
Un agente de terminal que hace trabajo real por su cuenta, y una aplicación de escritorio para trabajar con él. Código abierto, se ejecuta en tu máquina, y publica los benchmarks en los que perdió.
Muchas mentes, una respuesta
El león, la cabra, el dragón y la serpiente estaban en el logo antes de ser un argumento. Un panel de modelos responde, un juez señala dónde coinciden y dónde no, y un sintetizador escribe el resultado — pero solo cuando la pregunta es lo bastante difícil para merecerlo. La fusión en sí no es única; conectarla al bucle del agente detrás de un enrutador consciente del coste, y medirla, sí lo es.
Tres apuestas, y dónde está cada una
Evolución con una señal de aptitud
Otros agentes aprenden anexando lo que pasó. Chimera conserva un cambio aprendido solo cuando un resultado verificado demuestra que ayudó — condicionado al diff real del árbol de trabajo y a un A/B honesto, nunca a lo que el modelo dice de sí mismo. Si esa acumulación lo mejora en tareas nuevas es algo medido, y la respuesta hasta ahora está en la página de evidencia.
Seguridad como arquitectura
La inyección de prompts se considera ampliamente imparcheable, y la mayoría de los agentes la mitigan en la capa de aplicación o la declaran fuera de alcance. Aquí hay una capa de defensa real — rastreo de contaminación por referencia literal, y no flujo de datos de verdad (un modelo que parafrasea el texto contaminado lo lava), tokens de control eliminados del contenido no confiable, herramientas peligrosas restringidas durante el resto de una ejecución contaminada, reintentos con efectos secundarios protegidos. Es opcional: se activa con --taint y viene desactivada. La página de seguridad de la documentación dice dónde se detiene cada capa, y nombra lo que aún pasa.
Benchmarks publicados, incluidas las derrotas
Cada cifra publicada viene con un intervalo de confianza, las ejecuciones que no llevaron a nada se publican sin cambios, y una afirmación que deja de sobrevivir a la réplica se retira. Nada en este sitio se escribe a mano; se lee del snapshot que el producto sella en cada versión, y los intervalos están en la página de evidencia.
Lo que realmente está medido
Dos productos
Agente de terminal
El harness: una mano derecha en tu terminal. Planifica, edita, ejecuta la comprobación y revierte cuando la comprobación falla.
Leer más →Aplicación
La aplicación: conversación que edita código, un tablero que despacha a tus agentes, y todos los ajustes del agente — en Windows, macOS y Linux.
Leer más →
Una biblioteca de skills, con procedencia
Tarjetas breves que indican al agente cómo abordar un tipo recurrente de tarea — datos, nunca código; aquí no se ejecuta nada. Son pocas, y cada una tiene un nombre detrás: revisada por un mantenedor antes de integrarse, servida con un hash de los bytes exactos de la página, y leída en tu idioma — una traducción que se ha alejado de su fuente vuelve al inglés en lugar de parafrasear una frase que ya no existe.
Es alpha, y lo dice
Sólido y muy probado, todavía sin rodaje en producción. Los instaladores no están firmados por una autoridad certificadora, así que Windows y macOS avisan al primer arranque. Ese aviso está en la página de descarga por encima de los botones; el aviso de alpha, al final de ella.