Ir al contenido
Chimera
ChimeraAgent

Un agente de terminal que hace trabajo real por su cuenta, y una aplicación de escritorio para trabajar con él. Código abierto, se ejecuta en tu máquina, y publica los benchmarks en los que perdió.

Muchas mentes, una respuesta

El león, la cabra, el dragón y la serpiente estaban en el logo antes de ser un argumento. Un panel de modelos responde, un juez señala dónde coinciden y dónde no, y un sintetizador escribe el resultado — pero solo cuando la pregunta es lo bastante difícil para merecerlo. La fusión en sí no es única; conectarla al bucle del agente detrás de un enrutador consciente del coste, y medirla, sí lo es.

Tres apuestas, y dónde está cada una

  • Evolución con una señal de aptitud

    Otros agentes aprenden anexando lo que pasó. Chimera conserva un cambio aprendido solo cuando un resultado verificado demuestra que ayudó — condicionado al diff real del árbol de trabajo y a un A/B honesto, nunca a lo que el modelo dice de sí mismo. Si esa acumulación lo mejora en tareas nuevas es algo medido, y la respuesta hasta ahora está en la página de evidencia.

  • Seguridad como arquitectura

    La inyección de prompts se considera ampliamente imparcheable, y la mayoría de los agentes la mitigan en la capa de aplicación o la declaran fuera de alcance. Aquí hay una capa de defensa real — rastreo de contaminación por referencia literal, y no flujo de datos de verdad (un modelo que parafrasea el texto contaminado lo lava), tokens de control eliminados del contenido no confiable, herramientas peligrosas restringidas durante el resto de una ejecución contaminada, reintentos con efectos secundarios protegidos. Es opcional: se activa con --taint y viene desactivada. La página de seguridad de la documentación dice dónde se detiene cada capa, y nombra lo que aún pasa.

  • Benchmarks publicados, incluidas las derrotas

    Cada cifra publicada viene con un intervalo de confianza, las ejecuciones que no llevaron a nada se publican sin cambios, y una afirmación que deja de sobrevivir a la réplica se retira. Nada en este sitio se escribe a mano; se lee del snapshot que el producto sella en cada versión, y los intervalos están en la página de evidencia.

Lo que realmente está medido

+23ppMedido en nuestra propia suite sin Docker, calificada por pytest — un modelo, tareas de Python pequeñas y autocontenidas. Esto no es SWE-bench, y no generaliza a repositorios reales.
+9.8ppUna porción deliberadamente fácil y de un solo repositorio de SWE-bench Verified. Esto no es una puntuación de SWE-bench Verified — una de verdad necesita las 500 instancias completas. La diferencia no es significativa por sí sola.
-5ppEl andamiaje no ayudó aquí, y la ejecución se publica tal como se midió. Ambos brazos están cerca del suelo y la diferencia no es significativa.

Ver cada cifra, con sus salvedades

Dos productos

Una biblioteca de skills, con procedencia

Tarjetas breves que indican al agente cómo abordar un tipo recurrente de tarea — datos, nunca código; aquí no se ejecuta nada. Son pocas, y cada una tiene un nombre detrás: revisada por un mantenedor antes de integrarse, servida con un hash de los bytes exactos de la página, y leída en tu idioma — una traducción que se ha alejado de su fuente vuelve al inglés en lugar de parafrasear una frase que ya no existe.

Skills

Es alpha, y lo dice

Sólido y muy probado, todavía sin rodaje en producción. Los instaladores no están firmados por una autoridad certificadora, así que Windows y macOS avisan al primer arranque. Ese aviso está en la página de descarga por encima de los botones; el aviso de alpha, al final de ella.