Ir al contenido
Chimera
ChimeraAgent

Un agente de terminal que hace trabajo real por su cuenta, y una aplicación de escritorio para trabajar con él. Código abierto, se ejecuta en tu máquina, y publica los benchmarks en los que perdió.

Muchas mentes, una respuesta

El león, la cabra, el dragón y la serpiente estaban en el logo antes de ser un argumento. Un panel de modelos responde, un juez señala dónde coinciden y dónde no, y un sintetizador escribe el resultado — pero solo cuando la pregunta es lo bastante difícil para merecerlo. La fusión en sí no es única; conectarla al bucle del agente detrás de un enrutador consciente del coste, y medirla, sí lo es.

Tres apuestas, y dónde está cada una

  • Evolución con una señal de aptitud

    Otros agentes aprenden anexando lo que pasó. Chimera conserva un cambio aprendido solo cuando un resultado verificado demuestra que ayudó — condicionado al diff real del árbol de trabajo y a un A/B honesto, nunca a lo que el modelo dice de sí mismo. Si esa acumulación lo mejora en tareas nuevas es algo medido, y la respuesta hasta ahora está en la página de evidencia.

  • Seguridad como arquitectura

    La inyección de prompts se considera ampliamente imparcheable, y la mayoría de los agentes la mitigan en la capa de aplicación o la declaran fuera de alcance. Aquí hay una capa de defensa real — rastreo de contaminación, tokens de control eliminados del contenido no confiable, herramientas peligrosas restringidas durante el resto de una ejecución contaminada, reintentos con efectos secundarios protegidos — y es opcional y está desactivada por defecto, algo que la página de seguridad dice antes que cualquier otra cosa.

  • Benchmarks publicados, incluidas las derrotas

    Cada cifra viene con un intervalo de confianza, las ejecuciones que no llevaron a nada se publican sin cambios, y una afirmación que deja de sobrevivir a la réplica se retira. Nada en este sitio se escribe a mano; se lee del snapshot que el producto sella en cada versión.

Lo que realmente está medido

+23ppMedido en nuestra propia suite sin Docker, calificada por pytest — un modelo, tareas de Python pequeñas y autocontenidas. Esto no es SWE-bench, y no generaliza a repositorios reales.
+9.8ppUna porción deliberadamente fácil y de un solo repositorio de SWE-bench Verified. Esto no es una puntuación de SWE-bench Verified — una de verdad necesita las 500 instancias completas. La diferencia no es significativa por sí sola.

Ver cada cifra, con sus salvedades

Dos productos

Es alpha, y lo dice

Sólido y muy probado, todavía sin rodaje en producción. Los instaladores no están firmados por una autoridad certificadora, así que Windows y macOS avisan al primer arranque. Ambas cosas también están en la página de descarga, antes del botón.