Aller au contenu
Chimera
ChimeraAgent

Un agent de terminal qui fait du vrai travail tout seul, et une application de bureau pour travailler avec lui. Open source, tourne sur votre machine, et publie les benchmarks qu'il a perdus.

Plusieurs esprits, une réponse

Le lion, la chèvre, le dragon et le serpent étaient sur le logo avant d'être un argument. Un panel de modèles répond, un juge indique où ils s'accordent et où ils divergent, et un synthétiseur écrit le résultat — mais seulement quand la question est assez difficile pour le mériter. La fusion en soi n'a rien d'unique ; la câbler dans la boucle de l'agent derrière un routeur attentif au coût, et la mesurer, si.

Trois paris, et où en est chacun

  • Une évolution avec un signal de qualité

    Les autres agents apprennent en ajoutant ce qui s'est passé. Chimera ne garde un changement appris que lorsqu'un résultat vérifié prouve qu'il a aidé — conditionné au diff réel de l'arbre de travail et à un A/B honnête, jamais à ce que le modèle dit de lui-même. Savoir si cette accumulation l'améliore sur de nouvelles tâches est mesuré, et la réponse à ce jour est sur la page des preuves.

  • La sécurité comme architecture

    L'injection de prompt est largement considérée comme impossible à corriger, et la plupart des agents l'atténuent au niveau applicatif ou la déclarent hors périmètre. Il y a ici une vraie couche de défense — suivi de contamination, jetons de contrôle retirés du contenu non fiable, outils dangereux restreints pour le reste d'une exécution contaminée, réessais à effet de bord protégés — et elle est optionnelle et désactivée par défaut, ce que la page de sécurité dit avant tout le reste.

  • Des benchmarks publiés, y compris les échecs

    Chaque chiffre est accompagné d'un intervalle de confiance, les exécutions qui n'ont rien donné sont publiées telles quelles, et une affirmation qui ne survit pas à la réplication est retirée. Rien sur ce site n'est saisi à la main : tout est lu dans l'instantané que le produit estampille à chaque version.

Ce qui est réellement mesuré

+23ppMesuré sur notre propre suite sans Docker, notée par pytest — un seul modèle, de petites tâches Python autonomes. Ce n'est pas SWE-bench, et cela ne se généralise pas à de vrais dépôts.
+9.8ppUne tranche délibérément facile et mono-dépôt de SWE-bench Verified. Ce n'est pas un score SWE-bench Verified — un vrai score exige les 500 instances complètes. L'écart n'est pas significatif à lui seul.

Voir chaque chiffre, avec ses réserves

Deux produits

C'est de l'alpha, et il le dit

Solide et abondamment testé, pas encore éprouvé en production. Les installeurs ne sont pas signés par une autorité de certification, donc Windows et macOS avertissent au premier lancement. Ces deux points figurent aussi sur la page de téléchargement, avant le bouton.