Aller au contenu
Chimera
ChimeraAgent

Un agent de terminal qui fait du vrai travail tout seul, et une application de bureau pour travailler avec lui. Open source, tourne sur votre machine, et publie les benchmarks qu'il a perdus.

Plusieurs esprits, une réponse

Le lion, la chèvre, le dragon et le serpent étaient sur le logo avant d'être un argument. Un panel de modèles répond, un juge indique où ils s'accordent et où ils divergent, et un synthétiseur écrit le résultat — mais seulement quand la question est assez difficile pour le mériter. La fusion en soi n'a rien d'unique ; la câbler dans la boucle de l'agent derrière un routeur attentif au coût, et la mesurer, si.

Trois paris, et où en est chacun

  • Une évolution avec un signal de qualité

    Les autres agents apprennent en ajoutant ce qui s'est passé. Chimera ne garde un changement appris que lorsqu'un résultat vérifié prouve qu'il a aidé — conditionné au diff réel de l'arbre de travail et à un A/B honnête, jamais à ce que le modèle dit de lui-même. Savoir si cette accumulation l'améliore sur de nouvelles tâches est mesuré, et la réponse à ce jour est sur la page des preuves.

  • La sécurité comme architecture

    L'injection de prompt est largement considérée comme impossible à corriger, et la plupart des agents l'atténuent au niveau applicatif ou la déclarent hors périmètre. Il y a ici une vraie couche de défense — suivi de contamination par référence littérale, et non un vrai flux de données (un modèle qui paraphrase le texte contaminé le blanchit), jetons de contrôle retirés du contenu non fiable, outils dangereux restreints pour le reste d'une exécution contaminée, réessais à effet de bord protégés. Elle est optionnelle : on l'active avec --taint, et elle est désactivée par défaut. La page de sécurité de la documentation indique où chaque couche s'arrête, et nomme ce qui passe encore.

  • Des benchmarks publiés, y compris les échecs

    Chaque chiffre publié est accompagné d'un intervalle de confiance, les exécutions qui n'ont rien donné sont publiées telles quelles, et une affirmation qui ne survit pas à la réplication est retirée. Rien sur ce site n'est saisi à la main : tout est lu dans l'instantané que le produit estampille à chaque version, et les intervalles sont sur la page des preuves.

Ce qui est réellement mesuré

+23ppMesuré sur notre propre suite sans Docker, notée par pytest — un seul modèle, de petites tâches Python autonomes. Ce n'est pas SWE-bench, et cela ne se généralise pas à de vrais dépôts.
+9.8ppUne tranche délibérément facile et mono-dépôt de SWE-bench Verified. Ce n'est pas un score SWE-bench Verified — un vrai score exige les 500 instances complètes. L'écart n'est pas significatif à lui seul.
-5ppL'échafaudage n'a pas aidé ici, et l'exécution est publiée telle que mesurée. Les deux bras sont proches du plancher et la différence n'est pas significative.

Voir chaque chiffre, avec ses réserves

Deux produits

Une bibliothèque de skills, avec provenance

De courtes fiches qui indiquent à l'agent comment aborder un type de tâche récurrent — des données, jamais du code ; rien ici n'est exécuté. Elles sont peu nombreuses, et chacune a un nom derrière elle : relue par un mainteneur avant d'être fusionnée, servie avec une empreinte des octets exacts de la page, et lue dans votre langue — une traduction qui s'est écartée de sa source revient à l'anglais plutôt que de paraphraser une phrase qui n'existe plus.

Skills

C'est de l'alpha, et il le dit

Solide et abondamment testé, pas encore éprouvé en production. Les installeurs ne sont pas signés par une autorité de certification, donc Windows et macOS avertissent au premier lancement. Cet avertissement figure au-dessus des boutons sur la page de téléchargement ; la note alpha est à la fin de celle-ci.