Zum Inhalt springen
Chimera
ChimeraAgent

Ein Terminal-Agent, der eigenständig echte Arbeit erledigt, und eine Desktop-App, um mit ihm zu arbeiten. Open Source, läuft auf Ihrem Rechner, und veröffentlicht auch die Benchmarks, die er verloren hat.

Viele Köpfe, eine Antwort

Löwe, Ziege, Drache und Schlange waren im Logo, bevor sie ein Argument wurden. Ein Panel aus Modellen antwortet, ein Richter benennt, wo sie übereinstimmen und wo nicht, und ein Synthesizer schreibt das Ergebnis — aber nur, wenn die Frage schwer genug ist, um es zu rechtfertigen. Fusion an sich ist nichts Besonderes; sie hinter einem kostenbewussten Router in die Agentenschleife zu verdrahten und sie zu messen, schon.

Drei Wetten, und wo jede steht

  • Evolution mit einem Fitness-Signal

    Andere Agenten lernen, indem sie anhängen, was passiert ist. Chimera behält eine gelernte Änderung nur dann, wenn ein verifiziertes Ergebnis beweist, dass sie geholfen hat — abhängig vom tatsächlichen Diff im Arbeitsverzeichnis und einem ehrlichen A/B, nie davon, was das Modell über sich selbst sagt. Ob diese Anhäufung ihn bei neuen Aufgaben besser macht, wird gemessen, und die bisherige Antwort steht auf der Evidenzseite.

  • Sicherheit als Architektur

    Prompt Injection gilt weithin als nicht patchbar, und die meisten Agenten mildern sie in der Anwendungsschicht ab oder erklären sie für außerhalb des Umfangs. Hier gibt es eine echte Verteidigungsschicht — Taint-Verfolgung über wörtliche Referenz, nicht über echten Datenfluss (ein Modell, das kontaminierten Text paraphrasiert, wäscht ihn), aus nicht vertrauenswürdigen Inhalten entfernte Steuertoken, für den Rest eines kontaminierten Laufs eingeschränkte gefährliche Werkzeuge, geschützte Wiederholungen mit Seiteneffekten. Sie ist optional: mit --taint eingeschaltet, standardmäßig aus. Die Sicherheitsseite in der Dokumentation sagt, wo jede Schicht aufhört, und benennt, was weiterhin durchkommt.

  • Veröffentlichte Benchmarks, auch die verlorenen

    Jede veröffentlichte Zahl kommt mit einem Konfidenzintervall, Läufe ohne Ergebnis werden unverändert veröffentlicht, und eine Behauptung, die eine Replikation nicht übersteht, wird zurückgezogen. Nichts auf dieser Website ist von Hand getippt; alles wird aus dem Snapshot gelesen, den das Produkt bei jeder Veröffentlichung stempelt, und die Intervalle stehen auf der Evidenzseite.

Was tatsächlich gemessen ist

+23ppGemessen an unserer eigenen Docker-freien Suite, bewertet von pytest — ein Modell, kleine in sich geschlossene Python-Aufgaben. Das ist nicht SWE-bench, und es lässt sich nicht auf echte Repositories übertragen.
+9.8ppEin bewusst leichter Ausschnitt von SWE-bench Verified aus einem einzigen Repository. Das ist kein SWE-bench-Verified-Wert — ein echter braucht alle 500 Instanzen. Die Differenz ist für sich genommen nicht signifikant.
-5ppDas Gerüst hat hier nicht geholfen, und der Lauf wird so veröffentlicht, wie er gemessen wurde. Beide Arme liegen nahe am Boden, und der Unterschied ist nicht signifikant.

Jede Zahl ansehen, mit ihren Einschränkungen

Zwei Produkte

Eine Skill-Bibliothek, mit Herkunft

Kurze Karten, die dem Agenten sagen, wie er eine wiederkehrende Art von Aufgabe angeht — Daten, niemals Code; nichts davon wird ausgeführt. Es sind wenige, und jede hat einen Namen hinter sich: vor dem Merge von einem Maintainer geprüft, mit einem Hash der exakten Bytes der Seite ausgeliefert und in Ihrer Sprache lesbar — eine Übersetzung, die sich von ihrer Quelle entfernt hat, fällt auf Englisch zurück, statt einen Satz zu umschreiben, den es nicht mehr gibt.

Skills

Es ist Alpha, und es sagt das auch

Solide und ausgiebig getestet, noch ohne Produktionserfahrung. Die Installer sind nicht von einer Zertifizierungsstelle signiert, deshalb warnen Windows und macOS beim ersten Start. Dieser Hinweis steht auf der Download-Seite über den Buttons; der Alpha-Hinweis am Ende der Seite.