Przejdź do treści
Chimera
ChimeraAgent

Agent terminalowy, który sam wykonuje prawdziwą pracę, i aplikacja desktopowa do pracy z nim. Otwarty kod, działa na twojej maszynie i publikuje także te testy, które przegrał.

Wiele umysłów, jedna odpowiedź

Lew, koza, smok i wąż byli w logo, zanim stali się argumentem. Panel modeli odpowiada, sędzia wskazuje, gdzie się zgadzają, a gdzie nie, a syntezator pisze wynik — ale tylko wtedy, gdy pytanie jest na tyle trudne, by było warto. Sama fuzja nie jest niczym wyjątkowym; wpięcie jej w pętlę agenta za routerem świadomym kosztu i zmierzenie jej — już tak.

Trzy zakłady i to, gdzie stoi każdy z nich

  • Ewolucja z sygnałem jakości

    Inne agenty uczą się, dopisując to, co się wydarzyło. Chimera zachowuje wyuczoną zmianę tylko wtedy, gdy zweryfikowany wynik dowiedzie, że pomogła — na podstawie rzeczywistego diffu drzewa roboczego i uczciwego A/B, nigdy na podstawie tego, co model mówi o sobie. To, czy takie nagromadzenie poprawia go w nowych zadaniach, jest mierzone, a dotychczasowa odpowiedź znajduje się na stronie dowodów.

  • Bezpieczeństwo jako architektura

    Prompt injection powszechnie uchodzi za niemożliwy do załatania, a większość agentów łagodzi go w warstwie aplikacji albo uznaje za poza zakresem. Tutaj istnieje prawdziwa warstwa obrony — śledzenie skażenia przez dosłowne odwołanie, a nie prawdziwy przepływ danych (model, który sparafrazuje skażony tekst, pierze go), usuwanie tokenów sterujących z niezaufanej treści, ograniczanie niebezpiecznych narzędzi na resztę skażonego przebiegu, ochrona ponowień z efektami ubocznymi. Jest opcjonalna: włącza się ją flagą --taint i domyślnie jest wyłączona. Strona o bezpieczeństwie w dokumentacji mówi, gdzie każda warstwa się kończy, i nazywa to, co wciąż przechodzi.

  • Opublikowane testy, łącznie z przegranymi

    Każda opublikowana liczba ma przedział ufności, przebiegi, które donikąd nie doprowadziły, są publikowane bez zmian, a twierdzenie, które przestaje wytrzymywać replikację, zostaje wycofane. Nic na tej stronie nie jest wpisywane ręcznie — wszystko czytane jest ze snapshotu, który produkt stempluje przy każdym wydaniu, a przedziały znajdują się na stronie dowodów.

Co jest naprawdę zmierzone

+23ppZmierzone na naszym własnym zestawie bez Dockera, ocenianym przez pytest — jeden model, małe samodzielne zadania w Pythonie. To nie jest SWE-bench i nie przenosi się na prawdziwe repozytoria.
+9.8ppCelowo łatwy wycinek SWE-bench Verified z jednego repozytorium. To nie jest wynik SWE-bench Verified — prawdziwy wymaga pełnych 500 instancji. Różnica sama w sobie nie jest istotna statystycznie.
-5ppRusztowanie tutaj nie pomogło, a przebieg publikujemy dokładnie tak, jak go zmierzono. Oba ramiona leżą blisko podłogi, a różnica nie jest istotna.

Zobacz każdą liczbę wraz z zastrzeżeniami

Dwa produkty

Biblioteka skills, z pochodzeniem

Krótkie karty, które mówią agentowi, jak podejść do powtarzalnego rodzaju zadania — dane, nigdy kod; nic tutaj nie jest wykonywane. Jest ich niewiele i za każdą stoi nazwisko: przejrzana przez opiekuna przed scaleniem, serwowana z haszem dokładnych bajtów strony i czytana w twoim języku — tłumaczenie, które odeszło od źródła, wraca do angielskiego, zamiast parafrazować zdanie, którego już nie ma.

Skills

To alpha i sam to mówi

Solidne i mocno przetestowane, ale bez doświadczenia produkcyjnego. Instalatory nie są podpisane przez urząd certyfikacji, więc Windows i macOS ostrzegają przy pierwszym uruchomieniu. To ostrzeżenie jest na stronie pobierania nad przyciskami; nota o alfie — na jej końcu.