Vai al contenuto
Chimera
ChimeraAgent

Un agente da terminale che fa lavoro vero da solo, e un'applicazione desktop per lavorarci insieme. Open source, gira sulla tua macchina, e pubblica i benchmark in cui ha perso.

Molte menti, una risposta

Il leone, la capra, il drago e il serpente erano nel logo prima di diventare un argomento. Un panel di modelli risponde, un giudice indica dove concordano e dove no, e un sintetizzatore scrive il risultato — ma solo quando la domanda è abbastanza difficile da meritarlo. La fusione in sé non è unica; cablarla nel ciclo dell'agente dietro un router attento al costo, e misurarla, lo è.

Tre scommesse, e a che punto è ciascuna

  • Evoluzione con un segnale di merito

    Altri agenti imparano accodando quello che è successo. Chimera conserva un cambiamento appreso solo quando un risultato verificato dimostra che ha aiutato — vincolato al diff reale dell'albero di lavoro e a un A/B onesto, mai a ciò che il modello dice di sé. Se quell'accumulo lo renda migliore su compiti nuovi è misurato, e la risposta finora è sulla pagina delle prove.

  • Sicurezza come architettura

    La prompt injection è largamente considerata non correggibile, e la maggior parte degli agenti la mitiga a livello applicativo o la dichiara fuori ambito. Qui c'è un vero strato di difesa — tracciamento della contaminazione per riferimento letterale, e non un vero flusso di dati (un modello che parafrasa il testo contaminato lo ripulisce), token di controllo rimossi dai contenuti non affidabili, strumenti pericolosi ristretti per il resto di un'esecuzione contaminata, ritentativi con effetti collaterali protetti. È opzionale: si attiva con --taint ed è disattivato di default. La pagina sulla sicurezza nella documentazione dice dove si ferma ogni strato, e nomina ciò che ancora passa.

  • Benchmark pubblicati, sconfitte comprese

    Ogni cifra pubblicata arriva con un intervallo di confidenza, le esecuzioni che non hanno portato a nulla sono pubblicate senza modifiche, e un'affermazione che smette di reggere alla replica viene ritirata. Niente su questo sito è scritto a mano: tutto è letto dallo snapshot che il prodotto timbra a ogni versione, e gli intervalli sono sulla pagina delle prove.

Cosa è davvero misurato

+23ppMisurato sulla nostra suite senza Docker, valutata da pytest — un solo modello, piccoli compiti Python autonomi. Questo non è SWE-bench, e non si generalizza a repository reali.
+9.8ppUna fetta deliberatamente facile e su un solo repository di SWE-bench Verified. Questo non è un punteggio SWE-bench Verified — uno vero richiede tutte le 500 istanze. La differenza non è significativa da sola.
-5ppL'impalcatura qui non ha aiutato, e l'esecuzione è pubblicata così come è stata misurata. Entrambi i bracci sono vicini al pavimento e la differenza non è significativa.

Vedi ogni cifra, con le sue riserve

Due prodotti

Una libreria di skills, con provenienza

Schede brevi che dicono all'agente come affrontare un tipo ricorrente di attività — dati, mai codice; qui non viene eseguito nulla. Sono poche, e ognuna ha un nome dietro: revisionata da un manutentore prima di essere unita, servita con un hash dei byte esatti della pagina, e letta nella tua lingua — una traduzione che si è allontanata dalla sorgente torna all'inglese invece di parafrasare una frase che non esiste più.

Skills

È alpha, e lo dice

Solido e testato a fondo, non ancora rodato in produzione. Gli installer non sono firmati da un'autorità di certificazione, quindi Windows e macOS avvisano al primo avvio. Quell'avviso sta sopra i pulsanti nella pagina di download; la nota sull'alpha è in fondo alla pagina.