Vai al contenuto
Chimera
ChimeraAgent

Un agente da terminale che fa lavoro vero da solo, e un'applicazione desktop per lavorarci insieme. Open source, gira sulla tua macchina, e pubblica i benchmark in cui ha perso.

Molte menti, una risposta

Il leone, la capra, il drago e il serpente erano nel logo prima di diventare un argomento. Un panel di modelli risponde, un giudice indica dove concordano e dove no, e un sintetizzatore scrive il risultato — ma solo quando la domanda è abbastanza difficile da meritarlo. La fusione in sé non è unica; cablarla nel ciclo dell'agente dietro un router attento al costo, e misurarla, lo è.

Tre scommesse, e a che punto è ciascuna

  • Evoluzione con un segnale di merito

    Altri agenti imparano accodando quello che è successo. Chimera conserva un cambiamento appreso solo quando un risultato verificato dimostra che ha aiutato — vincolato al diff reale dell'albero di lavoro e a un A/B onesto, mai a ciò che il modello dice di sé. Se quell'accumulo lo renda migliore su compiti nuovi è misurato, e la risposta finora è sulla pagina delle prove.

  • Sicurezza come architettura

    La prompt injection è largamente considerata non correggibile, e la maggior parte degli agenti la mitiga a livello applicativo o la dichiara fuori ambito. Qui c'è un vero strato di difesa — tracciamento della contaminazione, token di controllo rimossi dai contenuti non affidabili, strumenti pericolosi ristretti per il resto di un'esecuzione contaminata, ritentativi con effetti collaterali protetti — ed è opzionale e disattivato di default, cosa che la pagina sulla sicurezza dice prima di ogni altra.

  • Benchmark pubblicati, sconfitte comprese

    Ogni cifra arriva con un intervallo di confidenza, le esecuzioni che non hanno portato a nulla sono pubblicate senza modifiche, e un'affermazione che smette di reggere alla replica viene ritirata. Niente su questo sito è scritto a mano: tutto è letto dallo snapshot che il prodotto timbra a ogni versione.

Cosa è davvero misurato

+23ppMisurato sulla nostra suite senza Docker, valutata da pytest — un solo modello, piccoli compiti Python autonomi. Questo non è SWE-bench, e non si generalizza a repository reali.
+9.8ppUna fetta deliberatamente facile e su un solo repository di SWE-bench Verified. Questo non è un punteggio SWE-bench Verified — uno vero richiede tutte le 500 istanze. La differenza non è significativa da sola.

Vedi ogni cifra, con le sue riserve

Due prodotti

È alpha, e lo dice

Solido e testato a fondo, non ancora rodato in produzione. Gli installer non sono firmati da un'autorità di certificazione, quindi Windows e macOS avvisano al primo avvio. Entrambe le cose sono anche nella pagina di download, prima del pulsante.