Ir para o conteúdo
Chimera
ChimeraAgent

Um agente de terminal que faz trabalho de verdade sozinho, e um aplicativo para trabalhar com ele. Código aberto, roda na sua máquina, e publica os benchmarks em que perdeu.

Muitas mentes, uma resposta

O leão, a cabra, o dragão e a serpente estavam no logo antes de virarem argumento. Um painel de modelos responde, um juiz aponta onde eles concordam e onde não, e um sintetizador escreve o resultado — mas só quando a pergunta é difícil o bastante para valer. Fusão em si não é novidade; ligá-la ao laço do agente atrás de um roteador que enxerga custo, e medi-la, é.

Três apostas, e onde cada uma está

  • Evolução com sinal de aptidão

    Outros agentes aprendem anexando o que aconteceu. O Chimera guarda uma mudança aprendida só quando um resultado verificado prova que ela ajudou — condicionado ao diff real da árvore de trabalho e a um A/B honesto, nunca ao que o modelo diz de si mesmo. Se esse acúmulo o torna melhor em tarefas novas é coisa medida, e a resposta até agora está na página de evidências.

  • Segurança como arquitetura

    Injeção de prompt é amplamente considerada impossível de corrigir, e a maioria dos agentes mitiga na camada de aplicação ou declara fora de escopo. Aqui existe uma camada de defesa real — rastreio de contaminação, tokens de controle removidos de conteúdo não confiável, ferramentas perigosas estreitadas pelo resto de uma execução contaminada, retentativas com efeito colateral protegidas — e ela é opcional e vem desligada, o que a página de segurança diz antes de dizer qualquer outra coisa.

  • Benchmarks publicados, inclusive as derrotas

    Todo número vem com intervalo de confiança, as execuções que não deram em nada são publicadas sem edição, e uma afirmação que deixa de sobreviver à réplica é retirada. Nada neste site é digitado à mão: tudo é lido do snapshot que o produto carimba a cada release.

O que está realmente medido

+23ppMedido na nossa própria suíte sem Docker, corrigida por pytest — um modelo, tarefas Python pequenas e autocontidas. Isto não é SWE-bench, e não generaliza para repositórios reais.
+9.8ppUma fatia deliberadamente fácil e de um único repositório do SWE-bench Verified. Isto não é uma pontuação do SWE-bench Verified — uma de verdade exige as 500 instâncias completas. A diferença não é significativa sozinha.

Ver cada número, com suas ressalvas

Dois produtos

É alpha, e ele diz isso

Sólido e muito testado, ainda não endurecido em produção. Os instaladores não são assinados por uma autoridade certificadora, então Windows e macOS avisam na primeira execução. As duas coisas também estão na página de download, antes do botão.