Ir para o conteúdo
Chimera
ChimeraAgent

Um agente de terminal que faz trabalho de verdade sozinho, e um aplicativo para trabalhar com ele. Código aberto, roda na sua máquina, e publica os benchmarks em que perdeu.

Muitas mentes, uma resposta

O leão, a cabra, o dragão e a serpente estavam no logo antes de virarem argumento. Um painel de modelos responde, um juiz aponta onde eles concordam e onde não, e um sintetizador escreve o resultado — mas só quando a pergunta é difícil o bastante para valer. Fusão em si não é novidade; ligá-la ao laço do agente atrás de um roteador que enxerga custo, e medi-la, é.

Três apostas, e onde cada uma está

  • Evolução com sinal de aptidão

    Outros agentes aprendem anexando o que aconteceu. O Chimera guarda uma mudança aprendida só quando um resultado verificado prova que ela ajudou — condicionado ao diff real da árvore de trabalho e a um A/B honesto, nunca ao que o modelo diz de si mesmo. Se esse acúmulo o torna melhor em tarefas novas é coisa medida, e a resposta até agora está na página de evidências.

  • Segurança como arquitetura

    Injeção de prompt é amplamente considerada impossível de corrigir, e a maioria dos agentes mitiga na camada de aplicação ou declara fora de escopo. Aqui existe uma camada de defesa real — rastreio de contaminação por referência literal, e não fluxo de dados de verdade (um modelo que parafraseia o texto contaminado o lava), tokens de controle removidos de conteúdo não confiável, ferramentas perigosas estreitadas pelo resto de uma execução contaminada, retentativas com efeito colateral protegidas. Ela é opcional: liga-se com --taint e vem desligada. A página de segurança na documentação diz onde cada camada para, e nomeia o que ainda passa.

  • Benchmarks publicados, inclusive as derrotas

    Todo número publicado vem com intervalo de confiança, as execuções que não deram em nada são publicadas sem edição, e uma afirmação que deixa de sobreviver à réplica é retirada. Nada neste site é digitado à mão: tudo é lido do snapshot que o produto carimba a cada release, e os intervalos estão na página de evidências.

O que está realmente medido

+23ppMedido na nossa própria suíte sem Docker, corrigida por pytest — um modelo, tarefas Python pequenas e autocontidas. Isto não é SWE-bench, e não generaliza para repositórios reais.
+9.8ppUma fatia deliberadamente fácil e de um único repositório do SWE-bench Verified. Isto não é uma pontuação do SWE-bench Verified — uma de verdade exige as 500 instâncias completas. A diferença não é significativa sozinha.
-5ppO scaffold não ajudou aqui, e a execução é publicada como foi medida. Os dois braços ficam perto do piso e a diferença não é significativa.

Ver cada número, com suas ressalvas

Dois produtos

Uma biblioteca de skills, com procedência

Cartões curtos que dizem ao agente como abordar um tipo recorrente de tarefa — dados, nunca código; nada ali é executado. São poucos, e cada um tem um nome por trás: revisado por um mantenedor antes de entrar, servido com o hash dos bytes exatos da página, e lido no seu idioma — uma tradução que se afastou da fonte cai de volta para o inglês em vez de parafrasear uma frase que não existe mais.

Skills

É alpha, e ele diz isso

Sólido e muito testado, ainda não endurecido em produção. Os instaladores não são assinados por uma autoridade certificadora, então Windows e macOS avisam na primeira execução. Esse aviso está na página de download acima dos botões; o aviso de alpha fica no fim dela.