v0.36.1 — a citação apontava para o arquivo errado
This is the release note as published, not a rewrite of it. Release notes are published in the language they were written in.
Um patch de honestidade. A v0.36.0 exibia os números certos com a procedência errada — e num projeto cuja tese é medição rastreável, isso é a falha que menos podemos deixar passar.
O que estava errado
A citação apontava para o arquivo errado. A v0.36.0 mostrava o lift re-verificado (48% → 71%) citando bench/local_lift/results/paired.json — o arquivo da rodada superada, mantido intacto de propósito porque a errata aponta para ele. Quem fosse conferir a citação encontraria 9% → 15%, não os números na tela.
A explicação era a antiga. A nota que viajava junto contava a história da rodada velha — "6 tarefas recuperadas", "85 das 100 falham nos dois braços" — quando o re-teste mediu 28 recuperações contra 5 regressões, e 24, não 85.
O app mostrava só a metade que não nos favorece. O bloco de resultados externos era uma constante carregando apenas o Terminal-Bench (um nulo), então o resultado do SWE-bench nunca chegava à interface.
O que foi corrigido
- A fonte agora é derivada do arquivo realmente lido, nunca fixada no código.
- A nota descreve a rodada que produziu os números.
- Os dois resultados externos viajam juntos — publicar só a metade lisonjeira é exatamente o viés de seleção que o trabalho de benchmark existe para evitar.
- O teste foi endurecido, não só atualizado: exige que a fonte citada seja o arquivo lido e que exista, e confere os externos por nome, não por índice, para que uma reordenação não possa descartar um em silêncio.
Documentação alinhada ao que já foi medido
O README mencionava "SWE-bench" uma única vez, dentro de um disclaimer — então a porta de entrada ainda dava a entender que não havia número externo. Agora reporta as duas rodadas (o zero exato e o +15,8%), cada uma com seu intervalo de confiança e o aviso de que 57,9% não é um score de SWE-bench Verified.
O bullet do learning-lift estava desatualizado do mesmo jeito: descrevia só a primeira rodada quando a série fechou em sete rodadas, com o único positivo retratado.
Nada de novo em funcionalidade
Nenhuma mudança de comportamento no agente. Se você já está na v0.36.0, o que muda é que os números exibidos passam a citar a fonte correta e o app mostra os dois resultados externos.
pip install --upgrade chimera-agent
🤖 Generated with Claude Code