本文へスキップ

Blog

Releasesv0.36.1

v0.36.1 — a citação apontava para o arquivo errado

This is the release note as published, not a rewrite of it. Release notes are published in the language they were written in.

Um patch de honestidade. A v0.36.0 exibia os números certos com a procedência errada — e num projeto cuja tese é medição rastreável, isso é a falha que menos podemos deixar passar.

O que estava errado

A citação apontava para o arquivo errado. A v0.36.0 mostrava o lift re-verificado (48% → 71%) citando bench/local_lift/results/paired.json — o arquivo da rodada superada, mantido intacto de propósito porque a errata aponta para ele. Quem fosse conferir a citação encontraria 9% → 15%, não os números na tela.

A explicação era a antiga. A nota que viajava junto contava a história da rodada velha — "6 tarefas recuperadas", "85 das 100 falham nos dois braços" — quando o re-teste mediu 28 recuperações contra 5 regressões, e 24, não 85.

O app mostrava só a metade que não nos favorece. O bloco de resultados externos era uma constante carregando apenas o Terminal-Bench (um nulo), então o resultado do SWE-bench nunca chegava à interface.

O que foi corrigido

  • A fonte agora é derivada do arquivo realmente lido, nunca fixada no código.
  • A nota descreve a rodada que produziu os números.
  • Os dois resultados externos viajam juntos — publicar só a metade lisonjeira é exatamente o viés de seleção que o trabalho de benchmark existe para evitar.
  • O teste foi endurecido, não só atualizado: exige que a fonte citada seja o arquivo lido e que exista, e confere os externos por nome, não por índice, para que uma reordenação não possa descartar um em silêncio.

Documentação alinhada ao que já foi medido

O README mencionava "SWE-bench" uma única vez, dentro de um disclaimer — então a porta de entrada ainda dava a entender que não havia número externo. Agora reporta as duas rodadas (o zero exato e o +15,8%), cada uma com seu intervalo de confiança e o aviso de que 57,9% não é um score de SWE-bench Verified.

O bullet do learning-lift estava desatualizado do mesmo jeito: descrevia só a primeira rodada quando a série fechou em sete rodadas, com o único positivo retratado.

Nada de novo em funcionalidade

Nenhuma mudança de comportamento no agente. Se você já está na v0.36.0, o que muda é que os números exibidos passam a citar a fonte correta e o app mostra os dois resultados externos.

pip install --upgrade chimera-agent

🤖 Generated with Claude Code

Read the release on GitHub