publish-the-run-that-did-not-work
Publique o experimento que falhou, preserve o que foi superado sem alterá-lo, e nunca repita a rodada atrás de significância. O viés está na seleção, não no número.
Conferida por quem revisou e leu o cartão, não reivindicada pelo próprio arquivo. Um cartão que o agente destila durante uma execução que consumiu conteúdo não confiável nasce contaminado e fica retido para revisão antes de alguma vez ser recuperado.
Quando ele vem à mente
- o A/B deu negativo
- rodando o benchmark de novo
- o resultado contradiz o que afirmamos
- documentando uma medição
Evite e Verifique são onde costuma estar o valor. Faça é a seção que todo mundo escreve.
O corpo do cartão acima é uma tradução. O original em inglês é o que a CLI importa, o que o agente lê em execução e o que o hash abaixo atesta.
Gatilho
Você rodou uma comparação para decidir se uma mudança ajuda, e o resultado é inconveniente: negativo, não significativo, ou contradiz algo já anunciado.
Não se aplica a uma execução que simplesmente quebrou — um harness que travou não mediu nada, e publicá-lo como resultado seria seu próprio tipo de ruído. Conserte e rode de novo, e diga que foi isso que você fez.
Faça
- Escreva, antes de rodar, qual resultado mataria a afirmação. Se você não conseguir nomeá-lo, o experimento não pode falhar, e um experimento que não pode falhar não é um experimento.
- Reporte o efeito com um intervalo, não uma estimativa pontual.
+9.8pp [−3.5, +16.7]diz algo que+9.8ppsozinho não diz. - Quando uma execução posterior substitui uma anterior, mantenha a anterior publicada e sem edição, e ligue a correção a ela. Emendá-la remove a única evidência de que a correção aconteceu.
- Se uma afirmação não sobrevive à replicação, retrate-a no mesmo lugar em que foi feita, no mesmo tamanho de tipo.
Evite
Rodar de novo até parecer melhor e reportar a melhor execução. Isso não é uma medição ruim, é uma medição selecionada, e a seleção não pode ser detectada no número depois, por ninguém — inclusive você.
Evite descartar silenciosamente o resultado negativo enquanto mantém o positivo da mesma série. Evite juntar (pooling) uma amostra nova com uma antiga depois de ver que juntar ajuda; se o pooling não foi pré-registrado como primário, ele é secundário e precisa ser rotulado assim.
E evite descrever uma diferença não significativa com palavras que sugerem significância: "melhorou", "elevou", "subiu de". A frase certa é "não significativo por si só".
Verifique
Pergunte o que um leitor cético conseguiria concluir a partir dos artefatos que você publicou. Se a resposta exige confiar que você não descartou nada, os artefatos estão incompletos — publique o journal, os resultados por item, ou os pares brutos.
Depois confira a afirmação no seu próprio README contra a seção de resultados. Se uma diz uma coisa e a outra retrata, a retratação é a verdadeira e a afirmação precisa se mover.
Risco
Isso é mais lento, e publica trabalho que parece um fracasso para quem lê uma única página fora de contexto. Alguns desses leitores estarão avaliando se vão usar a coisa.
O custo mais sutil: um projeto que publica negativos pode ser citado contra si mesmo. Esse é um preço real, e é menor que a alternativa — um único exagero descoberto torna inútil todo outro número que você já publicou.
Como usar
O cartão é dado. Clone o repositório e importe pelo caminho — o que chega pela rede é tratado como contaminado e fica retido para aprovação, que é o comportamento desejável e a razão de não haver um instalador de uma linha aqui.
git clone https://github.com/brcampidelli/chimera-agent.gitchimera skills-import chimera-agent/skills/publish-the-run-that-did-not-work/SKILL.mdIntegridade
SHA-256 do arquivo como publicado. Quem importa pode conferir que o que recebeu é o que esta página mostrou.
1b443d67d0a4e7631a57f1d67c8dc737b561c3ee5f67bb731b55a25f222b1a23