publish-the-run-that-did-not-work
Opublikuj eksperyment, który się nie powiódł, zachowaj niezmieniony ten zastąpiony i nigdy nie powtarzaj losowania dla istotności. Błąd tkwi w selekcji, nie w liczbie.
Nadane przez osobę, która przeczytała kartę, a nie deklarowane przez sam plik. Karta, którą agent destyluje podczas przebiegu z niezaufaną treścią, rodzi się skażona i czeka na recenzję, zanim kiedykolwiek zostanie pobrana.
Kiedy przychodzi na myśl
- test A/B wyszedł negatywnie
- powtarzanie benchmarku
- wynik przeczy temu, co twierdziliśmy
- opisywanie pomiaru
Wartość zwykle kryje się w Unikaj i Sprawdź. Rób to sekcja, którą pisze każdy.
Treść karty powyżej to tłumaczenie. Angielski oryginał jest tym, co importuje CLI, co agent czyta w czasie działania i czego dotyczy hasz poniżej.
Wyzwalacz
Uruchomiłeś porównanie, żeby zdecydować, czy zmiana pomaga, a wynik jest niewygodny: ujemny, nieistotny statystycznie albo sprzeczny z czymś, co już zostało ogłoszone.
Nie dotyczy to uruchomienia, które było po prostu zepsute — harness, który się wywalił, niczego nie zmierzył, a opublikowanie tego jako wyniku byłoby swoim własnym rodzajem szumu. Napraw, uruchom ponownie i powiedz, że to zrobiłeś.
Rób
- Zapisz, zanim uruchomisz, jaki wynik obaliłby twierdzenie. Jeśli nie potrafisz go nazwać, eksperyment nie może zawieść, a eksperyment, który nie może zawieść, nim nie jest.
- Raportuj efekt z przedziałem, nie punktowym oszacowaniem.
+9,8pp [−3,5, +16,7]mówi coś, czego+9,8ppnie mówi. - Gdy późniejsze uruchomienie zastępuje wcześniejsze, zostaw wcześniejsze opublikowane i niezmienione, a poprawkę połącz linkiem. Poprawianie go usuwa jedyny dowód na to, że poprawka miała miejsce.
- Jeśli twierdzenie nie przetrwa replikacji, wycofaj je w tym samym miejscu, w którym zostało wygłoszone, tą samą wielkością czcionki.
Unikaj
Ponawianie uruchomień, aż wynik będzie wyglądał lepiej, i raportowanie najlepszego z nich. To nie jest zły pomiar, to pomiar wyselekcjonowany, a selekcji nikt potem nie wykryje w samej liczbie — włącznie z tobą.
Unikaj cichego porzucania wyniku negatywnego przy zachowaniu pozytywnego z tej samej serii. Unikaj łączenia świeżej próbki ze starą po zobaczeniu, że łączenie pomaga; jeśli łączenie nie było wstępnie zarejestrowane jako podstawowe, jest drugorzędne i musi być tak oznaczone.
I unikaj opisywania nieistotnej różnicy słowami sugerującymi istotność: "poprawiło się", "wzrosło", "więcej niż". "Nieistotne samo w sobie" to jest to zdanie.
Sprawdź
Zapytaj, co sceptyczny czytelnik mógłby wywnioskować z opublikowanych artefaktów. Jeśli odpowiedź wymaga zaufania, że niczego nie odrzuciłeś, artefakty są niekompletne — opublikuj dziennik, wyniki per element albo surowe pary.
Potem porównaj twierdzenie we własnym README z sekcją wyników. Jeśli jedno mówi coś, co drugie wycofuje, wycofanie jest tym prawdziwym, a twierdzenie musi się przesunąć.
Ryzyko
To wolniejsze i publikuje pracę, która wygląda jak porażka dla każdego, kto czyta pojedynczą stronę bez kontekstu. Część tych czytelników będzie oceniać, czy tego użyć.
Subtelniejszy koszt: projekt, który publikuje negatywne wyniki, może być cytowany przeciwko sobie. To prawdziwa cena i jest mniejsza niż alternatywa — jedno odkryte podkoloryzowanie sprawia, że każda inna opublikowana liczba jest bezwartościowa.
Jak użyć
Karta to dane. Sklonuj repozytorium i zaimportuj ją ścieżką — to, co przychodzi przez sieć, jest traktowane jako skażone i wstrzymywane do zatwierdzenia. Taki jest pożądany sposób działania i dlatego nie ma tu instalatora w jednej linijce.
git clone https://github.com/brcampidelli/chimera-agent.gitchimera skills-import chimera-agent/skills/publish-the-run-that-did-not-work/SKILL.mdIntegralność
SHA-256 pliku w postaci opublikowanej. Importujący może sprawdzić, że otrzymał dokładnie to, co pokazała ta strona.
1b443d67d0a4e7631a57f1d67c8dc737b561c3ee5f67bb731b55a25f222b1a23