chimera-when-two-results-contradict-suspect-the-apparatus
Wenn zwei deiner eigenen Messungen um einen Abstand auseinandergehen, den kein Mechanismus erzeugen könnte, liegt der Defekt im Instrument. Prüfe das Harness, bevor du Theorie darauf aufbaust.
Verliehen von der Person, die die Karte gelesen hat — nicht von der Datei über sich selbst behauptet. Eine Karte, die der Agent während eines Laufs mit nicht vertrauenswürdigen Inhalten destilliert, kommt kontaminiert zur Welt und wird bis zur Prüfung zurückgehalten, bevor sie jemals abgerufen wird.
Wann sie in den Sinn kommt
- zwei Läufe widersprechen sich massiv
- der kleinere Lauf schnitt besser ab
- eine Metrik lief in die unmögliche Richtung
- ein überraschendes Benchmark-Ergebnis erklären
In Vermeiden und Prüfen steckt meist der Wert. Tun ist der Abschnitt, den alle schreiben.
Der Kartentext oben ist eine Übersetzung. Das englische Original ist das, was die CLI importiert, was der Agent zur Laufzeit liest und was der Hash unten bezeugt.
Auslöser
Zwei Messungen, die Sie selbst erzeugt haben, widersprechen sich um einen Betrag, den Sie nicht erklären können: Der Lauf mit einem Bruchteil der Daten schneidet besser ab als der große; eine Komponente liest 0 % auf einer Aufgabe, die eine benachbarte Messung sie routinemäßig erledigen sieht; eine Änderung bewegt eine Zahl in die Richtung, die sie unmöglich macht.
Der Auslöser ist die Größe der Lücke, nicht ihre Existenz. Zwei Läufe, die sich innerhalb ihres Rauschbands unterscheiden, sind eine Stichprobenfrage, und dazu hat diese Karte nichts zu sagen. Sie gilt auch nicht für Ihre Zahl gegen die veröffentlichte Zahl von jemand anderem — unterschiedliche Daten, Prompts, Seeds und Versionen erklären das den ganzen Tag, und das als Apparatur-Alarm zu behandeln bringt Sie dazu, ein Harness zu auditieren, das in Ordnung ist. Der Fall hier ist: Beide Seiten des Widerspruchs sind Ihre, und beide können nicht wahr sein.
Tun
- Schreiben Sie den Widerspruch zuerst auf, als zwei Zeilen: die zwei Zahlen und die genauen Befehle und Commits, die sie erzeugt haben. Hören Sie mit dem Theoretisieren auf, bis das auf dem Papier steht — ein unaufgeschriebener Widerspruch wird innerhalb eines Absatzes zu einem Rätsel weichgespült.
- Diffen Sie die beiden Läufe, bevor Sie über sie nachdenken: Konfiguration, Commit, Codepfad, Hash der Eingabedatei, Version des Scorers. Bevorzugen Sie einen Diff, den Sie lesen können, gegenüber einer Erklärung, die Sie konstruieren können.
- Schieben Sie bekannte Antworten durch die Messung selbst. Lassen Sie die Referenz-/Gold-Lösungen durch Ihren Grader laufen, bevor Sie irgendeinem Modell-Score trauen. Wenn eine als korrekt bekannte Antwort als Fehlschlag bewertet wird, liegt der Defekt im Grader, und jede Zahl, die er produziert hat, ist nichtig, einschließlich der, die Ihnen gefiel.
- Erst wenn die Apparatur Schritt 3 übersteht, wenden Sie Mühe darauf auf, das Phänomen zu erklären.
- Wenn die Apparatur schuld war, widerrufen Sie die Zahlen, statt sie neu zu interpretieren. Ein Score aus einem kaputten Scorer ist keine verrauschte Schätzung der Wahrheit; er hat nichts mit ihr zu tun.
Vermeiden
Mehrere sorgfältige Hypothesen zu bauen, die beide Zahlen erklären, und sie dann rigoros zu testen. Das ist die teure Variante dieses Fehlers: Die Strenge ist echt, der Aufwand ist echt, und alles davon wird an einem Artefakt gemessen. Methodenqualität hinter einem kaputten Instrument bringt Sie nur mit besseren Fehlerbalken zur falschen Antwort.
Vermeiden Sie es, arithmetisch zu versöhnen — die beiden zu mitteln oder still die zu behalten, die zu Ihrer Erwartung passt. Vermeiden Sie einen Grader mit geschlossener Welt, der genau der Bug ist, der diese Form am häufigsten erzeugt:
# and the score then reads as "the model cannot do this at all"
CITIES = {"lisbon", "porto"}
ok = answer.lower() in CITIES
# yes — grade against a rule that the real world can satisfy
ok = geocode(answer) == geocode(expected)
Und vermeiden Sie den Satz „das muss ein Zufall sein" als Endpunkt. Er ist eine Hypothese über die Apparatur, also ist er prüfbar — prüfen Sie ihn oder lassen Sie ihn fallen.
Prüfen
Ein Satz, laut ausgesprochen, mit einer Größenordnung darin: „X erzeugt einen so großen Unterschied, weil …". Wenn Sie ihn nicht zu Ende bringen können — „zehnmal weniger Daten erzeugen einen besseren Score, weil …" —, ist das Instrument der Verdächtige, und Schritt 3 ist, wo Sie als Nächstes hingehen.
Dann die binäre: Haben die Gold-Antworten den Grader bestanden? Jeder Gold-Eintrag, den der Grader als falsch markiert, ist eine Obergrenze dafür, was die Messung je bedeutet haben kann, und ihr Anteil ist die erste Zahl, die zu berichten ist.
Risiko
Manchmal ist der Widerspruch echt und das überraschende Ergebnis ist der Befund. Ein Reflex, das Harness zu beschuldigen, verwirft diese — und, schlimmer, es ist genau der Zug, der jedem zur Verfügung steht, der eine unbequeme Messung loswerden will. Also grenzen Sie ihn ein: Die Apparatur-Prüfung ist eine feste, kurze Liste (die Läufe diffen, Gold durch den Grader, die Eingabe-Hashes bestätigen). Kommt diese Liste sauber zurück, glauben Sie dem Widerspruch und untersuchen Sie das Phänomen. Diese Karte ordnet die Arbeit; sie wählt nicht die Antwort.
Der zweite Kostenpunkt ist rekursiv. Neuer Code, geschrieben, um den alten Code zu prüfen, ist ein weiteres Ding, das falsch sein kann, und ein fehlerhaftes Audit-Skript hat jetzt eine dritte Zahl produziert. Bevorzugen Sie Prüfungen, die Artefakte nutzen, die Sie bereits haben, und Eingaben, deren Antworten bekannt sind, gegenüber einem frischen Harness, das unter dem Druck einer Anomalie geschrieben wurde.
Verwenden
Die Karte ist Daten. Klonen Sie das Repository und importieren Sie sie über den Pfad — was über das Netz kommt, gilt als kontaminiert und wird bis zur Freigabe zurückgehalten. Das ist das gewünschte Verhalten und der Grund, warum es hier keinen Einzeiler-Installer gibt.
git clone https://github.com/brcampidelli/chimera-agent.gitchimera skills-import chimera-agent/skills/chimera-when-two-results-contradict-suspect-the-apparatus/SKILL.mdIntegrität
SHA-256 der Datei in der veröffentlichten Fassung. Wer sie importiert, kann prüfen, dass das Empfangene dem entspricht, was diese Seite gezeigt hat.
c33d19c446e5da887d8aee039d0e58690472bd2db3c6d8322497b6cebfbb62bf