chimera-when-two-results-contradict-suspect-the-apparatus
当你自己的两次测量相差到没有任何机制能产生的幅度时,缺陷在仪器上。在此之上建立理论之前,先审查那套框架(harness)。
由读过该卡片的评审者赋予,而不是文件自我声明的。智能体在处理不可信内容的运行中提炼出的卡片,生来即被标记为受污染,在被检索之前会一直等待评审。
何时会想到它
- 两次运行结果差得离谱
- 规模更小的那次反而分更高
- 指标朝着不可能的方向变了
- 解释一个反常的基准结果
价值通常在「避免」和「检查」里。「该做」是人人都会写的那一节。
上面的卡片正文是译文。英文原文才是 CLI 导入的内容、智能体运行时读取的内容,也是下方哈希所证明的内容。
触发
你自己产出的两次测量之间的差距,大到你解释不了:用了零头数据的那次运行,得分比大的那次还高;某个组件在一项相邻测量显示它做得很稳的任务上读数是 0%;一个改动把某个数字推向了它本该不可能推向的方向。
触发条件是差距的大小,不是它的存在。两次运行在各自的噪声带内有出入,那是个抽样问题,这张卡片对此无话可说。它也不适用于你的数字对上别人发表的数字——不同的数据、提示词、随机种子和版本,随时都能解释这类差异,把它当成仪器警报,只会让你去审计一套本来没问题的框架(harness)。这里说的情况是:矛盾的两边都是你自己的,而它们不可能都是真的。
该做
- 先把这个矛盾写下来,写成两行:那两个数字,以及产出它们的确切命令和提交。在这些落到纸上之前不要开始构建理论——一个没写下来的矛盾,大约一段话之内就会被软化成一个"谜题"。
- 在对它们做推理之前,先 diff 这两次运行:配置、提交、代码路径、输入文件的哈希、评分器的版本。优先要一份你能读的 diff,而不是一套你能构建出来的解释。
- 把已知答案推过这套测量本身。在信任任何模型分数之前,先把参考答案/标准答案跑过你的评分器。如果一个已知正确的答案被判为失败,那缺陷就在评分器上,而它产出过的每一个数字都是无效的,包括你喜欢的那一个。
- 只有在这套装置通过了第 3 步之后,你才去花力气解释这个现象。
- 如果问题出在装置上,就撤回这些数字,而不是重新解释它们。一个坏掉的评分器给出的分数,不是对真值的一个带噪声的估计;它和真值毫无关系。
避免
构建若干个仔细的假设去解释这两个数字,然后严谨地检验它们。那是这个错误的昂贵版本:严谨是真的,投入是真的,而这一切都是在一个人造产物上测量的。在一台坏掉的仪器下游做出来的方法学质量,只能让你带着更漂亮的误差棒走到错误的答案上。
避免用算术来调和——把两个平均一下,或者悄悄留下和你预期一致的那个。避免封闭世界的评分器,这是最常产生这种形状的那个具体 bug:
# 而这个分数读起来就成了"模型根本做不了这件事"
CITIES = {"lisbon", "porto"}
ok = answer.lower() in CITIES
# 要——用一条真实世界能够满足的规则来评分
ok = geocode(answer) == geocode(expected)
还要避免把"这肯定是个偶然"当成终点。那是一个关于装置的假设,所以它是可检验的——要么检验它,要么放弃它。
检查
把一句带有量级的话说出声:"X 之所以会产生这么大的差异,是因为……"。如果你说不完——"少了十倍的数据反而得分更高,是因为……"——那仪器就是嫌疑人,而第 3 步就是你接下来该去的地方。
然后是二元的那一问:标准答案通过评分器了吗?任何一条被评分器判错的标准答案,都是这次测量所能表达的含义的一个天花板,而它们当中失败的比例,是第一个该报出来的数字。
风险
有时候矛盾是真的,而那个出人意料的结果就是发现本身。一见矛盾就怪框架(harness)的反射会把这些丢掉,而且——更糟的是——这恰恰是任何一个想让不方便的测量消失的人可以使的那一招。所以要给它划界:装置检查是一份固定的短清单(diff 两次运行、标准答案过评分器、确认输入哈希)。如果这份清单查下来是干净的,就相信这个矛盾,去调查那个现象。这张卡片安排的是工作顺序;它不替你挑答案。
第二项代价是递归的。为了检查旧代码而新写的代码,又是一个可能出错的东西,而一个有 bug 的审计脚本现在又产出了第三个数字。相比在异常的压力下现写一套框架,优先选择那些使用你已有的产物、以及答案已知的输入的检查。
如何使用
卡片就是数据。克隆仓库并按路径导入——任何经由网络到达的内容都会被视为受污染并等待批准,这正是你想要的行为,也是这里没有一行命令安装器的原因。
git clone https://github.com/brcampidelli/chimera-agent.gitchimera skills-import chimera-agent/skills/chimera-when-two-results-contradict-suspect-the-apparatus/SKILL.md完整性
文件发布版本的 SHA-256。导入方可以据此核对收到的内容与本页展示的一致。
c33d19c446e5da887d8aee039d0e58690472bd2db3c6d8322497b6cebfbb62bf