多个头脑,一个答案
狮子、山羊、龙和蛇早在成为论点之前就已经在标志里了。一组模型各自作答,一个裁判指出它们在哪里一致、在哪里分歧,再由一个综合器写出结果——但只在问题难到值得这么做的时候。融合本身并不稀奇;把它接进智能体循环、放在一个考虑成本的路由器后面,并且加以测量,才是。
三个赌注,以及各自的进展
带适应度信号的演化
别的智能体靠追加发生过的事来「学习」。Chimera 只在一次经过验证的结果证明某个学到的改动确实有用时才保留它——依据是工作区里真实的 diff 和一次诚实的 A/B,而不是模型对自己的评价。这种积累是否让它在新任务上更好,是被测量的,目前的答案就在证据页上。
把安全做进架构
提示注入被普遍认为无法彻底修补,多数智能体在应用层缓解,或者干脆声明不在范围内。这里有一层真实的防御——污点追踪、从不可信内容中剥离控制标记、在被污染的运行剩余部分收窄危险工具、保护有副作用的重试——而它是可选的、默认关闭的,安全页面在说别的之前就先说了这一点。
公开的基准,包括输掉的那些
每个数字都附带置信区间,没有得出结果的运行原样公开,一个经不起复现的结论会被撤回。本站没有任何数字是手写的:它们都读自产品在每次发布时打上版本戳的快照。
真正被测量的东西
+23pp测于我们自己的免 Docker 测试集,由 pytest 判分——单一模型、小型自包含的 Python 任务。这不是 SWE-bench,也不能推广到真实仓库。
+9.8ppSWE-bench Verified 中一个刻意挑选的、来自单一仓库的简单切片。这不是 SWE-bench Verified 的分数——真正的分数需要完整的 500 个实例。这个差值单独来看并不显著。
两个产品
它是 alpha,而且它自己这么说
扎实且经过大量测试,尚未在生产环境中久经考验。安装包没有证书颁发机构签名,因此 Windows 和 macOS 首次运行会告警。这两件事在下载页上也写在按钮前面。
