多个头脑,一个答案
狮子、山羊、龙和蛇早在成为论点之前就已经在标志里了。一组模型各自作答,一个裁判指出它们在哪里一致、在哪里分歧,再由一个综合器写出结果——但只在问题难到值得这么做的时候。融合本身并不稀奇;把它接进智能体循环、放在一个考虑成本的路由器后面,并且加以测量,才是。
三个赌注,以及各自的进展
带适应度信号的演化
别的智能体靠追加发生过的事来「学习」。Chimera 只在一次经过验证的结果证明某个学到的改动确实有用时才保留它——依据是工作区里真实的 diff 和一次诚实的 A/B,而不是模型对自己的评价。这种积累是否让它在新任务上更好,是被测量的,目前的答案就在证据页上。
把安全做进架构
提示注入被普遍认为无法彻底修补,多数智能体在应用层缓解,或者干脆声明不在范围内。这里有一层真实的防御——按字面引用做的污点追踪,而不是真正的数据流(模型把被污染的文本改写一遍就能把它洗白)、从不可信内容中剥离控制标记、在被污染的运行剩余部分收窄危险工具、保护有副作用的重试。它是可选的:用 --taint 开启,默认关闭。文档里的安全页面写明每一层在哪里停下,并点名还有什么会漏过去。
公开的基准,包括输掉的那些
每个公开的数字都附带置信区间,没有得出结果的运行原样公开,一个经不起复现的结论会被撤回。本站没有任何数字是手写的:它们都读自产品在每次发布时打上版本戳的快照,而区间就在证据页上。
真正被测量的东西
两个产品
一个来源可查的技能卡库
简短的卡片,告诉智能体如何处理某一类反复出现的任务——是数据,绝不是代码;这里的内容不会被执行。数量不多,但每一张背后都有署名:合并前经过维护者评审,连同本页确切字节的哈希一起提供,并以你的语言呈现——一旦译文与原文脱节,就退回英文,而不是去改写一句已经不存在的话。
它是 alpha,而且它自己这么说
扎实且经过大量测试,尚未在生产环境中久经考验。安装包没有证书颁发机构签名,因此 Windows 和 macOS 首次运行会告警。这条告警在下载页写在按钮上方;alpha 提示在页面末尾。
