多くの頭脳、ひとつの答え
ライオン、ヤギ、ドラゴン、ヘビは、主張になるより前からロゴにいました。複数のモデルが答え、審判が一致点と相違点を名指しし、統合器が最終的な答えを書く — ただし、それに見合うだけ難しい問いのときだけです。フュージョン自体は珍しくありません。コストを見るルーターの後ろでエージェントのループに組み込み、それを測ることが違いです。
三つの賭けと、その現在地
適応度シグナルを伴う進化
他のエージェントは起きたことを追記して「学習」します。Chimera は、検証済みの結果がその変更は役に立ったと示したときだけ、学んだ変更を保持します — 判断材料は作業ツリーの実際の差分と正直な A/B であり、モデルの自己申告ではありません。その蓄積が新しいタスクで実際に効くかどうかは測定されており、現時点の答えは証拠ページにあります。
アーキテクチャとしてのセキュリティ
プロンプトインジェクションは広く「パッチ不能」とみなされ、多くのエージェントはアプリ層で緩和するか、対象外と宣言します。ここには本物の防御層があります — 汚染追跡、信頼できない内容からの制御トークン除去、汚染された実行の残りにおける危険なツールの制限、副作用のある再試行の保護 — そしてそれは任意であり既定では無効です。セキュリティのページは、何よりも先にそのことを述べます。
負けた分も含めて公開するベンチマーク
すべての数値に信頼区間が付き、何も出なかった実行もそのまま公開され、再現に耐えなくなった主張は撤回されます。このサイトの数値は手打ちされていません。プロダクトがリリースごとに刻むスナップショットから読み出されます。
実際に測られていること
+23ppDocker 不要の自前スイートで測定し、pytest で採点しました — モデルは 1 つ、小さく自己完結した Python タスクです。これは SWE-bench ではなく、実在のリポジトリには一般化しません。
+9.8ppSWE-bench Verified のうち、意図的にやさしい単一リポジトリの切片です。これは SWE-bench Verified のスコアではありません — 本当のスコアには 500 インスタンス全体が必要です。この差は単体では有意ではありません。
二つのプロダクト
アルファ版であり、そう明言しています
堅実でよくテストされていますが、本番環境で鍛えられてはいません。インストーラーは認証局の署名を持たないため、Windows と macOS は初回起動時に警告します。どちらもダウンロードページの、ボタンより前に書いてあります。
