Перейти к содержимому
Chimera
ChimeraAgent

Агент в терминале, который сам делает настоящую работу, и приложение, чтобы работать с ним. Открытый исходный код, работает на вашей машине и публикует замеры, в которых проиграл.

Много умов, один ответ

Лев, коза, дракон и змея были на логотипе раньше, чем стали доводом. Панель моделей отвечает, судья называет, где они согласны, а где нет, и синтезатор пишет результат — но только когда вопрос достаточно труден, чтобы это окупилось. Само по себе слияние не уникально; уникально то, что оно вшито в цикл агента за маршрутизатором, знающим цену, и что оно измерено.

Три ставки и положение каждой из них

  • Эволюция с сигналом пригодности

    Другие агенты учатся, дописывая то, что произошло. Chimera сохраняет усвоенное изменение, только когда подтверждённый результат доказывает, что оно помогло, — по настоящей разнице в рабочем дереве и честному A/B, а не по тому, что модель говорит о себе. Делает ли это накопление её лучше на новых задачах — измеряется, и ответ на сегодня лежит на странице доказательств.

  • Безопасность как архитектура

    Внедрение в промпт широко считается непатчабельным, и большинство агентов смягчает его на уровне приложения или объявляет вне области. Здесь есть настоящий слой защиты — отслеживание заражения по дословной ссылке, а не по настоящему потоку данных (модель, пересказавшая заражённый текст, тем самым его отмывает), удаление управляющих токенов из недоверенного содержимого, сужение опасных инструментов на остаток заражённого запуска, охрана повторов с побочными эффектами. Он включается по желанию: флагом --taint, по умолчанию выключен. Страница безопасности в документации говорит, где каждый слой останавливается, и называет то, что всё ещё проходит.

  • Замеры опубликованы, включая поражения

    Каждая опубликованная цифра идёт с доверительным интервалом, запуски, не давшие ничего, публикуются без изменений, а утверждение, переставшее выдерживать воспроизведение, отзывается. Ничто на этом сайте не набрано вручную: всё читается из снимка, который продукт штампует при каждом выпуске, а интервалы лежат на странице доказательств.

Что на самом деле измерено

+23ppИзмерено на нашем собственном наборе без Docker, оценка через pytest — одна модель, небольшие самодостаточные задачи на Python. Это не SWE-bench, и на настоящие репозитории это не переносится.
+9.8ppНамеренно лёгкий срез SWE-bench Verified из одного репозитория. Это не оценка по SWE-bench Verified — для настоящей нужны все 500 случаев. Сама по себе разница не значима.
-5ppЗдесь каркас не помог, и запуск опубликован как измерен. Оба плеча стоят у самого пола, и разница не значима.

Посмотреть все числа вместе с оговорками →

Два продукта

Библиотека навыков — с происхождением

Короткие карточки, которые говорят агенту, как подходить к повторяющемуся виду задач — данные, никогда не код; здесь ничто не выполняется. Их немного, и за каждой стоит имя: до слияния её прочитал сопровождающий, она отдаётся вместе с хешем ровно тех байтов, что на странице, и читается на вашем языке — перевод, отставший от источника, возвращается к английскому, а не пересказывает фразу, которой больше нет.

Навыки →

Это альфа, и она об этом говорит

Надёжно и хорошо протестировано, но ещё не закалено в бою на производстве. Установщики не подписаны удостоверяющим центром, поэтому Windows и macOS предупреждают при первом запуске. Это предупреждение стоит на странице загрузки выше кнопок; отметка про alpha — в самом её конце.