Перейти к содержимому
Chimera
ChimeraAgent

Агент в терминале, который сам делает настоящую работу, и приложение, чтобы работать с ним. Открытый исходный код, работает на вашей машине и публикует замеры, в которых проиграл.

Много умов, один ответ

Лев, коза, дракон и змея были на логотипе раньше, чем стали доводом. Панель моделей отвечает, судья называет, где они согласны, а где нет, и синтезатор пишет результат — но только когда вопрос достаточно труден, чтобы это окупилось. Само по себе слияние не уникально; уникально то, что оно вшито в цикл агента за маршрутизатором, знающим цену, и что оно измерено.

Три ставки и положение каждой из них

  • Эволюция с сигналом пригодности

    Другие агенты учатся, дописывая то, что произошло. Chimera сохраняет усвоенное изменение, только когда подтверждённый результат доказывает, что оно помогло, — по настоящей разнице в рабочем дереве и честному A/B, а не по тому, что модель говорит о себе. Делает ли это накопление её лучше на новых задачах — измеряется, и ответ на сегодня лежит на странице доказательств.

  • Безопасность как архитектура

    Внедрение в промпт широко считается непатчабельным, и большинство агентов смягчает его на уровне приложения или объявляет вне области. Здесь есть настоящий слой защиты — отслеживание заражения, удаление управляющих токенов из недоверенного содержимого, сужение опасных инструментов на остаток заражённого запуска, охрана повторов с побочными эффектами — и он включается по желанию и по умолчанию выключен, о чём страница безопасности говорит прежде всего остального.

  • Замеры опубликованы, включая поражения

    Каждая цифра идёт с доверительным интервалом, запуски, не давшие ничего, публикуются без изменений, а утверждение, переставшее выдерживать воспроизведение, отзывается. Ничто на этом сайте не набрано вручную: всё читается из снимка, который продукт штампует при каждом выпуске.

Что на самом деле измерено

+23ppИзмерено на нашем собственном наборе без Docker, оценка через pytest — одна модель, небольшие самодостаточные задачи на Python. Это не SWE-bench, и на настоящие репозитории это не переносится.
+9.8ppНамеренно лёгкий срез SWE-bench Verified из одного репозитория. Это не оценка по SWE-bench Verified — для настоящей нужны все 500 случаев. Сама по себе разница не значима.

Посмотреть все числа вместе с оговорками

Два продукта

Это альфа, и она об этом говорит

Надёжно и хорошо протестировано, но ещё не закалено в бою на производстве. Установщики не подписаны удостоверяющим центром, поэтому Windows и macOS предупреждают при первом запуске. И то и другое написано на странице загрузки — до кнопки.