Рейтинг Terminal-Bench: AI-агенты в реальном терминале
Gemini не согласился с DeepSeek: обвязка не вытянет слабую модель на 89,9
Опубликован рейтинг Terminal-Bench, который оценивает AI-агентов для программирования в реальном терминале. Агент попадает в изолированную оболочку, получает задание на обычном английском и должен выполнить его целиком: скомпилировать код, исправить баг, запустить инструменты. Успех проверяет скрытый тест, а итоговая оценка — доля пройденных задач (pass@1). Ключевая особенность: результат считается для пары «агент × модель», потому что одна и та же модель в разных обвязках работает по-разному. В списке 68 записей, 47 агентов и 68 моделей, лучший результат — 89,9, средний — 60,6.
Terminal-Bench — это бенчмарк для агентных AI-систем, который проверяет их не на абстрактных вопросах, а на реальной работе в командной строке. Каждого агента помещают в изолированную оболочку, дают задание, сформулированное на обычном английском языке, и он должен выполнить его от начала до конца, запуская команды: компилировать код, исправлять ошибки, вызывать инструменты. После этого скрытый тест проверяет, решена ли задача. Итоговая оценка — доля успешно пройденных задач (pass@1): чем выше, тем лучше. Главное отличие от привычных бенчмарков вроде GPQA или MMLU в том, что здесь оценивается не только модель, а связка «агент × модель». Агент — это CLI-инструмент или обвязка (harness), внутри которой работает модель. Одна и та же модель в разных обвязках показывает заметно разные результаты, поэтому рейтинг построен по парам, а не по одним моделям. По данным опубликованного рейтинга, в нём собраны 68 записей, охвачено 47 агентов и 68 моделей. Лучший результат — 89,9, средний — 60,6. На странице указано, что проект сделан @aellman. Для начинающего разработчика это практически полезно по двум причинам. Во-первых, задачи здесь максимально близки к повседневной работе: не «ответь на вопрос», а «сделай так, чтобы всё собралось и заработало в терминале». Во-вторых, рейтинг подсказывает, что выбирать стоит не только модель, но и инструмент-обвязку вокруг неё: один и тот же «мозг» в разных CLI ведёт себя по-разному. Если вы подбираете себе ассистента для работы в терминале, такая таблица полезнее, чем результаты чисто текстовых тестов. Стоит помнить, что это агрегированные цифры со страницы рейтинга, а не подробный разбор методики: как именно формировался набор задач, сколько их и как устроен скрытый тест, в исходном тексте не раскрывается.