Бенчмарки AI-агентов для кода: что показывают Cursor, Claude Code и Codex
DeepSeek поспорил с Gemini: в проде модель и обвязку не разделить
AI-агенты для написания кода давно переросли автодополнение: Cursor, Claude Code, Codex и открытые OpenCode умеют изучать репозитории, править несколько файлов, запускать команды и тесты, повторять попытки после ошибок. Автор разбирает, что показывают разные бенчмарки. В тесте AIMultiple по 10 full-stack задачам лучший результат у OpenCode — 0.816, у Claude Code 0.789, у Cursor 0.751. В контролируемом CLI-тесте DecideNavigator Codex прошёл 87% задач автономно против 61.1% у Claude Code. Главный вывод: результат зависит от того, что именно измеряют — модель, обвязку агента, окружение или набор задач, поэтому единого лидера нет.
AI-агенты для программирования уже не сводятся к автодополнению кода. Cursor, Claude Code, Codex и открытые инструменты вроде OpenCode умеют просматривать репозитории, редактировать сразу несколько файлов, выполнять команды, запускать тесты и повторять попытки после неудач при относительно небольшом участии человека. Из-за этого выбрать один инструмент стало сложнее: простой тест «Cursor против Claude Code» больше не даёт ответа, потому что результат зависит от того, что именно измеряется. Прежде всего стоит различать три вещи. Бенчмарк модели проверяет, насколько хорошо базовая модель решает задачи по разработке при неизменной обвязке. Бенчмарк обвязки (harness) оценивает оркестрацию вокруг модели: как агент ищет файлы, управляет контекстом, правит код, вызывает инструменты, обрабатывает упавшие тесты и решает, что задача выполнена. Бенчмарк продукта измеряет полный стек, которым пользуется разработчик: модель, IDE или CLI, системные инструкции, поиск, систему подтверждений, доступ к браузеру и вспомогательных агентов. Эти категории легко перепутать, а смена обвязки меняет результат даже при той же модели. Поэтому оценку корректнее читать как «модель + обвязка + инструменты + права + окружение + набор задач», а не как оценку интеллекта модели. SWE-bench с его набором Verified из 500 отфильтрованных людьми задач по реальным репозиториям как раз разделяет качество модели и качество обвязки. Конкретные результаты расходятся, и это ожидаемо, потому что методики разные. В бенчмарке AIMultiple на 10 full-stack задачах с автоматической проверкой бэкенда и UI лучший суммарный результат показал OpenCode — 0.816, затем Claude Code — 0.789 и Cursor — 0.751, который стал сильнейшим среди IDE. Однако CLI-инструменты там работали на одной конфигурации модели, а редакторы — на другой, и авторы сами предупреждают, что межкатегорийные сравнения стоит считать ориентировочными. В контролируемом CLI-тесте DecideNavigator на 18 неопубликованных задачах по TypeScript, Python и Go, по три прогона каждая, Codex автономно завершил 87% запусков против 61.1% у Claude Code. Ещё один набор — usamadar — использует 11 синтетических задач со скрытыми тестами: исправление ошибок, новые функции, рефакторинг и работа с несколькими файлами. Для практики из этого следует несколько вещей. Ни один агент не выигрывает во всём: сильная сторона зависит от типа задачи. Бенчмарки с реальными репозиториями и скрытыми тестами полезнее, чем задачи на генерацию отдельной функции, потому что настоящая работа включает настройку окружения, проблемы с зависимостями, размытые требования и регрессии. И главное — при выборе инструмента смотрите на то, насколько он подходит вашему рабочему процессу: сколько вмешательства он требует, умеет ли проверять результат и оставляет ли изменения, которые реально можно отревьюить и влить.