ИИ-агенты для разработки: что дальше автодополнения кода
GPT спустил Gemini с небес: тесты и PR — это только разминка
Разработка с ИИ переходит от автодополнения строк к автономным агентам: они читают код в нескольких файлах, запускают сборки и тесты, разбирают ошибки, исправляют код и открывают pull request по одному запросу на естественном языке. В обзоре разобраны Devin, Claude Code, Cursor, GitHub Copilot, Codex и Windsurf — их сильные и слабые стороны. Статистика отрезвляет: заявленный рост продуктивности 10–30% на разработчика, но время на проверку кода съедает выгоду, а доверие к точности ИИ упало с 40% до 29% за год.
Автодополнение кода перестало быть главным сценарием использования ИИ. В 2023 году инструменты предсказывали следующую строку, а в 2026-м агенты планируют функциональность сразу в нескольких файлах, запускают набор тестов, читают ошибки, правят код и открывают pull request — и всё это по одному запросу на естественном языке. По данным опроса разработчиков Stack Overflow 2025 года, 84% уже используют или планируют использовать ИИ-инструменты, но лишь около половины пробовали агентные версии. Что отличает агента от автодополнения. Обычный автокомплит работает в цикле «вы печатаете — модель предсказывает токены — вы принимаете или отклоняете», и курсор никуда не уходит. Агентные инструменты идут по циклу «план — выполнение — наблюдение — итерация»: читают кодовую базу в разных файлах, выполняют команды оболочки вроде сборок, тестов и линтеров, разбирают вывод, сами исправляют сломанное и сохраняют контекст между сессиями. Разница — в автономности: агент берёт цель и идёт к ней, обращаясь за помощью только когда застрял. Это тот же паттерн вызова инструментов, что лежит в основе современных ИИ-агентов, только применённый к среде разработки. Дальше обзор основных игроков. Devin запустился в марте 2024 года как первый «полностью автономный ИИ-инженер»: он работает в облачной песочнице с оболочкой, браузером и редактором, ему ставишь задачу и уходишь. Но результаты смешанные: месячное испытание Answer.AI зафиксировало 14 провалов, 3 неопределённых исхода и всего 3 успеха из 20 задач, а код получается функциональным, но переусложнённым и трудно поддерживаемым. Claude Code от Anthropic — терминальный агент, живущий в вашей оболочке, а не в отдельной IDE, поэтому он работает с любым редактором. Его особенность — масштаб: контекстное окно на 1 миллион токенов. В начале 2026 года появились Agent Teams: одна сессия порождает и координирует параллельные сессии под разные подзадачи. Плата за это — отсутствие визуального автодополнения. Cursor — форк VS Code с ИИ во всех поверхностях и агентом Composer, заточенным под низкую задержку: большинство ходов укладывается в 30 секунд. Версия 2.0 добавила параллелизм до 8 агентов в изолированных Git worktree. Среди известных слабостей — усечение чтения файлов до 250 строк по умолчанию и случаи галлюцинаций. У GitHub Copilot агентная стратегия разбита на три продукта: Agent Mode в IDE, облачный Coding Agent, открывающий PR из issue, и Copilot Workspace для планирования. Сильная сторона — глубокая интеграция с экосистемой и широкая поддержка IDE. OpenAI Codex — это открытый CLI плюс облачный агент, включённый в подписку ChatGPT Plus. Windsurf, бывший Codeium, строит контекст на реальном времени, учитывая каждое ваше действие. Что говорят данные о продуктивности. Самооценки разработчиков дают рост на 10–30%, организации заявляют ускорение циклов разработки. ИИ генерирует около 41% кода. Но контролируемые исследования показывают «парадокс продуктивности»: выигрыш отдельного разработчика исчезает на уровне организации, потому что время на проверку съедает экономию. По отчёту Anthropic 2026 года, ИИ используется примерно в 60% ежедневных задач, но полностью без присмотра делегируется лишь 0–20%. Доверие к точности ИИ снизилось с 40% до 29% за год. Вывод: инструменты действительно полезны, но не заменяют инженерное суждение. Тренд — многоагентный параллелизм, а роль разработчика смещается от построчного написания кода к оркестрации агентов и проверке результата.