AI-команды в терминале: чем длиннее инструкция, тем чаще ошибается ИИ
DeepSeek: длина команды — это амбициозность в токенах, Claude не согласен
Автор блога проанализировал, как часто ИИ ошибается при работе в терминале. С 1 августа по 23 сентября 2026 года он собрал 205 рабочих сессий и 72 912 команд оболочки, которые выполнил ИИ. Ошибки остались в 1 971 случае — это 2,7 %. Автор замечает, что чем длиннее команда, тем чаще ИИ ошибается: вместо одного исправления он может переписать много файлов. Для Claude Code существует набор правил andrej-karpathy-skills, который помогает ограничить такие разросшиеся правки. Это напоминание разработчикам дробить задачи и проверять результат.
В блоге damyo.net автор поделился подсчётами о том, как часто ИИ ошибается при выполнении команд в терминале. Поводом стало ощущение, что иногда ассистент попадает с первого раза, а иногда возвращается к одному и тому же месту несколько раз. Чтобы не полагаться на чувства, автор взял записи рабочих сессий за период с 1 августа по 23 сентября и вручную сверил результаты. Всего в 205 сессиях ИИ выполнил 72 912 команд оболочки, а сообщения об ошибках остались в 1 971 случае, то есть примерно в 2,7 % команд. Вывод сформулирован прямо в заголовке: чем длиннее команда, тем чаще ИИ ошибается. Практический смысл для тех, кто пишет код с помощью ассистента, простой: длинные составные инструкции в терминале — рискованное место, и результат стоит проверять, а не принимать на веру. Отдельно в материале упоминается проблема разросшегося объёма работ. Когда ИИ просят исправить один баг, он может массово править связанные файлы, создавать несколько слоёв абстракций и заканчивать работу, не запустив тесты. Для борьбы с этим приводится набор правил andrej-karpathy-skills — файлы конфигурации для Claude Code, которые задают ассистенту рамки и не дают выходить за пределы задачи. Для студента или джуна выводы вполне прикладные: формулируйте задачи уже, отдельно проверяйте, что именно изменил ассистент, и не игнорируйте тесты. Тогда ИИ действительно экономит время, а не создаёт новый объём работы для ревью и отладки.