NVIDIA SoL-Pi: оптимизация «обвязки» агента вдвое сокращает расход токенов
Grok и GPT спорят, что в SoL-Pi экономит токены: Fusion или сжатие
NVIDIA представила метод SoL-Pi, который снижает расход токенов у агентов для написания кода, не меняя саму модель. Оптимизируется harness — промежуточный слой, управляющий вызовами инструментов, контекстом и обработкой логов. Четыре механизма: слияние действий, онлайн-сжатие контекста, упаковка наблюдений и пересылка больших логов дешёвой модели. На 51 задаче EdgeBench расход токенов упал на 49%, стоимость API — на 33%, а качество сохранилось на 93,7% от исходного. При переносе на другую модель результат сохранился. Это практичный способ сократить счёт за AI-кодинг без смены модели.
Кодирующий агент, который работает долго, обходится дороже, и дело не всегда в модели. Одна и та же модель с теми же способностями может тратить вдвое больше токенов только потому, что слой кода, управляющий вызовами инструментов и обработкой обратной связи, написан неоптимально. NVIDIA в работе SoL-Pi предлагает оптимизировать именно эту прослойку — harness, «обвязку» агента, — а не менять модель. Контекст проблемы авторы описывают так: по данным аналитика OpenRouter Питера Уокера, к сентябрю 2026 года потребление токенов агентами выросло в 14 раз с февраля, почти 70% приходится на кэшированные подсказки. Отрасль привыкла снижать цену токена: быстрые ядра внимания, квантизация, дистилляция, переход на дешёвые модели. SoL-Pi идёт другим путём и работает с harness — слоем между языковой моделью и внешней средой. Он определяет, как агент воспринимает состояние, выполняет действия и обрабатывает обратную связь. Codex, Claude Code и OpenClaw используют собственные harness. Оптимизировать его вручную тяжело: вызовы инструментов, управление контекстом, проверки и стратегии остановки связаны между собой, и экономия в одном месте порождает ошибки в другом. SoL-Pi автоматизирует эту работу: исследовательский агент наблюдает за траекториями рабочего агента, предлагает улучшения, проверяет их в песочнице и отбирает кандидатов по критериям качества и эффективности. Построено 535 исполняемых сред, изучено 152 направления оптимизации — 495 задач из пар issue-PR на GitHub и 40 синтетических тестов, всего свыше 3000 запусков и более 60 тысяч взаимодействий агента со средой. Чтобы не переобучиться под конкретные задачи, поиск отделён от оценки: из 51 публичной задачи EdgeBench лишь 11 шли на разовую проверку кандидатов, остальные 40 — на финальную оценку, и её результаты в поиск не возвращались. Выжили четыре механизма. Action Fusion объединяет два подряд идущих шага в один, например правку кода и запуск тестов, экономя вызов модели. Online Context Compact выполняется после каждого шага планирования и подрезает накопленный контекст. ObservationPack архивирует длинный вывод инструментов, передавая дальше только краткое резюме. Evidence-Preserving Reducer отправляет большие логи ошибок и тестов дешёвой модели на суммаризацию, добавляя автоматическую проверку, чтобы не потерять важные детали. На 51 задаче EdgeBench исходный harness Pi на GPT-5.6 Sol расходовал 2,154 млрд токенов, стоил 1339 долларов и давал средний балл 44,8. Полный SoL-Pi потратил 1,099 млрд токенов, 894 доллара и набрал 42,0 — это минус 49% токенов и минус 33,2% стоимости при сохранении 93,7% исходного результата. В пересчёте на час работы это экономия от 8,75 до 13,50 доллара против штатных harness Codex и Claude Code и от 4,36 до 5,71 доллара против Pi. Harness без изменений перенесли на Claude Opus 5: он сохранил 94,3% среднего балла Pi, расход токенов упал на 44,7%, стоимость API — на 33,5%. Есть и компромисс: сжатие контекста снижает попадания в кэш подсказок, поэтому самый эффективный вариант экономит 49% токенов, но лишь около трети денег. За пределами EdgeBench картина сложнее. В Terminal-Bench 4 из 63 задач SoL-Pi решил 15, тогда как Codex и Pi — по 18, хотя суммарная стоимость всё равно примерно на четверть ниже, чем у Pi. В задачах формальной верификации Lean 4 на олимпиаде IMO 2026 он решил 3 из 6 задач с минимальной ценой за задачу. То есть метод не универсальная таблетка. В ту же неделю AWS выпустила Strands Harness, заявив о 77% меньшей стоимости по сравнению с Claude Code при той же модели. Над SoL-Pi работали 14 исследователей из MIT, Принстона, Университета Цинхуа и NVIDIA. В финале они описывают более далёкую цель: предобучать harness на разных задачах, как предобучают модели, а затем искать его следующую версию ради рекурсивного роста эффективности; сами авторы называют это замыслом, а не результатом исследования.