Nvidia: ИИ-агент сам оптимизирует harness и экономит почти 50% токенов кодинг-агентов
Qwen и Grok спорят: склейка шагов множит баги или экономит токены
Исследователи Nvidia описали систему SoL-Pi, которая автоматически оптимизирует harness — управляющий слой кодинг-агента между моделью и средой. Research-агент наблюдает за трассами другого агента, предлагает изменения и оставляет только те, что сохраняют качество и снижают расход токенов. На бенчмарке EdgeBench самая экономная конфигурация расходует на 49 процентов меньше токенов, сохраняя 93,7 процента результата Pi. По оценке авторов, это экономит от 8,75 до 13,50 доллара в час по сравнению с Codex и Claude Code. Механизмы сокращают лишние вызовы модели, сжимают контекст и архивируют длинные выводы инструментов.
Кодинг-агенты вроде Codex, Claude Code или Pi стоят тем дороже, чем дольше работают без присмотра: отдельные предсказания превращаются в длинные цепочки рассуждений, вызовов инструментов и обратной связи, и расход токенов растёт. Исследователи Nvidia предложили снижать эти затраты не на уровне модели, а на уровне harness — управляющего слоя между моделью и средой, который определяет, как агент видит состояние, выполняет действия и обрабатывает отклики. Обычные методы работают с ценой за токен: быстрые ядра внимания, квантизация, дешёвые модели. Но на практике это трудно: работа с инструментами, управление контекстом, проверка и логика остановки связаны, и экономия в одном месте рождает ошибки в другом. Система под названием SoL-Pi берёт ручную работу на себя. Research-агент наблюдает за трассами другого агента, предлагает изменения и проверяет их в подготовленных окружениях, а проверки способностей и эффективности решают, какие кандидаты выживут. Подход вдохновлён идеей рекурсивного самоулучшения, а итоговая оценка идёт только после заморозки harness и не влияет на поиск. Всего система исследовала 152 направления в 535 исполняемых окружениях: 495 задач из пар «issue — pull request» на GitHub и 40 синтетических тестов, что дало более 3000 прогонов и свыше 60000 взаимодействий агента со средой. Авторы подчёркивают: больше поиска не значит автоматически больше пользы, ведь автоптимизированные harness слишком подстраиваются под обучающие задачи. Поэтому обратная связь поиска и оценка разделены, а бенчмарк EdgeBench отгорожен: из 51 публичной задачи 11 служат для приёмки кандидатов, а 40 — для финальной оценки. Поиск дал четыре механизма. Action Fusion объединяет два последовательных шага в один, например правку кода и следующий за ней тест, и целый вызов языковой модели исчезает. Online Context Compact после каждого шага плана проверяет, можно ли сократить накопленный контекст без потери важного. ObservationPack складывает длинные выводы инструментов в архив и дальше подставляет лишь краткую сводку вместо полного текста. Evidence-Preserving Reducer отправляет объёмные протоколы ошибок и тестов более дешёвой модели, которая сжимает их до главного, а автоматическая проверка следит за сохранностью важных подсказок. На 51 публичной задаче EdgeBench SoL-Pi работает примерно так же хорошо, как исходный harness Pi. Самая экономная конфигурация сочетает все четыре механизма, тратит на 49 процентов меньше токенов и достигает 93,7 процента результата Pi. Вариант под производительность берёт только сильнейший механизм, превосходит Pi на 5,3 процента и всё равно экономит. По обеим конфигурациям расход падает на 44,7–49 процентов. Экономный вариант стоит 894 доллара вместо 1339, а экономия оценивается в 8,75–13,50 доллара в час против нативных harness Codex и Claude Code и в 4,36–5,71 доллара против Pi. Систему строили только на GPT-5.6 Sol и применили без изменений к Opus 5: там она сохранила 94,3 процента производительности Pi при похожей экономии, но механизмы срабатывали реже, вероятно из-за оптимизации на траекториях GPT-5.6 Sol. За пределами EdgeBench картина смешанная: на 63 CPU-задачах Terminal-Bench 4 SoL-Pi решает 15 задач против 18 у Codex и Pi, зато затраты примерно на четверть ниже. На задачах IMO 2026 с верификацией в Lean 4 система берёт три из шести при минимальной цене за решённую задачу, а рой из 20 работников SoL-Pi в тесте по оптимизации ядер снизил затраты на 26,8 процента против аналогичного роя на Pi. Экономия не бесплатна: короткий контекст может уменьшать повторное использование кэша промптов, но в одном прогоне суммарные затраты всё равно упали с 1339 до 894 долларов. На будущее авторы предлагают предобучать harness на множестве задач и использовать уже экономный harness для поиска преемника, называя это видением, а не результатом.