Исследователи из NVIDIA, MIT и NTU поручили одному ИИ-агенту улучшать harness другого, кодинг-ассистента на базе открытого Pi. Агент перебрал 152 идеи, и 4 из них сократили расход токенов почти вдвое при той же модели. Счёт за API упал на треть, средний балл на EdgeBench снизился на 6 %. Разбираем, что такое harness, какие приёмы сработали и где у результатов слабые места. Какие 4 приёма сработали
Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели10K
Обзор
Исследователи из NVIDIA, MIT и NTU поручили одному ИИ-агенту улучшать программу, в которой работает другой ИИ-агент, кодинг-ассистент. Цель поставили одну: тратить меньше токенов и сохранить качество решения задач.
Найденные приёмы сократили расход токенов на 45–49 %, счёт за API снизился примерно на треть. Счёт упал меньше, потому что сэкономленные токены в основном приходились на prompt cache, который и так стоит дешевле. Средний балл на бенчмарке EdgeBench при этом снизился на 6 %.
Статья SoL-Pi вышла 17 сентября 2026 года, код открыт в репозитории NVlabs/SoL-Pi.
Что такое harnessКодинг-агент вроде Claude Code или Codex состоит из двух частей: языковой модели и программы вокруг неё, которую называют harness. Модель читает текст и пишет текст. Harness передаёт ей задачу, выполняет команды, которые она запросила (открыть файл, запустить тесты), и отправляет ей результат.
За каждый такой обмен провайдер выставляет счёт. С каждым запросом модель заново получает всю накопленную историю: условие задачи, прочитанные файлы, вывод тестов. Повторяющееся начало истории провайдер хранит в prompt cache и берёт за него меньше, но тоже берёт.
Поэтому одна и та же модель в разных harness стоит разных денег. На 51 задаче EdgeBench с моделью GPT-5.6 Sol harness Codex потратил 1787 $, открытый harness Pi потратил 1339 $ и набрал больше баллов: 44,8 против 34,7.
Идея: harness улучшает другой агентВручную harness настраивают так: инженер читает логи работы агента (трейсы), ищет, где агент делает лишнюю работу, и правит код. Авторы поручили эту работу отдельному ИИ-агенту-исследователю. Он читает трейсы агента на базе Pi, придумывает изменение harness, реализует его и проверяет на тестовых задачах.
Этот цикл повторяется сотни раз, и весь процесс дальше называется подбором: исследователь раз за разом придумывает изменения, проверяет их и оставляет те, что прошли отбор. В статье процесс называется auto-research.
Изменение принимается по двум правилам, которые исследователь изменить не может: качество решения задач остаётся в заданных пределах, и расход токенов снижается. Всего исследователь перебрал 152 идеи на 535 задачах, из них 495 взяты из реальных исправлений ошибок на GitHub, а 40 синтетические с автоматической проверкой. Весь подбор занял больше 3000 прогонов.
У прежних работ такого рода была проблема: найденный harness подстраивался под задачи, на которых его подбирали, и на новых задачах давал малый прирост. Поэтому итоговый бенчмарк EdgeBench в подборе не участвовал, его запустили на готовом замороженном harness.
Каждая идея проверяется в своей изолированной копии исследовательского цикла, поэтому неудачная идея закрывается без влияния на остальные.
Четыре приёма, которые прошли отборИз 152 идей проверку прошли 4, и каждая убирает свой вид лишних токенов.
Action Fusion: раньше агент правил файл, получал ответ и следующим запросом просил запустить тесты, и каждый запрос снова отправлял модели всю историю. Теперь правка и запуск тестов идут одним вызовом, на такой паре действий модель получает 2 запроса вместо 3.
ObservationPack: вывод команды больше 10 KiB, например лог сборки, раньше оставался в истории и уходил модели с каждым следующим запросом. Теперь он идёт целиком только в двух ближайших запросах, дальше модель видит короткую ссылку, размер и первые и последние строки. Полный текст агент запрашивает по ссылке.
Evidence-Preserving Reducer: длинные логи сборки и тестов сначала читает дешёвая модель GPT-5.6 Luna и выписывает важное с точными цитатами. Программа сверяет цитаты с оригиналом, и при ошибке основная модель получает исходный лог.
Online Context Compact: сжатие истории в краткий пересказ экономит токены в следующих запросах и при этом сбрасывает prompt cache, за повторную запись которого провайдер тоже берёт деньги. После каждого выполненного шага плана harness сравнивает обе суммы и сжимает историю, когда экономия больше.
На 51 задаче EdgeBench с моделью GPT-5.6 Sol SoL-Pi со всеми четырьмя приёмами отправил модели 1,10 млрд токенов против 2,15 млрд у Pi, на 49 % меньше. Счёт составил 894 $ против 1339 $ у Pi и 1787 $ у Codex. Средний балл составил 42,0 против 44,8 у Pi.
Harness | Токены, млрд | Счёт за API, $ | Средний балл | $ за балл |
|---|---|---|---|---|
SoL-Pi, все 4 приёма | 1,10 | 894 | 42,0 | 0,42 |
Pi + ObservationPack | 2,02 | 1271 | 47,2 | 0,53 |
Pi | 2,15 | 1339 | 44,8 | 0,59 |
Codex | 3,05 | 1787 | 34,7 | 1,01 |
Один ObservationPack дал другой результат: балл вырос до 47,2, счёт снизился на 5 %. Ещё 4 открытых harness (OpenSquilla, Oh-My-Pi, OpenCode, Oh-My-Opencode) набрали 24,5–38,5 балла при счёте 1243–3422 $. Цены API взяты на 17 августа 2026 года.
Приёмы искали только на модели GPT-5.6 Sol. На Claude Opus 5 SoL-Pi запустили без изменений и получили похожую картину: счёт 1158 $ против 1741 $ у Pi и 2535 $ у Claude Code, балл 42,2 против 44,8 и 43,7. В пересчёте на час работы агента авторы оценивают экономию в 8,75–13,50 $ относительно Codex и Claude Code.
На Terminal-Bench 4 SoL-Pi решил 15 задач из 63 против 18 у Pi и Codex и потратил 211 $ против 286 $ у Pi. На 6 задачах олимпиады IMO 2026 с проверкой доказательств в Lean 4 SoL-Pi и Pi решили по 3 задачи, Codex решил 5, и счёт SoL-Pi составил 63 $ против 76 $ у Pi.
В эксперименте с роем из 20 агентов, которые 2 часа ускоряли вычислительное ядро, рой на SoL-Pi получил самое быстрое ядро и обошёлся на 27 % дешевле роя на Pi.
Что смущаетЭкономия оплачена качеством: на EdgeBench полный SoL-Pi теряет около 6 % балла, на Terminal-Bench 4 решает на 3 задачи меньше. Авторы называют это сопоставимым результатом.
Выбор лучшей конфигурации: вариант с одним приёмом, который дал 47,2 балла на GPT-5.6 Sol и 50,5 на Opus 5, выбрали по результатам того же EdgeBench. Эти цифры стоит считать оптимистичными.
Один прогон: каждую конфигурацию запускали по разу, разброс между прогонами в статье отсутствует. Разницу в 2–3 балла на 51 задаче по такой проверке отделить от случайности нельзя.
Часть бенчмарка: EdgeBench открыл 51 задачу из 134, все замеры сделаны на открытой части.
Цены: выгода от сжатия истории зависит от того, сколько провайдер берёт за prompt cache. При других ценах результат изменится.
Полный набор из 4 приёмов сокращает расход токенов почти вдвое и счёт за API на треть ценой 2,5–2,8 балла EdgeBench. Тем, кто работает с Pi, приёмы можно подключать по одному: Action Fusion и ObservationPack по отдельности на обеих моделях снизили счёт и подняли средний балл.
Источники| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Вайбкодинг: запретить нельзя возглавить | 0 | 11.07 | 30-09-2026 |
| 2 | ИИ развивается со скоростью света, и мы едва успеваем следить ... | 0 | 7.37 | 03-10-2026 |
| 3 | Фабрика кода с выключенным светом: почему Хорти зовет обратно читать код, и что у меня с этим сходится | 0 | 7.64 | 01-10-2026 |
| 4 | ИИ-ревью, или как я себя чуть не уволил | 0 | 9.94 | 02-10-2026 |
| 5 | Не трогая веса модели: как мы построили исследовательского агента Алисы AI и в разы сократили потребление GPU | 1 | 8.1 | 14-09-2026 |
| 6 | AGI как когнитивная ОС: что если искать программы, а не веса | 0 | 6.32 | 25-09-2026 |
| 7 | Путь к ИИ‑сингулярности | 0 | 8.46 | 28-09-2026 |
| 8 | [Перевод] От тестирования релиза с высоким уровнем риска к новому ИИ-инструменту для QA | 0 | 11.89 | 26-09-2026 |
| 9 | Почему нельзя отдавать 100% мышления ИИ: ловушка слепого доверия к AI-ассистентам | 0 | 7.82 | 26-09-2026 |
| 10 | Дайджест технологических новостей Мы продолжаем следить за тем, что происходит ... | 0 | 7.7 | 30-09-2026 |