ИИ сделал написание кода дешёвым, и в результате многие компании строят всё более крупные инструменты в погоне за производительностью: длиннее промпты, больше оркестрации, больше слоёв, больше сложности. Это же делает такие инструменты изначально дороже в использовании. Pi выбирает противоположный путь.
Pi — это coding harness (среда для агентного кодирования), который сознательно делает ставку на минимализм. «Из коробки» он поставляется всего с четырьмя инструментами, а его системный промпт и описания инструментов занимают менее 1000 токенов. Идея в том, что большую часть работы можно сделать базовыми средствами, а если нужно больше — это можно достроить самому.
Всё больше данных указывает на то, что подход Pi не просто аккуратнее — он ещё и дешевле, и производительнее. Пользователи отмечают, что «ванильный» Pi выдаёт результаты на уровне лучших в индустрии ещё до того, как к нему добавляют расширения под конкретные рабочие процессы. В кейсах Databricks и Shopify, о которых пойдёт речь ниже, Pi показал себя оптимальным решением в обоих случаях.
Кейсы применения
Databricks: стоимость выполнения задачи
Databricks недавно поделились результатами исследования «Benchmarking Coding Agents on Databricks' Multi-Million Line Codebase» («Бенчмаркинг coding-агентов на многомиллионностроковой кодовой базе Databricks»). Цель исследования — понять, какие coding-агенты дают лучшую производительность на реальных задачах и как эта производительность соотносится с ценой.
Чтобы избежать искажений, вносимых переобученными на публичных бенчмарках моделями, команда Databricks создала собственный набор тестов на основе задач, которые их инженеры выполняют регулярно. Результаты подтвердили ожидания исследователей, но, возможно, удивили многих в индустрии. По словам команды Databricks, «harness, из которого вызывается модель, драматически влияет на стоимость и качество», и «во многих случаях простые harness'ы вроде Pi показывали лучший результат на наших рабочих нагрузках».
В связке с моделью Opus 4.8 в режиме xhigh Pi показал наивысший процент успешно выполненных задач при заметно меньшей стоимости по сравнению с Claude Code и Codex.
Минимальный harness, измеримый эффект
Pi выигрывает потому, что не пытается обернуть модель набором дефолтов и инструкций, которые теряются где-то в иерархии инструкций. Вместо этого Pi не мешает модели работать, а команда разработчиков может добавить именно то, что нужно для их процесса.
Исследование Databricks ценно тем, что в нём разделены модель и harness как независимые переменные.
Команда сообщила, что при запуске одной и той же модели с одинаковым уровнем «размышления» через разные harness'ы «стоимость на задачу существенно различалась (в некоторых случаях более чем в 2 раза), при этом качество оставалось прежним». Это явление называют «дисциплиной контекста» Pi: «Pi отправлял примерно в 3 раза меньше контекста за ход. Он лучше управлял контекстом, поддерживая более компактный рабочий набор данных и завершая задачи за меньшее число прогонов».
Здесь стоит учитывать сквозную инженерную экономику, а не только цену за токен. То же самое верно и на уровне моделей: например, запуск сложных workflow на Haiku 4.5 нередко оказывался дороже, чем на Sonnet 4.6, особенно если требовалось выполнение кода — просто потому, что агенту требовалось больше ходов для успешного завершения задачи.
Теперь та же логика проявляется и на уровне harness'а: более мощные и дорогие модели в связке с производительным harness'ом могут обходиться дешевле, чем обратная комбинация.
Shopify создаёт Pi Autoresearch: расширяемость побеждает раздутость
Минимализм — часть базовой философии Pi. Работает это благодаря тому, что минимализм не означает негибкость. По сути, это первая широко используемая агентная инфраструктура, изначально созданная для расширяемости и способности к самомодификации.
Ещё одно независимое подтверждение эффективности архитектуры Pi пришло от Shopify. В посте Shopify Engineering Дэвид Кортес (David Cortés) описывает, как построил pi-autoresearch прямо в виде расширения Pi, просто попросив Pi «создать расширение для Autoresearch...». Pi изучил собственную документацию по расширениям и начал строить новый workflow на её основе.
Autoresearch — это автономный цикл оптимизации для coding-агентов. При запросе на изменение он запускает эксперименты, чтобы выяснить, что работает, а что вызывает регрессии. Пока цель измерима, система может отбрасывать регрессии и продолжать самосовершенствоваться.
Для Shopify и других компаний расширение Autoresearch быстро стало серьёзным внутренним инструментом повышения продуктивности. Shopify сообщила о случаях, когда unit-тесты стали выполняться «в 300 раз быстрее», монтирование React-компонентов ускорилось «на 20%», сократилось время сборки в нескольких проектах, а также улучшилась производительность pnpm.
Важный момент здесь в том, что Pi не поставляет ни один из этих инструментов «из коробки». Вместо этого он делает предельно простым процесс их создания. Вместо предположения, что поставщик знает рабочий процесс пользователя, и попытки поставить «все инструменты под солнцем», Pi исходит из того, что лучше знает сам пользователь, и даёт ему расширяемость для создания собственного workflow.
Почему минимализм побеждает именно сейчас
Около года назад ещё можно было выдвигать аргумент о структурном преимуществе «нативных» harness'ов над всеми остальными — потому что модели изначально строились вокруг них. Однако этот аргумент со временем ослаб.
Передовые модели теперь в целом хорошо понимают терминальную (или похожую на терминал) среду для кодирования и умеют в ней действовать. Недавнее сокращение Anthropic системного промпта Claude Code на 80% — явный признак этого. Так что вопрос всё меньше касается того, насколько harness «нативен», и всё больше — того, насколько хорошо он управляет контекстом, избегая избыточности, и работает с чистыми примитивами. Моделям нужен чистый интерфейс к среде исполнения и harness, который не тратит контекст впустую.
Именно это предоставляет Pi: меньше накладных расходов на промпт и повторяющийся контекст, более дешёвые запуски, меньше лишних абстракций. Благодаря расширяемости пользователь не теряет в мощности, но получает избирательность — сложность добавляется только тогда, когда она действительно «окупается».
Локальные модели тоже быстро развиваются, и в Earendil их считают весьма перспективными. Дисциплина контекста Pi особенно ценна именно здесь. У локальных моделей обычно меньше размер контекстного окна, а prefill (предварительное заполнение контекста) может занимать много времени, поэтому сохранение стабильного префикса промпта имеет значение. Дисциплина контекста означает, что контекст не меняется без явного запроса пользователя, что позволяет избежать многоминутного повторного prefill'а. В сочетании с минимальным системным промптом и набором инструментов по умолчанию это делает Pi идеальным harness'ом для локальных моделей.
Pi демонстрирует, что способен совмещать всё сразу: быть дешевле, минималистичнее и производительнее.