Прогресс больших языковых моделей обычно измеряют по тому, что теперь умеет лучшая модель из тех, что раньше не умел никто. Именно это направление попадает в заголовки, и результаты действительно впечатляющие: каждый новый шаг на верхней границе диапазона открывает модели доступ к задачам, которые раньше были недостижимы — от исправления бага, затрагивающего всю кодовую базу, до продвижения в решении нерешённых математических задач.

Есть и второе направление прогресса, о котором говорят меньше: насколько дёшево можно купить заданный уровень возможностей. Значительная часть полезной работы не требует самой умной модели из доступных — достаточно модели «достаточно хорошей», применённой много тысяч раз. Прочитать все научные статьи по теме, проверить каждый контракт в архиве на наличие определённого пункта, суммировать каждую ветку на крупном форуме — задачи именно такого рода. Здесь вопрос не в том, существует ли модель, способная справиться с задачей, а в том, может ли она сделать это десять тысяч раз в рамках бюджета. Потолок открывает новые виды задач; пол открывает объём.

При выборе модели для приложения приходится выбирать между возможностями и стоимостью каждого вызова. Для агентного кодирования внимание почти полностью сосредоточено на возможностях — исходя из ощущения, что более высокое качество работы стоит денег, даже когда существуют гораздо более дешёвые модели с приемлемыми возможностями. Внимание недавно привлекла именно стоимость нижнего порога. В одном из проектов измеряется, как часто наборы данных, опубликованные в архиве DANDI, повторно используются в последующих публикациях, а это означает прочтение порядка десяти тысяч статей-кандидатов с помощью модели и проверку по каждой — действительно ли данные были переиспользованы. По сегодняшним ценам полный проход по корпусу с моделью, чьи возможности были на переднем крае весной, стоит чуть больше ста долларов. По ценам этого марта тот же проход с тем же уровнем возможностей обошёлся бы в несколько тысяч долларов, а год назад такой уровень возможностей не был доступен ни за какие деньги. Именно изменение нижнего порога превратило анализ из того, что можно было сделать на выборке, в реализуемый проект. Прогресс по всему ценовому спектру оказался неожиданным — особенно то, насколько интеллектуальными стали дешёвые модели.

Artificial Analysis уже пару лет тестирует интеллект и цену сотен моделей, и часть этих данных доступна для реконструкции компромисса между ними. В частности, этот график показывает индекс интеллекта в сравнении со стоимостью за задачу, давая реалистичную оценку цены для разных уровней возможностей модели. Верхняя линия — это то, что там называют «линией Парето»: самые способные модели при заданной цене. Эта линия описывает истинную границу возможностей LLM. Данные с artificialanalysis.ai были собраны, чтобы посмотреть, как граница Парето смещалась по мере выхода новых моделей — и стоит остановиться на этом прогрессе и сделать несколько прогнозов на ближайшие месяцы.

Коротко: уровень интеллекта, который в феврале стоил $1,22 за задачу, сегодня стоит $0,022 — падение в 56 раз менее чем за полгода, причём темп падения ускоряется. При измеренных темпах падение в 100 раз для заданного уровня возможностей занимает около года, и вопрос не в том, произойдёт ли это, а в том, что это изменит.

Индекс интеллекта Artificial Analysis

Ось возможностей на протяжении всего материала — это индекс интеллекта Artificial Analysis, поэтому стоит пояснить, что это за число. Текущая версия, v4.1.1, представляет собой взвешенное среднее по девяти оценкам, сгруппированным в четыре категории: агентные задачи — 34%, программирование — 24%, научное рассуждение — 24% и общие возможности — 18%. Эти веса отражают, куда направлено внимание отрасли: треть оценки формируется способностью модели выполнять многошаговую агентную работу, а не отвечать на экзаменационные вопросы. Компонентные оценки, их веса и детали подсчёта задокументированы в методологии тестирования интеллекта Artificial Analysis.

В итоге получается одно число, представляющее возможности модели — что-то вроде IQ для LLM. Оно не идеально, и две модели с одинаковым баллом могут иметь разные сильные стороны, но на практике этот показатель достаточно хорошо отражает возможности модели.

Для ориентира: «Claude 4.5 Sonnet (Reasoning)» от Anthropic стал для многих первой моделью, которая ощущалась достаточно способной для использования в агентной среде для написания кода. На тот момент использовался Cline, и эта модель давала существенный прирост продуктивности по сравнению с авто-дополнением и копированием кода вручную. У этой модели индекс интеллекта составлял 37,4 (по нынешней системе оценки). Топовая модель на сегодня — Claude Opus 5 в режиме максимальных усилий, с индексом 63,1.

Чтобы дать более наглядное представление о том, что означают разные уровни индекса, был использован пеликаний бенчмарк Саймона Уиллисона: модели дают промпт «Сгенерируй SVG пеликана, едущего на велосипеде» и смотрят, что получится. Это не то, что измеряет индекс, но задача, которую любой может оценить на глаз. Ниже — семейство GPT-5.6 в четырёх точках индекса: Luna с низким, высоким и экстра-высоким уровнем усилий, и Sol с максимальными усилиями. Для каждой модели было сгенерировано по три образца, показан первый; все они доступны в репозитории сайта.

SVG пеликана на велосипеде, сгенерированный GPT-5.6 Luna при низких усилиях
Индекс 33.9
GPT-5.6 Luna (low)
SVG пеликана на велосипеде, сгенерированный GPT-5.6 Luna при высоких усилиях
Индекс 47.0
GPT-5.6 Luna (high)
SVG пеликана на велосипеде, сгенерированный GPT-5.6 Luna при экстра-высоких усилиях
Индекс 50.1
GPT-5.6 Luna (xhigh)
SVG пеликана на велосипеде, сгенерированный GPT-5.6 Sol при максимальных усилиях
Индекс 60.9
GPT-5.6 Sol (max)
Первый из трёх образцов от каждой модели по промпту «Сгенерируй SVG пеликана, едущего на велосипеде», сгенерировано через OpenRouter 20 августа 2026 года. Значения индекса интеллекта — от Artificial Analysis.

Прогресс заметен: больше деталей, лучшие пропорции, и пеликан, который явно едет на велосипеде, а не парит над ним.

Измерение стоимости за задачу

Стоимость за токен легко доступна, но разные модели могут использовать сильно различающееся число токенов, поэтому для корректной оценки стоимости модели нужно учитывать это. Стоимость за задачу — собственный измеренный показатель Artificial Analysis: средняя стоимость в долларах для выполнения одной задачи из набора оценок индекса интеллекта, включая входные, «рассуждающие» и ответные токены, реально учтённые при запуске. Сайт показывает это значение, но бесплатный уровень API его не включает, поэтому данные были собраны напрямую со страниц моделей на сайте — как для моделей, которые тестируются сейчас, так и для снятых с тестирования моделей, чьи страницы всё ещё содержат эти замеры (более старые версии Claude Opus и Sonnet, линейка GPT-5.x и другие). В итоге получены измеренные значения стоимости для 137 моделей начиная с DeepSeek V3 в декабре 2024 года, каждая — с датой релиза и баллом индекса интеллекта по текущей шкале.

Как двигалась граница

Графики в этом разделе — срез на 19 августа 2026 года, дату написания материала. Живая версия обоих графиков и таблицы уровней, обновляемая каждую неделю из того же источника, доступна на дашборде LLM Cost Frontier.

График ниже отображает индекс интеллекта в сравнении с измеренной стоимостью за задачу и прослеживает границу Парето — самый дешёвый способ достичь каждого уровня интеллекта — в её текущем состоянии и в состоянии на двухмесячных интервалах за последний год, используя дату релиза каждой модели для реконструкции того, что было доступно на тот момент. График строит границы по одной, затем задерживается на полной картине и повторяет цикл; кнопка позволяет остановить анимацию. При наведении на точку показываются детали модели.

Индекс интеллекта в сравнении с измеренной стоимостью за задачу индекса интеллекта (логарифмическая шкала). Маленькие точки — все 137 измеренных моделей по последней измеренной стоимости, окрашенные по двухмесячному окну релиза (модели до августа 2025 года сгруппированы с окном августа 2025). Полые точки, как маленькие, так и крупные, — модели с открытыми весами; закрашенные — проприетарные. При наведении на точку показываются детали, включая то, снята ли модель Artificial Analysis с активного тестирования. Каждая линия прослеживает самый дешёвый способ достичь заданного индекса интеллекта среди моделей, выпущенных к дате среза; маркеры — сами модели границы. Там, где последовательные границы совпадают на участке, более старая линия рисуется поверх, поэтому новая линия видна только там, где граница реально сдвинулась. Модели, чьи страницы больше не содержат измеренной стоимости (в их числе o3 и GPT-5.3 Codex), отсутствуют на графике (см. оговорки).

Каждая последующая граница располагается выше и левее предыдущей: больше интеллекта за ту же цену или тот же интеллект за меньшие деньги. Темп этого движения ускоряется. Во второй половине 2025 года граница смещалась медленно: всего два небольших скачка между августом и октябрём, и один — между октябрём и декабрём. Февральская и апрельская границы сдвинули значительную часть кривой, а последние два среза почти полностью заменили границу: десять из одиннадцати июньских моделей-границ появились после апреля, а пятнадцать из шестнадцати сегодняшних — после июня.

Правый край рассказывает историю возможностей. Потолок границы вырос с индекса 35,3 в августе 2025 года (GPT-5 за $0,26 за задачу) до 37,4 в октябре (Claude 4.5 Sonnet), 48,4 в феврале (Claude Sonnet 4.6), 55,0 в апреле (Claude Opus 4.7 за $2,23), 62,1 в июне (Claude Fable 5 за $3,14) и 63,1 сегодня (Claude Opus 5 за $2,34) — двадцать восемь пунктов индекса интеллекта за год. Левая половина показывает рост интеллекта дешёвых моделей. На 19 августа 2026 года лестница усилий GPT-5.6 Luna занимает почти всё пространство ниже индекса 52, а уровень, который был потолком в августе 2025 года, доступен за $0,0088 за задачу. Июньская граница 2026 года была необычно насыщена моделями с открытыми весами: шесть из одиннадцати моделей были открытыми (среди них MiMo-V2.5, DeepSeek V4 Pro, MiniMax-M3 и GLM-5.2), и они заняли всю середину диапазона от индекса 38 до 53. В более ранних срезах открытые модели появлялись только в нижней части диапазона, а сегодня, после выпуска GPT-5.6 Luna, лишь две из шестнадцати моделей границы — открытые.

Стоит отметить, что одна модель может покрывать значительную часть этого диапазона за счёт разных уровней рассуждения: лестница GPT-5.6 Luna идёт от $0,0088 при низких усилиях до $0,047 при максимальных и покрывает всю нижнюю половину границы, а Claude Opus 5 охватывает диапазон от $0,43 при низких усилиях до $2,34 при максимальных, добавляя по пути около десяти пунктов индекса интеллекта. Уровень усилий теперь ключевой параметр компромисса между стоимостью и интеллектом, и как следствие, цена и интеллект неразрывно связаны.

График рекордов ниже отслеживает самую низкую измеренную стоимость за задачу, достигнутую любой выпущенной моделью на заданном уровне индекса интеллекта или выше. Ряд данных начинается с середины 2025 года для нижних уровней, а более высокие уровни появляются по мере их достижения.

Каждая ступень — выпущенная модель, установившая новый минимум для своего уровня; полые маркеры — модели с открытыми весами, закрашенные — проприетарные. Линия уровня начинается, когда первая модель с измеренной стоимостью пересекает соответствующий порог индекса интеллекта. GPT-5.6 Luna отображена по цене запуска с 9 июля и по текущей цене после снижения 30 июля; все остальные цены отражают текущие значения (см. оговорки).
УровеньПервое измеренное достижениеПадение ценыВремя удвоения
Индекс ≥ 30Авг 2025 (GPT-5 high)29x~73 дня
Индекс ≥ 40Фев 2026 (Claude Sonnet 4.6)56x~28 дней
Индекс ≥ 50Мар 2026 (GPT-5.4 xhigh)35x~29 дней
Индекс ≥ 60Июн 2026 (Claude Fable 5 max)3.8x~34 дня

Уровень возможностей сначала достигается крупной моделью-границей по премиальной цене. Спустя некоторое время появляются более дешёвые модели с теми же возможностями, и рекорд снижается на порядок или больше. Уровень ≥ 40 открывается Claude Sonnet 4.6 в феврале по $1,22 за задачу, всего через два дня его подрезает Gemini 3.1 Pro Preview за $0,33; MiMo-V2.5-Pro, модель с открытыми весами, снижает рекорд до $0,034 в апреле, а GPT-5.6 Luna при высоких усилиях удерживает его на уровне $0,022 сегодня. Уровень ≥ 50 повторяет ту же дугу с отставанием на месяц: GPT-5.4 пересекла его в марте за $1,10, GPT-5.5, а затем GLM-5.2 и Grok 4.5 понижали рекорд в течение весны, режим xhigh GPT-5.6 Luna забрал рекорд за $0,16 при запуске 9 июля, а снижение цены OpenAI на 80% 30 июля довело его до $0,032 — падение в 35 раз за пять месяцев.

Первое достижение уровня — это модель-граница с максимальными усилиями по премиальной цене запуска, чаще всего от Anthropic или OpenAI. После этого небольшие дистиллированные модели крупных лабораторий (линейка GPT-5.6 Luna держит три из четырёх текущих рекордов) и релизы с открытыми весами (MiMo, DeepSeek V4, GLM, Hy3) резко снижают цены. По уровням, для которых накоплено достаточно истории для измерения, рекорды падают вдвое примерно каждые четыре-десять недель.

Верхний уровень — там, где премия ещё сохраняется. Только шесть моделей набирают 60 баллов и выше, и самая дешёвая из них, Grok 4.6, всё ещё стоит $0,84 за задачу. Но этот рекорд упал в 3,8 раза с июня, и если закономерность нижних уровней сохранится, дистиллированная модель этого уровня должна обвалить цену в течение пары кварталов.

Наиболее впечатляющий результат — низкая цена «GPT-5.6 Luna» от OpenAI при её уровне интеллекта. Уровень интеллекта «Claude 4.5 Sonnet (Reasoning)» от Anthropic, который 10 месяцев назад запустил революцию агентных сред для кодирования, сегодня доступен через «GPT-5.6 Luna (medium)» за 1/40 стоимости! Эта цифра зависит от снижения цены 30 июля; по цене запуска Luna тремя неделями ранее она составила бы 1/8.

Оговорки

Самое важное ограничение: цены — это последние измеренные значения, привязанные к дате релиза, а не исторические замеры на момент выхода модели. Цены снижаются в течение жизни модели, поэтому ранние точки отражают все снижения с момента запуска, что смещает анализ в сторону занижения масштаба падения и слишком раннего датирования этого падения. Единственное снижение цены, которое было скорректировано — самое крупное недавнее: OpenAI снизила цены на GPT-5.6 Luna на 80% 30 июля 2026 года, через три недели после релиза 9 июля (Terra была снижена на 20% в тот же день, Sol осталась без изменений). Поскольку снижение цены не меняет количество токенов, используемых в задаче, цена Luna на момент запуска была реконструирована путём масштабирования измеренного значения по коэффициенту цены, и на графике рекордов и в таблице рекорды Luna датированы моментом снижения цены, а не релизом. Это удлиняет измеренное время удвоения для трёх нижних уровней на несколько дней каждое. У других моделей могли быть снижения цен, которые не были обнаружены, а последняя измеренная цена снятой с тестирования модели может не совпадать с ценой запуска. Второй вопрос — покрытие данных. Снятые с тестирования модели включены только там, где их страницы всё ещё содержат замеры, что дало данные по 44 из 228 таких моделей с ценами и баллами; остальные — o3, GPT-5.3 Codex и всё поколение GPT-4 среди них — невидимы, поэтому самые старые границы опираются на меньшее число моделей, чем существовало на самом деле, а истинная стартовая цена нижних уровней, вероятно, была задана моделями, недоступными для этого анализа.

Баллы индекса интеллекта снятых с тестирования моделей приведены по текущей шкале, но сам индекс — это агрегат множества оценок. А стоимость за задачу в наборе оценок — это нагрузка, требующая интенсивных рассуждений с длинными промптами; нагрузка чата с короткими промптами и короткими ответами масштабировалась бы иначе для разных моделей, особенно между вариантами с рассуждениями и без них.

Прогнозы

Экстраполяция измеренных темпов рискованна, поскольку каждый обвал цены — это событие конкуренции, а не закон природы, но дуги падения были достаточно регулярными, чтобы поставить на них числа. При нынешнем времени удвоения около 34 дней для уровня ≥ 60 рекорд Grok 4.6 в $0,84 опустится ниже десяти центов примерно к началу декабря. Индекс 55, который сегодня держит Grok 4.5 за $0,36, должен стоить менее гривенника к середине октября. Потолок предсказать сложнее: он вырос на двадцать восемь пунктов за год, но всего на один пункт с июня, что скорее говорит о насыщении текущего индекса, а не о замедлении моделей, поэтому следующей вехой здесь, вероятно, станет пересмотр самого индекса, а не крупное число. И если закономерность последних четырёх уровней сохранится, что бы ни назвал границей пересмотренный индекс, дебютирует это по цене в несколько долларов за задачу и станет товаром широкого потребления в течение квартала.

Два направления прогресса

Два направления прогресса служат разным видам работы. Более высокий потолок меняет то, что вообще возможно: задачи, которые ни одна модель не могла выполнить год назад, а сейчас одна модель может. Более низкий пол меняет то, что доступно по цене в масштабе: задачи, которые одна модель уже могла выполнить, но не десять тысяч раз подряд. Сканирование литературы, послужившее поводом для этого материала — как раз проблема пола. Модели нужно всего лишь прочитать статью и ответить на чётко сформулированный вопрос — с этим уверенно справляются модели значительно ниже нынешней границы, но делать это нужно для каждой статьи-кандидата, а разница между $1 и $0,02 за статью — это разница между пилотным исследованием и полной переписью. Юридический due diligence, систематические обзоры, курирование данных большого масштаба, модерация контента и сортировка обращений в поддержку имеют ту же форму, и все они дешевеют на порядок примерно каждые несколько месяцев без изменения самой работы. Практическое следствие в том, что набор задач, которые стоит пытаться решить с помощью модели, расширяется сразу с обоих концов, и расширение на дешёвом конце легко упустить из виду.

Более дешёвый интеллект означает больше трат на него

Естественное прочтение этих графиков — что траты на LLM должны падать. Происходит обратное. В 1865 году Уильям Стэнли Джевонс заметил, что более эффективные паровые машины, требующие меньше угля на единицу работы, увеличили общее потребление угля в Британии вместо того, чтобы его снизить, потому что подешевевшая работа нашла гораздо больше применений. Та же динамика проявляется, когда стоимость единицы интеллекта падает в 30 раз. Работа, которая уже выполнялась, дешевеет, но гораздо более значимый эффект — та работа, которая вообще не выполнялась, потому что не проходила по бюджету. Это явление получило название парадокса Джевонса. Сканирование литературы — небольшой пример: по прошлогодним ценам его запустили бы один раз на выборке, если бы вообще запустили, а по нынешним ценам его прогоняют на всём корпусе, повторяют при изменении пайплайна и планируют трижды перепроверять каждый положительный результат для снижения шума. Стоимость за статью упала более чем на порядок, а общие траты на проект выросли. Спрос на интеллект при заданной цене оказывается высокоэластичным, и пока это так, падающая граница цены превращается в потребление большего числа токенов, а не в меньшие траты в долларах.

Движение границы предсказуемее любого отдельного релиза. Каждый уровень возможностей до сих пор проходил один и тот же путь: премиальный дебют, быстрая коммодитизация, устоявшийся рекорд, который держит дистиллированная модель или модель с открытыми весами по цене в несколько процентов от цены дебюта. Если возможность существует сегодня хоть по какой-то цене, разумное плановое допущение — что она станет доступна по цене товара широкого потребления в течение нескольких месяцев. Для проектирования систем это аргумент в пользу архитектур, где модель — заменяемый компонент, а маршрутизация между уровнями возможностей явно прописана, поскольку сами границы уровней ещё не устоялись и не показывают признаков скорой стабилизации.

Появляющиеся на рынке роутеры моделей — признак того, что это уже реализуется на практике. OpenRouter теперь предлагает роутер, который принимает минимальный порог возможностей и направляет каждый запрос к самой дешёвой модели на границе Парето Artificial Analysis, преодолевающей этот порог, так что система автоматически выигрывает от движущейся границы без необходимости отслеживать её вручную. Жёстко прописывать название модели в приложении стало самым быстрым способом переплатить.

Что меняется при падении в 100 раз

Если темп последнего года сохранится, возможности, которые в начале 2026 года стоили доллар за задачу, к концу года будут стоить цент, а модели с индексом 60, стоящие сегодня несколько долларов за задачу, окажутся дешевле десяти центов в течение пары кварталов. Не стоит переоценивать выводы из данных всего одного года, но несколько следствий вытекают из чисел напрямую.

Чтение всего подряд становится нормой по умолчанию. При цене в цент за документ модель может как рутинную операцию прочитать каждую статью в области, каждую запись в архиве, каждое письмо или каждое сообщение в очереди поддержки, и вопрос смещается с того, какие документы смотреть, на то, какие вопросы задавать по всем ним сразу. Проекты вроде переписи повторного использования данных перестают быть проектами и становятся мониторингом: сканирование может запускаться на каждой новой публикации по мере её появления. Многопроходные рабочие процессы становятся нормой, поскольку выполнение задачи трижды с последующим консенсусом стоит дешевле, чем выполнение её один раз стоило несколько месяцев назад, а прирост точности от этого значителен. И сами уровни возможностей перестают быть осмысленным способом описания системы, потому что пайплайн будет направлять каждый шаг к тому уровню интеллекта, который нужен, по той цене, которая действует на этой неделе. Дефицитным ресурсом в этом мире становится не интеллект, а суждение о том, куда его направить, эталонные данные для проверки результата и системы для запуска этого в масштабе. Именно эти части работы не дешевеют.