Оценки моделей за решение задач на рассуждение продолжают расти, а объём вычислений на токен — снижаться. GLM-5.2 набирает 99.2% на AIME 2026, задействуя около 40 миллиардов активных параметров на токен. Qwen3.5 показывает 91.3% при 17 миллиардах активных параметров. DeepSeek V4-Flash работает с 13 миллиардами активных параметров. Для сравнения: по слухам, GPT-4 в 2023 году задействовал около 280 миллиардов активных параметров и с трудом решал задачи уровня AIME. На нижнем конце спектра Qwen3.5 9B помещается в 6 ГБ видеопамяти после квантования и примерно вдвое обгоняет следующую лучшую модель до 10 млрд параметров по индексу интеллекта Artificial Analysis. Если судить только по бенчмаркам математики и кода, можно решить, что модели становятся умнее в расчёте на параметр с абсурдной скоростью.
На этих бенчмарках так и есть. Но стоит задать тем же моделям простой фактический вопрос — картина переворачивается. На SimpleQA, бенчмарке фактической памяти без использования инструментов, лидирует Gemini 2.5 Pro с результатом 53% — то есть даже лучшая доступная за деньги «память» промахивается почти в половине случаев. Компактные модели там едва заметны. Artificial Analysis фиксирует у Qwen3.5 4B и 9B частоту галлюцинаций 80–82% на бенчмарке знаний — то есть, не зная факта (а это происходит большую часть времени), модели его просто выдумывают. Спросите 9B-модель о годе рождения малоизвестного математика XIX века — получите уверенный, правдоподобный и неверный ответ. Количество параметров не упало само по себе: лаборатории целенаправленно меняют мировые знания модели на навык рассуждения.
Для чего были нужны параметры
Факты занимают место. Исследования ёмкости знаний (наиболее чистые измерения даёт серия работ «Physics of Language Models») оценивают её примерно в два бита фактического знания на параметр. Если нужна модель, которая знает год рождения каждой второстепенной фигуры из Wikipedia, население каждого голландского муниципалитета и порядок аргументов любой функции в любом npm-пакете, за это приходится платить весами — во многом именно поэтому фронтир-модели разрослись до триллионов параметров.
Рассуждение сжимается гораздо лучше, чем факты, потому что это относительно небольшой набор процедур, применяемых снова и снова: разбить задачу на части, отслеживать промежуточное состояние, проверять собственную работу, откатываться назад при неудачном шаге. Дистилляция и обучение с подкреплением на проверяемых задачах на удивление хорошо переносят эти процедуры в компактные модели. Phi-4 — модель на 14 миллиардов параметров, интенсивно обученная на синтетических данных в стиле учебников, — хороша в математике и слаба в фактических вопросах, что прямо говорит о содержимом её обучающих данных. Раньше такое сочетание выглядело как ограничение подхода с синтетическими данными. Теперь оно выглядит как цель дизайна.
У знаний, переживших этот обмен, есть определённая форма. Такие модели — универсалы: они немного знают почти обо всём и почти ничего — глубоко. Спросите такую модель о PostgreSQL — она знает, что это такое, в чём его сила и примерно как работает MVCC, но спросите, в какой версии добавили конкретную функцию планировщика, — и снова получите выдуманный факт. Именно этот слой правильно держать в весах, потому что широта — это то, что позволяет модели понять, о чём вопрос, знать, что нужно искать, и оценивать правдоподобность источника. Глубина же дёшево извлекается и дорого хранится, поэтому именно она уходит первой.
Факты устаревают, процедуры — нет
Обучение фронтир-модели занимает месяцы и стоит сотни миллионов долларов, а факты внутри неё начинают устаревать в тот же момент, как обучение завершается. API библиотек меняются, цены меняются, люди меняют работу, и половина того, во что верила модель 2024 года насчёт экосистемы JavaScript, устарела ещё до релиза модели. У каждого факта, зашитого в веса, есть срок годности, и единственный способ его обновить — новый цикл обучения.
Процедуры не устаревают. Алгебра работала одинаково в 1970 году и сейчас, так же как разбиение задачи на части или обнаружение противоречия между двумя источниками. Модель, состоящая преимущественно из процедур и лишь слегка нагруженная фактами, не стареет так, как стареет модель, перегруженная знаниями. Дата обучения имеет гораздо меньшее значение, потому что текущее состояние мира изначально не должно было храниться в весах. Похоже, это лучший аргумент в пользу всего подхода: он отделяет дорогой и медленный артефакт (обученную модель) от того, что меняется ежедневно — от актуальной картины мира.
Знания несёт harness
Если модель чего-то не знает, знать это должно что-то другое — и это «что-то» есть harness: retrieval по базе знаний, вызовы инструментов, веб-поиск, файловая система с документацией. Ранее уже отмечалось, что Rust — это harness для агентов, источник дешёвой машинно-проверяемой обратной связи. Здесь та же форма, только с другой стороны. Модель поставляет рассуждение, а всё, о чём она рассуждает, подаётся ей во время выполнения.
Такую работу агентов уже можно наблюдать в действии. Кодовому агенту не нужно помнить наизусть API-поверхность вашей зависимости, потому что он делает grep по node_modules или читает документацию перед тем, как что-либо вызвать, — и его ответ опирается на реально установленную версию, а не на ту, что доминировала в обучающих данных. Память, которая раньше была фиксированной ценой каждого прямого прохода, превратилась в поиск по требованию.
Фронтир-модель на вашей видеокарте
Если продолжить этот тренд на пару лет вперёд, получается модель с рассуждением фронтир-уровня, качеством на уровне Fable, работающая на одной потребительской видеокарте. Вычислительная половина этой картины уже почти достигнута. DeepSeek V4-Flash рассуждает при помощи примерно 13 миллиардов активных параметров на токен — это вполне укладывается в диапазон потребительских GPU. Не укладываются остальные 271 миллиард параметров, распределённые по её экспертам, а экспертные слои — это в основном хранилище фактов. Именно эту часть весь этот обмен делает необязательной. Уберите знания — и общий размер сжимается к размеру активных параметров, а модель на 20–40 млрд параметров в 4-битном квантовании помещается на 24 ГБ карту, которая с 2022 года стоит в игровых ПК.
Загвоздка в том, что такая модель мало что будет знать. Задайте ей голый фактический вопрос без инструментов — и правильное поведение модели заключается в том, чтобы сказать «не знаю» и пойти искать ответ. В паре с приличным harness'ом это покрывает большую часть того, для чего сегодня используется фронтир-модель — запущенная локально, без оплаты за токены и без утечки данных с машины.
Это почти полностью решает проблему галлюцинаций
Самая многообещающая часть этого подхода — то, что он делает с галлюцинациями. Когда факт живёт в весах, неверный факт невозможно найти и невозможно исправить. Веса нельзя прогрепать, их нельзя сравнить с прошлым месяцем через diff, а исправление одной ошибки означает дообучение, которое может сломать неизвестно что ещё. Модель озвучивает неверный факт с той же беглой уверенностью, что и верный, и нет никакого артефакта, с которым можно было бы сверить ответ.
Когда факт живёт вне модели, у неверного ответа появляется адрес. Модель ссылается на документ — можно открыть этот документ. Если документ неверен, его можно отредактировать, и каждый будущий запрос получит исправление, что значительно быстрее ожидания следующего цикла обучения — разница примерно в год. Retrieval не даёт нулевой ошибки: модель всё ещё может неправильно прочитать источник или неверно сшить два источника вместе, — но утверждение с источником проверяемо, а утверждение из весов — нет. Неверный факт в базе знаний — это обычный баг данных, тот тип, который уже умеют отслеживать, исправлять и покрывать регрессионным тестом.
Возможно, в будущем карточка модели вообще перестанет указывать дату обучения, потому что то немногое, что останется в весах, будет устаревать не за недели, а за годы. Модели просто будут передавать текущее состояние мира во время выполнения — точно так же, как процессору передают программу.