Изолированная песочница для изучения того, как модели усваивают знания
Современные языковые модели обучаются сразу на всём массиве данных, поэтому крайне сложно отличить, был ли новый навык действительно усвоен в процессе обучения или просто извлечён из уже имеющихся скрытых знаний. Чтобы разобраться в этом, исследователи ограничили само обучающее распределение: собрали корпус из 88 миллиардов токенов, отфильтрованный под программу американской начальной школы, обучили на нём модели с нуля и сравнили результаты с парными контрольными моделями на неотфильтрованных данных.
LittleCurriculum — датасет
Корпус из 88 миллиардов токенов получен из FineWeb-Edu с помощью пятиступенчатого пайплайна фильтрации, ориентированного на стандарты Common Core (классы K–5). Понятия, факты и лексика, выходящие за рамки программы пятого класса, целенаправленно исключены.
LittleLearner — модели
Три масштаба (0.6B / 1.3B / 5B) обучены с нуля на LittleCurriculum: это модели, способные вести диалог, с чётко очерченной и интерпретируемой границей знаний. К каждой модели прилагается парный неотфильтрованный контроль для корректного сравнения.
Выводы: извлечение, а не усвоение
В экспериментах масштабирование, постобучение (SFT+GRPO) и in-context learning усиливают то, чему уже научил модель отобранный корпус, но ни один из этих методов заметно не улучшает результаты на задачах за пределами обучающей программы. Это указывает на то, что именно фильтр на этапе предобучения задаёт эффективный потолок возможностей модели.
Контрольные точки моделей
LittleLearner представлен в трёх масштабах (0.6B / 1.3B / 5B), каждый — с парным неотфильтрованным контролем, использующим ту же архитектуру, тот же объём токенов и тот же рецепт обучения.
Base — базовая предобученная модель.
GRPO — математические специалисты, дообученные на MathCAMPS; в ответах может проявляться склонность к математически ориентированному стилю.
Chatty — варианты, настроенные под общее диалоговое поведение.
Способности модели не выходят за рамки учебной программы
Можно ли стандартными методами вывести модель за пределы того, чему её научили на этапе предобучения? Поскольку граница знаний находится под экспериментальным контролем, на этот вопрос можно ответить достаточно чётко. В проведённых экспериментах каждое из вмешательств усиливает способности внутри заданной области, но ни одно из них заметно не улучшает результаты за её пределами.
Масштабирование
Увеличение размера модели улучшает результаты в рамках контролируемого объёма знаний и даёт скромный прирост на задачах, лежащих на той же траектории обучения, но почти не помогает на задачах, требующих более продвинутых навыков за пределами изученного материала.
Постобучение
Постобучение методом GRPO заметно повышает способности модели в пределах программы K–5, но не восстанавливает возможности за её пределами — даже при обучении на данных, выходящих за рамки этой программы.
In-context learning
In-context learning с использованием протестированных промптов не раскрывает у обученной модели LittleLearner 5B новых способностей к рассуждению за пределами программы K–5.
Чему стоит научить модель дальше
Поскольку обучающая выборка LittleLearner задана явно, изменения в поведении и представлениях модели можно напрямую связать с введёнными в неё понятиями. Три направления, которые кажутся особенно перспективными:
RL и открытие новых способностей
Априорные знания модели ограничены программой K–5, поэтому любые способности, возникающие в процессе RL-обучения, можно однозначно приписать самому процессу обучения с подкреплением. Это удобный и управляемый способ изучать, как награда порождает новые возможности модели.
Непрерывное обучение
Можно ввести в модель, например, понятие отрицательных чисел и измерить эффективность усвоения, устойчивость знаний и эффект интерференции. Или исследовать поведение модели вблизи границы знаний: отвечает ли она, отказывается от ответа или начинает галлюцинировать?
Наука об образовании
Чётко заданный объём обучающего материала позволяет напрямую сравнивать модели с детьми. Нужен ли моделям и детям схожий объём материала, чтобы освоить дроби? Совершают ли они похожие ошибки в текстовых задачах?
Свой вопрос
Известная граница знаний модели превращает практически любую идею в чистый эксперимент.
Цитирование
Ссылка на работу для цитирования:
@misc{littlelearner2026,
title={LittleLearner: Language Models Under Pedagogically-Controlled Knowledge Exposure},
author={Fanfei Li and Jana Zeller and Manuel Prada-Corral and Thaddäus Wiedemer and Prasanna Mayilvahanan and Ryan Cotterell and Wieland Brendel},
year={2026},
eprint={2608.13545},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2608.13545}
}