Текст написан спустя несколько дней после того, как OpenAI объявила о решении десяти крупных проблем в математике и теоретической информатике, включая первое построение несофической группы и доказательство того, что многоцветное число Рамсея
(где
— число троек) растёт супер-экспоненциально по
. Судя по многочисленным докладам, первая из этих проблем считалась одной из важнейших нерешённых задач теории групп, а вторая — крупной открытой проблемой теории Рамсея, решения которой не обязательно ожидали увидеть при жизни нынешнего поколения математиков. Впрочем, такие ожидания теперь придётся пересматривать.
Важно оговорить момент написания: обсуждение текущих возможностей LLM ведётся с полным пониманием того, что ситуация будет быстро меняться. Поэтому вероятно, что уже совсем скоро эти наблюдения будут представлять интерес главным образом как фиксация того, как выглядела картина в начале августа 2026 года.
Эти результаты, как и остальные восемь из списка, поразительны, но пока не создаётся впечатление, что LLM превосходят всех людей во всех аспектах математики. Если бы это было так, то их огромное преимущество в скорости привело бы к настоящему потоку результатов. Поэтому естественно задаться вопросом: в каких задачах языковые модели действительно сильны, и где ещё остаётся пространство для роста? Чёткой классификации, которая аккуратно объясняла бы все текущие примеры, пока нет, но полезно попробовать отбросить некоторые неудачные гипотезы и наметить те, что хотя бы не противоречат имеющимся данным явно.
Особенно хороши ли LLM в поиске контрпримеров?
Первое замечание: LLM не просто хороши в поиске контрпримеров — они умеют находить и доказательства сложных утверждений. Однако примечательно, что самые известные решённые ими задачи почти всегда оказывались именно контрпримерами, а не доказательствами теорем. Это верно и для двух упомянутых выше проблем, и для гипотезы Якобиана, и для гипотезы о единичных расстояниях.
Если выдвигать теорию о том, что LLM особенно сильны в поиске контрпримеров, стоит сделать две вещи, чтобы теория звучала убедительнее. Первая, на первый взгляд простая задача — определить, когда решение задачи действительно считается нахождением контрпримера. Вторая, после того как это прояснено — предложить объяснение, почему LLM должны быть особенно приспособлены к решению задач именно такого типа.
Что значит найти контрпример?
Почему стоит усомниться, что смысл понятия "контрпример" очевиден? Казалось бы, всё просто: есть утверждение вида "каждый объект такого-то типа обладает таким-то свойством", и вы предъявляете объект данного типа, который этим свойством не обладает.
Однако это работает не всегда. Рассмотрим известный результат Виноградова: каждое достаточно большое натуральное число представимо в виде суммы трёх простых чисел. Отрицание этого утверждения эквивалентно следующему: для каждого натурального
существует целое
, такое что
не представимо суммой трёх простых. Иными словами — каждое натуральное число
обладает некоторым свойством. С этой точки зрения, Виноградов нашёл пример натурального числа
, которое не обладает заданным свойством. Стоит ли говорить, что Виноградов нашёл контрпример? Очевидно нет — результат должен быть классифицирован как теорема, а не как контрпример.
Таким образом, нельзя наивно утверждать, что LLM особенно хороши в отрицании универсально квантифицированных утверждений: важна именно природа этой квантификации. В примере с тремя простыми ясно, что Виноградов не думал: "Как мне найти
с этим свойством?" Скорее он размышлял примерно так: "У меня есть очень большое число
. Как показать, что оно представимо суммой трёх простых?" То есть всё внимание было сосредоточено на универсально квантифицированной переменной
, а экзистенциально квантифицированное
было скорее побочным следствием, всплывающим уже после того, как детали доказательства были продуманы.
Вообще, многие интересные результаты, если их формализовать, начинаются с чередования двух или трёх (или более) кванторов. Тогда вопрос сводится к тому, какая квантифицированная переменная "интересна" в первую очередь. Вот ещё один пример из теории конечномерных нормированных пространств. Приведём немного математических деталей для интересующихся, но если это неважно — следующие три абзаца можно пропустить, суть аргумента будет понятна и без них.
Пусть
и
— два
-мерных нормированных пространства, а
— линейное отображение из
в
. Говорят, что
является
-изоморфизмом, если существует
такое, что
для каждого
. Перемасштабированием всегда можно взять
равной 1, тогда
для каждого
. Если
, то
— изометрия. В общем случае расстояние Банаха-Мазура
между
и
определяется как наименьшее
, для которого существует
-изоморфизм из
в
. Легко показать, что логарифм расстояния Банаха-Мазура является метрикой на множестве классов изометрии
-мерных нормированных пространств. Менее очевидный, но всё же не слишком сложный факт: полученное метрическое пространство компактно — оно известно как компакт Банаха-Мазура.
Естественно задаться вопросом о диаметре компакта Банаха-Мазура, и здесь начинается самое интересное. Результат Фрица Джона утверждает, что любое
-мерное пространство
находится на расстоянии не более
от
. (Идея доказательства такая: выбираем внутри единичного шара
-мерный эллипсоид максимального объёма; он является единичным шаром пространства
, изометричного
; можно показать, что тождественное отображение является
-изоморфизмом между
и
.) Из теоремы Фрица Джона и (мультипликативного) неравенства треугольника следует, что
для любых двух
-мерных нормированных пространств. То есть диаметр компакта Банаха-Мазура не превышает
. Но может ли он быть заметно меньше?
Признак того, что ответ неочевиден, даёт рассмотрение пространств
и
. Тождественное отображение между этими двумя пространствами является
-изоморфизмом, но можно добиться намного лучшего результата, отображая базисные векторы не в самих себя, а в вершины единичного куба, выбранные максимально ортогональными друг к другу. В частности, если существует
матрица Адамара, то соответствующее линейное отображение является
-изоморфизмом. Развивая это наблюдение, можно показать, что для любых
расстояние Банаха-Мазура между
и
составляет
. Также легко показать, что
, так что
-пространства едва улучшают простую нижнюю оценку, а в размерностях
, для которых существует матрица Адамара, вообще не улучшают её.
В 1981 году Глускин решил эту проблему, определив верную асимптотику диаметра компакта Банаха-Мазура. Неформально: он показал, что диаметр отличается от верхней оценки, следующей непосредственно из теоремы Фрица Джона, лишь на константу. Если явно записать квантификацию, получившееся утверждение выглядит так:
,
где
обозначает множество всех
-мерных нормированных пространств. (Если возразить, что это не множество, добавим уточнение: лежащее в основе векторное пространство —
.) Словами: существует положительная константа
такая, что для каждого натурального
существуют
-мерные нормированные пространства
и
, для которых расстояние Банаха-Мазура составляет не менее
.
Нельзя не упомянуть кратко красивую и весьма влиятельную идею, которую Глускин применил для решения этой задачи. Он взял
и
как нормированные пространства, единичные шары которых были случайными симметричными выпуклыми множествами, построенными так: берутся стандартные базисные векторы и небольшое количество других случайных единичных векторов, а также противоположные им, и строится их выпуклая оболочка. Глускин показал, что если два нормированных пространства выбраны из этого распределения, то с высокой вероятностью расстояние Банаха-Мазура между ними составляет не менее
.
Но вернёмся к главной мысли: логическая форма приведённого выше утверждения очень похожа на логическую форму теоремы Виноградова, которая выглядит так:

где
обозначает множество простых чисел. И тем не менее теорема Виноградова безусловно является теоремой, а результат Глускина безусловно контрпримером — или, по крайней мере, примером.
В чём же существенная разница между этими двумя утверждениями? Похоже, в том, что в теореме Виноградова число
играет более существенную роль в доказываемом утверждении относительно различных квантифицированных переменных. В теореме Виноградова это утверждение —
, тогда как в теореме Глускина утверждение выглядит так:
и
,
что можно эквивалентно записать так:
и
.
В случае теоремы Виноградова весь вызов заключается в том, чтобы три простых числа в сумме дали
, тогда как для Глускина совсем не сложно добиться, чтобы размерности
и
равнялись
: сложность заключается в том, чтобы сделать
и
максимально далёкими друг от друга относительно их общей размерности.
Есть и дополнительная сложность, о которой стоит помнить: с помощью процесса, известного как сколемизация, универсально квантифицированное утверждение вида
можно преобразовать в экзистенциально квантифицированное утверждение
. (Для полной эквивалентности требуется аксиома выбора, но для достаточности она не нужна.) Это не просто логическая хитрость: подобный переход часто довольно точно отражает то, как мы думаем о некоторых задачах. Например, естественнее воспринимать пример Глускина как рецепт построения (или хотя бы доказательства существования) подходящей пары нормированных пространств для любой заданной размерности
, то есть как построение подходящей функции из
в пары нормированных пространств, задающей значение при каждом
, чем как утверждение о том, что каждое натуральное число
обладает некоторым сложным свойством.
Ещё одна сложность заключается в том, что некоторые универсально квантифицированные утверждения естественным образом следуют из экзистенциально квантифицированных, а иногда и вовсе эквивалентны им. Например, теорема о том, что двумерный тор не гомеоморфен двумерной сфере — это универсально квантифицированное утверждение (любое отображение тора в сферу не является гомеоморфизмом), но естественный способ доказать её — доказать экзистенциальное утверждение о существовании инварианта, различающего эти два пространства. Пример, где универсальное утверждение эквивалентно экзистенциальному: рассмотрим утверждение о том, что вектор
не принадлежит выпуклой оболочке некоторого компактного множества
. Утверждение о том, что никакая выпуклая комбинация элементов
не равна
, эквивалентно существованию линейного функционала
и
таких, что
и
для каждого
. В обоих случаях естественно воспринимать результат как теорему, доказанную через экзистенциальное утверждение, — возможно потому, что именно теорема в итоге и интересует нас. Но использовать "то, что нас интересует" как критерий для определения контрпримера кажется слишком расплывчатым и малопригодным, если мы хотим убедительно объяснить, почему ИИ должен быть особенно хорош именно в поиске контрпримеров.
Более общий аргумент против идеи о том, что экзистенциальные утверждения особенно подходят для ИИ, состоит в том, что необходимость устанавливать экзистенциальные утверждения пронизывает почти всё математическое исследование, независимо от природы итогового результата. Например, при доказательстве по индукции часто ищут усиление утверждения, которое лучше подходит в роли индуктивного предположения. Или, желая доказать, что каждый объект типа
со свойством
обладает также свойством
, ищут промежуточное свойство
, которое следует из
и с помощью которого можно доказать
. Это скорее метаматематические задачи существования, и граница здесь может быть размыта, но важнее другое: при попытке доказать утверждение
главный вопрос часто не "почему
истинно?", а "каким может быть доказательство
?" Например, довольно хорошо понятно, почему гипотеза Гольдбаха верна — весьма правдоподобная вероятностная модель простых чисел подтверждает её и хорошо согласуется с вычислительными данными — но при серьёзной попытке её доказать это понимание, которым многие математики обладали уже около века, помогло бы мало. Основная задача заключалась бы в поиске техник доказательства, достаточно мощных, чтобы сделать эти эвристические идеи строгими.
В чём разница между примером и контрпримером?
Логически, любое утверждение вида
является контрпримером к универсально квантифицированному утверждению
. Однако не все экзистенциальные утверждения принято называть контрпримерами. Например, если сказать: "
-пространства с
все сепарабельны, как и
, но
не сепарабельно" — вторую часть этого утверждения назвали бы вовсе не контрпримером к тезису о том, что все банаховы пространства сепарабельны. Скорее это назвали бы, вероятно, самым простым примером несепарабельного пространства. Важный момент здесь в том, что не было особых причин полагать, что все банаховы пространства сепарабельны, и найти пример несепарабельного пространства не так уж трудно.
Первый пункт кажется более важным: объект чаще называют контрпримером, если его существование опровергает утверждение, в истинность которого были достаточно веские основания верить. Часто бывает, что после многих неудачных попыток доказать утверждение математики начинают ощущать, что оно не имеет особых оснований быть верным, даже если контрпример найти всё равно трудно. В такой ситуации, если контрпример в конце концов находится, он может отчасти утратить свой "контр-" оттенок. Похоже, что построение несофической группы попадает именно в эту категорию. В литературе было несколько предложений о том, как можно было бы построить такую группу, и вряд ли было много (или хотя бы сколько-нибудь) экспертов, твёрдо верящих, что все группы софичны. Поэтому естественнее сказать: "OpenAI построила первый пример несофической группы", а не "OpenAI нашла контрпример к гипотезе о софичности" (хотя соответствующий раздел их статьи и назван именно "Контрпример к гипотезе о софичности").
Аналогично, новая нижняя оценка для многоцветных чисел Рамсея представляется скорее примером, чем контрпримером. Довольно многие полагали, что эта оценка должна быть экспоненциальной, и для них это стало контрпримером, но для других — включая автора этого разбора — отношение было более нейтральным. Приходилось в прошлом (давно) работать над этой задачей в эквивалентной формулировке: сколько треугольник-свободных графов на
вершинах нужно, чтобы их объединение дало полный граф
. Если брать двудольные графы, легко показать, что нужно
штук, но эту оценку можно улучшить, заметив, что полный 5-дольный граф можно записать как объединение двух треугольник-свободных подграфов, а значит полный граф можно записать как объединение
треугольник-свободных графов. Затем возникает искушение пойти дальше, используя менее плотные треугольник-свободные графы, но с неограниченным хроматическим числом — необходимое условие для использования сублогарифмического числа графов, что эквивалентно доказательству супер-экспоненциальной нижней оценки для
. Всё это говорит о том, что работа над этой задачей была сосредоточена в направлении, которое в итоге оказалось верным, так что для автора этого разбора решение OpenAI стало примером того, чего он (со сдержанной уверенностью) и ожидал, а не контрпримером.
К чему это приводит
Хотелось бы найти согласованное объяснение совокупности следующих фактов.
- Самые заметные математические результаты, полученные LLM, в основном относятся к категории примеров или контрпримеров, где контрпримеры — это, грубо говоря, утверждения о существовании, опровергающие то, что ожидалось быть истинным.
- Многие утверждения можно сформулировать как утверждения о существовании там, где обычно их считают универсальными утверждениями, и наоборот, так что то, что считается примером, зависит от математического контекста утверждения не меньше, чем от его логической формы.
- LLM неплохо умеют доказывать и универсальные утверждения: просто самые сильные из доказанных утверждений, которые считаются теоремами, в основном не достигают уровня самых сильных утверждений, считающихся контрпримерами.
С учётом этих фактов, вероятно, LLM хороши в чём-то другом, что просто имеет следствием их успешность в задачах существования, которые обычно классифицируются как поиск нетривиального примера.
Рассмотрим две вещи, в которых LLM определённо сильны. Первая — обширное знание математики: если задачу можно решить относительно стандартным аргументом, LLM с высокой вероятностью найдёт и применит его. Вторая — способность, которой обладает LLM просто в силу того, что она компьютер: работать с огромной скоростью (по сравнению с людьми) и, следовательно, позволить себе множество неудачных попыток решения задачи до того, как найдётся решение.
Даже не глядя на то, что LLM реально удалось решить, можно предположить, что эти две особенности приведут к несколько иному стилю работы по сравнению с математиками-людьми. Очень грубо: LLM будут иметь преимущество там, где в процессе поиска доказательства присутствует более выраженный вероятностный элемент — они будут хороши в задачах, где лучший метод — перепробовать множество идей, не обязательно особо оригинальных, пока в какой-то момент не повезёт. Люди же (пока) будут лучше находить более "неожиданные" и "концептуальные" аргументы, где подходящий метод — копать всё глубже и глубже в задачу, пока решение не проявится само. (Трудно сказать точно, что это значит, но опытный исследователь, читающий эти строки, вероятно поймёт, о чём речь.)
Отсюда возникают два вопроса: соответствует ли это предположение наблюдаемой реальности, и есть ли основания полагать, что описанный "стиль LLM" в математике естественным образом ведёт к обнаружению нескольких контрпримеров (или просто примеров) для давних гипотез, даже если это далеко не всё, на что они способны?
Научного ответа ни на один из этих вопросов пока нет, но реакции экспертов на несколько впечатляющих решений, найденных ChatGPT, отчасти подтверждают идею о том, что LLM работают скорее в режиме "перепробовать многое, пока не повезёт". Часто реакция звучит примерно так: "Сначала я был поражён тем, что задача решена, но при ближайшем рассмотрении понял, что подход на самом деле не так уж оригинален, и подходящий эксперт-человек с правильной небольшой подсказкой мог бы найти его довольно легко".
Со вторым вопросом — насколько "стиль LLM" подходит для поиска (контр)примеров — дело обстоит менее ясно, поскольку способов искать контрпример много, и некоторые из них соответствуют описанному стилю лучше других. Вот несколько общих методов (список не претендует на полноту).
- Искать готовый пример. Здесь имеется набор довольно стандартных примеров, и их просто пробуют один за другим, чтобы проверить, не нарушает ли какой-то из них заданное утверждение. Например, Райан О'Донелл в своей замечательной книге про анализ булевых функций завершает изложение советом: "Если у вас есть гипотеза про булевы функции, проверьте её на диктаторах, большинстве, чётности, "трайбс" (и, может быть, рекурсивном большинстве из трёх). Если она верна для этих функций, вероятно, она верна вообще".
- Строить пример из базовых примеров и стандартных методов построения. Для алгебраической задачи, например, можно начать со стандартных примеров, а затем брать произведения, факторы или пределы.
- Активно использовать метапеременные. Термин "метапеременная" пришёл из компьютерных наук, в частности из автоматического доказательства теорем, и обозначает практику, которая в математике соответствовала бы записи "где
будет выбрано позже" (в этом случае
и есть метапеременная). В статьях так делают обычно только в довольно простых ситуациях, например когда нужно выбрать число
, достаточно малое для дальнейших рассуждений. Но при поиске примера объекта
, удовлетворяющего некоторому свойству
(которое может быть конъюнкцией более простых свойств
), часто невыгодно полностью задавать
и только потом проверять, удовлетворяет ли оно
. Продуктивнее делать почти обратное: начать, почти ничего не говоря про
, и просто приступить к доказательству того, что оно удовлетворяет
. В процессе выясняется, что
должно удовлетворять свойству
. Если удаётся удачно описать достаточно широкий класс объектов
, удовлетворяющих
, например, можно найти параметризованный класс: определить некоторую функцию
и показать, что
удовлетворяет
для каждого
определённого типа. Задача сводится к поиску
такого, что выполняется
— более конкретная версия исходной задачи. Таких итераций может быть много, и они могут сочетаться с другими методами, прежде чем пример будет наконец найден. - Попробовать доказать противоположное. Если требуется найти
такое, что
, удивительно полезно начать с попытки доказать утверждение
. Причина в том, что стандартными методами доказательства этого утверждения можно наткнуться на ключевую лемму, которой достаточно: найти промежуточное свойство
, нетривиально влекущее
, и таким образом свести задачу
к
. Вновь повернув задачу, может оказаться, что найти контрпример к
проще, чем к
(то есть пример, удовлетворяющий
). Разумеется, нет гарантии, что контрпример к
окажется примером
, но иногда так везёт. Чаще можно воспользоваться идеей предыдущего метода, отмечая, что необходимым условием для примера
является отсутствие свойства
, поэтому можно попробовать описать общий класс объектов без свойства
и таким образом сузить задачу. - Последовательное приближение. Иногда при поиске примера
, удовлетворяющего
, записывается умеренно правдоподобная догадка
— не потому, что есть надежда, что она сработает (иначе применялся бы первый метод), а в надежде, что если
не удовлетворяет
, изучение того, почему это так, натолкнёт на следующее, лучшее приближение
, и так далее — итеративный процесс постепенного улучшения приближения, пока в конце концов не будет достигнуто рабочее решение или не станет ясно, что оно не может быть достигнуто.