Прорыв в решении классической задачи

OpenAI объявила о решении задачи Навье–Стокса — одной из семи задач тысячелетия, за решение которых с мая 2000 года выплачивается награда в $1 млн. Для решения проблемы существования и гладкости решений уравнений Навье–Стокса компания использовала экспериментальную внутреннюю модель.

Однако результат существенно осложнен обвинениями в недобросовестной конкуренции от Тристана Бакмастера, профессора математики NYU, который совместно с Левентом Альпёге — известным математиком и сотрудником Anthropic — работал над смежными задачами.

Конкурирующие решения и спор о приоритете

Бакмастер опубликовал спешно подготовленную версию своих результатов вместе с подробным описанием произошедшего. Вкратце: Бакмастер и Альпёге работали над задачей почти год, интенсивно используя Claude и Codex (главным образом GPT-5.6 Sol), добившись прорыва 15 августа. После этого слухи о решении быстро распространились в математическом сообществе. Когда они услышали, что OpenAI также работает над похожей задачей похожим способом, потребовали объяснений.

По словам Бакмастера, на ключевые вопросы получены уклончивые ответы:

Я спросил, когда им был отправлен первый запрос. OpenAI долгое время не давала прямого ответа. В итоге было согласовано, что запрос был отправлен в последние несколько дней — после того, как информация о нашей работе дошла до OpenAI.

Я спросил, была ли модель обучена на наших сессиях в Codex или имела к ним доступ — в этот инструмент мы загружали все свои черновики за весь проект. Мне сказали, что модель не обращается к пользовательским данным. Я спросил снова о тренировке — и ответа не получил.

OpenAI предложила ждать публикации Бакмастера или позволить ему соавторствовать их статью, но категорически отказала в этом праве Альпёге из-за конкурентных отношений OpenAI с Anthropic.

Технические детали решения OpenAI

OpenAI описала свой процесс так:

Во вторник, 1 сентября, мы услышали слухи о решении двух задач тысячелетия. Вдохновившись этими слухами и заметным скачком производительности нашей внутренней модели, мы запустили тестирование её на всех открытых задачах тысячелетия и некоторых других высокоэффективных задачах. [...] Агенты получили решение в субботу, 5 сентября, примерно через 88 часов после запуска первых агентов. Формализация и верификация на Lean заняли дополнительно 17 часов через GPT‑6 Astra.

Во всех попытанных задачах агенты отправили 4.9 млн сообщений и использовали около 300 млрд токенов на выходе. При решении задачи Навье–Стокса агенты отправили 2.7 млн сообщений и использовали примерно 130 млрд токенов на выходе.

Стоимость такого решения впечатляет: 300 млрд выходных токенов при публичных ценах GPT-6 Astra обошлись бы в $15 млн.

Вот как OpenAI прокомментировала работу Бакмастера и Альпёге:

Наша работа началась 1 сентября после слуха, который, как мы позже поняли, был связан с сотрудником Anthropic Левентом Альпёге и профессором математики NYU Тристаном Бакмастером. После завершения нашего проекта и верификации на Lean (6 сентября), полагая по слухам, что у них также есть решение задачи Навье–Стокса, мы обратились к ним с предложением о совместной публикации результата и признании их приоритета в совместном заявлении. [...] Мы (исследователи и агенты) не видели никакой их работы никакими средствами до публичной публикации — в частности, никакие пользовательские данные не использовались специально для решения этой задачи. Хотя это маловероятно, мы не можем исключить, что де-идентифицированные данные из их использования наших продуктов помогли улучшить наши модели. Однако наши доказательства существенно отличаются, и даже доказываемые результаты различаются в случае Эйлера (вынужденный и невынужденный).

Более широкая проблема

Происходящее напоминает динамику в области компьютерной безопасности. Анил Мадхавапедди недавно указал, что одного слуха о баге достаточно, чтобы найти уязвимость — если известно об неопубликованной уязвимости, достаточно задать агентам её поиск. Верно ли то же самое для математики? Знание о существовании непубликуемого решения математической задачи может спровоцировать миллионы долларов расходов на LLM-вычисления, чтобы добраться туда первым.

Это также обнажает фундаментальный вопрос о прозрачности AI. Когда лаборатория заявляет, что пользовательские данные используются для улучшения моделей, что это реально означает?

Раньше на этот счет были два любимых гипотетических вопроса:

  • Если я использую Codex и мой API-ключ случайно окажется в контексте, какова вероятность, что кто-то в будущем попросит API-ключ и получит мой? (Когда-то я спросил об этом у кого-то из OpenAI — они назвали это "проблемой срыгивания" и уверили, что принимают меры, но не объяснили как.)
  • Если я мозговою атаку в ChatGPT о возможных направлениях развития своей компании, какова вероятность, что информация попадет конкуренту через полгода, если он спросит "что может планировать компания X"?

Теперь предпочитаемый гипотетический вопрос такой:

  • Если я использую ChatGPT для частичного решения задачи тысячелетия, какова вероятность, что моя работа повлияет на обучение так, что позже модель поможет кому-то другому решить её первым?