Когда система ИИ решает сложную математическую задачу, обычное объяснение звучит так: модель стала умнее.
Возможно, она усвоила миллионы математических примеров. Возможно, обучение с подкреплением научило её более эффективным стратегиям рассуждения. Возможно, у неё начинает формироваться что-то похожее на настоящую математическую интуицию.
Во всех этих объяснениях может быть доля правды. Но они упускают более простую возможность:
у ИИ есть доступ к рабочей памяти, значительно превосходящей по объёму человеческий мозг.
Точнее говоря, у него есть доступ к огромному внешнему символьному рабочему пространству, которое выполняет многие функции, свойственные рабочей памяти человека.
Эта разница может быть особенно важна именно в математике.
Математик-человек способен одновременно удерживать в голове лишь небольшое число незнакомых элементов. Модель ИИ может держать в контекстном окне всю формулировку задачи, сотни промежуточных уравнений, несколько отброшенных подходов, определения, ограничения и ранее сделанные выводы.
Обычно результирующую производительность трактуют как свидетельство более совершенного рассуждения. Но часть этого эффекта может объясняться устранением одного из важнейших биологических ограничений человеческого мышления — крайне скромного объёма рабочей памяти.
Математика ограничена памятью
Рабочая память — это система, позволяющая удерживать и обрабатывать информацию в течение коротких промежутков времени.
Решая уравнение, нужно помнить, что означает каждая переменная, какие операции уже выполнены и какова текущая цель. В ходе доказательства приходится держать в уме предположения, промежуточные леммы, исключения и множество возможных случаев.
Человеческая рабочая память заметно ограничена.
Её точный объём зависит от задачи и от того, как организована информация, но общее ограничение очевидно из повседневного опыта. Попробуйте перемножить в уме два трёхзначных числа. Сами операции просты. Сложность возникает в основном из-за необходимости удерживать промежуточные результаты, выполняя дополнительные вычисления.
Запись чисел на бумаге меняет саму задачу.
Бумага не делает человека умнее. Она расширяет эффективный объём рабочей памяти.
Тот же принцип действует и на более высоких уровнях математики. Математик использует нотацию, черновик, диаграммы и ранее записанные леммы не только для того, чтобы сообщить решение, а чтобы вообще сделать рассуждение когнитивно возможным.
Эксперты компенсируют ограничение через «чанкинг» (укрупнение). Новичок видит длинную последовательность символов. Эксперт распознаёт знакомую структуру и обращается с ней как с единым концептуальным объектом. Это позволяет уместить гораздо больше информации в тот же биологический предел рабочей памяти.
Но чанкинг не устраняет ограничение. Он лишь сжимает информацию.
Модель ИИ сталкивается с совершенно иным ограничением.
Рабочая память предсказывает успехи в математике независимо от IQ
Значение рабочей памяти для математики — не просто теоретическое рассуждение. Оно видно в различиях между людьми.
Рабочая память тесно связана с общим интеллектом, что порождает очевидный вопрос: предсказывает ли она успехи в математике независимо, или это просто ещё один несовершенный показатель IQ?
Несколько исследований показывают, что она вносит вклад помимо стандартных измерений интеллекта. Эллоуэй и Пассолунги (2011), например, изучали рабочую память, вербальные способности и математические навыки у детей. Они обнаружили, что показатели рабочей памяти вносят самостоятельный вклад в успехи в математике, а не просто воспроизводят связь между математикой и общими вербальными способностями.
В отдельном шестилетнем лонгитюдном исследовании Эллоуэй и Эллоуэй (2010) измерили показатели детей в пять лет, а затем изучили их академические достижения шесть лет спустя. Ранние показатели рабочей памяти предсказывали последующую грамотность и владение счётом даже после учёта IQ в анализе. Более того, рабочая память оказалась более сильным предиктором последующих академических результатов, чем измеренный в исследовании IQ.
Бланкеншип с коллегами (2015) аналогично сообщили, что рабочая память объясняет уникальную часть вариации в математической беглости и вычислениях после статистического контроля за IQ и возрастом. Крупный метаанализ Фризо-ван ден Бос с коллегами (2013) также выявил устойчивую связь между рабочей памятью и математикой в исследованиях начальной школы, хотя сила связи варьировалась в зависимости от типа рабочей памяти и математической задачи.
Эти выводы не стоит преувеличивать. Рабочая память и интеллект существенно пересекаются, и статистический контроль не способен идеально изолировать их как независимые психологические механизмы. Данные также не означают, что коммерческая тренировка рабочей памяти обязательно приведёт к значительному росту интеллекта или математических способностей.
Тем не менее более узкий вывод важен: среди детей со схожим измеренным интеллектом различия в способности удерживать, обновлять и обрабатывать информацию по-прежнему предсказывают различия в успехах по математике.
Это даёт важную подсказку для понимания ИИ. Если человеческие успехи в математике частично ограничены узким местом рабочей памяти, то предоставление машине огромного символьного рабочего пространства меняет саму природу соревнования. Машина может казаться более математически способной отчасти потому, что она гораздо меньше скована когнитивным ограничением, подавляющим человеческую производительность.
Контекстное окно — это гигантский блокнот
Современная языковая модель способна обрабатывать за раз огромную последовательность токенов. Эта последовательность может включать исходный вопрос, определения, примеры, промежуточные вычисления и собственные более ранние рассуждения модели.
Контекстное окно не тождественно человеческой рабочей памяти. Правильнее понимать его как гигантский внешний блокнот в сочетании с несовершенной системой поиска и использования того, что в него записано.
Это различие важно.
Люди обладают формой активной внутренней памяти. Можно молча выбрать число, удержать его в уме, преобразовать и заменить новым значением, ничего не произнося и не записывая.
Стандартные языковые модели гораздо слабее в поддержании такого рода приватного, непрерывно обновляемого ментального состояния. Их наиболее устойчивая форма памяти — это, как правило, уже сгенерированная последовательность токенов.
Если модель пишет:
x=6
а затем пишет:
x+3=9,
эти утверждения остаются внутри контекста. Модель может вновь обратиться к ним при генерации следующего шага.
Поэтому её рассуждение зачастую экстернализировано. Текст — не просто отчёт о завершённом мыслительном процессе. Текст — часть механизма, посредством которого это рассуждение происходит.
Люди делают нечто похожее, используя черновик. Главное отличие — в масштабе.
Человеку без вспомогательных средств может быть трудно одновременно удерживать активными пять незнакомых условий. ИИ способен сохранять в явном виде десятки или сотни таких условий.
Это не значит, что каждый элемент длинного контекста извлекается идеально. Модели могут упускать релевантную информацию, отвлекаться или терять из виду детали. Заявленная длина контекста — не то же самое, что идеально используемая память.
Тем не менее разница в потенциальном объёме огромна.
Почему это особенно важно для математики
Преимущество контекстного окна полезно не в равной степени для всех видов рассуждения.
Оно особенно важно для математики, потому что математическое рассуждение необычайно хорошо переводится в явные символы.
Почти каждый значимый элемент математической задачи можно записать:
предположения;
определения;
известные уравнения;
текущую цель;
уже доказанные результаты;
исключённые случаи;
условия, при которых каждый шаг остаётся верным.
Однажды записанная, эта информация остаётся устойчивой.
Если x определена как целое число в начале доказательства, она остаётся целым числом, пока доказательство явно не изменит определение. Строгое неравенство не превращается постепенно в нестрогое из-за изменений настроения, контекста или интерпретации.
Математические символы созданы для того, чтобы уменьшать неоднозначность.
Это делает математику почти идеально подходящей для интеллекта, работающего через большое текстовое рабочее пространство.
Рассмотрим задачу, требующую помнить, что:
n нечётно;
p простое;
x≠0
и что одна из ветвей рассуждения уже привела к противоречию.
Человек может понимать основную стратегию, но разделить на x до того, как установлено, что x≠0. Ошибка не обязательно вызвана недостатком ума. Это может быть сбой в «бухгалтерии» рассуждения.
ИИ способен переформулировать действующие ограничения на каждом этапе:
Мы работаем в предположении, что n нечётно, p простое и x≠0.
Контекст становится своего рода журналом состояния рассуждения.
Многие сложные математические задачи содержат глубокую идею где-то в начале, но также включают большой объём менее эффектной работы после неё: раскрытие выражений, проверку случаев, перенос условий через преобразования и проверку совместимости итогового вывода с каждым ранее принятым предположением.
Машине не нужно обладать более глубоким пониманием, чем у человека, чтобы получить здесь преимущество. Ей достаточно быть лучше приспособленной к сохранению всего состояния задачи при выполнении длинной последовательности операций.
Длинные цепочки рассуждений могут превышать возможности человека
Математика в высокой степени композиционна.
Доказательство часто можно представить как:
A → B → C → D
Если каждый шаг корректен, а цепочка сохраняется в точности, вывод следует из неё.
Большое рабочее пространство позволяет модели строить гораздо более длинные цепочки, прежде чем потерять нить рассуждения.
Это важно, потому что сложность задачи зависит не только от сложности каждого отдельного шага. Она зависит и от того, сколько шагов нужно согласовать между собой.
Человек вполне может понимать каждый локальный вывод в стошаговом рассуждении, но всё же быть не в состоянии самостоятельно построить всю аргументацию целиком. Задача превышает его способность удерживать глобальную структуру.
ИИ потенциально компенсирует это, записывая практически всё.
Это может объяснять, почему дополнительное «время на размышление» часто улучшает результаты модели. Больше вычислений позволяет системе производить больше промежуточных состояний, рассматривать альтернативные ветви и сохранять частичные выводы.
То, что выглядит как более глубокое мышление, иногда оказывается более широким поиском, проводимым в куда более объёмном блокноте.
Неформальное рассуждение работает иначе
Теперь сравним математическую задачу с социальным вопросом:
Почему Мария внезапно перестала отвечать на мои сообщения?
Более широкое контекстное окно могло бы позволить ИИ изучить годы переписки. Он мог бы выявить изменения тона, тайминга и словаря.
Но решающая информация всё равно может отсутствовать.
Возможно, Мария злится. Возможно, она занята. Возможно, больна. Возможно, потеряла телефон. Возможно, избегает не связанной с этим проблемы.
Никакой объём памяти не способен извлечь факты, которые никогда не наблюдались.
Задача здесь не в том, чтобы сохранить известный набор посылок и вывести их следствия. Задача — рассуждать в условиях неопределённости о скрытых причинах.
Неформальное рассуждение также сильно зависит от понятий с неустойчивым значением.
Слова вроде «справедливый», «успешный», «ответственный», «вредный» или «умный» не обладают точностью математических переменных. Их значение зависит от культуры, целей и контекста.
Модель может помнить каждое предложение в обсуждении и при этом неверно понимать, что имеют в виду участники.
То же самое относится к политическому анализу, историческим интерпретациям, бизнес-стратегии и психологическим суждениям. В этих областях центральная проблема — обычно не объём рабочей памяти. Это определение верной причинной модели при неполных и неоднозначных данных.
Более объёмный блокнот помогает, но не решает фундаментальную проблему.
Математика отличается тем, что среда рассуждения искусственно устроена так, чтобы делать предположения явными, а преобразования — проверяемыми.
Математика даёт необычайно сильную обратную связь
Математические ответы часто можно проверить.
Решение уравнения можно подставить обратно в исходное выражение. Предложенное тождество можно проверить численно. Компьютерная программа может протестировать сотни случаев. Ассистент формального доказательства может проверить, следует ли каждый вывод из принятых правил.
Это создаёт идеальную среду для ИИ.
Модель может использовать контекст не только для получения решения, но и для фиксации альтернативных подходов, выявления противоречий и исправления предыдущих ошибок.
В менее формальных областях обратная связь гораздо слабее.
Убедительное историческое объяснение может быть невозможно проверить окончательно. Бизнес-стратегия может не показать, была ли она верной, годами. Психологическая интерпретация может оставаться неопределённой навсегда.
В таких областях длинная и связная аргументация может при этом оказаться полностью ошибочной.
Математика вознаграждает системы, способные генерировать, хранить и проверять явные промежуточные состояния. Именно эти способности усиливают контекстные окна, черновики, выполнение кода и формальная верификация.
Действительно ли это рабочая память?
Некоторые исследователи возразили бы против того, чтобы называть контекстное окно рабочей памятью.
И в этом есть резон.
Человеческая рабочая память — не просто буфер хранения. Она включает внимание, торможение, непрерывное обновление и активную обработку внутренних представлений.
Контекст языковой модели более пассивен. Предыдущие токены остаются фиксированными. Модель не может буквально вернуться к более ранней строке и заменить её. Она генерирует новые токены, обусловленные уже существующей записью.
Поэтому наиболее точным описанием может быть расширенная символьная рабочая память.
В некоторых отношениях у модели более слабая приватная ментальная память, чем у человека, но в других — значительно большая явная память.
Люди лучше умеют молча удерживать небольшое внутреннее состояние. ИИ лучше работает с огромной письменной записью.
Для математики второе умение зачастую оказывается более ценным.
Формальное рассуждение не требует, чтобы каждое релевантное состояние оставалось приватным. Напротив, математика выигрывает, когда предположения и промежуточные шаги делаются явными.
Кажущаяся слабость ИИ — его склонность «думать вслух» — превращается в преимущество, когда сама область построена из письменных символов.
Интеллект или когнитивная архитектура?
Это подводит к более широкому вопросу: что означает утверждение, будто ИИ «лучше в математике», чем люди?
Представим, что двум людям дали одну и ту же математическую задачу.
Один должен решить её полностью в уме. Другой получает неограниченную бумагу, идеальные заметки, мгновенный доступ ко всем предыдущим вычислениям, возможность параллельно пробовать несколько подходов и машину, проверяющую каждый результат.
Если побеждает второй, из этого не обязательно следует вывод, что второй обладает более высоким «сырым» математическим интеллектом. Вместо этого можно заключить, что у второго была гораздо более удачная когнитивная архитектура для данной задачи.
Та же осторожность должна применяться при сравнении людей и ИИ.
Системы ИИ обучены на огромных объёмах математического материала. Они способны генерировать много возможных решений, использовать код, обращаться к инструментам и сохранять длинные цепочки рассуждений.
Их производительность — результат сочетания нескольких факторов: математических знаний, способности рассуждать, объёма памяти, поиска и верификации.
Внимание обычно сосредоточено на рассуждении, потому что оно наиболее философски увлекательно. Но память, возможно, делает гораздо больше работы, чем принято думать.
Проверяемое предсказание
Гипотеза о рабочей памяти даёт чёткие предсказания.
Преимущество ИИ должно быть наибольшим на задачах, включающих:
множество взаимодействующих ограничений;
длинные вычисления;
обширный разбор случаев;
многократное обращение к предыдущим результатам;
точную символьную «бухгалтерию»;
большие массивы формальных определений.
Преимущество должно быть меньше на задачах, зависящих в основном от одного короткого концептуального прорыва.
Блестящий математик может по-прежнему превосходить ИИ, когда решающая сложность заключается в поиске совершенно нового представления задачи. Но как только такое представление найдено, ИИ может оказаться лучше в исследовании всех его следствий.
Гипотеза также предсказывает, что сокращение доступного контекста модели или запрет на запись промежуточных шагов должны непропорционально сильно снижать производительность на длинных математических задачах.
И наоборот, расширение внешней памяти человека — за счёт чёткой нотации, диаграмм, программного обеспечения и структурированных заметок — должно сокращать часть разрыва.
Поэтому наиболее честным сравнением может быть не ИИ против человека, рассуждающего без вспомогательных средств, а ИИ с его инструментами против человека с не менее мощной внешней памятью и системами верификации.
ИИ может побеждать нас именно памятью
Подъём математического ИИ часто описывают как триумф машинного интеллекта над человеческим.
Такая трактовка может быть преждевременной.
ИИ определённо, судя по всему, осваивает более совершенные стратегии рассуждения. Со временем он может развить формы математической интуиции, равные нашим или превосходящие их.
Но часть нынешнего преимущества может быть куда более прозаичной.
Человеческий мозг эволюционировал в условиях жёстких ограничений. У него ограниченная рабочая память, он устаёт, теряет промежуточные результаты и с трудом координирует длинные цепочки незнакомых символов.
ИИ не скован той же архитектурой.
Он способен превращать рассуждение в текст и использовать этот текст как огромное внешнее когнитивное рабочее пространство. Математика — благодаря своей точности и символьной структуре — та область, где это преимущество легче всего конвертируется в превосходящую производительность.
Настоящая причина, по которой ИИ обходит людей в математике, может оказаться менее загадочной, чем кажется.
Возможно, наиболее показательное сравнение — не между ИИ и средним человеком, а между двумя очень разными формами гениальности.
Физик Юджин Вигнер, знавший лично и Джона фон Неймана, и Альберта Эйнштейна, писал, что никто из встреченных им людей не обладал умом настолько «быстрым и острым», как у фон Неймана. Фон Нейман мог усваивать огромные объёмы информации, следить за исключительно сложными рассуждениями и мгновенно переключаться между математическими областями. Тем не менее Вигнер считал понимание Эйнштейна более глубоким, проникновенным и оригинальным. У фон Неймана, возможно, была большая «сырая» интеллектуальная вычислительная мощность, но именно Эйнштейн скорее был способен переосмыслить саму постановку проблемы.
Современный ИИ выглядит скорее как машинно усиленная версия первого набора способностей, нежели второго. Он необычайно быстр, широк по охвату и способен сохранять и обрабатывать огромные объёмы явной информации. Он может перебирать множество вариантов, помнить длинные цепочки выводов и выполнять формальные рассуждения в масштабе, недоступном человеку без вспомогательных средств. Но это не обязательно означает, что он обладает эйнштейновской глубиной — способностью отбросить принятую систему взглядов, выявить скрытую концептуальную ошибку и изобрести радикально новый способ видения реальности.
Не стоит слишком развивать эту аналогию. Сам фон Нейман был чрезвычайно оригинальным мыслителем, а не просто быстрым калькулятором. Но различие Вигнера отражает нечто важное. Возможно, сегодня ИИ обходит людей в математике не столько за счёт мышления в духе Эйнштейна, сколько за счёт сочетания чего-то похожего на скорость и широту фон Неймана с практически неограниченным блокнотом.
Следующий большой рубеж будет достигнут не тогда, когда ИИ научится решать существующие задачи быстрее людей. Он будет достигнут тогда, когда ИИ сможет распознать, что задача изначально сформулирована неверно, и изобрести принципиально лучший способ её понимания.