Современные системы искусственного интеллекта неплохо справляются с задачами, для которых, казалось бы, плохо подходят по своей природе. Интеллект традиционно моделировали как операции над структурированными комбинациями символов — например, логическими формулами. Однако самые мощные современные системы ИИ построены на нейросетях, которые представляют информацию иначе — в виде непрерывных векторов. Векторы на первый взгляд плохо подходят для передачи структуры языка, логики и других областей познания, но нейросети всё равно показывают в этих задачах впечатляющие результаты.
Группа исследователей — Р. Томас Маккой, Пол Соулос, Тал Лизен и Пол Смоленски — предложила возможный ответ на вопрос, как нейросетям это удаётся. Гипотеза звучит так: несмотря на внешний вид, внутренние представления нейросетей могут неявно реализовывать символьную структуру.
В подтверждение этой идеи авторы показали, что векторные представления самых разных нейросетей можно с высокой точностью приблизить символьными структурами. Весь процесс генерации представлений внутри сети можно заменить замкнутой (closed-form) формулой, реализующей символьную структуру, — и при этом поведение сети остаётся практически неизменным.
Результат подтвердился на двух принципиально разных типах моделей. Во-первых, на небольших нейросетях, специально обученных манипулировать списками. Во-вторых — на больших языковых моделях (LLM), работающих в четырёх областях, которые традиционно считаются вотчиной символьных подходов: арифметике, логике, программном коде и естественном языке.
Более того, символьное приближение позволило целенаправленно менять поведение LLM с помощью точечных интервенций во внутренние представления модели. Это подтверждает, что поведение LLM действительно зависит от найденных символьных структур, а не просто описывается ими постфактум.
Modern systems in artificial intelligence (AI) somehow excel in domains for which they seem poorly suited... In support of this hypothesis, we show that the vector representations of a variety of neural networks can be closely approximated with symbolic structures: we can replace the network's entire representation-generating process with a closed-form equation instantiating a symbolic structure, and the network's behavior remains largely unchanged.
Работа предлагает потенциальный способ примирить давнюю символьную концепцию интеллекта с векторной природой современного ИИ. Если внутренние представления нейросетей действительно неявно кодируют символьные структуры, это может объяснить, почему модели, обученные исключительно на непрерывных векторах и градиентном спуске, справляются с задачами, требующими дискретной, комбинаторной логики.
Статья объёмом 30 страниц плюс 29 страниц приложений и списка литературы опубликована на arXiv в разделах Computation and Language (cs.CL) и Artificial Intelligence (cs.AI).