Terminal-Bench-Science — бенчмарк, созданный исследователями из Stanford University совместно с командой Terminal-Bench при участии экспертов из разных научных дисциплин и исследовательских учреждений по всему миру. Он измеряет возможности ИИ-агентов через набор сложных, курируемых экспертами рабочих процессов, взятых из реальной научной практики.

Это непрерывный бенчмарк, развивающийся вместе с передовыми моделями ИИ и создающий обратную связь между потребностями науки и развитием технологий. Первый релиз включает 70 задач из наук о жизни, физических наук, наук о Земле, математики и инженерии. Самая сильная из протестированных моделей, Claude Opus 5, достигла показателя решения задач в 30% на Terminal-Bench-Science 0.1.

Terminal-Bench-Science
Показатели решения задач по 70 научным рабочим процессам в Terminal-Bench-Science 0.1

Обзор

Terminal-Bench уже способствовал прогрессу ИИ-агентов в разработке программного обеспечения, а Terminal-Bench-Science переносит те же амбиции в область науки. Цель — стимулировать развитие агентов с научными возможностями, которые сделают их полезными исследовательскими ассистентами. Такие агенты должны выполнять технически сложные и трудоёмкие рабочие процессы, освобождая учёных для того, что требует человеческого суждения: постановки исследовательских вопросов, формулирования гипотез, интерпретации и проверки результатов, коммуникации выводов. В этой роли ИИ-агенты способны расширить возможности исследователей и ускорить научные открытия.

Для этого нужны бенчмарки, которые отражают реальную научную практику, дают проверяемые доказательства возможностей и развиваются вместе с передовыми моделями ИИ.

Нужны бенчмарки, основанные на реальных научных рабочих процессах. Научные возможности следует оценивать на реальной исследовательской практике, а не на учебных вопросах или стандартизированных упражнениях, причём материал должны предоставлять практикующие учёные. Terminal-Bench-Science даёт учёным из разных областей прямой голос и общую платформу для установления планки прогресса ИИ по значимым для них проблемам. Ставки в науке слишком высоки, и бенчмарки должны отражать приоритеты научного сообщества, а не сторонние интересы.

Нужны проверяемые доказательства научных возможностей. Без надёжной оценки невозможно понять, улучшаются ли возможности агентов и где остаются их ограничения. Terminal-Bench-Science оценивает агентов в реалистичных условиях и проверяет конкретные результаты — анализы, симуляции, доказательства, код, продукты обработки данных — с помощью воспроизводимых тестов, специфичных для каждой задачи.

Нужен бенчмарк, который не отстаёт от передового края. Слишком часто научные бенчмарки воспринимаются как статьи для публикации, а не как механизмы для стимулирования прогресса: их выпускают один раз, а затем забрасывают, пока модели развиваются, а известные ограничения сохраняются. Terminal-Bench-Science — непрерывный бенчмарк, развивающийся вместе с передовыми моделями ИИ. Через регулярные релизы учёные могут добавлять новые рабочие процессы, улучшать существующие задачи и поддерживать обратную связь между научными потребностями и развитием ИИ.

Задачи

Terminal-Bench-Science 0.1 включает 70 задач из наук о жизни, физических наук, наук о Земле, математики и инженерии. Задачи охватывают анализ научных данных, статистический вывод, симуляции, оптимизацию, доказательство теорем, реконструкцию изображений, обработку сигналов, обратные задачи, калибровку сенсоров, подгонку моделей, классификацию и научное машинное обучение.

Задачи предлагают исследователи через открытый процесс на GitHub, с обсуждением и обратной связью в канале #tb-science на Discord. Вклад начинается с предложений: рецензенты обсуждают каждую идею, дают обратную связь и одобряют те, что выглядят подходящими — научно обоснованные рабочие процессы, достойные измерения в бенчмарке. Одобренные предложения реализуются как pull request'ы, где рецензенты проверяют, что каждая задача объективно верифицируема, действительно сложна для ИИ-агентов и не решается легко современными передовыми системами. Для слияния доменные рецензенты оценивают научную валидность и реалистичность, технические рецензенты проверяют построение задачи и верификацию, а финальную проверку качества выполняет отдельный рецензент. Из 920 предложений 464 были одобрены для реализации, было открыто 386 pull request'ов, но лишь 70 задач вошли в Terminal-Bench-Science 0.1. Такая избирательность отражает, насколько сложно создать задачи, которые одновременно интересны с научной точки зрения, сложны для передовых агентов и достаточно чётко специфицированы для строгой оценки. Прогресс по предложениям, pull request'ам и рецензиям отслеживается на публичной панели задач.

Карта мира с географической плотностью авторов предложений и реализаций Terminal-Bench-Science по публичным профилям и аффилиациям
376 участников из 22 стран, включая авторов предложений, рецензентов и авторов pull request'ов

Результаты

Terminal-Bench-Science 0.1 оставляет значительный простор для прогресса ИИ-агентов в научных исследованиях. Каждая протестированная модель прошла три независимых испытания на задачу по всем 70 задачам. Claude Opus 5 с Claude Code показал наивысший показатель решения — 30,0%, за ним следует GPT-5.6 Sol с Codex (22,4%) и Claude Fable 5 с Claude Code (21,4%). Claude Opus 4.8 находится в середине с показателем 10,5%. GPT-5.6 Terra, Kimi K3 и Grok 4.6 решают менее 10% задач. GLM 5.3 — сильнейшая открытая модель с показателем 8,1%, а GPT-5.6 Luna — последняя с 3,3%.

Terminal-Bench-Science различает системы примерно так же хорошо, как Terminal-Bench 3.0, при этом снижая показатели решения более чем на 10 процентных пунктов для каждой модели, протестированной на обоих бенчмарках. Этот разрыв намеренный: в ходе рецензирования задачи калибровались так, чтобы бросать вызов новейшим передовым моделям.

Производительность — лишь одно измерение прогресса. График стоимости и решаемости показывает общую стоимость оценки по всем 70 задачам в сравнении с показателем решения. GPT-5.6 Luna, Kimi K3 и GPT-5.6 Terra занимают низкозатратную часть границы. GPT-5.6 Sol и Claude Opus 5 достигают наивысших показателей решения при более высокой стоимости — Opus 5 обходится в $7,0 тыс. GPT-5.6 Sol сравнялся по производительности с Claude Fable 5 при стоимости менее трети ($4,2 тыс. против $14,2 тыс.). Использование токенов показывает другую картину: Claude Fable 5 сравнялся по результатам с GPT-5.6 Sol, используя примерно на четверть меньше токенов (6,4 млрд против 8,4 млрд). Kimi K3 закрепляет низкотокенный край, а Claude Opus 5 — высокорезультативный. Только Kimi K3 и Claude Opus 5 присутствуют на обеих границах Парето.

Показатели решения также варьируются по научным доменам. Модели Anthropic и OpenAI занимают первые два места в каждом домене, кроме инженерных наук, где Grok 4.6 делит второе место с GPT-5.6 Sol (14,8%) при меньшей стоимости и меньшем расходе токенов. Claude Opus 5 опережает GPT-5.6 Sol и Claude Fable 5 в каждом домене, кроме математических наук, где первые два места занимают Claude Fable 5 (33,3%) и GPT-5.6 Sol (31,4%). Полная разбивка по доменам доступна на лидерборде.

Заключение и планы

Terminal-Bench-Science 0.1 — результат совместных усилий исследователей из наук о жизни, физических наук, наук о Земле, математики и инженерии вместе с командой Terminal-Bench и Harbor. Это самый строгий открытый бенчмарк научных возможностей агентов, который удалось построить, и это лишь начало: Terminal-Bench-Science 0.1 — первый релиз непрерывно развивающегося бенчмарка.

Регулярные релизы будут добавлять задачи, расширять охват по пяти научным доменам, выводить из ротации задачи, которые агенты насытили или которые при рецензировании оказались недостаточно чётко специфицированы, а также поддерживать актуальность лидерборда по мере выхода новых передовых моделей. Каждый релиз калибруется относительно передового края на момент выхода. Для Terminal-Bench-Science 0.1 это были Claude Opus 5 и GPT-5.6 Sol; по мере появления более сильных моделей их будут использовать для оценки и калибровки новых и улучшенных задач. Задачи версионируются, поэтому испытания можно переиспользовать, перепроверить или перезапустить одной командой Harbor, что снижает стоимость обновления результатов. Прогресс отслеживается открыто на панели задач, а каждый релиз помечается тегом на GitHub и Harbor Hub.

Работа над Terminal-Bench-Science 0.2 уже идёт, дедлайн для pull request'ов — 5 октября 2026 года. Организаторы приглашают исследователей, у которых есть рабочий процесс, что передовые агенты пока не могут выполнить, добавить его в бенчмарк. Процесс участия: Предложить → Реализовать → Рецензировать — предложить задачу через форму предложений, реализовать её согласно руководству для контрибьюторов, после чего она пройдёт автоматические проверки, параллельное доменное и техническое рецензирование и финальное одобрение перед слиянием.

Присоединиться можно в канале #tb-science на Discord и на GitHub, а также на еженедельных встречах и office hours через календарь проекта.

Цитирование

Для цитирования можно использовать кнопку «Cite this repository» на GitHub (генерируется из CITATION.cff) или указать данные вручную.

@software{Terminal-Bench-Science_Team_Terminal-Bench-Science_Evaluating_AI_2026,
  author = {{Terminal-Bench-Science Team}},
  doi = {10.5281/zenodo.22110254},
  license = {Apache-2.0},
  month = aug,
  title = {{Terminal-Bench-Science: Evaluating AI agents on research workflows across scientific domains}},
  url = {https://github.com/harbor-framework/terminal-bench-science},
  version = {v0.1.0},
  year = {2026}
}

Благодарности

Отдельная благодарность всем авторам задач, рецензентам и консультантам, стоящим за Terminal-Bench-Science.

Особая благодарность ведущим консультантам проекта Людвигу Шмидту и Санми Койеджо; старшим рецензентам Аллену Харту, Ивану Берковичу, Джозефу Янссену, Цзямину Ху, Штеффену Больманну и Сергею Аганезову; консультантам по ИИ-исследованиям Райану Мартену, Алексу Шоу, Лин Ши, Бенджамину Фойеру, Майку А. Мерриллу, Алексу Димакису, Джении Йицев, Бодхисаттве Мажумдеру, Питеру Кларку, Томасу Вольфу, Брейдену Хэнкоку и Энди Конвински; а также научным консультантам Саре Бири, Джо Данкли, Дж. Натану Кутцу, Чинг-Яо Лай, Скотту Линдерману, Эмме Лундберг, Расселу Полдраку, Авив Регев и Рисе Векслер.

Terminal-Bench-Science — открытая академическая коллаборация под эгидой Stanford University и Laude Institute, в партнёрстве со Stanford AI Lab (SAIL), Stanford Institute for Human-Centered Artificial Intelligence (HAI), Stanford AI Measurement Science (AIMS), NSF AI Institute for Foundations of Machine Learning (IFML), Allen Institute и Allen Institute for AI (Ai2). Как часть семейства проектов Terminal-Bench, бенчмарк создан командой Terminal-Bench и Harbor совместно с сообществом научных контрибьюторов.

Благодарность за поддержку выражена Laude Institute в рамках программы Slingshots, Snorkel AI за поддержку по программе Open Benchmarks Grants, 2077AI Open Source Foundation за кредиты PP API, поддержавшие рецензирование и курирование задач, а также UniPat AI и Modal за поддержку проекта. Благодарность за API-кредиты, поддержавшие оценки для лидерборда, выражена Bespoke Labs, Anthropic, Google, Moonshot AI, SpaceXAI и Z.ai.

Материал подготовил Стивен Диллманн.