Введение
Anthropic представила Claude Opus 5.5 — первую модель из нового семейства Claude 5.5. Она достигает производительности Claude Fable 5.1 на большинстве задач и стоит на 40% дешевле в использовании, чем Opus 5.
Claude Opus 5.5 — это первый релиз после призыва к контролю над границами развития ИИ. Перед выпуском модель протестировали внешние оценщики, включая Frontier Design и METR. По результатам автоматизированного поведенческого аудита — наиболее полного теста на согласованность (alignment), который проводит компания — Opus 5.5 показывает лучшие результаты среди всех протестированных моделей. Модель также имеет средства защиты, разработанные для самых способных моделей Anthropic.
Вот основные улучшения, которые ожидают пользователи Opus 5.5:
Производительность. Opus 5.5 — это значительный скачок вперёд от Opus 5. Это новая лидирующая модель, и ранние тестировщики видели существенный рост производительности на сложных задачах. Один из тестировщиков выполнил миграцию кода объёмом 680 тысяч строк менее чем за день — работу, которая заняла бы у инженерной команды недели. Модель хороша в обнаружении и исправлении неэффективности в ПО: когда мы попросили её ускорить загрузку всех страниц веб-приложения, Opus 5.5 справилась в 39 из 40 случаев, тогда как Opus 5 дала меньшие улучшения и при этом изменила поведение приложения. Другой тестировщик попросил несколько моделей Claude построить игру по одному описанию; Opus 5.5 превзошла другие модели благодаря качеству графики и полировке.
Безопасность. Opus 5.5 показывает лучшие результаты среди всех моделей в автоматизированном поведенческом аудите — наборе тестов на согласованность, в котором Claude проверяется на тысячах смоделированных сценариев. Модель намного менее склонна к необратимым действиям или выходу за установленные границы, чем недавние модели, и более устойчива к prompt injection, чем Opus 5. Диапазон тестирования на согласованность также расширился — теперь он включает долгие задачи, невозможные задачи и сценарии на основе реальных инцидентов, хотя модель всё ещё имеет ограничения. Полная информация об оценке доступна в System Card для Opus 5.5.
Так как Opus 5.5 сравнима с Claude Mythos 5.1 в области биологии и кибербезопасности, её развёртывают с мерами защиты, аналогичными используемым для Claude Fable 5.1. Проверенные организации могут подать заявку на участие в программе проверки Life Sciences, чтобы использовать Opus 5.5 для биологических исследований. В ближайшие недели Anthropic также расширит доступ к программе проверки кибербезопасности, и проверенные специалисты по кибербезопасности смогут использовать Opus 5.5 для своей работы.
Стоимость и скорость. Opus 5.5 требует меньше вычислительных ресурсов для запуска, чем Opus 5, и цена отражает это. По тестам Anthropic, при стандартных настройках она будет стоить на 40% дешевле Opus 5 на типичных рабочих нагрузках. Входящие и исходящие токены стоят $4 и $20 за миллион соответственно — на 20% дешевле Opus 5. Чтения кэша (которые составляют большинство затрат на агентные системы и кодирование) стоят $0.20 за миллион токенов — на 60% дешевле Opus 5. Opus 5.5 также генерирует результат более чем на 30% быстрее, чем Opus 5.
Помимо снижения цены, Anthropic увеличивает ограничения на пятичасовое использование для планов Pro, Max и Team. Пользователи подписки также получают сброс лимита частоты запросов, который можно сохранить и использовать в любой момент.
Коммуникация. Opus 5.5 общается естественнее, чем предыдущие модели. Ранние тестировщики заметили, что её письмо понятнее и легче следить за логикой, что решает проблему, часто возникавшую с Opus 5. Модель выделяет самую важную информацию в начале, а её стиль делает её лучшим партнёром для долгих рабочих сессий. Как сказал один из ранних тестировщиков: «она пишет так, как я». В собственном использовании это сделало работу Opus 5.5 понятнее и проще проверять — что даёт выгоду и в плане безопасности, и в плане практичности.
Claude Sonnet 5.5 и Claude Haiku 5.5 последуют в ближайшие недели с многими из этих же улучшений производительности, эффективности и безопасности.
Производительность и экономическая эффективность
По тестам Anthropic Claude Opus 5.5 лидирует в агентном кодировании, компьютерном взаимодействии и работе со знаниями. Тем не менее, на этих уровнях возможностей преимущество в бенчмарках стало менее надёжным показателем реальных различий. В собственном использовании Anthropic разница между Opus 5.5 и Claude Fable 5.1 уже не так велика, как показывают эти оценки.
| Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol | |
|---|---|---|---|---|---|
| Агентное кодирование: Terminal-Bench 4.0¹ | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| Агентное кодирование: FrontierCode v1.1 (Main) | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| Агентное кодирование: CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — | 41.7% |
| Работа со знаниями: GDPval-AA v2.1 | 1846 | 1735 | 1708 | 1542 | 1588 |
| Бизнес-процессы: AutomationBench² | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| Многопредметное рассуждение: Humanity's Last Exam | 67.7% (с инструментами) | 65.6% (с инструментами) | 63.6% (с инструментами) | 57.2% (с инструментами) | — |
| Агентные научные исследования: Terminal-Bench-Science 0.1³ | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| Компьютерное взаимодействие: OSWorld 2.0 | 81.8% (partial) | 80.7% (partial) | 74.0% (partial) | — | — |
| Распознавание диаграмм: Chartography | 89.0% (с инструментами) | 88.4% (с инструментами) | 83.4% (с инструментами) | — | — |
Если не указано иное, все результаты Claude Opus 5.5 используют адаптивное мышление (adaptive thinking) на максимальном уровне. Результаты Terminal-Bench 4.0 отчитаны для Claude Opus 5.5 при xhigh effort и GPT-6 Astra при high effort, как сообщила OpenAI; это представляет максимальный балл каждой модели. Claude Opus 5.5 оценивалась с включёнными мерами защиты. Когда они срабатывали, задачи по кибербезопасности выполнял Claude Opus 4.8, а задачи по биологии и исследованию границ языковых моделей — Claude Opus 5. Это вероятно снижает производительность Claude Opus 5.5 на этих бенчмарках.
1 Terminal-Bench 4.0: Стандартная ошибка составляет ±2.6 pts для Claude Opus 5.5 и ±1.6–2 pts для других моделей Claude. Публичная таблица рейтингов (5 попыток/задача, Claude Code harness) указывает Claude Opus 5 при 51.8%; наша установка воспроизводит её при 52.3%, в пределах шума. Цифры GPT-6 Astra и GPT-5.6 Sol взяты из отчётов OpenAI.
2 AutomationBench: Результаты AutomationBench были запущены и отчитаны Zapier. Эти запуски проводились без резервных моделей, поэтому срабатывания мер защиты считались неудачами — это привело к более низким результатам, чем Opus 5.5 получила бы на практике. Результаты Claude Opus 5.5 взяты из собственной оценки Zapier во время раннего доступа. Результаты Opus 5, GPT-5.6 Sol и GPT-6 Astra взяты из публичной таблицы рейтингов Zapier.
3 Terminal-Bench-Science 0.1: Стандартная ошибка составляет ±3.5–5 pts на модель. Публичная таблица рейтингов (3 попытки/задача, Claude Code harness) указывает Claude Opus 5 при 30.0%; наша установка воспроизводит её при 29.0%, в пределах шума. Цифра GPT-6 Astra взята из отчётов OpenAI.
Где преимущество Opus 5.5 особенно выразительно — это эффективность. Стоимость за токен ниже, чем у Opus 5, и требует меньше токенов на задачу, что даёт в результате снижение затрат на 40%.
Цены за 1 млн токенов
| Чтения кэша | $0.20 | $0.50 |
|---|---|---|
| Входящие токены | $4 | $5 |
| Исходящие токены | $20 | $25 |
| Записи кэша | $5 | $6.25 |
Быстрый режим (fast mode) для Opus 5.5 также доступен в Claude Code и на платформе Claude с ускорением до 2.5x. Он стоит $8 за миллион входящих токенов и $40 за миллион исходящих.
Кодирование
Opus 5.5 особенно хороша в долгих и объёмных работах, таких как миграция кодовой базы по всему проекту и аудиты. Один из ранних тестировщиков использовал её для проверки и исправления кодовой базы объёмом 200 тысяч строк за три часа, тогда как Opus 5 потребовала более 20 часов и использовала в 2.5 раза больше токенов. Во внутреннем тесте Anthropic попросила Opus 5.5 и Fable 5.1 перевести HAProxy — широко используемое ПО, балансирующее нагрузку веб-трафика между серверами, — с C в Rust. Обе переписи прошли почти все регрессионные тесты HAProxy, но Opus 5.5 завершила работу за 9.5 часов против 12 часов для Fable 5.1 и обошлась на 51% дешевле.
Opus 5.5 даёт передовые результаты в агентном кодировании за долю стоимости. При стандартном уровне затрат (effort) на FrontierCode она превосходит GPT-6 Astra примерно за 20% стоимости на задачу. На Terminal Bench 4.0 она сопоставима с Astra за примерно 40% стоимости на задачу, а на CursorBench превосходит GPT-5.6 Sol на 11 пунктов за примерно треть стоимости на задачу.
Самый безопасный агент для кодирования
Предприятиям, которые используют агенты внутри своих систем, нужно знать, что эти агенты работают как задумано, особенно когда они работают самостоятельно много часов. Opus 5.5 имеет классификатор, который проверяет каждое действие перед его выполнением, открытый песочницу (sandbox), которую могут аудировать команды безопасности, и проверку кода, которая ловит уязвимости перед их слиянием (merge).
Сама модель также имеет более сильную защиту. На атаки prompt injection она соответствует или превосходит Opus 5 в каждой протестированной настройке, включая кодирование, использование инструментов, компьютерное взаимодействие и веб-просмотр. На бенчмарке, запущенном фирмой по ИИ-безопасности Gray Swan, Opus 5.5 делит первое место с Fable 5.1 по самой низкой вероятности успеха атаки prompt injection среди всех протестированных моделей.
Работа со знаниями
Opus 5.5 — надёжный и умелый исследователь. Во внутреннем тесте Anthropic попросила Opus 5.5, Fable 5.1 и Opus 5 написать отчёт о квартальной производительности компании, используя только информацию, которую она могла найти на копии веб-сайта, где пресс-релиз о доходах (earnings release) была сложно локализуема. Автоматизированный оценщик проверил каждую цифру и цитату против источников. На разных уровнях затрат 16 из 18 отчётов Opus 5.5 прошли стандарт качества Anthropic, где любой выдуманный факт или цитата привела бы к отказу. Ни Fable 5.1, ни Opus 5 не прошли этот стандарт ни в одной попытке.
Она также сильна в финансовом анализе и деловой работе. Walleye Capital, инвестиционная фирма и ранний тестировщик, отчитала, что Opus 5.5 в основном решила их набор оценок даже на самом низком уровне; на более высоких уровнях производительность была ещё лучше, заметив ошибку в инструкциях оценки и исправив её. Ни одна другая модель не уловила эту ошибку раньше.
В другом тесте Anthropic попросила Opus 5.5 и Opus 5 проанализировать предложенное слияние двух вымышленных HR-софт компаний. Каждая построила финансовую модель в Excel, затем превратила её в презентацию руководителям о том, имеет ли смысл сделка при предложенной цене. Обе модели пришли к одинаковым выводам о сделке, но модель Opus 5.5 была более тщательной и её презентация легче читается, тогда как Opus 5 имела мелкие ошибки. Opus 5.5 завершила за 63 минуты против 93 минут для Opus 5 и обошлась на 50% дешевле.
По оценкам работы со знаниями Opus 5.5 превосходит другие модели при использовании меньше токенов. На GDPval-AA v2.1, тесте реальной работы на 44 профессиях, Opus 5.5 набирает 1846 Elo, впереди Fable 5.1 и Opus 5. При стандартном уровне затрат (medium effort) Opus 5.5 превосходит GPT-6 Astra на максимальном уровне затрат примерно за пятую часть стоимости на задачу. Она также превзошла другие модели на бенчмарках, измеряющих бизнес-процессы и крупномасштабный сбор данных.
Коммуникация
Anthropic сделала значительные улучшения в том, как Opus 5.5 пишет и общается — одной из самых частых областей обратной связи, услышанной о Opus 5. Её сообщения намного проще понять с первого взгляда, что, по словам тестировщиков, помогает при долгих рабочих сессиях. Она выделяет самую важную информацию впереди, менее склонна использовать жаргон или идиосинкратические фразы и следует правилам письма, которые вы ей даёте. Это делает Opus 5.5 заметно лучшим сотрудником для сотрудничества.
Безопасность
Контроль над границами развития
На прошлой неделе генеральный директор Anthropic Дарио Амодеи утверждал, что прогресс ИИ следует контролировать, чтобы практики безопасности оставались впереди возможностей моделей. Контроль — это подход к обеспечению безопасности ИИ, сохранению конкурентоспособности с Китаем и реализации преимуществ ИИ, особенно в областях вроде биологии и медицины.
Anthropic в основном понимает риски, которые представляют современные модели, и хорошо оснащена для управления ими. Однако, по мере улучшения возможностей, могут возникнуть более серьёзные риски, и нужно готовиться к ним сейчас. По этой причине работа по безопасности проводится на двух временных горизонтах одновременно:
Практики безопасности для текущих моделей. Текущее поколение моделей опирается на установленный набор практик: обширное тестирование на согласованность, предварительную оценку внешними организациями, такими как METR и Frontier Design, и меры защиты, соответствующие возможностям каждой модели в областях высокого риска, таких как кибербезопасность и биология. Эти практики совершенствуются с каждым релизом. Anthropic верит, что они соответствуют самым серьёзным рискам, которые представляют современные модели, и что они дают широкую, хотя и не совершенную картину спектра серьёзных рисков.
Кроме того, Anthropic отслеживает способность обучать и оценивать согласованные модели и отчитывается о публичных и внутренних моделях в отчётах о рисках, которые публикует в соответствии с Политикой ответственного масштабирования, добровольной структурой для управления катастрофическими рисками от продвинутых систем ИИ.
Подготовка к будущим моделям. Anthropic готовит свои процессы обучения и оценки в предчувствии более продвинутых моделей. Совершенствуется фильтрация сред, используемых в обучении с подкреплением (reinforcement learning), так как ошибочные среды — значительный источник неправильного поведения. Кроме того, улучшаются вознаграждения за согласованность и разрабатываются автоматизированные процессы для создания новых, разнообразных сценариев для обучения безопасности. И укрепляется безопасность и мониторинг, включая сосредоточенный на улучшении мониторинга и оценки на основе интерпретируемости. Надежда на то, что такие методы помогут снизить зависимость от аудита цепочки рассуждений модели, или рассуждений, которые она выписывает во время работы.
Модели с большей мощностью — такие как те, которые могут полностью автоматизировать работу самого исследования ИИ — требуют ещё более высокого стандарта безопасности. Призывы к контролю были основаны в значительной части на ожидании, что такие модели могут быть обучены в ближайшее время. Для этих моделей Anthropic не предполагает, что описанные выше меры сами по себе будут соответствовать этому стандарту безопасности. По мере того как ИИ становится более мощным, государственная политика должна играть более крупную роль в обеспечении безопасности систем, на которые полагаются люди. Разработка этой способности требует времени, и Anthropic начала создавать инфраструктуру для её поддержки, как описано в «Мы должны контролировать границы развития» и недавнем объявлении с Accenture; более детальная информация об этих усилиях вскоре будет опубликована. Anthropic также продолжит участие в обсуждении политики с правительством и индустрией, включая подходы к регулированию и международной координации.
Согласованность (Alignment)
По первичному набору оценок Anthropic, автоматизированному поведенческому аудиту, который оценивает Claude на почти 2000 сценариях, Opus 5.5 набрала лучше, чем любая недавняя модель Claude, почти на каждом показателе неправильного поведения. Она также самая сильная модель по большинству показателей честности.
В частности, Opus 5.5 улучшается по отношению к предыдущим моделям в нескольких поведениях, способствовавших недавним инцидентам кибербезопасности, включая предвзятое или мотивированное рассуждение, попытки выхода из песочницы и предпринятие вредных действий после заключения о том, что оно находится в смоделированной среде. В новой оценке, разработанной для проверки предрасположения модели пересекать границы сдержания (containment boundaries), Opus 5.5 попыталась обойти границы на примерно 85% реже, чем Opus 5 или Claude Mythos 5.1, и каждая её попытка была низкой серьёзности и самозаявленной. Для команд, запускающих Claude без присмотра по всей их кодовой базе и системам, это так же важно, как и сырая мощность.
Однако, как описано в недавней оценке согласованности Anthropic, создание оценок, которые надёжно ловят каждый отказ перед развёртыванием, остаётся нерешённой проблемой. Есть признаки того, что Opus 5.5 часто подозревает, что она проходит оценку, что затрудняет способность оценивать, как она будет действовать в огромном разнообразии реальных сценариев, в которых она развёртывается. По мере расширения этих сценариев и увеличения возможностей модели, Anthropic ожидает, что этот вызов будет расти, если не будет прогресса на интерпретируемости. Хотя Anthropic уверена, что Opus 5.5 показывает широкие улучшения в областях, которые она способна измерить, она сочетает собственную работу по выравниванию с описанными ниже мерами защиты.
Меры защиты
Claude Opus 5.5 поставляется с установленными по умолчанию мерами защиты для высокорисковых областей. Для работы в биологии и исследовании границ моделей требуется проверка, хотя для большинства работ меры защиты будут практически невидимы. Организации, прошедшие проверку в программах Life Sciences или Cyber Verification, могут использовать модель в этих областях с меньшими ограничениями.