Введение
Claude Opus 5.5 — первая модель из новой семейства Claude 5.5 от Anthropic. Она работает на уровне Claude Fable 5.1 по большинству задач и стоит на 40% дешевле в эксплуатации, чем Opus 5.
Это первый релиз Anthropic после призыва к замедлению развития фронтира. Перед выпуском модель тестировали внешние оценщики, включая Frontier Design и METR. В автоматизированном поведенческом аудите — самом комплексном тесте выравнивания, который проводит Anthropic — Opus 5.5 показала лучший результат среди всех протестированных моделей. При этом она получила те же защиты, что и самые мощные модели компании.
Основные улучшения
Производительность. Opus 5.5 — значительный шаг вперёд от Opus 5. Это новая лидирующая модель, и ранние тестировщики заметили большой прирост производительности на сложных задачах. Один тестировщик завершил миграцию 680 000 строк кода менее чем за день — работа, которая заняла бы инженерной команде недели. Модель хороша в поиске и исправлении неэффективностей в ПО: когда её попросили снизить время загрузки для каждой страницы веб-приложения, Opus 5.5 преуспела в 39 из 40 случаев, тогда как Opus 5 дала более скромные улучшения, которые также изменили поведение приложения. Другой тестировщик просил несколько моделей Claude создать игру по одному описанию; Opus 5.5 набрала выше всех по качеству графики и полировки.
Безопасность. Opus 5.5 показывает лучшие результаты любой модели в автоматизированном поведенческом аудите — наборе тестов выравнивания, который проверяет Claude в тысячах симулированных сценариев. Она намного менее склонна, чем недавние модели, совершать сложно обратимые действия или выходить за установленные границы, и более устойчива к prompt injection, чем Opus 5. Расширили и тестирование выравнивания — теперь оно охватывает длинные задачи, невозможные задачи и сценарии, смоделированные на основе реальных инцидентов, хотя остаются ограничения. Полные детали оценки доступны в System Card Opus 5.5.
Так как Opus 5.5 сопоставима с Claude Mythos 5.1 в биологии и кибербезопасности, её развёртывают с защитами, аналогичными защитам Claude Fable 5.1. Проверенные организации могут сегодня подать заявку на участие в программе верификации Life Sciences, чтобы использовать Opus 5.5 для биологических исследований. В ближайшие недели расширят доступ к программе верификации Cyber, и проверенные специалисты по кибербезопасности получат возможность использовать Opus 5.5 для своей работы.
Стоимость и скорость. Opus 5.5 требует меньше вычислительных ресурсов для обслуживания, чем Opus 5, и её цена отражает это. По результатам тестирования при стандартных настройках она будет стоить на 40% дешевле Opus 5 на типичных рабочих нагрузках. Входные и выходные токены — $4 и $20 за миллион соответственно, на 20% меньше, чем Opus 5. Чтение из кеша (составляет большинство затрат на агентскую работу и кодирование) — $0,20 за миллион токенов, на 60% меньше. Opus 5.5 генерирует выход более чем на 30% быстрее, чем Opus 5.
Помимо снижения цены, повышены пятичасовые лимиты использования на тарифах Pro, Max, Team и корпоративных планах на основе мест. Пользователям подписки также предоставляют сброс лимита частоты запросов, который теперь можно сохранить и использовать в любой момент по выбору.
Коммуникация. Opus 5.5 общается более естественным образом, чем предыдущие модели. Ранние тестировщики находили её письмо более ясным и лёгким в понимании, что решает некоторые общие претензии, которые слышала компания к Opus 5. Модель выносит самую важную информацию в начало, и её стиль делает её лучшим партнёром для долгих сеансов работы. Как выразился один ранний тестировщик: «она пишет так же, как я». В собственном использовании это сделало работу Opus 5.5 легче проверять — что даёт выгоду и в безопасности, и на практике.
Claude Sonnet 5.5 и Claude Haiku 5.5 появятся в ближайшие недели с похожими улучшениями производительности, эффективности и безопасности.
Производительность и экономичность
В своих бенчмарках Claude Opus 5.5 лидирует в агентском кодировании, работе с компьютером и knowledge work. Однако на этих уровнях способности различия в бенчмарках стали менее надёжным ориентиром для реальных различий. На практике разрыв между Opus 5.5 и Claude Fable 5.1 уже, чем показывают эти оценки.
| Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol | |
|---|---|---|---|---|---|
| Agentуное кодирование (Terminal-Bench 4.0) | 66,4% | 55,8% | 52,3% | 57,9% | 37,3% |
| Агентское кодирование (FrontierCode v1.1 Main) | 54,4% | 50,3% | 48,0% | 53,3% | 47,5% |
| Агентское кодирование (CursorBench 4.0) | 57,8% | 51,8% | 46,6% | — | 41,7% |
| Knowledge work (GDPval-AA v2.1) | 1846 | 1735 | 1708 | 1542 | 1588 |
| Бизнес-процессы (AutomationBench) | 40,0% | 31,4% | 26,9% | 41,4% | 28,8% |
| Мультидисциплинарное рассуждение (Humanity's Last Exam) | 67,7% с инструментами | 65,6% с инструментами | 63,6% с инструментами | 57,2% с инструментами | — |
| Агентские научные исследования (Terminal-Bench-Science 0.1) | 58,7% | 52,6% | 29,0% | 64,6% | 22,4% |
| Работа с компьютером (OSWorld 2.0) | 81,8% частично | 80,7% частично | 74,0% частично | — | — |
| Распознавание визуальных графиков (Chartography) | 89,0% с инструментами | 88,4% с инструментами | 83,4% с инструментами | — | — |
Где преимущество Opus 5.5 совершенно очевидно — это эффективность. Она дешевле за токен, чем Opus 5, и использует меньше токенов для каждой задачи, что в итоге даёт 40-процентное снижение затрат.
| Цены за 1M токенов | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| Чтение из кеша | $0,20 | $0,50 |
| Входные токены | $4 | $5 |
| Выходные токены | $20 | $25 |
| Запись в кеш | $5 | $6,25 |
Для Opus 5.5 доступен режим быстродействия также в Claude Code и на Claude Platform с ускорением до 2,5x. Стоит $8 за миллион входных токенов и $40 за миллион выходных.
Кодирование
Opus 5.5 особенно хороша в долгих и масштабных задачах вроде миграции всей кодовой базы и аудитов. Один ранний тестировщик использовал её для аудита и исправления кодовой базы из 200 000 строк менее чем за три часа, тогда как Opus 5 потребовалась более 20 часов и использовала в 2,5 раза больше токенов. Во внутреннем тесте попросили Opus 5.5 и Fable 5.1 переписать HAProxy — широко используемое ПО для балансировки нагрузки веб-трафика между серверами — с C на Rust. Обе версии прошли почти все собственные регрессионные тесты HAProxy, но Opus 5.5 справилась за 9,5 часа против 12 у Fable 5.1 и обошлась на 51% дешевле.
Opus 5.5 даёт результаты фронтира в агентском кодировании за часть стоимости. На стандартном уровне усилий на FrontierCode она превосходит GPT-6 Astra примерно за 20% стоимости задачи. На Terminal Bench 4.0 совпадает с Astra примерно за 40% стоимости, а на CursorBench превосходит GPT-5.6 Sol на 11 пунктов примерно за треть стоимости задачи.
Ранние тестировщики сообщили о похожих скачках в эффективности и интеллекте:
GitHub: «Разработчикам нужны агенты, которые могут взяться за настоящую работу над ПО и завершить её. В наших тестах GitHub Copilot CLI и VS Code Claude Opus 5.5 использовала одно из самых малых количеств токенов и шагов, которые мы измеряли. В VS Code она решила больше терминальных задач, чем Opus 5, менее чем в половине шагов. Больше чем делая отдельные задачи эффективнее, она делает более крупные проекты разработчиков более достижимыми.» — Марио Родригес, Chief Product Officer
Clio: «Я дал Claude Opus 5.5 большую инженерную задачу по шести нашим репозиториям и дал ей работать ночью без присмотра. Она оставалась сосредоточена более 18 часов, определяя, как наши сервисы общаются друг с другом, и разбираясь, как каждый должен это применять. По сравнению с Opus 5 она достигала вех быстрее и требовала минимальной переработки. Её комментарии к коду были короткими и полезными вместо длинных и прозаических. Я стараюсь найти что-то негативное.» — Шон Хайнц, Staff Software Developer
Lovable: «Для строителей Lovable Opus 5.5 означает более быстрые сборки с той же качеством, работаете ли вы с нуля или над живым приложением. Она собирает контекст один раз, делает меньше и более полные правки и не зависает при повторных попытках, завершаясь в треть-половину меньше шагов и используя значительно меньше токенов.» — Фабиан Хедин, CTO and Co-founder
Quantium: «Мы тестировали Claude Opus 5.5 через Chat, Cowork и Claude Code — весь спектр, как работают наши команды. Сложная задача кодирования, которая раньше заняла 38 подсказок в течение четырёх дней, получена за 11 подсказок в течение трёх часов с более готовыми к производству результатами и меньшей переработкой. Для наших команд, решающих сложные проблемы в высоком темпе, это означает меньше времени на итерации и больше времени на анализ: проверку предположений, критическую проверку результатов и нахождение лучшего решения для наших клиентов.» — Харли Барнс, Executive Manager, AI Technology
Spotify: «С Claude Opus 5.5 мы заметили явное улучшение эффективности токенов в наших внутренних оценках, так как смогли выполнить те же задачи дешевле и быстрее.» — Александар Митиќ, Senior Engineer
Optiver: «Мы тестируем модели на настоящей инженерной работе и работе трейдинг-дека. На агентских задачах кодирования Claude Opus 5.5 совпадала с качеством Opus 5 примерно за половину ходов, времени и выходных токенов, сокращая стоимость этой рабочей нагрузки на 40–50%. Она набрала наивысший результат из всех, которые мы записали, на одном дек-набору поддержки торговли, передав задачи, которые не прошли предыдущие модели Claude, и заняла первое место из всех восьми моделей на задаче анализа.» — Ноян Токгозоглу, Global Head of AI Engineering
Column: «Claude Opus 5.5 делегирует субагентам намного более эффективно и проверяет свою собственную работу творческими способами. Циклы самопроверки кажутся проще установить. Она нашла возможности экономии в нашем облачном счёте, которые предыдущие модели пропустили, и при проверке кода обнаружила баг, проверяя внешние документы для интеграции третьей стороны, которую мы неправильно смоделировали несколько коммитов раньше.» — Митч Ферро, Engineering
Kiro: «Каждый вызов, который делает агент — это время и затраты, которые чувствует разработчик. На общедоступном бенчмарке настоящих задач командной строки Claude Opus 5.5 решила больше, чем Opus 5, при этом сделав примерно на 40% меньше вызовов и используя половину токенов. Для разработчиков, создающих с Kiro, это означает более быстрые и доступные сеансы агента для обычных задач и сложных проблем. Opus 5.5 вскоре будет доступна в Kiro.» — Дипак Сингх, VP of Agentic AI
Самый безопасный агент кодирования
Предприятиям, использующим агентов в своих системах, нужно знать, что агенты работают правильно, особенно когда они работают автономно много часов. Opus 5.5 имеет классификатор, который проверяет каждое действие перед его выполнением, открытую песочницу, которую могут проверить команды безопасности, и проверку кода, которая ловит уязвимости перед слиянием.
Сама модель имеет более сильные защиты. На атаках prompt injection она совпадает или превосходит Opus 5 в каждой протестированной конфигурации, включая кодирование, использование инструментов, работу с компьютером и веб-навигацию. На бенчмарке, проведённом фирмой безопасности AI Gray Swan, Opus 5.5 разделяет с Fable 5.1 самый низкий показатель успеха prompt injection из всех протестированных моделей.
Knowledge work
Opus 5.5 — надёжный и способный исследователь. В одном внутреннем тесте попросили Opus 5.5, Fable 5.1 и Opus 5 написать отчёт о квартальной производительности компании, используя только информацию, которую смогла найти в копии веба, где пресс-релиз был сложно расположен. Автоматический оценщик проверил каждую цифру и цитату по источникам. На разных уровнях усилий 16 из 18 отчётов Opus 5.5 прошли планку качества компании — любая придуманная цифра или цитата означала отказ. Ни Fable 5.1, ни Opus 5 не прошли планку ни в одной попытке.
Она также сильна в финансовом анализе и бизнес-работе. Walleye Capital, инвестиционная фирма и ранний тестировщик, сообщила, что Opus 5.5 в значительной мере решила их набор оценок на самом низком уровне; на более высоких уровнях она выполнила ещё лучше, заметив ошибку в их инструкциях оценки и исправив её. Никакая другая модель не поймала эту ошибку раньше.
В другом тесте попросили Opus 5.5 и Opus 5 проанализировать предложенное слияние двух вымышленных компаний ПО по управлению человеческими ресурсами. Каждая создала финансовую модель в Excel, затем превратила её в презентацию руководству о том, имеет ли смысл сделка по её цене. Обе модели пришли к одинаковым выводам о сделке, но модель Opus 5.5 была более тщательной, а её презентация была легче читать, тогда как у Opus 5 были небольшие ошибки. Opus 5.5 справилась за 63 минуты против 93 для Opus 5 и обошлась на 50% дешевле.
На оценках knowledge work Opus 5.5 превосходит другие модели, одновременно используя меньше токенов. На GDPval-AA v2.1, тесте настоящей работы по 44 профессиям, Opus 5.5 набирает 1846 Elo, впереди Fable 5.1 и Opus 5. На стандартном уровне усилий (средний) Opus 5.5 превосходит GPT-6 Astra на максимуме примерно за пятую часть стоимости задачи. Она также превосходила другие модели на бенчмарках бизнес-процессов и сбора крупномасштабных данных.
Deloitte Consulting LLP: «Даже на самом низком уровне усилий Claude Opus 5.5 поймала 72% известных ошибок в наших проверках кода против 56% у Opus 5 на высоком уровне, с меньшим количеством ложных тревог и частью выхода. На анализе консультирования в США низкое усилие мышления совпало с её более высокими уровнями на половине выхода и прошло наши проверки качества. Когда в производстве развёртывают больше попыток низкого мышления, это готовая к работе работа, выполненная эффективно.» — Карл Беннетт, CIO
Rogo: «Финансовым фирмам нужны результаты, которые всегда правильные. На самом низком уровне усилий Claude Opus 5.5 превзошла Opus 5 на высоком уровне на нашем BigFinance Bench примерно с 60% меньшим количеством выходных токенов. Её ответы короче и лучше структурированы, а её слайды выглядят плотнее, более в соответствии с отраслевыми стандартами.» — Стриб Уокер, Head of Product
LexisNexis Legal & Professional: «Оценка новых моделей является центральной в многомодельном подходе, лежащем в основе LexisNexis Legal Intelligence Engine. В наших первоначальных оценках Claude Opus 5.5 последовательно выявляла весьма релевантные цитаты, демонстрировала силу со статутами и структурировала свои ответы вокруг центральных правовых фреймворков и ключевых вопросов. Это именно те возможности, которые мы ищем, чтобы помочь нашим клиентам добиться большего с Lexis+ с Protégé.» — Мин Чен, Chief AI Officer
Walleye Capital: «В количественных исследованиях одно неправильное предположение может подорвать результат. На самом низком уровне усилий Claude Opus 5.5 в значительной мере решила нашу задачу оценки. На более высоких уровнях она пошла ещё дальше: она обнаружила, что минутное индексирование в наших собственных инструкциях было смещено на одну и исправила это, отметив, что это будет стоить ей очков у оценщика. Она была права, и никакая модель, которую мы тестировали, не поймала и не действовала на это раньше.» — Франк Коррао, Head of Central Equity Quant Research Engineering
Hex: «По мере того как модели становятся лучше в работе с данными, мы видим более убедительные выводы, которые данные не поддерживают. Claude Opus 5.5 продолжает копать дальше первого правдоподобного ответа. Одна задача в нашем бенчмарке DataBench спрашивает, были ли пакеты поздний или отслеживание просто медленное. Opus 5 проверила подтверждения доставки и назвала отслеживание здоровым. Opus 5.5 обнаружила, что пакеты были поздними, и отслеживание было сломано тоже. Мы вводим это в Hex agent для этой работы.» — Изи Миллер, AI Engineer
Thomson Reuters Labs: «CoCounsel объединяет несколько моделей с нашим контентом и опытом для сложной юридической работы. С Claude Opus 5.5 мы видим лучшие результаты в наших экспертных оценках и в наших внутренних бенчмарках, наряду с выигрышами в скорости и эффективности токенов. Мы в восторге о том, чтобы клиенты испытали это различие в перевалке с CoCounsel как помощник, взвешивая доказательства и уточняя своё мышление способами, которые бенчмарки не полностью охватывают.» — Омар Бари, VP Applied Research
Hebbia: «На сквозных финансовых рабочих потоках, оцениваемых по экспертным рубрикам, Claude Opus 5.5 охватила 86,6% от того, что мы ищем, против 60,3% для Opus 5. На оценках извлечения это достигла нашего лучшего когда-либо recall цитирования с лучшей эффективностью токена, чем Opus 5, что держит нашу стоимость за задачу исследования под контролем.» — Абхас Шарма, CTO
Viktor: «Viktor — это AI сотрудник, который живёт в Slack и Microsoft Teams, поэтому каждый шаг, который он делает, проявляется в наших затратах. На том же уровне усилий Claude Opus 5.5 нужно меньше шагов и вызовов инструментов на задачу, чем Opus 5, и стоит почти половину, при этом получая в два раза больше наших самых сложных задач правильно.» — Питер Альберт, Co-Founder
Коммуникация
Компания совершила крупные улучшения в том, как Opus 5.5 пишет и общается — одна из самых распространённых областей обратной связи, которая поступала о Opus 5. Её сообщения намного проще понять с первого взгляда, что, по словам тестировщиков, помогло при долгих рабочих сеансах. Модель выносит самую важную информацию вперёд, менее склонна использовать жаргон или идиосинкратические фразы и следует правилам письма, которые вы ей даёте. Компания находит, что это делает Opus 5.5 заметно лучшим сотрудником по сравнению.
Безопасность
Замедление фронтира
На этой неделе генеральный директор Anthropic Дарио Амодеи утверждал, что прогресс AI следует замедлить, чтобы практики безопасности оставались впереди возможностей моделей. Замедление — это подход к сохранению AI в безопасности, сохранению конкурентоспособности с Китаем и реализации преимуществ AI, особенно в областях вроде биологии и медицины.
Компания в значительной мере понимает риски, которые несут сегодняшние модели, и хорошо оснащена ими управлять. Однако более серьёзные риски могут появиться быстро по мере улучшения возможностей, и необходимо подготавливаться к ним сейчас. По этой причине работа по безопасности Anthropic происходит по двум временным горизонтам одновременно:
Практики безопасности для текущих моделей. Текущее поколение моделей опирается на устоявшийся набор практик: обширное тестирование выравнивания, предрелизную оценку внешними организациями такими как METR и Frontier Design, и защиты, приспособленные к каждой способности модели в высокорисковых областях вроде кибербезопасности и биологии. Компания уточняет эти практики с каждым релизом. Полагает, что они подходят для наихудших рисков, которые несут сегодняшние модели, и что они дают широкую, хотя и не идеальную, картину спектра серьёзных рисков.
Дополнительно компания отслеживает её способность обучать и оценивать выравненные модели и сообщает как об общедоступных, так и об внутренних моделях в отчётах о рисках, которые она публикует согласно её Политике ответственного масштабирования, её добровольной структуре управления катастрофическими рисками от продвинутых систем AI.
Подготовка к будущим моделям. Anthropic готовит процессы обучения и оценки в ожидании более продвинутых моделей. Усиливает, как она фильтрует окружение, используемое в усилении обучения, так как ошибочные окружения — это основной источник неправильно выравненного поведения. Дополнительно улучшает награды выравнивания и разрабатывает автоматизированные процессы для производства новых, разнообразных сценариев для обучения безопасности. И усиливает её безопасность и мониторинг, включая сосредоточенное усилие улучшить мониторинг и оценку на основе интерпретируемости. Надеется, что такие техники помогут снизить полагание на аудит цепочки мышления модели или рассуждения, которое она пишет, пока работает.
Модели с большей компетентностью — такие, которые могут полностью автоматизировать работу самого AI исследования — требуют стандарта безопасности всё ещё выше. Призывы компании к замедлению были основаны в значительной степени на её ожидании того, что такие модели можно было бы обучить вскоре. Для этих моделей компания не предполагает, что меры, описанные выше, будут отвечать этому стандарту безопасности сами по себе. По мере того как AI становится более способной, государственная политика должна играть большую роль в убеждении, что системы, на которые полагаются люди, в безопасности. Эта способность требует времени для построения, и компания начала размещать инфраструктуру для её поддержки, как описано в «Мы должны замедлить фронтир» и её недавном объявлении с Accenture; она ожидает поделиться больше деталей об этих усилиях вскоре. Будет также продолжать вносить вклад в обсуждения политики с правительством и индустрией, включая подходы к регулированию и международной координации.
Выравнивание
На основной группе оценки компании, автоматизированном поведенческом аудите, который оценивает Claude почти в 2 000 сценариях, Opus 5.5 набрала лучше, чем любая недавняя модель Claude по почти каждой мере неправильно выравненного поведения. Она также самая сильная модель компании по большинству мер честности.
В частности, Opus 5.5 улучшает над предыдущими моделями на нескольких поведениях, которые способствовали недавним инцидентам кибербезопасности, включая смещённое или мотивированное рассуждение, попытку выйти из песочницы и совершение вредоносных действий после заключения, что это была симулированная окружение. В новой оценке, разработанной для тестирования склонности модели пересекать границы удержания, Opus 5.5 пыталась обойти границы примерно на 85% меньше, чем Opus 5 или Claude Mythos 5.1, и каждая попытка была низкой серьёзности и самозаявленной. Для команд, запускающих Claude без присмотра по своим кодовым базам и системам, это так же важно, как сырая способность.
Однако, как компания описала в своей недавней оценке выравнивания, построение оценок, которые надёжно ловят каждый отказ до развёртывания, остаётся нерешённой проблемой. Компания видит признаки того, что Opus 5.5 часто подозревает, что её оценивают, что бросает вызов её способности оценить, как она будет действовать в громадном разнообразии реальных настроек, в которых её развёртывают. По мере расширения этих настроек и увеличения возможностей моделей компания ожидает, что этот вызов будет расти, если только она не добьёт прогресса в интерпретируемости. Хотя компания уверена, что Opus 5.5 показывает широкие улучшения в областях, которые она может измерить, она пары её собственную работу по выравниванию с описанными выше защитами.