Представление Claude Sonnet 5.5

Anthropic представила Claude Sonnet 5.5 — вторую модель в семействе Claude 5.5. Это значительный апгрейд в сравнении с Claude Sonnet 5: работает на 30% быстрее и стоит до 30% дешевле для большинства задач.

Sonnet 5.5 является более быстрым и экономичным дополнением к Claude Opus 5.5. Если Opus 5.5 создан для сложной работы, требующей взвешенных решений, то Sonnet 5.5 лучше всего справляется с хорошо структурированными повседневными задачами, исправлением ошибок и созданием полированных документов, слайдов и таблиц. У новой модели развитый взгляд на дизайн. Claude Haiku 5.5, предназначенный для высокообъемных и чувствительных к цене приложений, присоединится к семейству Claude 5.5 в ближайшие недели.

Sonnet 5.5 улучшил показатели Sonnet 5 по нескольким направлениям:

Производительность. Sonnet 5.5 набирает 70.6% на Terminal-Bench 4.0 — бенчмарке для оценки агентного кодирования, против 10.3% у Sonnet 5. На GDPval-AA, тесте реальной работы в различных профессиях, отстает от Opus 5.5 всего на две пункта. Сильно прошелся по долгосрочным задачам и пониманию изображений — первый Sonnet, который победил Pokémon Red, используя только скриншоты.

Сотрудничество. Как и Opus 5.5, Sonnet 5.5 пишет яснее, чем модели предыдущего поколения; тестировщики назвали его лучшим партнером для совместной работы, чем Sonnet 5. Его скорость также хорошо подходит для быстрой итерации по менее сложным задачам.

Стоимость. Sonnet 5.5 имеет ту же цену, что и Sonnet 5: $2 за миллион входных токенов, $10 за миллион выходных токенов и $0.20 за миллион токенов для чтения из кэша. Однако он требует значительно меньше токенов для выполнения той же работы. В тестировании Sonnet 5.5 обойдется до 30% дешевле на задачу по сравнению с предшественником.

Скорость. Sonnet 5.5 генерирует выходные данные на 30%+ быстрее, чем Sonnet 5, став самым быстрым Sonnet на сегодняшний день.

Выравнивание и безопасность. На автоматизированном поведенческом аудите Sonnet 5.5 улучшает или совпадает с Sonnet 5 по большинству мер выравнивания. Поскольку его возможности кибербезопасности сопоставимы с Opus 5, это первый Sonnet, запускаемый с кибер-защитой и резервными вариантами, как на самых мощных моделях. Защита биологии остается той же, что у Sonnet 5. Обе защиты нацелены на узкий набор высокорисковых запросов; рутинная разработка ПО и большая часть работ в биологии не затронуты.

Производительность

Sonnet 5.5 улучшается в сравнении с Sonnet 5 по всем направлениям — в некоторых случаях драматически. На нескольких оценках Sonnet 5.5 на максимальной интенсивности даже показывает результаты, сопоставимые с Opus 5.5. Однако баллы бенчмарков отражают только одну грань возможностей модели; в собственном тестировании и тестировании внешних экспертов Opus 5.5 остается явно сильнее на сложной открытой работе, требующей устойчивого суждения.

Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Агентное кодированиеTerminal-Bench 4.0 70.6% 10.3% 66.4%¹ —
Агентное кодированиеFrontierCode 1.1 (Main) 46.2%Max² 42.4% 54.4% 49.3%
52.1%Xhigh
Агентное кодированиеCursorBench 4.0 55.5% 34.1% 57.8% —
Работа со знаниямиGDPval-AA v2.1³ 1844 1449 1846 1487⁴
Работа со знаниямиAA-Briefcase v1.1³ 1811 1359 1822 1483⁴
Многодисциплинарные рассужденияHumanity's Last Exam 64.5%с инструментами 54.9%с инструментами 67.7%с инструментами —
Компьютерное использованиеOSWorld 2.1 80.1%частичный 57.0%частичный 81.8%частичный —
Распознавание визуальных графиковChartography 61.6%без инструментов 15.6%без инструментов 64.4%без инструментов 53.6%⁴без инструментов

Подробнее о методологии оценок можно узнать в System Card для Sonnet 5.5.

Графики ниже отображают результат каждой модели в зависимости от стоимости на задачу при каждом уровне интенсивности. По мере увеличения интенсивности модели обычно работают дольше, что ведет к более высокой стоимости на задачу, но в целом и к более высокому баллу. Чем ближе точка к верхнему левому углу графика, тем больше возможностей модель доставляет на доллар.

На нескольких бенчмарках Sonnet 5.5 на низком или среднем уровне интенсивности превосходит лучший результат Sonnet 5 примерно за десятую часть стоимости на задачу. Лучше всего дополняет Opus 5.5 при работе на более низких уровнях интенсивности, где затраты ниже. На более высоких уровнях может работать с аналогичным результатом при сравнимой цене.

Сравнение производительности и стоимости моделей Claude Диаграмма точности и стоимости для различных бенчмарков

Кодирование

Скачок в производительности Sonnet 5.5 особенно заметен в кодировании. На FrontierCode при высокой интенсивности результат на 10 пунктов выше, чем у Sonnet 5 на том же уровне, при этом стоимость примерно в пятнадцать раз ниже на задачу. На CursorBench, тестирующем модели на задачах из реальных сессий Cursor, лучший результат находится в пределах двух пунктов от Opus 5.5.

Ранние тестировщики оценили, как быстро Sonnet 5.5 разбирается в кодовой базе. Их также впечатлила эффективность: в прямых сравнениях объединял вызовы инструментов вместе чаще, чем Sonnet 5, что приводило к меньшему количеству шагов и низким затратам.

«На ранних тестированиях в Epic Sonnet 5.5 прошел по такому же стандарту качества, какой можно было ожидать от модели более высокого уровня, выдержав аудит дизайна системы и проверку потока данных. Новая модель справилась с десятками тысяч строк кода архитектуры игровых систем, держала ответы в тонусе, работала над многочасовыми задачами и доставила результаты с менее предписывающей подсказкой.»
— Дэниел Фогель, главный операционный директор Epic Games

«Claude Sonnet 5.5 готовит. Быстрый в кодировании и может быстро переориентироваться в итеративных рабочих процессах. Но может и долго работать, если нужно. Он взял некоторые из естественных письменных улучшений Opus 5.5, что делает его более интересным в работе.»
— Тайлер Нишида, дизайнер Every

«Claude Sonnet 5.5 показывает лучшее суждение, чем Sonnet 5 на разных уровнях сложности, при этом тратя значительно меньше выходных токенов. Тенденция Sonnet 5 слишком часто обращаться к веб-поиску и его высокое использование токенов ушли в прошлое с этой новой моделью. Мы планируем переместить простые и умеренные проверки сейчас и больше в ближайшие недели.»
— Дэвид Локер, вице-президент AI CodeRabbit

«Claude Sonnet 5.5 доставляет производительность на уровне границы на CursorBench 4.0 с 55.5%, второе место после Opus 5.5. Мы думаем, это будет хит у разработчиков, ищущих баланс между производительностью и стоимостью.»
— Сулех Асиф, директор ML SpaceXAI

«На 118 реальных app-сборках Claude Sonnet 5.5 создал приложения, получившие оценку на уровне Opus 5. Он достиг этого в среднем за 3.6 итерации на сборку, тогда как Opus 5 требовал 7.7. Он имел наименьшее количество неудачных вызовов инструментов среди всех сравниваемых моделей. Он также редко останавливался на середине сборки, чтобы спросить пользователя, поэтому меньше сборок зависают в ожидании ответа.»
— Габриэль Гринберг, руководитель AI-инженерии Base44

«В Unity у нас высокий стандарт для завершения задач. Проекты переоткрываются и результаты проверяются во время выполнения, поэтому задача считается выполненной только когда изменение работает, а не когда модель говорит, что готово. Большая часть работы Claude Sonnet 5.5 прошла эту проверку. Он также завершил 90% задач в нашем многошаговом бенчмарке Unity Editor и кодирования, превзойдя похожие модели.»
— Сэм Чжан, творческий технолог Unity

«Когда Claude Opus 5.5 задает архитектуру и общую структуру игры, я был бы уверен, позволив Sonnet 5.5 ее реализовать. Впечатлен тем, как Sonnet 5.5 справляется с долгоживущими, сложными задачами.»
— Кевин Нго, творческий программист Creator

Работа со знаниями

Sonnet 5.5 показывает прибыль в различных областях работы со знаниями. На GDPval-AA, тестирующем модели на реальных задачах в 44 профессиях и девяти основных отраслях, Sonnet 5.5 набирает почти на уровне Opus 5.5 и примерно на 400 пунктов выше Sonnet 5. Близко к Opus 5.5 в компьютерном использовании и распознавании графиков, явно превосходит Sonnet 5 и GPT-6 Sol по долгосрочной работе со знаниями.

Ранние тестировщики выделили менее измеримые улучшения. Нашли, что это более естественный собеседник и отметили его умение в дизайне, заметив, что добавляет полированность в пользовательские интерфейсы и может следовать шаблонам слайдов для создания колод, требующих минимального редактирования. На одном внутреннем тесте ему дали материалы квартального отчета публичной компании и стенограммы звонков вместе с шаблоном слайдов и попросили подготовить 10-слайдовый операционный обзор. Два эксперта посчитали его первый вариант готовым к отправке как есть.

«Без изменения каких-либо наших подсказок Claude Sonnet 5.5 справился лучше, чем Sonnet 5 почти на всех наших автономных оценках Slackbot, за меньшее количество шагов и примерно на 14% меньше выходных токенов. Когда кто-то дает Slackbot задачу, качество и скорость — это то, что имеет значение, и Sonnet 5.5 позволяет Slackbot доставить лучшие результаты для пользователей быстрее.»
— Кёртис Аллен, главный инженер Slack

«Мы скормили Claude Sonnet 5.5 сотням реальных случаев поддержки по ответам и запросам эскалации. Он принял меньше неправильных решений и разрешил тикеты быстрее, чем модели Claude, которые мы используем в production сегодня. Тикеты обрабатывались на 20% быстрее, получая нашим клиентам нужную помощь без ожидания.»
— Абхинай Кетория, директор AI Zendesk

«На нашем приватном наборе из 2441 финансовой задачи, охватывающей Q&A, извлечение, анализ и прогнозирование, Claude Sonnet 5.5 набрал больше, чем Sonnet 5, и использовал примерно 121k токенов за ответ, тогда как Sonnet 5 использовал 497k. На нашей работе поиска и поиска аналитиков он был лучше, чем Sonnet 5 почти во всем. Для высокообъемных рабочих процессов у него было наилучшее соотношение качества и стоимости из семи протестированных моделей.»
— Джо Пуарье, старший инженер AI Balyasny Asset Management

«Claude Sonnet 5.5 даст нашим клиентам в финансовых услугах и здравоохранении уверенность использовать его для своей самой чувствительной работы. Sonnet 5.5 перепроверяет данные в исходных документах, ловя ошибки, которые Sonnet 5 не заметил. По сравнению с последней моделью Sonnet 5.5 был более точным, в 2.4 раза быстрее и использовал на 12% меньше общих токенов.»
— Яшодха Бхавнани, вице-президент AI-продуктов Box

«Claude Sonnet 5.5 думает более полно, в более надежные шаги, поэтому разработчики ждут меньше, чтобы увидеть прогресс. Наши оценки кодирования показали на треть меньше вызовов инструментов и примерно вдвое меньше shell-запусков для завершения задачи. Для повседневного кодирования и бесед с большей интенсивностью это означает более быструю итерацию и более гладкий цикл сборки.»
— Фабиан Хедин, сооснователь и CTO Lovable

«С миллионами действий, поддерживаемых Rovo каждый месяц, скорость выполнения критична. Claude Sonnet 5.5 позволит командам запускать свои Rovo Agents на 30% быстрее, чем они могли бы с Sonnet 5. Я с нетерпением жду возможности предложить клиентам этот выбор.»
— Джамиль Валлиани, руководитель продукции AI Atlassian

Стоимость и скорость

Цена за 1M токенов Claude Sonnet 5.5 Claude Opus 5.5
Чтение из кэша $0.20 $0.20
Запись в кэш $2.50 $5
Входные токены $2 $4
Выходные токены $10 $20

Sonnet 5.5 требует меньше токенов на задачу, чем Sonnet 5, поэтому его дешевле запускать. Также генерирует выходные данные на 30%+ быстрее, и его эффективность сразу заметна:

Демонстрация скорости Sonnet 5.5 при создании мурмурации скворцов Демонстрация скорости Sonnet 5.5 при моделировании песчаных дюн Демонстрация скорости Sonnet 5.5 при создании часов из часов Сравнение скорости выполнения Sonnet 5 и Sonnet 5.5

Использование уровня интенсивности позволяет балансировать стоимость и скорость относительно общего качества. В Claude Code и приложениях уровень интенсивности по умолчанию установлен на Medium, в то время как Claude Platform по умолчанию использует High. На более низких уровнях Claude отвечает быстрее и использует меньше токенов, что подходит для повседневной работы. На более высоких уровнях Claude рассуждает дольше и более тщательно проверяет свою работу.

Безопасность

Выравнивание

Sonnet 5.5 не продвигает границы возможностей модели, поэтому оценка выравнивания сосредоточилась на целевом наборе рисков, которые применяются к моделям любого уровня возможностей, включая действия против интересов пользователей, введение пользователей в заблуждение и сотрудничество в высокорисковом неправильном использовании.

На автоматизированном поведенческом аудите, который тестирует Claude примерно на 1850 сценариев, Sonnet 5.5 улучшает или совпадает с Sonnet 5 по большинству мер выравнивания, сопротивления неправильному использованию и честности. На новых оценках сдерживания Sonnet 5.5 приближается к Opus 5.5, лучшей протестированной модели, по тому, как редко она пытается выбраться из песочницы, и это наименее вероятная из всех моделей для зондирования пределов своих контейнеров. На всем аудите Opus 5.5 все еще немного лучше в целом, но мы не нашли доказательств того, что Sonnet 5.5 преследует цели, которые конфликтуют с намерением пользователя.

Как описано в недавней оценке выравнивания, ни один набор оценок надежно не ловит каждый отказ, и Sonnet 5.5 может иметь тенденции, которые мы не нашли, что является причиной, по которой мы сочетаем нашу собственную работу по выравниванию с защитами, описанными ниже.

Защиты

Кибербезопасность. Возможности кибербезопасности Sonnet 5.5 — это большой скачок вперед от Sonnet 5, поэтому развертываем с защитой, подобной защите на Opus 5.5. Пользователи все еще могут находить и исправлять ошибки в своем коде как часть обычной разработки ПО, но высокорисковые задачи кибербезопасности будут видимо откатываться на Sonnet 5. Вскоре кибердефендеры смогут подать заявку на расширенную Программу кибер-верификации для многоуровневого доступа к более продвинутым возможностям на Sonnet 5.5, Opus 5.5 и моделях Claude Mythos.

Биология. Sonnet 5.5 использует тот же набор защит биологии, что и Sonnet 5. Они нацелены на вредные запросы; большинство исследований, образования и клинической работы не затронуты, хотя некоторые запросы микробиологии и вирусологии могут быть помечены по ошибке. Организации могут подать заявку на Программу верификации наук о жизни для доступа к защитам, разработанным для полного объема работ, связанных с биологией.

Дистилляция. Атаки дистилляции, при которых злоумышленники используют тысячи поддельных учетных записей для извлечения возможностей модели в промышленном масштабе, позволяют плохим акторам создавать высокоспособные модели без защит, которые мы встраиваем в Claude. Поскольку Sonnet 5.5 намного более способен, чем его предшественник, это первый Sonnet, запускаемый с классификаторами безопасности, которые предотвращают извлечение рассуждений. Sonnet 5.5 также расширяет preserved thinking, поэтому мышление Claude не может быть отделено от учетной записи, которая его создала. Большинство разработчиков не заметят изменений. Если вы перемещаете беседы между учетными записями, включая переключение учетных записей в середине сессии в Claude Code, документация объясняет изменение.

Начало работы

Как и Opus 5.5 и Sonnet 5, Claude Sonnet 5.5 доступен с нулевым сохранением данных.

Claude Sonnet 5.5 сейчас доступен на всех платформах, включая Amazon Web Services, Google Cloud и Microsoft Azure. Разработчики могут начать работу на Claude Platform с `claude-sonnet-5-5`. Если вы запускаете Sonnet с отключенным мышлением, вам нужно переключиться на новый параметр `between_tools`, который держит предварительное мышление отключенным, перед переходом на Sonnet 5.5. Подробности см. в нашем руководстве миграции.

Сноски

1 Результаты Terminal-Bench 4.0 сообщаются для Claude Opus 5.5 на уровне интенсивности Xhigh, что представляет наибольший показатель модели.

2 Sonnet 5.5 набирает ниже на Max effort, чем на Xhigh. FrontierCode оценивает, может ли изменение кода быть объединено без редактирования человека. Он штрафует изменения вне области, даже если они высокого качества или полезны. На Max effort Sonnet 5.5 чаще запускал навык проверки кода Claude, который разделяет проверку между множеством подагентов, и в двух случаях, которые изучила Cognition, это привело к timeout или дополнительным редактированиям сверх области задачи, и поэтому к более низкому баллу.

3 Artificial Analysis запустила GDPval-AA и AA-Briefcase на предварительном выпуске Sonnet 5.5 на Claude Platform, который, как мы обнаружили, имел баг, который мог ухудшить ответы на запросы, использующие структурированные выходы. Мы ожидаем, что эффект на результаты Sonnet 5.5, если он есть, будет небольшим и недооценивать производительность. Этот баг с тех пор был исправлен.

4 OpenAI недавно исправила баг, который ухудшил понимание изображений в GPT-6 Sol. Официальные баллы AA-Briefcase v1.1 и GDPval-AA v2.1 от Artificial Analysis и баллы Chartography от Surge AI могут не быть обновлены еще, чтобы отразить последнюю версию модели. Artificial Analysis не ожидает больших влияний на AA-Briefcase v1.1 и GDPval-AA v2.1. Внутреннее тестирование Chartography предполагает, что его баллы не были затронуты.