Производительность

Claude Haiku 5.5 демонстрирует значительное улучшение производительности по целому ряду тестов. Это первая модель Haiku, поддерживающая регулируемый уровень вычислительной нагрузки — пользователи могут выбирать между оптимизацией по стоимости или по качеству результатов, как и в других моделях Claude.

На тесте компьютерного взаимодействия OSWorld 2.1 Haiku 5.5 показывает 72,4% (против 15,7% у предыдущего поколения). По тестам знаний GDPval-AA v2.1 модель набирает 1620 баллов (было 735), а по многодисциплинарным рассуждениям Humanity's Last Exam — от 45,9% до 57,4% в зависимости от наличия инструментов.

В кодировании агентов Haiku 5.5 улучшился впечатляюще: на Terminal-Bench 4.0 теперь 39,2% (было 0%), на FrontierCode 1.1 — 46,4%.

По визуальному анализу (Chartography) модель достигает 46,4% без инструментов, что в семь раз выше, чем у Haiku 4.5 (6,4%).

Ценообразование

Стоимость использования Haiku 5.5 существенно ниже:

  • Чтение кэша: $0,01 за миллион токенов (для запросов до 100 тыс. токенов) против $0,10 у Haiku 4.5
  • Запись в кэш: $0,125 против $1,25
  • Входящие токены: $0,10 против $1,00
  • Выходящие токены: $0,50 против $5,00

Для запросов, превышающих 100 тыс. токенов, цены удваиваются, но остаются значительно ниже конкурентов. Около 90% запросов к предыдущему Haiku обычно попадают в категорию до 100 тыс. токенов, что делает Haiku 5.5 особенно выгодным выбором для типовых сценариев.

Безопасность

Выравнивание. Haiku 5.5 показывает значительные улучшения по большинству показателей выравнивания (alignment) относительно Haiku 4.5. Обнаружено намного меньше неправильного поведения и снижена готовность модели к сотрудничеству в контексте неправильного использования.

Гарантии безопасности. Кибербезопасность в Haiku 5.5 более строгая, чем в Haiku 4.5, но менее строгая, чем в недавних больших моделях. Модель разрешает более широкий спектр оборонительных задач, чем Sonnet 5.5, но по-прежнему блокирует тестирование на проникновение и другие приёмы, используемые злоумышленниками.

Биологические гарантии совпадают с теми, что используются в Sonnet 5, Sonnet 5.5 и Opus 5. Они позволяют работать с исследовательскими вопросами в области биологии, но ограничивают доступ к запросам, которые могут привести к вреду. Организации, занимающиеся более широким спектром биологических и кибернетических операций, могут подать заявку на участие в программе Life Sciences Verification Program и Cyber Verification Program.

Доступность

Claude Haiku 5.5 доступна на всех платформах: Amazon Web Services, Google Cloud и Microsoft Azure. На Claude Platform разработчики могут начать работу с моделью claude-haiku-5-5.

Дополнительные улучшения

Наряду с запуском Haiku 5.5, Anthropic снизила стоимость чтения кэша для Claude Sonnet 5.5 на 50%: теперь это стоит $0,10 за миллион токенов вместо $0,20. Поскольку операции чтения кэша составляют значительную часть потребления токенов, это снижает затраты на Sonnet 5.5 при работе с агентами примерно на 20%.

На этой неделе Anthropic запускает новый ежемесячный кредит API для всех подписчиков Max и Team на Claude Platform. Пользователи Max 5x получат $100 в месяц, Max 20x — $200, а Team подписчики — до $500 (общий пул для всех пользователей команды). Кредиты предназначены для экспериментов с созданием инструментов, приложений и агентов, работающих через API, и могут быть использованы на любой модели Claude.

Для разработчиков также добавлена поддержка компьютерного взаимодействия и браузерного использования в Python и TypeScript SDK для Claude (режим beta). Haiku 5.5 особенно хорошо подходит для таких задач благодаря сочетанию скорости, возможностей и цены.

Отзывы пользователей

В ранних тестах клиенты Anthropic отметили результаты, соответствующие показанным улучшениям производительности и снижению затрат.

Asana: Команда сообщила о более чем 30% сокращении задержки при выполнении задач и до 2,5x ускорении вывода на один ход агента при использовании Haiku 5.5 в AI Teammates — продукте для автоматизации работ вроде триажа ошибок, настройки проектов и поиска рискованных работ.

HubSpot: На тестовом наборе задач CRM Haiku 5.5 набрала лучший результат — 92,8% в среднем за три запуска. Модель была самой быстрой, имела наивысший показатель попаданий и минимальный процент ложных срабатываний при проверке устаревших записей.

AlphaSense: В функции Ask in Document, обрабатывающей 8 млн запросов в неделю, Haiku 5.5 показала статистически значимое улучшение: 0,84 против 0,76 у Haiku 4.5.

Box: Haiku 5.5 набрала на 11 баллов выше, чем Haiku 4.5, с примерно вдвое меньшей задержкой. Компания планирует использовать её для аналитической работы в масштабе, включая финансовые отчёты и еженедельные обзоры.

Rogo: Модель подходит для коротких высокомасштабных операций вроде быстрых поисков, работы подагентов и суммирования. Например, в то время как большая модель собирает отчет, Haiku 5.5 может быстро извлечь из 10-K документа строку доходов по сегментам, которая нужна для слайда.

Cognition: Haiku 5.5 входит в состав Devin Fusion как отличный вариант вспомогательного агента. С Haiku 5.5 в роли помощника Fusion достигает лучшего результата на FrontierCode — 66,2 при одновременном снижении затрат и задержки.