Почему с Opus 5 работать хуже?
По впечатлениям автора заметки и коллег, с которыми он это обсуждал, работа с Opus 5 ощущается как шаг назад по сравнению с Opus 4.7, Opus 4.8 и Fable.
Речь не идёт о снижении возможностей модели — Opus 5 действительно способнее, чем Opus 4.7 и 4.8, и даже соперничает с Fable по бенчмаркам. Но работать с этими более старыми моделями было приятнее. Причина, по мнению автора, в том, что они:
- останавливались и задавали вопросы, если намерение пользователя было неясным,
- не делали предположений без проверки,
- не переинтерпретировали и не меняли план без согласования.
Благодаря этому такие модели не требовали постоянного присмотра, в отличие от Opus 5.
Голословные предположения
Автор предполагает, что дело в двух накладывающихся друг на друга факторах, характерных для Anthropic и вообще для современных лабораторий переднего края ИИ.
Во-первых, это стремление создать самоулучшающийся ИИ, способный рекурсивно "вытянуть себя за волосы" до уровня AGI/ASI.
Во-вторых, давление необходимости показывать высокие результаты на бенчмарках. Хотя ни для кого не секрет, что многие бенчмарк-задачи плохо сформулированы, несправедливы, поддаются "взлому" или иным образом сломаны, хорошая бенчмарк-задача должна быть самодостаточной. Её можно решить. Она не требует подсказок, чтения мыслей автора задачи или внешней информации для прохождения.
Это не значит, что у хорошей задачи может быть только один правильный ответ — просто она должна одинаково засчитывать все однозначно верные ответы.
Отбор моделей, хорошо справляющихся с бенчмарками (и, по сути, обучение на них или на задачах RLVR в целом), по своей природе отбирает модели, склонные делать смелые, обычно верные предположения в условиях неопределённости. При этом наказываются модели со склонностью останавливаться и спрашивать уточнения или указания.
К сожалению, именно этого большинство пользователей и хочет от агента для написания кода.
Как ни старайся, практически невозможно полностью записать и сделать доступным для агента весь контекст, намерения, бизнес-последствия, бюджетные ограничения и прочие детали. Неизбежно возникает неопределённость и выбор, который нужно сделать, и приятно знать, что агент остановится и спросит, когда это нужно.
Реальная жизнь — это не бенчмарк. На каждый вопрос не существует гарантированно правильного ответа, ни даже набора правильных ответов, и когда на кону реальные последствия, автор не хочет, чтобы агент действовал наугад.