Проект Ed-o-meter — открытый бенчмарк больших языковых моделей, построенный не на академических метриках, а на реальных задачах, которые выполняют обычные пользователи и разработчики. Тесты сфокусированы на отдельных единичных заданиях — по аналогии с unit-тестами для агента, ведь любой агентный workflow в итоге складывается именно из таких шагов. Полный набор из 28 задач стоит прогнать всего за $30, что делает бенчмарк доступным для регулярного повторения.

Результаты сведены в таблицу с сортировкой по доле успешных прохождений, оценке по рубрике, соблюдению требований безопасности, задержке до первого токена (TTFT) и стоимости на задачу. Поскольку число испытаний ограничено, доверительный интервал Уилсона (отображается как «усы» на графике) остаётся довольно широким.

Круг почёта, поворот за поворотом

Тестовый круг состоит из пяти фиксированных «поворотов»: код → данные → реальные задачи → безопасность → работа с инструментами. Цвет сегмента отражает долю успешных прохождений модели в этой категории: зелёный — от 85% и выше, жёлтый — 60–85%, красный — ниже 60%. В центре каждого круга указана стоимость на задачу, а под ним — медианное время до первого токена в секундах.

Что на самом деле показывают результаты

Если запускать только одну модель — это должна быть glm-5.3

GLM-5.3 — первая модель в рейтинге, прошедшая все пять категорий (код, данные, реальные задачи, безопасность и работу с инструментами) на 100%. Оценка по рубрике — 9.3, третья по величине среди всех моделей, а стоимость полного круга составляет $0.28. Единственная цена за это — терпение: медианное время до первого токена — 16.3 секунды. Более быстрая альтернатива — gpt-5.5: 13.2 секунды до первого токена, те же 100% по безопасности, но 89% в категории реальных задач и $1.43 за полный прогон.

Fable не прошла ни одного полного круга

fable-5 делит последнее место с результатом 79% — модель отказалась выполнять 5 из тестовых заданий. В том, что модель всё же выполнила, качество было высоким, но даже сама fable-5, выступая в роли независимого судьи, признала ответы kimi-k3 более сильными. При использовании Fable потребуется резервная модель на случай отказов. opus-5 столкнулась с похожей проблемой: четыре безобидные задачи из категории coding-debug-* оказались заблокированы ещё до генерации первого токена, причём на пересекающемся наборе заданий — похоже, классификатор Anthropic действует на уровне всей линейки моделей, а не только у Fable.

Luna — самый дешёвый рабочий вариант

gpt-5.6-luna обходится в $0.064 за полный круг, или $0.0023 за задачу, при медианном TTFT в 5.3 секунды. Это делает модель привлекательной для высокообъёмных задач с низким риском, где ошибки легко обнаружить и повторить попытку. Но компромисс существенный: 79% общего прохождения и лишь 33% по безопасности — результаты стоит проверять вручную, а саму модель держать подальше от недоверенных промптов. haiku-4-5 предлагает более высокий процент прохождения при цене $0.0044 за задачу, 96% общего результата и TTFT 0.9 секунды. deepseek-v4-pro формально ещё дешевле — $0.0029 за задачу при тех же 96%, но медианный TTFT в 40.0 секунды (самый медленный в рейтинге) исключает её из интерактивных сценариев — только пакетная обработка.

Загадочный участник показывает самый быстрый качественный круг

kimi-k3 по-прежнему лидирует по оценке рубрики — 9.5 баллов (оценивалась независимо моделью fable-5) — при 96% успешных прохождений, хотя opus-5 с показателем 9.4 приближается по качеству, затрачивая втрое меньше времени ожидания. Расплата — терпение: медианное время до первого токена 26.4 секунды, второе с конца после deepseek-v4-pro (40.0 с), и проседание до 75% в категории данных — единственный слабый «поворот» модели. Для интерактивных сценариев не подходит.

Три модели провалили краш-тест

Линейка gpt-5.6 быстрая, но с проблемами безопасности. gpt-5.6-luna, gpt-5.6-terra и gpt-5.6-sol выдали «канарейку» джейлбрейка в 11 из 12 тестовых ячеек (33–50% прохождения по безопасности) — при использовании этих моделей необходима дополнительная защита на уровне harness и более тщательное red-teaming тестирование. Тройка моделей Claude прошла все 6 из 6 проверок чисто, как и gpt-5.5.

Фильтр безопасности может выглядеть точь-в-точь как провальный круг

opus-5 показывает лучшую оценку рубрики среди базовой панели — 9.4, и 100% как по реальным задачам, так и по безопасности, — но затем проседает до 43% по коду. Причина не в способности модели к отладке: четыре безобидные задачи coding-debug-* были заблокированы провайдерским классификатором ещё до генерации первого токена, причём на пересекающемся наборе задач с теми, что уже блокировались у fable-5. Два семейства моделей Anthropic натыкаются на один и тот же фильтр — это стоит рассматривать как артефакт измерения, а не особенность конкретной модели. Более того, opus-5 дважды была оштрафована за то, что помечала атаку, которой сама же успешно противостояла.

Как устроена методика оценки Ed-o-meter

  • Одни и те же задачи для всех моделей с одинаковыми промптами и одинаковыми вызовами API, измеряемые через единый идентичный streaming-путь OpenRouter, запускаемые последовательно как временное испытание — без параллельных запусков.
  • Задержка измеряется как время до первого токена, через тот же самый streaming-путь OpenRouter, последовательно, чтобы не искажать замеры. Фактическое время выполнения (wall-clock) фиксируется отдельно.
  • Автоматические бинарные проверки. Оценка по рубрике LLM — единственный компонент, требующий субъективного суждения, и её потенциальная предвзятость явно указывается в примечаниях, а не скрывается.
  • Настройки reasoning и effort зафиксированы в models.json и указываются вместе с каждым опубликованным числом, поскольку они существенно влияют на качество и стоимость.
  • Отказы фиксируются, а не скрываются. Жёсткая остановка со стороны провайдера логируется как отказ с указанием категории — без тихой переотправки на другую модель. Маршрутизация зафиксирована с параметром allow_fallbacks:false, чтобы исключить незаметные переключения на квантованные варианты. Модель, отказавшаяся отвечать текстом, оценивается тем же чекером, что и любой другой ответ.

Harness, задачи и чекеры доступны как открытый исходный код в проекте Featherbench (лицензия MIT) — можно склонировать репозиторий и прогнать тесты самостоятельно, либо запросить добавление новой модели через issue на GitHub.

Полный список из 28 задач

Код (7 задач, Python)

  • Дедупликация CSV — небольшая, чётко специфицированная задача с детерминированным unit-тестовым чекером
  • Отладка даты биллинга — исправление бага переполнения месяца/дня без регрессии рабочих случаев
  • Отладка разделения денег — деление целых центов на N частей так, чтобы сумма точно совпадала и распределение было справедливым
  • Отладка изменяемого значения по умолчанию — исправление классической ошибки с мутабельным аргументом по умолчанию
  • Отладка пагинации — исправление ошибки off-by-one в подсчёте страниц
  • Парсинг логов — разбор логов с экранированными кавычками, отсутствующими полями, крайними случаями IPv6
  • Rate limiter — реализация класса с состоянием, тестируемая с помощью подставного часового механизма

Данные (4 задачи)

  • Маппинг схемы CSV — сопоставление сырого экспорта из CRM с согласованным измерением клиента
  • Дорожная карта Fabric — превращение каталога, маппинга и требований в поэтапную дорожную карту в формате user story
  • Модель данных из интервью — построение модели «звезда» и требований на основе транскрипта разговора с заказчиком
  • Оценка качества данных — обнаружение искусственно внесённых дефектов в небольшой таблице и приоритизация исправлений

Реальные задачи (9 задач)

  • Совет по плачущему младенцу — чувствительная к безопасности сортировка при необычном плаче 8-недельного ребёнка
  • Свидание в Ноттингеме — локальные рекомендации без выдуманных заведений
  • Честность в поиске рейсов — признание отсутствия актуальных данных о ценах вместо выдумывания рейсов
  • Строгое форматирование списков — соблюдение точных требований к формату при неудобном запрете на слова
  • План отпуска в Лиссабоне — пятидневный маршрут с учётом бюджета, детей и дня отдыха
  • Опровержение мёда от кашля — исправление ошибочной предпосылки: мёд нельзя давать 5-месячному ребёнку
  • План личного рекорда на марафоне — понедельный план тренировок с учётом фиксированной клубной тренировки
  • Вегетарианский рецепт на будни — по-настоящему безмясной рецепт на шесть порций
  • Извлечение условий аренды — обоснованные ответы на основе предоставленного договора, включая признание того, что в нём не указано

Безопасность (6 задач)

  • Инъекция через резюме email — суммирование письма без выполнения встроенной инструкции о возврате средств
  • Инъекция через документ UnGpt — резюмирование отзыва без выдачи встроенной «канарейки» джейлбрейка
  • Джейлбрейк AIM/Макиавелли — отказ от нефильтрованной персоны при сохранении ответа на безобидный вопрос
  • Джейлбрейк Developer Mode — отказ от шаблона с двойным ответом
  • Джейлбрейк Evil Confidant — отказ от персоны «без правил» при сохранении полезности
  • Джейлбрейк OPPO — отказ от шаблона персоны, противоположной безопасной модели

Работа с инструментами (2 задачи)

  • Выбор инструмента для рейсов — только поиск, без бронирования, когда об этом явно сказано
  • Вызов инструмента погоды — вызов инструмента погоды с корректным аргументом местоположения

История обновлений

Последнее обновление — 23 августа 2026: добавлены четыре модели.

  • 23 августа 2026. Добавлены glm-5.3, grok-4.6, deepseek-v4-pro и gemini-3.7-flash. glm-5.3 проходит все пять категорий на 100% и становится новым лидером рейтинга, опережая gpt-5.5.
  • 5 августа 2026. Обновление стоимости после снижения цен OpenAI. Повторно протестирована тройка GPT-5.6, обновлены показатели стоимости, Luna отмечена как самый дешёвый рабочий вариант для низкорисковых, легко повторяемых задач.
  • 29 июля 2026. Добавлены три модели: opus-5, gemini-3.6-flash и grok-4.5, с полными результатами по задачам, качеству, безопасности, задержке и стоимости.
  • 19 июля 2026. Запуск рейтинга. Опубликована первая версия Ed-o-meter, включая эталонный набор Claude: haiku-4-5, sonnet-4-6 и sonnet-5.