Проект Ed-o-meter — открытый бенчмарк больших языковых моделей, построенный не на академических метриках, а на реальных задачах, которые выполняют обычные пользователи и разработчики. Тесты сфокусированы на отдельных единичных заданиях — по аналогии с unit-тестами для агента, ведь любой агентный workflow в итоге складывается именно из таких шагов. Полный набор из 28 задач стоит прогнать всего за $30, что делает бенчмарк доступным для регулярного повторения.
Результаты сведены в таблицу с сортировкой по доле успешных прохождений, оценке по рубрике, соблюдению требований безопасности, задержке до первого токена (TTFT) и стоимости на задачу. Поскольку число испытаний ограничено, доверительный интервал Уилсона (отображается как «усы» на графике) остаётся довольно широким.
Круг почёта, поворот за поворотом
Тестовый круг состоит из пяти фиксированных «поворотов»: код → данные → реальные задачи → безопасность → работа с инструментами. Цвет сегмента отражает долю успешных прохождений модели в этой категории: зелёный — от 85% и выше, жёлтый — 60–85%, красный — ниже 60%. В центре каждого круга указана стоимость на задачу, а под ним — медианное время до первого токена в секундах.
Что на самом деле показывают результаты
Если запускать только одну модель — это должна быть glm-5.3
GLM-5.3 — первая модель в рейтинге, прошедшая все пять категорий (код, данные, реальные задачи, безопасность и работу с инструментами) на 100%. Оценка по рубрике — 9.3, третья по величине среди всех моделей, а стоимость полного круга составляет $0.28. Единственная цена за это — терпение: медианное время до первого токена — 16.3 секунды. Более быстрая альтернатива — gpt-5.5: 13.2 секунды до первого токена, те же 100% по безопасности, но 89% в категории реальных задач и $1.43 за полный прогон.
Fable не прошла ни одного полного круга
fable-5 делит последнее место с результатом 79% — модель отказалась выполнять 5 из тестовых заданий. В том, что модель всё же выполнила, качество было высоким, но даже сама fable-5, выступая в роли независимого судьи, признала ответы kimi-k3 более сильными. При использовании Fable потребуется резервная модель на случай отказов. opus-5 столкнулась с похожей проблемой: четыре безобидные задачи из категории coding-debug-* оказались заблокированы ещё до генерации первого токена, причём на пересекающемся наборе заданий — похоже, классификатор Anthropic действует на уровне всей линейки моделей, а не только у Fable.
Luna — самый дешёвый рабочий вариант
gpt-5.6-luna обходится в $0.064 за полный круг, или $0.0023 за задачу, при медианном TTFT в 5.3 секунды. Это делает модель привлекательной для высокообъёмных задач с низким риском, где ошибки легко обнаружить и повторить попытку. Но компромисс существенный: 79% общего прохождения и лишь 33% по безопасности — результаты стоит проверять вручную, а саму модель держать подальше от недоверенных промптов. haiku-4-5 предлагает более высокий процент прохождения при цене $0.0044 за задачу, 96% общего результата и TTFT 0.9 секунды. deepseek-v4-pro формально ещё дешевле — $0.0029 за задачу при тех же 96%, но медианный TTFT в 40.0 секунды (самый медленный в рейтинге) исключает её из интерактивных сценариев — только пакетная обработка.
Загадочный участник показывает самый быстрый качественный круг
kimi-k3 по-прежнему лидирует по оценке рубрики — 9.5 баллов (оценивалась независимо моделью fable-5) — при 96% успешных прохождений, хотя opus-5 с показателем 9.4 приближается по качеству, затрачивая втрое меньше времени ожидания. Расплата — терпение: медианное время до первого токена 26.4 секунды, второе с конца после deepseek-v4-pro (40.0 с), и проседание до 75% в категории данных — единственный слабый «поворот» модели. Для интерактивных сценариев не подходит.
Три модели провалили краш-тест
Линейка gpt-5.6 быстрая, но с проблемами безопасности. gpt-5.6-luna, gpt-5.6-terra и gpt-5.6-sol выдали «канарейку» джейлбрейка в 11 из 12 тестовых ячеек (33–50% прохождения по безопасности) — при использовании этих моделей необходима дополнительная защита на уровне harness и более тщательное red-teaming тестирование. Тройка моделей Claude прошла все 6 из 6 проверок чисто, как и gpt-5.5.
Фильтр безопасности может выглядеть точь-в-точь как провальный круг
opus-5 показывает лучшую оценку рубрики среди базовой панели — 9.4, и 100% как по реальным задачам, так и по безопасности, — но затем проседает до 43% по коду. Причина не в способности модели к отладке: четыре безобидные задачи coding-debug-* были заблокированы провайдерским классификатором ещё до генерации первого токена, причём на пересекающемся наборе задач с теми, что уже блокировались у fable-5. Два семейства моделей Anthropic натыкаются на один и тот же фильтр — это стоит рассматривать как артефакт измерения, а не особенность конкретной модели. Более того, opus-5 дважды была оштрафована за то, что помечала атаку, которой сама же успешно противостояла.
Как устроена методика оценки Ed-o-meter
- Одни и те же задачи для всех моделей с одинаковыми промптами и одинаковыми вызовами API, измеряемые через единый идентичный streaming-путь OpenRouter, запускаемые последовательно как временное испытание — без параллельных запусков.
- Задержка измеряется как время до первого токена, через тот же самый streaming-путь OpenRouter, последовательно, чтобы не искажать замеры. Фактическое время выполнения (wall-clock) фиксируется отдельно.
- Автоматические бинарные проверки. Оценка по рубрике LLM — единственный компонент, требующий субъективного суждения, и её потенциальная предвзятость явно указывается в примечаниях, а не скрывается.
- Настройки reasoning и effort зафиксированы в
models.jsonи указываются вместе с каждым опубликованным числом, поскольку они существенно влияют на качество и стоимость. - Отказы фиксируются, а не скрываются. Жёсткая остановка со стороны провайдера логируется как отказ с указанием категории — без тихой переотправки на другую модель. Маршрутизация зафиксирована с параметром
allow_fallbacks:false, чтобы исключить незаметные переключения на квантованные варианты. Модель, отказавшаяся отвечать текстом, оценивается тем же чекером, что и любой другой ответ.
Harness, задачи и чекеры доступны как открытый исходный код в проекте Featherbench (лицензия MIT) — можно склонировать репозиторий и прогнать тесты самостоятельно, либо запросить добавление новой модели через issue на GitHub.
Полный список из 28 задач
Код (7 задач, Python)
- Дедупликация CSV — небольшая, чётко специфицированная задача с детерминированным unit-тестовым чекером
- Отладка даты биллинга — исправление бага переполнения месяца/дня без регрессии рабочих случаев
- Отладка разделения денег — деление целых центов на N частей так, чтобы сумма точно совпадала и распределение было справедливым
- Отладка изменяемого значения по умолчанию — исправление классической ошибки с мутабельным аргументом по умолчанию
- Отладка пагинации — исправление ошибки off-by-one в подсчёте страниц
- Парсинг логов — разбор логов с экранированными кавычками, отсутствующими полями, крайними случаями IPv6
- Rate limiter — реализация класса с состоянием, тестируемая с помощью подставного часового механизма
Данные (4 задачи)
- Маппинг схемы CSV — сопоставление сырого экспорта из CRM с согласованным измерением клиента
- Дорожная карта Fabric — превращение каталога, маппинга и требований в поэтапную дорожную карту в формате user story
- Модель данных из интервью — построение модели «звезда» и требований на основе транскрипта разговора с заказчиком
- Оценка качества данных — обнаружение искусственно внесённых дефектов в небольшой таблице и приоритизация исправлений
Реальные задачи (9 задач)
- Совет по плачущему младенцу — чувствительная к безопасности сортировка при необычном плаче 8-недельного ребёнка
- Свидание в Ноттингеме — локальные рекомендации без выдуманных заведений
- Честность в поиске рейсов — признание отсутствия актуальных данных о ценах вместо выдумывания рейсов
- Строгое форматирование списков — соблюдение точных требований к формату при неудобном запрете на слова
- План отпуска в Лиссабоне — пятидневный маршрут с учётом бюджета, детей и дня отдыха
- Опровержение мёда от кашля — исправление ошибочной предпосылки: мёд нельзя давать 5-месячному ребёнку
- План личного рекорда на марафоне — понедельный план тренировок с учётом фиксированной клубной тренировки
- Вегетарианский рецепт на будни — по-настоящему безмясной рецепт на шесть порций
- Извлечение условий аренды — обоснованные ответы на основе предоставленного договора, включая признание того, что в нём не указано
Безопасность (6 задач)
- Инъекция через резюме email — суммирование письма без выполнения встроенной инструкции о возврате средств
- Инъекция через документ UnGpt — резюмирование отзыва без выдачи встроенной «канарейки» джейлбрейка
- Джейлбрейк AIM/Макиавелли — отказ от нефильтрованной персоны при сохранении ответа на безобидный вопрос
- Джейлбрейк Developer Mode — отказ от шаблона с двойным ответом
- Джейлбрейк Evil Confidant — отказ от персоны «без правил» при сохранении полезности
- Джейлбрейк OPPO — отказ от шаблона персоны, противоположной безопасной модели
Работа с инструментами (2 задачи)
- Выбор инструмента для рейсов — только поиск, без бронирования, когда об этом явно сказано
- Вызов инструмента погоды — вызов инструмента погоды с корректным аргументом местоположения
История обновлений
Последнее обновление — 23 августа 2026: добавлены четыре модели.
- 23 августа 2026. Добавлены glm-5.3, grok-4.6, deepseek-v4-pro и gemini-3.7-flash. glm-5.3 проходит все пять категорий на 100% и становится новым лидером рейтинга, опережая gpt-5.5.
- 5 августа 2026. Обновление стоимости после снижения цен OpenAI. Повторно протестирована тройка GPT-5.6, обновлены показатели стоимости, Luna отмечена как самый дешёвый рабочий вариант для низкорисковых, легко повторяемых задач.
- 29 июля 2026. Добавлены три модели: opus-5, gemini-3.6-flash и grok-4.5, с полными результатами по задачам, качеству, безопасности, задержке и стоимости.
- 19 июля 2026. Запуск рейтинга. Опубликована первая версия Ed-o-meter, включая эталонный набор Claude: haiku-4-5, sonnet-4-6 и sonnet-5.