На прошлой неделе OpenAI представила линейку GPT-5.6 — модели Sol, Terra и Luna. На презентационном стриме команда сделала акцент на управлении компьютером, показав модели, способные ориентироваться в десктопных приложениях и работать с ними. Демонстрировались агенты для работы с UI и детальные 3D-визуализации — обе возможности напрямую зависят от качества визуального понимания.
Команда Roboflow прогнала модели через собственный бенчмарк для VLM, который планируется опубликовать в ближайшие недели. Бенчмарк охватывает типичные задачи компьютерного зрения: детекцию, подсчёт объектов, OCR и извлечение данных. Ниже — результаты по каждому из направлений.

Sol — очевидно лучшая модель компьютерного зрения из всех, что выпускала OpenAI. Скачок особенно заметен в детекции объектов и подсчёте, где GPT-5.5 сильно отставала от лучших VLM. Terra и Luna слабее Sol, но обе тоже заметно прогрессировали относительно GPT-5.5.
Детекция объектов
Именно в детекции GPT-5.6 демонстрирует самый явный рывок. GPT-5.5 набрала в бенчмарке 13.8 mAP@50, а Sol — 46.2. Terra и Luna показали 44.7 и 43.3 соответственно — детекция объектов перешла из категории слабых мест в практически применимую функцию.

Распознавание разметки документов — одна из явных сильных сторон GPT-5.6. Sol хорошо справилась с заголовками, абзацами, таблицами, изображениями и подписями. Многие рабочие процессы с документами начинаются именно с локализации нужных участков страницы перед OCR или извлечением данных.

GPT-5.6 также хорошо показала себя на плотных сценах. Примеры с таблетками и яйцами содержат множество похожих объектов, тесно расположенных друг к другу, — типичное слабое место для детекции на основе VLM. В отличие от классических детекторов, VLM генерируют метку класса и координаты каждого объекта в виде текста. По мере роста числа объектов ответ становится длиннее, а вероятность пропущенных объектов, дублей или ошибок в координатах растёт. Несмотря на это, Sol распознала большинство объектов в обеих сценах.

Для лучших результатов детекции модели GPT-5.6 стоит просить возвращать абсолютные координаты XYXY в пикселях изображения. Это отличается от Gemini 3.5 Flash, которая показывала лучший результат с координатами YXYX, нормализованными в диапазон 0–1000. Использование неверного формата координат снижало точность детекции GPT-5.6 примерно на 15 пунктов mAP в этом бенчмарке.
В нескольких случаях GPT-5.6 Sol возвращала рамки в, казалось бы, случайных местах изображения. Многие из них почти не пересекались с реальными объектами. Вместо привязки к видимым объектам рамки часто образовывали неестественные шаблоны — ровные ряды или равномерно расставленные группы.


Эти примеры были переданы в OpenAI. Там подтвердили, что стабильность Sol снижается на изображениях от примерно 2000×2000 пикселей и крупнее, особенно при низком уровне reasoning effort. Повышение reasoning effort улучшает стабильность, но увеличивает расход токенов, задержку и стоимость. Наиболее практичный обходной путь — уменьшать или обрезать крупные изображения перед отправкой в API OpenAI.
Подсчёт объектов
Подсчёт улучшился по всей линейке GPT-5.6. Sol набрала 73,0% в бенчмарке против 64,9% у GPT-5.5, а Terra и Luna достигли 67,6% и 66,2%. Даже Luna — самая дешёвая модель линейки — превзошла прежний базовый уровень OpenAI.

В рамках бенчмарка тестировались случаи, требующие не просто обнаружения объектов и выдачи итоговой цифры. Sol подсчитала сильно перекрывающиеся металлические скобы — сложный случай как для классических детекторов, так и для VLM. Также модель посчитала пулевые отверстия только в выбранных зачётных зонах, продемонстрировав понимание не только того, какие объекты считать, но и где действует правило.


Блистерные упаковки оказались значительно сложнее. В отдельных запросах Sol просили посчитать пустые ячейки и таблетки, всё ещё запечатанные внутри упаковки. Повторяющийся узор, блики и небольшие визуальные различия между заполненными и пустыми ячейками усложнили обе задачи.


Пример с нестандартными конфетами выявил другой тип сбоя. Sol дала неверный подсчёт, хотя неясно, ошиблась ли модель в подсчёте конфет или неправильно поняла целевую категорию.

OCR и извлечение данных
Результаты OCR остались близки к GPT-5.5. Sol достигла 90,7% средней схожести, что всего на 0,5 пункта отстаёт от GPT-5.5 с 91,2%, а Terra и Luna показали 88,8% и 88,4%. Разрыв оказался больше в задаче извлечения текста, где Sol набрала 82,5% против 87,6% у GPT-5.5. Luna и Terra показали 81,4% и 79,4% соответственно.


В рамках бенчмарка полная транскрипция была отделена от целевого извлечения. OCR требует от модели расшифровать весь видимый текст, тогда как извлечение текста подразумевает поиск конкретной информации. Sol хорошо справилась с рукописными заметками в обоих сценариях: в одном случае выдав полную транскрипцию, а в другом — извлечённую дату.


Sol хорошо справилась с текстом, встроенным в сложные визуальные сцены. Модель прочитала маркировку размера шины, напечатанную по изогнутой поверхности грязной, изношенной покрышки. В другом примере она извлекла текущий счёт хоккейного матча из телетрансляции и вернула ответ в запрошенном формате, проверив одновременно навыки визуального чтения и следования инструкциям.


Некоторые на первый взгляд простые задачи извлечения всё же не удались. Sol не смогла прочитать срок годности, напечатанный на блистерной упаковке. Текст был мелким, вертикальным, низкоконтрастным и подвержен бликам — это могло стать причиной ошибки.

Компромиссы
Улучшения в зрении обходятся ростом расхода токенов по всей линейке GPT-5.6. При небольших тестах разница не так заметна, но при масштабировании становится важной, поскольку объём токенов напрямую увеличивает стоимость обработки.

В бенчмарке Sol в среднем тратила около 10 секунд на изображение. Terra сократила это время примерно до 6 секунд, а Luna уложилась чуть более чем в 5 секунд. Luna демонстрирует лучший баланс скорости и качества в линейке: по задержке она близка к Gemini 3.5 Flash, при этом всё ещё превосходит GPT-5.5 в детекции и подсчёте.

В этом бенчмарке обработка одного изображения моделью Sol обходилась примерно в 2,5 цента, что делает её второй по дороговизне моделью после Claude Fable 5. Terra снизила среднюю стоимость до примерно 1 цента за изображение, а Luna обходится менее чем в 0,5 цента.

При стоимости 0,8 цента за изображение Gemini 3.5 Flash значительно дешевле Sol, при этом продолжая лидировать в бенчмарках детекции и подсчёта. Это делает её сильным вариантом для задач с интенсивной обработкой данных, где стоимость масштабируется на большие партии изображений. Сервис Roboflow Playground позволяет протестировать Sol, Terra и Luna вместе с Claude Fable 5, Gemini 3.5 Flash и другими VLM на одних и тех же задачах.
Итоги
С выходом GPT-5.6 OpenAI заметно приблизилась к лидирующим VLM. Детекция превратилась из слабого места в применимую на практике возможность, а подсчёт улучшился по всей линейке моделей.
Тем не менее ограничения остаются очевидными. Gemini 3.5 Flash по-прежнему выглядит более практичным выбором для высокообъёмной детекции и подсчёта в рамках этого бенчмарка, особенно с учётом цены.
GPT-5.6 показывает, что OpenAI теперь относится к компьютерному зрению куда серьёзнее. У Sol всё ещё есть недостатки — в первую очередь в стоимости, задержке и отдельных случаях нестабильной детекции, — но прогресс сложно игнорировать. Для агентов, понимания экрана, работы с документами и визуального рассуждения этот релиз делает OpenAI гораздо более сильным вариантом, чем раньше.