Последние несколько недель прошли в экспериментах с gpt-5.6-luna. Модель оказалась на удивление способной, быстрой и умной — регулярно выдаёт около 100 токенов в секунду и легко ориентируется в кодовой базе, почте и базе знаний.
Главное преимущество luna — стоимость. Даже при запуске довольно сложных исследовательских цепочек рассуждений набрать крупный счёт оказалось непросто. Поиск по тысячам писем в итоге обходится в десятки центов по API.

Данные предоставлены artificialanalysis.ai
С появлением GLM 5.3 на границе Парето появился ещё один вариант.
При работе с кодом обычно выбираются самые дорогие и мощные модели (Fable 5, 5.6 Sol), поэтому прогресс маленьких быстрых моделей легко упустить из виду.
Несколько инвесторов недавно заметили: «Странно, что не появляется больше потребительских AI-компаний. Почему так?»
Ответ прост: стоимость токенов.
До эпохи AI схема создания крупных потребительских приложений выглядела так:
- создать привлекательный сайт, который дёшево содержать
- привлечь пользователей (обычно за счёт виральности)
- привлечь инвестиции, масштабироваться на большее число пользователей
- создать рекламную биржу
Так работали почти все крупные потребительские компании (Google, Facebook, Snapchat и другие).1
Но если добавить AI в продукт, на каждый запрос появляются реальные расходы на инференс. Объём необходимого капитала резко возрастает.
Один из тестов — построить сайт с ежедневными новостями, персонализированный под конкретного человека:
research @calvinfo on the internet. figure out what news they might like. build a micro-site with today's top stories, personalized for them. search hn, reddit, twitter, etc.
На моделях предыдущего поколения (класс Sonnet) такой запрос обходился примерно в 1 доллар. Брать за подписку $30 в месяц при такой экономике невозможно для потребительского продукта. Здесь, конечно, есть простор для оптимизации, но если цена подписки сравнима с WSJ или The Economist, нужно давать сопоставимую ценность.
С luna результаты вполне достойные, а средняя стоимость запроса — около $0,10. Вот это уже интересно.
Ещё более любопытная картина складывается в мире бизнеса.
Сооснователь Segment Peter во время совместного похода поделился наблюдением: в его стартапах есть два типа работы.
- работа уровня «IQ 180» — когда безумный гений-учёный придумывает решение, о котором никто не думал
- работа «токенового разбрасывателя» — сверхбыстрая реакция и продвижение дел на десятках разных фронтов одновременно
Питер руководит несколькими компаниями. Помимо Segment, он привлёк более $100 млн для Charm Industrial, а недавно закрыл раунд Series A для Revoy. Он крайне организован и эффективно использует время.
И всё же по его словам, около 95% его собственной работы относится ко второй категории: звонки, напоминания людям, рутинная организационная работа.
При этом Питер уточняет, что без технического специалиста уровня IQ 180, решающего глубокие проблемы, его компании сегодня были бы обречены. Просто основной объём его личной работы приходится на вторую категорию.2
Спрос на модели «уровня фронтира» продолжит расти — особенно в областях, требующих прорывных открытий: инженерии, точных наук, обучения моделей.
Но одновременно назревает взрывной рост спроса на модели категории «быстро/дёшево/достаточно хорошо».
Стоит подумать о людях, с которыми взаимодействие происходит ежедневно: коллеги, поставщики, клиенты. В девяти случаях из десяти нужен человек, который быстро реагирует и просто решает вопрос. Большая часть «человеческих токенов» в компаниях сегодня расходуется именно так — найм сильно смещён в сторону архетипа «быстро/дёшево/достаточно хорошо».
Чтобы превратить быстрые и дешёвые модели в реальный инструмент для бизнеса, нужно проделать немалую работу: новые обвязки (harnesses), защита от prompt injection, роли и права доступа. Но эти задачи вполне решаемы.
1. Amazon и Netflix — заметные исключения.
2. Питер здесь скромничает — он на самом деле очень остёр на ум.