Запуск Desert Ant Labs

Запущена Desert Ant Labs — европейская AI лаборатория, разрабатывающая специализированные модели интеллекта, работающие целиком на устройстве. Философия проста: эффективный интеллект начинается локально, на устройстве пользователя.

Платформа предлагает небольшие, узкоспециализированные модели для работы с аудио, видео и текстом. Каждая модель выдаёт результат за миллисекунды и не требует денежных затрат на запуск, позволяя встроить интеллект в каждое взаимодействие пользователя без ограничений по стоимости токенов и скорости вывода. Модели достаточно компактны, чтобы работать на пятилетнем смартфоне, но достаточно быстры, чтобы обрабатывать каждый кадр видео или нажатие клавиши — и часто превосходят облачные API, которые разработчики сегодня используют.

Первая волна включает 18 моделей (12 стабильных и 6 в бета-версии), доступных через единый SDK для Swift, Kotlin и JavaScript. По одной модели на задачу, каждая оптимизирована для максимальной скорости на устройстве:

  • Voz: распознаёт 10 минут аудио за две секунды на iPhone — в 4,7 раза быстрее Whisper — с точной разметкой начала и конца каждого слова.
  • Clear: модель размером 9 МБ превращает пятиминутную запись с ноутбука в студийное качество за одну секунду.
  • Redact: маскирует имена, адреса и номера карт в реальном времени, на 27 языках, перед тем как данные покинут устройство.
  • Tongue: определяет 84 языка по трём словам с помощью модели размером всего 2 МБ.

Полные характеристики и бенчмарки остальных четырнадцати моделей доступны на desertant.com/models и Hugging Face. Каждая модель бесплатна для использования до 100 000 активных устройств в месяц — никаких токенов, никаких учётных записей.

История: почему возникла необходимость

Desert Ant разрабатывал видеоприложение Detail с упором на локальную обработку данных на протяжении пяти лет. Но когда вводились функции вроде Auto Edit для создания коротких клипов или улучшения аудио для подкастов, приходилось обращаться к облачным API. С ростом популярности приложения растили и счета за инфраструктуру.

Регулярно возникала необходимость поискать подходящие локальные модели: на Hugging Face охотился за моделями для выделения слов-паразитов или очистки записей. Каждый июнь выходили интересные инструменты, но индустрия двигалась недостаточно быстро. Фундамент был: вычислительные чипы, Core ML, научные исследования. Чего не хватало — всё остальное: моделей, которые можно просто заинтегрировать в приложение несколькими строками кода.

Поэтому занялись обучением собственных моделей. Выяснилось, что разработка модели — это прежде всего задача проектирования продукта. Спроектировали модели и локальный вывод, которые превосходят облачные сервисы по скорости, качеству и стоимости, и обыграют другие локальные и облачные модели на целевой задаче при существенно меньшем размере.

Заменили Dolby на улучшенное и более быстрое аудиулучшение с помощью Clear, ускорили локальное распознавание речи в 5 раз с Voz. Также заменили Claude Sonnet на Clips — модель размером 284 МБ, которая превращает десятиминутное видео в дюжину клипов за 5 секунд. Это в 10 раз быстрее и использует в 470 раз меньше энергии, чем Sonnet, с той же качеством.

Detail 6, выходящая вместе с iOS 27, заменяет все облачные API на собственные локальные модели.

Почему локальные модели логичны

Последние несколько лет разработчики строили решения на LLM как на обычном API. На волне ажиотажа вокруг больших универсальных моделей индустрия забыла, что существуют другие варианты.

Любой разработчик может перечислить локальные модели, которые хотел бы использовать, если бы не платёж за каждый вызов. Или функции, которые кровят токенами и охотно заменил бы локальной моделью. Вызовы, которые выполняются одинаково тысячи раз в день: очистка записи, классификация фото, извлечение даты из текста, ловля имени до того, как текст дойдёт до сервера. Ничего из этого не требует фронтальную модель.

Собственные исследователи NVIDIA разобрали три агентские системы и подсчитали, что 40–70% обращений к большой модели можно переадресовать небольшой специализированной вместо этого.

Вычисления уже оплачены

Индустрия потратит около 450 миллиардов долларов на дата-центры в этом году. В то же время мир отправляет более миллиарда смартфонов, планшетов и ноутбуков со всё более способными чипами, идеально подходящими для решения таких задач. Вычислительной мощности в руках людей больше, чем во всех AI дата-центрах на земле вместе взятых.

Получается значительное преимущество с нулевой стоимостью вывода. Без платежей за каждый вызов функция может работать на каждом сообщении, а не только на тех, которые разработчик может себе позволить проверить. Никаких промежуточных запросов, и данные пользователя никогда не покидают устройство. Когда вывод бесплатный, способ разработки продуктов меняется полностью.

Маленькие мозги в каждом продукте

Чтобы работать с локальными моделями, нужно существенно улучшить опыт разработчика. Требуются модели, которые можно использовать коммерчески, которые превосходят альтернативы по скорости и качеству на конкретной задаче, которые можно интегрировать в приложение несколькими строками кода и которые легко находятся.

Первые сто моделей подобны мозжечку — маленькому мозгу. Мозжечок справляется с постоянной работой: равновесие, синхронизация, навыки, о которых не думаешь, освобождая остальной мозг для раздумий. Именно это начинаем строить: быстрые, специализированные модели для работы, которая идёт весь день, на устройстве, бесплатно.

Потом придёт кора — слой, решающий, какая модель ответит. Сначала небольшая локальная модель, потом большая, когда задача это требует, облако только когда работа должна покинуть устройство. По мере продвижения открытых исследований и роста возможностей чипов локальные модели будут расширяться, и сами обучим более крупные. Фронтальный интеллект, построенный снизу вверх.

Облачные лаборатории выпускают нейтральные модели, потому что ценообразование по токенам требует нейтральности. Каждая модель Desert Ant поставляется с выбранным по умолчанию вариантом и рычагами для его изменения. Оптимизируются модель и runtime вместе: на iPhone Clear и Voz работают через Neural Engine, а в браузере веса Clear работают через WebAssembly.

SDK

Готовы начать? Модели Desert Ant можно интегрировать в приложение с помощью нативного SDK для Swift, Kotlin и JavaScript, доступного на GitHub.

Документация написана для разработчиков и агентов. Модели можно попробовать на Mac с помощью CLI, или в браузере на Hugging Face.

Создаёте что-то интересное с использованием моделей или хотите разрабатывать их вместе с лабораторией? Свяжитесь.