Быстродействие

Решения за миллисекунды.

Модель принятия решений выдаёт ответ за один forward pass без генерации токен за токеном. На собственном GPU запрос из пяти вопросов к Laya занимает около 10 мс с концами через HTTP API.

Сравнение задержек моделей
Модель Задержка (мс)
laya:multilingual 8.1 мс
laya:en 9.6 мс
gliclass 14.7 мс
nli 20.4 мс
decider:0.8b 155 мс
decider:2b 190 мс
TypeSafe Jev (hosted API) 236–276 мс

Примечание: Ollaya — медиана пятивопросного запроса через HTTP API на NVIDIA RTX 4090 (laya в fp16, остальные в fp32). Jev — медиана запроса размещённого API по данным бенчмарков третьих сторон, включая сетевую задержку. Условия различаются, воспринимайте это как сравнение порядков величины.

Совместимость с TypeSafe API

Обеспечивает совместимость с API TypeSafe.

Ollaya подает /v1/systemone и /v1/models с формами запроса и ответа TypeSafe. Официальный Python SDK TypeSafe версии 0.7.1 работает без изменений против локального сервера.

Пример запроса:

# Укажите TypeSafe SDK на Ollaya
export TYPESAFE_BASE_URL=http://localhost:11435
export TYPESAFE_API_KEY=local        # любое значение подойдёт
export TYPESAFE_DEFAULT_MODEL=laya

# …или вызовите совместимый endpoint напрямую
curl http://localhost:11435/v1/systemone -d '{
    "model": "laya",
    "state": "Can I get an invoice for last month?",
    "questions": {
      "intent": {
        "type": "choice",
        "instructions": "What does the customer want?",
        "criteria": {
          "invoice": "Needs an invoice or receipt",
          "refund": "Wants money back",
          "other": "Anything else"
        }
      }
    }
  }'

Ответ системы:

{
  "model": "laya:en",
  "answers": {
    "intent": {
      "type": "choice",
      "choice": "invoice",
      "confidence": 0.9547,
      "probabilities": {
        "invoice": 0.9698,
        "refund": 0.0172,
        "other": 0.013
      }
    }
  },
  "usage": {
    "input_tokens": 43,
    "output_tokens": 0
  }
}

Подробнее в руководстве совместимости TypeSafe.

Открытые модели

Веса в открытом доступе, готовые к загрузке.

Стартовый набор включает Laya от Convai Innovations: модель для английского, модель на 100+ языках, модель, настроенную для типизированных решений, и маршрутизатор, который выбирает подходящую автоматически.

  • laya — открытые модели принятия решений от Convai Innovations. Типизированные, калиброванные ответы на вопросы выбора, оценки и да/нет в один forward pass на английском и 100+ языках (322M и 421M параметров)
  • decider — модели принятия решений от Mapika на базе Qwen3.5: ответ считывается из логитов букв вариантов за один forward pass. Самая точная открытая модель решений в Ollaya (0.75B и 1.9B параметров)
  • nli — нулевое обучение классификаторов от Moritz Laurer: каждый вариант становится гипотезой, оценённой на следствие. Самая точная модель энкодера для типизированных решений в тестах (396M и 435M параметров)
  • gliclass — следящий инструкции нулевой классификатор от Knowledgator: все варианты вопроса оцениваются за один проход, так что стоимость почти не растет с числом вариантов (439M параметров)

Больше открытых моделей принятия решений планируется: von и GGUF LLM-ориентированные модели решений через llama.cpp.

Данные остаются вашими

Приватность по умолчанию.

Тикеты, письма и сообщения пользователей часто представляют собой самые чувствительные данные. Ollaya обрабатывает их там, где они уже находятся.

  • Локальное исполнение: работает на машине с ONNX Runtime, на CPU или GPU NVIDIA. Сервер по умолчанию слушает 127.0.0.1
  • Открытые веса: веса загружаются из репозиториев авторов на Hugging Face, привязаны к коммиту и проверяются по sha256. Ollaya никогда их не переразмещает, а runtime распространяется под Apache-2.0
  • Без поплатков за токены: запускайте столько решений, сколько может обработать оборудование. Без учёта расходов и счетов за API
  • Калибровка: вероятности, на которые можно ставить пороги. ECE калибровки Laya составляет 0.081 после подгонки температуры против 0.246 у Jev

Платформы

Работает там, где вы трудитесь.

Десктопное приложение и командная строка для macOS, Windows и Linux, Docker-образ для серверов. Каждая модель запускается на CPU; GPU NVIDIA на Linux, в WSL 2 или в Docker сокращает время обработки запроса до миллисекунд.

Платформа Десктопное приложение Командная строка GPU
macOS (Apple silicon) Приложение меню (DMG) Install script Только CPU
Windows (10 и 11, x64) Приложение (EXE или MSI) PowerShell script Только CPU, NVIDIA через WSL 2
Linux (x86-64) Приложение (AppImage, DEB, RPM) Install script, systemd service NVIDIA, CUDA 13
Linux (ARM64) Недоступно Install script, systemd service Только CPU
WSL 2 (Linux на Windows) Недоступно Install script, как Linux NVIDIA, CUDA 13
Docker (amd64 и arm64) Недоступно Image на GHCR NVIDIA, CUDA 13 (образ :cuda, amd64)

GPU NVIDIA требуют драйвер R580 или новее; установщики загружают CUDA-библиотеки только если обнаруживают GPU. На GPU Apple, AMD и Intel модели работают на CPU.

Начало работы за несколько минут

Один бинарный файл, одна команда: ollaya run laya.

macOS, Windows, Linux и Docker · Apache-2.0 · GitHub