Быстродействие
Решения за миллисекунды.
Модель принятия решений выдаёт ответ за один forward pass без генерации токен за токеном. На собственном GPU запрос из пяти вопросов к Laya занимает около 10 мс с концами через HTTP API.
| Модель | Задержка (мс) |
|---|---|
| laya:multilingual | 8.1 мс |
| laya:en | 9.6 мс |
| gliclass | 14.7 мс |
| nli | 20.4 мс |
| decider:0.8b | 155 мс |
| decider:2b | 190 мс |
| TypeSafe Jev (hosted API) | 236–276 мс |
Примечание: Ollaya — медиана пятивопросного запроса через HTTP API на NVIDIA RTX 4090 (laya в fp16, остальные в fp32). Jev — медиана запроса размещённого API по данным бенчмарков третьих сторон, включая сетевую задержку. Условия различаются, воспринимайте это как сравнение порядков величины.
Совместимость с TypeSafe API
Обеспечивает совместимость с API TypeSafe.
Ollaya подает /v1/systemone и /v1/models с формами запроса и ответа TypeSafe. Официальный Python SDK TypeSafe версии 0.7.1 работает без изменений против локального сервера.
Пример запроса:
# Укажите TypeSafe SDK на Ollaya
export TYPESAFE_BASE_URL=http://localhost:11435
export TYPESAFE_API_KEY=local # любое значение подойдёт
export TYPESAFE_DEFAULT_MODEL=laya
# …или вызовите совместимый endpoint напрямую
curl http://localhost:11435/v1/systemone -d '{
"model": "laya",
"state": "Can I get an invoice for last month?",
"questions": {
"intent": {
"type": "choice",
"instructions": "What does the customer want?",
"criteria": {
"invoice": "Needs an invoice or receipt",
"refund": "Wants money back",
"other": "Anything else"
}
}
}
}'
Ответ системы:
{
"model": "laya:en",
"answers": {
"intent": {
"type": "choice",
"choice": "invoice",
"confidence": 0.9547,
"probabilities": {
"invoice": 0.9698,
"refund": 0.0172,
"other": 0.013
}
}
},
"usage": {
"input_tokens": 43,
"output_tokens": 0
}
}
Подробнее в руководстве совместимости TypeSafe.
Открытые модели
Веса в открытом доступе, готовые к загрузке.
Стартовый набор включает Laya от Convai Innovations: модель для английского, модель на 100+ языках, модель, настроенную для типизированных решений, и маршрутизатор, который выбирает подходящую автоматически.
- laya — открытые модели принятия решений от Convai Innovations. Типизированные, калиброванные ответы на вопросы выбора, оценки и да/нет в один forward pass на английском и 100+ языках (322M и 421M параметров)
- decider — модели принятия решений от Mapika на базе Qwen3.5: ответ считывается из логитов букв вариантов за один forward pass. Самая точная открытая модель решений в Ollaya (0.75B и 1.9B параметров)
- nli — нулевое обучение классификаторов от Moritz Laurer: каждый вариант становится гипотезой, оценённой на следствие. Самая точная модель энкодера для типизированных решений в тестах (396M и 435M параметров)
- gliclass — следящий инструкции нулевой классификатор от Knowledgator: все варианты вопроса оцениваются за один проход, так что стоимость почти не растет с числом вариантов (439M параметров)
Больше открытых моделей принятия решений планируется: von и GGUF LLM-ориентированные модели решений через llama.cpp.
Данные остаются вашими
Приватность по умолчанию.
Тикеты, письма и сообщения пользователей часто представляют собой самые чувствительные данные. Ollaya обрабатывает их там, где они уже находятся.
- Локальное исполнение: работает на машине с ONNX Runtime, на CPU или GPU NVIDIA. Сервер по умолчанию слушает 127.0.0.1
- Открытые веса: веса загружаются из репозиториев авторов на Hugging Face, привязаны к коммиту и проверяются по sha256. Ollaya никогда их не переразмещает, а runtime распространяется под Apache-2.0
- Без поплатков за токены: запускайте столько решений, сколько может обработать оборудование. Без учёта расходов и счетов за API
- Калибровка: вероятности, на которые можно ставить пороги. ECE калибровки Laya составляет 0.081 после подгонки температуры против 0.246 у Jev
Платформы
Работает там, где вы трудитесь.
Десктопное приложение и командная строка для macOS, Windows и Linux, Docker-образ для серверов. Каждая модель запускается на CPU; GPU NVIDIA на Linux, в WSL 2 или в Docker сокращает время обработки запроса до миллисекунд.
| Платформа | Десктопное приложение | Командная строка | GPU |
|---|---|---|---|
| macOS (Apple silicon) | Приложение меню (DMG) | Install script | Только CPU |
| Windows (10 и 11, x64) | Приложение (EXE или MSI) | PowerShell script | Только CPU, NVIDIA через WSL 2 |
| Linux (x86-64) | Приложение (AppImage, DEB, RPM) | Install script, systemd service | NVIDIA, CUDA 13 |
| Linux (ARM64) | Недоступно | Install script, systemd service | Только CPU |
| WSL 2 (Linux на Windows) | Недоступно | Install script, как Linux | NVIDIA, CUDA 13 |
| Docker (amd64 и arm64) | Недоступно | Image на GHCR | NVIDIA, CUDA 13 (образ :cuda, amd64) |
GPU NVIDIA требуют драйвер R580 или новее; установщики загружают CUDA-библиотеки только если обнаруживают GPU. На GPU Apple, AMD и Intel модели работают на CPU.
Начало работы за несколько минут
Один бинарный файл, одна команда: ollaya run laya.
macOS, Windows, Linux и Docker · Apache-2.0 · GitHub