Запускай фронтирные модели локально с ds4
DwarfStar 4 — это узкоспециализированная инженерия вывода на C для мощных машин: Apple Silicon Mac, CUDA и ROCm. Поддерживает DeepSeek V4 и V4.1 Flash, GLM 5.x и Qwen 3.8 Flash Next с моделями для работы с текстом и изображениями, локальными API, CLI и встроенным агентом в одном стеке.
Лицензия: MIT. Написано на C с поддержкой Metal, CUDA и ROCm. Посмотреть на GitHub.
Три фазы локальной инженерии
Фаза 1: гигант
DeepSeek V4 Flash — это большая модель, основанная на mixture-of-experts. Обычный путь — удалённый сервис; ds4 отталкивается от противоположного ограничения: модель должна работать локально.
Фаза 2: коллапс
Асимметричное квантование нацелено на маршрутизируемые эксперты, сохраняя критические пути сети точными. Модель становится практичной на машинах с высоким объёмом памяти.
Фаза 3: карликовая звезда
Локальная инженерия открывает доступ через CLI, HTTP API и встроенного агента — все три интерфейса делят одно состояние модели и кеш.
Три ключевых компонента
Асимметричное 2-битное квантование
Сжимаются маршрутизируемые эксперты, критические общие пути остаются точными. Так поддерживаемые MoE модели вмещаются в целевые машины.
KV-кеш как жилец диска
Длинные префиксы сохраняются на SSD и возобновляются по хешу промпта. Перезагрузки не требуют полного пересчёта префикса.
Один движок, три интерфейса
Используй ./ds4 для чата, ./ds4-server для локальных API и ./ds4-agent для стойких сеансов кодирования.
Начало работы
Шаг 1: загрузи веса модели
$ git clone https://github.com/antirez/ds4
$ cd ds4 && ./download_model.sh ds4f-q2
Шаг 2: собери под свою платформу
$ make # macOS · Metal
$ make cuda-spark # Linux · DGX Spark
Шаг 3: общайся с ней
$ ./ds4
$ ./ds4-server --ctx 100000 # или используй как API
Требования к оборудованию
Типичные поддерживаемые конфигурации:
- Apple Silicon Mac — 64 GB+ в зависимости от модели, Metal
- NVIDIA DGX Spark или стандартная машина с CUDA на Linux
- AMD Strix Halo, Framework Desktop и аналогичные, ROCm
- Mac Studio 512 GB — V4.1 Q4 или достаток для класса PRO
Производительность
V4 Flash Q2 — базовая конфигурация. На 128 GB также вмещаются GLM 5.3 Q2 и Qwen Q4; V4.1 Q2 потоком читает с SSD.
| Машина | Контекст | Prefill t/s | Generation t/s |
|---|---|---|---|
| M5 Max, 128 GB | q2 · 2,048 tokens | 790.2 | 39.4 |
| M5 Max, 128 GB | q2 · 65,536 tokens | 398.5 | 27.6 |
| DGX Spark, 128 GB | q2 · 2,048 tokens | 825.8 | 18.1 |
| DGX Spark, 128 GB | q2 · 65,536 tokens | 823.0 | 13.8 |
API совместимость
ds4 поддерживает стандартные интерфейсы: /v1/chat/completions, /v1/messages, /v1/responses. Вмещается в OpenCode, Claude Code, Codex CLI и другие клиенты.
Возьми контроль над локальным выводом AI
Начни с быстрого старта, проверь матрицу оборудования, затем подключи свой редактор, агента или клиент API к локальному серверу.