Запускай фронтирные модели локально с ds4

DwarfStar 4 — это узкоспециализированная инженерия вывода на C для мощных машин: Apple Silicon Mac, CUDA и ROCm. Поддерживает DeepSeek V4 и V4.1 Flash, GLM 5.x и Qwen 3.8 Flash Next с моделями для работы с текстом и изображениями, локальными API, CLI и встроенным агентом в одном стеке.

Лицензия: MIT. Написано на C с поддержкой Metal, CUDA и ROCm. Посмотреть на GitHub.

Три фазы локальной инженерии

Фаза 1: гигант

DeepSeek V4 Flash — это большая модель, основанная на mixture-of-experts. Обычный путь — удалённый сервис; ds4 отталкивается от противоположного ограничения: модель должна работать локально.

Фаза 2: коллапс

Асимметричное квантование нацелено на маршрутизируемые эксперты, сохраняя критические пути сети точными. Модель становится практичной на машинах с высоким объёмом памяти.

Фаза 3: карликовая звезда

Локальная инженерия открывает доступ через CLI, HTTP API и встроенного агента — все три интерфейса делят одно состояние модели и кеш.

Три ключевых компонента

Асимметричное 2-битное квантование

Сжимаются маршрутизируемые эксперты, критические общие пути остаются точными. Так поддерживаемые MoE модели вмещаются в целевые машины.

KV-кеш как жилец диска

Длинные префиксы сохраняются на SSD и возобновляются по хешу промпта. Перезагрузки не требуют полного пересчёта префикса.

Один движок, три интерфейса

Используй ./ds4 для чата, ./ds4-server для локальных API и ./ds4-agent для стойких сеансов кодирования.

Начало работы

Шаг 1: загрузи веса модели

$ git clone https://github.com/antirez/ds4
$ cd ds4 && ./download_model.sh ds4f-q2

Шаг 2: собери под свою платформу

$ make # macOS · Metal
$ make cuda-spark # Linux · DGX Spark

Шаг 3: общайся с ней

$ ./ds4
$ ./ds4-server --ctx 100000 # или используй как API

Требования к оборудованию

Типичные поддерживаемые конфигурации:

  • Apple Silicon Mac — 64 GB+ в зависимости от модели, Metal
  • NVIDIA DGX Spark или стандартная машина с CUDA на Linux
  • AMD Strix Halo, Framework Desktop и аналогичные, ROCm
  • Mac Studio 512 GB — V4.1 Q4 или достаток для класса PRO

Производительность

V4 Flash Q2 — базовая конфигурация. На 128 GB также вмещаются GLM 5.3 Q2 и Qwen Q4; V4.1 Q2 потоком читает с SSD.

Машина Контекст Prefill t/s Generation t/s
M5 Max, 128 GB q2 · 2,048 tokens 790.2 39.4
M5 Max, 128 GB q2 · 65,536 tokens 398.5 27.6
DGX Spark, 128 GB q2 · 2,048 tokens 825.8 18.1
DGX Spark, 128 GB q2 · 65,536 tokens 823.0 13.8

API совместимость

ds4 поддерживает стандартные интерфейсы: /v1/chat/completions, /v1/messages, /v1/responses. Вмещается в OpenCode, Claude Code, Codex CLI и другие клиенты.

Возьми контроль над локальным выводом AI

Начни с быстрого старта, проверь матрицу оборудования, затем подключи свой редактор, агента или клиент API к локальному серверу.