GitHub-радар
DwarfStar: локальный деплой DeepSeek V4 Flash
Нативный движок инференса для DeepSeek V4 Flash и GLM 5.2 от Сальваторе Санфилиппо (создателя Redis) — Apple Metal (Mac), NVIDIA CUDA (мульти-GPU), AMD ROCm.
DwarfStar — это нативный движок инференса, разработанный Сальваторе Санфилиппо (создателем Redis) для DeepSeek V4 Flash / DeepSeek V4 PRO / GLM 5.2. Это НЕ обычный загрузчик GGUF. Поддерживает Apple Metal (Mac, основная цель), NVIDIA CUDA (мульти-GPU) и AMD ROCm. Использует 2-битную квантизацию только для маршрутизируемых MoE-экспертов (без общих экспертов, проекций, роутинга), сохраняя качество при небольшом размере модели. Встроенный HTTP-сервер позволяет делать микробатчинг для нескольких пользователей. Можно соединить два ноутбука MacBook M5 Max или M3 Ultra через RDMA для тензорного параллелизма. Если не хватает RAM, возможен стриминг с SSD. Бенчмарки смотрите в README. Например, на MacBook Pro M5 Max 128GB получается 39 t/s. Бета.
Зачем это вайб-кодеру
Если у вас Mac-ноутбук с 96+ ГБ RAM (M5 Max или M3 Ultra), теперь можно запускать DeepSeek V4 Flash локально без всяких платежей за облачный API! Также работает со старыми CUDA-видеокартами на архитектуре Ada Lovelace (которые vLLM больше не поддерживает для новых моделей).
Как поставить
Скопируйте и отправьте своему агенту — Claude Code, Codex, любому:
Разверни DwarfStar отсюда: https://github.com/antirez/ds4 — действуй по README, скачай квантизацию ds4f-q2 командой ./download_model.sh ds4f-q2, собери через make и покажи, как запустить ./ds4. Спроси, если понадобятся зависимости или права.
Нужен Mac с 96+ ГБ оперативки — например, MacBook Pro M5 Max или M3 Ultra. На машинах с меньшим объёмом доступен SSD-стриминг, но скорость снижается. Для PRO-модели нужно 512 ГБ.
Открыть на GitHub▌ Ещё находки