GitHub-радар
Большие модели на домашнем игровом компьютере
Edge-native движок вывода от команды FlashML (Berkeley/MIT): запускает крупные открытые MoE-модели вроде DeepSeek-V4-Flash на домашних NVIDIA RTX — без облака.
FreeToken — edge-native движок для запуска крупных открытых MoE-моделей (Mixture of Experts) на потребительском железе. Вышел около месяца назад и уже набрал 3300★; за проектом стоит команда FlashML из Berkeley/MIT — Matei Zaharia (один из создателей Apache Spark и Ray), Song Han, Ion Stoica — подход подтверждён статьёй на arXiv (2608.16157). Главный приём: bandwidth-adaptive CPU–GPU co-execution с LRU-кешем экспертов и семантическими чекпоинтами KV-кеша — вместо загрузки всей модели в VRAM сразу слои распределяются между GPU и оперативной памятью, горячие эксперты кешируются. Это позволяет гонять модели 290B+ — DeepSeek-V4-Flash, Qwen3.6-35B-A3B, GLM-5.2 — на NVIDIA RTX 30/40/50. API совместим с Anthropic и OpenAI, поэтому сразу подключается к Claude Code, Codex, OpenCode. Есть десктопное приложение для Windows и Linux с GUI и CLI через pip.
Зачем это вайб-кодеру
Если есть геймингвый ПК с NVIDIA RTX, можно гонять большие открытые модели локально — без платы за токены и без передачи данных в облако. Anthropic-совместимый API позволяет подключить FreeToken к Claude Code как локальный бэкенд.
Как поставить
Скопируйте и отправьте своему агенту — Claude Code, Codex, любому:
Установи FreeToken отсюда: https://github.com/FlashML-org/FreeToken — по README поставь CLI (`pip install 'freetoken[accel]'`), скачай модель (например Qwen3.6-35B-A3B) и запусти inference-сервер с OpenAI-совместимым API на localhost. Если нужны ключи или разрешения — спроси.
Нужна NVIDIA-видеокарта серии RTX 30, 40 или 50 — на Mac и на компьютере без дискретной GPU не запустит.
Открыть на GitHub▌ Ещё находки