GitHub-радар
Код-модель Qwen сжали в шесть раз для домашнего запуска
Лаборатория ISTA-DASLab сжала модель Qwen3.8-Flash-Next для кода почти в шесть раз: вырезала половину внутренних экспертов и переупаковала оставшиеся веса. Получившийся файл помещается на одну видеокарту или Mac с памятью от 32 ГБ и держит почти всё качество на повседневных задачах по коду.

Qwen выпустила Qwen3.8-Flash-Next - модель на 176,9 миллиарда параметров, собранную из множества внутренних экспертов и предназначенную для серверного запуска: в обычном виде она весит 354 гигабайта. Лаборатория ISTA-DASLab при Институте науки и технологий Австрии, которая давно занимается сжатием больших моделей, выпустила версию специально для кода: половину экспертов убрали целиком, а оставшиеся веса пересчитали в более грубый формат. Получившийся файл в формате GGUF весит 58,4 гигабайта - это примерно в шесть раз легче исходника, и он помещается в память одной видеокарты или Mac на 32 ГБ. Авторы прямо пишут, на сколько упало качество: на тесте SWE-bench Verified, где проверяются длинные агентские задачи по реальным репозиториям, модель сохраняет 91,3% результата базовой версии. На тесте LiveCodeBench, где задачи короче и проще, сохранилось 98,7% - на одиночных задачах по коду разница почти не заметна. Модель по-прежнему понимает не только код, но и изображения: эту способность при обрезке экспертов постарались не потерять.
Зачем это вайб-кодеру
Такую модель можно поставить на своё железо без подписки и без интернета. Качество честное: на коротких задачах по коду разница с полной версией едва заметна, а на длинных агентских сценариях модель слабее примерно на десятую часть. Для фронтирной работы вроде Claude Code на Opus 5 это не замена, но для простых повторяющихся задач по коду или когда на платную подписку нет денег - рабочий вариант.
Как поставить
Скопируйте и отправьте своему агенту — Claude Code, Codex, любому:
Поставь мне эту модель для работы с кодом локально: https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-Coder-GGUF - это готовый GGUF-файл, запусти его через Ollama или llama.cpp (нужен Mac от 32 ГБ памяти или видеокарта на 32 ГБ) и покажи, как ставить ей задачи по коду.
Нужен Mac от 32 ГБ единой памяти или видеокарта на 32 ГБ - столько в сжатом виде занимает сама модель.
Открыть на Hugging Face▌ Ещё находки