GitHub-радар

27-миллиардная модель в 6 ГБ: Ternary-Bonsai от Prism ML

Prism ML выпустили модель с 27 миллиардами параметров на базе Qwen от Alibaba — файл занимает 5.95 ГБ и запускается на обычном ноутбуке.

01prism-ml/Ternary-Bonsai-2-27B-gguf 547406k загрузок/мес27B параметровtext-generation

Ternary-Bonsai-2-27B — языковая модель с 27 миллиардами параметров на базе Qwen3.8-27B от Alibaba, выпущенная командой Prism ML. Модель использует троичное представление весов: каждый параметр принимает одно из трёх значений, что даёт честные 1.72 бита на вес без перехода на более высокую точность в отдельных слоях. Файл весит 5.95 ГБ — против примерно 54 ГБ у полной версии FP16. По данным авторов, модель сохраняет 98.2% точности FP16 и набирает 84.78 в среднем по 14 тестам на рассуждение; стандартная IQ2_XXS-сборка того же Qwen даёт 72.59. На M5 Max скорость около 47 токенов в секунду. Контекстное окно — 262 тысячи токенов. Файлы в формате GGUF, совместимы с llama.cpp на CUDA, Metal и CPU.

Зачем это вайб-кодеру

При размере 5.95 ГБ модель запускается на обычном ноутбуке от 8 ГБ оперативки, и это позволяет использовать модель класса 27B локально — без облачной подписки, в задачах, где важны приватность или работа без интернета. По моей оценке, качество соответствующее для локального запуска: подойдёт для простых повторяющихся задач или когда нет денег на подписку, но в серьёзной агентской работе не заменит фронтирные модели.

Как поставить

Скопируйте и отправьте своему агенту — Claude Code, Codex, любому:

Поставь мне модель Ternary-Bonsai-2-27B от Prism ML: https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf — скачай GGUF-файл и запусти через Ollama, потом покажи пример диалога.

Обычный ноутбук от 8 ГБ оперативки — модель занимает около 6 ГБ; с 16 ГБ будет свободнее.

Открыть на Hugging Face