GitHub-радар

Топ-5 моделей Hugging Face за эту неделю

35-я неделя выдалась жаркой. Мультимодальная модель Qwen на 27B разгромила своего предшественника в агентных задачах, MiniMax представила генератор музыки и видеомодель со стереозвуком из коробки, а DeepSeek тихо выпустила 304B Flash-модель, которая превосходит их Pro Preview. Отличная неделя для open-source!

01Qwen/Qwen3.8-27B 12k2645k загрузок/мес27.8B параметровimage-text-to-text

Эту модель можно скачать через Ollama. Это 4-битная версия, всего 17 ГБ, так что она без проблем работает на моем Mac с 32 ГБ памяти. Qwen опубликовала мультимодальную модель на 27,8B, которая поддерживает текст, изображения и видео на входе с нативным контекстным окном в 262K токенов (можно расширить до 1M). Есть заметные улучшения по сравнению с Qwen3.6-27B (OSWorld-Verified выросла с 63,9 до 84,3, SWE-bench Pro — с 53,5 до 61,7, Terminal Bench — с 63,4 до 73,0). Мне нравится, что они добавили аргумент reasoning_effort, который позволяет настраивать глубину рассуждений. Теперь вместо того, чтобы позволять модели переусердствовать с размышлениями, можно самим решать, сколько усилий она должна на это тратить.

Зачем это вайб-кодеру

Лучшая open-source модель для локального выполнения агентных задач с мультимодальностью, контекстным окном на 1M токенов и настраиваемыми уровнями рассуждений.

Mac от 32 ГБ памяти или видеокарта на 24 ГБ

Открыть на Hugging Face
02Lightricks/LTX-2.5 1.7k790k загрузок/месimage-to-video

Я скачал LTX-2.5 от Lightricks — это не просто генератор видео, а генератор видео с синхронизированным звуком в одной модели. Главное улучшение — мультишот: можно создавать сразу несколько связанных сцен, сохраняя внешность одного и того же персонажа во всех кадрах. В предыдущей версии это было невозможно. Они улучшили свой VAE-декодер, поэтому изображения стали четче, особенно лица и текст. Также они заменили текстовый энкодер на кастомную модель Gemma 4 12B, которая корректно обрабатывает сложные промпты с несколькими персонажами. Веса выложены под коммерческой лицензией, позволяющей использовать их в проектах с выручкой до 10 млн долларов.

Зачем это вайб-кодеру

Единственная модель с открытыми весами, способная создавать синхронизированные видео (аудио + видео) с мультишотом (несколько связанных сцен сразу), при этом полностью работающая локально без ограничений API!

Видеокарта на 24 ГБ VRAM или Mac от 32 ГБ памяти (поддерживается квантизация для меньших конфигураций)

Открыть на Hugging Face
03MiniMaxAI/MiniMax-Music3 1.2k18k загрузок/мес2.4B параметровtext-to-audio

MiniMax Music3 — модель на 2,4B параметров, способная генерировать полноценные песни (до 5 минут) включая текст, инструментал и структуру (куплеты, припевы, бриджи, outro). На входе — набор куплетов/припевов и описание желаемой песни (жанр, BPM, инструменты, настроение), модель выстроит вокруг них историю. Модель использует комбинацию глобальной (8B) LLM для высокоуровневого планирования и локальной (0,6B) LLM для деталей низкого уровня, а также Flow Matching для получения стереозвука 32 кГц в формате WAV. Правда, у модели не похоже, что есть явная лицензия, так что коммерчески ее, вероятно, использовать не стоит.

Зачем это вайб-кодеру

Крошечная, но простая в использовании open-source модель генерации музыки, способная создавать полноценные песни с текстом. Работает из коробки на вашем ноутбуке через Diffusers или ComfyUI.

Обычный ноутбук от 8 ГБ оперативки

Открыть на Hugging Face
04MiniMaxAI/MiniMax-H3 4.4k4465k загрузок/мес33B параметровimage-text-to-video

Разверните MiniMax H3 — трансформер на 33B от MiniMaxAI, который превращает текст/изображения в видео с подходящим стереозвуком в разрешении до 2K. Модель разделена на 3 части: предобработка контекста, базовая генерация в 768p и апскейл до 2K (H3-Regenerate-2K пока закрытый). Использовал эту модель на задачах изображение+описание сцены, получил ролики по ~4–15 секунд при 24 fps. Это первая модель с открытыми весами, которая встретилась мне с нативной поддержкой стереозвука (без необходимости в отдельном пайплайне обработки аудио).

Зачем это вайб-кодеру

Лучшая модель с открытыми весами для одновременной генерации видео и звука в разрешении 2K для личного использования через Diffusers, SGLang, vLLM, ComfyUI.

Mac от 32 ГБ памяти или видеокарта на 24 ГБ

Открыть на Hugging Face
05deepseek-ai/DeepSeek-V4-Flash-0731 3.7k3274k загрузок/мес304B (MoE) параметровtext-generation

Запустите DeepSeek-V4-Flash-0731 через vLLM на серверном окружении. MoE-модель на 304B, выпущенная DeepSeek под лицензией MIT. «Flash» означает спекулятивное декодирование DSpark для быстрого инференса при активации лишь части от общего числа параметров. На Terminal Bench 2.1 она набрала 82,7 против 72,1 у DeepSeek-V4-Pro Preview. На DeepSWE результат вырос с 12,8 до 54,4, а на AutomationBench — с 12,8 до 25,1. Настройки reasoning_effort (low/high/max) позволяют контролировать, насколько глубоко/быстро модель должна рассуждать над задачей.

Зачем это вайб-кодеру

Лучший open-source инструмент для агентного программирования с лицензией MIT. Превосходит Pro Preview от DeepSeek по всем агентным метрикам и работает даже быстрее благодаря спекулятивному декодированию!

Серверное железо — дома не запустить

Открыть на Hugging Face