GitHub-радар

MiniMax-H3: 2K-видео + звук с открытыми весами

MiniMaxAI представляет MiniMax-H3 — омнимодальный генератор видео с открытыми весами, который создаёт 4–15-секундные ролики в 2K с нативным стереозвуком 32 кГц по любому запросу: тексту, изображению, видео или аудио.

01MiniMaxAI/MiniMax-H3 4.3k3899k загрузок/мес33B параметровimage-text-to-video

MiniMax-H3 — флагманская модель MiniMaxAI для генерации видео с открытыми весами. Она генерирует видео длиной 4–15 секунд разрешением до 2K с нативным стереозвуком 32 кГц. Модель работает с любой модальностью (текст/изображение/видео/аудио), поддерживает разные соотношения сторон (21:9, 16:9, 1:1) и 11 языков (включая русский). Архитектура состоит из трёх модулей: H3-Context-IR для представления мультимодальных входных данных, H3-Base для генерации видео в 768p со звуком и H3-Regenerate-2K для апскейла до разрешения 2K. Чтобы запустить модель, нужно как минимум 4 GPU в точности BF16 (например, через SGLang с --num-gpus 4).

Зачем это вайб-кодеру

MiniMax-H3 достигает лучшего среди открытых моделей качества генерации видео с синхронизированным звуком (в других моделях это часто обрабатывается отдельно). Благодаря разрешению 2K и нативному стереозвуку 32 кГц модель способна выдавать контент профессионального качества. К сожалению, эта модель слишком требовательна к вычислениям, чтобы использовать её дома (нужны мощные GPU), но раз веса открыты, скоро она станет доступна через облачные сервисы инференса. Если вам интересна генерация видео, следите за этой моделью и не теряйте из виду опенсорсную сцену!

Как поставить

Скопируйте и отправьте своему агенту — Claude Code, Codex, любому:

Открой страницу MiniMax-H3 от MiniMaxAI и объясни, какие облачные платформы или API позволяют попробовать эту модель без серверного железа: https://huggingface.co/MiniMaxAI/MiniMax-H3 — и как к ней подключиться

Серверное железо — нужно минимум 4 видеокарты в режиме BF16. Дома не запустить.

Открыть на Hugging Face