GitHub-радар

ZDTaichu 5.0: локальная 9B-модель с пространственным зрением

TaichuAI выпустили ZDTaichu5.0-9B — мультимодальную модель для понимания картинок, видео и пространственных отношений, которая запускается локально примерно на 6 ГБ в 4-битной версии.

01TaichuAI/ZDTaichu5.0-9B 3836.9k загрузок/мес9.8B параметровimage-text-to-text

ZDTaichu5.0-9B — по словам авторов, «мультимодальная базовая модель для общего понимания изображений, пространственного мышления, агентного использования инструментов и исследований воплощённого ИИ». Модель от TaichuAI объединяет языковую модель Qwen3.5-9B с визуальным энкодером C-RADIOv4-H. Принимает на вход текст, изображения и видео, контекстное окно — 128 тысяч токенов. Умеет рассуждать о пространстве на картинке: объяснять, где что расположено и как объекты соотносятся. В сравнении с другими моделями общего назначения до 10 миллиардов параметров — лучший результат по пространственному мышлению и агентным задачам. В 4-битной версии занимает около 6 ГБ и запускается на обычном ноутбуке. Лицензия — NVIDIA Open Model License Agreement.

Зачем это вайб-кодеру

Для задач, где модели нужно посмотреть на картинку и понять пространственный контекст — описать комнату, разобрать схему, понять интерфейс — это сильный локальный вариант в классе 9B. Я бы взял её для простых повторяющихся задач с изображениями, где не нужна платная облачная подписка. Результаты на агентных задачах для такого размера тоже необычны. Главный минус: нет готового файла для Ollama, нужна настройка через Python.

Как поставить

Скопируйте и отправьте своему агенту — Claude Code, Codex, любому:

Установи мне мультимодальную модель ZDTaichu5.0-9B от TaichuAI: https://huggingface.co/TaichuAI/ZDTaichu5.0-9B — подбери подходящий вариант для моего компьютера, настрой через transformers и покажи, как задать ей вопрос по картинке.

Обычный ноутбук от 16 ГБ оперативки — в 4-битной версии модель занимает около 6 ГБ.

Открыть на Hugging Face