← Все новости·2026-09-27·3 мин чтения

Nvidia бесплатно выложила модель, которая различает голоса в разговоре

Nvidia открыла модель Nemotron 3 Diarization весом 100 млн параметров: различает до 8 голосов, на первом месте по точности среди аналогов.

aiaudio

Nvidia опубликовала модель Nemotron 3 Diarization весом около 100 миллионов параметров и выложила её в открытый доступ на Hugging Face. Модель определяет, кто из участников говорит в данный момент, различает до восьми голосов одновременно и справляется с ситуациями, когда люди говорят друг поверх друга. В тесте VoiceArena Diarization Benchmark v1 она сейчас на первом месте с ошибкой 14,72 процента против 19,3 процента у следующей системы. А по сравнению с предыдущей версией Nvidia ошибка снизилась в среднем на 41 процент в восьми проверенных сценариях.

Мне это интересно именно потому, что диаризация — задача узкая и техническая, а не работа общего чат-агента, и модель размером в 100 миллионов параметров для такой задачи не выглядит как компромисс по качеству, как обычно бывает с маленькими универсальными моделями. Веса открыты на Hugging Face, значит модель можно скачать и запустить у себя без подписки и без обращения к чужому API, а 100 миллионов параметров — это размер, который спокойно тянет обычный сервер, а не десятки тысяч долларов в железе. Если соединить её с моделью распознавания речи вроде Parakeet, голосовой агент сможет честно подписывать, кто из собеседников что сказал.

Источник: the-decoder.com

Бесплатный курс

Хватит читать про ИИ — начни строить с ним

Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.

Начать →
ЕАЕвгений Арсентьев

Автор

Евгений Арсентьев

PhD · CEO, digital health