ByteDance обучает модель на 10 триллионов параметров
ByteDance тренирует модель размером до 10 триллионов параметров — в три раза крупнее ведущей китайской модели и сопоставимую с Anthropic Mythos 5.
ByteDance создаёт крупнейшую языковую модель в истории компании — до 10 триллионов параметров. По данным Financial Times со ссылкой на три источника, знакомых с проектом, модель сейчас находится на стадии предобучения, которая обычно занимает от трёх до шести месяцев. Разработкой руководит команда Seed численностью 2000 человек.
По масштабу новая модель втрое крупнее Kimi K3 от Moonshot — нынешнего рекордсмена среди китайских языковых систем. По оценкам аналитиков, она сопоставима с Anthropic Mythos 5, которому приписывают порядка 8 триллионов параметров. xAI параллельно обучает версии Grok на 6 и 10 триллионов параметров на кластере Colossus 2, о чём сообщал Илон Маск.
Основатель ByteDance Чжан Имин лично поставил перед командой директиву — добиться «мирового лидерства по возможностям модели на длинном горизонте». Компания намеренно избегала дистилляции (метода обучения меньших моделей на выходах более крупных) более года, делая ставку на оригинальное предобучение с нуля.
Параметры — не абсолютный показатель качества: данные и методы обучения решают не меньше размера. Тем не менее масштабная гонка обозначает уровень инвестиционных ставок: технологические компании держатся на убеждении, что монументальные архитектуры ещё не раскрыли весь потенциал — и первый, кто его извлечёт, получит стратегическое преимущество.
Источник: the-decoder.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →▌ Гайды по теме

Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи