Пять стартапов строят замену архитектуре всех нынешних LLM
Пять стартапов строят замену трансформеру: Mercury 2 в 10× быстрее GPT-4, Liquid AI — на $50 Raspberry Pi, Dragon Hatchling — 97% судоку, где LLM дали ноль.
С 2017 года в основе каждой языковой модели лежит одна архитектура — трансформер, описанная в статье «Attention Is All You Need». Из-за механизма плотного внимания обработка документа в 10 000 слов требует 50 миллионов умножений: чем длиннее контекст, тем быстрее растут вычисления.
Пять компаний — пять подходов
MIT Technology Review описывает пять стартапов с альтернативной математикой. Inception (Пало-Альто) применяет диффузию — модель генерирует целые блоки текста одновременно; компания заявляет, что Mercury 2 работает как GPT-4, но в 10 раз быстрее. Liquid AI (Кембридж) комбинирует 20% трансформеров с 80% жидких нейронных сетей и получает модели, обходящие конкурентов вчетверо большего размера на одноплатнике Raspberry Pi за $50 — скачаны 34 миллиона раз. Dragon Hatchling от Pathway решил 97% из 250 000 задач-судоку, с которыми ведущие LLM справились в ноль процентов случаев.
Почему это стало срочным
OpenAI планирует потратить $50 млрд на вычисления в 2026 году, а потребление электроэнергии дата-центрами ожидается вдвое выше к 2030-му. Трансформеры упираются в физический потолок масштабирования — наращивать мощь всё дороже. Если хотя бы одна из альтернативных архитектур оправдает обещания, следующее поколение AI-моделей может оказаться в разы дешевле — не потому что интеллект прибавился, а потому что математика под капотом изменилась.
Источник: www.technologyreview.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →▌ Гайды по теме

Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи