GitHub-радар

APEX: открытый аппаратный чип для запуска LLM на FPGA

Sigmantic AI опубликовала APEX — полностью открытый, верифицированный аппаратный проект трансформерного декодера, запускающего настоящие языковые модели прямо на FPGA. Ключевое решение: KV-кеш сжимается прямо в железе, поэтому скорость не падает с ростом длины диалога.

APEX — открытый аппаратный проект (RTL) одного полного трансформерного декодера от Sigmantic AI, созданный с помощью их автономных агентов верификации. Модель Qwen2.5-0.5B выдаёт 0,56 токена в секунду на реальном FPGA-оборудовании — рост в 140 раз относительно начального результата. Каждый блок верифицируется побитово на соответствие эталонной NumPy-модели.

Зачем это вайб-кодеру

Сжимая KV-кеш прямо в железе, чип удерживает скорость инференса постоянной даже при очень длинных разговорах — именно это замедляет облачный ИИ при длинном контексте. Проект полностью открыт и воспроизводим из клона репозитория, что в аппаратном ИИ встречается крайне редко.

Открыть на GitHub