GitHub-радар
DeepSeek выкладывает в открытый доступ свой набор инструментов для спекулятивного декодирования
DeepSeek AI открыла исходный код своей реализации спекулятивного декодирования — метода, который значительно ускоряет инференс LLM без изменения самой модели.
Спекулятивное декодирование — это метод ускорения инференса LLM, при котором маленькая «черновая» модель быстро генерирует пачку токенов, а затем более крупная «целевая» модель проверяет и исправляет всю пачку за один проход вперёд. DeepSpec включает реализации трёх методов обучения (DSpark, DFlash и Eagle3), пайплайн данных для построения кэшированных датасетов и фреймворк для оценки на датасетах GSM8K, MATH и HumanEval. Также они предоставляют предобученные черновые чекпоинты для целевых моделей Qwen3 и Gemma, которые были проверены на системах с 8 GPU.
Зачем это вайб-кодеру
Использование спекулятивного декодирования может снизить расходы на инференс, если у вас локальный инстанс LLM или вы платите за токены в облачном API. А поскольку они также предоставляют предобученные черновые чекпоинты, начать можно сразу же — просто подставив эти чекпоинты для моделей Qwen3/Gemma.
▌ Ещё находки