GitHub-радар
Swiftlet: 35B-модели Qwen на iPhone и Mac
Открытый Swift-рантайм на Metal, который стримит веса 35B и 80B модели Qwen прямо с диска — в RAM держится только 2–3 ГБ. Работает на Mac с чипами Apple Silicon и на iPhone 17 полностью без интернета.
Swiftlet — рантайм на Swift и Metal для Mixture-of-Experts моделей Qwen: 35B и 80B — серии моделей, выпущенной командой Qwen в Alibaba под лицензией Apache 2.0. Он держит в памяти только плотное ядро модели, а разреженные веса экспертов подгружает с диска по мере генерации каждого токена — поэтому 35B-модель запускается в 2,6 ГБ оперативной памяти на Mac M5 со скоростью 7–11 токенов в секунду. На iPhone 17 та же модель работает в ~2,5 ГБ, около 1 токена в секунду. Выстрелил потому, что до этого мало кто стримил веса таких моделей с диска — обычно всё грузится целиком в RAM.
Зачем это вайб-кодеру
Если строишь с ИИ и не хочешь платить за каждый запрос или отправлять данные в облако — Swiftlet позволяет запустить по-настоящему способную большую модель на том Mac, что уже есть. Это и основа для приложений, которые держат весь ИИ-вывод приватным прямо на устройстве Apple.
▌ Ещё находки