Открытый проект Swiftlet позволяет запускать Qwen3.6-35B на iPhone примерно в 2,5 ГБ оперативной памяти, а 80-миллиардную Qwen3-Next — на Mac с пиковым расходом 4,3 ГБ.
Открытый проект Swiftlet позволяет запускать большие модели семейства Qwen непосредственно на устройствах Apple. Qwen3.6-35B работает на iPhone примерно в 2,5 ГБ оперативной памяти со скоростью около одного токена в секунду, а Qwen3-Next-80B на Mac требует до 4,3 ГБ и выдаёт 4,5–5 токенов в секунду.
Экономия памяти достигается за счёт того, что небольшое плотное ядро остаётся в памяти, а нужные экспертные веса MoE-модели подгружаются с накопителя. Для Mac требуются Apple Silicon и macOS 14 или новее; проект распространяется по Apache 2.0, инструкции и исходный код доступны на GitHub.
Swiftlet запускает модель Qwen на 35 млрд параметров на iPhone без облака
Источник: Swiftlet — GitHub