Perplexity выложила в open source свой инференс-движок Lily — специально заточен под Qwen3.6-35B-A3B на Apple Silicon.
Никакого PyTorch или MLX внутри — чистый Rust + кастомные Metal-кернелы. На M5 Max с 128GB на борту получили +23% к обработке промпта и +35% к скорости генерации токенов по сравнению с MLX-LM.
Фишка в специализации: движок заточен ровно под одну архитектуру модели и один чип, а prefill и decode обрабатываются как разные задачи. Так добывается скорость, которую универсальные фреймворки не выжимают.
#AI #opensource #apple
Perplexity выложила в open source свой инференс-движок Lily — специально заточен под Qwen3.
AI | Новости | Volodymyr Saakian
@ai_it_education🤖 AI новости для разработчиков, фрилансеров и бизнеса Tech Lead @ TUI · 9 лет в IT 90% моего кода пишет AI — рассказываю как и зачем Кейсы · Инструменты · Автоматизация Вопросы → @llossless
19 مشتركًا
فتح في تيليجرام 1 صورة مرفق بهذا المنشور — مرئي في تطبيق تيليجرام.