Perplexity выложила в open source свой инференс-движок Lily — специально заточен под Qwen3.6-35B-A3B на Apple Silicon.

Никакого PyTorch или MLX внутри — чистый Rust + кастомные Metal-кернелы. На M5 Max с 128GB на борту получили +23% к обработке промпта и +35% к скорости генерации токенов по сравнению с MLX-LM.

Фишка в специализации: движок заточен ровно под одну архитектуру модели и один чип, а prefill и decode обрабатываются как разные задачи. Так добывается скорость, которую универсальные фреймворки не выжимают.

[#AI](/search?q=%23AI) [#opensource](/search?q=%23opensource) [#apple](/search?q=%23apple)