Тягне на революцію: вийшов експериментальний рушій для MoE-моделей, який дозволяє запускати гігантські моделі на звичайних ноутах 

Ідея проста: якщо в нас купа різних експертів, давайте зберемо в одну систему ресурси GPU, CPU та RAM та рівномірно розкидаємо навантаження.

Результати прямо кльові:

**** Qwen3.6-35B-A3B** — працює на мобільній RTX 4060 8 ГБ з ноуту й видає **39 ток/с**;
**** DeepSeek-V4-Flash 284B** — фуричить на RTX 5090 зі швидкістю **22–25 ток/с**;
****  Монструозна GLM-5.2 753B** — одна RTX PRO 6000: деcь **15 ток/с**.

Ну й та, потрібна саме відеокарта, тому маководи на цей раз поза грою 

[GitHub](https://github.com/FlashML-org/FreeToken) | [Стаття](https://arxiv.org/abs/2608.16157)

[ооо збори мої збори (залишилося 41 020.88)](https://send.monobank.ua/jar/33jo31bNu4)