Французский стартап Kog решил, что необязательно ждать новых чипов ради быстрого AI — можно выжать в разы больше из обычных GPU, которые уже стоят в дата-центрах. 🚀

Их движок уже показал 3000 токенов в секунду на маленькой модели, а теперь команда портирует трюк на большие LLM — обещают ускорение в 30 раз. Основатель — бывший white-hat хакер, реверсит GPU до ассемблера, чтобы понять, где зажат потенциал.

После демо на Hacker News к ним пришло 200 бизнес-лидов — похоже, все задолбались ждать, пока Claude Code отработает. 😄

[#AI](/search?q=%23AI) [#GPU](/search?q=%23GPU) [#inference](/search?q=%23inference)