Французский стартап ZML выпустил бесплатный inference-сервер LLMD — работает на Nvidia, AMD, Google TPU, Apple Metal и Intel одновременно 🔥 Никакой привязки к одному вендору: одна инсталляция, любой чип.

Поддерживает LLaMA, Gemma, Qwen и Mistral с continuous batching и prefix caching. Сам продукт бесплатный, хотя стартап уже поднял $20M от 20VC и LocalGlobe. Сначала хотят понять, как его используют — потом решать про монетизацию.

Война за AI-инфраструктуру идёт не только на уровне моделей, но и на уровне железа 🏗️

[#AI](/tag/AI) [#inference](/tag/inference) [#opensource](/tag/opensource)