Води Твіттеру принесли досить непоганий гайд з запуску локальних LLM — ароматний друг [розписав](https://carteakey.dev/blog/local-inference/local-llm-optimization/) усі нюанси при використанні llama.cpp 

Там не тільки текстові рекомендації, а я корисні флаги для оптимізації: `--fit on`, `--fit-ctx 65536`, `--fit-target 512` та інші.

Магії не чекайте, але витискати більше токенів/секунду зі свого заліза можна 

[ооо донат на збір (залишилося 72 520.33)](https://send.monobank.ua/jar/33jo31bNu4)