**Strata - Qwen 3.8 Flash Next(125B)를 일반 PC에서 초당 100토큰으로 실행하기**

- Qwen3.8-Flash-Next를 개인 PC에서 실행하는 오픈소스 추론 엔진으로, 대화·코딩·이미지 이해를 클라우드 없이 처리  
- 모델 전체를 GPU에 올리는 대신 GPU와 CPU, 시스템 메모리에 작업을 분산하며, 자주 사용하는 전문가 네트워크를 GPU에 유지  
- 작은 모델이 다음 토큰을 예측하고 큰 모델이 검증하는 방식으로 동일한 출력을 1.6~1.8배 빠르게 생성  
- 자체 측정에서 RTX 5070 12GB·RAM 64GB로 초당 94토큰을 생성하며, Q2_0 양자화 모델의 입력 처리 속도는 초당 2,650토큰  
- Windows와 Linux에서 실행하며 OpenAI·Anth…

[https://news.hada.io/topic?id=34761](https://news.hada.io/topic?id=34761)