Qwen3.8-Flash-Next 로컬 구동 가이드 — 125B MoE를 RTX PRO 6000 한 장으로 (llama.cpp)
알리바바의 125B MoE 멀티모달 모델 Qwen3.8-Flash-Next를 llama.cpp로 로컬 구동하는 전 과정. 빌드, GGUF 다운로드, 그리고 세 번의 반전 — qwen4exp 아키텍처, VRAM에 안 올라가는 26.8GiB n-gram 테이블, 듀얼 GPU보다 빠른 단일 GPU까지. 실측 벤치마크와 최종 실행 스크립트 포함.
2026년 09월 01일
