편찌

Qwen3.8-Flash-Next

Qwen3.8-Flash-Next 로컬 구동 가이드 — 125B MoE를 RTX PRO 6000 한 장으로 (llama.cpp)

알리바바의 125B MoE 멀티모달 모델 Qwen3.8-Flash-Next를 llama.cpp로 로컬 구동하는 전 과정. 빌드, GGUF 다운로드, 그리고 세 번의 반전 — qwen4exp 아키텍처, VRAM에 안 올라가는 26.8GiB n-gram 테이블, 듀얼 GPU보다 빠른 단일 GPU까지. 실측 벤치마크와 최종 실행 스크립트 포함.
2026년 09월 01일
llama.cpp 웹UI에서 Qwen3.8-Flash-Next가 한국어 질문에 생성 102.07 t/s로 답변하는 화면

RTX PRO 6000 Blackwell 구매 후기 — 5090이랑 듀얼 장착, 96GB VRAM으로 로컬 LLM 돌리기

RTX PRO 6000 Blackwell Workstation Edition을 2,628만원에 질렀다. Antec 빅타워에 ROG Astral 5090과 듀얼 장착하며 하단 팬을 떼어낸 사연, 램 128GB 풀뱅 EXPO 6000 성공기, 그리고 96GB VRAM으로 Qwen3.8-Flash-Next 125B를 초당 100토큰으로 돌려본 실사용 후기.
2026년 09월 01일
NVIDIA RTX PRO 6000 Blackwell Workstation Edition 그래픽카드 실물 쿨러 디자인 클로즈업