Qwen 3.8 27B,市場上在瘋這個?
有客戶珍藏全新求售(應該是當時返修換新)
聽說現在一張可以回到五萬多?
可以用3090 24G裝起來?
------
可以,但只能跑量化版,先把這顆的底細講清楚。
Qwen3.8-27B 是 8 月 13–14 日剛上 Hugging Face 的開源權重,Apache 2.0,還附帶一個意外的視覺編碼器和 262K 原生 context。架構上是 27B dense 混合注意力:64 層裡只有 16 層跑 full attention,其餘 48 層是 linear attention(固定 recurrent state),另外內建 MTP draft head,context 可延伸到 1M。這個 linear attention 佔比對你的問題很關鍵——KV cache 遠小於傳統 transformer。
記憶體帳很直白:27B 級 dense 模型 BF16 約需 56GB、FP8 約 28GB、4-bit 約 14–16GB,這還不含 KV cache。所以 3090 24G 上 BF16 和 FP8 都免談(Ampere 本來也沒有 FP8 硬體支援),只剩 4-bit 路線:LM Studio 的 Q4_K_M 量化檔約 17GB,權重放進去後還剩約 7GB 給 KV cache 和 vision tower,靠 hybrid attention 的省 KV 特性,context 可以開得不算難看。vLLM 那邊 AWQ/GPTQ INT4 同理能塞;官方 recipe 提的 NVFP4 24.6GiB 是 Blackwell 的事,3090 不用想。
速度預期:Simon Willison 在 M5 Max MacBook 和 DGX Spark 上用 LM Studio Q4_K_M 跑出約 15–30 tok/s,3090 的 936GB/s 頻寬比那兩台高,decode 估 30–45 tok/s 級別應該合理。但要有心理準備:這模型預設會嚴重 overthink,推理 token 噴很兇,體感吞吐會打折。
一個實務坑:架構是新的(Qwen3_5ForConditionalGeneration + hybrid attention),llama.cpp 和 vLLM 都要拉最新版,舊版跑不起來。
順帶一提,5090 32G 跑這顆才是甜蜜點(但現在價格太貴)——Blackwell 原生吃 NVFP4,24.6GiB 權重放進 32G 還有大把空間開長 context,單卡出租跑這種等級的開源模型,性價比會很漂亮。
 
 
Back to Top