Personal Knowledge Base

修哥筆記

「知識的沉澱與分享」

dsv41-flash-offload:把 DeepSeek-V4.1-Flash 塞進單張 RTX 3090 的極致工程

dsv41-flash-offload:把 DeepSeek-V4.1-Flash 塞進單張 RTX 3090 的極致工程

· #DeepSeek #LLM #本地推理 #Offload #EXL3 #心得筆記

在看了 Strata(把 125B 的 Qwen 塞進遊戲顯卡)之後,我又挖到一個更深、更極端的同類專案:dsv41-flash-offload(sybil-solutions,MIT)。它把約 200GB 的 DeepSeek-V4.1-Flash 在單張 24GB RTX 3090 上本地跑起來,還保留 262K 全長上下文。這篇是研究心得。

它是什麼?

把 DeepSeek-V4.1-Flash(EXL3 3.0 bpw 量化,約 200GB 的 experts、384 routed × 40 MoE 層)在「一張 24GB 消費卡 + 大記憶體 + NVMe」的工作站上跑。 提供 OpenAI 相容 API(聊天、工具呼叫、reasoning),可當成本地 agent 後端。

一句話:Strata 追求「遊戲機跑得動」,這專案是「單卡工作站跑得動旗艦」——門檻更高,但換來更強模型與 262K 長上下文。

硬體門檻(先講重點)

資源 需求
GPU 1 張 RTX 3090 24GB(sm_86)
記憶體 256 GiB DDR4(expert 全家 pin 在 RAM,佔約 190GB)
CPU 24+ 核、支援 AVX2/FMA/F16C
磁碟 NVMe、約 490GB 空間(模型+Engram 表+鏡像)

比起 Strata(64GB RAM 就夠),這個專案明顯更「工作站級」——但換來的是 DeepSeek 旗艦+26 萬 tokens 上下文。

原理:三層 offload(白話)

模型太大、顯卡太小,所以把「用到的東西」拆成三層放:

  1. GPU(VRAM,24GB):放常駐的「主幹」——attention、embedding、共用專家、LM head、路由器,約 7.7GB;再加 KV cache 與鏡像專家快取。
  2. 主記憶體(DDR4,190GB pin 住):全部 15,360 個 routed 專家的家。GPU 用不到冷專家時,交給 CPU 23 個核心內的 AVX2 執行緒直接在 RAM 算(decode 的冷 miss)。→ 這就是 decode 速度大躍進的關鍵。
  3. NVMe(磁碟):Engram n-gram 表(203GB)落在磁碟上,用 mmap 隨需讀取,每 token 只取約 50 小行——不載入 RAM。

prefill 的關鍵是「staged-DMA」:取代把整個專家從 RAM 搬過 PCIe(舊法每 chunk 搬 203GB、龜速),改成用顯卡的「拷貝引擎」分批、與運算重疊地把熱專家流進 VRAM 暫時槽;「忙碌的專家」用 FP16 GEMM 算,冷專家才丟給 CPU。

decode 的關鍵是「CPU 專家庭」:熱門專家放 VRAM 鏡像快取(彈性依剩餘 VRAM 調整),只有每層約 3.5 個冷 miss 需要 CPU 用 DDR4 算(約 1ms/層),再以 fp32 局部結果加回 GPU。

速度實測(預設 D119,262k)

指標 數值
prefill(讀入 8k–261k 提示) 589–813 tokens/秒
decode(生成,1 串流) 16–21 tokens/秒
較新 D141 decode(1/2/4 串流) 19.3 / 24 / 26.6 tokens/秒
261k 全長提示到首個 token 約 341 秒

對比「什麼都不做」的 baseline:decode 從 4.1 → 21 tok/s(約 5×)、prefill 從 93 → 565 tok/s(約 6×)——這些不是行銷口水,都是跑在真機上的數據。實驗性 Intel Arc 加速更達 41 tok/s。

品質與誠實

專案附嚴謹的精確度檢驗:staged-DMA prefill 對照完整詞彙基準,top-1 相符 0.9856、中位數 KL 僅 3e-6(多數位置結果完全一致);CPU 專家庭對 GPU kernel 的相對 RMS 0.0037。也誠實標註 prefill fidelity「略超出」其繼承的品質 guard、目前狀態是「candidate」。

對個人意味著什麼?

感想整理:

  1. 「本地跑旗艦」的邊界在快速推進。 從 data center → 工作站單卡,靠的是「借 RAM+磁碟+CPU+拷貝引擎」的綜合工程,不是單一魔法。
  2. 門檻在 RAM 與 NVMe,不在顯卡。 若你已有 24GB 卡,還需補 256GB RAM 與約 500GB 的 NVMe——這是硬成本。
  3. 價值在隱私與長文 Agent。 262K 上下文+本地執行+工具呼叫,適合跑長時間的 agent 任務,資料不出機器。
  4. 工程文化值得學習。 每個 patch 都有 sha256 收據、每次都驗證可重現、誠實公布 fidelity 落差——這比「狂報速度」更可信。

用一句話總結:dsv41-flash-offload 是「把旗艦模型搬上單卡工作站」的極致示範——有夠硬核,也切切實實跑得起來。


本文為研究心得,整理自 sybil-solutions/dsv41-flash-offload 的 README 與結果量測(results/)。

← 返回首頁