ATSInfer: 張量級 Hybrid CPU-GPU 排程 — 讓消費級裝置跑 LLM 快 3.3 倍

arXiv:2607.10183 — 2026-07-14 — cs.DC / cs.AI / cs.LG — Yangyijian Liu, Hongyi Ye, Mingyang Li, Wu-Jun Li (南京大學) — Hermes Agent generated
AdSense
AdSense

一句話核心結論

現有 hybrid CPU-GPU 推論系統用 layer 級或 expert 級 的粗粒度 offloading,忽略同一層內不同 tensor 的運算強度差異巨大,且排程策略不隨裝置當下的 CPU/GPU/PCIe 負載動態調整。ATSInfer 首創 tensor 粒度 offloading,結合 靜態張量放置(knapsack DP)負載感知動態傳輸(online DP)非同步 CPU-GPU 協調,在消費級 GPU(RTX 3060/4060/4090)上 decode 吞吐量最高 +229%(3.29x)、prefill 吞吐量最高 +94%(1.94x)、GPU 利用率提升約 70%。實作僅約 15,000 行 C++,擴充 llama.cpp,同時支援 dense 與 MoE 模型。

Decode 吞吐量

最高 3.29x vs llama.cpp

Prefill 吞吐量

最高 1.94x vs llama.cpp

GPU 利用率

decode 期間平均 +70%

核心洞察:粗粒度 offloading 的兩個致命缺陷

ATSInfer 從實證出發,揭示了現有系統的兩個系統性瓶頸:

  1. Intra-layer 張量異質性被忽略:同一層 Transformer 內的 Q/K/V/O projection、FFN up/gate/down、attention output 等張量的運算強度和 GPU 加速比差異懸殊。圖 3 顯示同一層內某些 tensor 搬上 GPU 的 latency reduction 是其他的 數倍。傳統 layer 級 offloading 要嘛全搬(VRAM 不夠)要嘛全不搬(浪費 GPU),完全錯失 selective promotion 的機會。
  2. 消費級裝置的負載是動態的:筆電/桌機同時跑瀏覽器、IDE、媒體播放,CPU/GPU 資源持續變動。更關鍵的是 thermal throttling——長時間高負載後處理器降頻,CPU 執行時間飆升。圖 4 展示了背景干擾→熱牆觸發的兩階段效能衰減,固定排程策略對此完全無能為力。

這兩個缺陷的疊加效果:粗粒度 + 靜態策略 = CPU 長期成為瓶頸、GPU 大量閒置、PCIe 頻寬未被充分利用。

技術架構:三層協同設計

ATSInfer 在 llama.cpp 上新增約 15,000 行 C++,分三層:

這三層的協同效應:靜態放置確保高價值 tensor 始終在 GPU → 動態傳輸在 CPU 瓶頸時把額外工作卸到 GPU → 非同步管線讓傳輸與計算最大化重疊。

實驗結果:三個消費級 GPU 跨模型驗證

ATSInfer 在 RTX 3060(6GB)、RTX 4060(8GB)、RTX 4090(24GB)上測試 dense(Qwen3-14B、Llama-4-Scout-17B)和 MoE(Qwen3-30B-A3B、DeepSeek-V3-Lite)模型:

對 DKY / Hermes 的啟發

ATSInfer 雖是系統 infra 論文,但三個設計決策對 DKY 的推論部署有直接參考價值:

限制