← 返回观点 思考

KV Cache 成为网络公民:SIGCOMM 2026 把推理的存储问题翻译成网络问题

PD 分离后 KV cache 从 GPU 内部状态变成跨网负载,六篇论文沿五层展开:压缩策略运行时化(KVServe)、视频编解码 ASIC 做 KV 压缩(KVCodec)、decode 侧闲置带宽做第二加载路(DualPath)、端点热迁移(Connex)、交换机聚合(Turbo)、AI 消费者改写…

2026-08-22思考41 分钟阅读

1. 新技术宣称

2026 年 8 月,ACM SIGCOMM 把开幕第一个 research session 的舞台给了同一个问题:KV cache 在分离式 LLM 服务架构中的网络传输

这不是常规的"热点占位"。Session 1(LLM Inference & Serving)五篇中四篇、Session 5(In-Network Aggregation for ML)一篇、Session 18 一篇,合计六篇论文,覆盖了从压缩策略、传输编码、存储 I/O 调度、端点迁移到交换机内聚合的完整技术栈。把它们放在一起读,能看到一个清晰的图景:

当 prefill-decode 分离(PD 分离)成为推理服务的默认架构,KV cache 就从 GPU 内部状态变成了跨网络的显式负载(explicit payload)。网络社区用了不到两年时间,把这个新的流量类型从"性能问题"重新定义为"研究问题域"。

这件事的时间线值得记录。PD 分离架构(DistServe、Mooncake 等系统论文,2024)先在生产界铺开;KV cache 的容量问题(显存的暴政)和传输问题先在系统会议(OSDI/SOSP/ATC)出现;到 2026 年,SIGCOMM 把它纳入自己的核心议程:不是作为应用背景,而是作为网络研究的对象本身。六篇论文的引言部分几乎都在复述同类测量事实,两组数字都出自 KVServe:H100 解码节点在 10-50Gbps 扫描下,KV 通信占任务完成时间的 16%-60%(图 1);占比随带宽收紧单调上升,带宽本身是第一变量。而在长上下文负载的端到端分解实验(Qwen2.5-32B,2WikiMQA/HotpotQA)里,Default 配置的通信占总 JCT 的 82%-90%,压缩后降至 6-9%(图 15)。长上下文把这个比例推到另一个量级。两个维度合起来:带宽越紧、上下文越长,KV 越是主导。

KVServe 两组边界测量:左图 10-50Gbps 带宽梯度下通信占比 16%-60%,右图长上下文负载 Default 配置通信占比 82-90%、压缩后降至 6-9%
KVServe 两组边界测量:左图 10-50Gbps 带宽梯度下通信占比 16%-60%,右图长上下文负载 Default 配置通信占比 82-90%、压缩后降至 6-9%

问题域的迁移本身就说明了一件事:LLM 推理的网络瓶颈,已经从"连接 GPU"变成"搬运状态"。

(Session 1 的第五篇 TurboBus 做 PCIe 带宽池化,属于 scale-up 互联问题,留给本系列第三篇。)

2. 逐篇深读:六篇论文在解决什么

先把这个技术栈里六篇论文的问题定义并排放出来。它们共享同一个大背景(PD 分离后 KV 必须跨网络流动),但切入的层面完全不同:

论文 一句话问题 切入层面
KVServe 静态 KV 压缩配置在变化的负载/带宽下次优甚至负优化 策略层(压缩配置的选择)
KVCodec CUDA 核解压与推理抢 GPU 资源,SmartNIC 方案太贵 编码层(传输格式与编解码硬件)
DualPath agentic 负载下 prefill 侧存储网饱和、decode 侧闲置 架构层(I/O 路径的带宽调度)
Connex worker 加入/离开/迁移时 NCCL 全局重建,多秒停摆 架构层(通信原语的弹性)
Turbo Pass-Q 序列并行的 master 聚合随上下文变长成为瓶颈 网络计算层(聚合算子进交换机)
Artic RTC 从"人看视频"变成"AI 理解视频",整套机制失配 流量类型层(AI 消费者的新流量)

(Video-codec-KV 与 KVCodec 为同一工作的会议版命名,正文统一用 KVCodec。)

2.1 KVServe:压缩不是算法选择,是状态依赖的策略选择

PD 分离之后,KV cache 要跨网搬运,压缩是省带宽的第一反应。但生产系统怎么选压缩方法?今天的答案是:上线前拍板一个,之后不再动。KVServe(中科院计算所,session 1 首篇)开头就用三组测量把这个默认做法打穿。第一,没有跨负载的最优算法:KIVI(2-bit 量化)在 Qasper 上精度最优,在 GSM8K/HumanEval 上接近垫底;DuoAttention(剪枝)恰好反过来;CacheGen 的压缩比在 Multi-News 上 6.20×,到 HumanEval 只剩 3.98×。第二,最优策略随带宽漂移:低带宽时 CacheGen(高压缩比)最优,中段 MixHQ 接管,高带宽时 KIVI(低压解压开销)反超;而且各自超过阈值(50/55/110 Gbps)后,三种静态方法都比不压缩更慢,压解压开销吃掉了通信节省。第三,负优化真实存在:短上下文任务(GSM8K、HumanEval)上,静态压缩基线的 JCT 高于完全不压缩的 Default。三组合起来,问题被重新定义:压缩配置不是离线常数,是随负载和带宽漂移的在线决策。

KVServe 的回答是把"选压缩方法"重构为带约束的在线选择:压缩策略 = 负载类型 × 有效带宽 × SLO/质量预算三维状态下的决策。工程上分三步走。先把 CacheGen/KIVI/KVQuant/MixHQ 分解成可插拔组件,让策略空间可组合,这一步是系统地基;离线侧不蛮力,贝叶斯 Profiling 把策略空间搜索从 1000 小时压到 20 小时量级,产出延迟×精度×压缩比的 Pareto 前沿;在线侧用解析延迟模型给出基线决策(单次 <1ms),再由轻量 bandit 纠正 offline-online 漂移。

系统在三负载族(QA/数学/代码)× 三档硬件(10/50/100 Gbps)× 四个静态基线上验证:状态感知的策略选择在全部测试点不输最优静态基线,在负载或带宽漂移时显著优于任何固定选择。静态最优只在它被选中的那个状态窗口里最优。

有效性成立,边界也清楚:20 小时级的离线 profiling 对模型频繁迭代的服务是真实成本;bandit 依赖在线信号质量。另一条发现值得单独记录:CacheGen 移植到 Qwen2.5 上精度崩塌(HumanEval 掉到 57.32%),根因是 Qwen2.5 的 K/V projection 含 bias 项,分布非零中心、非对称,uniform 量化映射失配。压缩方法的可移植性受模型架构细节约束,这类"架构耦合"问题会在更多模型上重演。原则判断:压缩策略必须运行时化,与拥塞控制从静态配置走到 BBR 的演进同构。

2.2 KVCodec:闲置的视频编解码 ASIC

压缩的另一端是解压在哪做。两条现有路线都有硬伤:CacheGen 用 CUDA 核加速解压,但 SM 与推理抢资源,实测 prefill 时间 +50%、decode 时间 +20%,解压峰值内存是原始 KV 的 2.7×;ShadowServe 把解压放到 SmartNIC,代价是专用硬件,普及不动。生产动机摆在那里:Kimi 的生产负载里 50% 的 KV 可复用(Mooncake 论文数据),fetch 路径的解压开销每天都在发生。

KVCodec(南大 + 清华 AIR)的洞察简单而有效:现代 GPU 的 NVENC/NVDEC 视频编解码 ASIC,在整个 LLM 推理过程中完全闲置。把它征用为 KV 编解码硬件:复用 H.265 的无损部分(帧内/帧间冗余消除),跳过 DCT+量化的有损步骤,配合 token 维切片和连续帧布局,做到约 10× 的无损压缩;解压走 NVDEC 池,与 CUDA 核物理隔离,干扰近乎为零。

原型基于 LMCache v0.3.7。结果分两层:fetch 请求的 TTFT(首 token 延迟)相比全量 prefill 降低 13.63×、相比原始 KV 传输降低 3.51×、相比 CacheGen 降低 1.52×;更值得注意的是连带效应,非 reuse 请求的 TTFT 反而降低 77%。解压不再抢 CUDA 资源后,连不碰 KV 复用的请求都被顺带加速了。

有效性成立,落地是中期档:需要 NVENC/NVDEC 的驱动级集成,不是改配置就能用。"闲置专用硬件是一等资源"这个思路可以推广:AMD 的 AMF 同理;其他被推理闲置的 ASIC(JPEG 解码器、显示引擎)是否可用,是论文留下的开放方向。

2.3 DualPath:agentic 负载推翻了 prefill 中心的假设

北大 + 清华 + DeepSeek-AI 的工作。DeepSeek 的名字第一次出现在 SIGCOMM 作者列表上,方向正是 agentic inference 的 KV 存储 I/O:一家以模型能力著称的公司,把生产推理系统的网络问题带到了网络顶会,这个信号本身值得记。

它攻击的是一个被默认架构掩盖的浪费。动机数据来自生产 agentic RL 训练 trace:平均 157 轮交互、上下文 32.7K token、每轮只追加 429 个新 token,KV 命中率 98.7%。这种负载下,推理几乎不做 prefill 计算,只做 KV 加载:DeepSeek-V3.2 的 cache-compute 比约 22 GB/PFLOP,瓶颈从计算彻底转向存储 I/O。而现有架构把全部存储 I/O 压在 prefill 侧:命中 KV 只从存储经 prefill 引擎的存储网卡加载,PE 侧饱和、DE 侧闲置。带宽不对称在被浪费,而不是在被调度。

DualPath 的方案是双路径加载:在"存储→prefill"之外,新增"存储→decode→经计算网 RDMA 转 prefill",让 decode 侧的闲置带宽也成为加载通道。配套两件事:CNIC 中心的流量管理,IB 虚拟通道按 99:1 仲裁(模型通信高优先级、KV 传输低优先级防饿死);两级调度,把全部节点的存储带宽聚成一个可调度池。理论侧给出无瓶颈的 P/D 安全区间:17 ≤ P/D ≤ 72(g=8、s=1 配置解析),覆盖绝大多数生产配置。

DS 660B 上的实验:离线 JCT 最高 1.87×,在线吞吐平均 1.96×。读数字要知道基线:对照组是 DeepSeek 内部框架,论文自己标注与公开系统(SGLang+Mooncake)的对比因实现差异不可直接比。还有一个对国产栈很实际的讨论:RoCE 上用 TC+DSCP 平移该设计,论文点名 UnifiedBus(灵衢)和 Ultra Ethernet 的 QoS 机制可以直接支持 DualPath 的需求。机制层面,这是六篇里最直接可移植到国产超节点栈的设计。

DualPath 双路径架构:存储带宽聚合为可调度池,命中 KV 经 decode 侧加载后走计算网 RDMA 转入 prefill,CNIC 以 99:1 虚拟通道仲裁保护模型通信
DualPath 双路径架构:存储带宽聚合为可调度池,命中 KV 经 decode 侧加载后走计算网 RDMA 转入 prefill,CNIC 以 99:1 虚拟通道仲裁保护模型通信

2.4 Connex:端点移动性升格为一等原语

弹性推理的通信层缺位,是 Connex 要解的问题。worker 加入/离开/迁移时,NCCL 的通信组需要全局重建:communicator 重建、rank 重排、barrier 同步,多秒级 stop-the-world。vLLM 社区已把"缺席 handover"列为弹性推理的 fundamental blocker。生产上的弹性扩缩容、故障恢复、多租户调度,全被这个通信层短板卡着。

中科院深圳先进院 + UPenn + 澳门大学的作者们没有为每种 churn 打补丁,而是定义 mobility contract:join/leave/migrate 发生时通信层必须保证的语义合同。三个机制各管一段:epoch 路由,让重配置变成局部路由更新,不再全局重建;显式 handover,用序列号+幂等投递+选择性重传,把迁移放在相邻阶段本地完成;credit 反压加流量分级,保证 churn 干扰不传导到延迟敏感路径。

5 节点 A40 测试床上的 churn 实验:P99 尾刺 -85%,切换亚秒级,稳态开销 <5%(TTFT +10ms、TPOT(每输出 token 间隔)+2ms)。机制成立,局限明确:5 节点是它的主要短板,规模上未验证。

值得记的是它的构造方式:三个组件全是经典分布式技术(epoch、幂等投递、反压),为 GPU tensor 流的 token-iterative 语义重新组合成合同。这不是发明新轮子,是把已知正确的机制搬到新语义下。落地节奏跟随 UCCL/NCCL 替代品的成熟度,属中期档。

2.5 Turbo:聚合算子进交换机

KV 线的最底层:不只是搬运 KV,把注意力聚合的计算本身放进交换机。背景是序列并行(SP)的 Pass-Q 模式:master 广播 query,各 worker 算本地 attention,master 集中聚合。序列一长,master 同时成为算力和带宽的瓶颈,还引发 incast。这是"计算跟着数据走"的老问题在注意力时代的版本。

东南大学 + 北大 + 清华 + NUS 的团队把广播和聚合都卸载到 Tofino2 可编程交换机。三件套里含金量最高的是在线查表聚合:softmax 的指数和除法在交换机上没有浮点支持,Turbo 把全局归约分解为 pairwise 操作,非线性函数用 11-bit 索引、2KB 的查找表近似,精度损失可忽略。配套解决 RMT(可重构 match-action 流水线,Tofino 类芯片的架构基础)单向流水线不可回溯写的 rolling forward 方案,和负载感知的聚合树(整数线性规划 ILP 归约为最大流问题)。

2352 行 P4 在 Tofino2 上实现,4 节点实测加 NS-3 大规模仿真。TPOT 最高 -37%(8 GPU 跨度上下文,vs Ring-Attention),仿真里延迟 -99%。经济账也算得清楚:可编程交换机与商用交换机的差价约 $4000,是 H100 的 1/10;整机功耗 268.8W,低于单张 H100 的 700W TDP。

有效,但两条边界都在证据核对表标了:-99% 是 NS-3 仿真值,实测床只到 4 节点(实测 -37%);硬件上 Tofino2 的 20 个物理阶段被排满,2 个给 γ 逻辑,64 元素 attention 段按 ⌈64/4⌉+2=18 个阶段布满余下全部(16 个分块+2 个滚动窗口),无余量。Tofino 停产之后,这条路线的下一个承载在商用可编程芯片:论文点名 Trident 可迁移,EPIC 工作组里有盛科。

2.6 Artic:AI 消费者的另一端流量

前五篇都在讲"AI 吃带宽",Artic 讲反面:"AI 不需要那么多带宽"。AI Video Assistant(Grok、Gemini Live、ChatGPT、Copilot、豆包都在做)的流量模式是上行高码率视频、云端 MLLM 理解后回传音频。上行主导,与 KV 的下行主导恰成方向对照。而传统 RTC 整套机制是为"人看视频"设计的,拥塞控制的目标是填满带宽;当消费者从人眼换成 MLLM,这套机制从根上失配。北大的这篇放在 session 18,但它在流量方向上与 KV 线构成对偶。

支撑一套新机制的是两个发现。其一,MLLM 的码率-精度曲线存在饱和点(约 968 Kbps,再加码率精度不涨)。对 AI 消费者,带宽 headroom 比码率更值钱,填满带宽的拥塞控制反而有害。其二,MLLM 可以实时反馈"回答所需的区域":客户端按反馈分配 QP,重要性识别放在服务端,客户端零开销。

配套的评测基准 DeViBench 自动构建(1968 样本,总成本 $48.06),实验用 5G 上行 trace 回放。同等精度下,标准编码需要 3171 Kbps,上下文感知编码只需 908 Kbps;总体精度 +15.12%、延迟 -135.31ms。

结论方向比数字更重要:AI 消费者的流量需要自己的传输语义,饱和点感知的码率控制、服务端驱动的区域优先级,这会反向改写 RTC 这一层的协议设计。

3. 路线分析:技术路径图谱

六篇论文并排放置,一个分层清晰的技术栈浮现出来。KV 传输问题的解空间可以沿"动什么"分成五层:

KV 传输技术栈的五层分解:六篇论文沿"动什么"分层定位,从改配置(策略层)到改消费者语义(流量类型层)
KV 传输技术栈的五层分解:六篇论文沿"动什么"分层定位,从改配置(策略层)到改消费者语义(流量类型层)

三个动词(省、快、搬)在这五层上重新分布:

  • 省(压缩):策略层+编码层。KVServe 证明静态压缩有负优化区,KVCodec 证明压缩/解压的算力开销可以用闲置 ASIC 消零。压缩路线的天花板由注意力质量对量化的敏感度决定。两个工作都绕开了"更高压缩比"的军备竞赛,转而解决"何时压、在哪压"。
  • 快(调度):架构层。DualPath 把带宽不对称当作可调度资源,Connex 把成员变化当作通信原语。这一层的共同假设是拓扑信息可用——调度质量取决于对网络状态的知识。
  • 搬(传输与计算):网络计算层。Turbo 的 LUT 方案把"交换机能算什么"的边界又推了一步。这条路线的约束是交换机资源(Tofino2 的 20 个物理阶段排满后无余量)和硬件世代(Tofino 停产后的移植问题)。

五层之间不互斥,反而高度可组合:KVServe 的策略层理论上可以驱动 KVCodec 的编码器;DualPath 的路径调度与 Turbo 的网内聚合作用于不同平面。SIGCOMM 把 session 1 和 session 5 排在同一个会议里,本身就暗示了这个栈式结构。

4. 证据核对

本篇所有数字的来源锚定:

主张 数字 出处
KV 传输占端到端延迟 16%-60% H100 解码+10-50Gbps 实测 KVServe §2.1 图 1
长上下文负载通信占比 82%-90%(压缩后 6-9%) Qwen2.5-32B,2WikiMQA/HotpotQA,Default 配置 KVServe §7 图 15
Kimi 生产负载 50% KV 复用率 Mooncake 论文引用 KVCodec §1(引 [54])
agentic 负载 KV 命中率 98.7% 生产 RL trace,平均 157 轮/32.7K ctx/429 append DualPath §3
静态压缩负优化阈值 50/55/110 Gbps CacheGen/MixHQ/KIVI 三方法实测 KVServe §2.2 图 4
KVServe 搜索开销 1000h→20h 贝叶斯优化 KVServe 摘要/§5
KVCodec 无损压缩 ~10× H.265 lossless+布局优化 KVCodec §3.2
KVCodec 同精度码率 3171→908 Kbps ZeCoStream(Artic 系统的上下文感知编码)vs 标准编码 Artic §7.3 图 11
DualPath 离线 1.87×/在线 1.96× DS 660B,vs 内部基线 DualPath §7.3/7.4
DualPath 无瓶颈区间 17≤P/D≤72 g=8,s=1 解析 DualPath §4.2 式(9)
Connex P99 尾刺 -85%,稳态 <5% 5 节点 A40 churn 实验 Connex 摘要/§6.2
Turbo TPOT -37%/-99% 4 节点 Tofino2 实测 / NS-3 仿真 Turbo §6.1/6.2
Turbo 交换机功耗 268.8W vs H100 700W Tofino2 4.2W/口×64 Turbo §6.1
Artic 精度 +15.12%/延迟 -135.31ms 5G 上行 trace 回放 Artic 摘要

两处需要说明的口径:其一,Turbo 的 -99% 来自 NS-3 仿真而非实测(测试床只到 4 节点);其二,DualPath 的基线是 DeepSeek 内部框架,与公开系统(SGLang+Mooncake)的对比因实现差异被论文自己标注为不公平。这两处在本篇正文中按原论文口径呈现,未做外推。

另一处补充:Turbo 论文在硬件通用性一节点名 Broadcom Trident(Trident 5)作为可迁移目标,但商用可编程交换芯片不止一家(EPIC 的作者列表里就有盛科/Centec)。"唯一商用承载"的说法不成立,本篇不取此说。

5. 技术评估与预测

一、KV 传输问题会催生新的传输协议族,而不是被现有协议吸收。 六篇论文没有一个试图修改 TCP/QUIC/RDMA 本身,它们全在 KV 的语义层做文章(请求级 profile、layer-block 格式、epoch 路由、ATTN 包头)。这与我们此前的判断一致:状态搬运需要的是语义感知的传输,通用协议给不了。预测:两年内会出现以 KV 为一等公民的传输协议提案(可能挂在 UEC/Ultra Ethernet 的扩展工作组下),DualPath 已点名 UE 的 QoS 支持。

二、压缩的战场从"压得更小"转向"选得更快"。 KVServe 的 50× 搜索加速 + <1ms 在线决策确立了这个方向:压缩比的边际收益递减(无损 ~10× 已接近 H.265 lossless 模式的压缩上限),而配置选择的收益空间刚刚打开。运行时化的压缩策略会成为推理服务的标配——正如自适应码率之于视频。

三、网内聚合与 KV 传输会在 decode 侧合流。 Turbo 的在网 attention 聚合与 DualPath 的 KV 加载调度作用于同一阶段(decode)的不同平面(计算 vs I/O)。当交换机同时做两件事,bitmap/表资源与聚合树的端口绑定会成为新的耦合点。session 5 的另四篇里,EPIC/HyNA 直接在网内聚合线上,PReCCL(遥测与重分配)与 UBEP(EP 通信库)在其外围,篇2 会展开。

四、agentic 负载是 KV 网络化的第一推动力,而且这个推动力被普遍低估。 DualPath 的 trace 显示 98.7% 命中率。agentic 多轮交互的 KV 复用模式与 chatbot 根本不同。当 agent 从几十轮走向几百轮、上下文走向 1M token,KV 传输的规模还会上一个量级。DeepSeek 把这个生产观察带到 SIGCOMM,说明这不是学术假设。

五、交换机做注意力聚合的路线受硬件周期约束。 Turbo 在 Tofino2 上把 20 个物理阶段排满:2 个给 γ 逻辑,64 元素 attention 段按 ⌈64/4⌉+2=18 个阶段布满余下全部(16 个分块+2 个滚动窗口),换来 TPOT -37%。这是把流水线资源用到物理上限换算力卸载的案例。Tofino 停产后,Broadcom Trident 与盛科等商用可编程交换芯片成为候选承载(Turbo 论文点名 Trident 可迁移,EPIC 工作组里有盛科),这条路线的未来取决于下一代可编程交换芯片的 SRAM/ALU 预算。五年维度看,晶上网络(wafer-scale)和 DPU 是更可能的承载。

六、可落地性分三档。 立即可抄的:KVServe 的策略层思路(自建推理平台可复刻,vLLM 集成已开源)、DualPath 的 VL 99:1 仲裁(有 IB 网络的集群改配置就能做);中期可用的:KVCodec 的思路(需要 NVENC/NVDEC 的驱动级集成,原型基于 LMCache v0.3.7)、Connex 的 mobility contract(等待 UCCL/NCCL 替代品的成熟);长期研究性的:Turbo 的全网在网聚合(受可编程交换机存量和批量部署成本约束)。对国产超节点栈(灵衢/UB 生态),DualPath 是最直接的可移植设计,论文已给出 QoS 映射路径。


声明: 本文基于六篇论文的 SIGCOMM 2026 正式版全文(ACM DL 获取,DOI 前缀 10.1145/3789240):KVServe / DualPath / KVCodec / Connex / Turbo / Artic。全部倍数与百分比按论文原文口径转写,实验条件在证据核对表逐行标注;Turbo 的 -99% 为 NS-3 仿真值(4 节点实测为 -37%),DualPath 基线为 DeepSeek 内部框架(作者自述与公开系统不可直接对照)。文中数据截至 2026 年 8 月 22 日。

本篇为 SIGCOMM 2026 深读系列第二篇。第一篇总览见《SIGCOMM 2026 全面研读》。下一篇:《Collectives 从库变成运行时》,集合通信的 15 篇论文如何重写 MoE(混合专家)时代的通信栈。