1. 新技术宣称
2026 年 8 月,ACM SIGCOMM 把开幕第一个 research session 的舞台给了同一个问题:KV cache 在分离式 LLM 服务架构中的网络传输。
这不是常规的"热点占位"。Session 1(LLM Inference & Serving)五篇中四篇、Session 5(In-Network Aggregation for ML)一篇、Session 18 一篇,合计六篇论文,覆盖了从压缩策略、传输编码、存储 I/O 调度、端点迁移到交换机内聚合的完整技术栈。把它们放在一起读,能看到一个清晰的图景:
当 prefill-decode 分离(PD 分离)成为推理服务的默认架构,KV cache 就从 GPU 内部状态变成了跨网络的显式负载(explicit payload)。网络社区用了不到两年时间,把这个新的流量类型从"性能问题"重新定义为"研究问题域"。
这件事的时间线值得记录。PD 分离架构(DistServe、Mooncake 等系统论文,2024)先在生产界铺开;KV cache 的容量问题(显存的暴政)和传输问题先在系统会议(OSDI/SOSP/ATC)出现;到 2026 年,SIGCOMM 把它纳入自己的核心议程:不是作为应用背景,而是作为网络研究的对象本身。六篇论文的引言部分几乎都在复述同类测量事实,两组数字都出自 KVServe:H100 解码节点在 10-50Gbps 扫描下,KV 通信占任务完成时间的 16%-60%(图 1);占比随带宽收紧单调上升,带宽本身是第一变量。而在长上下文负载的端到端分解实验(Qwen2.5-32B,2WikiMQA/HotpotQA)里,Default 配置的通信占总 JCT 的 82%-90%,压缩后降至 6-9%(图 15)。长上下文把这个比例推到另一个量级。两个维度合起来:带宽越紧、上下文越长,KV 越是主导。

问题域的迁移本身就说明了一件事:LLM 推理的网络瓶颈,已经从"连接 GPU"变成"搬运状态"。
(Session 1 的第五篇 TurboBus 做 PCIe 带宽池化,属于 scale-up 互联问题,留给本系列第三篇。)
2. 逐篇深读:六篇论文在解决什么
先把这个技术栈里六篇论文的问题定义并排放出来。它们共享同一个大背景(PD 分离后 KV 必须跨网络流动),但切入的层面完全不同:
| 论文 | 一句话问题 | 切入层面 |
|---|---|---|
| KVServe | 静态 KV 压缩配置在变化的负载/带宽下次优甚至负优化 | 策略层(压缩配置的选择) |
| KVCodec | CUDA 核解压与推理抢 GPU 资源,SmartNIC 方案太贵 | 编码层(传输格式与编解码硬件) |
| DualPath | agentic 负载下 prefill 侧存储网饱和、decode 侧闲置 | 架构层(I/O 路径的带宽调度) |
| Connex | worker 加入/离开/迁移时 NCCL 全局重建,多秒停摆 | 架构层(通信原语的弹性) |
| Turbo | Pass-Q 序列并行的 master 聚合随上下文变长成为瓶颈 | 网络计算层(聚合算子进交换机) |
| Artic | RTC 从"人看视频"变成"AI 理解视频",整套机制失配 | 流量类型层(AI 消费者的新流量) |
(Video-codec-KV 与 KVCodec 为同一工作的会议版命名,正文统一用 KVCodec。)
2.1 KVServe:压缩不是算法选择,是状态依赖的策略选择
PD 分离之后,KV cache 要跨网搬运,压缩是省带宽的第一反应。但生产系统怎么选压缩方法?今天的答案是:上线前拍板一个,之后不再动。KVServe(中科院计算所,session 1 首篇)开头就用三组测量把这个默认做法打穿。第一,没有跨负载的最优算法:KIVI(2-bit 量化)在 Qasper 上精度最优,在 GSM8K/HumanEval 上接近垫底;DuoAttention(剪枝)恰好反过来;CacheGen 的压缩比在 Multi-News 上 6.20×,到 HumanEval 只剩 3.98×。第二,最优策略随带宽漂移:低带宽时 CacheGen(高压缩比)最优,中段 MixHQ 接管,高带宽时 KIVI(低压解压开销)反超;而且各自超过阈值(50/55/110 Gbps)后,三种静态方法都比不压缩更慢,压解压开销吃掉了通信节省。第三,负优化真实存在:短上下文任务(GSM8K、HumanEval)上,静态压缩基线的 JCT 高于完全不压缩的 Default。三组合起来,问题被重新定义:压缩配置不是离线常数,是随负载和带宽漂移的在线决策。
KVServe 的回答是把"选压缩方法"重构为带约束的在线选择:压缩策略 = 负载类型 × 有效带宽 × SLO/质量预算三维状态下的决策。工程上分三步走。先把 CacheGen/KIVI/KVQuant/MixHQ 分解成可插拔组件,让策略空间可组合,这一步是系统地基;离线侧不蛮力,贝叶斯 Profiling 把策略空间搜索从 1000 小时压到 20 小时量级,产出延迟×精度×压缩比的 Pareto 前沿;在线侧用解析延迟模型给出基线决策(单次 <1ms),再由轻量 bandit 纠正 offline-online 漂移。
系统在三负载族(QA/数学/代码)× 三档硬件(10/50/100 Gbps)× 四个静态基线上验证:状态感知的策略选择在全部测试点不输最优静态基线,在负载或带宽漂移时显著优于任何固定选择。静态最优只在它被选中的那个状态窗口里最优。
有效性成立,边界也清楚:20 小时级的离线 profiling 对模型频繁迭代的服务是真实成本;bandit 依赖在线信号质量。另一条发现值得单独记录:CacheGen 移植到 Qwen2.5 上精度崩塌(HumanEval 掉到 57.32%),根因是 Qwen2.5 的 K/V projection 含 bias 项,分布非零中心、非对称,uniform 量化映射失配。压缩方法的可移植性受模型架构细节约束,这类"架构耦合"问题会在更多模型上重演。原则判断:压缩策略必须运行时化,与拥塞控制从静态配置走到 BBR 的演进同构。
2.2 KVCodec:闲置的视频编解码 ASIC
压缩的另一端是解压在哪做。两条现有路线都有硬伤:CacheGen 用 CUDA 核加速解压,但 SM 与推理抢资源,实测 prefill 时间 +50%、decode 时间 +20%,解压峰值内存是原始 KV 的 2.7×;ShadowServe 把解压放到 SmartNIC,代价是专用硬件,普及不动。生产动机摆在那里:Kimi 的生产负载里 50% 的 KV 可复用(Mooncake 论文数据),fetch 路径的解压开销每天都在发生。
KVCodec(南大 + 清华 AIR)的洞察简单而有效:现代 GPU 的 NVENC/NVDEC 视频编解码 ASIC,在整个 LLM 推理过程中完全闲置。把它征用为 KV 编解码硬件:复用 H.265 的无损部分(帧内/帧间冗余消除),跳过 DCT+量化的有损步骤,配合 token 维切片和连续帧布局,做到约 10× 的无损压缩;解压走 NVDEC 池,与 CUDA 核物理隔离,干扰近乎为零。
原型基于 LMCache v0.3.7。结果分两层:fetch 请求的 TTFT(首 token 延迟)相比全量 prefill 降低 13.63×、相比原始 KV 传输降低 3.51×、相比 CacheGen 降低 1.52×;更值得注意的是连带效应,非 reuse 请求的 TTFT 反而降低 77%。解压不再抢 CUDA 资源后,连不碰 KV 复用的请求都被顺带加速了。
有效性成立,落地是中期档:需要 NVENC/NVDEC 的驱动级集成,不是改配置就能用。"闲置专用硬件是一等资源"这个思路可以推广:AMD 的 AMF 同理;其他被推理闲置的 ASIC(JPEG 解码器、显示引擎)是否可用,是论文留下的开放方向。
2.3 DualPath:agentic 负载推翻了 prefill 中心的假设
北大 + 清华 + DeepSeek-AI 的工作。DeepSeek 的名字第一次出现在 SIGCOMM 作者列表上,方向正是 agentic inference 的 KV 存储 I/O:一家以模型能力著称的公司,把生产推理系统的网络问题带到了网络顶会,这个信号本身值得记。
它攻击的是一个被默认架构掩盖的浪费。动机数据来自生产 agentic RL 训练 trace:平均 157 轮交互、上下文 32.7K token、每轮只追加 429 个新 token,KV 命中率 98.7%。这种负载下,推理几乎不做 prefill 计算,只做 KV 加载:DeepSeek-V3.2 的 cache-compute 比约 22 GB/PFLOP,瓶颈从计算彻底转向存储 I/O。而现有架构把全部存储 I/O 压在 prefill 侧:命中 KV 只从存储经 prefill 引擎的存储网卡加载,PE 侧饱和、DE 侧闲置。带宽不对称在被浪费,而不是在被调度。
DualPath 的方案是双路径加载:在"存储→prefill"之外,新增"存储→decode→经计算网 RDMA 转 prefill",让 decode 侧的闲置带宽也成为加载通道。配套两件事:CNIC 中心的流量管理,IB 虚拟通道按 99:1 仲裁(模型通信高优先级、KV 传输低优先级防饿死);两级调度,把全部节点的存储带宽聚成一个可调度池。理论侧给出无瓶颈的 P/D 安全区间:17 ≤ P/D ≤ 72(g=8、s=1 配置解析),覆盖绝大多数生产配置。
DS 660B 上的实验:离线 JCT 最高 1.87×,在线吞吐平均 1.96×。读数字要知道基线:对照组是 DeepSeek 内部框架,论文自己标注与公开系统(SGLang+Mooncake)的对比因实现差异不可直接比。还有一个对国产栈很实际的讨论:RoCE 上用 TC+DSCP 平移该设计,论文点名 UnifiedBus(灵衢)和 Ultra Ethernet 的 QoS 机制可以直接支持 DualPath 的需求。机制层面,这是六篇里最直接可移植到国产超节点栈的设计。

2.4 Connex:端点移动性升格为一等原语
弹性推理的通信层缺位,是 Connex 要解的问题。worker 加入/离开/迁移时,NCCL 的通信组需要全局重建:communicator 重建、rank 重排、barrier 同步,多秒级 stop-the-world。vLLM 社区已把"缺席 handover"列为弹性推理的 fundamental blocker。生产上的弹性扩缩容、故障恢复、多租户调度,全被这个通信层短板卡着。
中科院深圳先进院 + UPenn + 澳门大学的作者们没有为每种 churn 打补丁,而是定义 mobility contract:join/leave/migrate 发生时通信层必须保证的语义合同。三个机制各管一段:epoch 路由,让重配置变成局部路由更新,不再全局重建;显式 handover,用序列号+幂等投递+选择性重传,把迁移放在相邻阶段本地完成;credit 反压加流量分级,保证 churn 干扰不传导到延迟敏感路径。
5 节点 A40 测试床上的 churn 实验:P99 尾刺 -85%,切换亚秒级,稳态开销 <5%(TTFT +10ms、TPOT(每输出 token 间隔)+2ms)。机制成立,局限明确:5 节点是它的主要短板,规模上未验证。
值得记的是它的构造方式:三个组件全是经典分布式技术(epoch、幂等投递、反压),为 GPU tensor 流的 token-iterative 语义重新组合成合同。这不是发明新轮子,是把已知正确的机制搬到新语义下。落地节奏跟随 UCCL/NCCL 替代品的成熟度,属中期档。
2.5 Turbo:聚合算子进交换机
KV 线的最底层:不只是搬运 KV,把注意力聚合的计算本身放进交换机。背景是序列并行(SP)的 Pass-Q 模式:master 广播 query,各 worker 算本地 attention,master 集中聚合。序列一长,master 同时成为算力和带宽的瓶颈,还引发 incast。这是"计算跟着数据走"的老问题在注意力时代的版本。
东南大学 + 北大 + 清华 + NUS 的团队把广播和聚合都卸载到 Tofino2 可编程交换机。三件套里含金量最高的是在线查表聚合:softmax 的指数和除法在交换机上没有浮点支持,Turbo 把全局归约分解为 pairwise 操作,非线性函数用 11-bit 索引、2KB 的查找表近似,精度损失可忽略。配套解决 RMT(可重构 match-action 流水线,Tofino 类芯片的架构基础)单向流水线不可回溯写的 rolling forward 方案,和负载感知的聚合树(整数线性规划 ILP 归约为最大流问题)。
2352 行 P4 在 Tofino2 上实现,4 节点实测加 NS-3 大规模仿真。TPOT 最高 -37%(8 GPU 跨度上下文,vs Ring-Attention),仿真里延迟 -99%。经济账也算得清楚:可编程交换机与商用交换机的差价约 $4000,是 H100 的 1/10;整机功耗 268.8W,低于单张 H100 的 700W TDP。
有效,但两条边界都在证据核对表标了:-99% 是 NS-3 仿真值,实测床只到 4 节点(实测 -37%);硬件上 Tofino2 的 20 个物理阶段被排满,2 个给 γ 逻辑,64 元素 attention 段按 ⌈64/4⌉+2=18 个阶段布满余下全部(16 个分块+2 个滚动窗口),无余量。Tofino 停产之后,这条路线的下一个承载在商用可编程芯片:论文点名 Trident 可迁移,EPIC 工作组里有盛科。
2.6 Artic:AI 消费者的另一端流量
前五篇都在讲"AI 吃带宽",Artic 讲反面:"AI 不需要那么多带宽"。AI Video Assistant(Grok、Gemini Live、ChatGPT、Copilot、豆包都在做)的流量模式是上行高码率视频、云端 MLLM 理解后回传音频。上行主导,与 KV 的下行主导恰成方向对照。而传统 RTC 整套机制是为"人看视频"设计的,拥塞控制的目标是填满带宽;当消费者从人眼换成 MLLM,这套机制从根上失配。北大的这篇放在 session 18,但它在流量方向上与 KV 线构成对偶。
支撑一套新机制的是两个发现。其一,MLLM 的码率-精度曲线存在饱和点(约 968 Kbps,再加码率精度不涨)。对 AI 消费者,带宽 headroom 比码率更值钱,填满带宽的拥塞控制反而有害。其二,MLLM 可以实时反馈"回答所需的区域":客户端按反馈分配 QP,重要性识别放在服务端,客户端零开销。
配套的评测基准 DeViBench 自动构建(1968 样本,总成本 $48.06),实验用 5G 上行 trace 回放。同等精度下,标准编码需要 3171 Kbps,上下文感知编码只需 908 Kbps;总体精度 +15.12%、延迟 -135.31ms。
结论方向比数字更重要:AI 消费者的流量需要自己的传输语义,饱和点感知的码率控制、服务端驱动的区域优先级,这会反向改写 RTC 这一层的协议设计。
3. 路线分析:技术路径图谱
六篇论文并排放置,一个分层清晰的技术栈浮现出来。KV 传输问题的解空间可以沿"动什么"分成五层:

三个动词(省、快、搬)在这五层上重新分布:
- 省(压缩):策略层+编码层。KVServe 证明静态压缩有负优化区,KVCodec 证明压缩/解压的算力开销可以用闲置 ASIC 消零。压缩路线的天花板由注意力质量对量化的敏感度决定。两个工作都绕开了"更高压缩比"的军备竞赛,转而解决"何时压、在哪压"。
- 快(调度):架构层。DualPath 把带宽不对称当作可调度资源,Connex 把成员变化当作通信原语。这一层的共同假设是拓扑信息可用——调度质量取决于对网络状态的知识。
- 搬(传输与计算):网络计算层。Turbo 的 LUT 方案把"交换机能算什么"的边界又推了一步。这条路线的约束是交换机资源(Tofino2 的 20 个物理阶段排满后无余量)和硬件世代(Tofino 停产后的移植问题)。
五层之间不互斥,反而高度可组合:KVServe 的策略层理论上可以驱动 KVCodec 的编码器;DualPath 的路径调度与 Turbo 的网内聚合作用于不同平面。SIGCOMM 把 session 1 和 session 5 排在同一个会议里,本身就暗示了这个栈式结构。
4. 证据核对
本篇所有数字的来源锚定:
| 主张 | 数字 | 出处 |
|---|---|---|
| KV 传输占端到端延迟 16%-60% | H100 解码+10-50Gbps 实测 | KVServe §2.1 图 1 |
| 长上下文负载通信占比 82%-90%(压缩后 6-9%) | Qwen2.5-32B,2WikiMQA/HotpotQA,Default 配置 | KVServe §7 图 15 |
| Kimi 生产负载 50% KV 复用率 | Mooncake 论文引用 | KVCodec §1(引 [54]) |
| agentic 负载 KV 命中率 98.7% | 生产 RL trace,平均 157 轮/32.7K ctx/429 append | DualPath §3 |
| 静态压缩负优化阈值 50/55/110 Gbps | CacheGen/MixHQ/KIVI 三方法实测 | KVServe §2.2 图 4 |
| KVServe 搜索开销 1000h→20h | 贝叶斯优化 | KVServe 摘要/§5 |
| KVCodec 无损压缩 ~10× | H.265 lossless+布局优化 | KVCodec §3.2 |
| KVCodec 同精度码率 3171→908 Kbps | ZeCoStream(Artic 系统的上下文感知编码)vs 标准编码 | Artic §7.3 图 11 |
| DualPath 离线 1.87×/在线 1.96× | DS 660B,vs 内部基线 | DualPath §7.3/7.4 |
| DualPath 无瓶颈区间 17≤P/D≤72 | g=8,s=1 解析 | DualPath §4.2 式(9) |
| Connex P99 尾刺 -85%,稳态 <5% | 5 节点 A40 churn 实验 | Connex 摘要/§6.2 |
| Turbo TPOT -37%/-99% | 4 节点 Tofino2 实测 / NS-3 仿真 | Turbo §6.1/6.2 |
| Turbo 交换机功耗 268.8W vs H100 700W | Tofino2 4.2W/口×64 | Turbo §6.1 |
| Artic 精度 +15.12%/延迟 -135.31ms | 5G 上行 trace 回放 | Artic 摘要 |
两处需要说明的口径:其一,Turbo 的 -99% 来自 NS-3 仿真而非实测(测试床只到 4 节点);其二,DualPath 的基线是 DeepSeek 内部框架,与公开系统(SGLang+Mooncake)的对比因实现差异被论文自己标注为不公平。这两处在本篇正文中按原论文口径呈现,未做外推。
另一处补充:Turbo 论文在硬件通用性一节点名 Broadcom Trident(Trident 5)作为可迁移目标,但商用可编程交换芯片不止一家(EPIC 的作者列表里就有盛科/Centec)。"唯一商用承载"的说法不成立,本篇不取此说。
5. 技术评估与预测
一、KV 传输问题会催生新的传输协议族,而不是被现有协议吸收。 六篇论文没有一个试图修改 TCP/QUIC/RDMA 本身,它们全在 KV 的语义层做文章(请求级 profile、layer-block 格式、epoch 路由、ATTN 包头)。这与我们此前的判断一致:状态搬运需要的是语义感知的传输,通用协议给不了。预测:两年内会出现以 KV 为一等公民的传输协议提案(可能挂在 UEC/Ultra Ethernet 的扩展工作组下),DualPath 已点名 UE 的 QoS 支持。
二、压缩的战场从"压得更小"转向"选得更快"。 KVServe 的 50× 搜索加速 + <1ms 在线决策确立了这个方向:压缩比的边际收益递减(无损 ~10× 已接近 H.265 lossless 模式的压缩上限),而配置选择的收益空间刚刚打开。运行时化的压缩策略会成为推理服务的标配——正如自适应码率之于视频。
三、网内聚合与 KV 传输会在 decode 侧合流。 Turbo 的在网 attention 聚合与 DualPath 的 KV 加载调度作用于同一阶段(decode)的不同平面(计算 vs I/O)。当交换机同时做两件事,bitmap/表资源与聚合树的端口绑定会成为新的耦合点。session 5 的另四篇里,EPIC/HyNA 直接在网内聚合线上,PReCCL(遥测与重分配)与 UBEP(EP 通信库)在其外围,篇2 会展开。
四、agentic 负载是 KV 网络化的第一推动力,而且这个推动力被普遍低估。 DualPath 的 trace 显示 98.7% 命中率。agentic 多轮交互的 KV 复用模式与 chatbot 根本不同。当 agent 从几十轮走向几百轮、上下文走向 1M token,KV 传输的规模还会上一个量级。DeepSeek 把这个生产观察带到 SIGCOMM,说明这不是学术假设。
五、交换机做注意力聚合的路线受硬件周期约束。 Turbo 在 Tofino2 上把 20 个物理阶段排满:2 个给 γ 逻辑,64 元素 attention 段按 ⌈64/4⌉+2=18 个阶段布满余下全部(16 个分块+2 个滚动窗口),换来 TPOT -37%。这是把流水线资源用到物理上限换算力卸载的案例。Tofino 停产后,Broadcom Trident 与盛科等商用可编程交换芯片成为候选承载(Turbo 论文点名 Trident 可迁移,EPIC 工作组里有盛科),这条路线的未来取决于下一代可编程交换芯片的 SRAM/ALU 预算。五年维度看,晶上网络(wafer-scale)和 DPU 是更可能的承载。
六、可落地性分三档。 立即可抄的:KVServe 的策略层思路(自建推理平台可复刻,vLLM 集成已开源)、DualPath 的 VL 99:1 仲裁(有 IB 网络的集群改配置就能做);中期可用的:KVCodec 的思路(需要 NVENC/NVDEC 的驱动级集成,原型基于 LMCache v0.3.7)、Connex 的 mobility contract(等待 UCCL/NCCL 替代品的成熟);长期研究性的:Turbo 的全网在网聚合(受可编程交换机存量和批量部署成本约束)。对国产超节点栈(灵衢/UB 生态),DualPath 是最直接的可移植设计,论文已给出 QoS 映射路径。
声明: 本文基于六篇论文的 SIGCOMM 2026 正式版全文(ACM DL 获取,DOI 前缀 10.1145/3789240):KVServe / DualPath / KVCodec / Connex / Turbo / Artic。全部倍数与百分比按论文原文口径转写,实验条件在证据核对表逐行标注;Turbo 的 -99% 为 NS-3 仿真值(4 节点实测为 -37%),DualPath 基线为 DeepSeek 内部框架(作者自述与公开系统不可直接对照)。文中数据截至 2026 年 8 月 22 日。
本篇为 SIGCOMM 2026 深读系列第二篇。第一篇总览见《SIGCOMM 2026 全面研读》。下一篇:《Collectives 从库变成运行时》,集合通信的 15 篇论文如何重写 MoE(混合专家)时代的通信栈。
