← 返回观点 思考

模型记忆架构的效率极限:从 MLA 到 CSA+HCA

以 V4 Flash/Pro 架构选择为锚点,先理解唐杰团队记忆综述的三轴分类框架,再用生产数据检验其预测力。V4 放弃 MLA、KDA 和 Gated DeltaNet 进入生产级。

2026-08-08思考50 分钟阅读

LLM 记忆架构演进:从 V4 的选择看模型记忆的下一个十年

推理经济学三部曲 · DeepSeek V4 Flash 输出 2 元/百万 token,Claude Sonnet 5 输出 107 元。53 倍差距不是补贴——是物理。本系列从定价倒推到架构选择到工程调度,拆解一个 Token 的物理成本到底由什么决定。

DeepSeek V4 技术报告(55 页)披露了两个模型在"记忆"维度上的关键选择:

记忆相关指标 V4-Flash V4-Pro V3.2(上一代)
激活参数(MoE 稀疏激活) 13B 49B 37B
注意力机制 CSA + HCA 混合 CSA + HCA 混合 MLA
单 token FLOPs V3.2 的 10% V3.2 的 27% 100%
KV cache 大小 V3.2 的 7% V3.2 的 10% 100%
上下文窗口 1M 1M 128K

这些数字不是孤立的工程指标——它们是"模型怎么记忆"这个问题的物理表达。V4 的两个模型在记忆架构的演进曲线上做了非常不同的选择,而两者的定价(Flash 2 元/M、Pro 6 元/M)精确追踪了这些选择的物理成本。

本文的方法论是:先准确理解 Zhoubian, Zhang, Kharlamov & Tang 在 Memory for Large Language Models(arXiv:2607.25380,2026-07-28 提交,20 页 4 图)中提出的三轴分类框架和主要结论,再用当前生产环境的实际数据来检验这个框架的预测力——V4 放弃 MLA 转向 CSA+HCA、Kimi K3 的 KDA 已生产级部署、Qwen3-Next 的 Gated DeltaNet 已生产级部署。不是直接拿分类去套,而是看论文的理论框架在面对 2026 年下半年的生产现实时,哪里吻合、哪里被超越。

一、论文框架:三轴分类与主要结论

1.1 忠实理解论文的三轴坐标系

Zhoubian, Zhang, Kharlamov & Tang(2026)在 Memory for Large Language Models 中的核心贡献是在混乱的"记忆"文献中建立了一个可比较的三轴坐标系,并形式化了记忆操作的四个核心机制——写入(write)、路由(route)、状态转换(state transition)、合并(merge)的粒度。

三轴分类:

取值 回答的问题
表征(Representation) 隐式(implicit)vs 显式(explicit) 存的是什么?有独立读写接口?
更新动态(Update Dynamics) 离线(offline)vs 在线(online) 什么时候更新?训练期还是推理期?
持久性(Persistence) 短期(short-term)vs 长期(long-term) 信息能影响多久?单次推理还是跨会话?

论文在三轴坐标系下进一步分析了混合记忆架构(跨越多个格子的设计)、系统级效率权衡(不同记忆类型的计算/存储成本),以及多维评估方法。论文的隐含判断是:当前主流 LLM 集中在"隐式 / 离线 / 短期"格子里,但演进趋势指向"显式 / 在线 / 长期"的迁移——论文梳理了多条可能的迁移路径。

1.2 用生产数据检验框架

V4 在框架中的位置:

V4 Flash/Pro 的位置 说明
表征 隐式 KV cache + MoE 参数路由,无独立记忆接口
更新动态 离线 训练期写入参数,推理时只读不写
持久性 短期 KV cache 随请求结束丢弃;参数持久但不是"记忆"语义

V4 两个模型都落在"隐式 / 离线 / 短期"——这与论文对主流 Frontier 模型的判断一致。Claude、GPT、Qwen 等也在同一格子。V4 的创新不是"跳到新格子",而是在这个格子里把效率推到极致。

但生产现实已经在挑战论文框架的边界:

  1. V4 放弃 MLA 是论文未覆盖的重大架构转向。 MLA(Multi-head Latent Attention)是 DeepSeek V2-V3 的核心 KV 压缩方案,属于"隐式 / 离线 / 短期"格子内的效率优化。V4 用 CSA+HCA 完全替代 MLA(详见第二节),意味着一种压缩路线被证伪、层级压缩 + 稀疏选择路线胜出——这是论文发表前后才发生的分叉。

  2. 线性注意力混合架构已跨越生产门槛——论文可能低估了这条路线的速度。 Kimi K3 的 KDA(2026-07)和 Qwen3-Next 的 Gated DeltaNet(2025-09)都已进入生产级部署(详见第六节),而论文分析混合架构时更多将其视为"趋势"。

  3. DeepSeek 对"迁移"的保守程度超出论文预期。 论文梳理了多条迁移路径,但 V4 连最接近生产的 Titans 式推理时更新都完全跳过——Engram(显式 / 在线 / 长期)仅留给 V5。DeepSeek 作为最激进的架构创新者都选择"榨干现有范式",说明迁移的工程障碍比理论分析显示的更大。

二、V4 在隐式记忆内部的三个 axes of improvement

在"隐式 / 离线 / 短期"这个格子里,V4 做了三件事,每一件都对定价有直接影响:

2.1 MoE 稀疏激活:参数空间的条件记忆

MoE 本质是参数空间里的条件记忆——每个专家是一个持久参数化记忆块,路由器是"上下文相关寻址"。

V4 的选择:

  • Flash:284B 总参数,每 token 激活 13B(4.6%)
  • Pro:1.6T 总参数,每 token 激活 49B(3.1%)
  • Pro 的稀疏度更高(3.1% vs 4.6%),意味着更大的知识储备但单位推理成本仍可控

V4 的 MoE 细节调整:affinity score 激活函数改为 Sqrt(Softplus(·)),前几层 dense FFN 改为 Hash routing。这些是工程优化,不改变记忆范式。

对定价的影响: Flash 13B 激活 → 单请求 decode 257.7 tok/s(H100);Pro 49B 激活 → 68.4 tok/s。定价比例 3× 追踪激活参数比例 3.75×。

2.2 CSA + HCA 混合注意力:KV cache 的层级压缩

这是 V4 记忆架构的核心创新。不是"换一种记忆方式",而是把同一种记忆(KV cache)做分层压缩

值得强调的架构决策:V4 放弃了 MLA。 从 V2 到 V3,DeepSeek 持续使用 MLA(Multi-head Latent Attention)作为注意力压缩方案——MLA 通过低秩投影压缩 KV 实现数倍效率提升,是 V2/V3 的核心技术之一。V4 用 CSA+HCA+MQA 的混合架构完全替代了 MLA,这是一个重大架构转向。UCLA 博士刘益枫在晚点访谈(2026-05)中明确指出:"V4 放弃了从 V2 到 V3 使用的 MLA。"这意味着 DeepSeek 判断 MLA 的压缩潜力已到天花板,层级压缩 + 稀疏选择(CSA+HCA)才是下一步。

CSA(压缩稀疏注意力)——局部精细依赖:

  • CSA 先将每 m 个 token 的 KV 压缩为 1 个条目(技术报告未公开 m 的具体取值,根据压缩比推算 m ≈ 8-16),再用 Lightning Indexer 做 top-k 稀疏选择
  • Lightning Indexer 以低秩方式生成索引查询,选择 top-k 压缩 KV 条目
  • 共享 KV-MQA 进一步降低计算成本
  • 负责底层——保持精细的局部依赖

HCA(重度压缩注意力)——远端大幅压缩:

  • 每 m'(m' ≫ m)个 token 压缩为 1 个条目
  • 保持密集注意力(不做稀疏选择)
  • 负责高层——大幅压缩远端上下文

两层交替叠加的结果:KV cache 压到 V3.2 的 7%(Flash)/ 10%(Pro)。注意 Flash 的压缩更激进——7% vs 10%,因为 Flash 的 CSA 参数 m 更小、HCA 的压缩比更大。

为什么 Flash 和 Pro 的 KV 压缩比例不同? 因为两个模型是独立预训练的,不是蒸馏关系。Flash 的设计目标是"极致推理效率"(适合高并发 API),Pro 的设计目标是"极致推理质量"(适合复杂推理)。KV 压缩比例的差异是质量-成本 trade-off 的直接体现。

2.3 MTP(Multi-Token Prediction):投机采样的加速器

MTP 本身不是记忆机制——它是 V3 遗留的工程设计,训练时预测多个 token,部署时用于投机采样。但它的效果(1.8× 加速)直接影响聚合吞吐,从而影响定价底线。

三、V4 没选的路:被明确放弃的记忆方向

理解 V4 选了什么很重要,理解它没选什么同样重要。

Engram(条件记忆模块):留给 V5

DeepSeek 2026 年 1 月联合北大发表 Engram 论文——哈希寻址稀疏记忆槽,把记忆稀疏性和专家稀疏性明确分开。但技术报告明确说 Engram 没进 V4,在"未来方向"里被点名。

为什么没进? 三个可能的工程原因:

  1. Engram 的"模型内嵌查找"与 RAG 的"外部检索"功能重叠,后者工程更成熟
  2. 哈希寻址的新组件增加训练和推理的复杂度,V4 的 55 页报告已经有足够多的架构变动
  3. 没有在 1.6T 规模上验证过——Engram 论文的实验规模远小于 Pro

对 V5 的含义: 如果 Engram 在 V5 进入生产,它将是第一个打破"隐式 / 离线"框架的主流 Frontier 模型——从"只读记忆"变成"可写记忆"。这是一个范式跳跃,不是渐进优化。

Titans / TTT:连提都没提

推理时记忆更新(Titans 的"惊讶度驱动梯度更新"、TTT-E2E 的"推理时端到端优化")在 V4 报告中完全缺席。这不是遗漏——是有意识的排除。

为什么? 推理时写参数和现代推理系统的核心优化直接冲突:

  • batch 内不同请求需要更新不同参数 → batching 效率崩溃
  • 更新计算量不可预测 → 延迟不稳定
  • 长期稳定性未知 → 生产风险

判断: 在可见的未来(2027-2028),推理时记忆更新不会进入主流 Frontier API。DeepSeek 作为最激进的效率优化者都没选这条路,说明工程障碍比论文里呈现的大得多。

循环状态记忆(Mamba/RWKV):替代路线,非融合路线

V4 没有采用任何循环状态层。纯注意力路线 + MoE 稀疏化是 V4 的选择。Kimi K3 的 KDA(Kimi Delta Attention,混合线性注意力机制——将线性注意力与 Delta 规则结合,实现 KV Cache 12.5 倍压缩、解码速度提升 6.3 倍)走的是另一条路——把线性状态压缩和注意力混合。KDA 已在 Kimi K3(2.8T 参数,2026-07-16 发布)中进入生产级部署。

这两条路不互斥——AI21 Jamba 已经在探索 MoE + Attention + Mamba 的三层混合。但 DeepSeek 在 V4 上选择了"把注意力做到极致"而不是"混合两种记忆范式"。

四、三层记忆体系:V4 的具体位置

把论文的三轴分类和 V4 的实际部署放在一起:

层级 V4 中的具体实现 寿命 更新方式 物理介质
架构级(模型内部) CSA + HCA 压缩 KV cache;MoE 13B/49B 激活路由 单次推理 ~会话 前向计算(只读) HBM
基础设施级(推理系统) DualPath 双路径加载 + 3FS 分布式文件系统 + 三级存储调度 分钟 ~小时 调度器管理 HBM → DRAM → SSD
Agent 级(应用层) DeepSeek Harness 原生框架 + OpenAI Responses API 兼容 小时 ~永久 工程管线编排 SSD → 对象存储

三层之间的信号传递路径(以 V4 Flash 为例):

  1. 架构级:CSA+HCA 把 KV cache 压到 V3.2 的 7% → 每请求 KV cache 仅 ~25 KB(4K 上下文)
  2. 基础设施级:KV cache 极小 → HBM 可容纳更多并发请求 → batch 天花板大幅提升
  3. batch 天花板提升 → 聚合吞吐 ~36,000 tok/s/GPU(batch=100,含 MTP)
  4. 吞吐决定定价底线 → Flash 2 元/M 在 batch ~80 时仍有 83% 毛利(OpenCode CEO 口径)
  5. Agent 级:Harness 框架产生大量重复 prefix(system prompt、工具定义)→ 95%+ KV-Cache 命中率(DualPath 论文 Agent 场景实测 98.7%)→ 进一步降低物理成本

核心洞察:三层不是独立设计的——V4 的架构选择(CSA+HCA)直接决定了基础设施级的调度策略,后者直接决定了定价。 这条因果链是文章《推理定价的物理底线》的分析基础。

五、演进趋势判断

趋势一:V4 代表的路线——"把隐式记忆做到极致"——还有 2-3 年的红利

V4 Flash 的 KV cache 已经压到 V3.2 的 7%。继续压缩的技术空间:

  • CSA 稀疏选择更激进(当前 top-k,未来可能 top-1 或动态 k)
  • HCA 压缩比更大(当前 m' ≫ m,未来 m' 可能到数百)
  • FlashMemory-DeepSeek-V4 论文(2026-06)已经展示 KV Cache 进一步压到 1/10 的可能性——Lookahead Sparse Attention

MoE 稀疏激活还有空间:Flash 4.6% 激活比例已经很低,但如果走向更细粒度的专家划分(V3 是 256 选 8,未来可能 1024 选 4),激活参数可以进一步降低。

判断:隐式 / 离线 / 短期这个格子里的效率提升还没到天花板。下一代模型不需要切换记忆范式,只需要在这个格子里继续压。

趋势二:隐式→显式的迁移正在加速,但不会经过 V4

阶段 记忆类型 代表 位置
2017-2023 隐式(注意力 KV cache) 标准 Transformer ← V3 在这里
2024-2026 隐式压缩 → 极致压缩(MLA+MoE → CSA+HCA) DeepSeek V3 → V4 Flash/Pro ← V3 到 V4 的演进路线
2026 显式参数化(推理时更新) Titans、TTT ← V4 明确不选
2027+ 显式查找 + 多时间尺度? Engram in V5? ← V4 留给未来

V4 的位置很清晰:隐式记忆的极致阶段。它是这条路线上效率最高的模型——但也是这条路线接近尾声的信号。7% KV cache 和 4.6% 激活比例留下的空间不多了。

趋势三:架构级和基础设施级的融合——V4 是第一个样本

当前两个层级独立设计。V4 是第一个把两者紧密耦合的系统:

  • 架构级:CSA+HCA 压缩让 KV cache 小到三级存储调度几乎无感
  • 基础设施级:DualPath 双路径加载 + 3FS 文件系统专门为这种小 KV cache 优化
  • 两者协同的结果:98.7% KV-Cache 命中率、batch 80+ 运行、83% 毛利

下一代趋势:模型架构师设计 CSA/HCA 参数时直接考虑"压缩后的 KV block 在 PCIe Gen5 上的传输延迟"——这在 V4 设计时已经隐含,下一代会显式化。

V4 记忆架构成熟度评估
V4 记忆架构成熟度评估

六、成熟度评估:哪些已经在你用的模型里,哪些还停在论文里

已在生产环境运行

这些技术在 2024-2026 年间成熟并进入生产系统。MoE 稀疏激活和注意力压缩的工程价值被多个团队独立验证,推理引擎(vLLM、SGLang)的生态支持已就位。除 DeepSeek V4 的 CSA+HCA 外,Kimi K3 的 KDA 和 Qwen3-Next 的 Gated DeltaNet 也已分别在 2026-07 和 2025-09 进入生产级部署——线性注意力混合架构不再是纸面方案。

技术 在 V4 中的角色 其他采用者
MoE 稀疏激活 Flash 284B/13B,Pro 1.6T/49B Qwen3-MoE、Mixtral、Kimi K3
CSA + HCA 混合注意力 V4 独有,KV cache 压到 7-10% 尚无第三方采用(技术报告刚开源 4 个月)
MLA(Multi-head Latent Attention) V2-V3 的注意力压缩方案,V4 放弃并转向 CSA+HCA DeepSeek V2/V3、Kimi Moonlight(月之暗面)
KDA(Kimi Delta Attention) V4 未采用 Kimi K3(2.8T 参数,2026-07-16 发布),KV Cache 压缩 12.5 倍、解码速度提升 6.3 倍
Gated DeltaNet V4 未采用 Qwen3-Next-80B-A3B(2025-09-12 发布),75% 层使用 Gated DeltaNet + Gated Attention 混合架构
三级 KV cache 调度 DualPath 论文证实生产部署 DeepSeek 独有
PagedAttention 推理引擎底层 vLLM(行业标准)
RadixAttention prefix cache SGLang
MTP 投机采样 1.8× 加速 DeepSeek V3 起标配

一句话: 今天你调 V4 Flash 或 Pro 的 API,这些技术的组合正在运行。它们是 2 元/M 和 6 元/M 定价的物理基础。

工程验证阶段(有可用实现,尚未大规模商用)

随着 KDA(Kimi K3)和 Gated DeltaNet(Qwen3-Next)在 2025-2026 年进入生产级部署,线性注意力混合架构已跨越从研究到生产的门槛。本阶段剩余的技术障碍主要在推理框架适配和公司层面的不确定性。

技术 当前状态 进入生产预估
Mamba-Transformer 混合架构 AI21 Jamba 商用但公司前景不确定:Nvidia 2025-12 曾考虑以 20-30 亿美元收购 AI21 但交易未达成;D 轮 3 亿美元融资从未正式 close;Nebius(Nvidia 投资的 AI 云服务商)正在洽谈收购。Jamba 架构(MoE + Attention + Mamba 三层混合)仍是线性注意力混合架构的最重要商用样本,但后续发展取决于 AI21 是否能保持独立运营 取决于 AI21 所有权归属
FlashMemory LSA(Lookahead Sparse Attention) 论文验证(在 V4 架构上进一步将 KV Cache 压到 1/10) 2027

实验室阶段(离生产 12-24 个月以上)

这些技术距离生产最远,核心障碍是它们与当前推理系统的根本假设冲突——推理时记忆更新(Titans/TTT)破坏 batching 效率,Engram 的大规模训练稳定性未验证,Nested Learning 需要分布式训练基础设施改造。它们进入生产的时间(2027-2028)取决于这些工程障碍能否被独立的系统级创新所解决。

技术 当前状态 V4 为什么没选 进入生产预估
Titans(推理时记忆更新) 论文 + 原型 与 batching/throughput 冲突 2027-2028
Engram(条件记忆) 2026-01 论文 规模未验证;与 RAG 重叠 2027-2028(可能在 V5)
Nested Learning 概念框架 分布式训练基础设施不支持 不确定
Mamba-3(复数 MIMO) 2026 论文 复数运算 GPU 效率损失 2027 下半年

七、判断锚点:5 个可证伪的预判

预判一:V4 的 CSA+HCA 路线将在 12 个月内被至少 2 家其他厂商跟进

底层逻辑: CSA+HCA 把 KV cache 压到 7-10%,直接改变推理经济学。技术报告已开源 4 个月,有足够时间复现。这个效率提升太大,不跟进的厂商在定价上会落后一个数量级。

证伪条件: 2027 年 8 月 8 日,如果除 DeepSeek 外没有 ≥2 个 Frontier 模型采用类似的层级压缩注意力(CSA 或等效方案),此预判错误。

预判二:Engram 在 V5(或下一代 DeepSeek)中进入生产的概率 >60%

底层逻辑: DeepSeek 在 V4 报告中明确把 Engram 列为"未来方向"——这不是泛泛的文献引用,是自有研究管线的产品规划信号。Engram 解决的问题(静态知识与动态推理的解耦)随上下文窗口从 128K 扩到 1M 变得更紧迫。

证伪条件: DeepSeek V5 技术报告中 Engram 未进入模型架构。如果 V5 在 2027 年发布且不含 Engram,概率需要下调。

预判三:Titans / TTT 类推理时记忆更新不会在 2028 年前进入任何主流 Frontier API

底层逻辑: DeepSeek 是最激进的架构创新者(CSA+HCA、Muon 优化器、mHC 全在 V4 中落地),连它都完全跳过推理时更新。这说明工程障碍比学术论文呈现的大得多——推理时写参数与 batching 效率、确定性延迟、长期稳定性三个核心要求直接冲突。

证伪条件: 2028 年 6 月 30 日前,任何主流 API 在生产中部署推理时参数更新。

预判四:Flash 的架构路线(<15B 激活 + 极致 KV 压缩 + 高 batch)会成为"API 级模型"的默认形态

底层逻辑: V4 Flash 正式版在后训练优化后反超 V4-Pro 预览版——证明 13B 激活 + 后训练的路线在 Agent/Coding 场景可以达到旗舰级能力。如果能力差距可以靠后训练弥补,没有理由在 API 场景部署更重的模型。

证伪条件: 2027 年底,如果排名前 5 的 API(按收入)中有 ≥3 个使用 >50B 激活参数的模型,此预判错误。

预判五:第一个 input price ≤ $0.10/M tokens 的 Frontier 级模型,必然同时使用 MoE 稀疏激活 + CSA/HCA 级 KV 压缩 + 三级 KV 存储

底层逻辑: V4 Flash 已经把 KV cache 压到 7%、激活参数降到 13B。再压一步(FlashMemory 论文展示的 1/10)+ 更细粒度 MoE + 三级存储成熟运行 → 物理成本底线到 $0.05-0.08/M。Dense 架构物理上不可能达到这个价格点。

证伪条件: 如果任何厂商以 Dense 架构实现 Frontier 质量 + input price ≤ $0.10/M tokens。

参考来源

  • DeepSeek V4 技术报告(2026-04,Towards Highly Efficient Million-Token Context Intelligence,55 页)
  • Sining Zhoubian, Dan Zhang, Evgeny Kharlamov, Jie Tang. Memory for Large Language Models. arXiv:2607.25380, submitted 2026-07-28(20 页 4 图). 唐杰:清华大学;Kharlamov:Bosch AI. https://arxiv.org/abs/2607.25380
  • DeepSeek DualPath 论文(2026-02,联手清华、北大)
  • DeepSeek Engram 论文(2026-01,联手北大)
  • FlashMemory-DeepSeek-V4 论文(2026-06)
  • Kimi K3 技术博客(kimi.com/blog/kimi-k3,2026-07-16)—— KDA 生产级部署数据来源
  • Qwen3-Next-80B-A3B 发布(阿里云通义团队,2025-09-12)—— Gated DeltaNet 生产级部署数据来源
  • 晚点对 UCLA 博士刘益枫访谈(2026-05)—— V4 放弃 MLA 的架构决策说明
  • AI21 Labs 收购报道:Calcalist / Globes / The Information(2026-01~04)—— Nvidia 收购未成、Nebius 洽谈中
  • Titans: Learning to Memorize at Test Time
  • vLLM PagedAttention 论文(Kwon et al., 2023)
  • SGLang RadixAttention 论文(Zheng et al., 2023)

声明:V4 架构数据来自技术报告(2026-04 开源)。Flash/Pro 定价来自 DeepSeek 官网(2026-08-08)。成熟度评估基于公开论文和技术报告,不构成投资建议。数据截止 2026 年 8 月 8 日。