LLM 记忆架构演进:从 V4 的选择看模型记忆的下一个十年
推理经济学三部曲 · DeepSeek V4 Flash 输出 2 元/百万 token,Claude Sonnet 5 输出 107 元。53 倍差距不是补贴——是物理。本系列从定价倒推到架构选择到工程调度,拆解一个 Token 的物理成本到底由什么决定。
DeepSeek V4 技术报告(55 页)披露了两个模型在"记忆"维度上的关键选择:
| 记忆相关指标 | V4-Flash | V4-Pro | V3.2(上一代) |
|---|---|---|---|
| 激活参数(MoE 稀疏激活) | 13B | 49B | 37B |
| 注意力机制 | CSA + HCA 混合 | CSA + HCA 混合 | MLA |
| 单 token FLOPs | V3.2 的 10% | V3.2 的 27% | 100% |
| KV cache 大小 | V3.2 的 7% | V3.2 的 10% | 100% |
| 上下文窗口 | 1M | 1M | 128K |
这些数字不是孤立的工程指标——它们是"模型怎么记忆"这个问题的物理表达。V4 的两个模型在记忆架构的演进曲线上做了非常不同的选择,而两者的定价(Flash 2 元/M、Pro 6 元/M)精确追踪了这些选择的物理成本。
本文的方法论是:先准确理解 Zhoubian, Zhang, Kharlamov & Tang 在 Memory for Large Language Models(arXiv:2607.25380,2026-07-28 提交,20 页 4 图)中提出的三轴分类框架和主要结论,再用当前生产环境的实际数据来检验这个框架的预测力——V4 放弃 MLA 转向 CSA+HCA、Kimi K3 的 KDA 已生产级部署、Qwen3-Next 的 Gated DeltaNet 已生产级部署。不是直接拿分类去套,而是看论文的理论框架在面对 2026 年下半年的生产现实时,哪里吻合、哪里被超越。
一、论文框架:三轴分类与主要结论
1.1 忠实理解论文的三轴坐标系
Zhoubian, Zhang, Kharlamov & Tang(2026)在 Memory for Large Language Models 中的核心贡献是在混乱的"记忆"文献中建立了一个可比较的三轴坐标系,并形式化了记忆操作的四个核心机制——写入(write)、路由(route)、状态转换(state transition)、合并(merge)的粒度。
三轴分类:
| 轴 | 取值 | 回答的问题 |
|---|---|---|
| 表征(Representation) | 隐式(implicit)vs 显式(explicit) | 存的是什么?有独立读写接口? |
| 更新动态(Update Dynamics) | 离线(offline)vs 在线(online) | 什么时候更新?训练期还是推理期? |
| 持久性(Persistence) | 短期(short-term)vs 长期(long-term) | 信息能影响多久?单次推理还是跨会话? |
论文在三轴坐标系下进一步分析了混合记忆架构(跨越多个格子的设计)、系统级效率权衡(不同记忆类型的计算/存储成本),以及多维评估方法。论文的隐含判断是:当前主流 LLM 集中在"隐式 / 离线 / 短期"格子里,但演进趋势指向"显式 / 在线 / 长期"的迁移——论文梳理了多条可能的迁移路径。
1.2 用生产数据检验框架
V4 在框架中的位置:
| 轴 | V4 Flash/Pro 的位置 | 说明 |
|---|---|---|
| 表征 | 隐式 | KV cache + MoE 参数路由,无独立记忆接口 |
| 更新动态 | 离线 | 训练期写入参数,推理时只读不写 |
| 持久性 | 短期 | KV cache 随请求结束丢弃;参数持久但不是"记忆"语义 |
V4 两个模型都落在"隐式 / 离线 / 短期"——这与论文对主流 Frontier 模型的判断一致。Claude、GPT、Qwen 等也在同一格子。V4 的创新不是"跳到新格子",而是在这个格子里把效率推到极致。
但生产现实已经在挑战论文框架的边界:
-
V4 放弃 MLA 是论文未覆盖的重大架构转向。 MLA(Multi-head Latent Attention)是 DeepSeek V2-V3 的核心 KV 压缩方案,属于"隐式 / 离线 / 短期"格子内的效率优化。V4 用 CSA+HCA 完全替代 MLA(详见第二节),意味着一种压缩路线被证伪、层级压缩 + 稀疏选择路线胜出——这是论文发表前后才发生的分叉。
-
线性注意力混合架构已跨越生产门槛——论文可能低估了这条路线的速度。 Kimi K3 的 KDA(2026-07)和 Qwen3-Next 的 Gated DeltaNet(2025-09)都已进入生产级部署(详见第六节),而论文分析混合架构时更多将其视为"趋势"。
-
DeepSeek 对"迁移"的保守程度超出论文预期。 论文梳理了多条迁移路径,但 V4 连最接近生产的 Titans 式推理时更新都完全跳过——Engram(显式 / 在线 / 长期)仅留给 V5。DeepSeek 作为最激进的架构创新者都选择"榨干现有范式",说明迁移的工程障碍比理论分析显示的更大。
二、V4 在隐式记忆内部的三个 axes of improvement
在"隐式 / 离线 / 短期"这个格子里,V4 做了三件事,每一件都对定价有直接影响:
2.1 MoE 稀疏激活:参数空间的条件记忆
MoE 本质是参数空间里的条件记忆——每个专家是一个持久参数化记忆块,路由器是"上下文相关寻址"。
V4 的选择:
- Flash:284B 总参数,每 token 激活 13B(4.6%)
- Pro:1.6T 总参数,每 token 激活 49B(3.1%)
- Pro 的稀疏度更高(3.1% vs 4.6%),意味着更大的知识储备但单位推理成本仍可控
V4 的 MoE 细节调整:affinity score 激活函数改为 Sqrt(Softplus(·)),前几层 dense FFN 改为 Hash routing。这些是工程优化,不改变记忆范式。
对定价的影响: Flash 13B 激活 → 单请求 decode 257.7 tok/s(H100);Pro 49B 激活 → 68.4 tok/s。定价比例 3× 追踪激活参数比例 3.75×。
2.2 CSA + HCA 混合注意力:KV cache 的层级压缩
这是 V4 记忆架构的核心创新。不是"换一种记忆方式",而是把同一种记忆(KV cache)做分层压缩。
值得强调的架构决策:V4 放弃了 MLA。 从 V2 到 V3,DeepSeek 持续使用 MLA(Multi-head Latent Attention)作为注意力压缩方案——MLA 通过低秩投影压缩 KV 实现数倍效率提升,是 V2/V3 的核心技术之一。V4 用 CSA+HCA+MQA 的混合架构完全替代了 MLA,这是一个重大架构转向。UCLA 博士刘益枫在晚点访谈(2026-05)中明确指出:"V4 放弃了从 V2 到 V3 使用的 MLA。"这意味着 DeepSeek 判断 MLA 的压缩潜力已到天花板,层级压缩 + 稀疏选择(CSA+HCA)才是下一步。
CSA(压缩稀疏注意力)——局部精细依赖:
- CSA 先将每 m 个 token 的 KV 压缩为 1 个条目(技术报告未公开 m 的具体取值,根据压缩比推算 m ≈ 8-16),再用 Lightning Indexer 做 top-k 稀疏选择
- Lightning Indexer 以低秩方式生成索引查询,选择 top-k 压缩 KV 条目
- 共享 KV-MQA 进一步降低计算成本
- 负责底层——保持精细的局部依赖
HCA(重度压缩注意力)——远端大幅压缩:
- 每 m'(m' ≫ m)个 token 压缩为 1 个条目
- 保持密集注意力(不做稀疏选择)
- 负责高层——大幅压缩远端上下文
两层交替叠加的结果:KV cache 压到 V3.2 的 7%(Flash)/ 10%(Pro)。注意 Flash 的压缩更激进——7% vs 10%,因为 Flash 的 CSA 参数 m 更小、HCA 的压缩比更大。
为什么 Flash 和 Pro 的 KV 压缩比例不同? 因为两个模型是独立预训练的,不是蒸馏关系。Flash 的设计目标是"极致推理效率"(适合高并发 API),Pro 的设计目标是"极致推理质量"(适合复杂推理)。KV 压缩比例的差异是质量-成本 trade-off 的直接体现。
2.3 MTP(Multi-Token Prediction):投机采样的加速器
MTP 本身不是记忆机制——它是 V3 遗留的工程设计,训练时预测多个 token,部署时用于投机采样。但它的效果(1.8× 加速)直接影响聚合吞吐,从而影响定价底线。
三、V4 没选的路:被明确放弃的记忆方向
理解 V4 选了什么很重要,理解它没选什么同样重要。
Engram(条件记忆模块):留给 V5
DeepSeek 2026 年 1 月联合北大发表 Engram 论文——哈希寻址稀疏记忆槽,把记忆稀疏性和专家稀疏性明确分开。但技术报告明确说 Engram 没进 V4,在"未来方向"里被点名。
为什么没进? 三个可能的工程原因:
- Engram 的"模型内嵌查找"与 RAG 的"外部检索"功能重叠,后者工程更成熟
- 哈希寻址的新组件增加训练和推理的复杂度,V4 的 55 页报告已经有足够多的架构变动
- 没有在 1.6T 规模上验证过——Engram 论文的实验规模远小于 Pro
对 V5 的含义: 如果 Engram 在 V5 进入生产,它将是第一个打破"隐式 / 离线"框架的主流 Frontier 模型——从"只读记忆"变成"可写记忆"。这是一个范式跳跃,不是渐进优化。
Titans / TTT:连提都没提
推理时记忆更新(Titans 的"惊讶度驱动梯度更新"、TTT-E2E 的"推理时端到端优化")在 V4 报告中完全缺席。这不是遗漏——是有意识的排除。
为什么? 推理时写参数和现代推理系统的核心优化直接冲突:
- batch 内不同请求需要更新不同参数 → batching 效率崩溃
- 更新计算量不可预测 → 延迟不稳定
- 长期稳定性未知 → 生产风险
判断: 在可见的未来(2027-2028),推理时记忆更新不会进入主流 Frontier API。DeepSeek 作为最激进的效率优化者都没选这条路,说明工程障碍比论文里呈现的大得多。
循环状态记忆(Mamba/RWKV):替代路线,非融合路线
V4 没有采用任何循环状态层。纯注意力路线 + MoE 稀疏化是 V4 的选择。Kimi K3 的 KDA(Kimi Delta Attention,混合线性注意力机制——将线性注意力与 Delta 规则结合,实现 KV Cache 12.5 倍压缩、解码速度提升 6.3 倍)走的是另一条路——把线性状态压缩和注意力混合。KDA 已在 Kimi K3(2.8T 参数,2026-07-16 发布)中进入生产级部署。
这两条路不互斥——AI21 Jamba 已经在探索 MoE + Attention + Mamba 的三层混合。但 DeepSeek 在 V4 上选择了"把注意力做到极致"而不是"混合两种记忆范式"。
四、三层记忆体系:V4 的具体位置
把论文的三轴分类和 V4 的实际部署放在一起:
| 层级 | V4 中的具体实现 | 寿命 | 更新方式 | 物理介质 |
|---|---|---|---|---|
| 架构级(模型内部) | CSA + HCA 压缩 KV cache;MoE 13B/49B 激活路由 | 单次推理 ~会话 | 前向计算(只读) | HBM |
| 基础设施级(推理系统) | DualPath 双路径加载 + 3FS 分布式文件系统 + 三级存储调度 | 分钟 ~小时 | 调度器管理 | HBM → DRAM → SSD |
| Agent 级(应用层) | DeepSeek Harness 原生框架 + OpenAI Responses API 兼容 | 小时 ~永久 | 工程管线编排 | SSD → 对象存储 |
三层之间的信号传递路径(以 V4 Flash 为例):
- 架构级:CSA+HCA 把 KV cache 压到 V3.2 的 7% → 每请求 KV cache 仅 ~25 KB(4K 上下文)
- 基础设施级:KV cache 极小 → HBM 可容纳更多并发请求 → batch 天花板大幅提升
- batch 天花板提升 → 聚合吞吐 ~36,000 tok/s/GPU(batch=100,含 MTP)
- 吞吐决定定价底线 → Flash 2 元/M 在 batch ~80 时仍有 83% 毛利(OpenCode CEO 口径)
- Agent 级:Harness 框架产生大量重复 prefix(system prompt、工具定义)→ 95%+ KV-Cache 命中率(DualPath 论文 Agent 场景实测 98.7%)→ 进一步降低物理成本
核心洞察:三层不是独立设计的——V4 的架构选择(CSA+HCA)直接决定了基础设施级的调度策略,后者直接决定了定价。 这条因果链是文章《推理定价的物理底线》的分析基础。
五、演进趋势判断
趋势一:V4 代表的路线——"把隐式记忆做到极致"——还有 2-3 年的红利
V4 Flash 的 KV cache 已经压到 V3.2 的 7%。继续压缩的技术空间:
- CSA 稀疏选择更激进(当前 top-k,未来可能 top-1 或动态 k)
- HCA 压缩比更大(当前 m' ≫ m,未来 m' 可能到数百)
- FlashMemory-DeepSeek-V4 论文(2026-06)已经展示 KV Cache 进一步压到 1/10 的可能性——Lookahead Sparse Attention
MoE 稀疏激活还有空间:Flash 4.6% 激活比例已经很低,但如果走向更细粒度的专家划分(V3 是 256 选 8,未来可能 1024 选 4),激活参数可以进一步降低。
判断:隐式 / 离线 / 短期这个格子里的效率提升还没到天花板。下一代模型不需要切换记忆范式,只需要在这个格子里继续压。
趋势二:隐式→显式的迁移正在加速,但不会经过 V4
| 阶段 | 记忆类型 | 代表 | 位置 |
|---|---|---|---|
| 2017-2023 | 隐式(注意力 KV cache) | 标准 Transformer | ← V3 在这里 |
| 2024-2026 | 隐式压缩 → 极致压缩(MLA+MoE → CSA+HCA) | DeepSeek V3 → V4 Flash/Pro | ← V3 到 V4 的演进路线 |
| 2026 | 显式参数化(推理时更新) | Titans、TTT | ← V4 明确不选 |
| 2027+ | 显式查找 + 多时间尺度? | Engram in V5? | ← V4 留给未来 |
V4 的位置很清晰:隐式记忆的极致阶段。它是这条路线上效率最高的模型——但也是这条路线接近尾声的信号。7% KV cache 和 4.6% 激活比例留下的空间不多了。
趋势三:架构级和基础设施级的融合——V4 是第一个样本
当前两个层级独立设计。V4 是第一个把两者紧密耦合的系统:
- 架构级:CSA+HCA 压缩让 KV cache 小到三级存储调度几乎无感
- 基础设施级:DualPath 双路径加载 + 3FS 文件系统专门为这种小 KV cache 优化
- 两者协同的结果:98.7% KV-Cache 命中率、batch 80+ 运行、83% 毛利
下一代趋势:模型架构师设计 CSA/HCA 参数时直接考虑"压缩后的 KV block 在 PCIe Gen5 上的传输延迟"——这在 V4 设计时已经隐含,下一代会显式化。

六、成熟度评估:哪些已经在你用的模型里,哪些还停在论文里
已在生产环境运行
这些技术在 2024-2026 年间成熟并进入生产系统。MoE 稀疏激活和注意力压缩的工程价值被多个团队独立验证,推理引擎(vLLM、SGLang)的生态支持已就位。除 DeepSeek V4 的 CSA+HCA 外,Kimi K3 的 KDA 和 Qwen3-Next 的 Gated DeltaNet 也已分别在 2026-07 和 2025-09 进入生产级部署——线性注意力混合架构不再是纸面方案。
| 技术 | 在 V4 中的角色 | 其他采用者 |
|---|---|---|
| MoE 稀疏激活 | Flash 284B/13B,Pro 1.6T/49B | Qwen3-MoE、Mixtral、Kimi K3 |
| CSA + HCA 混合注意力 | V4 独有,KV cache 压到 7-10% | 尚无第三方采用(技术报告刚开源 4 个月) |
| MLA(Multi-head Latent Attention) | V2-V3 的注意力压缩方案,V4 放弃并转向 CSA+HCA | DeepSeek V2/V3、Kimi Moonlight(月之暗面) |
| KDA(Kimi Delta Attention) | V4 未采用 | Kimi K3(2.8T 参数,2026-07-16 发布),KV Cache 压缩 12.5 倍、解码速度提升 6.3 倍 |
| Gated DeltaNet | V4 未采用 | Qwen3-Next-80B-A3B(2025-09-12 发布),75% 层使用 Gated DeltaNet + Gated Attention 混合架构 |
| 三级 KV cache 调度 | DualPath 论文证实生产部署 | DeepSeek 独有 |
| PagedAttention | 推理引擎底层 | vLLM(行业标准) |
| RadixAttention | prefix cache | SGLang |
| MTP 投机采样 | 1.8× 加速 | DeepSeek V3 起标配 |
一句话: 今天你调 V4 Flash 或 Pro 的 API,这些技术的组合正在运行。它们是 2 元/M 和 6 元/M 定价的物理基础。
工程验证阶段(有可用实现,尚未大规模商用)
随着 KDA(Kimi K3)和 Gated DeltaNet(Qwen3-Next)在 2025-2026 年进入生产级部署,线性注意力混合架构已跨越从研究到生产的门槛。本阶段剩余的技术障碍主要在推理框架适配和公司层面的不确定性。
| 技术 | 当前状态 | 进入生产预估 |
|---|---|---|
| Mamba-Transformer 混合架构 | AI21 Jamba 商用但公司前景不确定:Nvidia 2025-12 曾考虑以 20-30 亿美元收购 AI21 但交易未达成;D 轮 3 亿美元融资从未正式 close;Nebius(Nvidia 投资的 AI 云服务商)正在洽谈收购。Jamba 架构(MoE + Attention + Mamba 三层混合)仍是线性注意力混合架构的最重要商用样本,但后续发展取决于 AI21 是否能保持独立运营 | 取决于 AI21 所有权归属 |
| FlashMemory LSA(Lookahead Sparse Attention) | 论文验证(在 V4 架构上进一步将 KV Cache 压到 1/10) | 2027 |
实验室阶段(离生产 12-24 个月以上)
这些技术距离生产最远,核心障碍是它们与当前推理系统的根本假设冲突——推理时记忆更新(Titans/TTT)破坏 batching 效率,Engram 的大规模训练稳定性未验证,Nested Learning 需要分布式训练基础设施改造。它们进入生产的时间(2027-2028)取决于这些工程障碍能否被独立的系统级创新所解决。
| 技术 | 当前状态 | V4 为什么没选 | 进入生产预估 |
|---|---|---|---|
| Titans(推理时记忆更新) | 论文 + 原型 | 与 batching/throughput 冲突 | 2027-2028 |
| Engram(条件记忆) | 2026-01 论文 | 规模未验证;与 RAG 重叠 | 2027-2028(可能在 V5) |
| Nested Learning | 概念框架 | 分布式训练基础设施不支持 | 不确定 |
| Mamba-3(复数 MIMO) | 2026 论文 | 复数运算 GPU 效率损失 | 2027 下半年 |
七、判断锚点:5 个可证伪的预判
预判一:V4 的 CSA+HCA 路线将在 12 个月内被至少 2 家其他厂商跟进
底层逻辑: CSA+HCA 把 KV cache 压到 7-10%,直接改变推理经济学。技术报告已开源 4 个月,有足够时间复现。这个效率提升太大,不跟进的厂商在定价上会落后一个数量级。
证伪条件: 2027 年 8 月 8 日,如果除 DeepSeek 外没有 ≥2 个 Frontier 模型采用类似的层级压缩注意力(CSA 或等效方案),此预判错误。
预判二:Engram 在 V5(或下一代 DeepSeek)中进入生产的概率 >60%
底层逻辑: DeepSeek 在 V4 报告中明确把 Engram 列为"未来方向"——这不是泛泛的文献引用,是自有研究管线的产品规划信号。Engram 解决的问题(静态知识与动态推理的解耦)随上下文窗口从 128K 扩到 1M 变得更紧迫。
证伪条件: DeepSeek V5 技术报告中 Engram 未进入模型架构。如果 V5 在 2027 年发布且不含 Engram,概率需要下调。
预判三:Titans / TTT 类推理时记忆更新不会在 2028 年前进入任何主流 Frontier API
底层逻辑: DeepSeek 是最激进的架构创新者(CSA+HCA、Muon 优化器、mHC 全在 V4 中落地),连它都完全跳过推理时更新。这说明工程障碍比学术论文呈现的大得多——推理时写参数与 batching 效率、确定性延迟、长期稳定性三个核心要求直接冲突。
证伪条件: 2028 年 6 月 30 日前,任何主流 API 在生产中部署推理时参数更新。
预判四:Flash 的架构路线(<15B 激活 + 极致 KV 压缩 + 高 batch)会成为"API 级模型"的默认形态
底层逻辑: V4 Flash 正式版在后训练优化后反超 V4-Pro 预览版——证明 13B 激活 + 后训练的路线在 Agent/Coding 场景可以达到旗舰级能力。如果能力差距可以靠后训练弥补,没有理由在 API 场景部署更重的模型。
证伪条件: 2027 年底,如果排名前 5 的 API(按收入)中有 ≥3 个使用 >50B 激活参数的模型,此预判错误。
预判五:第一个 input price ≤ $0.10/M tokens 的 Frontier 级模型,必然同时使用 MoE 稀疏激活 + CSA/HCA 级 KV 压缩 + 三级 KV 存储
底层逻辑: V4 Flash 已经把 KV cache 压到 7%、激活参数降到 13B。再压一步(FlashMemory 论文展示的 1/10)+ 更细粒度 MoE + 三级存储成熟运行 → 物理成本底线到 $0.05-0.08/M。Dense 架构物理上不可能达到这个价格点。
证伪条件: 如果任何厂商以 Dense 架构实现 Frontier 质量 + input price ≤ $0.10/M tokens。
参考来源
- DeepSeek V4 技术报告(2026-04,Towards Highly Efficient Million-Token Context Intelligence,55 页)
- Sining Zhoubian, Dan Zhang, Evgeny Kharlamov, Jie Tang. Memory for Large Language Models. arXiv:2607.25380, submitted 2026-07-28(20 页 4 图). 唐杰:清华大学;Kharlamov:Bosch AI. https://arxiv.org/abs/2607.25380
- DeepSeek DualPath 论文(2026-02,联手清华、北大)
- DeepSeek Engram 论文(2026-01,联手北大)
- FlashMemory-DeepSeek-V4 论文(2026-06)
- Kimi K3 技术博客(kimi.com/blog/kimi-k3,2026-07-16)—— KDA 生产级部署数据来源
- Qwen3-Next-80B-A3B 发布(阿里云通义团队,2025-09-12)—— Gated DeltaNet 生产级部署数据来源
- 晚点对 UCLA 博士刘益枫访谈(2026-05)—— V4 放弃 MLA 的架构决策说明
- AI21 Labs 收购报道:Calcalist / Globes / The Information(2026-01~04)—— Nvidia 收购未成、Nebius 洽谈中
- Titans: Learning to Memorize at Test Time
- vLLM PagedAttention 论文(Kwon et al., 2023)
- SGLang RadixAttention 论文(Zheng et al., 2023)
声明:V4 架构数据来自技术报告(2026-04 开源)。Flash/Pro 定价来自 DeepSeek 官网(2026-08-08)。成熟度评估基于公开论文和技术报告,不构成投资建议。数据截止 2026 年 8 月 8 日。
