← 返回观点 思考

推理定价拆解:一个 Token 的物理成本

以 DeepSeek V4 Flash 和 Pro 双模型定价为起点,按 70%/83% 两档毛利倒推物理成本线。batch 逐档经济表揭示:定价比例追踪激活参数比例,53 倍差距由物理因素主导。

2026-08-08思考37 分钟阅读

推理定价拆解:一个 Token 的物理成本

以 DeepSeek V4 Flash 和 Pro 双模型定价为起点,按 70%/83% 两档毛利倒推物理成本线。batch 逐档经济表揭示:定价比例追踪激活参数比例,53 倍差距由物理因素主导。

推理经济学三部曲 · DeepSeek V4 Flash 输出 2 元/百万 token,Claude Sonnet 5 输出 107 元。53 倍差距不是补贴——是物理。本系列从定价倒推到架构选择到工程调度,拆解一个 Token 的物理成本到底由什么决定。

DeepSeek V4 Flash 输出 2 元/M token(平峰)。V4 Pro 输出 6 元/M。Claude Sonnet 5 输出约 107 元/M($15)。从 Flash 到 Claude 是 53 倍差距,从 Pro 到 Claude 是 18 倍。

常规解释停留在商业层面:补贴定价、品牌溢价。本文换一个方向:以 DeepSeek V4 技术报告披露的 Flash 和 Pro 双模型架构数据为基础,倒推各自的物理成本线,算出集群必须实现什么推理指标,然后验证这些指标是否可达。

一个前置数据点:OpenCode CEO Dax Raad 在 DeepSeek 涨价后公开表示,OpenCode 自己租 GPU 也能做到 DeepSeek 同样的价格水平——这意味着 DeepSeek 定价并非亏本倾销,而是有可观利润空间。业内解读这一说法指向约 6 倍加价(售价 ≈ 6 × 成本,毛利率 ~83%)。本文先用保守的 70% 毛利基线做倒推,再与 83% 毛利交叉验证。

基线:V4 双模型官方定价

模型 输出定价(平峰) 输入(缓存命中) 输入(缓存未命中)
V4-Flash 2 元/M 0.02 元/M 1 元/M
V4-Pro 6 元/M 0.025 元/M 3 元/M

峰谷定价:高峰时段(工作日 9-12, 14-18)×2。以下均以平峰输出价为基线。

关键观察:Pro 价格是 Flash 的 3 倍。这不是任意定价——它追踪两个模型的物理成本比例。下面逐步拆解。

V4 架构:技术报告的关键数字

DeepSeek V4 技术报告(2026 年 4 月,全名 Towards Highly Efficient Million-Token Context Intelligence,55 页)披露了两个模型的详细架构参数。Flash 和 Pro 不只是参数规模不同,它们的推理效率指标也不同:

指标 V4-Flash V4-Pro V3.2(基线)
总参数 284B 1.6T
每 token 激活参数 13B 49B 37B
上下文窗口 1M 1M 128K
单 token FLOPs V3.2 的 10% V3.2 的 27% 100%
KV cache 大小 V3.2 的 7% V3.2 的 10% 100%

注意:Flash 不只是"缩小的 Pro"。它的 FLOPs 效率比 Pro 更激进(10% vs 27%),KV cache 压缩也更猛(7% vs 10%)。两个模型都是独立预训练的 MoE,不是蒸馏关系。

三个架构创新支撑这些数字:

  1. Hybrid Attention(CSA + HCA 交替叠加):KV cache 大幅压缩的核心。CSA(压缩稀疏注意力)先把每 m 个 token 的 KV 压缩为 1 个条目,再用 Lightning Indexer 做 top-k 稀疏选择。HCA(重度压缩注意力)把每 m'(m' ≫ m)个 token 压为 1 个条目,保持密集注意力。两者交替叠加,底层 CSA 负责精细局部依赖,高层 HCA 负责大幅压缩远端上下文。

  2. mHC(流形约束超连接):替代传统残差连接,在万亿参数 MoE 上稳定训练。不影响推理经济学但影响训练效率。

  3. MoE 细节调整:affinity score 激活函数改为 Sqrt(Softplus(·)),前几层 dense FFN 改为 Hash routing MoE。MTP(Multi-Token Prediction)跟 V3 一致,部署时用于投机采样。

Engram(条件记忆模块)没进 V4,留在未来方向(V5)。

V4 双模型定价 vs 物理成本底线
V4 双模型定价 vs 物理成本底线

双线索倒推:Flash 和 Pro 各自的物理指标

GPU 小时成本(中国自建数据中心)

项目 估算
硬件折旧 H100/H800 级 ~$25K/GPU,4 年直线
功耗 + 电费 700W × ¥0.5/kWh
设施(PUE 1.3-1.5) 硬件成本 40%
小时成本 ¥20-33/hr(自建到公有云采购价)

两档毛利基线下的所需吞吐

OpenCode CEO 的 "6 倍加价" 说法意味着 ~83% 毛利率。与 70% 基线交叉验证:

V4-Flash(2 元/M):

毛利假设 成本线 GPU 预算(60% TCO) ¥33/hr 所需吞吐 ¥20/hr 所需吞吐
70%(保守基线) 0.60 元/M 0.36 元/M 25,470 tok/s 15,430 tok/s
83%(OpenCode CEO 口径) 0.33 元/M 0.20 元/M 46,250 tok/s 28,000 tok/s

V4-Pro(6 元/M):

毛利假设 成本线 GPU 预算(60% TCO) ¥33/hr 所需吞吐 ¥20/hr 所需吞吐
70%(保守基线) 1.80 元/M 1.08 元/M 8,490 tok/s 5,140 tok/s
83%(OpenCode CEO 口径) 1.00 元/M 0.60 元/M 15,400 tok/s 9,330 tok/s

下文先以 70% 毛利保守基线推演,再在 batch 逐档经济表中标注 83% 毛利的对应位置。

V4 能达到这些吞吐吗?

单请求 roofline 对比

指标 V4-Flash V4-Pro
激活参数(FP8,1 byte/param) 13 GB 49 GB
H100 decode 上限(3.35 TB/s) 257.7 tok/s 68.4 tok/s
H200 decode 上限(4.8 TB/s) 369.2 tok/s 98.0 tok/s
4K 上下文 KV cache ~25 KB(7% of V3.2) ~36 KB(10% of V3.2)

Flash 的单请求速度是 Pro 的 3.77 倍——和定价的 3 倍比例高度吻合。

KV cache 容量约束——在两个模型上都几乎消失

V4 Hybrid Attention 的 KV cache 压缩效果(基于 V3.2 MLA ~90 bytes/token 推算):

  • V4-Pro:~9 bytes/token(V3.2 的 10%)
  • V4-Flash:~6.3 bytes/token(V3.2 的 7%)

80GB HBM 减去激活权重后的剩余空间:

模型 激活权重占用 HBM 剩余 4K 上下文理论可容纳请求数
V4-Flash 13 GB 67 GB 268 万(25 KB/请求)
V4-Pro 49 GB 31 GB 86 万(36 KB/请求)

KV cache 容量约束在两个模型上实质消失了——batch 不再被 HBM 容量钉死,而是被推理引擎调度能力和网络带宽钉死。

一手验证: DeepSeek 的三级存储调度不是定价反推的推测。2026 年 2 月发表的 DualPath 论文(联手清华、北大)确认:在 660B 规模的生产模型上,Agent 场景的 KV-Cache 命中率超过 95%,存储 I/O 带宽(而非计算)已成为推理瓶颈。DualPath 重新设计了存储到预填充/解码引擎的双路径加载,离线吞吐提升 1.87×,在线提升 1.96×。DeepSeek 开源的 3FS 分布式文件系统(专为 AI 训练/推理设计)是这套存储基础设施的公开组件。

实际 batch 的限制因素

KV cache 不再是瓶颈,什么限制 batch?三个因素:

  1. 推理引擎调度 overhead:vLLM/SGLang 的 block manager 在 batch >500 时 overhead 显著上升
  2. 网络带宽(PD 分离架构下):prefill 和 decode 节点间 KV cache 传输受网卡带宽限制
  3. 尾延迟:batch 越大,最慢请求拖住整个 batch 的步进延迟

Batch 逐档经济表:Flash 和 Pro 的对比

这是理解推理定价的关键。下表逐档推演两个模型在 H100 上的 batch 经济性:

前置参数: FP8 量化,MTP 1.8× 加速,GPU 成本 ¥33/hr,TP=8 后单请求有效速度约为 roofline 的 78%(估算:MoE all-to-all 通信 + MTP 投采失败率 + 调度 overhead ≈ 22% 损失,与 vLLM/SGLang 生产系统实测一致)。

V4-Flash Batch 逐档(有效 decode ~200 tok/s)

Batch KV cache 介质 单步延迟 单 GPU tok/s(含 MTP) 每小时产出 成本/M 70%毛利底线 83%毛利底线
8 纯 HBM ~4ms 2,880 10.4M 3.17 元 10.6 元 18.6 元
16 纯 HBM ~6ms 5,760 20.7M 1.59 元 5.30 元 9.35 元
32 HBM + DRAM ~12ms 11,520 41.5M 0.80 元 2.65 元 4.67 元
64 三级存储 ~20ms 21,700¹ 78.1M 0.42 元 1.41 元 2.49 元
100 三级存储 ~35ms 36,000 129.6M 0.25 元 0.85 元 1.50 元

¹ Batch 64 理论值 64×200×1.8 = 23,040,实际 21,700 含 ~6% 调度 overhead(block manager + MoE all-to-all 通信尾延迟)。

V4-Pro Batch 逐档(有效 decode ~53 tok/s)

Batch KV cache 介质 单步延迟 单 GPU tok/s(含 MTP) 每小时产出 成本/M 70%毛利底线 83%毛利底线
8 纯 HBM ~15ms 763 2.7M 12.2 元 40.7 元 71.8 元
16 纯 HBM ~22ms 1,526 5.5M 6.0 元 20.0 元 35.3 元
32 HBM + DRAM ~40ms 3,053 11.0M 3.0 元 10.0 元 17.6 元
64 三级存储 ~60ms 5,800 20.9M 1.58 元 5.27 元 9.29 元
100 三级存储 ~90ms 9,540 34.3M 0.96 元 3.20 元 5.65 元

读法

Flash(70% 毛利基线): 盈亏平衡点在 batch 32 附近。batch 64+ 时利润充分。

Flash(83% 毛利 = OpenCode CEO 口径): 盈亏平衡点上移到 batch 48-64 之间。当前售价 2 元对应 batch ~80 的水平——这恰好是 DeepSeek 生产系统的典型运行区间(DualPath 论文披露 Agent 场景 95%+ KV-Cache 命中率意味着高 batch 运行)。OpenCode CEO 的 "6 倍利润" 说法与 batch ~80 的计算完全一致。

Pro(70% 毛利基线): 盈亏平衡点在 batch 16-32 之间。batch 64+ 时利润空间打开。

Pro(83% 毛利): 需要 batch 32+。Pro 的延迟更高(batch 100 时 ~90ms vs Flash ~35ms),适合吞吐场景而非交互场景。

交叉点分析: batch 64 时,Flash 每 GPU 每小时产出 78.1M token、Pro 产出 20.9M token——Flash 吞吐是 Pro 的 3.7 倍。但 Pro 售价是 Flash 的 3 倍。单位 GPU 的收入 Flash 略高于 Pro(156 元 vs 125 元),说明 Flash 对 DeepSeek 的单位 GPU 经济更友好——这也解释了为什么 Flash 定价更激进。

DeepSeek DualPath 论文的印证: Agent 场景 95%+ KV-Cache 命中率意味着大部分生产请求在 batch 64+ 水平运作。论文中 660B 模型(介于 V4-Flash 284B 和 V4-Pro 1.6T 之间)的实测数据确认了这个 batch 区间的可行性。

那 DeepSeek 为什么涨价?

如果两个模型的单位推理都赚钱,涨价的原因是什么?

容量瓶颈,不是成本瓶颈。

8 月 4 日 V4 Flash API 因"前所未有的访问量"出现性能下降。原因链条:

  1. 需求暴涨(OpenCode 平台单日 8 万亿 token)→ 集群满载
  2. 排队请求堆积 → 推理引擎被迫降低 batch → 有效吞吐下降
  3. 吞吐下降 → 更多排队 → 用户感知延迟和错误率上升
  4. 涨价是压缩需求的手段,不是因为单位推理亏钱

跟电力市场的逻辑一样:高峰时段电价翻倍不是因为发电成本翻倍,是因为发电机全部满载、边际成本变成"建新发电机的折旧"。

涨价幅度预测: 涨到需求回落到集群承载力以内就够了。考虑到 V4 Flash 当前周调用量 7.22 万亿 token(全球第一),需求弹性较低——预估 Flash 均衡价 4-6 元/M(涨幅 100-200%),Pro 相应上浮。

53 倍差距的物理拆解

同样方法倒推 Claude Sonnet 5($15/M ≈ 107 元/M):

  • 70% 毛利 → GPU 预算 19 元/M → 所需吞吐 482 tok/s/GPU
  • Dense 架构(推测 100B+ 参数全激活),batch 受 KV cache 容量钉死在个位数
  • 聚合约 400-500 tok/s——刚好

两个比较维度

比较 定价倍数 物理因素(见下文分解)
Claude vs V4-Flash(107÷2 = 53× ~50-70× 三个独立维度组合
Claude vs V4-Pro(107÷6 = 18× ~15-25× 同框架,Pro 各因子较小

因子分解到 53× 的组合逻辑(这些因子不是全部叠乘——有些是互斥的):

Flash vs Claude 的 53× 差距来自三个独立的物理维度:

  1. Per-token 计算效率差(叠乘):激活参数 100B+ vs 13B = 7.7× × MTP 1.8× = ~14×。同一 batch 下 Flash 每 token 所需 HBM 带宽比 Claude 少 14 倍。假设 Claude 以 BF16 推理,FP8 带来额外 ~1.5× 加速,此因子合计 ~21×。
  2. 有效 batch 差(独立维度,不与因子 1 简单叠乘):KV cache 压缩允许 Flash 跑 batch ~80+,Dense + 标准 MHA 的 Claude batch 钉死在 2-8。有效 batch 差约 10-40×
  3. 地理成本(小因子,叠乘):中国电费/自建数据中心 vs 美国云 = ~1.5×(Claude 推理用美国云 H100/H200,DeepSeek 自建数据中心用 H800/昇腾 950PR,电费 ~¥0.5/kWh)。

组合方式:因子 1(~21×)× 因子 3(~1.5×)= ~31× 的 per-token 计算成本差。再乘因子 2(batch 差 10-40×)会得到理论叠乘 ~300-1200×——但 batch 差和 per-token 差不是完全独立的(高 batch 的调度 overhead 递减、尾延迟增长),需打强耦合折扣。合理估计:~50-70× 的总差距,与实际 53× 吻合。

Pro vs Claude 的 18× 同理:因子 1 = 2.0× × 1.8× × 1.5× = ~5.4×;因子 2 = ~5-8×(Pro batch ~32-64 vs Claude 2-8);因子 3 = 1.5×。组合后 ~15-25×。

关键发现:Claude vs Pro 的差距只有 18 倍,且物理因素可以完全解释。 真正"不可思议"的便宜是 Flash(53 倍),不是 Pro。DeepSeek 的双模型策略实质上覆盖了两个价位:Pro 与 Claude/GPT 的差距是"合理物理差距",Flash 则把物理效率推到极致后多出了一个数量级的定价空间。

物理因素占绝对主导。 这不是"DeepSeek 在补贴",是"V4 架构在物理上更高效"。Claude 的 $15/M 也不是纯品牌溢价——dense 架构的物理底线就在那个位置。

对 Muse Code 的含义

Muse Code $0.20/M(≈1.4 元/M)。倒推 70% 毛利所需吞吐 = 36,670 tok/s/GPU

V4-Flash 在 batch=100 时已达 36,000 tok/s/GPU。如果 Muse Spark 1.2 的架构效率接近 V4-Flash(13B 级激活 + 类似 KV 压缩),$0.20/M 在物理上可达

关键问题:Muse Spark 1.2 的架构到底是什么?Meta 有三条路径:

  1. 架构接近 V4-Flash 级别(13B 激活 + 激进 KV 压缩)→ 物理可持续
  2. 架构常规(37B+ 激活)→ 不可持续,需靠数据补贴
  3. MTIA 自研芯片进一步压低成本 → 更宽裕

预判

  1. V4-Flash 涨价后均衡价 4-6 元/M。 驱动力是需求管理而非单位成本。涨价后毛利极高(85%+),但这是供需平衡价。

  2. V4 双模型的定价精确追踪激活参数比例。 Flash 13B → 2 元,Pro 49B → 6 元,比例 3.75× 映射到定价 3×。OpenCode CEO 的 "6 倍利润" 说法指向 ~83% 毛利率,对应 batch ~80 的运行水平——与 DeepSeek 生产系统实测数据吻合。未来如果出现更激进的小激活模型(5B 级),物理底线允许定价到 0.5 元/M 以下

  3. Claude 12 个月内转向稀疏激活。 Dense 架构的利润空间正在被竞争压缩。如果 Claude 转向类似 V4-Pro 的 49B 激活 + Hybrid Attention,物理底线可降到 $2-3/M。

  4. 下一代推理竞争的焦点是 KV cache 压缩。 V4-Flash 已把 KV cache 压到 V3.2 的 7%。继续压缩的技术空间(CSA 稀疏选择、Engram 查找、KV 差分编码)是下一个数量级的来源。

  5. 验证节点:

    • DeepSeek 涨价幅度。Flash 4-6 元 → 验证需求管理假设。
    • V4 开源后 SGLang/vLLM 社区实测吞吐。单 GPU 聚合 >15,000 tok/s(Flash)/ >5,000 tok/s(Pro)→ 验证本文推算。
    • Anthropic 2026 Q4 是否发布稀疏激活模型。
    • Meta 是否在 6 个月内调整 Muse Code 定价。

声明:DeepSeek V4 定价来自官网公开信息(2026-08-08)。架构数据来自 V4 技术报告(2026-04 开源,55 页)。GPU TCO 为行业估算。Claude 架构参数为推测。70% 毛利为保守分析基线,83% 毛利参考 OpenCode CEO Dax Raad 2026 年 8 月 X/Twitter 公开帖文。不构成投资建议。数据截止 2026 年 8 月 8 日。