行业信号 · 技术趋势 · 个人判断

观点

用长文记录技术变化的方向。

这里收纳较完整的判断、分析和复盘。它不是快速新闻流,而是把观察、论证、来源和观点沉淀为可回看的专业长文。

文章

35 篇文章
思考52 分钟阅读

Token 工厂账本:硅基流动招股书里的推理经济学

2025 年收入 5533 万(+653%)、毛利率 -24%、净亏 3.45 亿、估值 77.4 亿。硅基流动带着「Token 工厂」的故事递表港交所。本文拆它的账本:公有云亏着卖、本地部署赚着卖,算力成本吃掉 86.9% 收入,免费 token 代金券烧掉全年收入。对照海外 CoreWeave 与 Together…

AI 基础设施
阅读长文
思考48 分钟阅读

2026Q2 NVIDIA 千亿季度财报:从卖芯片到卖 AI 工厂

营收 962 亿美元、指引首破千亿,NVIDIA 从「卖芯片」转向「卖 AI 工厂」的布局证据首次集齐。本文从四个层面展开:买家从少数云厂商扩散至所有机构(ACIE 400 亿、同比 +138%);Hot Chips 五张网框架开始转化为收入(Spectrum-X 2.6 倍、BlueField-4、AI context…

AI 基础设施
阅读长文
思考30 分钟阅读

Agent 把 CPU 拽回牌桌:Hot Chips 2026 服务器芯片的四道题

Hot Chips 2026 六场 CPU 演讲拆成四道题:串行瓶颈(Vera 宽体对 IBM 高频)、内存功耗预算(SOCAMM2 满载 30-40W vs 传统 RDIMM 百瓦级)、封装三路线(先进制程面积 30% 以内的成本权衡)、生态交付(Arm 参考整机、IBM 单核原生双 ISA、富士通转通用)。三条判断与验证点,系列四方向收官。

AI 基础设施
阅读长文
思考25 分钟阅读

AI 工厂五张网:Spectrum-X 多平面与 512K GPU 尺度

Spectrum-X 多平面把 AI 工厂网络拆成五张专用网,规模以 8 平面×4 rail 扩展 64 倍到 512K GPU。CPO 量产落地:激光器数量减 4×、功耗降 5×、MTBI 升 10×。Thor Ultra 的 MRC++(eRoCE)数据通路本届公布:8 平面 packet spray…

AI 基础设施
阅读长文
思考14 分钟阅读

云自研芯片第二代:训推分兵的三条路线

三家云都拿出了第二代自研芯片:MTIA 400 双使命(含 MTIA 300 首颗训练芯片的实测坐标)、MAIA 200 以 SDLA 软件定义数据流承载 GPT-5.2(传输层 ATL 影响 Ultra Ethernet 标准)、TPU v8 训推拆两颗(Boardfly 1,152 芯片最多 7 跳、CAE 片上延迟降 5×),Cerebras…

AI 基础设施
阅读长文
思考23 分钟阅读

Intel 三连发:18A 全自研、350W 风冷推理、UCIe 开放封装

Intel 三场演讲构成一条完整的部署成本逻辑链:Diamond Rapids 用 Foveros Direct 3D 做机架编排、Crescent Island 绕开 HBM 用 480GB LPDDR5X 做纯推理、Wildcat Lake 把 UCIe 开放封装带进客户端。三条判断与五项跟踪点。

AI 基础设施
阅读长文
思考29 分钟阅读

内存墙四路进攻:Hot Chips 2026 交出的硅片侧答卷

美光四张账单测度这面墙:约 90% 封装面积用于存储、同容量晶圆消耗约三倍、约 17% 训练中断与 HBM 故障相关。三星押注 3D 直叠,SK 海力士深挖 2.5D,两条路线在 HBM5 节点正面相遇;d-Matrix 以 0.37 pJ/bit 实测将标尺从容量转向搬运能耗;LPDDR5X-PIM 与 CXL…

AI 基础设施
阅读长文
思考32 分钟阅读

Hot Chips 2026 总览:每 token 经济学逼出 decode 专门化

两天 27 场议程收进一张地图,按四个方向盘点:CPU 编排层、内存墙、AI 加速器五条路线、AI 工厂网络。每 token 经济学与 decode 专门化两条主线指向同一结论:训练堆 FLOPS 的时代结束,推理时代的架构变量是内存带宽、数据搬运、异构分工。四条判断,四条可检验的预测。

AI 基础设施
阅读长文
思考34 分钟阅读

OpenAI 交卷:自研芯片 Jalapeño 首份实测成绩单分析

Hot Chips 上 OpenAI 交出 Jalapeño 首份实测:三模型每瓦吞吐 1.5-1.9 倍于 Blackwell 系统,延迟低 1.7-3.6 倍。两个月前的推算表现已对账:制程、架构、算力兑现,功耗判断出错。胜负手在数据搬运而非算力密度,AI 造芯回路第一次有了数字。

AI 基础设施
阅读长文
思考41 分钟阅读

SemiAnalysis AgentX 实测拆解:Agent 时代推理的第一次大考

SemiAnalysis 花三百万美元采集真实 Claude Code 轨迹、开源 393 条会话、用 1000+ 芯片实测 agentic 推理。本文逐层拆解 AgentX 1.0:数据集管线、cache-bust 反作弊回放、投机解码公平性工程、度量体系,以及实测揭出的五课 KV 生命周期工程学;并以数据回答护城河问题:真身已从 CUDA…

AI 基础设施
阅读长文
思考35 分钟阅读

从独赌到共识:Groq 3 LPX 量产与低延迟推理的八个月

八个月前,收编一家推理芯片公司是 NVIDIA 一个人的赌注;八个月后,它成了六家公司的默认架构。本文拆解三组量产数字的成色,盘点量产与可用之间的四道依赖,对五月旧文做预测对账,并审视 SRAM 与 HBM 两种介质的赌注。

AI
阅读长文
思考22 分钟阅读

1.6T 端口下的协议栈:内核栈的最后一公里与四条出路

单端口迈向 1.6Tbps,协议栈 CPU 税成为与带宽同量级的成本科目。七篇论文四条路线:Presto 把完整 TCP 状态机搬进交换机流水线(Best Student Paper,省 16 核)、SMC-R 阿里四年透明替换教训、Flow.ZIP 头压缩、PacketExpress/Capybara 换语义,外加 Google CSIG…

SIGCOMM
阅读长文
思考23 分钟阅读

光网络的 P4 时刻还没到,但语言先来了:λλ 与光子软件栈

SIGCOMM 2026 Best Paper 给了一门编程语言:λλ 用线性类型编码光学物理(光不可复制 = 用且仅用一次),物理不可实现的电路在编译期被拒绝,商用 iPronics 开关上验证四案例。语言(λλ)/拓扑(Opus)/调度(Harvest)三层同届齐备,对照 P4 从语言到生态的 2014-2018 路径。

SIGCOMM
阅读长文
思考28 分钟阅读

Collectives 从库变成运行时:SIGCOMM 2026 的集合通信转折点

MoE 爆炸、超节点拓扑异构、多租户公平三个生产现实把集合通信从静态算法库推进到有遥测、有决策、有热切换的运行时系统。15 篇论文五条路线:OptCCL 理论清场、Theseus 热切换、UBEP 重造华为 EP 库、EPIC 以太网 INC 标准化、DynamiQ 拓扑感知量化。同步税概念与国产超节点栈的关键战场判断。

SIGCOMM
阅读长文
思考33 分钟阅读

Scale-Up 是新的数据中心网络:SIGCOMM 2026 重走 2015-2020 研究史

NVL72/CloudMatrix384 量产把机架内互联变成真正的网络:测量先行(FabricPerf/PingPoint)、拓扑成本革命(华为 BST 成本减半)、数据面(Elastic QP)、PCIe 池化(TurboBus 回收 60% 闲置带宽)、晶上传输层首篇(Credit-Guided)。scale-out 2015-2020…

SIGCOMM
阅读长文
思考41 分钟阅读

KV Cache 成为网络公民:SIGCOMM 2026 把推理的存储问题翻译成网络问题

PD 分离后 KV cache 从 GPU 内部状态变成跨网负载,六篇论文沿五层展开:压缩策略运行时化(KVServe)、视频编解码 ASIC 做 KV 压缩(KVCodec)、decode 侧闲置带宽做第二加载路(DualPath)、端点热迁移(Connex)、交换机聚合(Turbo)、AI 消费者改写…

SIGCOMM
阅读长文
思考19 分钟阅读

SIGCOMM 2026 全面研读:网络顶会把坐标系搬到 AI 基础设施上

第 40 届 SIGCOMM 的 110 篇主会论文按议题自数:AI 负载相关 30 篇占 27%,9 个 workshop 里 3 个直接关于 AI 互联。五条主线(KV 网络公民/Collectives 运行时/Scale-Up 主战场/光子软件栈/Terabit 协议栈)、五个结构性判断、2026-2028 研究议程推演。系列总览篇。

SIGCOMM
阅读长文
思考42 分钟阅读

SubQ 三个月对账:技术是真的,话术是超前的

5 月 5 日,Subquadratic 公司发布模型 SubQ,宣称 12M token 上下文、注意力计算较稠密架构削减近一千倍。中文社区流传最广的一句评价是:「这要么是 Transformer 之后最大的架构突破,要么就是 AI 版的 Theranos。中间没有模糊地带。」 三个月后,8 月 20 日,SubQ 的技术报告以赞助帖形式登上 Techme

AI
阅读长文
思考23 分钟阅读

收费站被收编:当智能开始走 Stripe 的管道

Stripe 以 75 亿美元收购 OpenRouter:82 天估值 5.8 倍。路由层用 5.5% take rate 证明了中间层价值可以捕获,随即被支付层整体收编。收费亭三部曲收束篇。

AI
阅读长文
思考30 分钟阅读

第八类消费者:给 Agent Harness 装一条会受审的学习回路

事件日志已有七类消费者——运行时六类加测试期快照回放——唯独没有 learner。本文给出可开工的参考设计:五阶段受审回路、六事件生命周期、三铁律安全模型。学习只能收紧、不能放松;可组合性优先的架构恰好是自我改进系统的安全底座。

AI 基础设施
阅读长文
思考55 分钟阅读

定律先于代码:DeepSeek Harness 的可组合性设计论

「可组合性优先」的理论提炼:一条元约束、八个维度、十二条设计论题、五族可移植的律。DSH 不是靠缩小组合空间获得可预测,而是把每个组合维度代数化。多数团队不必 fork——律可以整族抄走,本文给出收割清单与三条路决策树。

AI 基础设施
阅读长文
思考30 分钟阅读

不换发动机的换代:GLM-5.3 与后训练的下半场

GLM-5.3 与 GLM-5.2 完全同一基座,所有提升来自后训练:Terminal-Bench 涨六倍、编程逼近 Fable 5、CyberGym 压过 Mythos 5 成为开源第一。本文拆解环境工厂机制(research/judge agent 自动造环境)、底座复用经济学(对照 DeepSeek V4-Flash 284B 反超…

AI
阅读长文
思考25 分钟阅读

DeepSeek Harness 架构设计分析:当「一切皆插件」从口号变成源码

DSH 开源后的源码级架构分析。九个架构决策指向一个判断:DSH 在建 Agent 操作系统层。但这个操作系统只会执行不会学习——架构提供了进化的全部接口,反馈回路却是空的。

AI 基础设施
阅读长文
思考44 分钟阅读

DeepSeek Harness 与中国 Agent Harness 六强格局

从源码架构与市场格局两侧比较中国 Agent Harness 六强:Qoder、ZCode、WorkBuddy、MaxClaw/MaxHermes、TRAE 与 DeepSeek DSH 分属多模型平台、垂直整合和开放生态三条路线。

AI
阅读长文
思考53 分钟阅读

Agent 存储范式重估:FMS 2026 之后,推演变成了产品

一个月前的四阶段框架用 FMS 2026 实际产品验证和修正。阶段三和阶段四在同时发生。总线维度深度推演:CPU 主导→GPU+DPU 主导的三条新路径对 Agent 部署的影响。ICMSP/Mooncake/DualPath 多路线并列。NAND 物理推演链从 512B 写到 WAF 恶化。

存储
阅读长文
思考62 分钟阅读

FMS 2026:存储层级正在被网络化

AI 把存储层级从离散的层级变成可共享、可调度的资源网络。FMS 2026 三维度拆解:总线技术(UCIe/CXL 3.2/SCADA)→ 存储介质(介质光谱:HBM4E 到 QLC SSD,HBF 填补空白价格-性能区间)→ 协议演进(cuFile/ICMSP/FDP,GPU 接管存储调度权)。Samsung 封闭整合 vs OCP 开放标准 vs…

存储
阅读长文
思考51 分钟阅读

Harness 能不能自己进化?

一个 9B 模型,冻结权重不动,只改它外面的运行时逻辑,成功率涨了 9.3 个百分点。Harness-R1 第一次把改 harness 从工程流程变成了可训练的能力。但学到的是手艺还是代码,决定了 AI Agent 的进化路径走模型层还是 harness 层。

AI Agent
阅读长文
思考90 分钟阅读

KV Cache 调度工程:当压缩到 7% 之后

V4 Flash CSA+HCA 架构级冷热分级,策略对比基准,端到端案例 8×H100,差分编码前瞻。FMS 2026 硬件层验证已加入。

AI推理
阅读长文
思考50 分钟阅读

模型记忆架构的效率极限:从 MLA 到 CSA+HCA

以 V4 Flash/Pro 架构选择为锚点,先理解唐杰团队记忆综述的三轴分类框架,再用生产数据检验其预测力。V4 放弃 MLA、KDA 和 Gated DeltaNet 进入生产级。

AI
阅读长文
思考38 分钟阅读

推理定价拆解:一个 Token 的物理成本

以 V4 Flash/Pro 双模型定价倒推物理成本线,70%/83% 两档毛利交叉验证。FMS 2026 数据已加入——内存占系统价值 50%。

AI推理
阅读长文
思考28 分钟阅读

当 Agent 学会不忘记:Meta Muse Code 的运行时哲学

Meta 发布首款 AI 编程 Agent Muse Code。性能不是最强,但三个运行时架构选择——持久化后台 Agent、事件日志驱动崩溃恢复、用数据换极致降价——指向 Agent 执行环境竞争进入 runtime 层面的判断。

AI 基础设施
阅读长文
思考46 分钟阅读

模型即计算机:AMD 为什么要买下 Taalas

Taalas 把模型权重直接蚀刻进硅片掩膜 ROM,消除 HBM 依赖,推理速度达 GPU 的 48 倍。AMD 收购后可能将其作为 Helios 机架的 decode 加速器,与 Cerebras 形成分层互补——但 MoE 架构和模型迭代速度是关键制约。

AI
阅读长文
思考70 分钟阅读

两条路:Kimi K3 与 DeepSeek V4 的架构分歧

K3 和 DSV4 都从 MLA 出发走向不同极致。智能化角度:偶尔精确 vs 一直半精确,后训练提升空间。工程角度:从模型结构推导并行策略、EP 规模、PD 分离、占空比分析五步部署架构。Judy 终审 9.2/10。

AI
阅读长文
思考42 分钟阅读

Google AI 大地震:当研究领袖退场,工程交付上位

Hassabis 卸任 DeepMind CEO、Jeff Dean 27 年来首次离职创业、CEO 职位消失——Google AI 人事地震背后是 AI 竞争范式从研究驱动到工程驱动的迁移。从 Gemini 3.1 Pro 巅峰到 3.5 Pro 六个月连续跳票,横向对比 OpenAI 和 Anthropic 的迭代周期,瓶颈不在研究而在交付。

AI
阅读长文
思考40 分钟阅读

AI 供应链的物理约束:四重瓶颈与格局重塑

九大 CSP 2026 年 capex 8867 亿美元,全球芯片产出 1.5 倍。但 CoWoS 有效产出反降、HBM 进入配给制、电网排队 474GW——物理交付能力的线性增长追不上 capex 的指数增长。四堵墙背后,中国的策略是两有一缺。

AI 基础设施
阅读长文