← 返回观点 思考

SubQ 三个月对账:技术是真的,话术是超前的

5 月 5 日,Subquadratic 公司发布模型 SubQ,宣称 12M token 上下文、注意力计算较稠密架构削减近一千倍。中文社区流传最广的一句评价是:「这要么是 Transformer 之后最大的架构突破,要么就是 AI 版的 Theranos。中间没有模糊地带。」 三个月后,8 月 20…

2026-08-22思考42 分钟阅读

5 月 5 日,Subquadratic 公司发布模型 SubQ,宣称 12M token 上下文、注意力计算较稠密架构削减近一千倍。中文社区流传最广的一句评价是:「这要么是 Transformer 之后最大的架构突破,要么就是 AI 版的 Theranos。中间没有模糊地带。」

三个月后,8 月 20 日,SubQ 的技术报告以赞助帖形式登上 Techmeme,宣称与事实之间的距离第一次可以被测量。这篇文章分五步走:先列出当时的宣称与质疑,再看实际情况(他们做了什么),然后分析 SSA 在长上下文技术路线里的位置,逐项核对证据,最后给技术评估与预测。结论先行:技术是真的,话术是超前的,公开可验的部分还欠着。

先交代对象。5 月发布的是第一代(SubQ 1M-Preview,生产模型 + 12M 研究结果);6 月 16 日发布的第二代 SubQ 1.1 Small 才是那份 22 页技术报告的主体:四人实名署名(Saul Ramirez、Alex Whedon、Ashmal Vayani、Phong Vo),形式是 model card,晚到约六周;第三方评估机构 Appen 测的也是这一代。5 月的质疑打在第一代身上,8 月的证据来自第二代。跨代对比只记「换轨」,不记「消失」。

一、新技术宣称

发布文由 CEO Justin Dangel 署名,宣称拆开列是七条:

  • RULER 128K 95.6%,第三方验证,压过 Opus 4.6 的 94.8%(RULER:多任务长上下文检索基准套件);
  • 「注意力比 FlashAttention 快 52 倍(架构级对比),同时少用 63% 算力」,两个数字绑在同一句话里;
  • MRCR v2 报了两个分:研究结果 83,第三方验证的生产模型 65.9(MRCR:多轮指代消解类长上下文基准);
  • SWE-Bench Verified 81.8,超过 Opus 4.6 和 DeepSeek 4.0 Pro(对比分以官网原文为准,媒体转述过 81.42 的版本,对不上,无解释);
  • 12M 是「研究结果」,不是产品能力;
  • 架构叙事用词:「ground-up redesign,从头设计,第一性原理」;
  • 融资 2900 万美元种子轮,团队 11 名博士研究员。

质疑三天内到齐(经中文社区转述汇编):报告和 model card 都说「下周发」,有跳票前科;官网 About 页只列 Meta、Google、Oxford、Cambridge 等机构名,「一个名字都没挂」;2900 万美元根本不够从头训练一个能打 Opus 的模型。其中最具体的推断来自一位 OpenAI 工程师:大概率不是新架构训新模型,而是拿现成 Transformer 做注意力魔改,路径接近 DeepSeek 的 sparse attention。他补了一句:「很可能根本不 work,也可能就是假的。」另一位外部研究者玩了个梗:「是骗子的概率 subquadratically 上升。」

二、实际情况

报告交付了:6 月 16 日,22 页,model card 形式,比承诺晚约六周。但报告里最重要的内容不是成绩单,而是一句方法论的自白:

「Rather than training a new model from scratch, we converted an existing open-weight frontier model by replacing its dense attention with SSA」。与其从头训练新模型,他们改造了一个现成的开源权重前沿模型,把 dense attention 整体替换为 SSA(Subquadratic Sparse Attention,内容相关稀疏注意力)。

那位 OpenAI 工程师的推断全中。2900 万美元的疑问随之解开:他们根本没走重训路线,改造比从头训练便宜得多。

但对撞也在这里。5 月写「ground-up、从头设计」,6 月承认是现成开源模型改装,同一件事的两种说法相隔六周。基座是哪家,报告没说。

配方四步:

  1. 选一个开源权重前沿模型做底座(哪家未披露);
  2. 将 dense attention 替换为 SSA。机制:为每个 query 按内容相关性选择注意力位置,只在被选中的位置做精确计算,选择、检索、注意三步各自线性于序列长度;
  3. 阶梯式上下文扩展:262K→512K→1M→2M,每阶用 YaRN(位置编码重缩放)适配新长度,扩展之间穿插长文继续预训练;
  4. 约 1T token 的继续预训练,语料为天然长文本(书、文档、仓库级代码)。

之后是 100 多次实验、6 到 7 代模型迭代。

工程上这笔账不便宜。多百万 token 训练在注意力之外仍是内存问题:激活、优化器状态、序列本身都要装进显存预算。报告的解法是一架「内存阶梯」:混合分片数据并行起步,序列并行、CPU offload(含嵌套)、多节点序列并行逐级上阵,2M 以上引入 Ring Attention。打包长序列时不掩码跨文档注意力边界,与 DeepSeek-V3、UltraLong 的做法一致;后训练阶段还探索了按样本聚合损失,减少极长样本对梯度更新的主导。关键一句:没有一种现成分布式技术能直接高效承载 SSA,每个组件都要适配内容相关选择引入的不规则内存访问模式。这是 retrofit 路线藏在配方背后的真实工程量。

SSA retrofit 四步配方:开源底座、注意力替换、阶梯扩展、长文续训
SSA retrofit 四步配方:开源底座、注意力替换、阶梯扩展、长文续训

三、路线分析及技术分析

3.1 成本问题的定量

Dense attention 的计算复杂度是 O(n²):每层 FLOPs 随序列长度平方增长。报告给出逐档数字:128K 时每层 8.6×10⁹ 次运算,1M 时 5.49×10¹¹,2M 时 2.2×10¹²。与平方律自洽:128K→1M 长度 ×8,计算 ×64,8.6×10⁹ × 64 ≈ 5.5×10¹¹。

FlashAttention 需要准确定位:它是 IO 感知的 kernel 优化,把注意力显存占用从 O(n²) 压到 O(n),但不改变 FLOPs 的平方复杂度。它让长上下文实验可行,没有让长上下文便宜。

3.2 设计空间:注意力优化的方向对比

省算力是这个领域的共识,分歧在选择机制。报告原话把难点钉得很准:「难点从来不是稀疏本身,而是决定保留哪些交互(The challenge has never been sparsity itself. The challenge has been deciding which interactions to keep.)」公开文献里的优化方向可以归成五类,各自拿不同的东西换复杂度:

  • 固定模式稀疏(sliding window、strided,Longformer/BigBird 一脉):按位置裁剪。复杂度达标,但注意力模式与内容无关,相关信息落在窗口外就不可见。Gemma 等生产模型在用。
  • KV 潜空间压缩(MLA,Multi-head Latent Attention):把 K/V 压进学到的潜在表示,省的是推理期 KV cache 的显存与带宽。prefill 的平方计算原封不动。报告评价:解决的是另一个问题。
  • 线性注意力 / SSM(linear attention、Mamba、RetNet、RWKV):放弃注意力矩阵,改用固定尺寸状态递推,复杂度 O(n)。Mamba-2 证明了 SSM 与线性注意力在数学上是同一对象的两种参数化。代价是状态压缩有损:摘要类任务够用,精确复现类不行。
  • 混合架构(Jamba、Kimi Linear、Qwen3-Next、Nemotron v3):SSM/线性层为主,插入少量全注意力层补检索。常数级改善不改渐近形状,且注意力层是承重墙,占比压不下去。注脚:MiniMax M1 用混合架构,后续前沿模型 M2 回归了全注意力。
  • 系统层规避(RAG、agentic 编排、RLM 递归语言模型):不改模型,把检索移出模型外。能上线,但报告版图表里「任意位置检索」只算部分满足。

第六类是与 SubQ 同支的学习式稀疏(NSA/CSA,DeepSeek 系):让模型自己学该看哪里,注意力内容相关,但 NSA 的选择器(Lightning Indexer)自身是平方开销的。SubQ 的 SSA 就落在这条支线上,激进之处在于把「选择」这一步本身也做线性,这正是下一小节的主题,也是它与 DeepSeek 的分界。

3.3 SSA 的机制主张

报告把整个领域画成一张取舍表(Figure 4):八条路线,四个性质(亚二次方扩展、按内容路由、任意位置检索、生产成熟度),每个已有家族至少缺一列。SSA 的主张是四列全要:稀疏由内容决定(相关信息可能在任意位置),且选择步本身的成本也要线性,否则注意力省下的会被选择环节吃回去。

SubQ 1.1 Small 技术报告原图(Figure 4):长上下文八条路线对四个性质的取舍,每个已有家族至少缺一列,SSA 行四列全勾(报告自评)
SubQ 1.1 Small 技术报告原图(Figure 4):长上下文八条路线对四个性质的取舍,每个已有家族至少缺一列,SSA 行四列全勾(报告自评)

与 DeepSeek 的分野是这份主张的核心(注意:这是竞争者的观点)。报告先承认 NSA(Native Sparse Attention)用 Lightning Indexer 做学习式路由是「重要转变」,然后批评得很具体:Lightning Indexer 本身是蒸馏出来的全注意力模型,其打分开销是平方的,在约 52K token 处反超它所服务的主注意力。代入 DeepSeek v3.2 计算:1M 时索引开销约为主注意力的 16.1 倍,12M 时 190.4 倍。CSA(把检索搬到压缩表示上的路线)绕不开同一个索引器。报告的总结:为了长上下文可负担而生的路由机制,自己成了长上下文的主要成本。SSA 的对应主张是把「选择」这一步本身做成线性,不引入二次开销的索引器。报告同时说明 SSA 既能跑在原始 token 流上,也能跑在压缩表示上(后者只做了有限探索,列为未来工作),所以分界不在原文还是摘要,在选择步的成本。两家方向同路:DeepSeek 已用产品背书学习式稀疏注意力,SubQ 把选择步复杂度的主张推得更远。

对 SSM/混合这条路线的完整判词(固定尺寸状态=有损压缩、MiniMax M2 回归全注意力的注脚)已见于 3.2 的方向对比;报告对它的态度与对固定稀疏一致:复杂度达标,检索质量不保。

一条边界必须记下:报告明说「SSA 如何满足这些要求的机制细节,不在本报告范围内」。这是一份交代了动机、配方和结果的 model card,不是公开算法的架构论文。选择器如何做到线性,外界无法从报告验证。

四、证据核对

七项宣称的核对结果先摆总表:两项兑现,三项半步,一项换轨,一项未兑现。

SubQ 对账表:七项对账、三档判定加换轨
SubQ 对账表:七项对账、三档判定加换轨

报告自报、可复核的结果分两组。

检索泛化是最硬的一组。训练主要在 1M,推理时检索能力保持到 12M,超出训练窗口 6 到 12 倍。代价同时也是机制:全程只注意 0.13% 的 token 对,折算约 770 倍注意力剪枝(12M 全量配对 ≈1.44×10¹⁴,0.13% ≈1.9×10¹¹;报告说的「接近千倍」是取整,0.1% 才恰好一千倍)。NIAH(needle-in-a-haystack,单针检索)成绩:训练窗口内 100%,窗口外 98%。13 任务合成的 RULER 128K 拿到 99.12。报告将泛化归因于选择准则依赖内容相关性而非位置模式。

SubQ 1.1 Small 技术报告原图(Figure 7):NIAH 单针检索,训练窗口内 1M/2M 均 100%,窗口外 6M/12M 均 98%
SubQ 1.1 Small 技术报告原图(Figure 7):NIAH 单针检索,训练窗口内 1M/2M 均 100%,窗口外 6M/12M 均 98%

计算成本是第二组。Table 1 逐档列出注意力 FLOPs:dense 每翻一倍长度 ×4(0.25→0.99→3.9→15.8→63→252 PFLOP),SSA 每翻一倍约 ×2(0.12→0.25→0.49→0.99→2.0→3.9)。平方律对线性。Figure 12 里 SSA 与 FlashAttention-2 在约 16K 处交叉,之后比值从 32K 的 2.1× 一路拉到 1M 的 64.5×:优势随长度增长,不是常数加速。短上下文还占不了多少便宜,长上下文才是主场。代价是短上下文能力让位:GPQA 85.4,报告自评「低于中档前沿模型」(GPT-5.5 为 93.2、Opus 4.8 为 92);LiveCodeBench 89.7 贴近前沿。

SubQ 1.1 Small 技术报告原图(Figure 11):单张 B200 上的注意力算力对比,稠密注意力随长度二次方上升,SSA 近乎线性,1M 处 64.5×
SubQ 1.1 Small 技术报告原图(Figure 11):单张 B200 上的注意力算力对比,稠密注意力随长度二次方上升,SSA 近乎线性,1M 处 64.5×

效果合理性的交叉检验。 单看任何一组数字都可以怀疑,但三组独立测量互相咬合:

其一,剪枝率与算力曲线一致。0.13% 是 12M 档口径,折算约 770 倍剪枝;64.5× 是 1M 档实测。稠密平方、SSA 线性,比值随长度线性增长:按 Table 1 外推到 12M,64.5×12≈770,与剪枝率同阶,两个数字是同一条曲线在不同档位的读数。5 月的「千倍削减」相当于以 12M 档为口径,实测到 1M 为止是 64.5×。选择、检索、聚合的开销占比,报告未拆分。

其二,剪枝率与检索质量自洽。12M 档剪枝 770 倍后 NIAH 仍保持 98%:如果选择器在 12M 时漏掉了关键位置,检索应该断崖式下跌而不是从 100% 缓降到 98%。缓降与报告的归因相容:选择准则跟着内容走,训练窗口外仍有效——若是位置模式主导,应该看到断崖而非缓降。

其三,代价与增益对称。Table 1 里 32K 档只有 2.1×(短上下文还占不了多少便宜),GPQA 85.4 低于中档前沿模型:省下的算力没有凭空多出来,是从短上下文精度里换的。增益随长度单调增长、代价集中在短上下文,这个形状本身就是稀疏机制成立的旁证。

这三条交叉检验只能证合理,不能证真实:三组数字同源于一份报告。真正的检验还是要等独立复现(见第五章待验项)。

第三方验证有,但要打折。 Appen 的方法论披露完整:NIAH 用最基础的单针版本、每档 50 样本、关键参数公开(如 temperature 0),另有一套设置公开的代码基准,对象是 subq-2m-preview-small。但 Appen 是 Subquadratic 聘用的,委托评估不等于无偿复现;其结果(1M/2M 精确匹配 100%,6M/12M 为 98%)与报告自报一致,是委托验证而非独立复现。MRCR v2 的账也记全:研究结果 83,第三方验证的生产模型 65.9,低于 GPT-5.5 的 74、成倍高于 Opus 4.7 的 32.2。这个基准上各家前沿模型本就离散,单看一个对比分会读错位置。

效率口径半步。 速度站得住:5 月说 52×(架构级对比),6 月收窄成 56× @1M,出自 H100 单注意力层实测,SSA 966 ms 对 FlashAttention-2 的 54,164 ms,限定变多反而更诚实。算力悬空:5 月「63% less compute」折算约 2.7×,6 月「64.5× less compute」,同一事实差出约 24 倍,报告没有解释。

无法独立验证的部分。 API 仍是 private preview,SubQ Code 插件候补,官网口径年底 GA,「12M 上下文、线性成本」这些产品能力目前无法上手验证。SWE-Bench 81.8 在第二代不再出现:5 月列了这项,6 月报告不列,Appen 改用 LiveCodeBench,理由说明里点名 SWE-Bench「更容易被 game」。小尺寸模型本就不常规上这个基准,可能是常规操作,也可能 5 月那个数字本身不稳,证据不足以定论,记为换轨。

对质疑方也核对一笔:「根本不 work」落空了,现在有署名报告、有委托验证、有产品迭代轨迹;「Theranos 二选一」问错了问题,行业真相多数住在中间态;「一个名字都没挂」算半个落空:5 月发布文本身就有 CEO 署名和 CTO Alex Whedon 的实名履历,投资人名单带链接,报告署名在后,没改的只有 About 页。

五、技术评估与预测

经济性评估。 2900 万美元从疑点变成了论点。如果长上下文能力可以用「开源底座+注意力替换+1T 续训」获得,内存墙的算法层攻法就是平民化的,不需要前沿实验室预算。这比「第一家 sub-quadratic 前沿模型」的称号重要得多。5 月说 ground-up 是话术,6 月承认 retrofit 反而证明了这条路线的经济性:先吹错了方向,再做对了事。

技术评估。 技术是真的:检索泛化、算力形状、第三方验证三项互相咬合,配方自洽。话术是超前的:ground-up 与 retrofit 的对撞、63% 与 64.5× 的 24 倍口径跳变、SWE-Bench 的静默退场,都是同一副性格的两个面。公开可验欠着:机制细节未公开,产品无法上手。

待验四项。 年底 GA 后的公开实测;无偿第三方复现,尤其 12M 泛化;端到端基准(56× 是单注意力层数字);定价公开化(「成本不到 Opus 的 5%」出自 5 月中文转述,官网从未如此宣称,按价格算是 10%,按算力算是 1.5%)。63% 与 64.5× 的口径跳变,也需要一个解释。SWE-Bench 的静默退场同理。

条件预判。 如果 12M 检索被独立复现,受冲击的不只是长上下文模型排序,而是整仓库场景里 RAG 的碎片化范式:当模型能在单次上下文内保真检索,先切碎再拼回的架构就失去了存在理由。这个前提,年底见分晓。

SSA 是内存墙四路进攻里成本最低的一路(算法层)。另外三路在硅片层、协同设计层、系统层,大多 2027 年落地。那是下一篇的事。

声明: 本文基于 Subquadratic 官网及 SubQ 1.1 Small 技术报告(2026 年 6 月 16 日,22 页,已全文核读)、Appen 第三方评估简报(2026 年 6 月 16 日,注明系 Subquadratic 聘用)、5 月 5 日发布文原文(2026 年 8 月 20 日回抓),以及中文社区质疑记录汇编(含 5 月初社区公开转述,原帖未逐条回访);OpenAI 工程师与外部研究者的观点均经社区转述,未访问原帖。倍数与百分比均按原文口径转写,测量边界以文中标注为准。不构成投资建议。文中数据截至 2026 年 8 月 20 日。