Back

GLM-5.3-Flash 深度解读:320B-A18B、混合注意力与 1/40 成本背后的架构逻辑

一、引子:一个把海外社区搞糊涂的"牛来模型"

2026 年 8 月 20 日,一个名为 Ox Alpha 的匿名模型悄然上线全球模型聚合平台 OpenRouter 和编程平台 OpenCode。首日它就登顶 OpenRouter 调用量榜单、刷新单日 tokens 用量历史纪录,并终结了 DeepSeek 在 OpenCode 长达 56 天的霸榜;6 天内处理约 23.2 万亿 tokens,约为 DeepSeek-V4-Flash 的 2.3 倍[4][5]

匿名期间,有谷歌研究员发文暗示 Ox Alpha 可能是 Gemini 新模型,也有独立研究员发布"技术指纹报告",称其分词器在 25 组提示词测试中与 GLM-5.3 的 token 计数完全一致、11 项探针交叉匹配 GLM 家族,"99% 把握"指向智谱[3]。中文社区给它起了个外号叫"牛来"("牛模王"),而不少人一边用一边不信:这么高的调用量,不可能是智谱,"智谱没算力"。

8 月 26 日晚,谜底揭晓:Ox Alpha 就是智谱(Z.ai)开源的 GLM-5.3-Flash(320B-A18B),GLM-5 系列第一款原生多模态模型,以 MIT 协议开放权重,同步上线 Hugging Face、ZCode、智谱清言并开放 API[1][2][3]。更值得注意的是,匿名测试期间的全部线上流量,以及发布后的线上服务,均由约 10 万张国产芯片承载——这被媒体称为"国产算力芯片首次大规模集体出海"[3][5]

本文不做简单的"参数+价格"罗列,而是尝试回答一个更值得关注的问题:当 Flash 不再只是旗舰的"缩水版",它从架构层面到底改了什么,才能把成本压到 Claude Opus 4.8 的约 1/40,同时把能力推进到全球前沿区间?

二、一张表看懂 GLM-5.3-Flash

维度 规格 / 数据
发布方 智谱(Z.ai,HK2513),2026-08-26 开源上线
模型代号 GLM-5.3-Flash(匿名期 Ox Alpha / "牛来")
总参数 / 激活参数 320B / 18B(MoE,标为 320B-A18B)
层数 45 层(GLM-4.5 为 92 层,几近减半)
注意力架构 稀疏注意力 + 线性注意力混合架构(首个开源前沿模型采用)
上下文窗口 1M tokens
多模态 原生多模态,支持文本 / 图像 / 视频 / 文件输入
预训练语料 30T tokens 多模态语料
AA 综合智能指数 57 分(Claude Opus 4.8 持平;GLM-5.2 为 53,完整版 GLM-5.3 为 60)
开源协议 MIT
API 定价 输入 0.8 元、输出 2.8 元、缓存命中 0.23 元 / 百万 tokens;限时半价
成本对比 约为 GLM-5.3 的 1/10(活动期 1/20)、Claude Opus 4.8 的 1/40
算力 约 10 万张国产芯片,基于 SGLang 自研推理引擎

数据来源:智谱官方文档与发布稿、Artificial Analysis、财联社/科创板日报、36 氪等报道[1][2][3][4][5]

需要先澄清一个容易被标题党带偏的点:"1/40"指的是完成同一任务的综合成本,而不是单纯的 token 单价。按 token 单价,GLM-5.3-Flash 输入约 0.15 美元、输出约 0.50 美元 / 百万 tokens,GLM-5.3 分别为 1.40 美元和 4.40 美元,约为后者的 1/9;叠加限时半价后约 1/18,官方在传播中概括为 1/10 与 1/20,"1/40"则对应任务级成本口径[6]。看价格时把口径分清楚,比记住一个数字更重要。

三、架构革新:Flash 第一次不是"简单缩小"

过去行业里的 Flash / Mini / Air,通常意味着"更快更便宜,但能力明显打折"。GLM-5.3-Flash 的关键变化在于:它是围绕低成本推理由底向上重新设计的架构,而不是把旗舰砍一刀。

3.1 "大基座 + 小激活":320B 总参,18B 激活

模型总参数 320B,与 GLM-4.5 的 355B 相当,但激活参数从 32B 降到 18B、层数从 92 层压缩到 45 层,几乎减半[1][4]。这是一套典型的 MoE(混合专家)思路:保留庞大的知识容量,单次推理只激活一小部分专家,从而降低计算量。

但"瘦身"本身不必然带来更强能力,真正的杠杆在注意力机制。

3.2 稀疏 + 线性混合注意力:把平方增长压下来

标准 Transformer 的注意力计算量和显存占用随上下文长度近似平方级增长,这是长上下文服务成本居高不下的根源。GLM-5.3-Flash 的做法是两种注意力分工协作[1][5]

  • 线性注意力(linear attention):通过递归机制高效处理局部依赖,计算复杂度近似线性,适合邻近 token 间的关系建模;
  • 稀疏注意力(sparse attention):用一个轻量级索引器(indexer)在长上下文中召回真正需要计算的全局信息,避免全量两两计算。

两者配合,既保住了长上下文的精度,又显著降低了计算与显存。官方测算,相比 GLM-5.3:

  • 注意力计算量降低 3.01 倍
  • KV 缓存大小降低 4.44 倍[1][5]

在 GLM-5.3、DeepSeek-V4-Flash、Kimi-K3 等基线中,GLM-5.3-Flash 的注意力计算量最低;不过报道也指出,其平均每层 KV 缓存大小仍略高于 Kimi-K3 和 DeepSeek-V4-Flash[5]。换句话说,它在"算多少"上优势明显,但在"存多少"上并非全方位领先——这是一个诚实的细节。

3.3 IndexPool:给百万 token 的索引器"减重"

混合注意力有个工程难点:当上下文扩展到 1M tokens,索引器自身也会产生不小的内存和延迟。智谱为此引入了 IndexPool,通过加权池化把索引器原本的 4 个缓存向量压缩成 1 个,从而让稀疏注意力的索引机制在百万 token 级别依然可控[5]。这是把"架构 idea"落到"超长上下文可服务"的关键一环。

3.4 流形约束超连接(mHC):更深模型的可扩展性

模型还采用了流形约束超连接(Manifold-Constrained Hyper-Connections, mHC),用于提升网络的 Scaling 能力[1][4]。超连接类技术关注残差路径上的信息流稳定问题,mHC 通过对流形施加约束,帮助更深/更宽的网络在训练时保持稳定、更容易扩展。它和注意力改造共同构成了"少算但不少干活"的基础。

3.5 30T 多模态语料:能力不是白来的

架构效率解决的是"同样算力能训/推多少",而能力上限还取决于数据。GLM-5.3-Flash 使用了最新的 30T Token 多模态预训练语料[1][4],这是它在参数和层数下降的情况下仍能反超 GLM-5.2 的重要前提。效率革命和数据投入是互补而非替代关系。

四、性能评测:AA 指数 57 分意味着什么

4.1 第三方综合指数

在独立机构 Artificial Analysis 的 **Intelligence Index(综合智能指数)**中,GLM-5.3-Flash 取得 57 分,与 Claude Opus 4.8 持平,高于 GLM-5.2 的 53 分和 DeepSeek V4 Pro 正式版的 53 分;作为参照,完整版 GLM-5.3 为 60 分[3][6]

这个分数的意义不在于"谁吊打谁",而在于它标志着 Flash 定位的模型首次进入全球前沿能力区间——便宜不再必须以"明显变笨"为代价。

4.2 编程与智能体基准

官方公布的基准测试显示,在六项编码与智能体评测上 GLM-5.3-Flash 全面超越 GLM-5.2,部分提升接近翻倍[4][5]

基准 GLM-5.2 GLM-5.3-Flash
DeepSWE v1.1 46.2 63.4
AutomationBench v1.0.6 26.2 48.8
Terminal Bench 2.1 开源模型前列
Agents' Last Exam 开源模型前列

在智谱自建的 Z.ai Code Bench 体感评估中,最高推理档(max effort)下 GLM-5.3-Flash 得 29.0 分,Claude Opus 4.8 为 29.5,差距在 1 分以内——接近但未追平[6]

4.3 必须保留的审慎

36 氪的报道提醒得很到位:不同代码/Agent 模型的测试框架、工具环境、推理预算、最大输出长度和超时设置差异很大。例如智谱在 Terminal-Bench 2.1 和 DeepSWE 中允许模型最长运行 6 小时、最大生成长度设到 65536 tokens;Z.ai Code Bench 又是厂商自测,仍需更多第三方复现[7]

因此更可靠的判断来自匿名测试:在开发者不知道厂商和模型名称、没有品牌滤镜的情况下,Ox Alpha 依然靠真实体验冲到双平台第一。这部分真实世界证据,和跑分互相印证,比单一榜单更有说服力。

五、原生多模态:把"视觉"塞进编码闭环

GLM-5.3-Flash 是 GLM-5 系列第一个原生多模态模型,支持文本、图像、视频、文件输入。但它的重点不是"能看图"这个独立功能,而是把视觉能力直接服务于 Coding 和 Agent 的执行闭环[1][5]

5.1 从"代码能跑"到"结果是对的"

传统代码模型判断任务是否完成,主要看程序是否成功运行、测试是否通过。但很多问题运行时看不出来:

  • 网页能正常启动,按钮位置和配色却和设计稿不符;
  • Blender 脚本成功执行,场景却存在模型穿插、比例错误、光照异常;
  • 游戏没报错,却根本无法完成交互[7]

GLM-5.3-Flash 试图形成 "观察—实现—使用—修正" 的闭环:先读取截图、设计稿、页面录屏或真实软件界面,生成代码并运行,再"观察"渲染结果、与参考画面比较,然后继续修改。模型会自主判断何时需要"看一眼",并依据视觉反馈决定下一步行动[1][5]

5.2 训练方法:自我视觉判断 + 环境反馈强化

为支撑这一闭环,智谱构建了面向视觉编码的数据合成流程,重点训练模型的自我视觉判断测试时改进(test-time improvement)能力;在前端开发场景中还引入环境反馈强化学习,并通过基于真实用户流程的 Agent 验证,提升模型对 GUI 界面和交互结果的判断力[7]

5.3 能力边界:从前端到 3D,再到 Computer Use

官方与媒体实测展示的能力跨度相当大:

  • 前端/游戏开发:复刻网站、从零还原《深海迷航》《王者荣耀》片段、为 DeepSeek Harness 做二次元皮肤[8]
  • 3D 场景:无外部素材自主运行 16 小时,在 Blender 中搭建约 400 平方米的专业建筑场景[5]
  • Computer Use:在 BUA/CUA 驱动下操作真实软件环境与图形界面,跨代码、浏览器、GUI 协调任务[1]
  • 专业办公:输出 PPTX、PDF、DOCX、XLSX,覆盖金融研报、财报、法律文书,并可保留追溯痕迹[1][2]

这是一种"眼手并用"的智能体范式:模型不再只是生成文本/代码,而是能感知自己产出的结果并据此迭代。

六、极致性价比:价格是怎么打下来的

API 定价(人民币,限时半价前)[3][5]

  • 输入:0.8 元 / 百万 tokens
  • 输出:2.8 元 / 百万 tokens
  • 缓存命中:0.23 元 / 百万 tokens
  • 缓存存储:暂时免费
  • 周末及离峰时段:GLM Coding Plan 积分消耗减半

横向对比,这一价格约为 GLM-5.3 的 1/10、活动期 1/20、Claude Opus 4.8 任务成本的 1/40[3][6]。对 Coding/Agent 这种"一个任务连续跑几十分钟到数小时、上下文持续膨胀"的场景,注意力计算量和 KV 缓存的下降直接转化为显存、算力和成本的节约[5]

但也应看到两个变量:其一,限时优惠结束后的真实成本还需观察;其二,在缓存价格上它不如 DeepSeek-V4-Flash 有优势,只是综合输入/输出价格与能力后性价比更高[8]。低价能否长期持续,取决于国产算力供给和架构效率,而非营销补贴。

七、国产芯片推理栈:10 万张卡的工程意义

这次发布一个被"价格"和"跑分"掩盖的重点,是国产算力第一次大规模直接服务全球真实负载

据智谱披露,Ox Alpha 测试期间的全部流量和发布后的线上服务,均由约 10 万张国产芯片承载,知情人士称算力供应方可能涉及华为、海光、摩尔线程(官方未确认具体合作方)[3][5]。为解决单颗国产芯片在算力和显存上的限制,智谱:

  • 基于 SGLang 构建专用推理引擎;
  • 自研高带宽互联网络连接大规模芯片集群;
  • 相比同一硬件上的初始基线,端到端服务性能提升 3 倍
  • 硬件效率和单 token 成本已达到与主流英伟达 GPU "相当"的水平[4][5]

此前海外社区"智谱没算力"的质疑,恰恰反衬了这次验证的分量。它证明国产芯片集群在 MoE + 长上下文 + 多模态这种高难度推理负载下,已经具备承接全球流量的工程可行性——这比单个模型的跑分更具长期意义。当然,"相当"是官方口径,第三方独立压测仍有待补充。

八、如何使用:API、编码计划与开源

8.1 API 调用

模型代码为 glm-5.3-flash,兼容 Chat Completion 接口[1]

  • 文本参数与 GLM-5.3 一致,支持 1M 上下文;
  • 图像通过在 messages[].content[] 中加入 type: image_url 的 content block 传入,image_url.url 支持图片 URL(推荐)或 Base64 Data URL,可传多图;
  • 官方推荐参数:temperature: 1top_p: 0.95reasoning_effort: max
  • thinking.type 仅支持 enabled,建议 thinking.clear_thinking: false
  • 流式请求建议同时开启 stream: truetool_stream: true[1]

8.2 GLM Coding Plan

模型已全面接入 GLM Coding Plan,相比 GLM-5.3 提供 3 倍额度;采用积分制,离峰时段(含周末全天)仅消耗标准积分的 50%,每天限量发放体验卡[1]

8.3 开源权重

权重以 MIT 协议在 Hugging Face 开放(zai-org/GLM-5.3-Flash),开发者可本地部署与二次开发[3]。对需要私有化、数据不出域的团队,这是比 API 更重要的选项。

九、意义与冷思考

9.1 三个真正值得记的点

  1. Flash 的定位变了。它不再是旗舰的廉价缩水版,而是用混合注意力 + MoE + 多模态数据,把"低成本"和"前沿能力"同时拿到手的新品类。
  2. 架构创新比堆参数更重要。注意力计算量降 3 倍、KV 缓存降 4.4 倍,叠加 IndexPool 和 mHC,说明效率红利正从"工艺/堆卡"转向"注意力机制本身"。
  3. 国产算力完成大规模实战验证。10 万张国产芯片承载全球多模态长上下文负载,这是供应链层面的里程碑。

9.2 仍需观察的问题

  • 持久性与稳定性:限时半价结束后的定价、复杂真实业务下的长任务稳定性,仍需大量开发者上手检验[2]
  • KV 缓存并非全面领先:每层 KV 缓存仍略高于 Kimi-K3 和 DeepSeek-V4-Flash,超长上下文的显存效率还有优化空间[5]
  • 自测跑分待第三方复现:Z.ai Code Bench 是厂商自测,六项基准的测试设置(6 小时超时、65536 输出)与生产环境未必一致[7]
  • 多模态可靠性:视觉自我验证在复杂 GUI、长视频、专业文档上的鲁棒性,需要在真实场景中持续验证。

十、结语

GLM-5.3-Flash 最有价值的地方,不是又一个"比肩 Claude"的标题,而是它给出了一个清晰的工程答案:当 Flash 围绕推理成本被重新设计,稀疏+线性混合注意力、索引压缩、MoE 小激活和原生多模态可以组合出一种新的性价比曲线。再加上 10 万张国产芯片托住的全球真实流量,这次发布同时触及了模型架构、算力供应链和智能体范式三条主线。

对开发者而言,它意味着 coding/agent 这类长任务可以用更低成本跑在接近顶级的能力上;对行业而言,它让"前沿能力是否一定昂贵"这个问题,第一次有了不太一样的回答。至于这个回答能撑多久,就交给接下来几个月的真实负载来检验。


参考资料

[1] Z.ai 官方文档:GLM-5.3-Flash Model Overview & How to Use. https://docs.z.ai/guides/vlm/glm-5.3-flash

[2] 新浪财经:《智谱AI发布GLM-5.3-Flash,性能比肩Claude Opus仅需1/40成本》. 2026-08-26. https://cj.sina.com.cn/articles/view/7880068204/1d5b04c6c06801gjg6

[3] 财联社/科创板日报:《10万张国产算力卡扛起"牛来":智谱开源GLM-5.3-Flash》. 2026-08-27. https://www.cls.cn/detail/2465814

[4] 腾讯网/AI普瑞斯Pro:《智谱发布GLM-5.3-Flash原生多模态大模型》. 2026-08-26. http://news.qq.com/rain/a/20260826A0DUX000

[5] 腾讯网/腾讯科技:《智谱"牛来"模型算力谜底:全部国产卡承载,价格仅为Opus 4.8的1/40》. 2026-08-26. http://news.qq.com/rain/a/20260826A0E11E00

[6] 新浪财经/网易智能:《Ox Alpha揭晓:智谱开源GLM-5.3-Flash,跑在国产芯片上》. 2026-08-27. http://finance.sina.cn/stock/jdts/2026-08-27/detail-inipthpc5771729.d.html

[7] 36氪:《智谱认领"牛来"模型,实测:"牛马"友好》. 2026-08-27. https://m.36kr.com/p/3957202599132297

[8] 腾讯网/智东西:《实测智谱GLM-5.3-Flash:剪视频、复刻〈深海迷航〉,价格降低97.5%》. 2026-08-27. http://news.qq.com/rain/a/20260827A07BDW00

评论