一、引子:一个把海外社区搞糊涂的"牛来模型"
2026 年 8 月 20 日,一个名为 Ox Alpha 的匿名模型悄然上线全球模型聚合平台 OpenRouter 和编程平台 OpenCode。首日它就登顶 OpenRouter 调用量榜单、刷新单日 tokens 用量历史纪录,并终结了 DeepSeek 在 OpenCode 长达 56 天的霸榜;6 天内处理约 23.2 万亿 tokens,约为 DeepSeek-V4-Flash 的 2.3 倍[4][5]。
匿名期间,有谷歌研究员发文暗示 Ox Alpha 可能是 Gemini 新模型,也有独立研究员发布"技术指纹报告",称其分词器在 25 组提示词测试中与 GLM-5.3 的 token 计数完全一致、11 项探针交叉匹配 GLM 家族,"99% 把握"指向智谱[3]。中文社区给它起了个外号叫"牛来"("牛模王"),而不少人一边用一边不信:这么高的调用量,不可能是智谱,"智谱没算力"。
8 月 26 日晚,谜底揭晓:Ox Alpha 就是智谱(Z.ai)开源的 GLM-5.3-Flash(320B-A18B),GLM-5 系列第一款原生多模态模型,以 MIT 协议开放权重,同步上线 Hugging Face、ZCode、智谱清言并开放 API[1][2][3]。更值得注意的是,匿名测试期间的全部线上流量,以及发布后的线上服务,均由约 10 万张国产芯片承载——这被媒体称为"国产算力芯片首次大规模集体出海"[3][5]。
本文不做简单的"参数+价格"罗列,而是尝试回答一个更值得关注的问题:当 Flash 不再只是旗舰的"缩水版",它从架构层面到底改了什么,才能把成本压到 Claude Opus 4.8 的约 1/40,同时把能力推进到全球前沿区间?
二、一张表看懂 GLM-5.3-Flash
| 维度 | 规格 / 数据 |
|---|---|
| 发布方 | 智谱(Z.ai,HK2513),2026-08-26 开源上线 |
| 模型代号 | GLM-5.3-Flash(匿名期 Ox Alpha / "牛来") |
| 总参数 / 激活参数 | 320B / 18B(MoE,标为 320B-A18B) |
| 层数 | 45 层(GLM-4.5 为 92 层,几近减半) |
| 注意力架构 | 稀疏注意力 + 线性注意力混合架构(首个开源前沿模型采用) |
| 上下文窗口 | 1M tokens |
| 多模态 | 原生多模态,支持文本 / 图像 / 视频 / 文件输入 |
| 预训练语料 | 30T tokens 多模态语料 |
| AA 综合智能指数 | 57 分(Claude Opus 4.8 持平;GLM-5.2 为 53,完整版 GLM-5.3 为 60) |
| 开源协议 | MIT |
| API 定价 | 输入 0.8 元、输出 2.8 元、缓存命中 0.23 元 / 百万 tokens;限时半价 |
| 成本对比 | 约为 GLM-5.3 的 1/10(活动期 1/20)、Claude Opus 4.8 的 1/40 |
| 算力 | 约 10 万张国产芯片,基于 SGLang 自研推理引擎 |
数据来源:智谱官方文档与发布稿、Artificial Analysis、财联社/科创板日报、36 氪等报道[1][2][3][4][5]。
需要先澄清一个容易被标题党带偏的点:"1/40"指的是完成同一任务的综合成本,而不是单纯的 token 单价。按 token 单价,GLM-5.3-Flash 输入约 0.15 美元、输出约 0.50 美元 / 百万 tokens,GLM-5.3 分别为 1.40 美元和 4.40 美元,约为后者的 1/9;叠加限时半价后约 1/18,官方在传播中概括为 1/10 与 1/20,"1/40"则对应任务级成本口径[6]。看价格时把口径分清楚,比记住一个数字更重要。
三、架构革新:Flash 第一次不是"简单缩小"
过去行业里的 Flash / Mini / Air,通常意味着"更快更便宜,但能力明显打折"。GLM-5.3-Flash 的关键变化在于:它是围绕低成本推理由底向上重新设计的架构,而不是把旗舰砍一刀。
3.1 "大基座 + 小激活":320B 总参,18B 激活
模型总参数 320B,与 GLM-4.5 的 355B 相当,但激活参数从 32B 降到 18B、层数从 92 层压缩到 45 层,几乎减半[1][4]。这是一套典型的 MoE(混合专家)思路:保留庞大的知识容量,单次推理只激活一小部分专家,从而降低计算量。
但"瘦身"本身不必然带来更强能力,真正的杠杆在注意力机制。
3.2 稀疏 + 线性混合注意力:把平方增长压下来
标准 Transformer 的注意力计算量和显存占用随上下文长度近似平方级增长,这是长上下文服务成本居高不下的根源。GLM-5.3-Flash 的做法是两种注意力分工协作[1][5]:
- 线性注意力(linear attention):通过递归机制高效处理局部依赖,计算复杂度近似线性,适合邻近 token 间的关系建模;
- 稀疏注意力(sparse attention):用一个轻量级索引器(indexer)在长上下文中召回真正需要计算的全局信息,避免全量两两计算。
两者配合,既保住了长上下文的精度,又显著降低了计算与显存。官方测算,相比 GLM-5.3:
- 注意力计算量降低 3.01 倍;
- KV 缓存大小降低 4.44 倍[1][5]。
在 GLM-5.3、DeepSeek-V4-Flash、Kimi-K3 等基线中,GLM-5.3-Flash 的注意力计算量最低;不过报道也指出,其平均每层 KV 缓存大小仍略高于 Kimi-K3 和 DeepSeek-V4-Flash[5]。换句话说,它在"算多少"上优势明显,但在"存多少"上并非全方位领先——这是一个诚实的细节。
3.3 IndexPool:给百万 token 的索引器"减重"
混合注意力有个工程难点:当上下文扩展到 1M tokens,索引器自身也会产生不小的内存和延迟。智谱为此引入了 IndexPool,通过加权池化把索引器原本的 4 个缓存向量压缩成 1 个,从而让稀疏注意力的索引机制在百万 token 级别依然可控[5]。这是把"架构 idea"落到"超长上下文可服务"的关键一环。
3.4 流形约束超连接(mHC):更深模型的可扩展性
模型还采用了流形约束超连接(Manifold-Constrained Hyper-Connections, mHC),用于提升网络的 Scaling 能力[1][4]。超连接类技术关注残差路径上的信息流稳定问题,mHC 通过对流形施加约束,帮助更深/更宽的网络在训练时保持稳定、更容易扩展。它和注意力改造共同构成了"少算但不少干活"的基础。
3.5 30T 多模态语料:能力不是白来的
架构效率解决的是"同样算力能训/推多少",而能力上限还取决于数据。GLM-5.3-Flash 使用了最新的 30T Token 多模态预训练语料[1][4],这是它在参数和层数下降的情况下仍能反超 GLM-5.2 的重要前提。效率革命和数据投入是互补而非替代关系。
四、性能评测:AA 指数 57 分意味着什么
4.1 第三方综合指数
在独立机构 Artificial Analysis 的 **Intelligence Index(综合智能指数)**中,GLM-5.3-Flash 取得 57 分,与 Claude Opus 4.8 持平,高于 GLM-5.2 的 53 分和 DeepSeek V4 Pro 正式版的 53 分;作为参照,完整版 GLM-5.3 为 60 分[3][6]。
这个分数的意义不在于"谁吊打谁",而在于它标志着 Flash 定位的模型首次进入全球前沿能力区间——便宜不再必须以"明显变笨"为代价。
4.2 编程与智能体基准
官方公布的基准测试显示,在六项编码与智能体评测上 GLM-5.3-Flash 全面超越 GLM-5.2,部分提升接近翻倍[4][5]:
| 基准 | GLM-5.2 | GLM-5.3-Flash |
|---|---|---|
| DeepSWE v1.1 | 46.2 | 63.4 |
| AutomationBench v1.0.6 | 26.2 | 48.8 |
| Terminal Bench 2.1 | — | 开源模型前列 |
| Agents' Last Exam | — | 开源模型前列 |
在智谱自建的 Z.ai Code Bench 体感评估中,最高推理档(max effort)下 GLM-5.3-Flash 得 29.0 分,Claude Opus 4.8 为 29.5,差距在 1 分以内——接近但未追平[6]。
4.3 必须保留的审慎
36 氪的报道提醒得很到位:不同代码/Agent 模型的测试框架、工具环境、推理预算、最大输出长度和超时设置差异很大。例如智谱在 Terminal-Bench 2.1 和 DeepSWE 中允许模型最长运行 6 小时、最大生成长度设到 65536 tokens;Z.ai Code Bench 又是厂商自测,仍需更多第三方复现[7]。
因此更可靠的判断来自匿名测试:在开发者不知道厂商和模型名称、没有品牌滤镜的情况下,Ox Alpha 依然靠真实体验冲到双平台第一。这部分真实世界证据,和跑分互相印证,比单一榜单更有说服力。
五、原生多模态:把"视觉"塞进编码闭环
GLM-5.3-Flash 是 GLM-5 系列第一个原生多模态模型,支持文本、图像、视频、文件输入。但它的重点不是"能看图"这个独立功能,而是把视觉能力直接服务于 Coding 和 Agent 的执行闭环[1][5]。
5.1 从"代码能跑"到"结果是对的"
传统代码模型判断任务是否完成,主要看程序是否成功运行、测试是否通过。但很多问题运行时看不出来:
- 网页能正常启动,按钮位置和配色却和设计稿不符;
- Blender 脚本成功执行,场景却存在模型穿插、比例错误、光照异常;
- 游戏没报错,却根本无法完成交互[7]。
GLM-5.3-Flash 试图形成 "观察—实现—使用—修正" 的闭环:先读取截图、设计稿、页面录屏或真实软件界面,生成代码并运行,再"观察"渲染结果、与参考画面比较,然后继续修改。模型会自主判断何时需要"看一眼",并依据视觉反馈决定下一步行动[1][5]。
5.2 训练方法:自我视觉判断 + 环境反馈强化
为支撑这一闭环,智谱构建了面向视觉编码的数据合成流程,重点训练模型的自我视觉判断和测试时改进(test-time improvement)能力;在前端开发场景中还引入环境反馈强化学习,并通过基于真实用户流程的 Agent 验证,提升模型对 GUI 界面和交互结果的判断力[7]。
5.3 能力边界:从前端到 3D,再到 Computer Use
官方与媒体实测展示的能力跨度相当大:
- 前端/游戏开发:复刻网站、从零还原《深海迷航》《王者荣耀》片段、为 DeepSeek Harness 做二次元皮肤[8];
- 3D 场景:无外部素材自主运行 16 小时,在 Blender 中搭建约 400 平方米的专业建筑场景[5];
- Computer Use:在 BUA/CUA 驱动下操作真实软件环境与图形界面,跨代码、浏览器、GUI 协调任务[1];
- 专业办公:输出 PPTX、PDF、DOCX、XLSX,覆盖金融研报、财报、法律文书,并可保留追溯痕迹[1][2]。
这是一种"眼手并用"的智能体范式:模型不再只是生成文本/代码,而是能感知自己产出的结果并据此迭代。
六、极致性价比:价格是怎么打下来的
API 定价(人民币,限时半价前)[3][5]:
- 输入:0.8 元 / 百万 tokens
- 输出:2.8 元 / 百万 tokens
- 缓存命中:0.23 元 / 百万 tokens
- 缓存存储:暂时免费
- 周末及离峰时段:GLM Coding Plan 积分消耗减半
横向对比,这一价格约为 GLM-5.3 的 1/10、活动期 1/20、Claude Opus 4.8 任务成本的 1/40[3][6]。对 Coding/Agent 这种"一个任务连续跑几十分钟到数小时、上下文持续膨胀"的场景,注意力计算量和 KV 缓存的下降直接转化为显存、算力和成本的节约[5]。
但也应看到两个变量:其一,限时优惠结束后的真实成本还需观察;其二,在缓存价格上它不如 DeepSeek-V4-Flash 有优势,只是综合输入/输出价格与能力后性价比更高[8]。低价能否长期持续,取决于国产算力供给和架构效率,而非营销补贴。
七、国产芯片推理栈:10 万张卡的工程意义
这次发布一个被"价格"和"跑分"掩盖的重点,是国产算力第一次大规模直接服务全球真实负载。
据智谱披露,Ox Alpha 测试期间的全部流量和发布后的线上服务,均由约 10 万张国产芯片承载,知情人士称算力供应方可能涉及华为、海光、摩尔线程(官方未确认具体合作方)[3][5]。为解决单颗国产芯片在算力和显存上的限制,智谱:
- 基于 SGLang 构建专用推理引擎;
- 用自研高带宽互联网络连接大规模芯片集群;
- 相比同一硬件上的初始基线,端到端服务性能提升 3 倍;
- 硬件效率和单 token 成本已达到与主流英伟达 GPU "相当"的水平[4][5]。
此前海外社区"智谱没算力"的质疑,恰恰反衬了这次验证的分量。它证明国产芯片集群在 MoE + 长上下文 + 多模态这种高难度推理负载下,已经具备承接全球流量的工程可行性——这比单个模型的跑分更具长期意义。当然,"相当"是官方口径,第三方独立压测仍有待补充。
八、如何使用:API、编码计划与开源
8.1 API 调用
模型代码为 glm-5.3-flash,兼容 Chat Completion 接口[1]:
- 文本参数与 GLM-5.3 一致,支持 1M 上下文;
- 图像通过在
messages[].content[]中加入type: image_url的 content block 传入,image_url.url支持图片 URL(推荐)或 Base64 Data URL,可传多图; - 官方推荐参数:
temperature: 1、top_p: 0.95、reasoning_effort: max; thinking.type仅支持enabled,建议thinking.clear_thinking: false;- 流式请求建议同时开启
stream: true与tool_stream: true[1]。
8.2 GLM Coding Plan
模型已全面接入 GLM Coding Plan,相比 GLM-5.3 提供 3 倍额度;采用积分制,离峰时段(含周末全天)仅消耗标准积分的 50%,每天限量发放体验卡[1]。
8.3 开源权重
权重以 MIT 协议在 Hugging Face 开放(zai-org/GLM-5.3-Flash),开发者可本地部署与二次开发[3]。对需要私有化、数据不出域的团队,这是比 API 更重要的选项。
九、意义与冷思考
9.1 三个真正值得记的点
- Flash 的定位变了。它不再是旗舰的廉价缩水版,而是用混合注意力 + MoE + 多模态数据,把"低成本"和"前沿能力"同时拿到手的新品类。
- 架构创新比堆参数更重要。注意力计算量降 3 倍、KV 缓存降 4.4 倍,叠加 IndexPool 和 mHC,说明效率红利正从"工艺/堆卡"转向"注意力机制本身"。
- 国产算力完成大规模实战验证。10 万张国产芯片承载全球多模态长上下文负载,这是供应链层面的里程碑。
9.2 仍需观察的问题
- 持久性与稳定性:限时半价结束后的定价、复杂真实业务下的长任务稳定性,仍需大量开发者上手检验[2]。
- KV 缓存并非全面领先:每层 KV 缓存仍略高于 Kimi-K3 和 DeepSeek-V4-Flash,超长上下文的显存效率还有优化空间[5]。
- 自测跑分待第三方复现:Z.ai Code Bench 是厂商自测,六项基准的测试设置(6 小时超时、65536 输出)与生产环境未必一致[7]。
- 多模态可靠性:视觉自我验证在复杂 GUI、长视频、专业文档上的鲁棒性,需要在真实场景中持续验证。
十、结语
GLM-5.3-Flash 最有价值的地方,不是又一个"比肩 Claude"的标题,而是它给出了一个清晰的工程答案:当 Flash 围绕推理成本被重新设计,稀疏+线性混合注意力、索引压缩、MoE 小激活和原生多模态可以组合出一种新的性价比曲线。再加上 10 万张国产芯片托住的全球真实流量,这次发布同时触及了模型架构、算力供应链和智能体范式三条主线。
对开发者而言,它意味着 coding/agent 这类长任务可以用更低成本跑在接近顶级的能力上;对行业而言,它让"前沿能力是否一定昂贵"这个问题,第一次有了不太一样的回答。至于这个回答能撑多久,就交给接下来几个月的真实负载来检验。
参考资料
[1] Z.ai 官方文档:GLM-5.3-Flash Model Overview & How to Use. https://docs.z.ai/guides/vlm/glm-5.3-flash
[2] 新浪财经:《智谱AI发布GLM-5.3-Flash,性能比肩Claude Opus仅需1/40成本》. 2026-08-26. https://cj.sina.com.cn/articles/view/7880068204/1d5b04c6c06801gjg6
[3] 财联社/科创板日报:《10万张国产算力卡扛起"牛来":智谱开源GLM-5.3-Flash》. 2026-08-27. https://www.cls.cn/detail/2465814
[4] 腾讯网/AI普瑞斯Pro:《智谱发布GLM-5.3-Flash原生多模态大模型》. 2026-08-26. http://news.qq.com/rain/a/20260826A0DUX000
[5] 腾讯网/腾讯科技:《智谱"牛来"模型算力谜底:全部国产卡承载,价格仅为Opus 4.8的1/40》. 2026-08-26. http://news.qq.com/rain/a/20260826A0E11E00
[6] 新浪财经/网易智能:《Ox Alpha揭晓:智谱开源GLM-5.3-Flash,跑在国产芯片上》. 2026-08-27. http://finance.sina.cn/stock/jdts/2026-08-27/detail-inipthpc5771729.d.html
[7] 36氪:《智谱认领"牛来"模型,实测:"牛马"友好》. 2026-08-27. https://m.36kr.com/p/3957202599132297
[8] 腾讯网/智东西:《实测智谱GLM-5.3-Flash:剪视频、复刻〈深海迷航〉,价格降低97.5%》. 2026-08-27. http://news.qq.com/rain/a/20260827A07BDW00