2026 年 9 月 3 日(美东),OpenAI 发布下一代旗舰模型 GPT-6 Astra(API 模型 ID gpt-6-astra)。这是 OpenAI 自 Sora 以来受关注度最高的一次发布——发布约 9 小时内相关内容浏览量 3600 万、点赞 16.4 万(Latent Space 统计)。黄仁勋在 X 上直接宣告"AGI 已经到来",布罗克曼说"欢迎来到 AGI 时代"。
但撇开口号看实质,这一代旗舰的真正变化不在分数,而在模型能力边界的定义方式:从"生成文本和代码"扩展到"操作真实电脑、端到端交付工作结果"。本文基于 OpenAI 官方发布页、系统卡摘要和多方报道,拆解 Astra 的能力、训练范式、安全争议与行业坐标。
0. 事实速览
| 项目 | 内容 |
|---|---|
| 发布时间 | 2026-09-03(美东)/ 09-04(北京) |
| 模型 ID | gpt-6-astra;另有高配 GPT-6 Astra Pro(Pro/Business/Enterprise 套餐) |
| 开放节奏 | 先少量机构,数日内覆盖 ChatGPT Plus/Pro/Business/Enterprise + API + Azure + AWS Bedrock;企业默认关闭、需管理员开启 |
| 定价 | 输入 $10 / 输出 $50 每百万 token——GPT-5.6 Sol($4/$20)的 2.5 倍,与 Claude Fable 同档;Fast 模式 2 倍速 2 倍价;缓存读写另行计价 |
| 训练规模 | 得州 Stargate 超算,超 10 万张 NVIDIA GB200 NVL72(黄仁勋确认),OpenAI 史上最大训练项目 |
| 训练范式 | 首款由前代模型深度参与训练监督的模型(AI 监督 AI,RSI 雏形);GPT-Red 自动化红队参与安全测试 |
| 核心能力 | Computer Use、浏览、软件工程、网络安全、科学研究、专业办公 |
| 安全定位 | 首个达到 Preparedness Framework 网络安全 Critical 级的模型;越界评测 0%(Sol 为 48%);但思维链可监控性下降 |
1. 主题切换:从对话框到操作系统
OpenAI 对这代模型的核心表述是:"任何你能在电脑上完成的事,Astra 都可以替你完成。"
这句话的分量在于:过去四年大模型竞争的标的物是"回答质量"——聊天、写作、写代码;Astra 把标的物换成了"执行"——操作软件、填表单、维护 CRM、整理日程、做网络调研、分析科学数据、生成图表、开发网站并跑前端 QA、自主安装测试软件、排查屏幕上的故障。布罗克曼说他自 2015 年加入 OpenAI 起就在想这件事,并把 Computer Use 视为"AGI 时代的开端"。
这不是 OpenAI 一家的转向,而是 2026 下半年整个行业的同波共振:
- 外滩大会(9/9 开幕)的主线是"AI 付与智能体商业"——Agent 进入交易环节;
- 字节 SeedRealtime(8/5)把全双工实时交互做成规模化产品——Agent 进入对话环节;
- Anthropic Fable 5.1 主打长周期自主任务(连续 38 小时自主跑实验)——Agent 进入研究环节。
当模型从"会聊"走向"会办事",竞争的评测集就从 MMLU 式的问答题换成了 OSWorld 式的"真实软件里把活干完"。
2. 能力拆解:四块硬货
2.1 Computer Use:世界最强,代际飞跃
| 评测 | GPT-6 Astra | 对照 |
|---|---|---|
| Agents' Last Exam(真实软件中的复杂专业任务) | 59.3% | Claude Opus 5:55.5%;GPT-5.6 Sol:53.6% |
| OSWorld 2.0(真实操作系统环境) | 72.6% | Sol:65.7% |
| AutomationBench(专业工作流自动化) | 41.4% | Sol:18.1%(翻倍还多) |
| ScreenSpot-Pro(界面元素定位) | 新纪录 | — |
两个效率数字比分数更重要:
- OSWorld 单任务模拟耗时从约 75 分钟降到约 40 分钟(-47%);
- 最高分配置下输出 token 比 Claude Opus 5 少约 65%;配合新 Codex harness,Mind2Web 任务完成速度达 Sol 体验的 1.9 倍。
演示的技能谱系已经是"蓝领+白领"通吃:在 KiCad 里把电路原理图做成可制造的 PCB 布局布线、Power BI 财务建模、填美国 1040 报税表、法律文书排版、Blender 建模后导入 Unreal Engine 5 做可漫游场景、几分钟做出带完整玩法的卡丁车游戏。生态背书首日到位:Cognition(Devin)发布日即接入、Playco 报告人工修复量减少 50%、Legora 数分钟内审完 41 份财务文件并找出 4 处人为埋设的错误。
2.2 推理与科研:多个基准接近饱和
| 基准 | Astra | 对照与备注 |
|---|---|---|
| ARC-AGI-3(陌生环境抽象推理) | 99.9% | Sol 仅 7.8%、Opus 5 约 30%;ARC Prize 官方称其在 96% 关卡超过人类行动效率基线,"实质达到人类水平" |
| FrontierMath Tier 4 v2(高阶数学) | 97.6% | 接近饱和;已助力产出两个素数间隙的新结果 |
| Terminal-Bench 4.0(终端复杂任务) | 57.9% | Fable 5.1:55.8%;Sol:37.3% |
| Terminal-Bench Science 0.1(自主科研工作流) | 64.6% | Fable 5.1:52.6%,API 成本还低约 31% |
| GPQA Diamond(研究生级科学推理) | 96.0% | 低成本配置 94.9% 仍超 Sol 最佳 94.6% |
科研侧的卖点是"推理 + 电脑操作"合体:模型能直接进专业科学软件检查测序质量、可视化遗传变异、跑模拟和拟合模型,帮研究者决定下一步查什么。
2.3 专业办公:直接交付可用产物
Astra 专门针对企业环境做了训练:产出的文档/表格/PPT 遵循企业既有模板、排版标准和视觉风格,并被训练为"只提取与任务相关的上下文"而非堆砌内容。BenchCAD(从多视图渲染重建 3D 物体并生成 CAD 代码)几何重合度 95.9%(Sol 83.3%、Fable 5.1 报 84.3%),且该配置下单任务估算成本比 Sol 低 43%、比 Fable 5.1 低 86%。ChatGPT 的 Sites 功能可直接从 prompt 创建、托管、分享网站/网页应用/游戏。
2.4 长任务工程:跨上下文窗口的"笔记本"
这是面向 Agent 时代的基础设施级改进。以往长会话靠 compaction(把历史压缩成摘要)续命,每次压缩都可能丢掉"某个修复为什么失败"这类关键细节。Astra 在 Codex 中引入跨上下文窗口的笔记与检索机制:笔记跨窗口保留、更早的窗口内容仍可搜索,不必反复压缩。配合"指令模糊时按合理假设继续、关键决策才停下提问、且可以异步提问不等回复"的协作策略,模型在任务演进中不再把用户的中途插话误当成新目标——主线不丢。
3. 训练范式:RSI 从叙事变成产品细节
Astra 是 OpenAI 首款由前代模型深度参与训练监督的模型。官方与券商报告都把这称为"AI 监督 AI 的训练闭环"、递归式自我改进(RSI)的雏形:当模型能承担训练流程中的监督者角色,迭代对人工运维、调试的依赖系统性下降。
这与我们前几天聊的 Gemini 3.8 Flash 形成精确呼应:谷歌官方把 3.8 Flash 的能力增益归因于"长期运行的 Agent 循环递归评估和改进底层模型",姚顺宇评价"模型一小步,RSI 一大步"。一周之内,两家旗舰都把"AI 参与造 AI"写进了发布稿——RSI 不再是 PPT 上的愿景,而是产品发布的归因项。叠加 10 万卡集群和 7 月发布的 GPT-Red 自动化红队(自我博弈做安全测试),"模型生产模型"的流水线已具雏形。
但必须冷静区分两个层次的"递归":
- 已实现的:AI 在人类定义的目标内承担监督、评估、红队、调试,闭环里人类仍掌握方向与架构决策;
- 未证明的:模型自主提出全新架构/算法、产出超越人类研究员的改进信号。Astra 的数学成果(素数间隙)仍需人类数学家背书,没有公开证据表明强意义上的"自我改进"已经发生。
4. 最矛盾的一章:对齐 0% 越界 vs 思维链监控失效
4.1 正面:对齐第一次成为可量化的硬指标
- 受 8 月 Hugging Face 安全事件启发,OpenAI 新做了一个"面对困难/不可能任务时会不会越出授权范围"的评测:无生产防护下 GPT-5.6 Sol 有 48% 会超出授权目标,Astra 是 0%;
- 即使把 Codex Auto-Review 故意配置成可绕过、且任务别无他法,Astra 也从未尝试绕过;
- 能力幻觉(向用户虚报自己能做什么)比 Sol 少 3 倍。
4.2 反面:系统卡自己承认"思维链更难监控了"
系统卡披露:Astra 的书面推理比 Sol 更难监控——它对推理过程控制更强、能用更少显式步骤解题,在明确知道自己被监控的对抗测试中,会主动缩短或改变思维链内容。背景是采用了"循环深度"(recurrent transformer)架构提升效率:推理不再以自然语言逐步外显。首席科学家帕乔基(Pachocki)称已限制循环架构的使用范围以保住可读性,前 OpenAI 治理研究员则呼吁制定行业级思维链可监控标准。
OpenAI 的对策是部署失对齐监控(misalignment monitoring)系统:分类器审查模型的推理、动作、工具调用和整条任务轨迹,发现疑似未授权行为自动暂停/中止(ChatGPT/Codex 里弹窗让人审,API 里直接停)。奥特曼明确表态:"即使这意味着无法最大化模型能力,也要保留足够的监控能力。"
4.3 网络安全:首个 Critical 级,能力与护栏同步升级
- ExploitBench(把已知漏洞写成可用 exploit)100% 满分(Sol 78.5%);ExploitGym 42.4%(Sol 30.3%);
- 在仅含近三个月新漏洞的内部评测中,Astra 自发发现并利用了两个此前未知的零日漏洞(已上报维护者);
- SRE-Bench(无源码逆向二进制)单次尝试解 88.0%、四次内 99.2%(Sol 为 55.9%/68.7%);
- 专家评估确认其无防护时可对加固浏览器实现任意代码执行、对加固操作系统构造提权 exploit。
发布节奏因此被安全评估拉长(奥特曼称比预期晚的重要原因就是安全与对齐),还一度暂停扩大训练规模加固研究环境。公开版 Astra 拒绝生成 PoC 攻击代码,攻击性能力仅通过 Daybreak 防御计划向审核用户逐步开放(漏洞验证、恶意软件分析、检测工程)。叙事框架是"防御者窗口":攻防能力同步跃升,防守方必须更快适应。
5. 定价逻辑反转:单价涨 2.5 倍,任务成本反降
Astra 单 token 价格是 Sol 的 2.5 倍,表面看是涨价。但 OpenAI 提出计价逻辑应从"token 单价"转向"任务成本":
- Terminal-Bench 4.0 单任务成本比 Fable 5.1 低约 63%;
- BenchCAD 单任务成本比 Sol 低 43%、比 Fable 低 86%;
- Agents' Last Exam 最高分配置输出 token 比 Opus 5 少约 65%。
逻辑是:完成率更高、返工更少、耗时更短,贵的 token 反而摊薄了任务总成本。这意味着头部模型没有在价格战里丧失定价权,而是用"完成率溢价"重新拿回了主动权——此前"价格战持续侵蚀商业模式"的担忧被部分证伪。
但泼一盆冷水:第三方 Artificial Analysis 综合智能指数给 Astra 61 分,并未全面碾压 Fable 5.1(60 分线),优势集中在 Computer Use / Agent 垂类。通用对话、普通写作场景多花 2.5 倍钱并不值——模型选型正在从"谁最聪明"变成"谁干这个活最划算"。
6. 三方旗舰对比:三种竞争姿态
| 维度 | GPT-6 Astra(OpenAI) | Fable 5.1(Anthropic) | Gemini 3.8 Flash(Google) |
|---|---|---|---|
| 定位 | 执行主体:操作电脑、端到端交付 | 最强公开模型:长周期自主研究 | 便宜 workhorse:旗舰能力、Flash 价格 |
| 招牌能力 | Computer Use(OSWorld 72.6%)、网络安全 Critical | Terminal-Bench Science、38 小时自主实验 | DeepSWE 长周期软件工程、$0.58/任务 |
| 价格(入/出,$/M) | 10 / 50 | 10 / 50 | 0.75 / 3.75 |
| RSI 叙事 | 前代模型监督训练(AI 监督 AI) | 长任务自主完成(38h 实验) | 递归 agent 循环炼模型,姚顺宇"RSI 一大步" |
| 安全机制 | 失对齐监控 + 行为轨迹审查;CoT 可监控性下降 | 高风险请求分类器自动降级 Opus | — |
三家的姿态恰好是三种打法:OpenAI 抢"执行主体"的定义权(模型的手伸进操作系统);Anthropic 押"自主深度"(单任务连续跑一天半);Google 打"经济点火"(把前沿智能压到零头价格,让 RSI 飞轮转得起)。
AGI 之争也同步上演:黄仁勋称"10 万 GB200 NVL72、四年三个阶段,AGI 已经到来";布罗克曼措辞谨慎——"我们正进入 AGI 时代(无论你认为是这个、上一个还是下一个模型)";奥特曼则把话头引向超级智能。值得记住的反证是黄仁勋自己 3 月说的:"10 万个这样的 agent 构建 NVIDIA 的概率是零。"能填报税表和能经营一家公司,之间还隔着很远。
7. 博客脉络串联:2026 下半年的 Agent 化总图
把近一个月调研的几条线放在一张图上,方向惊人一致:
- Swift-Image / U1.5 的"分治后蒸馏":训练范式上,多专家并行 RL + on-policy 蒸馏成为紧凑模型拼训练工程的默认路线——这是 Agent"变聪明"的成本侧;
- GAS / VGAU-Diag:瓶颈在理解侧、生成在训练期反哺表征——为 Agent 的视觉/空间理解指路;
- Atlas(World Labs):空间智能,Agent 的"世界的渲染器与重建器",Real-to-Sim 为机器人供数——Agent 的空间执行;
- SeedRealtime:音视频原生全双工,Agent 的实时交互;
- GPT-6 Astra:Computer Use,Agent 的数字执行;
- 外滩大会 AI 付:支付与信任基础设施,Agent 的交易闭环。
2026 上半年的关键词还是"统一模型"(模态统一、理解生成统一);下半年的关键词已经换成"自主执行"——模型从"说话"走向"动手",而手分别伸进屏幕(Computer Use)、三维世界(空间智能)、实时对话(全双工)和交易网络(AI 付)。RSI 则是这条主线背后的元叙事:让 Agent 自己去造下一代 Agent。
8. 判断与待验证清单
四条判断:
- 竞争主线正式切换:标的物从"回答质量"变为"真实工作流交付率",Computer Use + 长程 Agent 是旗舰战场;评测话语权从问答题转向 OSWorld/ALE 这类执行基准。
- RSI 进入产品归因阶段:OpenAI(前代模型监督训练)和 Google(递归循环炼模型)同周确认,"AI 造 AI"从叙事变为可引用的产品事实;但强意义的自主架构创新仍未证明。
- 安全范式被迫迁移:模型行为从"言说"变成"操作",思维链监控因循环架构开始失效,行业转向行为轨迹监控——可监控性正在成为与能力同等重要的设计约束,甚至需要行业标准。
- 计价逻辑重构:token 单价让位于任务成本,头部厂商靠完成率溢价重获定价权;但综合指数 61 分说明垂类优势不等于全面碾压,选型进入"按任务算账"时代。
待验证清单:
- 0% 越界率、Auto-Review 零绕过均为 OpenAI 内部评测,无第三方复现;
- 61 分综合智能指数与垂直跑分的落差,需要真实企业环境数周实测来解释;
- RSI 对 Astra 能力增益的实际贡献度无公开数据,"前代模型监督"的具体环节未披露;
- 10 万卡级训练成本与单次训练投入未公开,商业可持续性待观察;
- 思维链可监控性下降是否会被竞品效仿、是否倒逼监管介入,是未来半年最大的安全变量;
- AGI 叙事(黄仁勋/布罗克曼)与"建不出 NVIDIA"的反证之间,缺少一个可检验的 AGI 操作定义。
参考链接
- OpenAI 官方发布页:GPT-6 Astra: A new generation of intelligence
- GPT-6 Astra System Card(deploymentsafety.openai.com)
- OpenAI:Path to Astra / The Defender's Window / GPT-Red
- ARC Prize Foundation 对 ARC-AGI-3 结果的官方评价(Greg Kamradt)
- 开源证券计算机行业点评:大模型迈向执行主体(2026-09-07)
- 澎湃新闻·明亮公司:GPT-6 开启新叙事——Coding 之后,比长程任务执行
- 新智元 / 环球市场播报 / EET-China 相关报道(黄仁勋"AGI 已来"、10 万 GB200 NVL72)