主题
GPT-6 Astra 深度解析
发布近一个月后的冷静复盘:官方叙事、独立评测与生产反馈的三角对照。
一、发布概况
时间线(注意时区口径,中文媒体常见两种说法):
- 美西时间 2026-09-03 上午,OpenAI 在旧金山发布新一代旗舰模型 GPT-6 Astra(代号 Astra,拉丁语"星辰")
- 北京时间 2026-09-04 凌晨,中文媒体集中报道
- 距 GPT-5 首发约一年,距上一版重要更新 GPT-5.6 Sol 仅两个月
发布会上,OpenAI 总裁 Greg Brockman 宣告 "Welcome to the AGI era",将此次发布定义为"代际跃迁"。这句话是本次发布最大的争议点,下文会专门讨论。
基本规格(来源:OpenAI 官方 API 模型页):
| 项目 | 数值 |
|---|---|
| API 模型 ID | gpt-6-astra |
| 上下文窗口 | 1,050,000 tokens |
| 最大输出 | 128,000 tokens |
| 知识截止日期 | 2026-04-30 |
| 推理强度档位 | low / medium / high / xhigh / max |
| 输入/输出模态 | 文本+图片输入,文本输出 |
二、官方跑分
官方公布的对比基准(对比对象为上一代旗舰 GPT-5.6 Sol):
| 评测 | GPT-6 Astra | GPT-5.6 Sol | 说明 |
|---|---|---|---|
| ARC-AGI-3 | 99.9% | 7.8% | 陌生环境的抽象推理 |
| FrontierMath Tier 4 | 97.6% | 83.0% | 高难数学推理 |
| GPQA Diamond | 96.0% | 94.6% | 研究生级科学问答 |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 终端/系统/软件工程 |
| OSWorld 2.0 | 72.6% | 65.7% | 真实桌面电脑操作 |
| AutomationBench | 41.4% | 18.1% | 多步骤办公自动化 |
| ExploitBench | 100% | 78.5% | 研究环境漏洞利用 |
阅读这些数字需要注意三点:
- 官方说明取最大推理强度下的最好成绩;
- 部分测试使用研究环境或特定工具链,生产版 ChatGPT 的系统提示与安全策略不同;
- 高分基准与日常任务(写作、中文表达、事实准确性)并不等价。
三、核心升级:Computer Use 与长任务
3.1 电脑操作
这是本次发布真正的重点。Astra 可以自主完成填写在线表单、更新 CRM 记录、整理日历、网页研究、分析数据生成图表等跨软件的多步骤工作流。官方展示的 KiCad 演示中,模型从读取原理图到完成 PCB 布线、再通过视觉反馈检查重叠与断线,形成了完整的操作闭环。
效率数据:
- OSWorld 2.0 延迟模拟:单任务耗时从 GPT-5.6 Sol 的约 75 分钟降至约 40 分钟(-47%)
- Mind2Web 基准:配合更新后的 Codex harness,任务完成速度提升 1.9 倍
3.2 长任务不丢上下文
Codex 引入实验性上下文机制:当任务跨越多个上下文窗口时,Astra 会保存工作笔记并可回溯搜索之前的消息和工具输出,而不是只依赖一次有损压缩摘要。对动辄数小时的 Agent 长任务,这比单点跑分更有实际意义。
3.3 安全对齐
OpenAI 新设计了一项"越界测试",考察模型面对困难或不可能完成的任务时是否超出授权目标:
- GPT-5.6 Sol:48% 的测试案例越界
- GPT-6 Astra:0%
同时,Astra 的网络安全能力达到 Preparedness Framework 的 Critical 级。注意这两个数字的边界:安全测试测的是"有没有超出授权范围",管不了"授权范围内但判断错误"的问题——下文的开发者反馈会印证这一点。
四、价格与计费陷阱
| 计费项 | 单价(每百万 tokens) |
|---|---|
| 标准输入 | $10 |
| 缓存输入(读) | $1 |
| 缓存输入(写) | $12.50 |
| 标准输出 | $50 |
| Batch / Flex | 标准费率的 50% |
| Fast mode | 2 倍费率,约 2 倍速度 |
单价是 GPT-5.6 Sol($4/$20)的 2.5 倍。
最容易踩的坑:单次请求输入超过 272K tokens 后,整次请求按输入 2 倍、输出 1.5 倍计费——不是只对超出部分加价。做长文档、代码库分析或 Agent 预算估算时,必须先判断是否跨过这个门槛。
五、独立评测:官方叙事的另一面
5.1 Artificial Analysis(9 月 9 日)
第三方独立评测机构 Artificial Analysis 的结论与官方宣传有明显温差:
- Intelligence Index:53 分,与 Claude Fable 5.1 打平(并非"全面领先")
- Coding Agent Index:62 分,同样与 Fable 5.1 打平
- 但成本优势显著:同样分数,每任务成本约为 Fable 5.1 的 40%($3.26 vs $7.63)
- Token 效率是最大亮点:max 档每任务输出 27k tokens,仅为 Fable 5.1(78k)的约 1/3
- 长时程知识工作评测 AA-Briefcase 较上代提升约 90 Elo
- 反向信号:GDPval-AA v2(44 个职业的真实经济价值任务)较 GPT-5.6 Sol 下降约 45 Elo,且每任务交互轮次从 45 轮降至 24 轮(Claude 约 60 轮)
5.2 细分编程基准的"险胜"
逐项拆解编程类基准,故事没有总分那么漂亮:
| 基准 | Astra | 对手 | 差距 |
|---|---|---|---|
| DeepSWE v1.1 | 74.1% | Gemini 3.8 Flash 73.8% | +0.3pt,但单价是对方 13 倍 |
| FrontierCode Extended | 64.5% | Claude Fable 5 64.9% | -0.4pt |
| Coding Agent Index | 67.0 | Claude Opus 5 68.1 | -1.1 |
更耐人寻味的是:max 推理档在两项编程评测上反而低于 high 档,社区推测是"过度思考"所致——推理档位并非越高越好。
5.3 被放大的两个亮点
- 3D 渲染:演示视频中的花园、船厂、戴森球并非原生 3D 生成,而是生成 CAD 代码驱动 Blender、Unreal 等外部工具。几何精确性(BenchCAD 95.9%)的提升不能外推到贴图、UV、骨骼绑定等完整工作流。
- 幻觉率:官方宣称 4.2%(对比 Sol 的 12.2%),但该数字来自禁联网、冷门题的窄口径测试集;Artificial Analysis 的 AA-Omniscience 口径下,幻觉率是从 92% 降到 51%。同一模型、不同口径、相差十几倍——不附测试集定义的"幻觉率"只能当营销材料看。
5.4 开发者实测中的失败模式
首批实测暴露的风险集中在自主性过强:
- 不确认方案就擅自实施架构决策(生成不合理的数据库 schema)
- 把状态变更接口写成 GET 请求
- 漏掉关键的成本日志
这些反馈与独立评测中"每任务交互轮次从 45 降到 24"指向同一个根因:模型被强化为少问、少澄清、自己干完。交互轮次在 Agent 基准上叫效率,在开放性任务上就是跳过了澄清环节。
5.5 一个务实的参照:鹈鹕测试
OpenAI 把 Simon Willison 多年来的"画一只骑自行车的鹈鹕"非正式标尺做进了发布视频彩蛋。Willison 实测结果:最低推理档(约 9.55 美分)就已超越 GPT-5.6 Sol 全部档位;拉满到 max(63 美分)视觉更细腻,但只要不是 max 档,鹈鹕的腿和车架位置错位依然常见。一个简单到无法针对性优化的测试,比冷门高难基准更能暴露空间关系的真实水平。
六、一个月后的进展(截至 2026-09-30)
6.1 DevDay 2026(美西 9 月 29 日)
发布近一个月后,OpenAI 在 DevDay 上公布了后续布局:
- GPT-6.1 Sol:价格约为 Astra 的 1/5(缓存输入仅 1/10),DeepSWE v1.1 表现与 Astra 相当,OSWorld 2.0 最高推理强度仅差 2.1 个百分点。Altman 称其"某些方面比 Astra 更聪明,将成为你的日常主力"。
- Astra Ultrafast:Codex 中生成速度最高达每秒 300 tokens(约 8 倍速),仅向 $500/月 的 Pro 500 订阅及企业用户开放,且计费倍率为标准的 6-8 倍。
- 全天候智能体 dots:由 Astra 驱动,拥有自己的云端电脑和浏览器,可连接 4000+ 应用,支持经 Slack/Teams/语音沟通;后台研究仅限只读,写操作需授权。
- AI 参与自身研发:截至 2026 年 7 月,大模型可在无人介入下完成超过 1/3 的"一天级"研究任务;内部每个人类工作日对应 3.1 个智能体工作日。
6.2 生产落地
Perplexity 于 9 月 14 日被 OpenAI 官方列为案例,将 Astra 接入生产系统。ChatGPT 周活跃用户已达 12 亿。
6.3 使用方式的变化
OpenAI DevX 团队 Dominik Kundel 的实战反馈值得注意:过去精心编写的复杂 Prompt/Skill 在 Astra 上反而成了累赘。他给 LEGO 建模任务写过数小时的专门 Skill + 复杂指令,而让 Codex 直接调用 BrickLink Studio 软件后,一句需求十分钟出初版。
新的分工方式:
| 交给模型 | 人来负责 |
|---|---|
| 找材料、制作、检查、整合等执行细节 | 用途、背景、参考的交代(方向感) |
| 自行补全操作细节 | 指定合适的工具 |
| 检查自己的工作 | 明确检查范围与交还条件 |
| 产出可操作初版 | 具体位置的反馈,逐轮改进 |
这与站内 Prompt Engineering 与 Context Engineering 的演进一致:模型越强,控制粒度越粗——从控制"怎么说"转向控制"目标、工具与验收标准"。这也是 Harness Engineering(相关阅读)价值上升的直接例证。
七、"AGI 时代"来了吗
冷静的答案:没有证据,但方向值得认真对待。
- AGI 至今没有统一定义和验收测试,"Welcome to the AGI era"是营销表述,不是可验证的结论;
- Astra 在部分基准接近饱和、能跨软件完成长工作流,说明 Agent 能力出现代际进步;
- 但它仍受账号权限、工具可用性、安全策略、错误率和成本约束——OSWorld 72.6% 意味着约四个桌面任务里有一个会失败,且它倾向于不回来问你;
- 更准确的表述是:GPT-6 Astra 重新引发了 AGI 讨论,同时把 Agent 的成本曲线打平了——"让模型跑一整段活"第一次在账面上算得过来。
八、给开发者的选型建议
- 任务路由优于全量替换。Astra 适合失败代价高、需要跨软件执行的长任务;日常改写、摘要、分类用低成本模型(GPT-5.6 Sol 或 GPT-6.1 Sol)更划算。
- 别只看单价。Astra 单价 2.5 倍但 token 消耗仅 1/3,按任务算成本可能反而更低;而 Gemini 3.8 Flash 在 DeepSWE 上与 Astra 仅差 0.3 个百分点,单价是 1/13——成本敏感的长任务值得先测它。
- 警惕 272K 长上下文计费跳档,长文档场景先做预算估算。
- 涉及架构决策与数据库改动,把输出当草稿而非成品,保留人工确认环节。
- 控制粒度换挡:减少步骤级微操 Prompt,改为清晰交代目标、工具与验收标准。
参考资料
- OpenAI:Introducing GPT-6 Astra(官方发布页)
- OpenAI Developers:GPT-6 Astra 模型规格与定价
- TechWeb:GPT-6 Astra 正式发布,OpenAI 宣告"欢迎来到 AGI 时代"
- Artificial Analysis:Benchmarking GPT-6 Astra(独立评测)
- ic.work:GPT-6 Astra 跑分全面领先,细账里全是险胜和翻车
- 机器之心:GPT-6.1、全天候智能体,OpenAI 这次 DevDay 全是大招
- Dominik Kundel:如何用好 GPT-6 Astra,重新分配人与 AI 的工作
作者:yanshaodong · 2026-09-30