Skip to content

GPT-6 Astra 深度解析 ​

发布近一个月后的冷静复盘:官方叙事、独立评测与生产反馈的三角对照。

一、发布概况 ​

时间线(注意时区口径,中文媒体常见两种说法):

  • 美西时间 2026-09-03 上午,OpenAI 在旧金山发布新一代旗舰模型 GPT-6 Astra(代号 Astra,拉丁语"星辰")
  • 北京时间 2026-09-04 凌晨,中文媒体集中报道
  • 距 GPT-5 首发约一年,距上一版重要更新 GPT-5.6 Sol 仅两个月

发布会上,OpenAI 总裁 Greg Brockman 宣告 "Welcome to the AGI era",将此次发布定义为"代际跃迁"。这句话是本次发布最大的争议点,下文会专门讨论。

基本规格(来源:OpenAI 官方 API 模型页):

项目数值
API 模型 IDgpt-6-astra
上下文窗口1,050,000 tokens
最大输出128,000 tokens
知识截止日期2026-04-30
推理强度档位low / medium / high / xhigh / max
输入/输出模态文本+图片输入,文本输出

二、官方跑分 ​

官方公布的对比基准(对比对象为上一代旗舰 GPT-5.6 Sol):

评测GPT-6 AstraGPT-5.6 Sol说明
ARC-AGI-399.9%7.8%陌生环境的抽象推理
FrontierMath Tier 497.6%83.0%高难数学推理
GPQA Diamond96.0%94.6%研究生级科学问答
Terminal-Bench 4.057.9%37.3%终端/系统/软件工程
OSWorld 2.072.6%65.7%真实桌面电脑操作
AutomationBench41.4%18.1%多步骤办公自动化
ExploitBench100%78.5%研究环境漏洞利用

阅读这些数字需要注意三点:

  1. 官方说明取最大推理强度下的最好成绩;
  2. 部分测试使用研究环境或特定工具链,生产版 ChatGPT 的系统提示与安全策略不同;
  3. 高分基准与日常任务(写作、中文表达、事实准确性)并不等价。

三、核心升级:Computer Use 与长任务 ​

3.1 电脑操作 ​

这是本次发布真正的重点。Astra 可以自主完成填写在线表单、更新 CRM 记录、整理日历、网页研究、分析数据生成图表等跨软件的多步骤工作流。官方展示的 KiCad 演示中,模型从读取原理图到完成 PCB 布线、再通过视觉反馈检查重叠与断线,形成了完整的操作闭环。

效率数据:

  • OSWorld 2.0 延迟模拟:单任务耗时从 GPT-5.6 Sol 的约 75 分钟降至约 40 分钟(-47%)
  • Mind2Web 基准:配合更新后的 Codex harness,任务完成速度提升 1.9 倍

3.2 长任务不丢上下文 ​

Codex 引入实验性上下文机制:当任务跨越多个上下文窗口时,Astra 会保存工作笔记并可回溯搜索之前的消息和工具输出,而不是只依赖一次有损压缩摘要。对动辄数小时的 Agent 长任务,这比单点跑分更有实际意义。

3.3 安全对齐 ​

OpenAI 新设计了一项"越界测试",考察模型面对困难或不可能完成的任务时是否超出授权目标:

  • GPT-5.6 Sol:48% 的测试案例越界
  • GPT-6 Astra:0%

同时,Astra 的网络安全能力达到 Preparedness Framework 的 Critical 级。注意这两个数字的边界:安全测试测的是"有没有超出授权范围",管不了"授权范围内但判断错误"的问题——下文的开发者反馈会印证这一点。

四、价格与计费陷阱 ​

计费项单价(每百万 tokens)
标准输入$10
缓存输入(读)$1
缓存输入(写)$12.50
标准输出$50
Batch / Flex标准费率的 50%
Fast mode2 倍费率,约 2 倍速度

单价是 GPT-5.6 Sol($4/$20)的 2.5 倍。

最容易踩的坑:单次请求输入超过 272K tokens 后,整次请求按输入 2 倍、输出 1.5 倍计费——不是只对超出部分加价。做长文档、代码库分析或 Agent 预算估算时,必须先判断是否跨过这个门槛。

五、独立评测:官方叙事的另一面 ​

5.1 Artificial Analysis(9 月 9 日) ​

第三方独立评测机构 Artificial Analysis 的结论与官方宣传有明显温差:

  • Intelligence Index:53 分,与 Claude Fable 5.1 打平(并非"全面领先")
  • Coding Agent Index:62 分,同样与 Fable 5.1 打平
  • 但成本优势显著:同样分数,每任务成本约为 Fable 5.1 的 40%($3.26 vs $7.63)
  • Token 效率是最大亮点:max 档每任务输出 27k tokens,仅为 Fable 5.1(78k)的约 1/3
  • 长时程知识工作评测 AA-Briefcase 较上代提升约 90 Elo
  • 反向信号:GDPval-AA v2(44 个职业的真实经济价值任务)较 GPT-5.6 Sol 下降约 45 Elo,且每任务交互轮次从 45 轮降至 24 轮(Claude 约 60 轮)

5.2 细分编程基准的"险胜" ​

逐项拆解编程类基准,故事没有总分那么漂亮:

基准Astra对手差距
DeepSWE v1.174.1%Gemini 3.8 Flash 73.8%+0.3pt,但单价是对方 13 倍
FrontierCode Extended64.5%Claude Fable 5 64.9%-0.4pt
Coding Agent Index67.0Claude Opus 5 68.1-1.1

更耐人寻味的是:max 推理档在两项编程评测上反而低于 high 档,社区推测是"过度思考"所致——推理档位并非越高越好。

5.3 被放大的两个亮点 ​

  • 3D 渲染:演示视频中的花园、船厂、戴森球并非原生 3D 生成,而是生成 CAD 代码驱动 Blender、Unreal 等外部工具。几何精确性(BenchCAD 95.9%)的提升不能外推到贴图、UV、骨骼绑定等完整工作流。
  • 幻觉率:官方宣称 4.2%(对比 Sol 的 12.2%),但该数字来自禁联网、冷门题的窄口径测试集;Artificial Analysis 的 AA-Omniscience 口径下,幻觉率是从 92% 降到 51%。同一模型、不同口径、相差十几倍——不附测试集定义的"幻觉率"只能当营销材料看。

5.4 开发者实测中的失败模式 ​

首批实测暴露的风险集中在自主性过强:

  • 不确认方案就擅自实施架构决策(生成不合理的数据库 schema)
  • 把状态变更接口写成 GET 请求
  • 漏掉关键的成本日志

这些反馈与独立评测中"每任务交互轮次从 45 降到 24"指向同一个根因:模型被强化为少问、少澄清、自己干完。交互轮次在 Agent 基准上叫效率,在开放性任务上就是跳过了澄清环节。

5.5 一个务实的参照:鹈鹕测试 ​

OpenAI 把 Simon Willison 多年来的"画一只骑自行车的鹈鹕"非正式标尺做进了发布视频彩蛋。Willison 实测结果:最低推理档(约 9.55 美分)就已超越 GPT-5.6 Sol 全部档位;拉满到 max(63 美分)视觉更细腻,但只要不是 max 档,鹈鹕的腿和车架位置错位依然常见。一个简单到无法针对性优化的测试,比冷门高难基准更能暴露空间关系的真实水平。

六、一个月后的进展(截至 2026-09-30) ​

6.1 DevDay 2026(美西 9 月 29 日) ​

发布近一个月后,OpenAI 在 DevDay 上公布了后续布局:

  • GPT-6.1 Sol:价格约为 Astra 的 1/5(缓存输入仅 1/10),DeepSWE v1.1 表现与 Astra 相当,OSWorld 2.0 最高推理强度仅差 2.1 个百分点。Altman 称其"某些方面比 Astra 更聪明,将成为你的日常主力"。
  • Astra Ultrafast:Codex 中生成速度最高达每秒 300 tokens(约 8 倍速),仅向 $500/月 的 Pro 500 订阅及企业用户开放,且计费倍率为标准的 6-8 倍。
  • 全天候智能体 dots:由 Astra 驱动,拥有自己的云端电脑和浏览器,可连接 4000+ 应用,支持经 Slack/Teams/语音沟通;后台研究仅限只读,写操作需授权。
  • AI 参与自身研发:截至 2026 年 7 月,大模型可在无人介入下完成超过 1/3 的"一天级"研究任务;内部每个人类工作日对应 3.1 个智能体工作日。

6.2 生产落地 ​

Perplexity 于 9 月 14 日被 OpenAI 官方列为案例,将 Astra 接入生产系统。ChatGPT 周活跃用户已达 12 亿。

6.3 使用方式的变化 ​

OpenAI DevX 团队 Dominik Kundel 的实战反馈值得注意:过去精心编写的复杂 Prompt/Skill 在 Astra 上反而成了累赘。他给 LEGO 建模任务写过数小时的专门 Skill + 复杂指令,而让 Codex 直接调用 BrickLink Studio 软件后,一句需求十分钟出初版。

新的分工方式:

交给模型人来负责
找材料、制作、检查、整合等执行细节用途、背景、参考的交代(方向感)
自行补全操作细节指定合适的工具
检查自己的工作明确检查范围与交还条件
产出可操作初版具体位置的反馈,逐轮改进

这与站内 Prompt Engineering 与 Context Engineering 的演进一致:模型越强,控制粒度越粗——从控制"怎么说"转向控制"目标、工具与验收标准"。这也是 Harness Engineering(相关阅读)价值上升的直接例证。

七、"AGI 时代"来了吗 ​

冷静的答案:没有证据,但方向值得认真对待。

  • AGI 至今没有统一定义和验收测试,"Welcome to the AGI era"是营销表述,不是可验证的结论;
  • Astra 在部分基准接近饱和、能跨软件完成长工作流,说明 Agent 能力出现代际进步;
  • 但它仍受账号权限、工具可用性、安全策略、错误率和成本约束——OSWorld 72.6% 意味着约四个桌面任务里有一个会失败,且它倾向于不回来问你;
  • 更准确的表述是:GPT-6 Astra 重新引发了 AGI 讨论,同时把 Agent 的成本曲线打平了——"让模型跑一整段活"第一次在账面上算得过来。

八、给开发者的选型建议 ​

  1. 任务路由优于全量替换。Astra 适合失败代价高、需要跨软件执行的长任务;日常改写、摘要、分类用低成本模型(GPT-5.6 Sol 或 GPT-6.1 Sol)更划算。
  2. 别只看单价。Astra 单价 2.5 倍但 token 消耗仅 1/3,按任务算成本可能反而更低;而 Gemini 3.8 Flash 在 DeepSWE 上与 Astra 仅差 0.3 个百分点,单价是 1/13——成本敏感的长任务值得先测它。
  3. 警惕 272K 长上下文计费跳档,长文档场景先做预算估算。
  4. 涉及架构决策与数据库改动,把输出当草稿而非成品,保留人工确认环节。
  5. 控制粒度换挡:减少步骤级微操 Prompt,改为清晰交代目标、工具与验收标准。

参考资料 ​


作者:yanshaodong · 2026-09-30