GPT-6 Astra:终端工程任务第一,复合智能第三梯队
gpt-6-astra
OpenAI 旗舰档,官方定位 hardest end-to-end work(gpt-6-astra):上下文 1.05M、单次输出 128K、知识截止 2026-04-30,内置 Functions、Web search、File search 与 Computer use,不必外拼 agent 框架。reasoning effort 五档而单价固定 $10/$50,成本杠杆在 token 侧;同门 Sol $2/$10、Luna $0.1/$0.5,100 倍价差可留在一家厂商内分流。第三方水位(2026-09-22):Terminal-Bench 4.0 第 1、58.18%(n_trials=330、pass@5 0.7121);Arena Agent 第 2,净改进 11.54、confirmed_success 17.70 低于榜首 Fable 5.1,praise 32.79 全场最高;智能指数第 6、7(max 52.67)。边界:知识截止比本页早近五个月,版本号与 API 变更须走 Web search;Computer use 可靠性不在任何榜上;闭源只走 API。置信度 A(已确认);未做能力复现。
- 置信度
- 已确认
- ≥2 个独立来源,或本站 harness 复现通过
- 关键指标
- Terminal-Bench 准确率
- 已确认 · 2026-09
- 成熟度
- 产品
- 研究 → 演示 → 产品 → 生产
我们的判断我们给它 A 档(已确认):OpenAI 官方文档给规格与定价,本站同步的 Terminal-Bench、Arena Agent、智能指数三张榜给读数,两组来源独立。A 档只对事实层负责。
它的定位在三条梯顶里最清晰也最窄:它是「动手做完」这条轴的第一名。Terminal-Bench 58.18% 排第一,这个榜的协议(真实终端环境、n=330、看能不能把任务做完)比复合智能指数更接近编码 agent 的日常;内置 Web search / File search / Computer use 又让它不必外挂 agent 框架就能端到端跑。这两件事叠起来,是我们把它列为推理与代码域梯顶第三条的完整理由。
但要如实讲它的两处不占优:智能指数 52.67 在三条里最低,用复合榜选型的人不该选它;Agent 榜上它 praise 全场最高(32.79)而 net_improvement 输给 Fable 5.1(11.54 对 13.71),这个分裂意味着它的输出更容易让人觉得「做得好」,但实际推进幅度更小。对生产系统这是个需要主动防的偏差:评审人容易被观感带走,而账单和 diff 只认净推进。另外知识截止 2026-04-30 比发布早了近五个月,凡涉及最新版本的任务必须走工具而不是记忆。
它解决的问题:端到端把一件事做完,而不是答好一个问题
OpenAI 给 GPT-6 Astra 的官方定位是旗舰档,面向 hardest end-to-end work(最难的端到端工作)。这句话的重点在「端到端」:不是给一段提示词写一段好回答,而是接手一整个任务——自己搜资料、读文件、调工具、跑代码、看结果、再决定下一步,直到事情做完。
这个定位在规格里落得很实:内置工具面直接列在模型页上,包含 Functions、Web search、File search 与 Computer use,也就是「查网 + 读库 + 操作界面」三件事是模型自带的能力,不需要外面再拼一层 agent 框架。上下文 1.05M tokens、单次输出 128K tokens、知识截止 2026-04-30,思考强度做成 low 到 max 的五档旋钮,而不是只有开/关。
官方规格与同门定价阶梯
| 模型 | API ID | 定位 | 价格(每百万 tokens) |
|---|---|---|---|
| GPT-6 Astra | gpt-6-astra | 旗舰,最难的端到端工作 | $10 输入 / $50 输出 |
| GPT-6 Sol | gpt-6-sol | 中档主力 | $2 / $10 |
| GPT-6 Luna | gpt-6-luna | 低成本高并发 | $0.1 / $0.5 |
Astra 自身的规格:上下文 1.05M tokens、最大输出 128K tokens、知识截止 2026-04-30、reasoning effort 五档(low / minimal 之上的中间档 / high / xhigh / max)、内置 Functions、Web search、File search、Computer use。三档之间价差是 100 倍(Luna 到 Astra),这个阶梯的意义是同一个厂商内可以做负载分流:高频调用走 Luna,常规走 Sol,只有真正难的端到端任务才升到 Astra。
第三方水位:终端工程任务第一,复合智能第三梯队
本站同步的三张榜(抓取 2026-09-22)给出的画像和 Anthropic 那条线正好互补:
- Terminal-Bench 4.0:第 1 名。准确率 58.18%,n_trials=330,pass@5 = 0.7121。第 2 名是 Fable 5.1 的 57.88%(pass@5 0.7879),第 7 名仍是 Astra 的另一行 54.24%(pass@5 0.6667),第 8 名 Opus 5 53.94%。这个榜量的是「在真实终端环境里完成工程任务」,是三条里最接近编码 agent 日常的那个协议。
- Arena Agent 榜:第 2 名。净改进 11.54、confirmed_success 17.70、praise 32.79。净改进与确认成功率都低于榜首 Fable 5.1(13.71 / 19.83),但 praise 是全场最高(32.79 对 31.83)——「看起来做得好」它赢,「确实推进了」它输,这个分裂要在选型时如实读。
- Artificial Analysis 智能指数:第 6、7 名。max 档 52.67、xhigh 档 52.39,低于 Opus 5.5 的 57.62 / 55.99 / 53.58 与 Fable 5.1 的 53.35 / 53.20。
三张榜合起来的结论:Astra 是「动手把事做完」这条轴上的第一名,不是「综合智能分」这条轴上的第一名。如果你的负载是编码 agent、终端自动化、需要模型自己操作界面的任务,它的排位最相关;如果你的负载是知识问答与复杂推理链,同价位的 Opus 5.5 在智能指数上高 4.95 分。
另外要说清 Terminal-Bench 榜上的一个数据形态:同一个模型在榜上有多行(Astra 出现在第 1 与第 2、第 7 行,读数不同),这是该榜按提交/配置分行记录的结果,不是三个不同的模型。我们引的是第 1 行 58.18%,并注明 n_trials=330,读者要知道这个榜的样本量口径。
五档思考旋钮:为什么这是工程特性而不是营销
reasoning effort 从 low 到 max 五档,配合固定单价($10/$50 不随档位变),意味着成本杠杆在 token 消耗侧而不是单价侧:同一个模型,选 low 就少烧思考 token,选 max 就多烧,单价不变。这和 Anthropic 的自适应思考是两种相反的设计哲学——一个把决定权交给调用方(可预测、可调优),一个交给模型自己(省事、不可预测)。
对生产系统这是好事:你可以按任务类型静态分流(格式转换走 low,架构决策走 max),成本曲线是自己画的,不是模型给的。代价是你必须自己维护这张分流表,而且要定期用真实任务重测,否则档位会随模型更新而漂移。
边界
- 智能指数不占优:52.67(max)在本站梯顶三条里排最后。用复合智能榜选型的人不该选它。
- praise 高而 net_improvement 低是个警号:在 Agent 榜上它的「观感分」全场最高而「净推进」输给 Fable 5.1。生产里要盯的是后者,前者容易被过度解读成能力优势。
- 知识截止 2026-04-30:比页面发布日期早了将近五个月,涉及最新版本号、最新 API 变更的任务必须走 Web search 而不是模型记忆。
- Computer use 的可靠性不在任何榜上:内置工具面是能力声明,本站没有它的界面操作成功率读数,这部分的可用性只能按厂商宣称理解。
- 闭源、只走 API:不能自托管、不能微调、数据出域。
我们的核验状态
事实来自两个独立来源:OpenAI 官方模型文档(platform.openai.com 的 models 页,实读定位、API ID、五档 reasoning effort、上下文与输出上限、知识截止、内置工具面、三档定价)与本站同步的 Terminal-Bench 4.0、Arena Agent、Artificial Analysis 智能指数三张榜的原始行(抓取 2026-09-22,含 metrics 字段名与 n_trials 口径)。两者独立,因此置信度记 A(已确认)。
未覆盖的部分如实说明:我们未做能力复现。没有在自有 harness 上跑过 Astra 的 Computer use 成功率,没有实测五档 reasoning effort 在我们任务上的成本-效果曲线,也没有验证 Terminal-Bench 58.18% 在我们的终端环境里能否复现。本页「按任务类型静态分流」那一节是基于规格的设计建议,不是实测结论。要升到实测级,需要:固定任务集上 Astra 对 Fable 5.1 / Opus 5.5 的端到端完成率对照、五档旋钮的真实 token 消耗与耗时曲线、以及 Computer use 在有界面依赖任务上的成功率量化。