OpenAI 最新旗舰模型叫 GPT-6 Astra。官方定位就是面向复杂推理、Coding、Computer Use、研究和完整交付任务。API 版本拥有 105 万 Token Context,并支持最高 max Reasoning Effort。

GPT-6 最重要的变化不是“聊天更聪明”,而是它开始更擅长把一个复杂目标连续完成。

01|真正值得看的只有 4 组数据

电脑操作

ScreenSpot-Pro GPT-5.6 Sol 76.9% GPT-6 Astra 92.7% OSWorld 2.0 GPT-5.6 Sol 65.7% GPT-6 Astra 72.6%

ScreenSpot-Pro 主要测试模型能否准确理解屏幕并定位操作目标;OSWorld 则更接近真实电脑任务。官方还表示,在其 OSWorld 延迟模拟中,Astra 完成任务所需时间约减少 47%。

它测试的是:

理解目标 → 调用工具 → 操作软件 → 处理结果 → 继续下一步 → 完成交付

而不是回答一道单独的问题。

GPT-6 更值得用在“几十步才能完成的工作”,而不是一句话问答。

Coding

Terminal-Bench 4.0:

GPT-5.6 Sol 37.3% GPT-6 Astra 57.9% Claude Fable 5.1 55.8%

这个 Benchmark 主要测试真实终端环境里的软件工程、系统配置和数据处理任务。

在 Artificial Analysis Coding Agent Index 上:

GPT-6 Astra 67.0 Claude Fable 5 67.2 Claude Opus 5 68.1

所以准确的结论是 Astra 的 Coding Agent 能力进步很大,但不同 Harness 和 Benchmark 下排名仍会变化。

科研

Terminal-Bench Science GPT-5.6 Sol 22.4% GPT-6 Astra 64.6% FrontierMath Tier 4 GPT-5.6 Sol 83.0% GPT-6 Astra 97.6%

Terminal-Bench Science 不是简单问答,它要求 Agent 使用代码和终端完成数据分析、模拟、模型拟合等科研流程。

所以科研场景真正的提升,是“从回答问题”开始进入“参与科研工作流”。

02|2.4% 到底是什么意思

网上最近很容易看到一句:GPT-6 误操作率从 22% 降到 2.4%。

这句话不严谨。

官方 Benchmark 名称其实是:Internal Computer Use Safety Benchmark

结果:

GPT-5.6 Sol 22.0% GPT-6 Astra 2.4%

而且是:越低越好。

它衡量的是内部模拟环境中出现不符合预期安全边界结果的比例,不是日常使用时只有 2.4% 概率点错按钮。

03|普通人第一个用法:别让它“告诉你怎么做”,让它交付结果

以前:

帮我分析一下 AI Agent 市场。

换成:

调研过去 30 天 AI Agent 领域最重要的产品更新。优先使用官方来源。建立产品对比表。找出 5 个值得关注的趋势。每个结论保留出处。最后整理成一份适合微信公众号选题使用的研究报告。无法确认的信息明确标注,不要猜。

关键变化:

回答问题 ↓ 完成一份交付物

04|第二个用法:把重复网页操作交给它

例如你每周都要:

登录几个后台 → 查看数据 → 导出 → 对比 → 找异常 → 写总结

可以直接给:

打开这几个后台。只读取信息,不修改任何数据。整理过去 7 天核心指标。对比上一周期。找出变化超过 20% 的项目。整理成表格并给出优先检查顺序。任何发送、删除、付款、修改操作都先停下来让我确认。

Astra 的 Computer Use 和长链路能力,就是针对这类工作明显增强。OpenAI 官方展示的场景已经包含表单、Excel、Power BI、Frontend QA、文档格式化等真实软件任务。

05|第三个用法:Codex 不要再只让它“写函数”

以前:

写一个 Stripe Webhook。

更推荐:

先阅读项目,不修改代码。运行现有测试,定位 Stripe Webhook 重复发放 Credits 的根因。告诉我涉及哪些文件。给出最小修复方案。修改后补 Regression Test。重新运行相关测试。不做无关重构。最后输出修改摘要。

也就是从:

写代码

升级成:

定位 → 修改 → 测试 → 验证 → 汇报

Terminal-Bench 4.0 从 37.3% 提升到 57.9%,这种场景才最能体现差异。

06|第四个用法:数据分析不要只说“帮我分析”

上传 CSV 后直接要求:

先检查字段类型、缺失值和异常值。不修改原始数据。提出 3 个值得验证的假设。使用 Python 分析。为每个假设生成对应图表。区分相关性和因果关系。最后给出: 能确定的结论; 目前证据不足的结论; 下一步还需要什么数据。

这比一句:

帮我看看数据有什么规律。

效果会稳定得多。

07|科研用户可以这样用

例如:

阅读我上传的论文和实验数据。第一步只复现论文的方法,不提出改进。第二步检查结果是否能复现。如果失败,列出可能原因。第三步提出最多 3 个后续实验。每个实验说明: 假设 自变量 因变量 控制变量 判断标准不得虚构论文中不存在的数据。

Terminal-Bench Science 的提升说明 Astra 特别适合:文献 + 代码 + 数据 + 工具 组合任务。

但科研、医疗、金融等高风险结论仍然不能因为 Benchmark 高就直接跳过专业复核。

08|网络安全能力很强

GPT-6 Astra 在旧版 ExploitBench 上确实达到:100%。

但 OpenAI 自己明确提醒,这个成绩可能受到历史漏洞污染影响。

于是他们又做了只包含 Astra Knowledge Cutoff 之后新漏洞的内部版本:

ExploitBench June–Aug 2026 GPT-5.6 Sol 5.5% GPT-6 Astra 39.0%

此外:

ExploitGym 42.4% SEC-Bench Pro 85.4%

都远不是 100%。

所以准确的说法是 GPT-6 的安全研究能力大幅增强,但绝不等于“扫描一次就没有漏洞”。

09|谁现在能用

OpenAI 9 月 3 日宣布:GPT-6 Astra 正在 Rollout。

当前先向有限组织开放,随后几天逐步覆盖:Plus、Pro、Business、Enterprise 以及 API、Azure 和 AWS Bedrock。

其中 GPT-6 Astra Pro 当前面向 Pro、Business、Enterprise。

Plus 会获得 Astra,但不包含 Astra Pro。

所以如果你现在模型列表还没出现 Astra 属于正常,官方正在逐步推送。

10|普通人的模型选择

没有必要所有任务都直接上 GPT-6。

普通聊天、改标题、简单翻译 用快速模型。

日常写作、普通研究、一般代码 用 GPT-5.6 系列。

真正复杂的任务再用 Astra

例如:

跨多个网页完成工作 大型代码库 Debug 复杂数据分析 长链路 Agent 科学研究 Computer Use 完整报告 / PPT / 项目交付

因为 Astra API 官方价格目前是:$10 / 百万输入 Token,$50 / 百万输出 Token。

Fast Mode 速度最高可提升约 2 倍,但价格也是标准模式的 2 倍。

最后

以后用 GPT-6,不要只写:

帮我完成 XX。

改成:

目标 + 已有资料 + 允许使用的工具 + 不能做什么 + 执行步骤要求 + 最终交付物 + 验收标准 + 哪些动作必须先让我确认

例如:

**目标:**找出网站过去 7 天转化下降的原因。**权限:**只能读取,不允许修改后台。**过程:**检查 Analytics、Search Console 和支付数据。**交付:**给我异常页面、影响范围、可能原因和优先级。**验收:**所有数字必须有来源;不确定就写不确定。**安全边界:**任何发送、删除、付款、改配置操作必须先确认。

这才是 GPT-6 最值得普通人学习的地方。

以前我们给 AI 一个问题,现在更应该给 AI 一个目标、权限边界和验收标准,然后让它完成工作。