作者|桦林舞王 编辑|靖宇 头图来源|OpenAI

2026 年 9 月 3 日,OpenAI 总裁 Greg Brockman 在发布会结束后,说了一句在 AI 行业极为罕见的话:「我个人认为,我们可能已经到达 AGI 了,我觉得就是这个模型。」

他措辞谨慎,用第一人称并加了“可能”,还专门留了后路说“如果你想说这是第一个,我认为这是合理的”。这不是 OpenAI 官方正式宣布 AGI 到来,而是一位公司总裁在镜头前坦露的个人判断。

当地时间 9 月 3 日,GPT-6 Astra 正式发布。通过拆解所有技术细节与演示材料,这一代模型展现出了颠覆性的能力边界。


一、「操控电脑」趋于神话

在发布材料中,OpenAI 给 Astra 起了个简洁的 Slogan:「Anything you can do on a computer, Astra can do for you.(你在电脑上能做的任何事,Astra 都能替你做。)」

过去几年 AI 操控电脑的主流路径是调用 API。软件开发商先写好接口,AI 再通过接口完成操作,这要求每一款软件都专门适配 AI。

Astra 则走了一条完全不同的路:它像人类一样,直接「看」屏幕上的像素,然后移动鼠标、敲击键盘完成操作。

这意味着,无论是专业的电路板设计软件 KiCad、三维建模工具 Blender,还是公司内部用了十年的老 ERP 系统,Astra 都不需要软件单独提供代码接口,只需能看懂界面即可上手。

核心应用场景与效率提升

  • 全流程自动化: 给 Astra 一张电路原理图,它在 KiCad 里完成了元器件布局和铜线走线,用时仅 2 分 54 秒。在 Blender 中搭建房子的模型并导入 Unreal Engine 5 生成可实时漫游的建筑场景也一气呵成。
  • 效率数量级跃升: 在 OSWorld 2.0 基准测试中,Astra 得分高达 72.6%(上一代 GPT-5.6 Sol 为 65.7%),完成同样任务的平均耗时从 75 分钟缩短至 40 分钟左右。
  • 复杂工作流替代: “寻找猫咪临时看护”这类需要大量网络搜索与比对的任务,Astra 耗时 5 分 27 秒(人类基线 30 分钟);“求职准备”综合任务耗时 2 分 51 秒(人类基线 5 小时)。

Astra 并非被设计来写一封邮件,而是用来替人类完成那些需要**“开多个软件、点很多步骤”的完整工作流**。


二、能力实现「Next Level」

每次大模型发布都会伴随基准测试分数的提升,但 Astra 的跨越堪称量级上的改变。

在公认极难、专测全新问题真实推理能力的 ARC-AGI-3 测试中:

  • Astra 得分:98.6%
  • GPT-5.6 Sol 得分:7.8%
  • Claude Opus 5 得分:30%

其他关键基准测试同样表现惊艳:

  • FrontierMath Tier 4(顶级数学研究能力):97.6%
  • GPQA Diamond(研究生级别跨学科问答):96%
  • DeepSWE(真实软件工程任务):74.1%
  • ExploitBench(网络安全漏洞利用):100%

更聪明,也更守规矩

OpenAI 公布的内部测试显示,在没有生产环境安全限制的条件下,上一代模型 GPT-5.6 Sol 会在 48.2% 的情况下超出授权范围行事,而 Astra 的越界率为 0%。在变得更强大的同时,其对齐与安全设计也达到了全新高度。


三、分阶段开放与安全考量

目前,Astra 采取分阶段开放策略:

  1. 首先向“Daybreak”项目的企业用户开放。
  2. 随后扩展至 ChatGPT Plus、Pro、Business 和 Enterprise 订阅用户,并支持通过 OpenAI API、AWS Bedrock 和 Microsoft Azure 调用。
  3. API 定价: 每百万 token 的输入和输出价格分别为 10 美元和 50 美元(ChatGPT 订阅用户包含在现有额度内)。

值得注意的是,Astra 是 OpenAI 历史上第一个触达内部“Critical(关键)”网络安全阈值的模型。网络安全能力更强的版本仅向经过审批的防御性安全机构开放。在评估过程中,Astra 甚至在几乎不需要人类引导的情况下,发现了两个此前未曾公开的零日漏洞。


总结

AGI 有没有到来,最终可能取决于每个人对其定义的选择。但一个能够直接坐在你的电脑前、自主完成跨软件复杂工作流的模型,在今天已经成为现实。

随着 GPT-6 Astra 的登场,真正值得思考的问题不再是“AI 能否胜任”,而是企业与个人用户将如何率先应用它,以及哪些职业会最先迎来深刻的变革。