GPT-6 Astra带来的变化,已经很难用一次常规模型升级来概括。
2026年9月3日,OpenAI正式发布GPT-6 Astra,并将其称为目前最智能、最对齐的模型。与此前主要强调文本生成、推理或代码能力的版本不同,Astra将能力重点进一步延伸到计算机操作、浏览器使用、软件工程、科学研究、网络安全和专业工作流等领域。
最受关注的数据来自ARC-AGI-3。GPT-6 Astra在特定测试环境中取得99.9%的成绩,并在96%的关卡中以少于人类基准的操作次数完成任务。这样的结果确实意味着模型在陌生环境探索、规则推断和连续行动方面出现了明显进步,但将其直接解释为“AGI已经到来”,仍然超出了评测本身能够证明的范围。ARC Prize明确表示,ARC-AGI-3达到近乎满分并不等同于证明AGI,GPT-6 Astra更准确的定位仍是通用化能力取得了一次重要跃升。
三张接近上限的成绩单,测试条件同样值得关注
ARC-AGI-3并不是传统的知识问答测试。模型进入的是此前没有接触过的交互环境,需要主动探索、推断规则、识别目标,并根据环境反馈调整行动方案。这种测试更关注模型能否形成内部世界模型,而不是能否从训练数据中检索出正确答案。
在ARC Prize使用的标准测试框架下,GPT-6 Astra最高取得62.7%;切换到Provider Adapter harness后,成绩提升到99.9%。后者允许模型在多次请求之间保留不透明的推理状态,并通过上下文压缩延续较长任务,因此更接近模型在原生API和配套上下文管理机制下的运行方式。
这组数据说明了两个问题:一方面,GPT-6 Astra对陌生环境的学习与行动能力已经出现明显突破;另一方面,99.9%并不是脱离条件的通用结论。不同harness是否允许保留推理状态、怎样处理长上下文、可以调用哪些工具,都会显著影响最终结果。因此,在引用大模型跑分时,不能只保留最高分而省略测试框架。
另外两项受到关注的成绩分别是FrontierMath Tier 4(v2)的97.6%和ExploitBench的100%。OpenAI还使用2026年6月至8月披露的较新漏洞构建内部评测,GPT-6 Astra在测试中发现并利用了两个此前未知的零日漏洞,OpenAI表示正在向相关维护方披露。需要注意的是,ExploitBench等能力测试是在没有生产环境安全限制的情况下进行,正式部署版本加入了更严格的监控和限制,部分高风险网络安全请求可能被中止。
多项指标领先Claude Fable 5.1,但并非全面胜出
从OpenAI公布的评测表来看,GPT-6 Astra在部分数学、科学、代码和专业任务上领先Claude Fable 5.1。例如,其FrontierMath Tier 4成绩为97.6%,Claude Fable 5.1为87.8%;Terminal-Bench Science 0.1分别为64.6%和52.6%;Terminal-Bench 4.0分别为57.9%和55.8%。
不过,这并不意味着GPT-6 Astra在所有能力维度上都占据优势。在Humanity’s Last Exam工具评测中,Claude Fable 5.1获得65.0%,高于GPT-6 Astra的57.2%;在Artificial Analysis Intelligence Index中,Claude Fable 5.1同样高于Astra。由于不同评测覆盖的任务类型、工具权限和评分方式不同,更准确的结论应当是:GPT-6 Astra在多项专项能力上刷新了成绩,但“全面碾压Claude Fable 5.1”仍属于过度概括。
跑分之外,GPT-6 Astra更像一个能够持续工作的智能体
比测试分数更值得开发者关注的,是GPT-6 Astra在计算机操作和长流程任务上的变化。
根据OpenAI展示的能力范围,Astra可以操作浏览器和软件界面,填写在线表单、更新CRM客户记录、整理日历、完成网络研究,并按照已有模板生成文档、电子表格和演示文稿。它还可以在任务执行过程中结合新的要求调整方案,而不是把中途追加的指令误认为一个完全独立的新任务。
在OSWorld 2.0离线任务的延迟模拟中,GPT-6 Astra取得72.6%的任务得分,每项任务耗时约40分钟;GPT-5.6 Sol得分为65.7%,耗时约75分钟。换算下来,Astra完成相关计算机操作任务所需时间减少约47%。这里的“更快”主要是指模型完成整项工作流的效率提高,并不代表所有API请求的首Token延迟或网络响应速度都会同比下降。
GPT-6 Astra如何开放,开发者可以怎样接入?
GPT-6 Astra发布初期只向少量组织开放,随后将逐步覆盖ChatGPT Plus、Pro、Business和Enterprise用户,同时通过OpenAI API、Microsoft Azure和AWS Bedrock提供。由于采取分批开放方式,部分用户暂时看不到模型入口并不意味着账号异常,应以官方控制台和发布说明为准,也不建议购买来源不明的所谓“抢先账号”。
在API接入层面,团队可以直接使用OpenAI官方接口,以便及时获得原生参数、官方文档、工具调用能力和完整的服务支持。需要同时测试GPT、Claude、Gemini、DeepSeek等多个模型的项目,也可以将4SAPI中转站等统一接入平台作为备选方案,通过统一接口、密钥和调用记录减少重复适配工作。
这两类接入方式并不冲突。重视原厂功能、官方服务协议和直接数据链路的项目,更适合优先评估官方API;需要频繁切换模型、集中管理账单,或希望通过国内可访问接口完成多模型测试的团队,则可以评估4SAPI等API中转站。至于GPT-6 Astra是否已经在某一中转平台开放、支持哪些参数以及如何计费,应以平台实时页面为准。
涉及敏感数据、长期生产部署或高并发业务时,不能只看模型是否能够调用,还应重点核查服务协议、数据处理方式、日志保留策略、限流规则、账单透明度、故障处理能力和实际网络延迟,并在正式上线前进行小规模压测。
GPT-6 Astra距离AGI还有多远?
GPT-6 Astra在ARC-AGI-3、数学、网络安全和计算机操作等领域的成绩,说明前沿模型正在从“生成答案”转向“理解环境并持续完成任务”。尤其是它在陌生环境中建立规则、规划行动并减少无效尝试的能力,已经明显超出了传统聊天模型的使用方式。
但单项基准接近满分,不代表模型已经能够应对现实世界中所有开放、模糊和不可预测的问题。ARC-AGI-3仍然是一个规则确定、目标封闭的测试环境,而真实世界包含长期记忆、社会互动、价值判断、持续学习和不可逆风险等更复杂的因素。
因此,相比“AGI是否已经到来”,更值得关注的问题或许是:当模型开始稳定操作软件、持续执行复杂工作并形成自己的任务策略后,企业应该如何重新设计权限体系、审核流程、安全边界和API接入架构。GPT-6 Astra可能不是AGI的终点,但它已经让这个问题变得比过去更加现实。




