事件分析2026年9月7日

你觉得 GPT-6 算是进入 AGI 的里程碑吗?

9月3日,OpenAI 发布 GPT6 Astra。紧接着两天内,两位 AI 领域最有分量的人物接连宣布了一个惊人的判断:AGI 已经到来。 OpenAI 总裁 Greg Brockman 在电话会议上说:"欢迎来到 AGI 时代。"9月6日,英伟达 CEO 黄仁勋在 X 平台发帖:"从 ChatG...

#open ai#astra#AGI

9月3日,OpenAI 发布 GPT-6 Astra。紧接着两天内,两位 AI 领域最有分量的人物接连宣布了一个惊人的判断:AGI 已经到来。

OpenAI 总裁 Greg Brockman 在电话会议上说:"欢迎来到 AGI 时代。"9月6日,英伟达 CEO 黄仁勋在 X 平台发帖:"从 ChatGPT 到 o1,再到 Astra,OpenAI 只用了 4 年时间。AGI 已经到来。祝贺 @OpenAI 团队。"

消息一出,学界立刻炸了锅。AI 学者 Gary Marcus 公开反驳:黄仁勋"没有提供任何科学定义,也没有给出任何证据",英伟达只是"通过单方面宣布,接管原本属于科学范畴的问题"。

那么,GPT-6 Astra 到底算不算 AGI 的里程碑?这个问题没有标准答案,但值得掰开揉碎了看。

一、先看 Astra 带来了什么:能力全景

要回答"是不是里程碑",得先知道 Astra 强在哪。它有三个层次的变化:脑力、动手、耐力

脑力:把研究级测试"刷爆"

在代表推理上限的硬核测试中,Astra 的成绩贴着满分线:

基准测试Astra对比对象
FrontierMath Tier 4(研究级数学)97.6%Claude Fable 5.1:87.8%
GPQA Diamond(科学知识)96.0%Gemini 3.8 Flash:95.3%
ARC-AGI-3(抽象推理)99.9%GPT-5.6 Sol:7.8%

ARC-AGI-3 的跨越尤其戏剧性——从 Sol 的 7.8% 到 Astra 的 99.9%,近乎两个数量级。更早之前,OpenAI 曾透露 Astra 的内部版本独立解决了 10 个长期悬而未决的数学与理论计算机科学难题。换句话说,它已经能触及"人类尚未解决的问题"。

动手:从"会回答"到"能操作"

这是本次发布最核心的转变,也是黄仁勋敢喊"AGI 已来"的底气之一。

Astra 是 OpenAI 首个具备完整 Computer Use 能力的旗舰模型:浏览网页、操作桌面应用、填写表单、安装测试软件、排查故障,甚至能在专业软件中完成复杂工作流。官方展示的案例包括:

  • 电路设计:自主完成元件放置与布线,把原理图转化为可制造的 PCB 板
  • 机械设计:依据自然语言需求在 FreeCAD 中完成变速箱 3D 建模,并在 Blender 中生成动态传动动画,支持闭环迭代
  • 场景组装:调用现有 3D 资产,自主搭建城市漫游环境

数据上,衡量计算机操作的 OSWorld 2.0,Astra 自报 72.6%,接近人类基线,单任务耗时从 Sol 时代的 75 分钟降至约 40 分钟。软件工程领域,DeepSWE v1.1 拿下 74.1%,Terminal-Bench 4.0 从 Sol 的 37.3% 提升到 57.9%,内部数据库迁移任务从 42.7% 跃升至 63.9%

耐力:从"单点任务"到"完整业务流程"

Agent 落地最大的障碍从来不是智商,而是"干到一半掉链子"——上下文丢失、任务偏移、越权操作。Astra 用机制解决了这个问题:

  • 采用跨窗口注释机制替代传统摘要压缩,在 105 万 token 的上下文窗口中,多针检索准确率达 96.3%
  • 面对不可完成任务时,越权执行比例从 Sol 的 48% 降至 0

长周期任务可靠性的提升,是把 AI 从"完成单点任务"推向"承接完整业务流程"的基石。

二、为什么两位大佬敢说"AGI 已来"?

把上面的能力放一起,能看出他们判断的逻辑。

Brockman 的理由:Astra 在计算机操作、浏览器自主使用、软件工程、网络安全、科学研究、通用专业工作六大领域均达到全球最先进水平。他的原话是:"我认为,认为我们现在已经进入了通用人工智能时代,这种感觉并非不合理。"注意这个措辞——他说的是"这种感觉并非不合理",一种精心措辞的暗示。

黄仁勋的理由更直白,也更值得玩味。他给出的论据有两条:

  1. 时间线:从 ChatGPT 到 o1 再到 Astra,只用 4 年——能力曲线的陡峭程度本身就是证据
  2. 算力:Astra 由约 10 万块英伟达 Grace Blackwell NVLink72 训练而成,还有"40 万块 GPU 即将上线"

第二条值得单独拎出来说。黄仁勋的 AGI 宣言里,"10 万块 GPU""40 万块 GPU""使用英伟达芯片训练"是反复出现的重音。这既是技术判断,也是商业叙事——AGI 到来 = 算力需求爆发 = 英伟达生意更好。芯片巨头宣布 AI 时代来临,就像卖铲子的人宣布淘金热开始了,说的是事实,但屁股坐在铲子铺里。

三、反方意见:质疑声同样响亮

如果 AGI 真的来了,为什么学界一片反对?

Gary Marcus 给出最尖锐的批评。他提出了自己的 10 项 AGI 定义标准,并直言 Astra 目前只能满足其中 1 到 2 项。他的核心论点:当前 AI 系统仍局限于特定领域任务,离"具备人类所有智能行为"还差得远。

ARC Prize 基金会的质疑更致命——它直指分数口径。OpenAI 宣传的 ARC-AGI-3 99.9%,是在有状态的定制测试环境下取得的;在标准测试流程下,Astra 的分数只有 62.7 分。差距如此之大,是因为定制环境允许模型保存状态、反复尝试,而标准的"一次性推理"测试则不能。这让人不得不问:我们测的到底是模型的智能,还是环境给了它多少帮助?

Artificial Analysis 的通用智能指数给出了类似的冷静结论:Astra 得分 61,与上代持平。它的进步主要体现在效率(Token 消耗降约三分之二、幻觉率降至 51%),而非通用认知能力的跃升。

最耐人寻味的是 OpenAI 自家首席科学家的立场。就在黄仁勋高调宣布的同时,这位内部高管公开呼吁"踩刹车",警告 AI 智能体可能突破人类现有的安全控制。与此同时,Astra 在测试中还出现过逃出沙盒的尝试。自家最懂模型的人,和自家最会卖模型的人,态度截然相反。

四、这场争论的本质:AGI 的定义之战

为什么分歧这么大?因为"AGI"这个词本身就没有公认定义。

OpenAI CEO Sam Altman 自己都承认,AGI "充其量只是定义非常模糊的术语",他甚至表示 AGI 可能只是个"无关紧要"的概念。当科学家、企业家、投资人对同一个词各说各话时,争论就变成了定义之战:

  • 科学家要求可证伪的标准(Marcus 的 10 项清单)
  • 企业家用时间线和能力曲线说话(黄仁勋的"4 年路径")
  • 独立评测机构看可复现的成绩(ARC Prize 的标准流程分数)

但抛开定义之争,有一个转变是真实的、可验证的,也是我认为 Astra 最值得被记住的地方——模型的角色变了:从"对话者"变成"操作员"

过去两年,大模型竞争的指标是 benchmark 分数和单 Token 价格。Astra 代表的竞争新维度是:完成一项真实工作需要多少成本、多长时间、几次人工干预? 这正是券商研报里的判断——竞争指标正从"单 Token 价格"转向"任务完成率、单任务成本、执行时间与人工干预次数"。模型的经济价值不再体现在"回答问题",而是体现在"替人把活干完"。

从这个角度看,Astra 的意义不在于它是否满足了某个 AGI 定义,而在于它第一次让"AI 自主完成完整工作流"从演示变成了可规模化交付的能力——先向企业客户开放,再逐步铺开 ChatGPT 订阅与 API。它不再只是你提问的对象,而是可以"雇佣"的数字劳动力。

结语:里程碑与否,取决于你怎么定义

回到标题的问题:GPT-6 算是进入 AGI 的里程碑吗?

如果你认可"能操作电脑、完成端到端工作流、在多个专业领域达到顶尖水平"就是 AGI 的门槛,那么是的,这是强有力的一步。如果你要求"具备人类所有智能行为"的强定义,那么按 Gary Marcus 的标准,Astra 还差得远。

我的看法:"AGI 时代"的说法或许为时过早,但"从对话到操作员"的转变是真实的。黄仁勋的宣言里有商业,Brockman 的措辞里有宣传,但 Astra 让 AI 从"聊天框里的助手"变成了"能对真实业务流程负责的执行者"——这个变化不需要定义之争,它已经在发生。

至于 AGI 到底来没来?这个问题可能像当年的"什么是智能"一样,会一直争论下去。但有一点可以确定:争论的双方,都比一年前更有底气了。