昨天凌晨3 点半,OpenAI 发布了 GPT-6 Astra,说”欢迎来到 AGI 时代” 我刚好在熬夜,恰好看到了

可惜tibo说不能体验,还要过几天才能开放给所有人用

今天上午终于看到一些人的实测,看完之后,真的蛮惊叹的

我感觉这个东西确实是能力天花板,而且现在已经跳出之前的玩法了

我看完之后,总结三个比较直观的点:

第一,他是天赋怪,悟性超强,能自己摸索规则

有个测试叫做 ARC-AGI-3,专门测 AI 的”悟性” 什么意思呢?就是给你一堆从来没见过的游戏,没说明书,没规则提示,甚至不告诉你目标是啥

你得自己玩,自己琢磨”碰到红色会死”、”这个方块是可以推的”,然后把学到的规律用到更难的关卡里

半年前最强的 AI 得分:0.51% Claude Opus 5(已经蛮强了):30.2% GPT-6 Astra:99.9% 人类平均分:48%

真很离谱的得分。因为它不是背答案背出来的,是真的在”悟”

就跟游戏的天赋一样,这玩意儿是个天赋怪

第二,它能自己操作电脑,像人一样用鼠标

Astra 具备高级的操作电脑能力,它能看着屏幕,自己点鼠标,自己填表,自己找按钮 比如:

  • 你让它整理一份在线表格,它会自己打开浏览器,找到表格,一个个单元格填进去
  • 你让它测试网站,它会自己点按钮、提交表单,看哪里报错
  • 你让它装个软件,它会自己下载、安装、运行,遇到弹窗还知道该点”确定”还是”取消”

官方甚至演示了 Astra 直接操作 Blender 建模、用 UE5 渲染场景 为什么这能力很强?

其实之前也有computer use 功能,但是准确性和稳定性比较弱

自从他把我的谷歌表格搞得一团糟之后,我就不用它了

这次更新,根据其他人的测试,准确性真的强化很多

不过我觉得还是不能大规模应用,小场景可以,大规模不行

主要是两点:1. 稳定性(很多事情不允许错,比如填表) 2. 烧 token、费钱(小心钱包)

第三, 它会快速”心算”,思考过程越来越不透明

我们知道,有的大模型思考问题(比如 deepseek ),会在思维链里一步步写出来:

先分析用户需求 → 再查找相关数据 → 然后做计算 → 最后给出答案

这样我们能看懂它在想什么

比如,如果它突然冒出”我可以绕过权限”这种危险想法,监控系统ye能直接拦住 不过这次 Astra 不一样,它越来越喜欢心算,直接给答案,不写思考过程

测试显示,Astra 能”心算”解决相当于人类思考 30.9 分钟的数学题,是上一代模型的 10 倍。 听起来很牛逼对不对?

但问题来了:我们看不懂它在想什么了

OpenAI 自己也承认,Astra 的”思维链可监控性显著下降”。它的推理语言变得越来越压缩,出现了一些人类很难理解的短语和省略表达

这就很有问题了:一个比我们聪明得多的 AI,我们还能理解它吗?

如果它做了坏事,怎么办?

这就需要全世界的 AI 安全部门,共同出力,想办法解决问题

🤔 所以,AGI 真的来了吗?

OpenAI 的总裁说:”未来人们可能会回头看,把这个时间、这个模型,视为 AGI 到来的节点。” 我的感觉是:AGI 快来了,但是还有瓶颈 现在有一种说 agi 来了的论调,是因为它已经超过了人类理解的范畴

哪怕它超出一些极限,涌现一些智慧,我们人类也可能察觉不到

我认为 agi 可能还要好几年,但是也快了

因为现在大模型有点陷入一种瓶颈

  1. 无法接触真实世界反馈,没有真正意义上接触真实世界,就很难说拥有更高级的智能
  2. 大模型现在吞噬了海量的资料,但是只是局部的细节的不断强化,结构还是没变,如果不发现新的结构,也很难涌现出真正的智慧

AGI 来了吗?没来

但是现在属于黎明前的黑暗

相信不久之后就能看到 AGI 的阳光,洒过世界大地

我们在等待,在预备

AGI,快来了