关注AI圈动态的朋友们都知道,美东时间 9 月 3 日,OpenAI 发布了 GPT-6 Astra。

GPT-6 Astra 暂时没有向用户全量开放,而是采用了灰度测试的方式。而小灰十分幸运,被官方灰度到了。

那么,GPT-6 Astra到底有多强?使用起来是怎么样的体验?今天小灰就用一篇测评来给大家讲清楚。

GPT-6 Astra 有哪些更新?

在分享我的测评之前,小灰先给大家科普一下,GPT-6 Astra的关键更新有哪些。

官方把 GPT-6 Astra 定位成处理复杂端到端工作的模型,覆盖推理、研究、编码、电脑操作和文档创建,也支持更长的上下文。

但这些能力到底和普通人有什么关系,不能只看参数和评测图。

真正有意思的地方是:你给它一个不够完整的想法,它能不能继续往下做;第一次结果不够好时,它能不能自己发现问题;面对金钱、人情这类带有外部干扰的现实问题时,会不会强行输出绝对化结论。

下面是官方评测数据:

这次我也拿到了 GPT-6 的灰度测试资格,先拿之前的孙宇晨的热度问题试了一下。它没有直接替我做决定,而是先把金额比例、用途、风险和手续拆开来看。

最后它给出的建议是:条件满足,可以谈;只靠感情和口头承诺,不要直接转账。

接下来才是这次真正要测的任务:只给它一句话,看它能不能做出一个真的小游戏。

测评第一步:6 分钟先把功能跑起来

我给它的第一条提示词: 请帮我设计一款小游戏,叫做月面维修费,我们需要模拟月球表面,情形类似《独行月球》电影的背景,独自被留下的宇航员,按照关卡设计,月球上可能遇到各种生存问题。我们需要有移动、收集、计时、电量等等能够生存下去必须的要素。

第一版,GPT-6 Astra 用了 6 分 56 秒,给出了游戏设计案和浏览器原型。它先把游戏的基本骨架搭了起来,至少没有停在“我可以帮你设计一个游戏”这一步。

首版已经包含移动、冲刺、电量消耗、氧气、倒计时、资源收集、4 个月面维修节点、维修进度和成功 / 失败结局。对一个只有文字要求的任务来说,这个速度已经很快了。

测评第二步:验证原型功能

我把它给出的本地页面打开后,基本玩法已经能看出来:左边是月面活动区域,右边是维修账单和故障节点,顶部有救援倒计时、氧气和电量。

第一版的功能原型已经完成,但素材和动效还没有跟上。月面场景、角色反馈、资源碰撞和维修完成时的反馈,都还比较粗。

测评第三步:再让 Image Gen 把美术补上

第一版的功能已经能跑,但画面还是原型级别。我接着让 GPT-6 Astra 调用 Image Gen,生成能真正放回游戏里的素材:

一张俯视地图,用来统一区域、光影和路线;一张角色与维修道具设定板,用来统一角色、资源和维修节点的造型。

后面我又让它补了角色素材图,先把游戏需要的基础资产库搭起来。

测评第四步:对着实际运行画面做一次视觉统一

有了素材还不够,真正放回游戏以后,问题会变得更具体。我把当前运行画面重新交给 GPT-6 Astra,让它按画面继续调整:

左侧信息框保留深蓝、青色和橙色的视觉语言,右下角小车、上方侧边天线和中央陨石坑重新做一轮,再接回 Canvas 里检查比例和层次。

经过几轮对话后,第一关的界面优化成这个样子:

该游戏Demo的完整视频演示如下:

GPT-6 Astra 的整体测评体验

今天整体使用下来,我比较明显的感受是:Astra 在思考能力上相比 5.6 Sol 有了一个比较明显的提升,同时响应和执行速度也快了很多。

以前使用 Sol 做一些相对复杂的任务时,经常会出现任务开始执行之后,需要等待比较长时间才能看到阶段性结果的情况。但 Astra 给我的体验明显更“连贯”,基本不会有那种任务丢进去之后很久没有反馈的感觉。

这次让我感受比较深的一点,是它在第一次交互时,几乎就直接给出了一个可以运行的原型。

我一开始提供的其实只是一个比较模糊的需求,并没有详细描述具体应该怎么实现。但 Astra 能够自己把需求进一步拆解,从核心玩法、关卡设计、交互方式到整体产品结构进行补全,并且在大约 6 分钟内给出了一个已经可以实际体验的版本。

这一点相比之前使用 Sol 时的体验提升还是比较明显的。

过去用 Sol 做类似项目时,为了让模型能够更加全面地考虑产品设计、交互、视觉等问题,我通常还需要搭配比较多的 Skill,对不同环节分别进行补充和约束。

但这次使用 Astra 时,模型自身对于整个项目的理解和补全能力已经比较强了。尤其到了后面的视觉和美术优化阶段,基本配合 Image 相关能力,就可以继续完成素材设计、动态帧、视觉元素等内容,并逐步形成一套比较完整的游戏素材库。

整个过程给我的感觉是,模型开始从以前的“帮你完成某一个任务”,逐渐变成了能够围绕一个相对模糊的目标,自主把产品往前推进。

当然,目前使用过程中也遇到了一个比较明显的问题:

推测目前 Astra 的模型容量和算力资源可能还处在逐步扩充的阶段,所以偶尔会遇到无法调用的情况。希望后续 OpenAI 扩充资源之后,这方面的体验能够得到进一步改善。

总体来说,这次 Astra 给我的第一印象还是比较惊喜的。

尤其是在复杂任务的理解能力、第一次输出的完成度,以及整体执行速度这几个方面,相比我之前使用 Sol 的体验都有比较明显的提升。

接下来我也会继续用 Astra 完善这次的小游戏,看看在项目不断迭代、需求越来越复杂之后,它的稳定性和上限到底能够达到什么程度。

好了,关于GPT-6 Astra的测评,我们就分享到这里。

正在阅读这篇文章的朋友,你有被GPT-6 Astra模型灰度到吗?你对这款新模型怎么看?欢迎在留言区聊一聊。