Chatgpt6: AGI 是啥,跟你有啥关系?

都在聊 AGI,啥是 AGI 你知道吗?你今天有没有问豆包,AGI 是个啥?

你跟豆包说,给我做个周报,它很快回了你一段话,这个叫 agi 吗?

你让 codex 给你写个网页,它很快给你写出来 localhost:3000,这个是 agi 吗?

那么,AGI 是什么?

简单理解:你给它一个目标,它会去翻材料、套模板、改文件、查网络,直接给你一份可以使用的东西,不需要你指挥就完成了你的需求。

一、 先把概念讲清楚

第 1 章 先把 Chatbot、Agent、AGI 和 ASI 分清

AGI 是一种能在许多领域理解问题、学习新规则、完成任务,还能把已有能力迁移到陌生任务上的人工智能。

这里最重要的词是「通用」。

会写文章、会做图、会下围棋,都只能说明它在某项任务上很强,换一份任务还能快速上手,才接近 AGI 讨论的范围。

下面四个名词经常一起出现,但它们不是同一件事。

Agent 解决「怎么动手」,AGI 关注「能在多少种新任务上理解并做好」。

第 2 章 AGI 离真正的交付有多远?

模型发布时最喜欢拿榜单说事,数学 98,代码排名第一,推理成绩又刷新了。

跑分测的是一道题能不能答对。工作里麻烦的多,一件事往往牵着好几个文件,还会有人临时改需求。

假设明早 9 点,你要给客户做项目汇报,手里有四份材料。

  • 公司 PPT 模板
  • 两个小时的会议记录
  • 一张销售数据表
  • 客户刚发来的补充邮件

你的要求也很明确,做一份 8 页汇报,把项目进展、销售变化、风险和下周计划讲清楚。

如果交给 Chatbot

它可能会给你列一份漂亮的大纲,再提醒你「注意数据准确」。

看着没毛病对吧,可 PPT 还是空的。

如果换成 Agent

它可以读材料、做图表、生成 PPT。

问题也会跟着冒出来。它可能套错模板,漏掉客户邮件里的新要求,或者把退款订单也算进销售额。

文件虽然做出来了,你仍然不敢直接拿去开会。

再往 AGI 方向走

系统可以把这串事情接起来。

它先读完四份材料,发现会议记录和销售表的数字对不上,于是停下来问你。

口径确认后,它更新图表、套用公司模板,再把每页结论写清楚,交到你手里的,是一份能拿去汇报的材料。

第 3 章 Agent 走到哪了?AGI 从哪开始

Chatbot 的工作很简单。你给一句话,它回一段话。

解释概念、改句子、列提纲都很好用,整件事交给它就容易卡住。

Agent 通常多了三样东西。

  • 脑子,听懂目标,也会拆步骤
  • 工具箱,可以读写文件、打开软件、上网查资料、运行命令
  • 判断力,知道下一步做什么,卡住后怎么换路,做完后还要检查什么

有了这三样,它开始能连续干活。

不过,Agent 的能力上限仍然由底层模型、工具、记忆和流程共同决定。

举个极端例子。

一个报销 Agent 可以把发票识别、金额核对和表单填写做得很熟。你突然让它分析合同风险,它可能完全接不住。

这个 Agent 很好用,通用性依然有限。

AGI 要再往前走几步。

它面对陌生领域时,能先读规则、理解目标、发现缺少的信息。

之前学会的分析方法,可以迁移到新任务里。任务做得很长,它也能记住前面的约束,出错后知道回到哪一步修。

OpenAI 即将发布的 GPT-6 Astra。重点介绍了电脑操作、软件工程、研究、文档制作和复杂多步骤工作,也强调了中途追加要求和调整方向的能力。

这些提升说明 Agent 能力又往前走了一截。至于是否已经达到 AGI,还需要看最终能交付的产物来定。

第 4 章 为什么 AGI 这个词突然火了

以前发新模型,厂商爱讲推理、考试分数和幻觉率。

普通人看完,留下的印象往往只有一件事,99 分比 98 分厉害。

现在的演示更直接。AI 打开浏览器、修改表格、写代码、做演示文稿。大家一下有了代入感,开始担心自己的工作会不会被接走。

AGI 这个词也因此从实验室跑进了办公室。

问题在于,AGI 没有统一的评价标准。

  • 有人看考试分数
  • 有人看能不能独立做科研
  • 有人更关心它能否稳定接住大部分定制化需求

落到每个人自己身上,更实用的做法是把日常工作交给它,观察三个问题。

  1. 哪里能省时间
  2. 哪里仍然需要人盯着
  3. 最后交付的结果如何

第二部分 怎么判断,怎么测试

第 5 章 用五个维度判断 AI 离 AGI 有多远

\1. 能力广度

它能处理多少类工作?

写作、代码、数据分析、研究、视觉理解、软件操作,覆盖的领域越多,通用性越强。不过,项目数量多还不够,每一项都得达到能用的水平。

\2. 迁移能力

换到陌生任务后,它要不要你从第一步教起?

比如刚做完销售汇报,接着给它一份从没见过的售后规则。它能否先读懂规则,再把分析、归类和检查的方法迁移过去。这个能力比背过多少答案更能说明问题。

\3. 长任务执行

它能不能把一件需要几十步的工作做到底?

现实里的任务会遇到缺文件、网页报错、格式冲突和需求变更。它得记住目标,卡住后换办法,中途被打断也能继续。只完成其中两三步,仍然需要人频繁接管。

\4. 可靠性和自我修正

同一个任务做十次,结果能不能保持稳定?

发现数字冲突时,它会不会主动核对。你指出错误后,它能不能找到受影响的图表、正文和结论,一起修改。一次漂亮演示很吸睛,连续稳定交付才有工作价值。

\5. 边界感

它知不知道什么时候该停?

材料不够就问,结论拿不准就标出来。涉及付款、删除、对外发送和生产环境修改时,把最后一步留给人。能力越强,边界感越重要。

第 6 章 几个可用来测试的任务

任务 A 看它能不能把概念讲明白

把这段话直接发给它。

text

1
2
3
4
5
我要给平时不关注 AI 的人讲 AGI。
用大白话解释 Chatbot、Agent、AGI 和 ASI。
每个词配一个生活里的例子。
不要引用论文和评测分数。
最后压成 5 句话,我要发到朋友圈。

怎么看结果

找一个平时不关注 AI 的朋友或家人看看。看对方读完是否能直接看懂。

任务 B 按现成模板交一次活

找一份你本来就要做的东西。周报、方案、课程大纲、客户表都可以。

text

1
2
3
4
这是模板,后面是原始材料。
按模板整理完成,保留原来的结构,不要补充材料里没有的信息。
先列出你的处理步骤,我确认后再修改文件。
做完后检查格式、数字和遗漏,并告诉我哪些地方需要人工确认。

怎么看结果

看产物是否只用改一两处就能交,不用推倒重来。

任务 C 换一个陌生领域测试迁移

前面做的是办公任务,这次故意换个方向。你可以准备一份售后规则、几条客户投诉和现有回复模板,然后这样说。

text

1
2
3
4
5
下面是售后规则、6 条客户投诉和现有回复模板。
先读懂规则,把投诉分类,并指出材料里互相冲突或缺失的地方。
我确认后,再整理一份处理流程、异常情况清单和回复草稿。
不要补写规则里没有的政策。
最后说明你用了哪些规则,还有哪些地方需要人工判断。

怎么看结果

这里看的不是客服文案写得多漂亮。你要观察它能不能读懂新规则,把前面学会的分析和检查方法带到新任务里。

同类任务多跑几次,再换领域复测。结果稳定,它就确实能帮你干活了。

第三部分 普通人能做什么

第 7 章 可以从哪些方向开始

大家更想知道 GPT-6 会改掉哪部分工作,自己今天又能拿它做什么。

你能把概念讲明白,可以做科普、课程和企业培训。

再往前一步,把模型接进真实工作流,帮企业整理模板、知识库、权限和验收规则,需求会更具体,交付周期也更长。

做落地和 FDE 的人会遇到一堆实际问题。

  • 权限由谁管
  • 知识库谁来维护
  • 怎样算验收合格
  • 出错谁负责
  • 哪一步必须人工确认

这些事都绕不过去。

模型越强,流程、材料和执行护栏越值钱。

企业买到模型,只是拿到了发动机。能不能跑起来,还要看数据、流程和人怎么配合。

本地模型和硬件也有机会。

云端模型负责能力上限,本地环境可以放知识库、常用工作流和不能离开公司的数据。

比如昨晚大模型都挂了,你手里的工作还能继续。

写在最后

判断 AI 走到了哪一步,有没有达到 AGI 的水平,不要只看榜单,自己测试。

看它能做多少种工作,长任务会不会跑偏,出错能不能修复,遇到风险知不知道停。

不用刻意追新名词。豆包对话如果能搞定你的工作,那么它就是你的 AGI。