AI 的能力越来越容易获得,接下来值得投入的,是新的使用场景,以及能稳定交付的流程
这几个月,我做了自动化项目,也开源了视频制作平台和 AI 技能包。把这些东西逐步做出来以后,我开始认真考虑一个问题:
AI 还会继续变强,而我的时间有限。接下来,什么最值得我花时间?
把自己的实践和行业里已经发生的变化放在一起,我有三个思考后的判断,不一定准确,仅仅分享出来大家交流:
第一个判断,桌面端 AI 的主要工作方式已经逐渐清楚,移动端值得投入更多注意力。
2024 年 10 月,Anthropic 开放了 computer use 测试,让模型尝试看屏幕、移动鼠标、点击和输入文字。它当时仍然笨拙、容易出错,但已经展示了一条明确的路径:AI 可以开始直接操作软件。
沿着这条路径看,桌面端 AI 的工作方式已经有了轮廓。人提出目标,AI 调用工具、操作软件,再由人检查结果。后续仍然有大量可靠性和效率问题需要解决,但对于做应用的人来说,已经可以据此设计产品。
这也是我所说的“格局逐渐清楚”。至于模型能力的上限,我现在没有依据下结论。
与此同时,移动端已经出现了一些值得注意的信号。
2025 年 3 月,Google 开始向部分用户推出 Gemini Live 的摄像头和屏幕共享能力,让用户直接围绕眼前看到的东西与 AI 对话。
Claude Code 的 Remote Control 则展示了另一种连接方式:任务继续在电脑上运行,人可以通过手机接着查看和交互。
这两件事放在一起,让我更看好手机作为 AI 入口的价值。
手机能带来现场的信息,也能让人离开电脑后继续参与工作。复杂任务可以留在电脑上执行,提出需求、查看进度和确认关键动作,则可以在手机上完成。
对我来说,这是一块值得继续探索的空间。重点是找到那些发生在日常生活里、用手机处理更自然的需求。
第二个判断,最值得积累的,是经过验证、能够重复交付的 workflow。核心在于“固化”。
AI 能完成一次任务,和这件事能长期稳定地交给它做,中间还有很多工作。
拿视频制作来说,生成一段文案只是其中一步。脚本怎样进入配音,画面怎样与内容对应,字幕如何检查,最后什么样的成片才算合格,都需要有明确的安排。流程中断后,还要知道已经完成了什么、应该从哪里继续。
我所说的固化,就是把这些要求变成可以执行、检查和复用的规则。
输入是什么,输出要达到什么标准,哪些地方允许灵活处理,哪些地方必须停下来确认,都得说清楚。下一次换一个选题,也能沿着这套流程继续工作。
Anthropic 在 2024 年底发布的工程文章中,也区分了预先定义执行路径的 workflow 和由模型动态决定步骤的 agent。对于任务明确的场景,他们强调了 workflow 的可预测性与一致性。
不过,固化流程这件事,AI 本身也能参与。n8n 的 AI Workflow Builder 已经支持根据自然语言要求创建、修改和调试工作流。
所以,我更看重的是其中的业务经验和验证过程。
一个节点接到另一个节点,并不代表流程已经可用。什么结果值得交付,哪些错误不能接受,遇到例外应该怎样处理,需要结合真实工作不断检验。AI 可以帮助设计和实现,业务方仍然要确定目标,并对采用的流程负责。
我更看好这样的企业应用机会:把一项具体工作做好,形成稳定的交付方式,再逐步扩大使用范围。
模型升级可以让执行变得更快、更便宜,而积累下来的业务规则、验收标准和真实案例,也能继续发挥作用。
第三个判断,记忆和多 Agent 都应该围绕具体问题来做,我不准备把架构本身当成目标。
关于记忆,我现在更关心的是:它究竟帮任务保留了什么?
记住大量历史对话,不等于下一次就能把事情做好。有些信息已经过时,有些只是当时的讨论。对持续工作的 AI 来说,当前目标、已经确认的决定、完成到哪一步,往往更值得留下。
这类记忆有实际用途。2025 年 9 月,Anthropic 推出了基于文件的记忆工具,用来在上下文之外保存信息,并支持跨会话保留项目状态和经验。
因此,我不会笼统地说记忆没有意义。我会先问,它能不能减少重复解释,避免任务做着做着丢掉关键约束。解决不了这些问题,再复杂的记忆设计,也不值得我优先投入。
多 Agent 也是一样。
同一家厂商的模型,可以因为分工、工具和上下文不同而形成有效协作。Anthropic 在 2025 年公布的研究系统中,用 Claude Opus 4 负责统筹、Claude Sonnet 4 执行子任务,在其内部研究评测上优于单 Agent。与此同时,他们也指出,多 Agent 系统消耗很大,其观察到的 token 用量约为普通聊天的十五倍。
这个案例说明,同厂商协作可以有效,但收益必须结合任务和成本来看。
我会先判断一项工作能不能真正拆开。几个 Agent 是否各有明确任务,结果能不能独立检查,并行带来的收益能不能抵消沟通和协调成本。至于要不要跨厂商,也应该放到同一批真实任务里比较。
如果一个 Agent 已经能把事情做好,就先把它做好。只有出现了明确的瓶颈,再增加分工。
接下来,我更愿意先把已经跑通的流程做扎实,再寻找适合手机发起任务、接收结果的场景。记忆和多 Agent,则在它们能解决具体问题的时候加入。
我的时间会优先花在这里:把一件有用的事做成,再让它能够稳定地被别人使用。





