WorkBuddy最近版本更新非常频繁,并且也新增了不少功能。比如有Buddy应用,还有外观上新,这招延续了腾讯的传统,现在WorkBuddy官方也支持更换主题皮肤了。

目前最新版本应该是5.5.3,老马的Mac版本是这样的。如果你还没有更新,请务必更新。因为接下来要介绍的是WorkBuddy最主要的功能更新,那就是本地大模型的部署。

相比豆包工作、千问办公来说,WorkBuddy算是秉承了老大哥CodeBuddy的优良传统。它的模型是支持自定义接入第三方API的,而不是内置锁死的,不开放的。

也就是说,你不想用WorkBuddy内置的模型,因为你的积分可能不够用。或者不想用腾讯云的token plan的订阅计划,那你完全可以接入任意一家大模型厂商提供的API。

甚至于有些用中转站的小伙伴,还可以接入GPT、Grok之类的模型。但令老马没想到的是,WorkBuddy居然还嫌不够开放,进一步支持你本地模型的部署和使用。

以前你要自己去本地部署大模型,得学会Ollama或者llama.cpp等推理引擎的安装与模型部署。现在不需要了,你只要在WorkBuddy里面下载推荐的模型文件,连同推理引擎打包一起给你装好。

你只需要打开开关,在WorkBuddy新建任务的窗口右下角,选择模型时选中本地模型的名称,即可利用你本地电脑硬件资源来推理部署好的大模型,实现零积分,零token消耗,玩转WorkBuddy。

听起来是不是很美好,再也不用为大模型的token或者积分消耗掏一分钱了。但这是有前提的,前提是你的电脑硬件配置要足够,不足够的情况也是白搭。

你首先得有一个心理准备,我们作为普通消费者,所使用的电脑设备都叫消费级设备,消费级设备是没法说硬件性能达到非常高的水平的。因此部署的大模型,只能是小参数量尺寸的量化模型。

在断网的环境下,或者自己实在没有积分了,没有token额度了,用这种本地部署的小模型来应应急,处理点小任务小问题是可以的。

你非要跟你接入的大模型厂商那种云端的满血大模型对比性能,对比智商和能力,那纯属自找没趣。

其次,不排除有些懂电脑硬件的玩家,他们会通过DIY的方式,还有大撒币的方式,组装出性能很好的设备。用来跑大模型,无论是部署的模型参数量大小,还是吐字的速度都很不错。

这些人我们称之为极客,老钱。你现在去打听打听,网上电商平台搜搜,内存跟显卡都贵成啥样了,对吧。所以别动不动就跟别人对比,甚至对标,人比人气死人的。

前提提要废话说完了,主要是怕有些小伙伴认知不到位。等下自己用WorkBuddy本地部署完模型,跑起来很慢很卡,就开始BB各种找人问了。这种基础的知识科普,还是得讲一遍。

下面老马不使用Mac系统,而是改用Windows 11系统,来实际给大家演示一下,如何用WorkBuddy成功部署本地大模型进行使用。

首先说一下老马的Windows电脑的硬件配置,内存是DDR5 64G的,显卡是RTX4070 8G显存,CPU是14代I9,硬件参数是重点,等下会提到一些细节。

有关于什么样的电脑硬件能跑什么样的大模型,这种性能的测试文章老马之前也写过了,有兴趣的小伙伴可以去搜搜老文章。或者最简单的,你把你的电脑配置信息发给WorkBuddy,再把模型完整的名称发过去。

然后问WorkBuddy,这样版本和参数量的量化模型,我的电脑能不能跑得动,你就会得到一份详细的解答。甚至你都不懂自己的电脑什么硬件配置,你都可以直接让WorkBuddy自行去帮你检测出来。

01 · DEPLOY LOCALLY

再啰嗦就没完没了,我们直接进入实操。

打开已经更新到最新版本的WorkBuddy,点击左下角你的用户名,进入设置页面:

在设置页面左侧的菜单中,找到模型点击,进入模型设置页面,你就能看到本地模型的信息:

这里会显示内存至少需要32G以上,显存最少需要16G以上。目前来说,大部分人电脑内存都能满足,比较难满足的是显存,毕竟被系统占用掉一部分后,哪怕你本来是16G显存的显卡,也变得不足够了。

但也没关系,像老马是内存是64G的,内存明显够得多余了。不过显存才8G,那剩下不够的显存,在实际模型本地推理的时候,就会去拿内存来凑一凑,也能跑起来。

还有一种情况就是,内存跟显存都不够,但你的CPU足够强悍,比如像老马是14代i9的CPU。那实际模型本地推理的时候,就不会去用到显存GPU推理的方式,而是会改成CPU推理的方式。

缺点就是CPU推理肯定速度比GPU的慢,只能说能用,能跑起来。这点大家了解一下即可,下面你就在模型名后面的状态那里,有一个下载按钮,点击下载模型文件和推理引擎就行了。

不需要去点那个推理引擎:CUDA-13旁边的下载按钮,点状态下面的下载按钮就行了。整个下载的文件大小大概是接近16GB,所以得保证你的硬盘空间足够,下载的速度还是蛮快的:

下载完毕之后,你就会发现,模型的状态那里已经显示开关是开启的状态。而刚才CUDA-13那里的下载按钮也消失了,显示正常。

上面还会显示一行自定义的模型名称,WorkBuddy这里默认推荐的是Qwen3.6 35B 激活参数3B的MoE模型。自定义模型名称右边会有一个小铅笔的按钮:

点击进去就可以对模型进行编辑,包括调整上下文窗口大小等设置。这里我们一般不需要去改动它,因为很多小伙伴其实也不知道怎么改,等下我们让WorkBuddy来帮我们修改:

小铅笔的右边是一个测试链接的按钮,刚才我们已经下载好模型文件及推理引擎了。接下来就可以点击这个按钮测试一下链接,不出意外的,显示模型连接失败:

这是因为WorkBuddy虽然帮我们把模型文件和推理引擎都下载完了,但是没有直接去启动本地推理引擎的服务。你服务没起来,那肯定连接不上了。

所以我们在WorkBuddy上新建一个任务,模型先选择GLM-5.3-Flash,输入以下提示词:

我在workbuddy模型设置里面,已经下载了Qwen3.6 35B-A3B(pruned v2)的模型文件及推理引擎,开关也是开启了,但是测试连接的时候,却提示连接失败,你帮我检查一下,是不是llama.cpp之类的本地推理服务没有成功启动

这段提示词的作用就是让WorkBuddy帮我们去检查一下,本地模型的推理引擎服务是否已经正常启动,如图所示果然是没有启动:

那没有启动的话,WorkBuddy就会帮我们去启动起来,如图所示:

启动成功后,我们再回到设置里面,找到模型,点击刚才的测试连接,你就会发现连接成功了,代表模型已经可以正常使用了:

你就可以回到WorkBuddy,再新建一个任务,在右下角的选择模型时,就点选刚才部署好本地大模型,名称是Qwen3.6 35B-АЗВ (pruned v2)开头的:

到这里,你就可以给WorkBuddy发送任务消息。WorkBuddy收到后,就会调用推理服务已经处于正常启动状态的本地大模型,推理后回复你了。

02 · TROUBLESHOOTING

然后这就算完了么?

老马为了保证万无一失,就关掉了WorkBuddy,重启了一下。结果发现,刚才还能正常测试连接成功的本地大模型,又连接失败了。

怎么回事?肯定是重启WorkBuddy客户端之后,本地模型推理服务没跟着重启,又被关掉了。遇事不要慌,交给WorkBuddy,于是老马又跟WorkBuddy讲了一下情况,如图:

你看WorkBuddy经过一番排查,确实是推理服务又没开启。重新进行了开启,还做了一套长效的方案。另外大家注意上面截图的最后一段,老马的显卡驱动是有问题的,所以接下来的模型推理走的是CPU推理的方式。

那这个问题修复了,下面可以好好用本地大模型了吧。结果老马新建了个任务,给WorkBuddy随便发送了一条你是什么模型的消息,又报错了:

这次报错的代码是400,400是啥情况,老马也看不懂啊。遇事不要慌,交给WorkBuddy,于是老马截图了报错的信息,让WorkBuddy去查明一下原因:

原因找到了,这是因为老马的WorkBuddy本身就装了很多的Skill技能和MCP服务,这些技能工具的信息都会跟着系统提示词,一起丢给WorkBuddy去处理,每次塞进去的内容高达3.7万tokens。

这就导致刚才部署的本地大模型上下文窗口爆了,塞不进去了,上下文窗口默认才设置8192tokens,小得可怜,所以直接就报400错误了。

因此后面WorkBuddy把本地大模型默认的上下文窗口改成了64K,也就是约等于6.5万tokens,这下够塞进去了。重新发送了同样的询问模型消息,大概等待了1分多钟,收到了回复:

∞ · POSTSCRIPT

至此,WorkBuddy本地部署大模型才算是完美搞定。不过刚才的400报错也提醒了老马,得跟小伙伴们说一下,不经常使用的Skill技能或者MCP服务,得定时清理删除掉,还有就是记忆文件之类的。

堆积得越多,每次对话都会去塞给大模型处理,这样很耗费token的。当然你如果不会自己处理,那就交给WorkBuddy帮你清理。至于刚才部署好的本地大模型,你就当个玩具自己乐呵一下玩玩就得了。