小白从 0 到 1实操保姆级教程:本地搭建最强开源千问大模型,实现 token 自由(文章末尾附一键部署提示词)

读完这篇,你将在自己的电脑上拥有一个永久免费、不限量、离线可用、数据不外泄的 AI 助手。全程以 Windows 电脑为例,不需要任何编程基础,照着做就行。

> >

引言:先搞懂我们要干什么

什么是”本地大模型”? 平时你用的 ChatGPT、文心一言,模型跑在别人的服务器上,你联网去”借用”。而”本地大模型”是把 AI 模型的文件下载到你自己的电脑里,让它在你的机器上运行——不联网也能用,问它多少次都不花钱。

什么是”token 自由”? token 是大模型计费的基本单位(大致相当于”字数”)。用云端 API 时,每问一句都在花钱、都在消耗额度。而本地模型跑在你自己电脑上,问多少都免费,这就是”token 自由”。

为什么值得折腾?

  • 免费不限量:一次搭好,之后随便用,不再按次付费。
  • 离线可用:没网、断网、飞机上,照样能用。
  • 隐私安全:所有对话都在你电脑里,不上传任何服务器。
  • 可定制:想换模型、调参数、接进自己的程序,都由你说了算。

提醒: 本地能跑的模型,和 ChatGPT、Claude 这种顶级云端模型是有差距的。普通电脑能跑的模型通常是”中小个头”,它适合日常问答、写作润色、翻译总结、简单代码,但在复杂推理、超长文档、专业难题上,比不过云端旗舰。把它当成一个免费、听话、随叫随到的助手,而不是万能专家,你的体验就会很好。

读完这篇你会得到什么: 一套 “Ollama(发动机)+ Chatbox(聊天界面)” 的完整本地 AI,会下载模型、会配置、会避开新手必踩的坑,还知道怎么日常使用和进阶折腾。

序章 · 让 AI 智能体(Codex / Claude Code)全程带你部署

这篇教程有两种打开方式:手动照做(第 1–9 章一步步点),或者——更省事——把活儿交给 AI 智能体(Codex 或 Claude Code)。它们能直接在你电脑上运行命令、装软件、改配置,你只需在旁边看它汇报、在它询问时点头确认。本章先讲清”用智能体部署”是怎么回事、整体流程、以及过程中你会遇到什么;后面每章也会标出 🤖 交给智能体 的小提示,告诉你这一步它会怎么替你做。只想躺平的,直接翻到文末第 10 章,复制那段一键提示词发给它即可。

什么是 Codex / Claude Code

它们是运行在终端里的 AI 编程/运维助手:你用大白话下指令,它自己敲命令、装东西、查问题,并实时把结果讲给你听。对本文来说,它就是那个”替你操作电脑的人”。

用智能体部署的整体流程(5 步)

  1. 先装好 Codex 或 Claude Code(命令行工具,按官网引导安装并登录即可)。
  2. 把第 10 章那段一键提示词整段复制发给它。
  3. 它先检测你的硬件(内存 / 显存 / 硬盘),据此推荐一个模型,你确认或改。
  4. 它自动装 Ollama、拉模型、修上下文、装 Chatbox,每步汇报,关键动作前先问你。
  5. 它做一次对话验证,再告诉你怎么在 Chatbox 里用起来。

部署过程中你会遇到的情况(心里有数)

  • 它会停下来问你:下载几个 G、安装软件、改环境变量之前,它会先说明再等你确认——看明白后同意即可。
  • 让你确认选型:它按显存推荐型号(如 6G 显存 → 7B),你可以同意,也可以让它换。
  • 命令找不到(PATH):装完 Ollama 若提示”不是命令”,它会改用完整路径,或让你重启一下终端 / 电脑。
  • 下载慢或中断:它会自动切到魔搭镜像重试、断点续传,不用从头下。
  • C 盘空间不够:它会提醒你,并在你同意后把模型改存到别的盘。
  • 显存被占满:它可能提醒你先关掉浏览器 / 微信等大软件腾显存。
  • 有些图形界面操作仍需你点两下:比如在 Chatbox 里选模型、调”上下文消息数量”,它会给出明确指引,你照着点即可。
  • 感觉答得慢或变笨:多半是模型偏大、或上下文 / 思考模式设置问题,它会按第 6 章的四个坑逐一帮你排查。

下面第 1–9 章,既是”你自己手动怎么做”的说明,也标注了”交给智能体它会怎么做”。看懂原理再躺平,用得更踏实。

> >

第 1 章 · 开工前:先看看你的电脑够不够格

🤖 交给智能体:这一步它会自动跑命令读出你的内存、硬盘和显存(Windows 上用 nvidia-smi 等),并直接按下面的对照表替你选好模型,你只需确认。

> >

这是全篇最重要的一步。新手最容易犯的错,就是不看配置直接下一个巨大的模型,结果电脑卡成幻灯片。选对模型的前提,是先看懂自己的电脑。

1.1 三个关键部件,各管什么

跑大模型主要看三个硬件,用做饭打个比方:

  • 内存(RAM):相当于”料理台”。模型运行时要摊开在这里,台子越大,能摆下的模型越大。主流是 8G / 16G / 32G。
  • 显卡显存(VRAM):相当于”最快的那块料理台”。模型如果能放进显存,运算速度飞快;放不下就得挪到普通内存里用 CPU 慢慢算。这是决定”快不快”的关键,也是新手最容易忽略的。
  • 硬盘空间:相当于”仓库”。模型文件很大,一个就好几个 G,得有地方存。

一句话:内存决定”能不能跑”,显存决定”跑得快不快”,硬盘决定”能存几个”。

1.2 手把手查看自己的配置

看内存和 CPU:

  1. 按 Ctrl + Shift + Esc 打开”任务管理器”。
  2. 点上方”性能”标签。
  3. 左侧点”内存”,右上角就能看到总容量(比如 16.0 GB);点”CPU”能看到型号。

看显卡和显存:

  1. 同样在”任务管理器 → 性能”里,左侧找有没有”GPU”项。
  2. 点开 GPU,看名字里有没有 NVIDIA / AMD 独立显卡(如 RTX 4050、RTX 3060)。
  3. 看”专用 GPU 内存”那一栏的总量,比如 6.0 GB——这就是你的显存。

小贴士:如果只有”Intel(R) UHD Graphics”这类核显,说明没有独立显卡,显存很小,只能靠 CPU 跑,方案见 1.4。

> >

1.3 【核心】按配置选模型对照表

记住一个换算:模型常见的 “Q4 量化” 版本,体积大约是 “参数量 × 0.6 GB”。比如 14B 模型的 Q4 版约 8~9 GB。下面是保守推荐:

说明:显存装不下没关系,Ollama 会自动把装不下的部分挪到内存用 CPU 算,只是会变慢。所以内存也要够——跑 14B 建议 16G 以上内存,跑更大的建议 32G。

> >

1.4 没有独立显卡怎么办?

完全可以玩,只是慢一些。纯 CPU 跑 1.5B~4B 的小模型,回答速度大概是”一个字一个字往外蹦”,日常问答、翻译还是能用的。内存越大越好(建议 16G 起)。先从小模型试起,觉得慢就别硬上大的。

第 2 章 · 认识两个主角:Ollama 和 Chatbox

我们只用两个免费软件,分工明确:

  • Ollama —— 大模型的”发动机”。 它负责下载模型、把模型跑起来、管理你装的模型。它本身没有好看的界面,主要在后台默默工作,靠命令行操作。你只需要记住两三条命令。
  • Chatbox —— 聊天的”方向盘和仪表盘”。 一个漂亮的桌面软件,长得像微信/ChatGPT 的聊天窗口。它连上后台的 Ollama,你就能像平时聊天一样跟模型对话。

为什么选这套组合? 因为对新手最友好:Ollama 把”下载和运行模型”这件复杂的事简化成一条命令;Chatbox 把”对话”变成点点鼠标。两者配合,既省心又好用,是目前本地大模型最主流的入门方案。

工作关系是这样的:你在 Chatbox 里打字 → Chatbox 把话发给后台的 Ollama → Ollama 让模型思考并回答 → 答案显示回 Chatbox。 全程在你电脑里完成,不经过任何外部服务器。

第 3 章 · 安装发动机:Ollama

🤖 交给智能体:它会先查 Ollama 是否已装,未装则用 winget 或官网包安装并验证 11434 端口;遇到 PATH 找不到命令会自动改用完整路径,C 盘不够会先征得你同意再改存储盘。

> >

3.1 下载与安装

  1. 打开浏览器,访问 Ollama 官网:

    https://ollama.com

  2. 点击首页的 Download,选择 Windows 版本,下载安装包(约几百 MB)。

  3. 双击安装包,一路”下一步”完成安装。装完后,它会在后台自动运行(右下角托盘可能有个小图标),并且设置为开机自启——以后开机它就自动待命。

3.2 验证是否装成功

打开”终端”或”PowerShell”(在开始菜单搜索 PowerShell 即可),输入:

1
ollama --version

如果显示出一个版本号(比如 ollama version 0.x.x),就说明装好了。

踩坑提示: 如果提示 ollama 不是可识别的命令,通常是安装目录没加进系统 PATH。最简单的办法是重启一次电脑;或者找到 Ollama 的安装目录(比如 C:\Users\你的用户名\AppData\Local\Programs\Ollama),用它的完整路径来调用。

> >

你也可以在浏览器地址栏输入 http://127.0.0.1:11434,如果显示 Ollama is running,说明后台服务正常。

3.3 (进阶可选)把模型存到别的盘,别撑爆 C 盘

模型文件很大,Ollama 默认存在 C 盘。如果你 C 盘紧张,想存到 D 盘,可以设置一个环境变量:

  1. 开始菜单搜索”环境变量”,打开”编辑系统环境变量”。
  2. 点”环境变量”,在”用户变量”里”新建”。
  3. 变量名填 OLLAMA_MODELS,变量值填你想存的目录,比如 D:\ollama\models。
  4. 保存后,重启 Ollama(或重启电脑) 生效。之后下载的模型就会存到 D 盘。

第 4 章 · 下载千问模型

🤖 交给智能体:它会用 ollama pull 拉取选定模型并盯进度;下载慢或断了会自动切换到魔搭镜像、断点续传,不用你操心。

> >

4.1 千问(Qwen)是什么,为什么选它

千问(Qwen)是阿里巴巴开源的大模型系列。选它的理由很实在:中文能力强(毕竟国产,最懂中文语境)、开源免费可商用型号齐全(从超小到超大都有,总能找到适合你电脑的那一款)、社区支持好(教程多、下载渠道通畅)。

4.2 看懂型号:三个关键词

在下载前,先看懂模型名字里的门道,比如 qwen2.5:14b 这种写法:

  • 参数量(7B / 14B / 32B):B = Billion(十亿)。数字越大越”聪明”,但也越大、越吃硬件、越慢。这是选型第一要素,要和你第 1 章查的显存对上。
  • 量化(Q4 / Q8):可以理解成”给模型压缩瘦身”。原始模型很大,量化后体积大幅缩小、速度变快,代价是损失一点点精度。Q4_K_M 是最常用的档位,体积和质量平衡得最好,新手首选;Q8 更接近原版但更大更慢。
  • 稠密 vs MoE:普通模型(稠密)每次都要动用全部参数。MoE(混合专家)模型则像”一个大团队里每次只派几个专家干活”——总个头很大很聪明,但每次只激活一小部分,所以在内存够的机器上,MoE 能用大模型的聪明、又比同等大小的稠密模型快。硬件一般但内存大的电脑,可以关注 MoE。

4****.3 结合你的配置,到底下哪个

对照第 1 章的表,给个直接建议:

  • 4~6 GB 显存(最常见的入门笔记本):下 qwen2.5:7b 或 9B 级别的模型,流畅好用。
  • 8~12 GB 显存:可以上 qwen2.5:14b,更聪明。
  • 16 GB 以上显存 / 32G 大内存:可以试 32B 或 MoE 大模型。
  • 没有独显:从 qwen2.5:3b 这类小模型起步。

本文后续以 9B 级别模型(约 6 GB)为例演示,它是 4~6 GB 显存机器的甜点档位。你把命令里的模型名换成自己选的即可。

> >

4.4 一条命令拉取模型

打开 PowerShell,输入(把模型名换成你选的):

1
ollama pull qwen2.5:7b

回车后开始联网下载,会显示进度百分比和速度。模型好几个 G,耐心等它下完。下载虽然联网,但下完之后运行就完全离线免费了

4.5 【避坑】国内下载慢?用魔搭镜像加速

如果从官方源下载很慢或老中断,可以改用国内的魔搭 ModelScope 镜像,速度快很多。魔搭上很多模型可以直接用 Ollama 拉取,格式类似:

1
ollama pull modelscope.cn/Qwen/Qwen2.5-7B-Instruct-GGUF

具体命令以魔搭对应模型页面给出的为准(页面上一般会直接写好 ollama 拉取命令,复制即可)。

4.6 验证:命令行里的第一次对话

下完后,直接在 PowerShell 里跑:

1
ollama run qwen2.5:7b

稍等十几秒(第一次要把模型加载进内存),出现输入提示后,打一句”你好,介绍下你自己”,它就会回答。能对话,就说明模型装好了! 输入 /bye 退出。

第 5 章 · 装上方向盘:Chatbox 连接模型

🤖 交给智能体:Chatbox 的安装它能代劳;但『选模型、填地址』这类界面操作需要你点两下,它会给出明确指引。

> >

命令行能聊,但不好看也不好用。装个 Chatbox,体验立刻变成”图形化聊天软件”。

5.1 下载安装 Chatbox

  • 方法一(推荐):访问官网

    https://chatboxai.app

    ,下载 Windows 版,双击安装。

  • 方法二(会用命令的话):如果你的电脑有 winget,可在 PowerShell 里一条命令装好:

1
winget install Bin-Huang.Chatbox

5.2 连接本地 Ollama

  1. 打开 Chatbox,如果弹出引导,选 “使用自己的 API Key / 本地模型”,不要选官方云服务(那个要花钱)。
  2. 点左下角 设置(齿轮图标)
  3. 在”模型提供方”里选 Ollama API
  4. 关键两项:
  1. 保存。

5.3 发出第一条消息

回到聊天界面,确认顶部选中的是你的本地模型,随便打一句话发出去。第一次会等十几秒加载模型,之后就快了。能正常对话,恭喜你——本地 AI 已经跑起来了!

第 6 章 · 调优避坑

🤖 交给智能体:这四个坑它基本都会自动帮你规避,尤其会主动建好 num_ctx 16384 的加长上下文版本;你只需按它的提示在 Chatbox 里做几处设置。

> >

很多人搭好之后觉得”这模型怎么这么笨、这么难用”,其实八成不是模型的问题,是下面这几个坑没填。这一章最值得细看。

坑一:上下文默认只有 4096,导致”失忆”

现象:多聊几轮,或者贴一段长文,它就开始答非所问、前面说过的全忘了。

原因:模型能”记住”多少内容,由”上下文长度”决定。而 Ollama 默认只给了 4096(很短),哪怕模型本身支持很长。这一项在 Chatbox 界面里改不了,得在 Ollama 端设置。

解决办法:给模型做一个”加大记忆”的版本。步骤:

  1. 新建一个文本文件,命名为 Modelfile(没有后缀名),里面写两行(把模型名换成你的):
1
2
FROM qwen2.5:7b
PARAMETER num_ctx 16384
  1. 在 PowerShell 里,进入这个文件所在目录,运行:
1
ollama create qwen2.5-7b-16k -f Modelfile
  1. 这会生成一个叫 qwen2.5-7b-16k 的新模型,记忆长度提升到 16384。它不重新下载、几乎不占额外空间(和原模型共用文件)。
  2. 回到 Chatbox,刷新模型列表,改用这个新模型即可。

提示:上下文越大越吃内存。16K 对日常足够;要处理超长文档可以设更大(如 32768),前提是内存够。

> >

坑二:思考模式——又聪明又啰嗦

新一代千问(Qwen3 系列)带”思考模式”:回答前会先在心里推演一大段,再给结论。开着它,解题、推理更准;但它非常啰嗦,一道简单题能”想”好几千字,导致回答很慢,甚至在有输出长度限制时”想到一半就没了”,看起来像卡住或变笨。

怎么用

  • 难题、要推理(数学、逻辑、写代码)→ 保持思考开启,答得准。
  • 日常闲聊、简单问答 → 可以关掉思考,秒回。

关于 Chatbox 里那个灰色的”思考控制”开关:如果你发现它点不动、提示”此模型非通过 Qwen API 提供,思维控制已禁用”——这是正常现象,不是故障。那个开关只对接了阿里云端官方 API 的模型,对本地 Ollama 模型无效。好消息是:本地千问思考模式默认就是开着的,你正常提问它就在思考,不用管那个开关。

坑三:显存被其他软件偷偷占满

现象:模型突然变得很慢,或加载失败。

原因:浏览器(尤其是开了很多标签的 Chrome)、微信、各种带界面的软件都会悄悄占用显存。你的显存本来就不大,被它们一分,留给模型的就不够了。

解决办法:跑模型前,关掉不用的浏览器窗口和后台大软件,把显存尽量腾给模型。这一步对小显存的笔记本提速很明显。

坑四:模型选太大,卡成幻灯片

现象:回答一个字要等好几秒,风扇狂转。

原因:模型超出了显存+内存能流畅承载的范围,大部分只能靠 CPU 硬扛。

解决办法降一档。14B 卡就换 7B,7B 还卡就换 3B。宁可用一个流畅的小模型,也别用一个卡顿的大模型——日常体验里,”响应快”比”稍微聪明一点”重要得多。

Chatbox 里几个实用设置

  • 上下文消息数量上限:决定 Chatbox 每次把前面多少条对话发给模型。默认可能偏小,导致它”忘事”。调大一些(比如 20 条以上)能明显改善多轮对话的连贯性。要和坑一的 16K 配合才完整。
  • Temperature(温度):控制回答的”发散程度”。想要严谨稳定(写代码、查资料)就调低(如 0.3);想要有创意(写文案、头脑风暴)就调高(如 0.9)。

第 7 章 · 日常怎么用

7.1 拿手场景

  • 写作与润色:写文案、改邮件、起标题、扩写缩写。
  • 翻译:中英互译、润色译文,效果不错且完全离线。
  • 总结:把长文、会议记录粘进去,让它提炼要点(注意别超过上下文长度)。
  • 写代码:写小脚本、解释报错、给思路,适合日常编程辅助。
  • 问答与陪聊:知识问答、头脑风暴、日常闲聊。

7.2 它能干嘛、不能干嘛(边界)

  • 擅长:语言类任务、常见知识、结构化整理、中等难度的代码。
  • 不擅长:需要最新实时信息(它不联网,知识有截止日期)、极其复杂的专业推理、超长文档的精确处理、需要绝对准确的事实(它可能”一本正经地胡说八道”,重要信息务必自己核实)。

7.3 开机自启与后台常驻

Ollama 安装后默认开机自启、常驻后台,所以你随时打开 Chatbox 就能用,不用每次手动启动。它平时不占多少资源,只有真正对话时才会把模型加载进内存;一段时间不用会自动卸载,释放内存。

7.4 管理你的多个模型

常用命令(在 PowerShell 里):

1
2
3
ollama list          # 查看已安装的所有模型
ollama ps # 查看当前正加载在内存里的模型
ollama rm 模型名 # 删除某个模型,释放硬盘空间

你可以同时装好几个模型,在 Chatbox 里随时切换:小模型用于快速问答,大模型用于难题。

第 8 章 · 进阶拓展

8.1 想更聪明:换 MoE 或更大模型

如果日常觉得模型不够聪明、而你内存较大(32G 起),可以试 MoE 模型(如千问的 A3B 系列)——它”总个头大但每次只用一小部分”,能在普通硬件上兼顾聪明和速度。下载方式和普通模型一样,用 ollama pull 拉取对应型号即可。

8.2 让手机、其他电脑也能用

默认 Ollama 只允许本机访问。如果想让同一个 WiFi 下的手机或其他电脑也连过来用,可以设置环境变量 OLLAMA_HOST 为 0.0.0.0,再重启 Ollama,其他设备就能通过”你的电脑 IP:11434”访问。

安全提醒:这相当于把服务开放到局域网。请只在可信的家庭/办公网络里这么做,公共 WiFi 下不要开放,避免被他人蹭用。

> >

8.3 接入编程:OpenAI 兼容接口

Ollama 自带一个和 OpenAI 完全兼容的接口,这意味着你现有的、为 ChatGPT 写的代码,几乎只改一个地址就能白嫖本地模型。地址是 http://127.0.0.1:11434/v1。Python 示例:

1
2
3
4
5
6
7
from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:11434/v1", api_key="ollama") # key 随便填
resp = client.chat.completions.create(
model="qwen2.5:7b",
messages=[{"role": "user", "content": "你好,用一句话介绍你自己"}],
)
print(resp.choices[0].message.content)

第 9 章 · 常见问题 FAQ

Q:下载到一半断了怎么办?A:重新运行同一条 ollama pull 命令即可,它会接着没下完的部分继续,不用从头来。

**Q:模型占内存太多,怎么让它释放?**A:一段时间不对话,Ollama 会自动把模型从内存卸载。想立刻释放,可以在 ollama ps 看到它后,等待其自动过期,或直接重启 Ollama。

**Q:回答很慢,是正常的吗?**A:如果模型比显存大,慢是正常的(在用 CPU 硬扛)。想快就:关掉占显存的软件、换小一档的模型、关掉思考模式。参考第 6 章。

**Q:它答错了 / 一本正经地胡说八道怎么办?**A:这是所有大模型(尤其是本地小模型)的通病,叫”幻觉”。重要信息一定要自己核实。可以通过把问题问得更具体、提供更多背景、降低 temperature 来减少胡说。

**Q:怎么彻底卸载?**A:用 ollama rm 模型名 删掉模型释放硬盘;在 Windows”设置 → 应用”里卸载 Ollama 和 Chatbox 程序本身;如果设过 OLLAMA_MODELS 等环境变量,一并删除。

**Q:这一套到底花不花钱?**A:软件全免费、模型全免费、运行不花钱。唯一成本是下载时的流量和运行时的电费。真正的 token 自由。

结语:你已经实现 token 自由

回头看,你已经完成了一件一个月前可能觉得”很硬核”的事:在自己的电脑上,从零跑起了一个大模型。

现在你拥有的,是一个免费、不限量、离线、隐私安全的 AI 助手。它也许不是最聪明的那个,但它 24 小时待命、问多少都不要钱、聊什么都不外传。把它用在日常的写作、翻译、总结、问答里,你会发现”够用”其实已经很香。

想更进一步,就回到第 8 章折腾更大的模型、接进自己的程序。祝你玩得开心——欢迎来到 token 自由的世界。

第 10 章 · 解放双手:一句提示词,让 AI 全自动部署

前面九章是”手把手”版。如果你懒得一步步操作,可以把下面这段完整提示词整段复制,粘贴给 CodexClaude Code,它会自动检测你的电脑配置、按显存选型、安装 Ollama 与模型、修复上下文、装好 Chatbox 并验证——全程你只需在它询问时确认即可,真正解放双手。

使用方法:打开 Codex / Claude Code,把下面代码框里的整段文字发给它。

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
你是一名运维助手。请在我这台电脑上全自动完成"本地部署千问(Qwen)开源大模型"的全过程,让我不必一步步手动操作。目标:装好 Ollama(运行引擎) + 一个适配我硬件的 Qwen 模型 + Chatbox(图形界面),最终我能在 Chatbox 里流畅对话。请每完成一步简要汇报结果;在联网下载数 GB 文件、安装软件、修改环境变量之前,先说明将做什么并等我确认;绝不删除或覆盖我已有的模型和数据。请依次完成以下各步,任一步失败都要给出原因和修复建议,同一处问题重试不超过两次:

第1步 环境与硬件检测:判断操作系统(Windows/macOS/Linux);检测内存总量和硬盘剩余空间;检测是否有 NVIDIA/AMD 独立显卡及其显存大小(Windows 用 nvidia-smi,拿不到就用系统信息;无独显按纯 CPU 处理)。把检测结果汇报给我。

第2步 按显存选模型(除非我另行指定):无独显→qwen2.5:3b;4~6GB 显存→qwen2.5:7b;8~12GB 显存→qwen2.5:14b;16GB 以上显存或大内存→可选 32B 或 MoE(如 A3B)。量化一律优先 Q4_K_M。先把你选定的型号和理由告诉我。

第3步 安装并验证 Ollama:先检查是否已安装(运行 ollama --version,或查进程/端口 11434),已装则跳过;未装则安装(Windows 优先 winget install Ollama,否则从 ollama.com 下载安装包)。验证 ollama --version 正常、且访问 http://127.0.0.1:11434 返回 Ollama is running。若 ollama 命令找不到,改用完整安装路径调用,并提示我可能需要重启终端或电脑让 PATH 生效。若 C 盘剩余空间不足(小于模型体积的 1.5 倍),提示我,并在我同意后新建环境变量 OLLAMA_MODELS 指向空间充足的盘(如 D:\ollama\models)再重启 Ollama。

第4步 下载模型:用 ollama pull 拉取第2步选定的模型并显示进度。如果下载很慢或中断,改用魔搭 ModelScope 镜像(形如 ollama pull modelscope.cn/Qwen/Qwen2.5-7B-Instruct-GGUF)重试;中断就重跑同一命令续传,不要从头开始。

第5步 修复上下文长度(重要):Ollama 默认上下文只有 4096,会导致多轮对话"失忆"。请创建一个加大上下文的版本——写一个名为 Modelfile 的文件,内容两行:FROM <所选模型> 与 PARAMETER num_ctx 16384,然后运行 ollama create <所选模型>-16k -f Modelfile 生成新模型(与原模型共用权重、几乎不额外占空间)。内存充足时可用 32768。

第6步 安装 Chatbox 并给出连接方法:检查是否已装 Chatbox,未装则安装(Windows 优先 winget install Bin-Huang.Chatbox,否则从 chatboxai.app 下载)。然后告诉我如何在 Chatbox 里连接:模型提供方选 Ollama API,API 地址填 http://127.0.0.1:11434,模型选第5步生成的 <所选模型>-16k。提醒我把 Chatbox 的"上下文消息数量上限"调大(不少于20)以配合 16K 上下文。并说明思考模式:新一代千问默认开启思考,Chatbox 里灰色不可点的"思维控制"开关对本地 Ollama 模型无效,属正常现象;日常想快可关思考,难题保持开启。

第7步 验证:用命令行 ollama run,或 Ollama 的 OpenAI 兼容接口 http://127.0.0.1:11434/v1,对 <所选模型>-16k 发一句测试(如"用一句话介绍你自己"),确认能正常回复,并把回复内容与加载耗时/生成速度告诉我。

第8步 收尾与提醒:告诉我最终可用的模型名、如何在 Chatbox 打开使用、以及常用管理命令(ollama list 查看已装模型、ollama ps 查看已加载、ollama rm 删除)。提醒我:跑模型前关掉占显存的浏览器/微信等大软件可提速;若明显卡顿说明模型偏大,建议降一档(14B→7B→3B)。强调全程本地运行、免费离线,不要把我的任何数据发往外部服务器。

几点说明

  • 涉及下载几个 G、安装软件、改环境变量时,它都会先问你再动手,放心用。
  • 如果你已经想好用哪个模型或知道自己显卡,可在提示词末尾补一句”直接用 qwen2.5:7b”来覆盖它的自动选型。
  • 这段提示词以 Windows 为主、同时兼容 macOS/Linux,具体命令由 AI 按你的系统自动调整。
  • 全程本地、免费、离线,数据不外发——和手动版完全一样,只是把九章的操作交给 AI 一次跑完