小白从 0 到 1实操保姆级教程:本地搭建最强开源千问大模型
小白从 0 到 1实操保姆级教程:本地搭建最强开源千问大模型,实现 token 自由(文章末尾附一键部署提示词)
读完这篇,你将在自己的电脑上拥有一个永久免费、不限量、离线可用、数据不外泄的 AI 助手。全程以 Windows 电脑为例,不需要任何编程基础,照着做就行。
> >
引言:先搞懂我们要干什么
什么是”本地大模型”? 平时你用的 ChatGPT、文心一言,模型跑在别人的服务器上,你联网去”借用”。而”本地大模型”是把 AI 模型的文件下载到你自己的电脑里,让它在你的机器上运行——不联网也能用,问它多少次都不花钱。
什么是”token 自由”? token 是大模型计费的基本单位(大致相当于”字数”)。用云端 API 时,每问一句都在花钱、都在消耗额度。而本地模型跑在你自己电脑上,问多少都免费,这就是”token 自由”。
为什么值得折腾?
- 免费不限量:一次搭好,之后随便用,不再按次付费。
- 离线可用:没网、断网、飞机上,照样能用。
- 隐私安全:所有对话都在你电脑里,不上传任何服务器。
- 可定制:想换模型、调参数、接进自己的程序,都由你说了算。
提醒: 本地能跑的模型,和 ChatGPT、Claude 这种顶级云端模型是有差距的。普通电脑能跑的模型通常是”中小个头”,它适合日常问答、写作润色、翻译总结、简单代码,但在复杂推理、超长文档、专业难题上,比不过云端旗舰。把它当成一个免费、听话、随叫随到的助手,而不是万能专家,你的体验就会很好。
读完这篇你会得到什么: 一套 “Ollama(发动机)+ Chatbox(聊天界面)” 的完整本地 AI,会下载模型、会配置、会避开新手必踩的坑,还知道怎么日常使用和进阶折腾。
序章 · 让 AI 智能体(Codex / Claude Code)全程带你部署
这篇教程有两种打开方式:手动照做(第 1–9 章一步步点),或者——更省事——把活儿交给 AI 智能体(Codex 或 Claude Code)。它们能直接在你电脑上运行命令、装软件、改配置,你只需在旁边看它汇报、在它询问时点头确认。本章先讲清”用智能体部署”是怎么回事、整体流程、以及过程中你会遇到什么;后面每章也会标出 🤖 交给智能体 的小提示,告诉你这一步它会怎么替你做。只想躺平的,直接翻到文末第 10 章,复制那段一键提示词发给它即可。
什么是 Codex / Claude Code
它们是运行在终端里的 AI 编程/运维助手:你用大白话下指令,它自己敲命令、装东西、查问题,并实时把结果讲给你听。对本文来说,它就是那个”替你操作电脑的人”。
用智能体部署的整体流程(5 步)
- 先装好 Codex 或 Claude Code(命令行工具,按官网引导安装并登录即可)。
- 把第 10 章那段一键提示词整段复制发给它。
- 它先检测你的硬件(内存 / 显存 / 硬盘),据此推荐一个模型,你确认或改。
- 它自动装 Ollama、拉模型、修上下文、装 Chatbox,每步汇报,关键动作前先问你。
- 它做一次对话验证,再告诉你怎么在 Chatbox 里用起来。
部署过程中你会遇到的情况(心里有数)
- 它会停下来问你:下载几个 G、安装软件、改环境变量之前,它会先说明再等你确认——看明白后同意即可。
- 让你确认选型:它按显存推荐型号(如 6G 显存 → 7B),你可以同意,也可以让它换。
- 命令找不到(PATH):装完 Ollama 若提示”不是命令”,它会改用完整路径,或让你重启一下终端 / 电脑。
- 下载慢或中断:它会自动切到魔搭镜像重试、断点续传,不用从头下。
- C 盘空间不够:它会提醒你,并在你同意后把模型改存到别的盘。
- 显存被占满:它可能提醒你先关掉浏览器 / 微信等大软件腾显存。
- 有些图形界面操作仍需你点两下:比如在 Chatbox 里选模型、调”上下文消息数量”,它会给出明确指引,你照着点即可。
- 感觉答得慢或变笨:多半是模型偏大、或上下文 / 思考模式设置问题,它会按第 6 章的四个坑逐一帮你排查。
下面第 1–9 章,既是”你自己手动怎么做”的说明,也标注了”交给智能体它会怎么做”。看懂原理再躺平,用得更踏实。
> >
第 1 章 · 开工前:先看看你的电脑够不够格
🤖 交给智能体:这一步它会自动跑命令读出你的内存、硬盘和显存(Windows 上用 nvidia-smi 等),并直接按下面的对照表替你选好模型,你只需确认。
> >
这是全篇最重要的一步。新手最容易犯的错,就是不看配置直接下一个巨大的模型,结果电脑卡成幻灯片。选对模型的前提,是先看懂自己的电脑。
1.1 三个关键部件,各管什么
跑大模型主要看三个硬件,用做饭打个比方:
- 内存(RAM):相当于”料理台”。模型运行时要摊开在这里,台子越大,能摆下的模型越大。主流是 8G / 16G / 32G。
- 显卡显存(VRAM):相当于”最快的那块料理台”。模型如果能放进显存,运算速度飞快;放不下就得挪到普通内存里用 CPU 慢慢算。这是决定”快不快”的关键,也是新手最容易忽略的。
- 硬盘空间:相当于”仓库”。模型文件很大,一个就好几个 G,得有地方存。
一句话:内存决定”能不能跑”,显存决定”跑得快不快”,硬盘决定”能存几个”。
1.2 手把手查看自己的配置
看内存和 CPU:
- 按 Ctrl + Shift + Esc 打开”任务管理器”。
- 点上方”性能”标签。
- 左侧点”内存”,右上角就能看到总容量(比如 16.0 GB);点”CPU”能看到型号。
看显卡和显存:
- 同样在”任务管理器 → 性能”里,左侧找有没有”GPU”项。
- 点开 GPU,看名字里有没有 NVIDIA / AMD 独立显卡(如 RTX 4050、RTX 3060)。
- 看”专用 GPU 内存”那一栏的总量,比如 6.0 GB——这就是你的显存。
小贴士:如果只有”Intel(R) UHD Graphics”这类核显,说明没有独立显卡,显存很小,只能靠 CPU 跑,方案见 1.4。
> >
1.3 【核心】按配置选模型对照表
记住一个换算:模型常见的 “Q4 量化” 版本,体积大约是 “参数量 × 0.6 GB”。比如 14B 模型的 Q4 版约 8~9 GB。下面是保守推荐:
说明:显存装不下没关系,Ollama 会自动把装不下的部分挪到内存用 CPU 算,只是会变慢。所以内存也要够——跑 14B 建议 16G 以上内存,跑更大的建议 32G。
> >
1.4 没有独立显卡怎么办?
完全可以玩,只是慢一些。纯 CPU 跑 1.5B~4B 的小模型,回答速度大概是”一个字一个字往外蹦”,日常问答、翻译还是能用的。内存越大越好(建议 16G 起)。先从小模型试起,觉得慢就别硬上大的。
第 2 章 · 认识两个主角:Ollama 和 Chatbox
我们只用两个免费软件,分工明确:
- Ollama —— 大模型的”发动机”。 它负责下载模型、把模型跑起来、管理你装的模型。它本身没有好看的界面,主要在后台默默工作,靠命令行操作。你只需要记住两三条命令。
- Chatbox —— 聊天的”方向盘和仪表盘”。 一个漂亮的桌面软件,长得像微信/ChatGPT 的聊天窗口。它连上后台的 Ollama,你就能像平时聊天一样跟模型对话。
为什么选这套组合? 因为对新手最友好:Ollama 把”下载和运行模型”这件复杂的事简化成一条命令;Chatbox 把”对话”变成点点鼠标。两者配合,既省心又好用,是目前本地大模型最主流的入门方案。
工作关系是这样的:你在 Chatbox 里打字 → Chatbox 把话发给后台的 Ollama → Ollama 让模型思考并回答 → 答案显示回 Chatbox。 全程在你电脑里完成,不经过任何外部服务器。
第 3 章 · 安装发动机:Ollama
🤖 交给智能体:它会先查 Ollama 是否已装,未装则用 winget 或官网包安装并验证 11434 端口;遇到 PATH 找不到命令会自动改用完整路径,C 盘不够会先征得你同意再改存储盘。
> >
3.1 下载与安装
打开浏览器,访问 Ollama 官网:
点击首页的 Download,选择 Windows 版本,下载安装包(约几百 MB)。
双击安装包,一路”下一步”完成安装。装完后,它会在后台自动运行(右下角托盘可能有个小图标),并且设置为开机自启——以后开机它就自动待命。
3.2 验证是否装成功
打开”终端”或”PowerShell”(在开始菜单搜索 PowerShell 即可),输入:
1 | ollama --version |
如果显示出一个版本号(比如 ollama version 0.x.x),就说明装好了。
踩坑提示: 如果提示 ollama 不是可识别的命令,通常是安装目录没加进系统 PATH。最简单的办法是重启一次电脑;或者找到 Ollama 的安装目录(比如 C:\Users\你的用户名\AppData\Local\Programs\Ollama),用它的完整路径来调用。
> >
你也可以在浏览器地址栏输入 http://127.0.0.1:11434,如果显示 Ollama is running,说明后台服务正常。
3.3 (进阶可选)把模型存到别的盘,别撑爆 C 盘
模型文件很大,Ollama 默认存在 C 盘。如果你 C 盘紧张,想存到 D 盘,可以设置一个环境变量:
- 开始菜单搜索”环境变量”,打开”编辑系统环境变量”。
- 点”环境变量”,在”用户变量”里”新建”。
- 变量名填 OLLAMA_MODELS,变量值填你想存的目录,比如 D:\ollama\models。
- 保存后,重启 Ollama(或重启电脑) 生效。之后下载的模型就会存到 D 盘。
第 4 章 · 下载千问模型
🤖 交给智能体:它会用 ollama pull 拉取选定模型并盯进度;下载慢或断了会自动切换到魔搭镜像、断点续传,不用你操心。
> >
4.1 千问(Qwen)是什么,为什么选它
千问(Qwen)是阿里巴巴开源的大模型系列。选它的理由很实在:中文能力强(毕竟国产,最懂中文语境)、开源免费可商用、型号齐全(从超小到超大都有,总能找到适合你电脑的那一款)、社区支持好(教程多、下载渠道通畅)。
4.2 看懂型号:三个关键词
在下载前,先看懂模型名字里的门道,比如 qwen2.5:14b 这种写法:
- 参数量(7B / 14B / 32B):B = Billion(十亿)。数字越大越”聪明”,但也越大、越吃硬件、越慢。这是选型第一要素,要和你第 1 章查的显存对上。
- 量化(Q4 / Q8):可以理解成”给模型压缩瘦身”。原始模型很大,量化后体积大幅缩小、速度变快,代价是损失一点点精度。Q4_K_M 是最常用的档位,体积和质量平衡得最好,新手首选;Q8 更接近原版但更大更慢。
- 稠密 vs MoE:普通模型(稠密)每次都要动用全部参数。MoE(混合专家)模型则像”一个大团队里每次只派几个专家干活”——总个头很大很聪明,但每次只激活一小部分,所以在内存够的机器上,MoE 能用大模型的聪明、又比同等大小的稠密模型快。硬件一般但内存大的电脑,可以关注 MoE。
4****.3 结合你的配置,到底下哪个
对照第 1 章的表,给个直接建议:
- 4~6 GB 显存(最常见的入门笔记本):下 qwen2.5:7b 或 9B 级别的模型,流畅好用。
- 8~12 GB 显存:可以上 qwen2.5:14b,更聪明。
- 16 GB 以上显存 / 32G 大内存:可以试 32B 或 MoE 大模型。
- 没有独显:从 qwen2.5:3b 这类小模型起步。
本文后续以 9B 级别模型(约 6 GB)为例演示,它是 4~6 GB 显存机器的甜点档位。你把命令里的模型名换成自己选的即可。
> >
4.4 一条命令拉取模型
打开 PowerShell,输入(把模型名换成你选的):
1 | ollama pull qwen2.5:7b |
回车后开始联网下载,会显示进度百分比和速度。模型好几个 G,耐心等它下完。下载虽然联网,但下完之后运行就完全离线免费了。
4.5 【避坑】国内下载慢?用魔搭镜像加速
如果从官方源下载很慢或老中断,可以改用国内的魔搭 ModelScope 镜像,速度快很多。魔搭上很多模型可以直接用 Ollama 拉取,格式类似:
1 | ollama pull modelscope.cn/Qwen/Qwen2.5-7B-Instruct-GGUF |
具体命令以魔搭对应模型页面给出的为准(页面上一般会直接写好 ollama 拉取命令,复制即可)。
4.6 验证:命令行里的第一次对话
下完后,直接在 PowerShell 里跑:
1 | ollama run qwen2.5:7b |
稍等十几秒(第一次要把模型加载进内存),出现输入提示后,打一句”你好,介绍下你自己”,它就会回答。能对话,就说明模型装好了! 输入 /bye 退出。
第 5 章 · 装上方向盘:Chatbox 连接模型
🤖 交给智能体:Chatbox 的安装它能代劳;但『选模型、填地址』这类界面操作需要你点两下,它会给出明确指引。
> >
命令行能聊,但不好看也不好用。装个 Chatbox,体验立刻变成”图形化聊天软件”。
5.1 下载安装 Chatbox
方法一(推荐):访问官网
,下载 Windows 版,双击安装。
方法二(会用命令的话):如果你的电脑有 winget,可在 PowerShell 里一条命令装好:
1 | winget install Bin-Huang.Chatbox |
5.2 连接本地 Ollama
- 打开 Chatbox,如果弹出引导,选 “使用自己的 API Key / 本地模型”,不要选官方云服务(那个要花钱)。
- 点左下角 设置(齿轮图标)。
- 在”模型提供方”里选 Ollama API。
- 关键两项:
- API 地址:填 http://127.0.0.1:11434(一般是默认值,不用改)。
- 模型:下拉选你刚下载的模型(比如 qwen2.5:7b)。如果列表是空的,点一下刷新,Chatbox 会自动从 Ollama 读取你装的模型。
- 保存。
5.3 发出第一条消息
回到聊天界面,确认顶部选中的是你的本地模型,随便打一句话发出去。第一次会等十几秒加载模型,之后就快了。能正常对话,恭喜你——本地 AI 已经跑起来了!
第 6 章 · 调优避坑
🤖 交给智能体:这四个坑它基本都会自动帮你规避,尤其会主动建好 num_ctx 16384 的加长上下文版本;你只需按它的提示在 Chatbox 里做几处设置。
> >
很多人搭好之后觉得”这模型怎么这么笨、这么难用”,其实八成不是模型的问题,是下面这几个坑没填。这一章最值得细看。
坑一:上下文默认只有 4096,导致”失忆”
现象:多聊几轮,或者贴一段长文,它就开始答非所问、前面说过的全忘了。
原因:模型能”记住”多少内容,由”上下文长度”决定。而 Ollama 默认只给了 4096(很短),哪怕模型本身支持很长。这一项在 Chatbox 界面里改不了,得在 Ollama 端设置。
解决办法:给模型做一个”加大记忆”的版本。步骤:
- 新建一个文本文件,命名为 Modelfile(没有后缀名),里面写两行(把模型名换成你的):
1 | FROM qwen2.5:7b |
- 在 PowerShell 里,进入这个文件所在目录,运行:
1 | ollama create qwen2.5-7b-16k -f Modelfile |
- 这会生成一个叫 qwen2.5-7b-16k 的新模型,记忆长度提升到 16384。它不重新下载、几乎不占额外空间(和原模型共用文件)。
- 回到 Chatbox,刷新模型列表,改用这个新模型即可。
提示:上下文越大越吃内存。16K 对日常足够;要处理超长文档可以设更大(如 32768),前提是内存够。
> >
坑二:思考模式——又聪明又啰嗦
新一代千问(Qwen3 系列)带”思考模式”:回答前会先在心里推演一大段,再给结论。开着它,解题、推理更准;但它非常啰嗦,一道简单题能”想”好几千字,导致回答很慢,甚至在有输出长度限制时”想到一半就没了”,看起来像卡住或变笨。
怎么用:
- 难题、要推理(数学、逻辑、写代码)→ 保持思考开启,答得准。
- 日常闲聊、简单问答 → 可以关掉思考,秒回。
关于 Chatbox 里那个灰色的”思考控制”开关:如果你发现它点不动、提示”此模型非通过 Qwen API 提供,思维控制已禁用”——这是正常现象,不是故障。那个开关只对接了阿里云端官方 API 的模型,对本地 Ollama 模型无效。好消息是:本地千问思考模式默认就是开着的,你正常提问它就在思考,不用管那个开关。
坑三:显存被其他软件偷偷占满
现象:模型突然变得很慢,或加载失败。
原因:浏览器(尤其是开了很多标签的 Chrome)、微信、各种带界面的软件都会悄悄占用显存。你的显存本来就不大,被它们一分,留给模型的就不够了。
解决办法:跑模型前,关掉不用的浏览器窗口和后台大软件,把显存尽量腾给模型。这一步对小显存的笔记本提速很明显。
坑四:模型选太大,卡成幻灯片
现象:回答一个字要等好几秒,风扇狂转。
原因:模型超出了显存+内存能流畅承载的范围,大部分只能靠 CPU 硬扛。
解决办法:降一档。14B 卡就换 7B,7B 还卡就换 3B。宁可用一个流畅的小模型,也别用一个卡顿的大模型——日常体验里,”响应快”比”稍微聪明一点”重要得多。
Chatbox 里几个实用设置
- 上下文消息数量上限:决定 Chatbox 每次把前面多少条对话发给模型。默认可能偏小,导致它”忘事”。调大一些(比如 20 条以上)能明显改善多轮对话的连贯性。要和坑一的 16K 配合才完整。
- Temperature(温度):控制回答的”发散程度”。想要严谨稳定(写代码、查资料)就调低(如 0.3);想要有创意(写文案、头脑风暴)就调高(如 0.9)。
第 7 章 · 日常怎么用
7.1 拿手场景
- 写作与润色:写文案、改邮件、起标题、扩写缩写。
- 翻译:中英互译、润色译文,效果不错且完全离线。
- 总结:把长文、会议记录粘进去,让它提炼要点(注意别超过上下文长度)。
- 写代码:写小脚本、解释报错、给思路,适合日常编程辅助。
- 问答与陪聊:知识问答、头脑风暴、日常闲聊。
7.2 它能干嘛、不能干嘛(边界)
- 擅长:语言类任务、常见知识、结构化整理、中等难度的代码。
- 不擅长:需要最新实时信息(它不联网,知识有截止日期)、极其复杂的专业推理、超长文档的精确处理、需要绝对准确的事实(它可能”一本正经地胡说八道”,重要信息务必自己核实)。
7.3 开机自启与后台常驻
Ollama 安装后默认开机自启、常驻后台,所以你随时打开 Chatbox 就能用,不用每次手动启动。它平时不占多少资源,只有真正对话时才会把模型加载进内存;一段时间不用会自动卸载,释放内存。
7.4 管理你的多个模型
常用命令(在 PowerShell 里):
1 | ollama list # 查看已安装的所有模型 |
你可以同时装好几个模型,在 Chatbox 里随时切换:小模型用于快速问答,大模型用于难题。
第 8 章 · 进阶拓展
8.1 想更聪明:换 MoE 或更大模型
如果日常觉得模型不够聪明、而你内存较大(32G 起),可以试 MoE 模型(如千问的 A3B 系列)——它”总个头大但每次只用一小部分”,能在普通硬件上兼顾聪明和速度。下载方式和普通模型一样,用 ollama pull 拉取对应型号即可。
8.2 让手机、其他电脑也能用
默认 Ollama 只允许本机访问。如果想让同一个 WiFi 下的手机或其他电脑也连过来用,可以设置环境变量 OLLAMA_HOST 为 0.0.0.0,再重启 Ollama,其他设备就能通过”你的电脑 IP:11434”访问。
安全提醒:这相当于把服务开放到局域网。请只在可信的家庭/办公网络里这么做,公共 WiFi 下不要开放,避免被他人蹭用。
> >
8.3 接入编程:OpenAI 兼容接口
Ollama 自带一个和 OpenAI 完全兼容的接口,这意味着你现有的、为 ChatGPT 写的代码,几乎只改一个地址就能白嫖本地模型。地址是 http://127.0.0.1:11434/v1。Python 示例:
1 | from openai import OpenAI |
第 9 章 · 常见问题 FAQ
Q:下载到一半断了怎么办?A:重新运行同一条 ollama pull 命令即可,它会接着没下完的部分继续,不用从头来。
**Q:模型占内存太多,怎么让它释放?**A:一段时间不对话,Ollama 会自动把模型从内存卸载。想立刻释放,可以在 ollama ps 看到它后,等待其自动过期,或直接重启 Ollama。
**Q:回答很慢,是正常的吗?**A:如果模型比显存大,慢是正常的(在用 CPU 硬扛)。想快就:关掉占显存的软件、换小一档的模型、关掉思考模式。参考第 6 章。
**Q:它答错了 / 一本正经地胡说八道怎么办?**A:这是所有大模型(尤其是本地小模型)的通病,叫”幻觉”。重要信息一定要自己核实。可以通过把问题问得更具体、提供更多背景、降低 temperature 来减少胡说。
**Q:怎么彻底卸载?**A:用 ollama rm 模型名 删掉模型释放硬盘;在 Windows”设置 → 应用”里卸载 Ollama 和 Chatbox 程序本身;如果设过 OLLAMA_MODELS 等环境变量,一并删除。
**Q:这一套到底花不花钱?**A:软件全免费、模型全免费、运行不花钱。唯一成本是下载时的流量和运行时的电费。真正的 token 自由。
结语:你已经实现 token 自由
回头看,你已经完成了一件一个月前可能觉得”很硬核”的事:在自己的电脑上,从零跑起了一个大模型。
现在你拥有的,是一个免费、不限量、离线、隐私安全的 AI 助手。它也许不是最聪明的那个,但它 24 小时待命、问多少都不要钱、聊什么都不外传。把它用在日常的写作、翻译、总结、问答里,你会发现”够用”其实已经很香。
想更进一步,就回到第 8 章折腾更大的模型、接进自己的程序。祝你玩得开心——欢迎来到 token 自由的世界。
第 10 章 · 解放双手:一句提示词,让 AI 全自动部署
前面九章是”手把手”版。如果你懒得一步步操作,可以把下面这段完整提示词整段复制,粘贴给 Codex 或 Claude Code,它会自动检测你的电脑配置、按显存选型、安装 Ollama 与模型、修复上下文、装好 Chatbox 并验证——全程你只需在它询问时确认即可,真正解放双手。
使用方法:打开 Codex / Claude Code,把下面代码框里的整段文字发给它。
1 | 你是一名运维助手。请在我这台电脑上全自动完成"本地部署千问(Qwen)开源大模型"的全过程,让我不必一步步手动操作。目标:装好 Ollama(运行引擎) + 一个适配我硬件的 Qwen 模型 + Chatbox(图形界面),最终我能在 Chatbox 里流畅对话。请每完成一步简要汇报结果;在联网下载数 GB 文件、安装软件、修改环境变量之前,先说明将做什么并等我确认;绝不删除或覆盖我已有的模型和数据。请依次完成以下各步,任一步失败都要给出原因和修复建议,同一处问题重试不超过两次: |
几点说明:
- 涉及下载几个 G、安装软件、改环境变量时,它都会先问你再动手,放心用。
- 如果你已经想好用哪个模型或知道自己显卡,可在提示词末尾补一句”直接用 qwen2.5:7b”来覆盖它的自动选型。
- 这段提示词以 Windows 为主、同时兼容 macOS/Linux,具体命令由 AI 按你的系统自动调整。
- 全程本地、免费、离线,数据不外发——和手动版完全一样,只是把九章的操作交给 AI 一次跑完




