Ollama 详细部署教程

Ollama 是一个轻量级、易上手的本地大模型运行框架,它让你能像运行普通软件一样,在 Windows、macOS 或 Linux 上轻松运行和管理各种开源大语言模型(如 Qwen、DeepSeek、Llama 等),所有数据都保留在本地,保障隐私安全。本教程将提供最全面的部署指南,从零开始带你完成安装、模型部署与调用。


1. 准备工作

1.1 硬件与系统要求

在开始前,请检查你的设备是否满足基本要求:

配置项 基础要求 (运行 7B 模型) 进阶要求 (运行更大模型)
操作系统 Windows 10/11, macOS, Linux 同左
CPU 4 核或以上 8 核或以上
内存 8 GB 16 GB 或更高
磁盘空间 至少 20 GB (用于存储模型) 更大容量 (模型文件可达数GB至数十GB)
GPU (可选) 无 (CPU模式可运行) NVIDIA GPU (需配置CUDA) 以获得更好性能

1.2 必要环境

  • 对于 Docker 部署:需要安装并配置好 Docker 环境。
  • 对于 GPU 加速:若想使用 NVIDIA GPU,需提前安装好 NVIDIA 驱动NVIDIA Container Toolkit

2. 安装 Ollama

Ollama 提供了多种安装方式,你可以根据自己的习惯和环境选择。

方式一:直接安装 (推荐新手)

这是最简单、最通用的方式,适合在个人电脑上快速开始。

  • macOS / Linux
    打开终端,执行以下命令:

    1
    curl -fsSL https://ollama.com/install.sh | sh

    该脚本会自动完成安装。

  • Windows

    1. 访问 Ollama官网,点击下载 Windows 安装包。
    2. 双击运行安装程序,按向导完成安装。
  • 验证安装
    安装完成后,打开终端(或命令提示符)并运行:

    1
    ollama --version

    如果正确显示版本号,则说明安装成功。

方式二:使用 Docker 部署

Docker 方式能提供更好的环境隔离和可复现性,适合生产环境或服务器部署。

  1. 拉取并运行容器 (CPU 模式)

    1
    docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
    • -d:后台运行容器
    • -v ollama:/root/.ollama:挂载数据卷,持久化存储模型文件,防止容器删除后数据丢失
    • -p 11434:11434:将容器的 11434 端口映射到主机,供 API 访问
    • --name ollama:给容器命名
  2. 启动 GPU 加速容器 (需 NVIDIA GPU)
    如果满足条件,可使用此命令获得更好的推理性能:

    1
    docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
    • --gpus=all:将宿主机所有 GPU 资源分配给容器。

3. 下载与运行模型

安装完成后,就可以下载并运行你感兴趣的开源模型了。

3.1 基础命令

  • 下载/拉取模型ollama pull <模型名称:标签>
    • 例如,下载阿里的通义千问 2.5 模型:ollama pull qwen2.5
    • 下载 DeepSeek-R1 小型模型:ollama pull deepseek-r1:1.5b
  • 运行并对话ollama run <模型名称:标签>
    • 如果本地没有该模型,此命令会先自动下载,然后直接进入对话界面。
    • 例如:ollama run qwen2.5
  • 查看本地已有模型ollama list
  • 删除模型ollama rm <模型名称>

3.2 国内下载加速(重要)

由于网络原因,直接从官网下载模型可能较慢。你可以使用国内镜像站来加速下载。

  • 使用 ModelScope (魔搭) 镜像
    在拉取命令前加上镜像站前缀,例如:

    1
    ollama pull modelscope.cn/Qwen/Qwen2.5-7B-GGUF

    注意:模型名称和标签 (Tag) 可能因镜像站命名规则而异,建议先去 ModelScope 官网搜索你需要的 GGUF 格式模型,再复制其 ID 进行拉取。

3.3 首次对话测试

以运行 Qwen2.5 模型为例:

1
ollama run qwen2.5

等待模型加载完成后,你会看到 >>> 提示符,输入你的问题即可开始对话。输入 /bye 可退出对话。


4. 配置与高级使用

4.1 常用环境变量

你可以通过设置环境变量来定制 Ollama 的行为。

环境变量 作用 示例
OLLAMA_HOST 指定 Ollama 服务监听的地址和端口 0.0.0.0:11434 (允许外部访问)
OLLAMA_MODELS 更改模型文件的存储目录 /path/to/your/models
OLLAMA_NUM_PARALLEL 设置同时处理的并发请求数 4
OLLAMA_MAX_LOADED_MODELS 设置最多同时加载到内存的模型数量 2
  • 在 Docker 中使用:通过 -e 参数传递,例如:

    1
    docker run -d -e OLLAMA_HOST=0.0.0.0:11434 ... ollama/ollama
  • 在 Linux 服务中使用:可修改 /etc/systemd/system/ollama.service 文件,在 [Service] 段落下添加 Environment="OLLAMA_HOST=0.0.0.0:11434",然后重启服务。

4.2 API 调用

Ollama 提供了简洁的 REST API,默认监听 http://localhost:11434,方便其他应用集成。

示例:使用 curl 调用文本生成

1
2
3
4
5
curl http://localhost:11434/api/generate -d '{
"model": "qwen2.5",
"prompt": "为什么天空是蓝色的?",
"stream": false
}'

使用 Python 调用
首先安装官方库:pip install ollama,然后:

1
2
3
4
5
import ollama
response = ollama.chat(model='qwen2.5', messages=[
{'role': 'user', 'content': '为什么天空是蓝色的?'}
])
print(response['message']['content'])

完整的 API 文档可参考 Ollama API 文档


5. 图形界面:接入 Open WebUI

对于不习惯命令行的用户,可以部署一个美观的图形界面——Open WebUI。它支持多模型切换、历史记录、文件上传等丰富功能。

使用 Docker Compose 一键部署

  1. 创建一个 docker-compose.yml 文件,内容如下:

    1
    2
    3
    4
    5
    6
    7
    8
    9
    10
    11
    12
    13
    14
    15
    16
    17
    18
    19
    20
    21
    22
    23
    24
    services:
    ollama:
    image: ollama/ollama:latest
    container_name: ollama
    restart: unless-stopped
    ports:
    - "11434:11434"
    volumes:
    - ollama_data:/root/.ollama

    open-webui:
    image: ghcr.io/open-webui/open-webui:main
    container_name: open-webui
    restart: unless-stopped
    ports:
    - "3000:8080"
    environment:
    - OLLAMA_BASE_URL=http://ollama:11434
    volumes:
    - open-webui_data:/app/backend/data

    volumes:
    ollama_data:
    open-webui_data:
  2. 在文件所在目录下运行:

    1
    docker-compose up -d
  3. 启动后,在浏览器访问 http://localhost:3000,注册账号即可开始使用。


6. 故障排除

问题 可能原因与解决方案
下载模型速度极慢或失败 网络问题。尝试使用国内 ModelScope 镜像站进行拉取。
API 无法访问 (连接被拒绝) 1. 检查 Ollama 服务是否运行。2. 检查 OLLAMA_HOST 环境变量是否设置正确。3. 检查防火墙是否放行 11434 端口。
Docker 容器无法使用 GPU 1. 确认 NVIDIA 驱动及 NVIDIA Container Toolkit 已正确安装。2. 运行 docker run --rm --gpus all nvidia/cuda:11.0-base nvidia-smi 测试 GPU 是否对 Docker 可见。
运行大模型时系统卡顿或内存不足 模型参数规模 (B) 越大,所需内存越多。可尝试下载更小尺寸的模型(如 1.5B, 3B 或 7B 版本),或设置 OLLAMA_NUM_PARALLELOLLAMA_MAX_LOADED_MODELS 限制资源消耗。

7. 总结

Ollama 极大地降低了本地运行大模型的门槛。无论你是想私有化部署一个 AI 助手测试不同模型的能力,还是为自己的应用集成本地 AI 能力,Ollama 都是一个绝佳的起点。

相关资源