local-llmup 是一个硬件感知的命令行工具和交互式终端界面 (TUI)
local-llmup 详细部署教程
local-llmup 是一个硬件感知的命令行工具和交互式终端界面 (TUI),它能帮助你在本地机器上发现、评估、安装、运行和迁移大型语言模型 (LLM)。它的核心价值在于,在您下载任何模型之前,就能根据您的具体硬件配置,给出“能运行 / 较慢 / 不能运行”的明确结论,并估算每秒可处理的令牌数 (tok/s)。
本教程将指导您从安装到日常使用的完整过程。
1. 准备工作
1.1 核心要求
- Node.js: 版本 18 或更高。
- 网络: 安装和下载模型时需要网络连接。但硬件评估和建议功能完全离线工作。
- 后端 (Backend):
local-llmup本身不运行模型,它需要调用以下至少一个后端。推荐安装 Ollama。- Ollama (推荐,全平台支持): 从 ollama.com 下载安装。
- llama.cpp (全平台支持): 可通过
brew install llama.cpp(macOS) 等方式安装。 - MLX (仅限 Apple Silicon Mac): 通过
pip install "mlx-lm==0.31.3"安装。 - LM Studio (全平台): 用户需自行管理其服务器,
local-llmup仅负责连接。
1.2 了解工作流程
工具的核心工作流如下:
- 评估 (
recommend或can-run):分析您的硬件 (CPU/GPU/内存),判断哪些模型能运行。 - 安装并启动 (
up):下载选定的模型,验证文件完整性,并启动一个本地服务器。 - 对话 (
chat):通过命令行或浏览器界面与模型进行交互。 - 迁移 (
migrate):将当前对话的记忆迁移到另一个模型上,方便无缝切换。
2. 安装
2.1 使用 npm 全局安装 (推荐)
1 | npm install -g local-llmup |
安装后,您可以在任何目录下使用 local-llmup 命令。
2.2 无需安装直接运行
如果您不想全局安装,可以使用 npx 直接运行:
1 | npx local-llmup |
2.3 使用 Docker (体验/测试)
项目也提供了 Docker 镜像,但请注意容器内的硬件检测可能无法准确反映宿主机状态。
1 | docker pull ghcr.io/shashankswe2020-ux/local-llmup:latest |
建议: 对于准确的硬件推荐,直接使用 npm 安装而非 Docker。
3. 快速开始
3.1 第一步:评估您的硬件和可运行的模型
运行以下命令,工具会分析您的机器并列出所有推荐模型及其运行状态:
1 | local-llmup |
您会看到类似如下的输出,每个模型都有明确的 yes / slow / no 判定和预估速度:
1 | Rank Model Verdict Est. tok/s Score Backends |
3.2 第二步:检查特定模型
您也可以直接询问某个具体模型能否运行:
1 | local-llmup can-run llama3.1:8b |
3.3 第三步:启动您的第一个模型
选择一个判定为 yes 的模型,使用 up 命令拉取、验证并启动它:
1 | local-llmup up qwen3:14b |
- 验证: 工具会自动验证下载文件的 SHA-256 完整性,确保文件未被篡改。
- 安全: 启动的服务器默认只绑定在本地回环地址
127.0.0.1,不会暴露到网络。
3.4 第四步:开始对话
模型启动后,您可以直接在终端中与其对话:
1 | local-llmup chat |
您输入的所有内容都会作为对话历史被记录下来,方便后续迁移。
3.5 第五步:停止模型
当您使用完毕后,可以停止当前正在运行的模型服务器:
1 | local-llmup down |
4. 核心功能与高级用法
4.1 交互式终端界面 (TUI)
直接输入 local-llmup 并回车,在支持的终端(≥60列,≥16行)中会自动启动一个可视化的交互界面。
- 键盘导航: 使用
↑/↓或j/k在模型列表中移动,按/键搜索,按m键标记模型进行比较,按c键查看对比详情。 - 核心信息: 您可以看到模型的详细评估、预估吞吐量和硬件瓶颈。
- 辅助模式: 为屏幕阅读器用户提供了
--accessible标志。
4.2 浏览器图形界面 (GUI)
如果您更喜欢可视化操作,可以启动一个本地 Web 界面:
1 | local-llmup gui |
它会在您的默认浏览器中打开一个地址为 127.0.0.1 的本地 AI 工作区。您可以在这里浏览模型、一键启动、调整上下文窗口大小,并与模型进行对话。所有操作均通过本地回环进行,数据不会离开您的机器。
4.3 迁移对话记忆
local-llmup 最强大的功能之一是可以将对话记忆从一个模型迁移到另一个模型。这对于尝试不同模型但不想丢失当前对话上下文非常有用:
1 | # 先迁移记忆 |
4.4 脚本化与 CI/CD 集成
工具支持 --json 输出格式和明确的退出码,方便集成到脚本中:
1 | # 在 CI 脚本中用作门控 |
can-run命令在判定为yes或slow时退出码为 0,no时为 1。
5. 配置与运维参考
5.1 环境变量与全局选项
您可以通过全局选项来控制工具行为,例如:
--task <任务>: 根据任务(如chat,code,vision)优化模型推荐排序。--context <令牌数>: 指定上下文窗口大小并重新评估模型。在 GUI 中可直接选择 Low/Mid/High/Max 预设。--backend <名称>: 限定只使用特定后端(如--backend ollama)。--json: 以纯 JSON 格式输出结果,便于解析。
5.2 查看硬件诊断
运行 doctor 命令可以获取详细的硬件诊断和 AI 硬件评分 (0-100):
1 | local-llmup doctor |
它会给出 VRAM、RAM、计算能力和存储的细分瓶颈分析。
5.3 更新与目录管理
- 更新工具:
npm update -g local-llmup - 查看已下载模型:
local-llmup ls
6. 故障排查
| 问题 | 解决方案 |
|---|---|
up 命令因大小不匹配失败 |
重新运行命令,通常是下载中断导致的。 |
提示 ollama is not installed |
安装 Ollama (或选择其他后端)。评估和建议功能无需后端。 |
吞吐量显示 unknown |
您的硬件带宽信息不在项目内置数据集中。您仍可依据 yes/slow/no 判断运行可行性。 |
| TUI 界面不渲染 | 检查终端窗口是否大于 60 列、16 行。在非 TTY 环境(如管道)或使用 --no-tui 标志会回退到纯文本模式。 |
KV 缓存显示 unknown |
该模型的注意力机制架构信息不在内置数据集中,因此无法精确计算上下文内存占用。 |
总结
local-llmup 为您管理本地 LLM 提供了一个从“评估决策”到“运行迁移”的完整生命周期方案。它的核心价值在于通过硬件感知,帮助您在上百个模型变体中快速找出最适合您当前机器的那一个,避免了反复下载、尝试的试错过程。
建议您从 local-llmup 命令开始,了解您机器的能力,然后尝试启动一个推荐的小型模型,熟悉整个工作流。随着对工具的深入使用,您会发现它是探索和利用开源 LLM 生态的得力助手。


