这份详细的部署教程将指引您安装和使用 Hyper-Extract——一个强大的命令行工具,能将非结构化的文本文档(如PDF、Markdown)通过大语言模型(LLM)转化为结构化的知识,包括知识图谱、超图、时空图等多种形式。

Hyper-Extract 的核心价值在于其一键式的复杂知识提取能力。您无需编写代码,只需通过一个命令,就可以从海量文本中提取出实体、关系、事件和时间/空间信息,并构建成交互式的知识结构,方便后续查询、分析和可视化。

整个部署流程非常简单,主要包括安装工具、配置 LLM 提供商、以及运行解析命令。

📥 安装

Hyper-Extract 推荐使用 uvpipx 进行安装,以获得独立的命令行环境。

1
2
3
4
5
6
# 1. 安装 uv (如果尚未安装)
curl -LsSf https://astral.sh/uv/install.sh | sh

# 2. 安装 Hyper-Extract CLI
uv tool install hyperextract
# 或使用 pipx: pipx install hyperextract

⚙️ 配置 LLM 提供商

Hyper-Extract 需要配置大语言模型(LLM)来驱动提取过程。您需要选择一个受支持的提供商并配置 API 密钥。

1. OpenAI (推荐,同时提供 LLM 和 Embedding 模型)

1
he config init -p openai -k YOUR_OPENAI_API_KEY

2. Anthropic Claude (仅 LLM,需配对 OpenAI Embedding)

1
2
3
4
# 设置 Claude 作为 LLM
he config llm -p anthropic -k YOUR_ANTHROPIC_API_KEY
# 设置 OpenAI 作为 Embedding 模型 (用于搜索)
he config embedder -p openai -k YOUR_OPENAI_API_KEY

注意:使用 Anthropic 需要额外安装依赖:pip install 'hyperextract[anthropic]'

3. DeepSeek (性价比高,仅 LLM)

1
2
he config llm -p deepseek -k YOUR_DEEPSEEK_API_KEY
he config embedder -p openai -k YOUR_OPENAI_API_KEY

4. 阿里云百炼 (Bailian)

1
he config init -p bailian -k YOUR_BAILIAN_API_KEY

5. 本地 vLLM (完全离线,需 GPU)

1
2
he config llm -p vllm -u http://localhost:8000/v1 -k dummy -m Qwen/Qwen3.5-9B
he config embedder -p vllm -u http://localhost:8001/v1 -k dummy -m BAAI/bge-m3

🚀 核心使用流程

配置完成后,您可以使用 he parse 命令从文档中提取知识。

1. 从文档提取知识图谱

1
2
# 使用通用传记图谱模板,从 tesla.md 文件中提取知识
he parse examples/en/tesla.md -t general/biography_graph -o ./output/ -l en

2. 查询提取的知识

1
2
# 对生成的 Knowledge Abstract (KA) 进行自然语言查询
he search ./output/ "What are Tesla's major achievements?"

3. 可视化知识图谱

1
2
# 在浏览器中打开交互式图谱
he show ./output/

4. 导出为 Obsidian 笔记库

1
2
# 将图谱转化为 Obsidian 风格的 Markdown 笔记,并使用 [[wikilinks]] 链接
he export obsidian ./output/ -o ./vault/

🎯 应用场景与模板

Hyper-Extract 提供了 80+ 种预定义的 YAML 模板,覆盖金融、法律、医疗、通用等多个领域,您可以零代码直接使用。

  • 研究者:将学术论文转化为概念、作者和引用关系的知识图谱。

    1
    he parse paper.pdf -t general/academic_graph -o ./paper_kb/
  • 金融分析师:从财报中自动提取公司、高管和财务指标及其关系。

    1
    he parse earnings.md -t finance/earnings_graph -o ./finance_kb/

🔌 高级功能:MCP 服务器

Hyper-Extract 还提供了一个 MCP (模型上下文协议) 服务器,允许 Claude Desktop 或 IDE 代理等工具直接查询您提取的知识摘要。

1
2
3
4
# 安装 MCP 扩展
pip install 'hyperextract[mcp]'
# 启动 MCP 服务器 (stdio 模式)
he-mcp

📚 了解更多