首页 / 开源热榜 / Hyper-Extract / 使用教程

Hyper-Extract 中文教程:v0.10.3 安装、模板与 GraphRAG 对比

更新于 2026-09-23 · NGJOO AI 实验室 · 约 8 分钟

Hyper-Extract 把文本或文档抽取成列表、模型、知识图谱、超图和时空图等强类型 Knowledge Abstract。当前版本还提供 Obsidian 导出与只读 MCP server。

版本纠正:旧页面停在 v0.2.0;当前 release 与 pyproject.toml 都是 v0.10.3,要求 Python 3.11+。

1. 安装 CLI

python3 --version
uv tool install hyperextract
# 或
pipx install hyperextract

he --help

只在项目代码中使用 Python API 时,可以在独立虚拟环境运行 uv pip install hyperextract

2. LLM 和 embedding 要分开看

OpenAI、百炼可以同时提供 LLM 与 embedding;Anthropic 和 DeepSeek 只用于 LLM 时,需要另配 OpenAI-compatible embedder 才能做语义搜索。官方还提供本地 vLLM 路径,但需要自行准备 GPU、模型服务和访问控制。

# OpenAI 示例
he config init -p openai -k YOUR_OPENAI_API_KEY

# DeepSeek 需要另配 embedder
he config llm -p deepseek -k YOUR_DEEPSEEK_API_KEY
he config embedder -p openai -k YOUR_OPENAI_API_KEY

3. 用公开示例做首次抽取

he parse examples/en/tesla.md -t general/biography_graph -o ./output/ -l en
he search ./output/ "What are Tesla's major achievements?"
he show ./output/

检查实体名称、关系方向、重复合并和缺失字段。模板能约束结构,不能保证模型提取的内容全部正确。敏感文档不要直接发给未经批准的云 provider。

4. 架构和输出

Auto-Types 定义八类输出结构;Methods 提供 GraphRAG、LightRAG、Hyper-RAG 等提取方法;Templates 固定领域字段、标识和合并规则。需要给 Agent 查询时可安装 hyperextract[mcp] 并运行 he-mcp,官方工具以读取、查询和导出为主。

5. 与 Microsoft GraphRAG 的区别

维度Hyper-ExtractMicrosoft GraphRAG
主要目标按模板得到多种强类型知识结构建立实体/关系、社区摘要并进行全局或局部检索
输出范围列表、模型、图、超图、时空图GraphRAG 索引与查询流程
使用入口CLI、Python、Obsidian、MCPCLI、Python 与 GraphRAG 工作流

标准 GraphRAG 研究和索引查询先看 Microsoft GraphRAG;需要领域模板或超图/时空结构时再看 Hyper-Extract。

6. 本次验证边界

验证状态:本次核对官方 README、中文 CLI/架构文档、pyproject.toml 与 v0.10.3 release,没有安装 CLI 或调用模型。

确认内容:Python 3.11+、uv/pipx 安装、provider 配置、parse/search/show/export、MCP extra 和当前 release 都有官方材料对应。

没有验证:解析准确率、费用、本地 vLLM、Obsidian 导出和 MCP 客户端未在本站环境实测。

这里仅补原教程没有展开的事实和边界。安装命令与操作步骤仍以前文为准。

先判断这个项目是否适合你

适合谁用

适合从论文、财报、政策或内部文档提取固定结构,构建可查询知识图谱,或将结果导出为 Obsidian vault。涉及敏感资料时应选本地模型或经过批准的 provider,并检查输出中的遗漏与虚构关系。

采用建议

适合需要用模板约束实体、关系或时空结构,并希望通过 CLI、Python、Obsidian 或 MCP 使用结果的团队。先用公开小文档验证模板和 provider,再评估准确率、费用、隐私和人工复核成本。

原教程未展开的系统信息

核心功能

  • 八类强类型知识结构

    从 List、Set、Pydantic Model 到 Graph、Hypergraph、Temporal、Spatial 和 Spatio-Temporal Graph。

技术栈和运行条件

语言

Python

框架

Typer CLI + Pydantic 强类型结构

关键依赖

  • Python >=3.11
  • 具备 json_schema 或 function calling 的 LLM
  • 语义搜索所需的 OpenAI-compatible embedding endpoint

运行环境

可使用云 provider,也可用本地 vLLM;MCP 额外安装 hyperextract[mcp]

常见问题

Hyper-Extract 当前需要哪个 Python 版本?

v0.10.3 的 pyproject.toml 要求 Python 3.11 或更新版本。

使用 DeepSeek 或 Claude 时还需要 embedding 模型吗?

需要语义搜索时需要。官方说明 DeepSeek 和 Anthropic 没有 embedding API,要另配 OpenAI-compatible embedder。

Hyper-Extract 输出的实体和关系可以直接当事实吗?

不能。模板约束输出结构,但内容仍由模型提取,必须回到原文核对遗漏、合并错误和虚构关系。

Hyper-Extract 与 Microsoft GraphRAG 怎么选?

需要标准 GraphRAG 索引和全局/局部查询时先看 GraphRAG;需要多种强类型结构和领域模板时看 Hyper-Extract。