Hyper-Extract 中文教程:v0.10.3 安装、模板与 GraphRAG 对比
Hyper-Extract 把文本或文档抽取成列表、模型、知识图谱、超图和时空图等强类型 Knowledge Abstract。当前版本还提供 Obsidian 导出与只读 MCP server。
pyproject.toml 都是 v0.10.3,要求 Python 3.11+。1. 安装 CLI
python3 --version uv tool install hyperextract # 或 pipx install hyperextract he --help
只在项目代码中使用 Python API 时,可以在独立虚拟环境运行 uv pip install hyperextract。
2. LLM 和 embedding 要分开看
OpenAI、百炼可以同时提供 LLM 与 embedding;Anthropic 和 DeepSeek 只用于 LLM 时,需要另配 OpenAI-compatible embedder 才能做语义搜索。官方还提供本地 vLLM 路径,但需要自行准备 GPU、模型服务和访问控制。
# OpenAI 示例 he config init -p openai -k YOUR_OPENAI_API_KEY # DeepSeek 需要另配 embedder he config llm -p deepseek -k YOUR_DEEPSEEK_API_KEY he config embedder -p openai -k YOUR_OPENAI_API_KEY
3. 用公开示例做首次抽取
he parse examples/en/tesla.md -t general/biography_graph -o ./output/ -l en he search ./output/ "What are Tesla's major achievements?" he show ./output/
检查实体名称、关系方向、重复合并和缺失字段。模板能约束结构,不能保证模型提取的内容全部正确。敏感文档不要直接发给未经批准的云 provider。
4. 架构和输出
Auto-Types 定义八类输出结构;Methods 提供 GraphRAG、LightRAG、Hyper-RAG 等提取方法;Templates 固定领域字段、标识和合并规则。需要给 Agent 查询时可安装 hyperextract[mcp] 并运行 he-mcp,官方工具以读取、查询和导出为主。
5. 与 Microsoft GraphRAG 的区别
| 维度 | Hyper-Extract | Microsoft GraphRAG |
|---|---|---|
| 主要目标 | 按模板得到多种强类型知识结构 | 建立实体/关系、社区摘要并进行全局或局部检索 |
| 输出范围 | 列表、模型、图、超图、时空图 | GraphRAG 索引与查询流程 |
| 使用入口 | CLI、Python、Obsidian、MCP | CLI、Python 与 GraphRAG 工作流 |
标准 GraphRAG 研究和索引查询先看 Microsoft GraphRAG;需要领域模板或超图/时空结构时再看 Hyper-Extract。
6. 本次验证边界
验证状态:本次核对官方 README、中文 CLI/架构文档、pyproject.toml 与 v0.10.3 release,没有安装 CLI 或调用模型。
确认内容:Python 3.11+、uv/pipx 安装、provider 配置、parse/search/show/export、MCP extra 和当前 release 都有官方材料对应。
没有验证:解析准确率、费用、本地 vLLM、Obsidian 导出和 MCP 客户端未在本站环境实测。
这里仅补原教程没有展开的事实和边界。安装命令与操作步骤仍以前文为准。
先判断这个项目是否适合你
适合谁用
适合从论文、财报、政策或内部文档提取固定结构,构建可查询知识图谱,或将结果导出为 Obsidian vault。涉及敏感资料时应选本地模型或经过批准的 provider,并检查输出中的遗漏与虚构关系。
采用建议
适合需要用模板约束实体、关系或时空结构,并希望通过 CLI、Python、Obsidian 或 MCP 使用结果的团队。先用公开小文档验证模板和 provider,再评估准确率、费用、隐私和人工复核成本。
原教程未展开的系统信息
核心功能
八类强类型知识结构
从 List、Set、Pydantic Model 到 Graph、Hypergraph、Temporal、Spatial 和 Spatio-Temporal Graph。
技术栈和运行条件
语言
Python
框架
Typer CLI + Pydantic 强类型结构
关键依赖
- Python >=3.11
- 具备 json_schema 或 function calling 的 LLM
- 语义搜索所需的 OpenAI-compatible embedding endpoint
运行环境
可使用云 provider,也可用本地 vLLM;MCP 额外安装 hyperextract[mcp]
常见问题
Hyper-Extract 当前需要哪个 Python 版本?
v0.10.3 的 pyproject.toml 要求 Python 3.11 或更新版本。
使用 DeepSeek 或 Claude 时还需要 embedding 模型吗?
需要语义搜索时需要。官方说明 DeepSeek 和 Anthropic 没有 embedding API,要另配 OpenAI-compatible embedder。
Hyper-Extract 输出的实体和关系可以直接当事实吗?
不能。模板约束输出结构,但内容仍由模型提取,必须回到原文核对遗漏、合并错误和虚构关系。
Hyper-Extract 与 Microsoft GraphRAG 怎么选?
需要标准 GraphRAG 索引和全局/局部查询时先看 GraphRAG;需要多种强类型结构和领域模板时看 Hyper-Extract。