首页 / 开源热榜 / LiteParse / 使用教程

LiteParse 教程:先跑本地无 OCR 基线

更新于 2026-09-23 · 约 10 分钟

LiteParse 用 Rust 管道提取 PDF 文本和坐标,再通过规则恢复阅读顺序、标题、列表与表格。基础路径不需要 LLM,也不依赖云服务。先关闭 OCR 建立基线,才能看清 PDF 原生文本、OCR 和格式转换分别带来什么变化。

版本情况:Python、Node.js、Rust/CLI 和 WASM 已发布 v2.14.6;官方 Releases 页面当前列出的 Docker 最新版是 v2.14.5。不同入口要分别固定版本。

1. 在虚拟环境安装 Python 版

python3 -m venv .venv
source .venv/bin/activate
python -m pip install liteparse==2.14.6
lit --version

Node.js 可用 @llamaindex/liteparse,Rust 可用 crate,浏览器使用 WASM 包。第一次只选一种入口,避免把绑定差异误判为解析差异。

2. 选择可公开的测试 PDF

准备一份简单文本、一份表格和一份扫描件,记录预期页数、标题与表格结构。先使用无敏感内容的副本。非 PDF 文件会进入转换层,可能需要 LibreOffice 或其他组件,应作为另一组测试。

3. 关闭 OCR 建立基线

lit parse sample.pdf --no-ocr --format markdown -o sample.md
lit parse sample.pdf --no-ocr --format json -o sample.json

逐页检查丢字、阅读顺序、表格行列与 bbox。Markdown 是规则重建结果,不能把排版看起来整齐当作内容正确。

4. 再比较本地 OCR

内置 Tesseract 可以在本机处理扫描页。分别保留无 OCR 与 Tesseract 输出,比较新增文字和误识别。HTTP OCR 会把页面交给指定服务,只有确认传输、日志和保留政策后才应使用。

5. 认识项目方基准的范围

官方基准使用公开数据集和指定硬件,能说明测试设置下的相对表现。README 同时显示图表与数学类别很弱,复杂多栏、密集表格、手写和旧扫描件也有明显限制。自己的文档集仍是采用依据。

与 Microsoft MarkItDown 对比

MarkItDown 覆盖 PDF、Office、图片、音频、HTML、ZIP、EPUB 和 URL,目标是把多种内容转换成适合 LLM 的 Markdown。LiteParse 更集中于 PDF 空间布局、bbox、截图和可选 OCR。需要广格式转换时评估 MarkItDown;需要页级坐标与本地 PDF 版面信息时评估 LiteParse。

验证状态:本轮只核对官方 README、OCR API 规范、Releases 和各语言安装入口。未安装任何包,未加载 PDFium、Tesseract或 LibreOffice,未解析 PDF,也未调用 HTTP OCR、WASM、Docker 或 LlamaParse。

这里仅补原教程没有展开的事实和边界。安装命令与操作步骤仍以前文为准。

先判断这个项目是否适合你

适合谁用

适合 RAG 前处理、PDF 文本与坐标抽取、页面截图和简单表格恢复。复杂多栏、密集表格、图表、手写和旧扫描件仍可能失败;项目自己的基准也显示图表与数学类别存在明显短板,关键文档要人工抽查。

采用建议

LiteParse 适合先用本地、无模型的方式提取 PDF 文本和坐标。是否采用应由自己的文档集决定;先关闭 OCR 建基线,再分别测试 Tesseract 和受控 HTTP OCR,不能把项目方基准直接当成生产结论。

原教程未展开的系统信息

核心功能

  • 本地空间文本解析

    PDFium 提取文本与坐标,规则管道重建阅读顺序、标题、列表和表格,不依赖专有 LLM。

  • 选择性 OCR

    内置 Tesseract,也可把页面交给 HTTP 或自定义 OCR;是否外发数据取决于所选后端。

  • 多语言绑定

    同一 Rust 核心提供 lit CLI、Python、Node.js/TypeScript、Rust 库和浏览器 WASM。

  • 结构化与可视输出

    可输出 Markdown、文本、带 bounding box 的 JSON、截图、图片、表单字段和可选矢量路径。

架构与数据流

输入先按格式进入转换层;PDF 直接由 PDFium 提取,DOCX/XLSX/PPTX 等先转换。管道判断是否需要 OCR,把原生文本与 OCR 结果合并,再用 Grid Projection 和规则分类恢复空间布局。Rust 核心通过 PyO3、napi-rs 与 wasm-bindgen 提供多语言接口。

常见问题

LiteParse v2.14.6 解析 PDF 必须使用云服务吗?

不需要。基础 PDFium 和内置 Tesseract 路径可在本机运行;HTTP OCR、远程 URL 和 LlamaParse 才会引入网络边界。

LiteParse 的所有发布包都是 v2.14.6 吗?

不是。Python、Node.js、Rust/CLI 与 WASM 已发布 2.14.6,而官方 Releases 页面列出的 Docker 最新版是 2.14.5,应按实际入口分别固定版本。

LiteParse 的 Markdown 能可靠还原复杂表格和图表吗?

不能保证。README 明确说复杂文档质量会变化,项目基准中的图表与数学类别也很弱,关键结果必须对照原页抽查。

配置 LiteParse HTTP OCR 会发送什么数据?

它会把待识别页面交给配置的 OCR 服务处理。服务地址、传输加密、日志和保留策略都属于新的数据边界。