LiteParse 教程:先跑本地无 OCR 基线
LiteParse 用 Rust 管道提取 PDF 文本和坐标,再通过规则恢复阅读顺序、标题、列表与表格。基础路径不需要 LLM,也不依赖云服务。先关闭 OCR 建立基线,才能看清 PDF 原生文本、OCR 和格式转换分别带来什么变化。
1. 在虚拟环境安装 Python 版
python3 -m venv .venv
source .venv/bin/activate
python -m pip install liteparse==2.14.6
lit --version
Node.js 可用 @llamaindex/liteparse,Rust 可用 crate,浏览器使用 WASM 包。第一次只选一种入口,避免把绑定差异误判为解析差异。
2. 选择可公开的测试 PDF
准备一份简单文本、一份表格和一份扫描件,记录预期页数、标题与表格结构。先使用无敏感内容的副本。非 PDF 文件会进入转换层,可能需要 LibreOffice 或其他组件,应作为另一组测试。
3. 关闭 OCR 建立基线
lit parse sample.pdf --no-ocr --format markdown -o sample.md
lit parse sample.pdf --no-ocr --format json -o sample.json
逐页检查丢字、阅读顺序、表格行列与 bbox。Markdown 是规则重建结果,不能把排版看起来整齐当作内容正确。
4. 再比较本地 OCR
内置 Tesseract 可以在本机处理扫描页。分别保留无 OCR 与 Tesseract 输出,比较新增文字和误识别。HTTP OCR 会把页面交给指定服务,只有确认传输、日志和保留政策后才应使用。
5. 认识项目方基准的范围
官方基准使用公开数据集和指定硬件,能说明测试设置下的相对表现。README 同时显示图表与数学类别很弱,复杂多栏、密集表格、手写和旧扫描件也有明显限制。自己的文档集仍是采用依据。
与 Microsoft MarkItDown 对比
MarkItDown 覆盖 PDF、Office、图片、音频、HTML、ZIP、EPUB 和 URL,目标是把多种内容转换成适合 LLM 的 Markdown。LiteParse 更集中于 PDF 空间布局、bbox、截图和可选 OCR。需要广格式转换时评估 MarkItDown;需要页级坐标与本地 PDF 版面信息时评估 LiteParse。
这里仅补原教程没有展开的事实和边界。安装命令与操作步骤仍以前文为准。
先判断这个项目是否适合你
适合谁用
适合 RAG 前处理、PDF 文本与坐标抽取、页面截图和简单表格恢复。复杂多栏、密集表格、图表、手写和旧扫描件仍可能失败;项目自己的基准也显示图表与数学类别存在明显短板,关键文档要人工抽查。
采用建议
LiteParse 适合先用本地、无模型的方式提取 PDF 文本和坐标。是否采用应由自己的文档集决定;先关闭 OCR 建基线,再分别测试 Tesseract 和受控 HTTP OCR,不能把项目方基准直接当成生产结论。
原教程未展开的系统信息
核心功能
本地空间文本解析
PDFium 提取文本与坐标,规则管道重建阅读顺序、标题、列表和表格,不依赖专有 LLM。
选择性 OCR
内置 Tesseract,也可把页面交给 HTTP 或自定义 OCR;是否外发数据取决于所选后端。
多语言绑定
同一 Rust 核心提供 lit CLI、Python、Node.js/TypeScript、Rust 库和浏览器 WASM。
结构化与可视输出
可输出 Markdown、文本、带 bounding box 的 JSON、截图、图片、表单字段和可选矢量路径。
架构与数据流
输入先按格式进入转换层;PDF 直接由 PDFium 提取,DOCX/XLSX/PPTX 等先转换。管道判断是否需要 OCR,把原生文本与 OCR 结果合并,再用 Grid Projection 和规则分类恢复空间布局。Rust 核心通过 PyO3、napi-rs 与 wasm-bindgen 提供多语言接口。
常见问题
LiteParse v2.14.6 解析 PDF 必须使用云服务吗?
不需要。基础 PDFium 和内置 Tesseract 路径可在本机运行;HTTP OCR、远程 URL 和 LlamaParse 才会引入网络边界。
LiteParse 的所有发布包都是 v2.14.6 吗?
不是。Python、Node.js、Rust/CLI 与 WASM 已发布 2.14.6,而官方 Releases 页面列出的 Docker 最新版是 2.14.5,应按实际入口分别固定版本。
LiteParse 的 Markdown 能可靠还原复杂表格和图表吗?
不能保证。README 明确说复杂文档质量会变化,项目基准中的图表与数学类别也很弱,关键结果必须对照原页抽查。
配置 LiteParse HTTP OCR 会发送什么数据?
它会把待识别页面交给配置的 OCR 服务处理。服务地址、传输加密、日志和保留策略都属于新的数据边界。