liteparse
SHA-256一个快速、开源的文档解析器,专注 PDF 提取,支持 Markdown/JSON/文本输出,内置 OCR,完全本地运行,无需云服务。
轻量级 PDF 解析神器,本地运行,秒转 Markdown 和 JSON。
核心功能
- 高速 PDF 文本提取,带边界框定位
- Markdown/JSON/文本多格式输出,支持标题、表格、列表重建
- 内置 Tesseract OCR,也可对接 EasyOCR 等自定义服务
- 支持 PDF、DOCX、XLSX、PPTX、图片等多种输入
- Node.js/Python/Rust/WASM 多语言绑定,跨平台(Linux/macOS/Windows)
避坑指南
- •复杂文档(密集表格、多栏布局、扫描件)的 Markdown 重建效果有限,建议此类文档使用 LlamaParse(云端版)。OCR 模式需额外安装 Tesseract 或配置 HTTP OCR 服务器。WASM 版本不包含 CLI 功能。
适用场景
- 开发 RAG 知识库时批量提取 PDF 内容为结构化数据
- 为 LLM 预处理文档,生成干净的 Markdown 供问答系统使用
详细介绍
LiteParse 是一个开源 PDF 解析工具,主打快速和轻量。它提供带边界框的空间文本提取、Markdown 重建(标题、表格、列表)以及 OCR 集成(支持 Tesseract 或自定义 HTTP 服务器)。与云端方案(如同团队的 LlamaParse)不同,LiteParse 完全本地运行,无需任何云依赖,非常适合离线或隐私敏感的文档处理流程。它支持多种输出格式(Markdown、JSON、纯文本)、截图生成、复杂度检测,并提供 Rust、Node.js、Python、WASM 等多语言绑定。相比 pdfplumber 等传统解析库,LiteParse 内置了更丰富的输出结构(包括 Markdown 和 OCR),支持更多输入格式(DOCX、XLSX、PPTX、图片),并覆盖 Linux、macOS、Windows 三大平台。采用 Apache-2.0 许可,GitHub 星标超过 11800。
标签
快速上手
安装软件
双击下载的安装程序,按提示完成安装
通过 npm 全局安装:npm i -g @llamaindex/liteparse
通过 pip 安装:pip install liteparse
使用命令行解析 PDF:lit parse 文档.pdf --format markdown -o 输出.md
- 通过 npm 全局安装:npm i -g @llamaindex/liteparse
- 通过 pip 安装:pip install liteparse
- 使用命令行解析 PDF:lit parse 文档.pdf --format markdown -o 输出.md
已提供 SHA-256 校验码,下载后可自行核对文件完整性
该校验码提取自 GitHub 官方 Release 页面
SHA256 校验码
883462e89c4b24d9c92cf04eb67ed867563968c4c92559aa04540f034b11d8bf该校验码提取自 GitHub Release 页面,下载后请自行核对文件完整性
本平台所有 SHA-256 校验码均提取自项目在 GitHub 官方 Release 页面发布的文件,未做任何修改。你可以通过 GitHub Releases 页面自行验证。
开源透明
查看 GitHub 源码卸载说明
根据安装方式不同:npm 全局卸载执行 npm uninstall -g @llamaindex/liteparse;pip 卸载执行 pip uninstall liteparse;Rust 卸载执行 cargo uninstall liteparse。
无额外依赖
下载后即可直接使用,无需安装其他运行环境