OpenSource-Hub
L

liteparse

SHA-256
11.8k stars·开发工具·已提供 SHA-256 校验码,下载后可自行核对文件完整性

一个快速、开源的文档解析器,专注 PDF 提取,支持 Markdown/JSON/文本输出,内置 OCR,完全本地运行,无需云服务。

智能下载

下载 Download 版本

vpython-v2.10.0 · 9.1 MB

轻量级 PDF 解析神器,本地运行,秒转 Markdown 和 JSON。

核心功能

  • 高速 PDF 文本提取,带边界框定位
  • Markdown/JSON/文本多格式输出,支持标题、表格、列表重建
  • 内置 Tesseract OCR,也可对接 EasyOCR 等自定义服务
  • 支持 PDF、DOCX、XLSX、PPTX、图片等多种输入
  • Node.js/Python/Rust/WASM 多语言绑定,跨平台(Linux/macOS/Windows)

避坑指南

  • 复杂文档(密集表格、多栏布局、扫描件)的 Markdown 重建效果有限,建议此类文档使用 LlamaParse(云端版)。OCR 模式需额外安装 Tesseract 或配置 HTTP OCR 服务器。WASM 版本不包含 CLI 功能。

适用场景

  • 开发 RAG 知识库时批量提取 PDF 内容为结构化数据
  • 为 LLM 预处理文档,生成干净的 Markdown 供问答系统使用

详细介绍

LiteParse 是一个开源 PDF 解析工具,主打快速和轻量。它提供带边界框的空间文本提取、Markdown 重建(标题、表格、列表)以及 OCR 集成(支持 Tesseract 或自定义 HTTP 服务器)。与云端方案(如同团队的 LlamaParse)不同,LiteParse 完全本地运行,无需任何云依赖,非常适合离线或隐私敏感的文档处理流程。它支持多种输出格式(Markdown、JSON、纯文本)、截图生成、复杂度检测,并提供 Rust、Node.js、Python、WASM 等多语言绑定。相比 pdfplumber 等传统解析库,LiteParse 内置了更丰富的输出结构(包括 Markdown 和 OCR),支持更多输入格式(DOCX、XLSX、PPTX、图片),并覆盖 Linux、macOS、Windows 三大平台。采用 Apache-2.0 许可,GitHub 星标超过 11800。

标签

pdfdocument-parserocrmarkdownrustwasmllm

快速上手

1

下载安装包

点击上方按钮下载对应系统的安装包

2

安装软件

双击下载的安装程序,按提示完成安装

3

通过 npm 全局安装:npm i -g @llamaindex/liteparse

4

通过 pip 安装:pip install liteparse

5

使用命令行解析 PDF:lit parse 文档.pdf --format markdown -o 输出.md

安装指引
  1. 通过 npm 全局安装:npm i -g @llamaindex/liteparse
  2. 通过 pip 安装:pip install liteparse
  3. 使用命令行解析 PDF:lit parse 文档.pdf --format markdown -o 输出.md
文件完整性

已提供 SHA-256 校验码,下载后可自行核对文件完整性

该校验码提取自 GitHub 官方 Release 页面

SHA256 校验码

883462e89c4b24d9c92cf04eb67ed867563968c4c92559aa04540f034b11d8bf

该校验码提取自 GitHub Release 页面,下载后请自行核对文件完整性

本平台所有 SHA-256 校验码均提取自项目在 GitHub 官方 Release 页面发布的文件,未做任何修改。你可以通过 GitHub Releases 页面自行验证。

运维指引

卸载说明

根据安装方式不同:npm 全局卸载执行 npm uninstall -g @llamaindex/liteparse;pip 卸载执行 pip uninstall liteparse;Rust 卸载执行 cargo uninstall liteparse。

无额外依赖

下载后即可直接使用,无需安装其他运行环境

项目信息
开源协议Apache-2.0
最后更新2026-07-29T09:21:49Z
GitHub 仓库官方网站

相似推荐