Skip to content

功能请求:支持 Paddle OCR 作为 PDF 解析引擎 #35

Description

@moyu12-ae

功能请求:支持 Paddle OCR 作为 PDF 解析引擎

背景

目前 DocuTranslate 的 convert_engine 支持以下 PDF 解析引擎:

  • mineru(MinerU Cloud API)
  • mineru_deploy(MinerU 本地部署)
  • docling(Docling)
  • identity(不做转换)

这些引擎都各有优劣,但社区中对 Paddle OCR 的呼声也很高。Paddle OCR 是百度开源的 OCR 引擎,具有以下优势:

Paddle OCR 的优势

  1. 完全免费开源 — 无需 API Token,无调用次数限制
  2. 本地部署 — 数据不出本地,适合隐私敏感场景
  3. 多语言支持 — 支持 80+ 种语言识别
  4. 高精度 — 在中文场景下识别准确率极高,特别适合中文学术论文、书籍翻译
  5. 表格识别 — PaddleOCR 的表格识别能力(Table Recognition)非常出色
  6. 活躍社区 — GitHub 40k+ Stars,文档丰富

期望行为

convert_engine 中新增 paddle_ocr 选项,新增相关配置参数(如语言选择、是否启用表格识别等),实现 X2MarkdownConverter 接口。

建议的配置参数

# 新增 convert_engine 选项: "paddle_ocr"
paddle_ocr_lang: str = "ch"            # OCR 语言
paddle_ocr_table_enable: bool = True   # 是否启用表格识别
paddle_ocr_formula_enable: bool = True # 是否启用公式识别

替代方案

目前用户只能使用 MinerU (需付费 Token) 或 Docling 作为替代,但缺少纯本地且免费的 OCR 方案。

参考资料

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions