PDF Inspector:更准确地将 PDF 转换为 Markdown

PDF Inspector 会在将 PDF 转换为 Markdown 之前分析每一页。

它会保留合理的阅读顺序、表格、标题、列表、链接和代码,并在需要时选择性使用 OCR。

开始转换

1

上传待转换的文件

Upload your file

Drag and drop or click to select

或者输入网页 / 公开文件的 URL

0/3-升级至 30

隐私与性能: 文件处理完全在您的浏览器中进行,因此文件不会被上传。处理速度可能因设备和浏览器环境而有所不同。

如何检查 PDF 并将其转换为 Markdown

PDF Inspector 将文档分析与转换结合起来,让每一页采用合适的提取路径。

从设备选择的文件会在本地处理,并生成可在下载前预览的 Markdown。

1

添加您的 PDF

从设备选择 PDF,或提供公开文件 URL,然后将其加入转换队列。

2

检查页面结构

让 PDF Inspector 识别文档类型、复杂版式、需要 OCR 的页面以及潜在的字体编码问题。

3

使用选择性 OCR 转换

直接转换嵌入文本;启用自动 OCR 后,仅将被标记的扫描页或图片页交由 OCR 处理。

4

检查并下载 Markdown

预览重建后的标题、段落、列表、表格、链接和代码块,然后将结果下载为 Markdown 文件。

为什么 PDF 转换为 Markdown 前需要先检查

PDF 描述的是内容在页面上的位置,而不是这些内容在 Markdown 中应当如何阅读。

PDF Inspector 会先检查视觉页面背后的信号,再决定如何提取内容。

一个文件可能包含不同类型的页面
一份数字报告可能同时包含可选择文本、扫描附件、纯图片插页和混合页面。对整个文件使用同一种提取方式,可能遗漏内容,也可能在不需要的页面上浪费 OCR 时间。
视觉顺序不等于阅读顺序
PDF 文本通常以带坐标的片段保存。如果缺少字体和坐标上下文,双栏论文、侧边栏、图注和从右向左的文字可能会被错误拼接。
表格未必以数据形式存在
许多 PDF 通过线条和独立放置的文字绘制表格,而不是保存真实的行列。财务报表、脚注以及跨页续表都需要版面感知的重建。
Image 1

为什么使用 PDF Inspector 将 PDF 转换为 Markdown

先依据 PDF 的实际信号作出判断,再生成更易核对、编辑和复用的 Markdown。

避免整份文档都使用 OCR
数字文本页面保持快速的原生提取,只为真正需要的页面保留 OCR,从而减少重复文字和不必要的图片识别。
保护本地文件隐私
PDF Inspector 在 Web Worker 中以 WebAssembly 运行 Rust 解析器,因此从设备选择的 PDF 会直接在浏览器中处理,无需上传文件或往返服务器。
保留复杂的阅读流程
位置感知提取能让 Markdown 按合理顺序呈现分栏和从右向左的段落,而不是按照 PDF 内部存储顺序简单铺平所有文字片段。
保留更多表格含义
基于绘图和文字对齐的检测,为有边框及无边框表格提供转换为 Markdown 的路径,包括普通文本提取器会拆散到多行的版式。
生成便于核对的 Markdown
标题、列表、代码块、强调、链接、表格和分页边界,让输出在进入文档或检索系统前更容易与原文件进行比较。
使用轻量的第一步解析
PDF Inspector 的核心解析器使用 Rust 编写,并依赖 lopdf 解析 PDF;文本型页面无需 ML 模型,只有启用 OCR 且页面被路由到该流程时才会加载 OCR 模型。

PDF Inspector 与 PDF 转 Markdown常见问题

关于文档分类、结构化提取、OCR、隐私和转换限制的清晰解答。