PDF Inspector:更準確地將 PDF 轉換為 Markdown

PDF Inspector 會在將 PDF 轉換為 Markdown 前分析每一頁。

它會保留合理的閱讀順序、表格、標題、清單、連結和程式碼,並在需要時選擇性使用 OCR。

開始轉換

1

上傳待轉換的檔案

Upload your file

Drag and drop or click to select

或者輸入網頁 / 公開檔案的 URL

0/3-升級至 30

隱私與效能: 檔案處理完全在您的瀏覽器中進行,因此檔案不會上傳。處理速度可能會因裝置和瀏覽器環境而異。

如何檢查 PDF 並將其轉換為 Markdown

PDF Inspector 將文件分析與轉換結合,讓每一頁採用合適的擷取路徑。

從裝置選取的檔案會在本機處理,並產生可在下載前預覽的 Markdown。

1

加入您的 PDF

從裝置選取 PDF,或提供公開檔案 URL,然後將它加入轉換佇列。

2

檢查頁面結構

讓 PDF Inspector 辨識文件類型、複雜版面、需要 OCR 的頁面,以及可能的字型編碼問題。

3

使用選擇性 OCR 轉換

直接轉換內嵌文字;啟用自動 OCR 後,只將標記的掃描頁或圖片頁交由 OCR 處理。

4

檢查並下載 Markdown

預覽重建後的標題、段落、清單、表格、連結和程式碼區塊,再將結果下載為 Markdown 檔案。

為什麼 PDF 轉換為 Markdown 前需要先檢查

PDF 描述的是內容在頁面上的位置,而不是這些內容在 Markdown 中應如何閱讀。

PDF Inspector 會先檢查視覺頁面背後的訊號,再決定如何擷取內容。

一個檔案可能包含不同類型的頁面
一份數位報告可能同時包含可選取文字、掃描附件、純圖片插頁和混合頁面。對整個檔案使用同一種擷取方式,可能遺漏內容,也可能在不需要的頁面上浪費 OCR 時間。
視覺順序不等於閱讀順序
PDF 文字通常以帶座標的片段儲存。若缺少字型和座標脈絡,雙欄論文、側邊欄、圖說和由右至左的文字可能會被錯誤拼接。
表格未必以資料形式存在
許多 PDF 透過線條和獨立放置的文字繪製表格,而非儲存真正的列與欄。財務報表、註腳和跨頁續表都需要感知版面的重建。
Image 1

為什麼使用 PDF Inspector 將 PDF 轉換為 Markdown

先依據 PDF 的實際訊號作出判斷,再產生更容易核對、編輯和重複使用的 Markdown。

避免整份文件都使用 OCR
數位文字頁面維持快速的原生擷取,只為真正需要的頁面保留 OCR,減少重複文字和不必要的圖片辨識。
保護本機檔案隱私
PDF Inspector 在 Web Worker 中以 WebAssembly 執行 Rust 解析器,因此從裝置選取的 PDF 會直接在瀏覽器中處理,不需上傳檔案或往返伺服器。
保留複雜的閱讀流程
位置感知擷取能讓 Markdown 按合理順序呈現分欄和由右至左的段落,而非按照 PDF 內部儲存順序直接攤平所有文字片段。
保留更多表格含意
基於繪圖和文字對齊的偵測,為有框線及無框線表格提供轉換為 Markdown 的路徑,包括一般文字擷取器會拆散到多行的版面。
產生便於核對的 Markdown
標題、清單、程式碼區塊、強調、連結、表格和分頁邊界,讓輸出在進入文件或檢索系統前更容易與原始檔案比較。
使用輕量的第一步解析
PDF Inspector 的核心解析器以 Rust 編寫,並依賴 lopdf 解析 PDF;文字型頁面不需要 ML 模型,只有啟用 OCR 且頁面被導向該流程時才會載入 OCR 模型。

PDF Inspector 與 PDF 轉 Markdown 常見問題

關於文件分類、結構化擷取、OCR、隱私和轉換限制的清楚解答。