專為 AI 代理人與結構化檢索打造

極速 PDF 本地結構解析 與 Markdown 轉換

直接在您的裝置上提取原生文字 PDF,精確重建多欄閱讀順序、表格結構與中繼資料。完全無須後端 API、零網路延遲、守護商業機密與隱私。

選擇或拖放 PDF 本機解析

拖放 PDF 檔案至此
原生文字或掃描影像 · 最大支援 100 MB
快速測試示範檔案
請選擇或拖放 PDF 檔案以開始本機檢查。

文件中繼資料 (Metadata) PDF DocInfo

尚未載入 PDF 檔案

請從左側拖放或點選上傳 PDF 檔案,解析後的 Markdown 內容與中繼資料將即時呈現在此處。

核心特點

輕量聚焦的 PDF 工具鏈

結合分類偵測、版面分析、表格恢復與語意 Markdown 轉換,以極致效能實現高品質文件理解。

01 · detector.rs

文件分類與評估

即時辨識原生文字型 (TextBased)、掃描影像型 (Scanned)、純影像型 (ImageBased) 與混合型 (Mixed),並明確標示需 OCR 頁數。

02 · layout.rs

閱讀順序還原

透過水平投射直方圖與智慧跨欄辨識,自文字座標重構多欄與報紙排版,保留自然的閱讀行文邏輯。

03 · tables/

表格結構恢復

依序結合矩形框線、格線網格與對齊啟發式三大策略,自動精確還原儲存格邊界、跨頁續表與資料對齊。

04 · tounicode.rs

字型與編碼解碼

支援 Type0 / CID 字型與 ToUnicode CMap 映射解碼,並在缺少字型對照表時提供智慧字元修復。

05 · markdown/

結構化語意 Markdown

產出標題層級 (# ~ ######)、表格、清單、強調標籤、頁面分割註解,過濾冗餘裝飾,節省 LLM Token。

06 · wasm/

純前端 WebAssembly

全套 Rust 核心透過 wasm-bindgen 編譯為瀏覽器本地模組,零後端伺服器依賴,安全無隱私風險。

系統架構

一次解析 · 清晰階段管道

底層管道將原始 PDF 解析、版面佈局推斷與語意 Markdown 轉換清晰解耦,保持極致輕量與高速。

STAGE 1 · 輸入

PDF 位元組載入

自檔案讀取二進位資料至瀏覽器記憶體,無需建立本機暫存檔或網路傳輸。

STAGE 2 · 偵測與提取

detector + extractor

同步計算文件分類置信度,並提取文字項目、座標、字型寬度與幾何向量矩形。

STAGE 3 · 版面與表格

layout + tables

分析段落行高、欄位分佈與表格網格,將離散字元聚合成具結構的區塊。

STAGE 4 · 輸出

markdown/convert.rs

轉換為簡潔的標準 Markdown 與詳細結構化中繼資料報告。

基準評測

OpenDataLoader 200 份 PDF 實測

在無 OCR 的原生文字測試集上,pdf-inspector 在整體評分、閱讀順序與表格還原度上表現卓越,且速度領先。

解析引擎 綜合得分 閱讀順序 表格結構 標題階層 全語料庫耗時
pdf-inspector (Rust/WASM) 0.875 0.915 0.814 0.788 0.470s
LiteParse 0.873 0.913 0.693 0.811 0.750s
OpenDataLoader 0.831 0.902 0.489 0.739 2.569s
PyMuPDF4LLM 0.735 0.886 0.401 0.424 17.117s
MarkItDown 0.589 0.844 0.273 0.000 16.165s