文件分類與評估
即時辨識原生文字型 (TextBased)、掃描影像型 (Scanned)、純影像型 (ImageBased) 與混合型 (Mixed),並明確標示需 OCR 頁數。
直接在您的裝置上提取原生文字 PDF,精確重建多欄閱讀順序、表格結構與中繼資料。完全無須後端 API、零網路延遲、守護商業機密與隱私。
請從左側拖放或點選上傳 PDF 檔案,解析後的 Markdown 內容與中繼資料將即時呈現在此處。
結合分類偵測、版面分析、表格恢復與語意 Markdown 轉換,以極致效能實現高品質文件理解。
即時辨識原生文字型 (TextBased)、掃描影像型 (Scanned)、純影像型 (ImageBased) 與混合型 (Mixed),並明確標示需 OCR 頁數。
透過水平投射直方圖與智慧跨欄辨識,自文字座標重構多欄與報紙排版,保留自然的閱讀行文邏輯。
依序結合矩形框線、格線網格與對齊啟發式三大策略,自動精確還原儲存格邊界、跨頁續表與資料對齊。
支援 Type0 / CID 字型與 ToUnicode CMap 映射解碼,並在缺少字型對照表時提供智慧字元修復。
產出標題層級 (# ~ ######)、表格、清單、強調標籤、頁面分割註解,過濾冗餘裝飾,節省 LLM Token。
全套 Rust 核心透過 wasm-bindgen 編譯為瀏覽器本地模組,零後端伺服器依賴,安全無隱私風險。
底層管道將原始 PDF 解析、版面佈局推斷與語意 Markdown 轉換清晰解耦,保持極致輕量與高速。
自檔案讀取二進位資料至瀏覽器記憶體,無需建立本機暫存檔或網路傳輸。
同步計算文件分類置信度,並提取文字項目、座標、字型寬度與幾何向量矩形。
分析段落行高、欄位分佈與表格網格,將離散字元聚合成具結構的區塊。
轉換為簡潔的標準 Markdown 與詳細結構化中繼資料報告。
在無 OCR 的原生文字測試集上,pdf-inspector 在整體評分、閱讀順序與表格還原度上表現卓越,且速度領先。
| 解析引擎 | 綜合得分 | 閱讀順序 | 表格結構 | 標題階層 | 全語料庫耗時 |
|---|---|---|---|---|---|
| pdf-inspector (Rust/WASM) | 0.875 | 0.915 | 0.814 | 0.788 | 0.470s |
| LiteParse | 0.873 | 0.913 | 0.693 | 0.811 | 0.750s |
| OpenDataLoader | 0.831 | 0.902 | 0.489 | 0.739 | 2.569s |
| PyMuPDF4LLM | 0.735 | 0.886 | 0.401 | 0.424 | 17.117s |
| MarkItDown | 0.589 | 0.844 | 0.273 | 0.000 | 16.165s |