# pdf-to-excel **Repository Path**: xrlnewman/pdf-to-excel ## Basic Information - **Project Name**: pdf-to-excel - **Description**: PDF 表格提取 - 识别 PDF 中的表格转为 Excel(基于文本坐标,准确率受版面影响) - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-05-28 - **Last Updated**: 2026-05-28 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # PDF → Excel PDF 表格提取工具,把 PDF 中的表格内容转为 Excel,Electron 桌面应用。 ## 实现原理 1. 用 pdfjs-dist 提取 PDF 每页所有文本块(带 x/y 坐标和宽度) 2. 按 y 坐标聚类成"行" 3. 按 x 坐标聚类成"列"(统计所有文本左侧 x 的分布找列边界) 4. 把每行的文本分配到对应列 5. 每个 PDF 页面 → 一个 Sheet ## 准确率 | 场景 | 效果 | |---|---| | 纯表格 PDF(如银行流水、考勤表) | 准确率高,✅ 推荐 | | 表格 + 段落混排 | 中等,段落会污染表格 | | 多列布局 | 差,会拍平 | | 扫描件(图片型 PDF) | 完全不行,需要先 OCR | | 单元格合并的复杂表头 | 差 | **纯 JS 方案的天花板**。专业表格提取建议用 Tabula / Camelot(Python)或商业工具。 ## 用法 1. 添加 PDF 2. 可选:手动指定列边界(高级模式) 3. 默认自动检测列 4. 导出为 .xlsx ## 开发 ```bash git clone https://gitee.com/xrlnewman/pdf-to-excel.git cd pdf-to-excel npm install npm start ``` MIT © xrlnewman