# Pdftomarkdown **Repository Path**: ThalloVerShures_Fooljoe/Pdftomarkdown ## Basic Information - **Project Name**: Pdftomarkdown - **Description**: ???PDF?Markdown???,??AI?????F# + .NET 10 + PdfPig,???????????????AI????? - **Primary Language**: Unknown - **License**: MIT - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-09-01 - **Last Updated**: 2026-09-19 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # Pdftomarkdown 工具 ## 基本信息 - **工具名称**:Pdftomarkdown - **版本**:v2.2.2(最新 Release 版) - **复制时间**:2026-09-03 - **大小**:约 8-10 MB - **可执行文件**:`Pdftomarkdown.exe` - **目标框架**:.NET 10.0 ## 版本历史 ### v2.2.2(当前版本) - MuPDF高DPI页面渲染,解决矢量图形提取问题 - 220 DPI最优值计算 - 5条设计哲学 ### v2.2.1 - 使用PdfPig.Rendering.Skia的GetSKBitmap替代TryGetPng - 显著改善图片提取能力 ### v2.2.0 - 使用XianLang标准工作流程重写 - 解决之前版本调试不好的性能瓶颈问题 ## 工具说明 高性能 PDF 转 Markdown 转换器,专为 AI 阅读优化。 ### 主要特性 - **纯 .NET 实现** — F# + .NET 10 + PdfPig,无需本地依赖 - **AI 友好输出** — YAML 元数据头 + 结构化 Markdown + 页码标记 - **自动缩短文件名** — 优先用文档标题,超长截断+哈希后缀,原始名保留在元数据 - **文件夹结构** — 每文档独立文件夹 + images 子文件夹,图片引用带三层位置标记 - **智能文本合并** — 按行分组+同行合并+段落合并,减少碎片化 - **标题/列表/图片/表格识别** — 基础结构提取框架 - **矢量图形提取** — MuPDF高DPI页面渲染,220 DPI最优值 - **形式化验证** — .flyre 规范 + 运行时断言模块 - **批量并行处理** — 6线程并行、实时进度、错误日志、增量更新、断点续传 - **排除路径** — 支持排除特定文件夹 ### 使用方法 ```bash # 转换单个PDF Pdftomarkdown.exe input.pdf output.md # 批量转换文件夹 Pdftomarkdown.exe --input <输入文件夹> --output <输出文件夹> # 6线程并行批量转换 Pdftomarkdown.exe --input <输入文件夹> --output <输出文件夹> --threads 6 ``` ### 依赖文件 - `Pdftomarkdown.exe` — 主程序 - `Pdftomarkdown.dll` — 主程序库 - `FSharp.Core.dll` — F# 核心库 - `UglyToad.PdfPig.*.dll` — PdfPig PDF 解析库 - 各语言资源文件(cs/de/es/fr/it/ja/ko/pl/pt-BR/ru/tr/zh-Hans/zh-Hant) ## 来源 - **项目仓库**:https://gitee.com/ThalloVerShures_Fooljoe/Pdftomarkdown - **源代码位置**:`D:\AI工作区\家用电脑-QT8T6EA\Pdftomarkdown` - **编译配置**:Release / net10.0 - **Git提交**:aa71874(v2.2.2) ## 注意事项 - 本目录只包含编译好的可执行文件,不包含源代码 - 源代码和完整项目请参考上方的源代码位置 - 如需更新版本,请从源代码位置重新编译后复制