实用指南
文本提取和视觉保留是两个不同任务
一个 PDF 可以同时包含文本层、位图、矢量图和被分散定位的表格文字。基础提取可能拿到所有单词,却丢失图注与图片、单元格与列标题之间的关系。DocKernel 浏览器预览会识别包含图像绘制操作的页面,并把这些页面以视觉形式放进 Markdown 预览,方便检查。但预览中使用的内嵌数据并不等于适合代码仓库、内容管理系统或长期发布的独立资源包。
稳定输出之前,要先决定哪些内容必须可编辑,哪些内容保留为视觉资源更可靠。叙述文字适合转换成标题和段落;行列关系清楚的简单表格可以重建为 Markdown 表格;复杂财务表、图表、表单或示意图则更适合保留图片,并附上简洁图注和上下文。登录后的转换任务在处理器返回资源时可以提供单独下载,让 Markdown 与图片文件按相对路径一起迁移。
视觉上下文重要时使用这套流程
- 产品手册中的截图必须与对应操作步骤保持相邻。
- 报告中的图表需要保留图注和来源页码,便于核对。
- 表格需要检查行列、合并单元格、换行和跨页延续是否正确。
- 文档迁移需要独立资源文件,而不是体积很大的 base64 内嵌图片。
操作流程
不丢失复核线索地转换视觉 PDF
- 01
先检查原文件
标出真正承载信息的图片和表格页面,区分装饰元素与核心内容。
- 02
运行浏览器预览
用本地提取检查文字顺序,并确认哪些页面被识别为视觉页面。
- 03
决定输出形式
简单表格转换成 Markdown;复杂视觉内容使用资源链接;同时补充图注和页码标记。
- 04
验证完整资源包
打开 Markdown 和每个资源文件,检查相对路径、图注、表格行列,并确认没有页面被静默遗漏。
转换示例
示例:让图示离开原 PDF 后仍能理解
合格输出不只是插入一张图,还会保留图示名称、描述性图注和页码标记。这样资源文件单独查看或进入代码仓库后,仍然能知道它表达什么。
PDF 原始内容
第 6 页
图 2:请求生命周期
[示意图:上传 → 排队 → 转换 → 下载]
处理时间中位数不包含排队时间。Markdown 输出
<!-- page: 6 -->
## 请求生命周期

*图 2:上传、排队、转换和下载阶段。*
处理时间中位数不包含排队时间。质量基准
图片与表格转换验收基准
视觉文档应按“含义是否保留下来”验收,而不是要求每个坐标都被复刻。不同页面可以采用不同的正确输出形式。
| 文档类型 | 建议路径 | 通过标准 |
|---|---|---|
| 以截图为主的操作手册 | Markdown 文字加独立图片资源 | 每条操作说明对应正确截图,所有资源相对路径都能打开。 |
| 简单对比表格 | 重建 Markdown 表格 | 列标题、行标签、数值和脚注抽查后与原文件一致。 |
| 密集图表、表单或合并单元格表格 | 保留图片并增加说明文字 | 不虚构单元格结构,同时保留图注、页码和周边解释。 |
这里展示的是验收矩阵,不是“所有 PDF 都有相同准确率”的承诺。正式批量处理前,请先用你自己的代表性文件进行测试。
视觉内容转换的限制
Markdown 本来就比 PDF 版式简单。某些视觉信息应当被诚实表示,而不是强行塞进不可靠的表格或文字近似结果。
- 浏览器预览使用数据地址内嵌图片时,Markdown 文件体积会明显增大。
- 矢量图和统计图不会自动变成可编辑的 Mermaid、SVG 源码或原始数据。
- 合并单元格、旋转表头、嵌套表格和跨页表格必须仔细人工检查。
- 只存在于图片中的图注和坐标轴文字,需要 OCR 才能变成可搜索文本。
常见问题
PDF 图片与表格转换常见问题
1浏览器转换器会导出独立图片文件吗?
浏览器预览可以渲染包含图片的页面,并在预览 Markdown 中保留视觉数据。独立可下载资源属于登录后的处理器工作流,并且需要当前配置的处理器实际返回资源。
2所有 PDF 表格都能转成 Markdown 表格吗?
不能。行列分隔清楚的简单表格比较适合;合并单元格、多层表头、自动换行和跨页结构容易产生错误,保留图片或单独结构化抽取通常更安全。
3为什么带内嵌图片的 Markdown 很大?
浏览器预览可能使用 base64 数据地址,让文件保持自包含。正式文档通常更适合使用独立图片和相对链接,因为体积更小、可缓存,也便于替换和管理。
4图表会自动转换成可编辑数据吗?
默认不会。图表可以作为图片保留,其中可见文字也可能被提取,但要恢复图表背后的原始数据,需要额外的图表或表格识别流程。