跳转到正文

扫描文档转换流程

OCR PDF 转 Markdown:扫描件转换工具

把纯图片页面转换成可检查、可编辑的 Markdown,同时明确区分 OCR 与普通文本提取。先用浏览器工具检测 PDF 是否含可选文字;没有文字时,再对支持的扫描件使用登录后的 AI 转换流程。

试用浏览器预览

把 PDF 转成 Markdown

上传 PDF,预览干净的 Markdown 导出结果。可选择文本会在本地提取,包含图片的页面会保留为 Markdown 视觉预览。

就绪
输出选项

本地预览支持文本提取和页面视觉保留,文件上限为 25 MB。OCR、独立资源文件、批量任务和历史记录属于云端工作流。

Markdown 预览会显示在这里

上传 PDF 后,在下载前检查提取出的标题、段落、页码标记和保留的视觉页面。

扫描页面可以通过付费 AI 工作流转换为可搜索 Markdown。

云端批量工作流

一次排队转换多个 PDF

最多上传 20 个 PDF,逐个跟踪任务状态;即使关闭浏览器,也能在账户中查看结果和失败项。

实用指南

为什么扫描 PDF 必须走不同的转换路径

普通 PDF 文本提取器读取的是文件中已经存在的字符层;扫描件往往只有整页图片,所以人眼看起来清晰,程序却可能提取不到任何文字。DocKernel 会把这一区别直接显示出来:含可选文字的 PDF 优先在浏览器本地处理,预览提示“未检测到文本”时,才进入需要登录的 AI/OCR 转换路径。这样可以避免生成空白 Markdown,也能在文件进入笔记、代码仓库或知识库之前建立明确的检查节点。

OCR 效果会受到分辨率、对比度、页面倾斜、语言、字体、分栏、手写内容、印章和压缩噪点影响。合理目标不是逐像素复制 PDF,而是得到阅读顺序基本正确、标题和段落清楚、页码可追踪、关键字段便于复核的 Markdown。原始 PDF 应继续作为记录依据;姓名、日期、金额、编号和法律文本要逐项核对;复杂表格、签名或视觉页面应进入人工复核,而不能把机器输出直接当成已经验证的事实。

哪些情况适合 OCR PDF 转 Markdown

  • PDF 看起来有文字,但选中或复制后得不到可用内容。
  • 文件来自扫描仪、手机拍照、传真归档或纯图片导出。
  • 你需要建立可搜索笔记或 RAG 数据,并且能够复核姓名、日期、金额与页码。
  • 一个混合 PDF 同时包含正常文本页和少量扫描页、照片页。

操作流程

用四个可控步骤把扫描 PDF 转成 Markdown

  1. 01

    先运行本地检测

    上传 PDF 并启动浏览器转换。如果文件带有文本层,可能无需上传服务器就能得到可用结果。

  2. 02

    确认确实需要 OCR

    预览没有检测到文本时,先排除加密、损坏或不支持的文件,并检查页面是否确实由图片组成。

  3. 03

    启动 AI 转换

    登录后对支持的文件运行 OCR 流程。当前前端保护限制为 10 MB,并且最多处理 20 张页面图像。

  4. 04

    复核后再使用

    对照原 PDF 检查标题、姓名、日期、数字、表格、脚注和跨页顺序,再决定是否发布或写入知识库。

转换示例

示例:扫描项目备忘录转成可编辑 Markdown

这个代表性示例的输入是一张纯图片页面。合格输出需要保留文档标题、日期、列表结构和页码标记,让审核者能快速回到扫描原件确认不确定内容。

PDF 原始内容

[扫描页面图片]
项目交接备忘录
日期:2026 年 9 月 8 日
1. 导出归档
2. 核对 24 条记录
3. 上报无法辨认的签名

Markdown 输出

<!-- page: 1 -->

# 项目交接备忘录

**日期:** 2026 年 9 月 8 日

1. 导出归档
2. 核对 24 条记录
3. 上报无法辨认的签名

> 复核提示:签名内容以扫描原件为准。

质量基准

按文档类型划分的 OCR 验收基准

下面的矩阵用于判断哪些文件可以直接进入编辑,哪些文件必须增加人工检查。这里的“通过”表示完成指定复核后可用于目标场景,并不代表每个字符和版式都能自动完全一致。

文档类型建议路径通过标准
清晰的 300 DPI 印刷体扫描件OCR 云端转换标题与段落阅读顺序正确,抽查姓名、日期和数字无误。
带阴影、倾斜的手机照片先校正或重扫,再 OCR旋转和对比度处理后文字可读,所有关键字段逐项复核。
手写、印章或密集表单OCR 初稿加人工录入机器结果只作为草稿,业务字段必须全部与原件核对。

这里展示的是验收矩阵,不是“所有 PDF 都有相同准确率”的承诺。正式批量处理前,请先用你自己的代表性文件进行测试。

OCR 的限制与复核风险

OCR 会对页面进行识别和判断,因此会产生普通文本层提取不存在的错误类型。应根据错误后果安排不同强度的检查。

  • 低分辨率扫描可能混淆 O 与 0、l 与 1、标点或相近汉字。
  • 分栏边界不清时,左右栏可能被交叉读取,导致句子顺序错误。
  • 手写、数学公式、签名、印章和装饰字体必须人工确认。
  • 加密、损坏、超大或页数异常的文件通常需要先拆分、解密或重新导出。

常见问题

OCR PDF 转 Markdown 常见问题

1DocKernel 能把纯图片 PDF 转成 Markdown 吗?

浏览器预览会先检查文本层。没有检测到文字时,界面可对符合限制的扫描件提供登录后的 AI 转换路径。OCR 可能误读字符和阅读顺序,所以结果仍需复核。

2OCR 能完整保留原 PDF 版式吗?

目标是得到实用的 Markdown 结构,而不是逐像素复刻。标题、段落、列表、页码和关键标签比绝对坐标更重要,复杂表单和视觉版式通常需要人工整理。

3OCR PDF 转换是否私密?

可选文字预览在浏览器本地运行;OCR 属于另一条由服务端支持的处理路径,可能涉及配置的处理服务、存储和保留策略。敏感材料上传前请先阅读安全和隐私页面。

4怎样提高扫描 PDF 的 OCR 准确率?

使用平整、高对比度、方向正确的扫描件,去掉大面积空白边缘,避免阴影和运动模糊,过大的文档先拆分。姓名、日期、金额、证件号和法律文字必须再次核对。

相关 PDF 转 Markdown 工作流