实用指南
为什么 Markdown 适合作为向量化之前的检查层
RAG 系统是否可信,首先取决于它实际检索到的文档表示。把 PDF 原始提取结果直接送进分块器,容易掩盖错乱的分栏顺序、每页重复的页眉页脚、丢失的章节边界和脱离正文的图注。Markdown 提供了可阅读的中间层:标题可以成为语义边界,页码注释可以支持来源追踪,列表结构依然可见,明显错误能在索引前修正。与其等到生成嵌入后排查匿名文本块,不如先把提取问题变成可以直接查看和版本管理的文件。
完成转换并不等于文档已经适合检索。导出后还应删除每页重复的页眉页脚,保留来源文件和页码元数据,根据内容意义而不是固定字符数机械分块,并只在上下文确实跨越边界时增加重叠。每个文本块都应记录原始文件名、章节和页码。生成答案时,应用才能展示可验证来源,让审核者快速返回 PDF 的正确页面,而不是只给出一个无法定位的文件名。
哪些场景适合先把 PDF 转成 Markdown
- 你正在用手册、政策、报告或论文建设可搜索知识库。
- 领域专家需要在索引前检查一份人类可读的中间文件。
- 检索答案需要页级来源,而不是只显示整个 PDF 文件名。
- 你想先统一处理混合文档,再决定分块大小、重叠和嵌入模型。
操作流程
四步准备可用于 RAG 的 PDF 内容
- 01
转换成 Markdown
启用页码标记并保留合理段落换行,让来源结构仍然可见。
- 02
清洗和标准化
删除重复页眉页脚,修正明显标题错误,让表格与图注靠近对应解释,并保留来源元数据。
- 03
按语义分块
优先使用标题、段落和主题转换作为边界;只有上下文确实跨区块时才添加重叠。
- 04
评估真实检索
准备代表性问题,检查召回文本块和页码是否正确,再调整转换或分块规则并扩大导入。
转换示例
示例:带页码的检索文本块
下面的输出把政策标题与页码放在一起。后续导入程序可以把来源文件和页码保存为元数据,不必重新猜测这段文字来自哪里。
PDF 原始内容
第 14 页
访问权限复核政策
负责人每季度检查一次有效账户。
例外情况必须注明负责人和到期日。Markdown 输出
<!-- page: 14 -->
## 访问权限复核政策
负责人每季度检查一次有效账户。
例外情况必须注明负责人和到期日。
元数据:source=security-handbook.pdf, page=14质量基准
RAG 文档准备质量基准
中间 Markdown 的结构质量和下游检索效果要分开评估。文件看起来整洁不代表一定召回正确;版式简单但标题与页码可靠的文本反而可能更适合检索。
| 文档类型 | 建议路径 | 通过标准 |
|---|---|---|
| 单栏政策手册 | 本地转换后按语义分块 | 代表性问题能召回正确章节,并保留对应来源页码。 |
| 包含脚注和图片的论文 | 转换、整理图注后再评估 | 摘要、方法和结论边界清楚,脚注与引用不会打乱主阅读顺序。 |
| 多栏报告或扫描附件 | 先 OCR 或人工复核再索引 | 空白块、交叉分栏和无法验证的内容不得进入正式知识库。 |
这里展示的是验收矩阵,不是“所有 PDF 都有相同准确率”的承诺。正式批量处理前,请先用你自己的代表性文件进行测试。
PDF 转换不能替代 RAG 系统设计
转换器可以暴露结构,但最终检索质量还取决于语料范围、元数据、分块、嵌入、排序、提示词和评估方法。
- 重复页眉和法律页脚如果不清理,可能在大量文本块中反复出现并污染召回。
- 跨页表格可能需要单独的结构化提取方式,而不是直接当普通段落。
- 页码标记适合追踪来源,生产系统通常应把它保存为元数据,而不是原样塞进每个答案。
- 敏感知识库必须在检索阶段执行访问控制,不能只依赖上传时的权限。
常见问题
PDF 转 Markdown 用于 RAG 的常见问题
1Markdown 一定比 PDF 原始文本更适合 RAG 吗?
不一定。Markdown 的主要价值是可见性和结构:人在索引前可以检查标题、页码、列表和提取失败。极简单的 PDF 可以直接提取,但 Markdown 通常更容易清洗、版本管理和审阅。
2每个 RAG 文本块都要包含页码标记吗?
转换时应保留页码,再把与文本块相关的页码写入元数据。这样既能支持引用,也不会让页面注释反复进入发送给模型的正文。
3PDF 转换后文本块应该多大?
不存在通用尺寸。先按章节和段落等语义边界分块,再用真实问题评估召回。根据文档写法和答案粒度调整长度与重叠,而不是只追求固定字符数。
4扫描 PDF 可以加入 RAG 知识库吗?
可以,但必须先做 OCR 和质量检查。空白页面、字符误识别或错乱阅读顺序在索引后可能变成语气自信但没有依据的回答,因此扫描件需要更严格的准入标准。