“总结这份 PDF”往往会得到一段流畅但用处不大的摘要。问题不一定是模型能力,而是你没有告诉它阅读目的,也没有要求保留证据。
阅读前先写三个问题
假设你拿到一份行业报告,不要立刻上传。先写清楚你要用它做什么:
- 报告对市场规模的核心判断是什么?
- 哪些数据支持这个判断,数据年份和来源是什么?
- 哪些限制会影响我们采用这些结论?
问题会决定模型关注什么。如果你只说“总结”,它只能猜测重点。
先抽取事实卡片
对每一章使用相同结构:
阅读这一章,只提取与三个研究问题有关的信息。
每条输出:
- 结论;
- 原文证据或数据;
- 页码/章节;
- 作者给出的限制;
- 你的置信度(高/中/低)及原因。
如果原文没有回答,请明确写“本章未提供”。
页码可能因 PDF 解析方式产生偏差,所以重要数据仍要回到原文件核验。
再做跨章节综合
所有章节完成后,把事实卡片而不是整份 PDF 交给模型:
请基于事实卡片回答三个研究问题。
区分:
1. 多个章节共同支持的结论;
2. 仅出现一次、需要谨慎使用的结论;
3. 不同章节之间的矛盾。
每个结论后标注证据卡片编号。
这个过程会明显降低“模型写了一段漂亮总结,却找不到出处”的情况。
表格和图表单独处理
对于关键表格,直接让模型输出数字可能不可靠。先指定列名、单位和时间范围,再逐行核对。图表则要求描述趋势和异常点,不要让模型根据模糊图片猜精确值。
最终交付格式
一份可用的研究摘要至少包含:一句话结论、三条关键证据、适用范围、限制、待验证问题和原文位置。这样接收者既能快速阅读,也能在需要时回到证据。
常见问题
PDF 太长,模型一次读不完怎么办?
按章节拆分,先生成每章的事实卡片,再把事实卡片汇总。不要分别总结后直接拼接结论。
扫描版 PDF 为什么识别不准确?
扫描版需要先做 OCR。表格、脚注和双栏排版容易错位,关键数字应回到原页核验。