不是只有学术圈才需要写文献综述。做技术选型要读十几份白皮书,做行业研究要读一堆券商报告,做政策解读要读一批文件和专家评论——本质上都是同一件事:把散在几十份材料里的说法归拢成一条线,并且让每个结论都能翻回原处。
真正的痛点在最后半句。人工读完几十份材料,写出来的东西往往是另一种失败:观点看着没错,但说不清是谁、在什么时候、在哪一页说的。综述的命根子恰恰是可回溯——读者顺着你的引用翻过去能看到原句,他才敢信你这一段。
这篇讲的是怎么让 AI Agent 把这套流程跑起来。它和站内 用 AI Agent 做竞品调研 相邻但不同:调研是为判断下结论,综述是为既有说法编索引;前者重结论,后者重出处。它也和大模型对话框里直接问一句「帮我综述一下」完全不同——那样出来的东西,正好会踩中下面要讲的第一个坑。
一、先想清楚:综述的命门是「引用能翻到」
把话说直白一点:一篇综述可以观点平庸,但不能引用不实。而大模型在这一点上恰恰不可信。让它生成一条看起来规范的引注太容易了——作者、标题、刊名、年份、页码都能对仗工整,唯独那篇文献并不存在,或者存在但没有那句话。
所以第一条纪律是:所有材料必须是喂给它的,不允许它凭记忆补充。把角色从「作者」改成「提取器 + 归并器」,幻觉空间立刻小一个数量级。这条纪律和执行层面的做法,和站内 证据包怎么留 是一个思路:结论旁边必须躺着证据,而不是结论旁边躺着另一句话。
顺带说清楚一个常见误解:很多人以为难点在「读得快」,其实难点在「记清楚哪句话是谁说的」。速度是副产品,可核验才是目的。
二、五步流水线:从一堆 PDF 到一份可核验的综述
第一步:先把检索边界定死,再动手找
不要一上来就说「帮我找找关于 XX 的资料」。先和它把四件事敲定:主题范围(包含什么、明确排除什么)、时间窗(近三年还是近十年,以及为什么要这个窗口)、材料类型(期刊论文、技术白皮书、行业报告、政策文件还是全都算)、语言。这四条不定,后面一定会混进一堆跑题的材料,而你还很难发现——因为跑题的材料也是「相关领域」的。
如果材料是你自己攒的(比如一个文件夹里的几十份 PDF),那直接进第二步,把检索环节换成「入库 + 编目」。这一步的具体做法可以参考站内 OpenClaw 怎么搭企业内部知识库 里的文档入库流程。
第二步:粗筛,只读标题和摘要
粗筛阶段千万别让它读全文,成本高且容易越读越偏。让它只做一件事:逐份判断「该不该进入精读池」,并给出一句话理由。
输出格式固定成表格:材料、关键结论一句话、是否入选、入选理由、排除理由。人到这一步只需要扫一眼表格,把明显判断错的捞回来——这个动作十分钟就能做完,比让它重读一遍划算得多。
第三步:精读取证(这一步是分水岭)
这是最容易做错的一步。很多人让 Agent 「读完写个摘要」,结果拿到一堆平铺直叙的摘要,后面根本没法用。正确做法是让它抽卡片,而不是写摘要。每张卡片固定六个字段:
- 观点原句:原文里的那句话,允许摘引,不允许改写。
- 出处定位:文件名 + 页码或小节号,精确到能一翻就到。
- 作者与年份:谁说的、什么时候说的。
- 证据类型:实测数据 / 问卷调查 / 案例分析 / 个人观点 / 二手转述——这一栏决定了这条说法有多硬。
- 适用范围:这个结论是在什么条件下得出的(样本、行业、地区、模型版本)。
- 存疑标记:口径不清、样本过小、没有给出方法的地方,必须标出来,不能糊过去。
六栏里最容易被省略、也最关键的是「证据类型」和「适用范围」。一个访谈得来的观点和一个上千样本的实测,在综述里的分量完全不同;不标出来,读者就会把两者当同一回事。
第四步:观点归并,按问题而不是按材料组织
摘要式综述的通病是「一份材料一段」,读完不知道谁和谁在打架。归并时要强行换一种组织方式:按争议问题分组,每个问题下面列出有哪些说法、各自出自谁、分歧点具体在哪。
两种归并顺序各有用途:按问题归并适合看分歧,按时间归并适合看演进(某个结论是什么时候被推翻的)。选一个明写在开头,别混用。
到这一步材料量往往已经超出上下文能装下的范围,需要配合检索和分层摘要来做,思路可参考站内 上下文管理怎么做 和 嵌入模型和向量库怎么选。
第五步:引用核验(谁都别跳过这一步)
最后一步是把每条引用随机抽若干条,回到原文核对三件事:材料存在吗、原句真的这么说吗、结论有没有被断章取义。
这一步不能交给写正文的那个会话——同一个上下文里做的检查容易自证。换一个新会话、只给引用清单和原始文件,让它做纯粹的比对。核验结果分三档:一致、表述有偏差、找不到原句。第三档必须从正文里删掉或者降级成「有观点认为」。
三、四句必须交代给它的硬指令
不管用什么 Agent、什么模型,下面这四句建议直接写进系统提示或任务说明里,它们比任何技巧都管用:
- 「只允许使用我提供的材料,缺什么直接说缺,不要用你的记忆补充。」——堵住编造文献的主入口。
- 「每条观点后面必须带出处,写不出出处的观点不要写进正文。」——把「说不清」变成硬性失败。
- 「区分『原文说的』和『你推断的』,凡是推断必须显式标注。」——让读者知道哪部分需要自己再判断。
- 「材料之间互相矛盾时并列呈现,不要替我选一个。」——综述里最值钱的往往就是分歧本身。
这四条不改模型、不加插件,只是把要求说清楚,效果立竿见影。它们和站内 AI Agent 工具怎么设计 里强调的原则一样:约束要写进接口,不能靠默契。
四、三个最容易翻车的地方
第一个坑:把「没有出处」当成「常识」。模型有一种很强的倾向——遇到需要引用的地方,如果手边没有合适材料,它会顺手写一句听起来很像那么回事的话。这类句子读起来最舒服,也最危险。防法是要求它给每条观点标出「出处编号」,没有编号的一律不进正文。
第二个坑:把「新」当成「权威」。材料新鲜度和材料权威性是两回事。2026 年的一篇营销号解读,分量不如 2023 年的一份官方技术报告。所以卡片里要分开标注发布时间和证据类型,并在归并时明确:这是「最新说法」还是「最可靠说法」,两者冲突时怎么写。
第三个坑:综述写成摘要拼接。一段一段摘要摞起来,篇幅够了,信息密度却很低,而且看不出材料之间的关系。判断标准很简单:删掉任意一段,其他段落的逻辑是否还成立?如果成立,说明这篇其实没有综述结构,只是材料清单加长版。
五、优缺点和适合人群
它能省什么:粗筛和抽卡片这两步最省时间,几十份材料从「读一周」压到「一天顺完」是现实的。引用核验也终于变成可执行的流程,而不是「写完就发出去」。
它省不了什么:深度精读仍然不如人——特别是需要看懂公式推导、复杂图表和隐含前提的材料;判断「这个结论对我们的场景成不成立」也只能由人来做;原文是非扫描版或者没有电子文本时,它也无能为力。
适合谁:要交综述的研究生、做行业研究的分析师、做技术选型的工程师、写政策解读和内部调研材料的人。凡是「需要读一堆材料并让结论可回溯」的场景都适用。
不适合谁:需要原创理论贡献的写作——那部分没有任何工具能替;以及材料量很小(三五份)的情况,人工读反而更快,上流程是给自己找麻烦。
总结
- 一句话定位:把 Agent 当「提取器 + 归并器」,不要当「作者」——它负责找证据和归类,判断留给人。
- 五步流程:定检索边界 → 只读标题摘要做粗筛 → 精读抽六字段卡片 → 按问题(或时间)归并观点 → 换一个新会话做引用核验。
- 四句硬指令:只用我给的材料、没出处不写进正文、推断必须标注、矛盾时并列呈现。
- 三个坑:把没出处当常识、把新当权威、把摘要拼接当综述。
- 底线:引用核验必须人工抽检,且要在独立会话里做——这是整条流水线上唯一不能省的一步。
最后一句:Agent 不会让你的综述变深刻,但能让它变得可查。而在绝大多数场景里,可查就已经赢过一大半了。