先做个小测试。
打开你最近那篇稿子的参考文献列表,随机挑三条,把标题复制到 PubMed 或者 Google Scholar 里搜一下。
如果三条都能搜到,恭喜。如果有一条搜不到,别急着说"可能是数据库收录不全",先看完这篇。
今年 5 月,《柳叶刀》(The Lancet)刊出一封通信,哥伦比亚大学数据科学研究所的 Maxim Topaz 团队做了一次大规模审计。结论一句话:生物医学文献里编造的参考文献,两年涨了 12 倍。
这篇讲清楚五件事:这组数字是怎么来的、为什么假文献特别难被发现、几个真实案例、学界正在吵什么、以及你投稿前该怎么自查。
一、这组数字:近 250 万篇论文,9710 万条参考文献
先把研究本身说清楚,因为数字背后的方法比数字更值得看。
审计范围: 近 250 万篇 PubMed 收录论文(PubMed Central 开放获取子集),时间跨度 2023 年 1 月到 2026 年 2 月。
核验规模: 团队成功核验了 9710 万条参考文献。
筛出结果: 识别出 4406 条"编造"的参考文献,分布在 2810 篇论文里。
最刺眼的那条趋势线:
| 时间 | 至少含一条假文献的论文比例 |
|---|---|
| 2023 年 | 约 1/2828 |
| 2025 年 | 1/458 |
| 2026 年前七周 | 1/277 |
两年,12 倍。 而且团队定位到激增的拐点在 2024 年中,这个时间和 AI 写作工具大规模普及吻合。
研究里还有两个细节值得单独拎出来:
第一,98% 以上的问题论文,出版方零动作。 审计做到 2026 年 2 月的时候,被查出含假文献的论文里,超过 98% 没有见到任何出版方处理,既没撤稿,也没勘误,就那么挂在数据库里,继续被人检索、被人引用。
第二,综述类文章的编造率比其他类型高 57%。 这一点对做文献综述的人是直接警告:你在综述里引的那些"我没读过但看着相关"的文献,是风险最集中的地方。
顺便提一句方法上的诚实之处:团队自己用了 AI 来"区分真正的编造和格式差异",比如非正式缩写的标题。也就是说,这份名单不是靠人眼一条条看出来的。这个方法本身有争议,第四节会讲。
二、为什么假文献特别难被发现:它长得太正常了
很多人下意识以为,AI 编的参考文献应该一眼就能看出破绽。
恰恰相反。 研究里对这些假文献的描述是:它们"并不明显有缺陷",讨论的是具体的科学主题,格式正确,署的是真实存在的研究者,发表日期也合理。
把这几个特征拆开看,你就明白它为什么能一路混过审稿:
- 标题像真的。 大模型是在海量文献上训练的,它非常清楚某个领域的论文标题该长什么样,甚至能生成一个比真实标题更"标准"的标题。
- 作者是真人。 它会挑这个领域里真实存在、发表量大的作者,署上去毫无破绽。
- 期刊是真刊、年份合理、卷期页码格式规范。
- 甚至 DOI 都有。 后续有读者在评论区补充了自己发现的案例:某篇材料学论文里出现了 9 条格式完整但无法解析的假 DOI,作者名甚至用了 J. Doe、J. Smith 这类占位名。
所以审稿人扫一眼参考文献列表,看到的是一份体例整齐的清单。它的破绽只有一个:点进去,那篇论文不存在。
而审稿人通常不会去点。这就是问题所在。
三、四个真实案例
抽象的比例不好体感,几个具体案例更能说明这事有多普遍。
案例一:世界银行的一份报告,至少 14 条假文献。 2025 年 12 月被曝出,一份关于肥胖趋势的世界银行报告里,至少 14 条参考文献不存在。
案例二:Springer Nature 期刊一篇肠道手术管理的文章,14 条里 12 条不存在。 2026 年 3 月,一位图书馆员发现了这个数字。14 条参考文献,12 条查不到。这已经不是"顺手引错了"能解释的比例了。
案例三:Retraction Watch 的联合创始人,被"署名"了一篇他没写过的论文。 2025 年 11 月,Ivan Oransky 本人成了某篇 Springer Nature 期刊文章里一条虚构参考文献的作者。他自己是专门追踪撤稿的人,结果被 AI 凭空安上了一篇作品。
案例四:一位获奖的韩国研究学者,被指使用 AI 编造的引用。 这是今年 6 月的报道。案例说明这件事不分领域、不分资历。
还有一个极端例子来自研究本身: Topaz 举了一篇文章,30 条参考文献里有 18 条像是编的。 这篇文章仍然发表了。
不过要给个平衡的数字:在他们的问题论文数据集里,91% 只有 1 到 2 条假文献。 Topaz 的判断是,这些"很可能是作者用了 AI 工具但没核验输出的诚实失误"。
四、正在吵的问题:该撤稿,还是该勘误
这一节是这个事件里最值得读的部分,因为它暴露了学界对"AI 时代的失误算什么"还没有共识。
四种立场,都有分量:
| 立场 | 谁在说 | 理由 |
|---|---|---|
| 出现幻觉文献就该撤稿 | 前 JAMA 主编 Howard Bauchner、前 JAMA Pediatrics 主编 Frederick Rivara | 作者同意署名,就"对整篇论文的全部内容负责"。撤稿能让作者更认真对待参考文献 |
| 看这条文献起什么作用 | NIH 的 David Resnik、研究者 Topaz 本人 | 幻觉文献是不是论文结论的核心?核心才撤,附带的一两条更适合勘误加透明说明 |
| 不能自动等于学术不端 | PLOS 出版伦理负责人 Renee Hoch | 学术不端有明确定义,包含"故意"这个要素;是否构成不端由机构认定,不是期刊或出版社说了算 |
| 这项研究本身要打个折 | Cochrane 的 Ella Flemyng | 结论依赖 AI 辅助审计,虽然在 500 条记录上做过验证,但方法细节不足;可信度更取决于系统怎么设计、误差怎么评估、过程能不能复现 |
我个人觉得最值得记住的是第五种声音。 西北大学的 Mohammad Hosseini 认为这项研究只是"低垂的果实"、"冰山一角",更大更重要的问题是:那些不是完全凭空编造,但不准确、有偏、不完整的 AI 生成引用。 他的原话大意是,我们连检测它们都还做不到。
这句话很清醒。假文献是可以查的:点开、搜、看在不在。但"这条真实文献到底支不支持你这句话",没有任何工具能替你判断。
出版方那边在动了: Taylor & Francis 表示在投入技术、专职人员和流程来筛查有问题的引用,含疑引用超过一小部分、或明显影响稿件整体完整性的,通常会直接拒稿。PLOS 表示在评估"全系统引文完整性筛查"的方案。Topaz 团队的建议更直接:publishers should integrate automated reference verification into submission workflows before peer review begins(出版方应把自动引文核验嵌进投稿流程,放在同行评审开始之前)。
也就是说,引文核验正在变成投稿流程里的一道新关口。 这和查重、AI 率、图片检测走的是同一条路:先是靠人抽查,然后变成系统前置。
五、说个不好听的:查重查不出这个
这里要把工具的边界讲明白,免得有人误会。
查重系统查的是"字面重复"。 它把你的文本和数据库里的文献比对,找出重合的片段。所以它能发现:
- 你抄了别人的句子;
- 你自我重复了;
- 你的参考文献列表和某篇文献的列表大面积雷同(这个偶尔能间接暴露"整段抄了别人的引用")。
但它查不出:
- 你引的这篇文献根本不存在(系统不会去核验每条引文是否真实);
- 你引的文献存在,但不支持你说的这句话;
- 你引了这个领域该引的十篇里的三篇,故意漏掉七篇(这在学界有个专门说法叫 citation amnesia)。
这就是为什么每份检测报告底下都该有那句话:报告仅为文字匹配结果,是否构成抄袭需结合引用规范判断。 这不是免责声明的客套话,它精确描述了工具的能力范围。
四道关各管什么,横着摆一下就清楚了:
| 关卡 | 查的是什么 | 能发现 | 发现不了 |
|---|---|---|---|
| 文本重复率 | 字面重合 | 抄句子、自我重复、大段照搬 | 引文真假、引用是否成立 |
| AI 率检测 | 文风统计特征 | 文本像不像 AI 写的 | 具体哪句是 AI 写的、参考文献真不真 |
| 图片检测 | 图像相似与处理痕迹 | 重复、拼接、克隆、AI 生成特征 | 图是不是这次实验拍的 |
| 引文核验 | 每条文献是否真实存在 | 凭空编造的文献 | 文献真实但不支持你的论述 |
看这张表能得出一个结论:四道关加起来,仍然有一格是空的。 那一格是"这条文献到底支不支持我这句话",永远只能由作者自己回答。
顺便说一个很多人忽略的技术细节。 这次审计能识别出来的,主要是那些有可解析 ID(DOI、PMID 之类)的文献。有读者在评论里补充了一个更麻烦的情况:某些假文献带的是格式完整但无法解析的 DOI,而这类恰好落在审计范围之外;还有一种情况是 ID 是被出版社或数据库的模糊匹配算法"凑"上去的,看起来能解析,其实指向的是另一篇文章。
这两种情况对你的实际含义是: 光看"参考文献里有 DOI"不代表安全,要真的点开,并且核对打开的页面标题和你写的一致。 这一步很多人省掉了,恰恰是最关键的一步。
结论是:引文真实性这一关,目前只能靠你自己。 好消息是它不难,就是费点时间。
六、投稿前的引文自查:五步,一小时以内
这套流程针对的是"我用过 AI 辅助写作或检索"的情况。如果你全程手动从 PDF 里导文献,风险低得多,但第一步还是建议做。
第一步,把域代码转成纯文本,导出一份干净的文献列表。
如果你用 EndNote 或 Zotero,先另存一份副本,全选后 Ctrl+Shift+F9 把域代码转成纯文本。这一步顺手解决另一个问题:带域代码的文献容易让重复率虚高。
第二步,逐条点 DOI,这是最硬的一关。
有 DOI 的,直接在浏览器里打开 https://doi.org/ 加上 DOI 号。
- 能解析、打开的页面标题和你写的一致 → 通过;
- 解析不了 → 高度可疑;
- 能解析但打开是另一篇文章 → 你的 DOI 抄错了或者是编的,两种都要改。
没有 DOI 的(老文献、书、报告),用标题原文加引号在 Google Scholar 或 PubMed 搜。搜不到就去查原始出处。
第三步,重点核查你"没亲手读过"的那些。
现实一点:一篇论文四五十条参考文献,你真正逐字读过的可能只有一半。剩下那一半就是风险区。 尤其是:
- AI 帮你"补充相关文献"给出的;
- 从别人的综述里顺下来的(别人错了你跟着错);
- 为了凑数量、凑"本领域已有大量研究"这类句子加进去的。
第四步,做综述的话,把标准再提一级。
研究里说综述类的编造率高出 57%,这不是巧合:综述引文多、每条的权重低、作者不可能全读完,正好是 AI 补文献用得最多的场景。做综述就老老实实全查一遍,一条不漏。
第五步,核查"这条文献支不支持我这句话"。
这一步最花时间,也最没法偷懒。挑出你论文里结论性、支撑性的那些引用(不是"某某也研究过这个问题",而是"已有研究证明 X 导致 Y〔12〕"),打开原文,确认它真的说了这个。
这一步做完,你签那句"我对全文内容负全责"才是真的敢签。
七、常见问题
问:AI 为什么会编参考文献?它不知道自己在编吗? 不知道。大模型的运作方式是逐词预测概率最高的下一个词,它生成"一条看起来像参考文献的字符串"和生成一句话是同一件事,没有"去数据库查一下"这个步骤(除非你用的工具明确接了检索)。有研究者的判断是,幻觉与大模型的运作方式"不可分割地绑在一起",所以这个问题不会因为模型变强就自动消失。Topaz 说得更直白:已经污染进文献里的那四千多条假引用,不会因为 AI 变好而消失。
问:那用带联网检索的 AI 就安全了吧? 安全得多,但不等于免检。检索型工具也会出现"找到了一篇真文献,但把它的结论概括错了",或者混合真实与虚构的元数据。规则不变:写进参考文献的每一条,你都要自己点开确认过。
问:Elsevier 这些出版社有明文要求吗? 有。Elsevier 的生成式 AI 政策把"核查来源"列为作者的问责范围,原文明确提醒 AI 生成的参考文献可能有误或系凭空编造。ICMJE 2026 年 1 月版的规定更硬:把 AI 生成内容作为主要来源引用是不可接受的,而且作者要能声明论文中不存在抄袭,包括 AI 产出的文字和图片。
问:我已经发表的论文里发现了一条假文献,怎么办? 主动联系期刊。按目前的实践,只有一两条、且不影响主要结论的,多数会走勘误(correction);如果假文献支撑的是核心结论,可能走撤稿。主动上报和被别人查出来,处理结果的差别很大,这一点和 AI 使用披露是一个道理。
问:审稿人现在会查我的参考文献吗? 越来越会。评论区里已经有审稿人说自己每周都遇到幻觉引用,还开始维护"不再信任"的作者名单。同时出版方在推自动引文核验前置到同行评审之前。趋势是明确的:这一关正在从"没人查"变成"系统查"。
问:一条假文献会被认定为学术不端吗? 不一定,但也别赌。PLOS 的口径是学术不端的定义包含"故意"要素,且由机构认定;但前 JAMA 主编那一派主张出现就该撤稿。你处在两种口径之间,成本最低的做法是投稿前查掉。
问:这事和查重、AI 率是什么关系? 是同一条趋势上的第四个关口。文本重复率、AI 率、图片检测,现在加上引文核验。共同点是:都在从事后追责,变成事前拦截。 对认真做研究的人,多的是一道手续;对靠 AI 批量凑稿的人,是成本大幅上升。
最后
这件事最让人不舒服的地方,不是有人故意造假,而是绝大多数出问题的作者可能真的没想造假。他们只是让 AI 帮着补了几条文献,没点开看。
91% 的问题论文只有一两条假引用,这个分布本身就说明了:这是一个"没核验"的问题,不是"想骗人"的问题。
好消息是,"没核验"是最容易解决的一类问题。逐条点开 DOI,一篇论文的参考文献半小时能过完。
坏消息是,如果你不做,现在有系统在做了,而且是在你投稿之后做。
顺手也提一句:文字重复率、AI 率、图片这三关,逻辑完全一样。都是趁还在自己手上的时候过一遍,比落到编辑手上再解释省事得多。
查个重 · chagechong.com
重复率检测 · AI 率检测 · 图片检测
24 小时自助提交,报告在线可查。
查个重,查得准。想你所想,帮你阻挡。
报告仅为文字匹配与特征分析结果,是否构成抄袭需结合引用规范判断;引文真实性需作者自行逐条核验。
参考来源
- Retraction Watch, One in 277 PubMed-indexed papers in 2026 shows fabricated references, says analysis(2026-05-07,报道 The Lancet 通信及多方评论):https://retractionwatch.com/2026/05/07/one-in-277-pubmed-indexed-papers-in-2026-shows-fabricated-references-says-analysis/
- Topaz M, et al., Correspondence, The Lancet(2026):https://www.thelancet.com/journals/lancet/article/PIIS0140-6736(26)00603-3/fulltext
- Nature, Hallucinated citations are polluting the scientific literature. What can be done?:https://www.nature.com/articles/d41586-026-00969-z
- Hosseini M, Resnik D, Hallucinated citations produced by generative artificial intelligence may constitute research misconduct when citations function as data in scholarly papers, Accountability in Research(2026):https://www.tandfonline.com/doi/full/10.1080/08989621.2026.2645390
- Elsevier, Generative AI policies for journals(政策更新于 2026 年 6 月,"AI 生成的参考文献可能有误或系凭空编造"):https://www.elsevier.com/about/policies-and-standards/generative-ai-policies-for-journals
- ICMJE Recommendations, Section V.A Use of AI by Authors(2026 年 1 月版):https://www.icmje.org/recommendations/browse/artificial-intelligence/ai-use-by-authors.html
- 世界银行报告假文献(2025-12-19):https://retractionwatch.com/2025/12/19/world-bank-report-removed-nonexistent-references/
- Springer Nature 期刊 14 条里 12 条不存在(2026-03-06):https://retractionwatch.com/2026/03/06/librarian-finds-preposterous-number-of-fake-references-in-paper-from-springer-nature-journal/
- Ivan Oransky 被虚构为参考文献作者(2025-11-21):https://retractionwatch.com/2025/11/21/springer-nature-flags-paper-with-fabricated-reference-to-article-not-written-by-our-cofounder/

