首页专栏正文

AI 扒出 25 万篇疑似造假的癌症论文:这一次,检测跑到了造假前面

AI 扒出 25 万篇疑似造假的癌症论文:这一次,检测跑到了造假前面

这周学术圈最重的一条新闻,来自澳大利亚。

昆士兰科技大学 Adrian Barnett 教授带领的国际团队,用 AI 语言模型扫了 1999 至 2024 年间的 260 万篇癌症研究论文,从里面筛出 超过 25 万篇高度疑似出自"论文工厂"的稿子。相关研究已发表在 BMJ(英国医学杂志)

25 万这个数字已经够骇人了。但真正让做检测这行的人后背发凉的,是里面那条趋势线,还有一个很少被讨论的技术细节。

这篇文章我想讲三件事:这项研究到底查了什么、为什么说这是一次转折、以及普通科研人现在具体该做什么。


一、先把这项研究读懂:它到底怎么筛的

网上大部分转载只报了"25 万篇"这个数字,但方法比数字更值得看。

扫描范围: 1999 至 2024 年,260 万篇癌症研究论文。这是接近全量的规模,不是抽样。

用的工具: BERT 语言模型。这里有个容易被误解的点,BERT 不是 ChatGPT 那种生成式模型,它擅长的是"理解文本特征"。研究团队训练它去识别论文工厂产出的语言指纹。

准确率: 在已知样本的验证测试中,模型对可疑论文的识别准确率达到 91%

筛出结果: 逾 25 万篇被标记为高度疑似。

最刺眼的那条曲线: 可疑论文的比例,从 2000 年代初的约 1%,一路升到 2022 年的 16% 以上

停下来算一下这个 16% 意味着什么:在癌症研究这个和人命直接相关的领域,近几年发表的论文里,每六七篇就有一篇带着论文工厂的特征。你在做文献综述时读的每二十篇文章,可能有三篇的数据是编的。

这里要说清一件事: "疑似"就是疑似。模型标记不等于定罪,91% 准确率反过来说也意味着约 9% 的误判空间。所以这份名单的意义不是"审判了 25 万篇论文",而是证明了大规模筛查在技术上已经可行


二、论文工厂的三个特征,恰好就是检测的三道关

论文工厂是什么?批量生产、批量出售虚假或低质量研究的公司。它们卖作者署名位,有时候直接给你一篇现成的完整论文。

研究里总结的典型特征有三样:重复使用的文本、生硬异常的语言、伪造的数据和图片。

做检测这行的人看到这三样,第一反应是:这不就是今天投稿要过的三道关吗?

论文工厂特征 对应检测关卡 检测手段
重复使用的文本 文本查重 iThenticate / Crossref Similarity Check
生硬异常的语言 AI 率检测 Turnitin AI Writing Detection(青色标 AI 生成、紫色标 AI 润色)
伪造的数据和图片 图片检测 / 原始数据 图像重复、拼接、克隆、AI 生成图识别

这个对应关系不是巧合。期刊这两年之所以把三道关一起收紧,就是因为造假的形态本来就是这三种。 你去看各大出版社的作者须知,Elsevier、Springer Nature 走 Crossref Similarity Check,Wiley、MDPI、IEEE、Frontiers 走 iThenticate,图片端则要求提交未经处理的原始图,三条线一起在收。


三、为什么说这是转折:打假从"人力"进了"工业化"

要理解这次的分量,得看看以前打假是怎么打的。

过去靠人眼。 学术图像打假专家 Elisabeth Bik,一张图一张图地比对,靠肉眼看出 Western blot 条带的复制痕迹,她在 2018 年就指出约 35000 篇生物医学文章可能存在图片造假需要撤回。北航的耿同学,一个人四十多天,连续举报多所名校学者的顶刊论文。

这种打假的特点是:准,但慢,而且高度依赖个人。 面对每年上百万篇的发表量,杯水车薪。造假者赌的就是这个概率:论文这么多,谁会挨个看我这篇?

现在这个赌注不成立了。 260 万篇全量扫描,91% 准确率,机器不会累,也不在乎你是不是名不见经传的普通作者。

顺着这个逻辑往下推,有三件事会连着发生:

第一,期刊必须把防线前移。 事后被机器扒出来,代价是整个期刊的声誉和大规模撤稿。所以它们只能在收稿这一关就把问题挡住,这就是我们看到的检测收紧。国际 STM 协会在图像完整性指南里说得很直接:这类问题应该在评估早期、最好在同行评审之前就识别出来。

第二,回溯检查会常态化。 这次筛查覆盖的是 1999 年以来的论文,它是往回扒的

第三,"发表即安全"的心理彻底失效。 这一点下一节展开说。


四、两个真实案例:论文发表多久算"安全期"?

答案是没有安全期。两个案例值得每个科研人记住。

案例一:PTEN 论文,20 年后被撤。

一篇题为《PTEN Has Nuclear Localization Signal-Like Sequences...》的论文,2005 年 5 月发表在 Cancer Research(IF 16.6,一区)。二十年过去,PubPeer 上有用户借图片检测工具发现,文中图片"比预期相似得多(Much more similar than expected)",随后论文被撤稿。撤稿后它仍能在 PubMed 检索到,只是永久带上了撤稿标记。

案例二:Neuron 论文,从质疑到勘误走了 7 年。

2011 年发表在 Neuron 的一篇文章,2018 年被质疑图片存在剪切和重复,也就是发表 7 年后才被发现。作者积极回复,但迟迟给不出明确方案。直到 2025 年 4 月,作者找到原始数据、与期刊提交勘误,事情才落定。从发表到解决,前后 14 年。

这两个案例告诉我们两件事: 一是数据库不会遗忘,工具在进步,当年查不出来不等于以后查不出来;二是原始数据是你唯一的救命稻草。Neuron 那篇最后能以勘误收场,靠的就是作者拿出了原始数据;拿不出来的,性质就完全变了。

顺便提一个更重的案例:NIH 神经科学部门前负责人 Eliezer Masliah,因长达 25 年的系统性图像造假被免职,影响波及临床试验推进和药物审批。25 年,也没能躲过去。


五、对认真做研究的人,这到底是好事还是坏事

先说结论:长期是好事,短期要适应。

好的一面很实在。 论文工厂最伤害的其实是老老实实做实验的人。你辛辛苦苦跑一年数据发一篇,别人花钱买三篇,评奖评优、申请基金的时候,你还比不过他。规模化检测把这条产业链的成本抬上去,对踏实做研究的人是实打实的公平。

这一点在国内的实践里已经看得到。有高校在通报学术打假事件后,采取的措施是要求发表论文前先提交实验原始数据、备案审核通过才能投稿。听起来是多了一道手续,但换个角度看:以前不用交原始数据,谁知道那些高产的数据是真是假?现在加了这道枷锁,对踏实做实验的人反而更公平。

要适应的一面也很实在。 检测收紧会传导到每一个普通作者身上:查重要求更严、AI 率成标配、图片和原始数据被要求可追溯。你没造假,但你也得能证明自己没问题,这就是多出来的成本。

还有一个容易被忽略的连带效应:导师的责任被压实了。 学生论文出问题,导师失察也要被追究。所以以后你会感觉到导师审你的稿子更早、更严,这不是针对你,是压力传导。


六、具体该做什么:三关自查清单

不用焦虑,把该做规范的做扎实就行。

第一关,文本:规范引用是根本。

论文工厂的第一个特征是"重复使用的文本"。要做的不是玩文字游戏,而是把引用做规范:理解原意后用自己的话转述,再规范标注来源。 记住一条容易踩的红线:标了参考文献不等于可以照抄原文,直接引述原句必须加引号并标出处,而且应尽量少用。

参考安全线:SCI 排除参考文献后总重复率 ≤20%、单一来源 ≤3%,一区或顶刊建议 ≤15%;EI 会议看含文献的全文重复率,一般 ≤25%。但更重要的是重复落在哪里:25% 全来自参考文献和材料方法,编辑多半能接受;12% 但集中在结论和讨论,反而危险。

第二关,AI:合理用 + 如实声明。

"生硬异常的语言"是第二个特征,而机翻加 AI 大段改写,恰恰会留下同类痕迹。红线很清楚:AI 用来查资料、列大纲、改语法是允许的(多数期刊要求声明),但用 AI 生成核心数据、结果、结论属于学术不端

两个实操提醒:一是别用 AI 去降 AI,改写工具的痕迹现在能被识别,重复率降了 AI 率反而飙上去;二是 Turnitin 的 AI 检测在 2025 年 10 月做过一次灵敏度大升级,升级之前测的旧报告参考价值已经明显下降,投稿前建议重测。

第三关,图片和数据:可追溯。

"伪造的数据和图片"是第三个特征,也是现在撤稿的重灾区。有研究指出约 4% 的论文存在不同程度图片问题(这个数字的学术源头可追溯到 Bik、Casadevall 与 Fang 发表于 mBio 2016 年的图像重复研究);美国科研诚信办公室的统计显示,约 68% 的科研不端案件涉及图像伪造。

具体做四件事:所有图都自查(包括补充材料,重点 WB、凝胶电泳、免疫荧光、显微照片、流式细胞图);保留未经处理的原始图,WB 最好显示完整膜边界和分子量标记;别复用别拼接,自己旧文的图再用也算重复;数据图严禁 AI 生成,用 AI 做示意图要按期刊政策披露。

合作论文尤其要小心:图来自不同实验室、不同学生时,你未必知道别人给的图有没有被处理过,而一旦出问题,第一作者和通讯作者都担责


七、几个你可能会追问的问题

Q:我的领域不是癌症研究,是不是就没事? 这项研究选癌症领域是因为它体量大、论文工厂扎堆,但方法本身是通用的。同类筛查扩展到其他领域只是时间问题。

Q:我引用了被标记的论文,会连带影响我吗? 引用本身不构成不端。但如果你的结论建立在被撤稿文献的数据上,学术上是有风险的。建议养成习惯:写作时顺手查一下关键引文有没有撤稿标记(PubMed 会标注,Crossref 也有 Retraction Watch 数据)。

Q:我发过的论文会不会被回溯查出来? 理论上都在回溯范围内。真正的应对不是担心,而是确保你手上有原始数据和记录,出现质疑时能拿出来说明。这就是 Neuron 那个案例的启示。

Q:查重和 AI 率,我自己测和期刊测会一样吗? 只有系统一致、稿件一致、设置一致时才基本一致。要注意两点:期刊看的通常是排除参考文献后的结果;另外期刊系统里还跑着一个重复提交检测(Duplicate Submission Check),那是查一稿多投的,和查重不是一回事,两个分数别混着看。

Q:图片检测通过了,是不是就安全了? 不是。图片检测的数据库覆盖远不如文字查重全,物理化学等学科的图目前 AI 还识别不了。查出问题大概率有问题,没查出不代表一定没问题,它只能作参考。


最后

这条新闻真正的信息不是"25 万篇造假",而是:规模化筛查从"不可能"变成了"已经发生",而且它会往回扒。

对造假的人,这是坏消息。对认真做研究的人,这是迟来的公平,代价是多了一道"自证清白"的手续。

要做的事说白了就一句话:让你的论文,经得起机器和时间的双重回看。


投稿前想把文本重复率和 AI 率这两关先自己过一遍、看清哪里被标了再改,可以用 查个重(chagechong.com):正版 iThenticate 检测,重复率、AI 率一起出,报告与期刊一致、文档不留痕不收录,24 小时自助。

查个重,查得准。 投稿之前,先来查个重。


参考来源

  1. Barnett A, et al., BMJ(2026):昆士兰科技大学团队用 BERT 模型扫描 1999–2024 年 260 万篇癌症研究论文,标记逾 25 万篇高度疑似论文工厂产物,验证集识别准确率约 91%,可疑比例由 2000 年代初约 1% 升至 2022 年 16% 以上。中文媒体 2026 年 7 月 19 日相关报道。
  2. Bik EM, Casadevall A, Fang FC, The Prevalence of Inappropriate Image Duplication in Biomedical Research Publications, mBio(2016):约 4% 论文存在图片问题。
  3. 美国科研诚信办公室(ORI)关于图像伪造在不端案件中占比的公开统计。
  4. STM 协会《Recommendations for handling image integrity issues》V10(2021):图片问题应在评估早期、最好在同行评审之前识别(该工作组已于 2026 年 3 月并入 STM Integrity Hub)。
  5. PTEN 论文(Cancer Research, 2005)与 Neuron 论文(2011)相关 PubPeer 讨论、撤稿与勘误公开记录。
  6. Turnitin 官方 AI Writing Detection 说明(含 2025-10-14 模型灵敏度升级):https://guides.turnitin.com/hc/en-us/articles/28294949544717-AI-writing-detection-model
  7. Eliezer Masliah 长达 25 年图像造假案相关公开报道。

本文所述"疑似"均指模型标记结果,不等于对具体论文或作者的定性认定;检测结果为参考,最终判断需人工核查。重复率与 AI 率标准以目标期刊要求为准。

报告仅为文字匹配与特征分析结果,是否构成抄袭需结合引用规范判断;涉及具体期刊要求,以该期刊 Instructions for Authors 为准。

阅读下一篇
SCI 重复率多少算过?别再背那个“20%”了,编辑真正看的是这个
2026-07-18 · 全文 1082 字 · 预计阅读 3 分钟
SCI 重复率多少算过?别再背那个“20%”了,编辑真正看的是这个