从耿同学打假,到兰州大学论文插图里的“豆包 AI 生成”水印,这一年图片问题成了学术圈的高频雷区。于是很多人开始问一个很实际的问题哈:
图片查重,到底能查出什么?把图跑一遍没问题,是不是就稳了?
今天把图片检测的能力和边界都讲清楚,尤其是那句最重要的话:它没查出问题,不等于你就一定没问题。
一、先看数据:图片问题有多普遍
不是小题大做。几个来自权威来源的数字:
- 有研究估计,约 4% 的论文存在不同程度的图片问题(这个数字的学术源头可追溯到 Bik、Casadevall 与 Fang 发表于 mBio(2016)的图像重复研究);
- 美国科研诚信办公室(ORI)曾统计,约 68% 的学术不端案件涉及图像伪造;
- 顶刊(Nature、Cell 等)现在普遍要求作者提供未经处理的原始图像备查。
一句话:图片,已经和文字、AI 一样,成了检测的一道硬关。
二、图片查重能查出的三类问题
主流图片检测工具(如 Imagetwin、Proofig 等)大致能识别三类问题:
1. 图像重复。 分两种:一种是文内重复(同一篇论文里,本应不同的图却高度雷同);一种是跨文献重复(你的图和数据库里已发表论文的图撞了,包括撞到你自己以前发的图)。工具能抗旋转、缩放、裁剪、镜像,你把图转个角度、改个大小,照样认得出。
2. 图像篡改。 针对 Western blot 条带的拼接(splicing)、局部复制粘贴(copy-move)“移花接木”,通过分析噪点、边缘、色彩来识别,并用热力图把可疑区域高亮标出。哪怕你调低了透明度、改了对比度想藏起来,也可能被揪出。
3. AI 生成图。 判断某张图是不是 AI 生成的,给出置信度评分,有的还能溯源到具体的生成器(DALL·E、Stable Diffusion 等)。这正是“豆包水印”那类事件的检测逻辑。
图片检测的重灾区,集中在生命科学和医学:Western blot、显微图、免疫荧光图、流式细胞图,都是高发区。
三、最重要的一点:图片查重不是万能的
这才是本文的核心,也是很多人误解的地方。图片检测有明确的能力边界:
边界一:数据库覆盖不如文字查重全。 图片检测是这几年才兴起的,它的比对库主要来自与它合作的期刊的已发表论文,覆盖面远不及 iThenticate 那种“97% 主流期刊”的文字库。库里没有的图,它比不出来。
边界二:有些学科的图,AI 根本识别不了。 物理、化学等学科的很多图(谱线、结构示意等),目前的图片 AI 还处理不了,仍然得靠人眼。
边界三:它是“辅助”,不是“判决”。 工具给的是置信度、是线索,最终要不要判定问题,还得作者和编辑结合研究背景去分析。
所以请记住这句话:
查出重复,大概率有问题;但没查出重复,不代表一定没问题。图片查重的结果,只能作参考。
别把“图片查重通过”当成免死金牌。
四、投稿前,图片这样自查
结合上面的能力和边界,给你几条实操建议:
1. 所有图都要跑,包括补充材料。 别只查正文的几张主图,补充材料里的图同样是重灾区。重点:Western blot、凝胶电泳、免疫荧光、显微照片、流式细胞图。
2. 保留所有原始图。 未裁剪、未处理的原始文件(显微镜原始 TIFF、WB 扫描件)一定要留好,部分期刊在返修或发表后会要求上传原始数据验证。WB 图最好显示完整的膜边界和分子量标记。
3. 合作论文尤其小心。 图来自不同实验室、不同学生时,你未必知道别人给的图有没有被处理过。而一旦出问题,第一作者和通讯作者都要担责。投稿前统一自查一遍,是对整个团队负责。
4. AI 作图是红线。 数据图严禁用 AI 生成;用 AI 做示意图,务必按目标期刊政策如实披露,水印之类的更要彻底检查干净。
图片这一关,越来越绕不过去。投稿前把它和重复率、AI 率一起过一遍,心里才踏实 查个重(chagechong.com) 提供重复率、AI 率检测,报告与期刊一致、可溯源,正版授权、24 小时自助。三大检测(重复率 / AI 率 / 图片),想你所想,帮你阻挡。
查个重,查得准。 投稿之前,先来查个重。
参考来源:Bik, Casadevall & Fang, mBio (2016) 图像重复研究;美国科研诚信办公室(ORI)图像伪造相关统计;STM 协会《图像完整性最佳实践指南 V10》(2021,注:该图像完整性工作组已于 2026 年 3 月并入 STM Integrity Hub);Nature《How journals are fighting back against a wave of questionable images》(Nicola Jones, 2024)。
温馨提示:图片检测结果为参考性线索,非绝对判定;是否构成不端需结合研究背景与期刊政策综合判断。

