七月过去了。
这个月学术圈发生的事密度很高:国内有一份官方声明和一份官方通报,国际上有平台级的处罚政策落地、有顶刊主编的公开表态、有把撤稿污染追到专利体系的研究,还有一起牵涉到人命的临床试验调查。
单看每一条都是新闻,串起来看是一个趋势:学术诚信的检查,正在从"事后追责"变成"事前拦截",而且关口在增加。
这是我们的第一份月度白皮书。结构是这样的:先看数字,再看四条主线,然后是完整时间线,最后落到你自己该做的十件事。 内容有点长,但这个月值得一次性看明白。
每一条都附了来源,可以自己去核。
第一部分:数据看板
一、可核查的公开数字
| 指标 | 数值 | 变化 / 说明 | 出处 |
|---|---|---|---|
| Retraction Watch 撤稿数据库 | 超过 66,000 条 | 月初约 65,000,一个月增加约 1,000 | Retraction Watch,7 月更新 |
| 劫持期刊核查表(Hijacked Journal Checker) | 超过 450 条 | 2025 年 12 月刚过 400 | 同上 |
| 编委集体辞职名单 | 超过 50 条 | 同上 | |
| COVID-19 撤稿论文 | 650 篇 | 同上 | |
| 国家卫健委通报科研不端案件 | 28 起 | 涉数据造假、论文买卖、挂名署名 | 国家卫健委,2026 年 7 月 |
| 引用了撤稿论文的美国专利 | 401 项 | 其中 195 项在申请前该论文已撤 | SSRN 预印本,7 月 30 日报道 |
| Joachim Boldt 累计撤稿 | 240 篇 | 案发十余年后仍在陆续撤稿 | Retraction Watch,7 月 15 日 |
二、需要背景的三组数字(今年早些时候,但七月仍在发酵)
| 指标 | 数值 | 说明 |
|---|---|---|
| 含编造参考文献的论文比例 | 2023 年约 1/2828 → 2025 年 1/458 → 2026 年前七周 1/277 | 两年 12 倍;审计范围为近 250 万篇 PubMed 论文、9710 万条参考文献 |
| 2025 年单年幻觉引用总量 | 将近 15 万条 | 四个预印本平台,研究由 arXiv 创始人 Paul Ginsparg 参与 |
| 疑似论文工厂产出的癌症论文 | 超过 25 万篇 | 扫描 1999–2024 年 260 万篇,可疑比例由约 1% 升至 2022 年 16% 以上 |
这张表里最该记住的一个数字是 1/277。 它意味着 2026 年发表的论文里,每 277 篇就有一篇至少引用了一条根本不存在的文献。而如果你用过 AI 辅助检索或写作,你在的是风险更集中的那一档;做综述的更要注意,综述类文章的编造率比其他类型高 57%。
第二部分:四条主线
主线一:AI 不能署名,用了要说,说了要自己兜底
七月最重的国内新闻,是 7 月 15 日同方知网的声明。
起因是有期刊刊发了把 DeepSeek、Gemini 等 AI 列为作者的论文。知网的处理是:此类 AI 署名论文已做下架处理,并明确"所有作者须为自然人、法人或非法人组织"。
声明的法律逻辑分三层,值得完整理解:
- 作者身份的前提是民事主体资格。 依据民法典、著作权法,享有著作权的是自然人、法人及非法人组织。AI 不具备民事主体资格,既无民事权利能力也无民事行为能力。
- 著作权跟着"实质性智力创作"走。 声明的表述是:AI 仅属于科研辅助工具,其生成内容对应的著作权应归属于进行实质性智力创作的研究者。
- 责任必须落到人头上。 要求作者对论文内容的真实性、原创性、学术规范以及 AI 工具使用的合规性承担责任。
这不是国内独有的立场,国际上定调更早,今年又收紧了一轮:
| 机构 / 出版社 | 能否署名 | 声明写在哪 | 什么情况不用声明 |
|---|---|---|---|
| COPE(立场声明,2023 年 2 月) | 不能 | 材料与方法或类似章节 | 未细分 |
| ICMJE(2026 年 1 月版新增第五章) | 不能 | 投稿信 + 稿件相应位置,两处都要 | 未细分 |
| Elsevier(2026 年 6 月更新) | 不能,也不能作为被引作者 | 参考文献前的独立声明区,有固定模板 | 基础语法、拼写、标点检查;无障碍辅助技术 |
| Springer Nature | 不能,LLM 不满足署名条件 | Methods 或等效章节(书稿写在致谢/前言) | 仅做可读性与文法层面的 AI 辅助文字编辑 |
| 知网(2026 年 7 月 15 日) | 不能 | 按各刊投稿说明 | 尚未细化 |
四家都说不能署名,但"写在哪"四家不一样。 所以没有通用写法,投哪家看哪家的作者指南。
这一轮最硬的两句话都在 ICMJE 第五章 A 节里:
作者应能够声明论文中不存在抄袭,包括 AI 产出的文字和图片。
不披露 AI 使用,可能需要采取纠正措施,在某些情况下可能被认定为学术不端。
第一句是整个自查体系的法理来源。 它的含义是:你用 AI 写的段落可能与某篇已发表文献高度接近,你用 AI 生成的示意图可能构图来自某张受版权保护的图,这两件事你自己看不出来,但你要为它们背书。
顺带说清一件常被忽略的事:Elsevier 2026 年 6 月新政把论文配图分成了三类,待遇完全不同。
- 示意类图(流程图、决策树、时间线、概念示意、实验流程图):可以用 AI 辅助,但要在每张图的图注里披露工具、版本、使用方式,同时进正文总声明;
- 数据图(plot、chart、heatmap):只有输出直接源自底层数据、方法可复现并写进 Methods 才可以,可能被要求提供原始未处理图;
- 原始研究图像(显微、组织、Western blot、影像、患者图像):不得用 AI 生成或修改,连亮度、对比度、色彩平衡的调整都只能用成熟图像处理软件做。
另外两条容易踩:图文摘要不允许用通用 AI 绘图工具做;期刊封面图用 AI 需事先获得编辑和出版社许可。
主线二:幻觉参考文献从"现象"变成了"可处罚的行为"
这是今年最快从发现走到处罚的一条线,七月是它落地的月份。
时间脉络:
- 今年 5 月:《柳叶刀》刊出的审计给出 1/277 这个数字;同月,arXiv 宣布对幻觉参考文献实施一年封禁。
- 7 月:arXiv 上出现一篇论文,标题直指《Phantom References: Hallucinated Citations That Survive Peer Review at Top-Tier Conferences》,讨论幻觉引用能通过顶级会议的同行评审活下来。
- 7 月 30 日:研究显示 401 项美国专利引用了撤稿论文,其中 195 项在专利申请之前那篇论文就已被撤。
arXiv 那条政策的关键,不在"封一年",在它的定性逻辑。 宣布政策的 Thomas Dietterich 给的理由是:
如果一份投稿里存在无可辩驳的证据表明作者没有检查 LLM 生成的结果,那么 arXiv 无法信任这篇论文里的任何内容。
它罚的不是"你用了 AI",是"你用了 AI 但没看一眼"。 触发条件有三类:幻觉参考文献;正文里残留的大模型元评论(官方举的例子包括 "here is a 200 word summary; would you like me to make any changes?" 和 "the data in this table is illustrative, fill it in with the real numbers from your experiments.");未替换的占位数据。
而且封禁期满后还有附加条件:后续投到 arXiv 的稿子,必须先被正规同行评审平台接收。
争议也要给出来。 《高等教育内幕》报道时用的标题是 "Welcome but Unenforceable"(值得欢迎,但无法执行):能抓到的是最不小心的那批人,真正批量生产 AI 论文的人删掉那句话只要三秒钟。这个批评站得住,但政策的价值本来也不在抓人,在第一次把"没检查 AI 输出"定义成一种可处罚的行为。
至于 401 项专利那件事,它的意义是把污染追到了学术圈之外。 研究者的表态很克制:引用撤稿论文不应自动导致专利无效,但专利局和信息平台必须有能力方便地识别撤稿论文,他把这称为"一个可以修复的基础设施问题",解法是把专利系统接上 Retraction Watch 撤稿数据库与 Crossref 的元数据。
主线三:图片与原始数据,清算没有时限
七月有三条撤稿新闻,放在一起看特别清楚。
- 7 月 15 日:Joachim Boldt 的撤稿数达到 240 篇,距案发已过十余年,期刊至今仍在陆续撤他的论文。
- 7 月 16 日:哈佛的癌症研究者因图像重复被撤稿。
- 7 月下旬:一篇乳腺癌论文,在打假人举报十年之后被期刊撤稿。
再加上我们之前写过的三个案例,把五个放在一张表里,规律非常清楚:
| 案例 | 发表年 | 问题被提出 | 最终处理 | 跨度 | 结局差异的原因 |
|---|---|---|---|---|---|
| PTEN 论文(Cancer Research) | 2005 | 二十年后由 PubPeer 用户借图片检测工具发现"比预期相似得多" | 撤稿 | 约 20 年 | 未见有效的原始数据回应 |
| Neuron 论文 | 2011 | 2018 年被质疑图片剪切与重复 | 勘误 | 14 年 | 作者最终找到原始数据 |
| Joachim Boldt 系列 | 2000 年代 | 十余年前案发 | 累计撤稿 240 篇,仍在继续 | 十余年且未结束 | 系统性造假 |
| 乳腺癌论文 | 约 2015 | 打假人举报 | 撤稿 | 10 年 | 举报后长期无实质回应 |
| Eliezer Masliah 系列 | 跨 25 年 | 2024 年系统性调查 | 免职,波及临床试验与药物审批 | 25 年 | 系统性图像造假 |
这张表给出两个结论。
第一,论文没有安全期。 数据库不会遗忘,工具在进步,当年查不出来不等于以后查不出来。五个案例的跨度分别是 20 年、14 年、十余年、10 年、25 年,没有一个短于十年。
第二,也是更有用的一条:唯一改变结局的变量是有没有原始数据。
对比第一行和第二行最能说明问题。两篇都是图片问题、都是发表十几二十年后被翻出来,一篇撤稿,一篇勘误。差别在于 Neuron 那篇的作者最终拿出了原始数据,证明问题出在图片整理环节而非数据本身。
从"被质疑"到"能自证"之间隔着的,就是你当年有没有把原始文件存下来。 这件事的成本是几乎为零的(存个文件夹),价值却在十年后才兑现。
国内的实践已经跟上了这个逻辑。 有高校在通报学术打假事件后,采取的措施是要求发表论文前先提交实验原始数据、备案审核通过才能投稿。听起来是多一道手续,但换个角度:以前不用交原始数据,谁知道那些高产的数据是真是假?
主线四:同行评审这道关,本身正在出问题
这是七月最值得警惕的一条线,因为它动摇的是学术体系的信任基础。
七月发生的:
- 7 月 14 日:Sage 因同行评审过程被操纵,撤下一位前 Radboud "rising star" 的 8 篇论文。后续报道里,合作者本人描述了这位造假者如何伪造整个同行评审流程。
- 7 月 20 日:有出版方正在调查一名审稿人涉嫌行贿计划。
- 7 月:一名学生在至少 8 封写给期刊的信中谎称自己有博士学位,已有两封被撤。
- 今年早些时候:有预印本研究考察 AI 审稿的效果,结论是 AI 审稿人让论文更容易被接收,作者称之为 paper-laundering(论文洗白)。
- COPE 论坛上有一场持续到 6 月的讨论《When editors suspect AI》,议题包括未披露的 AI 使用在上升、编辑何时该起疑、以及 AI 可能被用来起草审稿报告。
规则层面的应对是明确的: Elsevier 期刊政策与 ICMJE 第五章都规定,审稿人和编辑不得将稿件或其任何部分上传到 AI 工具,因为这可能侵犯作者的保密权和专有权。Elsevier 还定义了"私有 AI 工具"的标准:不保留、不复用、不共享、不用于训练,并提醒许多免费工具默认不是私有的。
但对作者来说,这条主线真正的含义是反过来的: 出版社禁止审稿人把你的稿子丢进公共 AI 的理由,一字不改地适用于你自己。同期《自然》还报道了一项研究,说 arXiv 上"大多数"预印本包含本不该公开的信息,包括密码和 GPS 坐标,说明研究者对"我这份文件里到底有什么"的掌握程度,普遍比自己以为的低。
还有一条来自最上层的观察值得放在这里收尾。 Science 主编 H. Holden Thorp 七月发了一篇社论,标题是《AI in scientific publishing: Slower, worse, and more expensive》。他承认 Science 在用 AI 工具发现论文错误、识别稿件缺失要素,但结论是:这些工具的使用及对其输出的评估要求更多的人类投入,而不是更少,因为 AI 生成的报告必须由人来评估;软件要付费、报告要人分析、问题要人处理,这些工具并没有省钱。
这解释了很多人今年的直观感受:投稿变慢了、编辑要求变多了。 一部分原因就是期刊那边新增了一整套需要人工判读的检查环节。
第三部分:七月时间线
| 日期 | 事件 | 涉及主线 |
|---|---|---|
| 7 月 5 日 | 中国人民大学通报蒋方舟论文案:认定注释存在学术不规范但未构成不端,导师暂停研究生招生资格一年 | 三 |
| 7 月上旬 | 安徽大学就拟录用一名被期刊认定学术不端并撤稿的博士发布通报,表示正依规严肃复核 | 三 |
| 7 月 10 日前后 | 国家卫健委披露 28 起科研不端案件,涉数据造假、论文买卖、挂名署名 | 一、三 |
| 7 月 14 日 | Sage 因同行评审被操纵,撤下前 Radboud 研究者 8 篇论文 | 四 |
| 7 月 15 日 | 知网发布 AI 署名论文处理声明,此类论文已下架 | 一 |
| 7 月 15 日 | Joachim Boldt 累计撤稿达 240 篇 | 三 |
| 7 月 16 日 | 哈佛癌症研究者因图像重复被撤稿 | 三 |
| 7 月 17 日 | 财新报道:一名顶级中国肿瘤医生被指在"论文工厂"丑闻中涉学术造假 | 二、三 |
| 7 月 20 日 | 出版方调查一名审稿人涉嫌行贿计划 | 四 |
| 7 月 21 日 | Retraction Watch 独家:一名尼泊尔医学生撑起一个高产论文工厂 | 二 |
| 7 月 23 日 | Science 与 Retraction Watch 联合调查:一对夫妇支付逾 80 万美元用于基因编辑疗法,患儿死亡且从未公开 | 三 |
| 7 月下旬 | 一篇乳腺癌论文在打假人举报十年后被撤 | 三 |
| 7 月 | Science 主编社论《AI in scientific publishing: Slower, worse, and more expensive》 | 四 |
| 7 月 | arXiv 论文《Phantom References》:幻觉引用能通过顶会同行评审 | 二 |
| 7 月 30 日 | 研究显示 401 项美国专利引用了撤稿论文,195 项在申请前已撤 | 二 |
| 7 月 | 撤稿数据库突破 66,000 条,劫持期刊核查表超过 450 条 | 全部 |
第四部分:数据的边界与争议
这一部分是白皮书里最容易被跳过、但最不该跳过的一节。上面所有数字都有边界,不说清楚就是误导。
一、撤稿数增长,不等于造假在增长
撤稿数据库突破 66,000 条,一个月增加约 1,000 条,这个曲线看着吓人。但它至少有两种解释:
解释 A:造假变多了。 论文工厂产业化、AI 降低了造假成本,这些都是真实存在的。
解释 B:发现能力变强了。 图像比对工具普及、PubPeer 这类平台让质疑有了公开渠道、Retraction Watch 在系统性记录、大规模机器筛查成为可能、出版方开始设专职研究诚信岗位。
两件事同时为真,而且很难分离。 撤稿多也可能说明纠错机制在起作用。所以正确的读法不是"学术圈越来越烂",而是"过去被漏掉的,现在正在被翻出来"。
不过这一点不该被用来淡化问题。上面那五个案例的跨度都超过十年,说明纠错机制的速度仍然远远不够。
二、"疑似"就是疑似,不是定罪
BMJ 那项研究筛出逾 25 万篇疑似论文工厂产物,模型识别准确率约 91%。91% 反过来说,意味着约 9% 的误判空间。
这份名单的意义不是"审判了 25 万篇论文",而是证明了大规模筛查在技术上已经可行。任何把"疑似"读成"确认造假"的转述,都是在放大原研究没有主张的东西。
同理,AI 写作检测测的是文风的统计特征(用词概率模式与文风稳定性),不是"抓现行"。认真手写、句式工整、领域套话多的人也可能被标高分。它不是判决书。
三、"用 AI 审计 AI"本身有争议
《柳叶刀》那份幻觉引用审计,团队自己用了 AI 来区分"真正的编造"和"格式差异"(比如非正式缩写的标题)。
Cochrane 的编辑政策与研究诚信负责人 Ella Flemyng 对此提出过质疑:虽然方法在 500 条记录上做过验证,但方法细节披露不足;结论的可信度更取决于 AI 系统怎么设计、误差怎么评估纠正、整个过程能不能复现与透明,而不是那个头条数字本身。
这个质疑是成立的,也应该被引用者一并转述。
四、比幻觉引用更难的问题,目前无解
西北大学的 Mohammad Hosseini 认为《柳叶刀》这项研究只是"低垂的果实"、"冰山一角"。他指出更大更重要的问题是那些不是完全凭空编造,但不准确、有偏、不完整的引用,原话大意是"我们连检测它们都还做不到"。
这句话画出了整个自查体系的能力边界:
| 问题 | 能不能自动检测 |
|---|---|
| 引的这篇论文不存在 | 能(DOI 解析、元数据比对) |
| 引的这篇论文已被撤稿 | 能(撤稿数据库比对) |
| 引的这篇论文存在,但不支持你的论述 | 不能 |
| 该引的关键文献你故意没引(citation amnesia) | 不能 |
后两行永远只能由人回答。 这也是为什么每份检测报告底下那句"报告仅为文字匹配结果,是否构成抄袭需结合引用规范判断"不是免责套话,它在精确描述工具能力的上界。
五、"该撤稿还是该勘误",学界没有共识
围绕幻觉引用的处理,七月前后至少有四种立场同时存在:
| 立场 | 谁在说 | 理由 |
|---|---|---|
| 出现幻觉文献就该撤稿 | 前 JAMA 主编 Bauchner、前 JAMA Pediatrics 主编 Rivara | 作者同意署名,就要对整篇论文的全部内容负责 |
| 看这条文献在结论里起什么作用 | NIH 的 Resnik、研究者 Topaz | 核心依据才撤,附带的一两条更适合勘误加透明说明 |
| 不能自动等同于学术不端 | PLOS 出版伦理负责人 Hoch | 学术不端的定义包含"故意"要素,且由机构认定,不是期刊说了算 |
| 政策值得欢迎但无法执行 | Inside Higher Ed 报道口径 | 能抓到的只是最不小心的那批人 |
把这四种立场并列出来,比只讲其中一种更有用。 因为它告诉你一件实际的事:如果你的论文里出现了这类问题,最终怎么处理取决于你遇到的是哪一家期刊、哪一个编辑、以及那条引用起什么作用。 在这种不确定性里,唯一可控的做法就是投稿前查掉。
六、几组互相冲突的厂商数据,引用时要标来源
做内容的人和读内容的人都该知道,检测领域有几组数字长期存在口径差异:
- iThenticate 数据库规模:Crossref 官方口径与厂商宣传口径不一致(78M+ 与 8940 万、1.5 亿等说法并存);
- 图像比对库规模:厂商自述从 7500 万到 1.6 亿都有;
- 小段匹配的词数门槛:8 词、9 词、11 词的说法都能查到,实际以你所用那一版报告里显示的数值为准;
- 图片问题论文比例:4%(Bik 等,mBio 2016)、15%、"35000 篇需撤回"等数字来自不同研究与不同口径,不能混用。
引用任何一个都要标明来源与时间。 我们自己写文章时的规则是:厂商自述数据标注为厂商自述,与官方口径冲突的两边都列。
第五部分:对你的十件事
前面都是别人的事,这一节是你的。按优先级排。
1. 投稿前把参考文献逐条核一遍。
有 DOI 的,浏览器打开 https://doi.org/ 加号码,并核对打开的页面标题和你写的一致(光有 DOI 不算数,假文献可以带无法解析的假 DOI)。没有的,标题加引号搜 Google Scholar / PubMed / CNKI。五十条文献,半小时。
2. 顺手查一下撤稿状态。 Retraction Watch 撤稿数据库(Crossref 托管,已开放)、PubMed 的 Retracted 标记、期刊原页面。优先查支撑你核心结论的、高被引的、年代久远的、以及从二手来源拿到的。
3. 全文搜一遍 AI 残留词。
would you like · let me know · here is · As an AI · illustrative · placeholder · TODO · [insert · 此处填 · 示例数据。十秒钟,避免最丢人的那一类问题。
4. 用了 AI 就披露,按目标期刊要求的位置写。 Elsevier 要参考文献前的独立声明区(有模板:工具名 + 用途 + 我已审阅并负全责),Springer Nature 要 Methods,ICMJE 要投稿信加正文两处。基础语法拼写检查不用披露,实质性改动句子结构或段落组织就要披露。
5. AI 用在研究方法里的,写进 Methods 而不是声明区。 包括模型/工具名称、版本、开发方,要可复现。
6. 原始数据和原始图像按论文归档。 包括拍摄参数和处理记录。这件事的价值在被问到的那一天才体现,但那天来的时候,你要么有,要么没有。Western blot 保留完整膜边界与分子量标记,别只交裁切好的条带。
7. 别把完整稿子整篇丢进公共 AI 工具。 需要润色就分段,去掉数据、致谢、伦理编号。用之前读一遍工具条款,找"数据保留"和"模型训练"两处表述;机构有企业版就用企业版。
8. 投稿前把三关自己过一遍:重复率、AI 率、图片。 趁稿子还在自己手上。图片这一关很多问题不是造假,是无意的复用(对照组的图两篇都用了、同批实验取错编号),自己查出来改掉成本几乎为零。
9. 中文毕业论文一切以本校当年通知为准。 各校 AIGC 红线不统一,30%、40%、25% 的口径都有,每年还在调,用的系统也可能不同。去教务处或学院官网找今年的通知,确认三件事:指定哪个系统、上限多少、有没有申诉通道和截止时间。
10. 调整对 AI 的时间预期。 AI 省的是"写"的时间,不是"交"的时间。初稿三周变五天是真的,但从五天到可以投出去,中间那段没变短。把"评估 AI 输出"当成一道正式工序,给它排时间。
分人群:你属于哪一类,风险重心不同
上面十件事是通用的。但不同身份的人,真正该盯的地方差别很大。
本科生 / 硕士(中文毕业论文)
主要风险是 AIGC 检测率,不是重复率。一切以本校当年的通知为准,各校红线不统一(30%、40%、25% 的口径都存在),用的系统也可能不同。今年有平台明确回应:对检测结果有异议可以通过邮件申请复核,一般 1 至 3 个工作日反馈,但复核确认无误的仍需自行修改。别把复核当免死金牌。
另外提醒一句:本文讨论的国际口径(iThenticate、Crossref、ICMJE)不适用于中文毕业论文,别拿国外系统的结果去跟学校讲道理。
博士生 / 博后(投英文期刊)
风险最全面,四关都要过。重点有三个:一是 AI 率(用过润色或机翻的段落容易被标,投稿前看一眼报告,别让编辑先看到);二是引文核验(你是自己写全文的人,AI 补的文献大概率经你手);三是原始数据归档(这是你未来十年的保险)。
投稿系统认哪个引擎也要搞清楚:主流是 iThenticate(Wiley、MDPI、IEEE、Frontiers 等)和 Crossref Similarity Check(Elsevier、Springer Nature、ACS 等),两者技术同源、结果基本一致。
通讯作者 / 课题组长
你的风险不在自己写的那部分,在别人写的那部分。按 ICMJE 的口径,每位作者都要为整篇论文的准确性和完整性负责,学生补的一条假文献,你一样跑不掉。
三个建议:投稿前把完整的参考文献列表自己过一遍(不能只看自己那节);把"原始数据交存"设成组内的硬规定而不是建议;组里用 AI 的情况要摸清楚并统一披露口径,别出现同一篇论文里张三声明了、李四没声明的情况。
科研管理与学位办
关注两条:一是本月国内已出现要求发表前先提交实验原始数据、备案审核通过才能投稿的做法,这可能成为趋势;二是 iThenticate 1.0 于 2026 年 12 月 31 日停服、续订通道已于 2025 年底关闭,且 AI 写作检测是 2.0 独有功能,还在用 1.0 的机构迁移窗口只剩五个月。
编辑与出版服务方
本月最值得关注的是引文核验前置这条线:有出版方在评估全系统的引文完整性筛查,有出版方已在投入技术与专职人员,含疑引用占比大的稿件会直接拒稿。同时 Science 主编那篇社论提醒了成本的另一面:AI 生成的检查报告必须由人评估,人力是净增加的。
第六部分:本月最值得读的五份原始文件
新闻转述总会失真。如果你只有一小时,直接读这五份,比读五十篇解读有用。每份我标了该重点看哪一段。
1. ICMJE Recommendations 第五章《人工智能在出版中的使用》(2026 年 1 月版)
分 A 作者、B 审稿人、C 编辑三节。重点读 A 节最后两句:作者应能够声明论文中不存在抄袭(包括 AI 产出的文字和图片);不披露 AI 使用可能需要纠正措施,某些情况下可能被认定为学术不端。这两句是今年所有自查要求的法理源头。
icmje.org/recommendations/browse/artificial-intelligence/
2. Elsevier《期刊生成式 AI 政策》(2026 年 6 月更新)
重点读两段:一是 Disclosure 那段给的声明模板(可以直接抄,三要素:工具名、用途、我已审阅并负全责);二是 Images and artwork 整节的三分法,尤其"原始研究图像不得用 AI 生成或修改,包括亮度、对比度、色彩平衡的调整"那句。
elsevier.com/about/policies-and-standards/generative-ai-policies-for-journals
3. COPE 立场声明《Authorship and AI tools》
最短的一份,两分钟能读完。重点在它给的理由:AI 无法对提交的作品承担责任,作为非法律实体既不能声明利益冲突,也无法处理版权与许可协议。理解了这个理由,你就不需要记各家的具体规定。
publicationethics.org/guidance/cope-position/authorship-and-ai-tools
4. 知网 AI 署名论文处理声明(2026 年 7 月 15 日) 中文语境下最重要的一份。重点是那三层法律逻辑:民事主体资格、著作权归于实质性智力创作者、作者要对 AI 工具使用的合规性负责。第三条是很多人没注意到的新增责任。
5. iThenticate 官方指南《How exclusion filters refine the Similarity Report》
纯操作类,但含金量极高。重点看两处:参考文献自动排除所依赖的起止关键词完整清单(决定了你的文献标题该怎么写);以及"缩进的块引用只有原文件是 .doc 或 .docx 时才会被排除"这句(交 PDF 就失效)。
guides.ithenticate.com/hc/en-us/articles/27870922360333
第七部分:术语表
这一节是给刚接触这套体系的人准备的,也方便你在跟导师或编辑沟通时用对词。
| 术语 | 中文 | 一句话解释 |
|---|---|---|
| Similarity Check | 相似度检查 | Crossref 提供的查重服务,Elsevier、Springer Nature、ACS 等走这条渠道,技术上由 iThenticate 驱动 |
| iThenticate | 无通行中译 | 面向科研论文的查重系统,2.0 版才有 AI 写作检测;1.0 定于 2026-12-31 停服 |
| Turnitin AI Writing Detection | AI 写作检测 | 测的是文风统计特征,报告中通常青色标 AI 生成、紫色标 AI 润色改写 |
| Duplicate Submission Check | 重复投稿检查 | 对内的检查,投稿系统拿你的标题、摘要、作者名单与该刊历史投稿比对,用来抓一稿多投;与对外查重不是一回事 |
| Hallucinated citation | 幻觉引用 | AI 编造的、根本不存在的参考文献 |
| Paper mill | 论文工厂 | 批量生产、销售虚假或低质量研究的公司,也卖作者署名位 |
| Hijacked journal | 劫持期刊 | 冒用正规期刊名称与刊号的假刊,Retraction Watch 有专门核查表,目前超过 450 条 |
| Retraction / Correction / Expression of Concern | 撤稿 / 勘误 / 关注声明 | 严重程度依次递减;关注声明常用于调查尚未结束时的预警 |
| Prior art | 现有技术 | 专利术语,指申请日前已公开的技术,撤稿论文进入这个列表就是本月那项研究的问题所在 |
| Citation amnesia | 引用失忆 | 故意不引应当引用的相关工作,属于引用不端的一种,任何工具都查不出来 |
| Field code | 域代码 | EndNote、Zotero 插入文献时留下的隐藏代码,会导致重复率虚高,投稿前用 Ctrl+Shift+F9 转纯文本 |
| Graphical abstract | 图文摘要 | 全文的视觉化总结;Elsevier 2026 年 6 月起明确禁止用通用 AI 绘图工具制作 |
第八部分:八月看什么
几条值得跟踪的线:
第一,孤立事件会不会变成系统。 arXiv 是第一个对幻觉引用实施处罚的平台,接下来看正式期刊会不会跟进,以及跟进的形式是处罚还是前置筛查。已有出版方在投入技术和专职人员筛查有问题的引用、评估全系统的引文完整性筛查。
第二,iThenticate 1.0 的倒计时。 官方已定 2026 年 12 月 31 日停止服务,续订通道 2025 年底已关闭。AI 写作检测是 2.0 独有功能,还在用 1.0 的机构和个人,迁移窗口只剩五个月。
第三,国内的原始数据备案会不会扩面。 目前是个别高校在通报事件后采取的措施,如果扩散,会实质性改变国内的投稿流程。
第四,中文期刊的 AI 披露格式。 知网的声明确立了"不能署名"和"作者要对 AI 使用合规性负责"两条原则,但具体的披露格式各刊还在陆续明确,别自己发明格式。
第九部分:常见问题
问:这一切是不是意味着以后不能用 AI 写论文了? 不是。从 ICMJE 到 Elsevier 到 arXiv,没有一家禁止使用 AI。它们要求的是三件事:用了要披露、产出要自己核、责任由人承担。arXiv 那条封禁政策罚的是"用了但没检查",不是"用了"。这个区别是理解今年所有新规的钥匙。
问:我完全没用 AI,这些跟我有关系吗? 有两处。一是AI 率误判:文本较短、句式工整、领域套话多的原创文本也可能被标高分,你需要知道怎么读报告、怎么申诉。二是引文核验:哪怕你不用 AI,你也可能引到已被撤稿的文献,本月那 401 项专利里有 195 项就是这种情况。
问:为什么强调"引文核验"是第四道关,它和查重不是一回事吗? 完全不是。查重比对的是你正文的文字和已发表文献的重合度;引文核验回答的是你引的这篇论文存不存在、有没有被撤。前者有工具,后者目前只能靠人。把两件事混为一谈,是今年最常见的认知误区。
问:撤稿数据库突破 66,000 条,我该慌吗? 不该慌,但该改一个习惯:引用前查一下这篇文献的状态。这个动作过去二十年不是常规,现在应该是了。三个渠道:Retraction Watch 撤稿数据库、PubMed 的 Retracted 标记、期刊原页面。如果你已经在逐条点 DOI 核验,撤稿标记就在那个页面上,顺手就看到了。
问:投稿前到底该按什么顺序做? 建议顺序是:先降重 → 再处理 AI 率 → 图片过一遍 → 最后核引文。理由是降重的改写会改变文风统计特征,AI 率会跟着变,顺序反了要返工;而引文核验放最后,是因为定稿前你可能还会增删引用。
问:AI 率要降到多少才安全? 国际主流系统有缓冲设计,低于阈值时不显示具体数字,只标一个星号,看到星标就算过关,不必追求 0%。中文毕业论文则完全以本校当年通知为准。另外注意报告要分开看:青色标的"AI 生成"优先处理,紫色标的"AI 润色"如实披露即可,多数期刊允许。
问:这些规则会不会明年又变? 会,而且大概率还会更细。但方向是稳定的,过去两年一直没变:从建议走向要求,从事后追责走向事前拦截,从平台承担走向作者自证。按这个方向准备,不会白准备。
问:你们做检测的,会不会夸大这些风险? 这个质疑很合理,所以我们的做法是:每条数据标出处、每个能力边界主动说清、每处争议把对立观点都列出来。本文第四部分整节都在讲数据的边界,包括"撤稿增长不等于造假增长""疑似不等于定罪""引文是否成立没有任何工具能判断"。我们卖的是重复率、AI 率和图片这三样能客观测量的东西,测不了的绝不说能测。
最后
把这个月压缩成一句话:规则在补齐,工具在前移,责任在往作者身上压。
规则补齐,是说 ICMJE 加了一整章、Elsevier 更新了图片政策、知网明确了署名口径、arXiv 落地了处罚。
工具前移,是说检查正在从"发表后有人举报"变成"投稿时系统就跑",而且新增了引文核验这第四道关。
责任往作者身上压,是那句最硬的话:你要能够声明论文中不存在抄袭,包括 AI 产出的文字和图片。
这三件事叠在一起,对靠 AI 批量凑稿的人,是成本大幅上升;对认真做研究的人,是多几道手续,换一个更公平的比较环境。
论文工厂最伤害的,其实一直是老老实实做实验的人。你辛辛苦苦跑一年数据发一篇,别人花钱买三篇,评奖评优、申请基金的时候你还比不过他。把这条产业链的成本抬上去,对踏实做研究的人是实打实的公平。
代价是多出来的那点手续。这个月我们写了六篇文章讲这些手续具体怎么做,核心其实就一句:趁稿子还在自己手上的时候,把该看的看一遍。
八月见。
查个重 · chagechong.com
重复率检测 · AI 率检测 · 图片检测
24 小时自助提交,报告在线可查。
查个重,查得准。想你所想,帮你阻挡。
报告仅为文字匹配与特征分析结果,是否构成抄袭需结合引用规范判断。引文真实性与撤稿状态需作者自行核验,本月《投稿前的第四道关》一篇给出了完整方法。
参考来源
官方文件与政策
- 知网关于人工智能(AI)署名为作者的论文处理声明(2026-07-15),媒体报道:https://finance.sina.com.cn/wm/2026-07-15/doc-inihxaew4676029.shtml
- 国家卫生健康委员会通报 28 起科研不端案件(2026 年 7 月):https://www.nhc.gov.cn/qjjys/ycdtxx/202607/6a18742855dc4482b5c2cd625fed4194.shtml
- ICMJE Recommendations, Section V Use of Artificial Intelligence in Publishing(2026 年 1 月版新增):https://www.icmje.org/recommendations/browse/artificial-intelligence/
- Elsevier, Generative AI policies for journals(政策更新于 2026 年 6 月,含图片三分法与声明模板):https://www.elsevier.com/about/policies-and-standards/generative-ai-policies-for-journals
- Elsevier, AI and AI-assisted technologies in the review process:https://www.elsevier.com/about/policies-and-standards/the-use-of-generative-ai-and-ai-assisted-technologies-in-the-review-process
- COPE Position Statement, Authorship and AI tools:https://publicationethics.org/guidance/cope-position/authorship-and-ai-tools
- Springer Nature, Artificial Intelligence (AI) editorial policy:https://www.springer.com/de/editorial-policies/artificial-intelligence--ai-/25428500
- iThenticate Guides, Upgrading to iThenticate 2.0(1.0 于 2026-12-31 停服):https://guides.ithenticate.com/hc/en-us/articles/32604031123853-Upgrading-to-iThenticate-2-0
研究与数据
- Retraction Watch, One in 277 PubMed-indexed papers in 2026 shows fabricated references(2026-05-07,报道 The Lancet 通信):https://retractionwatch.com/2026/05/07/one-in-277-pubmed-indexed-papers-in-2026-shows-fabricated-references-says-analysis/
- Retraction Watch, Just over 400 U.S. patents contain citations to retracted scientific papers(2026-07-30):https://retractionwatch.com/2026/07/30/us-patents-contain-citations-to-retracted-scientific-papers/
- Nature News, Researchers who use hallucinated references to face arXiv ban(2026-05-19,Nature 653, 988-989):https://www.nature.com/articles/d41586-026-01595-5
- Inside Higher Ed, Ban on Authors Who Submit AI Content "Welcome but Unenforceable"(2026-05-22):https://www.insidehighered.com/news/faculty/books-publishing/2026/05/22/ban-authors-who-submit-ai-content-welcome-unenforceable
- Phantom References: Hallucinated Citations That Survive Peer Review at Top-Tier Conferences(arXiv,2026 年 7 月):https://arxiv.org/html/2607.00738
- Thorp HH, AI in scientific publishing: Slower, worse, and more expensive, Science 393, 225(2026):https://www.science.org/doi/10.1126/science.aek5570
- Barnett A 等,BMJ(2026):260 万篇癌症论文筛查,逾 25 万篇高度疑似论文工厂产物。
- Nature, Most arXiv papers contain information never meant to be shared(2026 年 7 月):https://www.nature.com/articles/d41586-026-02057-8
- 预印本:AI 审稿与 paper-laundering:https://arxiv.org/abs/2605.03202
本月事件报道
- Retraction Watch, Weekend reads(2026-07-18 与 2026-07-25 两期,含本月各条事件与统计数字):https://retractionwatch.com/2026/07/25/weekend-reads-young-girls-death-after-gene-therapy-never-made-public-fda-retracts-lettuce-test-result-ada-delays-editorial-publication-after-controversy/
- Retraction Watch, Sage retracts eight papers by former Radboud 'rising star' for compromised peer-review process(2026-07-14):https://retractionwatch.com/2026/07/14/sage-retracts-eight-papers-by-former-radboud-rising-star-for-compromised-peer-review-process/
- Retraction Watch, Now, 240: More than a decade later, journals are still retracting Joachim Boldt's papers(2026-07-15):https://retractionwatch.com/2026/07/15/joachim-boldt-retractions-journals-more-than-decade-later/
- Retraction Watch, Harvard cancer researchers earn retraction for image duplication(2026-07-16):https://retractionwatch.com/2026/07/16/harvard-cancer-researchers-earn-retraction-for-image-duplication/
- Retraction Watch, Exclusive: Medical student in Nepal behind busy research factory(2026-07-21):https://retractionwatch.com/2026/07/21/exclusive-medical-student-in-nepal-behind-busy-research-factory/
- Retraction Watch × Science, Exclusive: A couple paid more than $800,000 for a gene-editing therapy for their daughter(2026-07-23):https://retractionwatch.com/2026/07/23/exclusive-death-gene-editing-trial-china-nature-science-investigation/
- 中国人民大学关于蒋方舟硕士学位论文的情况通报(2026-07-05)及安徽大学相关通报(2026 年 7 月),见公开媒体报道。
- 财新,《Top Chinese Cancer Doctor Accused of Academic Fraud in 'Paper Mill' Scandal》(2026-07-17):https://www.caixinglobal.com/2026-07-17/top-chinese-cancer-doctor-accused-of-academic-fraud-in-paper-mill-scandal-102465056.html

