上个月有一项研究,把一个大家都知道但没人当回事的问题摆到了台面上。
401 项已授权的美国专利,引用了已被撤稿的科学论文。其中 195 项,在专利申请之前那篇论文就已经被撤了。
接近一半。这说明的不是有人故意引假货,而是"引用前查一下这篇文献撤没撤"这个动作,在学术界和产业界都普遍不存在。
它不存在的原因也很简单:过去二十年,这确实不是个常规动作,而且大家默认"查起来很麻烦"。
但现在不麻烦了。 撤稿数据库已经开放,网页能查、API 能调、整个数据集能下载,最快十秒钟出结果。
这篇讲清楚:这个库是什么、覆盖到什么程度、三种查法分别怎么用、字段怎么读、什么时候该查、以及它的边界在哪。
一、先搞清楚这个库是什么
Retraction Watch 撤稿数据库,由学术打假机构 Retraction Watch 建立和维护。
关键的一件事发生在 2023 年 9 月:Crossref 从 Center for Scientific Integrity 手里收购了这个数据库,并把它公开了。 从那之后,它从一个需要申请权限的资源,变成了任何人都能免费用的公共基础设施。
几个必须知道的事实:
更新频率:每个工作日更新一次。 由 Retraction Watch 团队维护。
数据从哪来: 从出版商网站收集,同时用多种方式发现撤稿,包括检索学术数据库、核查出版商网站、网页搜索,以及来自学术共同体的举报。
规模:目前收录超过 66,000 条(上个月还是 65,000,一个月增长约 1,000 条)。
它还收录别的更新类型,但要注意覆盖度不同。 Crossref 的文档写得很老实:数据里也包含关注声明(expressions of concern)和更正(corrections)等其他更新类型,但这些不像撤稿那样全面。
这句话请记住。 它意味着:查到"没有记录"不等于"这篇论文完全没问题",只能说明它没有被记录为撤稿。关注声明和更正可能存在但没被收进来。这是这个工具最重要的边界,第六节还会展开。
二、最简单的三种查法,适合日常用
2.1 直接查 DOI(推荐,也最快)
如果你已经在做逐条核验参考文献这件事,这一步是顺带的,不额外花时间。
在浏览器输入 https://doi.org/ 加上 DOI 号,打开的就是这篇论文在出版商网站上的页面。如果它被撤稿了,页面顶部会有一个明显的撤稿标记或撤稿声明链接。
按 COPE 的指南要求,撤稿声明应该链接到被撤论文、清楚标出标题与作者、及时发布,并且对所有读者免费开放。而 Elsevier 的做法是:在线文章前面会加一个显示撤稿说明的页面,链接会先解析到这个页面。
所以正常情况下,你点开 DOI 就一定会看到。 这也是为什么我们一直强调"核验参考文献时要真的点开,而不是只看有没有 DOI"。
2.2 PubMed(生物医学领域最方便)
搜到论文之后,被撤稿的会有明显的 Retracted 标记,检索结果列表里就能看到,详情页会关联到撤稿声明。
PubMed 的一个额外好处是:它同时会显示 Expression of Concern 和 Erratum 的关联,比只查撤稿库更全面一些。
2.3 Retraction Watch 数据库网页
适合的场景:你只有标题或作者,没有 DOI;或者你想查某个作者名下有没有撤稿记录。
可以按标题、作者、期刊、DOI 检索。
这三种查法覆盖了 95% 的日常需求。 下面两节是给需要批量处理的人准备的。
三、进阶:用 Crossref REST API 查
如果你要处理几十上百条文献,或者想把这一步接进自己的流程,用 API 更合适。不需要注册,不需要 API key。
数据结构是这样的: 撤稿信息放在返回的 JSON 里的 update-to 字段中。来自 Retraction Watch 的更新和来自出版商的更新,用一个 source 字段区分,值可能是 publisher 或 retraction-watch。
查一篇具体的论文:
https://api.crossref.org/works/[这里填 DOI]
浏览器直接打开就能看到返回的 JSON。在里面找 update-to 字段:有内容,说明这篇论文有撤稿或其他更新;字段不存在,说明库里没有相关记录。
列出撤稿记录(官方文档给的示例):
https://api.crossref.org/v1/works?filter=update-type:retraction
这条会返回 100 条撤稿记录。可以配合其他 filter 参数做更精确的筛选,完整的 filter 列表在 Crossref 的 REST API 文档里。
实际用法建议: 如果你会一点 Python,把参考文献列表里的 DOI 循环丢进上面第一个接口,检查每个返回里有没有 update-to,几十条文献几秒钟就跑完了。这是把"引文核验"真正自动化的那一半(另一半"这条文献支不支持你的论述",永远只能人来做)。
四、批量:下载整个数据集
如果你要做文献计量研究、要给整个课题组建一个本地检查工具,或者干脆想离线用,可以把整个库下载下来。
数据以 CSV 格式发布在一个 Git 仓库里,每个工作日更新一次:
git clone https://gitlab.com/crossref/retraction-watch-data
这会生成一个叫 retraction-watch-data 的文件夹。之后想更新到最新版,在该文件夹里运行:
git pull
不会用 git 也没关系,GitLab 页面上可以直接下载 CSV 文件,只是更新时要重新下。
4.1 字段清单:知道每一列是什么
这份 CSV 的字段设计得相当细,值得逐个了解,因为它决定了你能做什么样的判断。
| 字段 | 含义 |
|---|---|
| Record ID | Retraction Watch 内部标识 |
| Title | 被撤稿或被更新内容的标题 |
| Subject | 学科领域 |
| Institution | 作者单位(按文中所载) |
| Journal | 发表的来源(期刊、书等) |
| Publisher | 出版机构 |
| Country | 作者单位所涉国家 |
| Author | 作者名单 |
| URLS | Retraction Watch 网站上的相关页面链接,包括关于该撤稿的博文 |
| ArticleType | 内容类型(用 Retraction Watch 自己维护的类型表,与 Crossref 的作品类型不是一回事) |
| RetractionDate | 撤稿声明发布的日期 |
| RetractionDOI | 撤稿声明的 DOI(没有的话是空、unavailable 或 Unavailable) |
| RetractionPubMedID | 撤稿声明的 PubMed ID(没有的话是空或 0) |
| OriginalPaperDate | 被撤内容的发表日期 |
| OriginalPaperDOI | 被撤论文的 DOI(缺失值规则同上) |
| OriginalPaperPubMedID | 原论文的 PubMed ID |
| RetractionNature | 更新通知的类型 |
| Reason | 撤稿原因(用受控词表) |
| Paywalled | 查看该撤稿声明是否需要付费或订阅 |
| Notes | 关于该撤稿的补充说明 |
注意:同一条记录里的列表(比如作者名、撤稿原因)用分号分隔,不是逗号,因为 CSV 本身用逗号分列。
4.2 三个字段值得单独说
第一,RetractionNature 里有一个几乎没人知道的值:Reinstatement(恢复)。
这个字段的可能取值是:Retraction(撤稿)、Correction(更正)、Expression of concern(关注声明)、Reinstatement(恢复)。
Reinstatement 意味着:一篇曾被撤稿的论文,后来又被恢复了。
这种情况确实存在,通常发生在撤稿后调查证明原来的指控不成立、或者撤稿程序本身有问题的时候。数量很少,但它的存在提醒了一件事:撤稿不等于终审判决。
这也呼应了 COPE 指南里的那句定调:撤稿的目的是纠正文献、保证其完整性,不是惩罚作者。
第二,Reason 用的是受控词表。
不是自由填写的,Retraction Watch 维护着一套标准化的撤稿原因分类。这一点非常有用:它让你能区分"诚实错误导致的撤稿"和"数据造假导致的撤稿"。
这两者在同行眼里完全不是一回事。所以当你查到一篇文献被撤时,别只看到"被撤了"三个字就停下,去看 Reason 那一栏。 因重复发表被撤、因计算错误被撤、因图像操纵被撤、因同行评审被操纵被撤,对你判断"这篇论文的数据还能不能用"影响完全不同。
第三,Paywalled 这个字段本身就是一个提醒。
它记录的是:查看这份撤稿声明,是否需要付费或订阅。
这和 COPE 的要求形成了对照。 COPE 的指南明确写着撤稿通知应当"对所有读者免费开放",理由很直白:如果读者看不到撤稿声明,撤稿就起不到警示作用。而这个字段的存在,说明现实中确实有一部分撤稿声明是收费的。
Crossref 的文档还补了一句:这个状态可能在声明发布一段时间之后发生变化。 所以查到 Paywalled 为真也别放弃,过段时间可能就开放了,或者去 Retraction Watch 网站上找对应的博文。
五、什么时候该查:四个时机
不用每篇文献都查,按这四个时机做就够了。
时机一:定稿投稿前,核参考文献的时候顺带查。
这是最主要的时机。如果你已经在逐条点开 DOI 核对标题(我们上一篇写过完整流程),撤稿标记就在那个页面上,不额外花时间。
优先查这几类: - 支撑你核心结论的那几条("已有研究证明 X 导致 Y〔12〕"这种句子里的); - 高被引的"权威"文献(反直觉但重要:被引越多,一旦有问题影响面越大,也越容易成为打假目标); - 年代久远的关键依据(我们写过的案例:2005 年的 PTEN 论文二十年后才被撤,一篇乳腺癌论文在举报十年后才被撤); - 从二手来源拿到的(你没读过原文,是从别人的综述里顺下来的)。
时机二:写综述或荟萃分析时,全部查。
这不是"建议",这是硬要求。 Elsevier 的撤稿理由清单里明确列着一条:
该文是一篇综述或荟萃分析,而其结果与结论所依赖的文献此后已被撤稿。
也就是说,你的综述本身没造假,但引的文献被撤了、而你的结论依赖它们,你的综述可能一起被撤。
再加上《柳叶刀》那份审计发现的综述类文章的编造率比其他类型高 57%,做综述的风险浓度是最高的。
时机三:修回稿件时,把新加的引用查一遍。
审稿意见常常要求你补充引用。这些临时加进去的文献,是你最不熟悉的,风险最高。 尤其如果你用 AI 帮忙找过。
时机四:论文已发表,定期回看一次核心引用。
不用频繁,但如果你的某篇论文是你的代表作、会被反复引用,每年查一次它依赖的那几条核心文献是值得的。发现问题主动联系期刊,和被别人查出来,处理结果差别很大。
六、边界和坑:这个工具做不到什么
这一节必须讲清楚,因为把工具能力吹大对谁都没好处。
6.1 查不到不等于没问题
上面说过,这个库对关注声明和更正的覆盖不如撤稿全面(Crossref 官方文档的原话)。
而且撤稿本身也存在时间差:从问题被发现,到期刊调查,到撤稿声明发布,中间可能隔几年甚至十几年。我们写过的五个案例,跨度分别是 20 年、14 年、十余年、10 年、25 年,没有一个短于十年。
所以"今天没查到"只意味着"今天还没被撤",不意味着"这篇论文没问题"。
6.2 撤稿数增长,不等于造假在增长
一个月涨 1000 条,这个曲线看着吓人,但它至少有两种解释:造假变多了,以及发现能力变强了(图像比对工具普及、PubPeer 让质疑有公开渠道、大规模机器筛查可行、出版方开始设专职研究诚信岗位)。
两件事同时为真,很难分离。 正确的读法是"过去被漏掉的,现在正在被翻出来"。
6.3 被撤稿不等于作者造假
再强调一次:撤稿的原因可能是诚实的错误、天真的失误,也可能是研究或出版不端。COPE 明确说撤稿这个机制"不是为了惩罚作者"。
所以看到一篇文献被撤,正确的动作是去看 Reason 那一栏,而不是直接给作者下结论。 这既是对别人的公平,也直接影响你的判断(因排版错误撤稿和因数据造假撤稿,对你能不能用这个结论的影响完全不同)。
6.4 撤稿论文不是完全不能引
有正当场景:你的研究就是在讨论学术不端、或者你要说明某个曾被广泛接受的结论后来被推翻。
关键是你得知道它被撤了,并且在文中说清楚。 问题从来不是引用本身,是不知情地把它当成有效证据。
6.5 它和查重、AI 检测是完全不同的东西
这个混淆很常见,最后再理一遍:
| 关卡 | 查什么 | 谁来做 |
|---|---|---|
| 文本重复率 | 你的文字和已发表文献的重合度 | 工具 |
| AI 写作率 | 文风的统计特征 | 工具 |
| 图片检测 | 图像重复、拼接、克隆、AI 生成特征 | 工具 |
| 引文存在性 | 这篇论文存不存在 | DOI 解析可自动,人来确认 |
| 引文撤稿状态 | 这篇论文有没有被撤 | 撤稿库可自动,人来判断影响 |
| 引文是否成立 | 这篇论文支不支持你的论述 | 只能人做 |
查重系统不会告诉你引文有没有被撤,撤稿库也不会告诉你重复率是多少。 它们是并列的关口,不能互相替代。
七、常见问题
问:查一篇文献要多久? 如果有 DOI 且你正在核参考文献,十秒钟,就是点开链接看一眼有没有撤稿标记。二三十条文献,五到十分钟。
问:中文文献怎么查? Retraction Watch 数据库以国际期刊为主,中文期刊的覆盖有限。中文文献建议在 CNKI、万方等平台查看该文的状态,以及关注期刊自己发布的撤稿公告。国内的撤稿信息目前没有一个像 Retraction Watch 这样统一开放的库,这是个客观短板。
问:EndNote 或 Zotero 能自动提示吗? 它们不会主动告诉你哪一篇被撤了。你可以用第三节的 API 方式自己批量跑一遍,或者用一些第三方插件(自行评估其数据源和更新频率)。最稳的还是核参考文献时顺手看一眼。
问:我的论文引了一篇后来被撤的文献,会怎样? 先判断它撑什么。背景性引用("某某也研究过这个问题")影响有限;结论性引用(你的论证依赖它)需要处理:换掉、补新证据、或者主动联系期刊说明。综述和荟萃分析尤其要认真对待,因为这是明列的撤稿情形。
问:为什么专利那边没人查? 研究者的判断是这属于"一个可以修复的基础设施问题":专利局和信息平台需要有能力方便地识别撤稿论文,解法是把专利系统接上 Retraction Watch 撤稿数据库与 Crossref 的元数据。技术上做得到,只是还没做。 在系统建起来之前,只能靠人。
问:Reinstatement 真的会发生吗? 会,但很少。它的存在主要提醒一件事:撤稿是一个可纠正的记录,不是终审判决。 如果你认为自己的论文被错误撤稿,这条路径是存在的。
问:撤稿声明要付费才能看,是不是不合理? 按 COPE 的指南,撤稿通知应当"对所有读者免费开放",理由是读者看不到就起不到警示作用。所以收费的撤稿声明是不符合最佳实践的。 数据库里专门有个 Paywalled 字段记录这件事,某种意义上也是一种监督。
最后
这件事最有意思的地方是:它的技术难度是零,成本也是零,缺的只是习惯。
数据库是免费开放的,更新是每个工作日的,查一篇文献十秒钟。但 401 项专利里有 195 项在申请时那篇论文已经撤了,说明这个习惯在专业人士当中都还没建立起来。
原因大概是:过去二十年,一篇论文发出来就默认是有效的,没人想过要回头确认。而现在,撤稿库一个月增长一千条,这个默认前提已经不成立了。
好消息是,把它加进流程几乎不增加负担。你在核参考文献、逐条点开 DOI 的时候,撤稿标记就在那个页面上。 一个动作,两件事一起做完。
顺带把整套自查说完整:重复率、AI 率、图片这三关有工具帮你测;引文的存在性、撤稿状态、以及"它到底支不支持你那句话",前两项半自动,最后一项永远只能你自己。
四关都过一遍,那句"我对全文内容负全责"才是真的敢签。
查个重 · chagechong.com
重复率检测 · AI 率检测 · 图片检测
24 小时自助提交,报告在线可查。
查个重,查得准。想你所想,帮你阻挡。
报告仅为文字匹配与特征分析结果,是否构成抄袭需结合引用规范判断。引文的存在性与撤稿状态需作者自行核验,检测系统不提供该项服务,本文给出了自查方法。
参考来源
- Crossref, Retraction Watch 文档(含数据来源、更新频率、REST API 与 CSV 两种访问方式、全部字段定义):https://www.crossref.org/documentation/retrieve-metadata/retraction-watch/
- Retraction Watch 撤稿数据库(CSV,Crossref 托管,每个工作日更新):https://gitlab.com/crossref/retraction-watch-data
- Retraction Watch, Retraction Watch Database User Guide(含字段附录 A、撤稿原因受控词表附录 B、文章类型附录 C、变更记录附录 D):https://retractionwatch.com/retraction-watch-database-user-guide/
- Retraction Watch, Building The Database(数据库建设方法说明):https://retractionwatch.com/wp-content/uploads/2023/12/Building-The-Database.pdf
- Crossref REST API 文档与 filter 参数列表:https://www.crossref.org/documentation/retrieve-metadata/rest-api/
- COPE Council, Retraction Guidelines(第三版,2025 年 9 月;撤稿的目的、通知应免费开放、批量撤稿):https://publicationethics.org/guidance/guideline/retraction-guidelines
- Elsevier, Article Correction, Retraction and Removal Policy(含"综述或荟萃分析所依赖文献被撤"这一撤稿情形):https://www.elsevier.com/about/policies-and-standards/article-withdrawal
- Retraction Watch, Just over 400 U.S. patents contain citations to retracted scientific papers(2026-07-30):https://retractionwatch.com/2026/07/30/us-patents-contain-citations-to-retracted-scientific-papers/
- Retraction Watch, One in 277 PubMed-indexed papers in 2026 shows fabricated references(2026-05-07,含综述类编造率高 57%):https://retractionwatch.com/2026/05/07/one-in-277-pubmed-indexed-papers-in-2026-shows-fabricated-references-says-analysis/
- PTEN 论文(Cancer Research, 2005)二十年后撤稿等案例,详见本号《AI 扒出 25 万篇疑似造假论文》与《2026 年 7 月学术诚信白皮书》。

