首页专栏正文

降重最难受的是"不知道改够了没":用在线报告的 Exclude 功能边改边看

降重最难受的是"不知道改够了没":用在线报告的 Exclude 功能边改边看

降重这件事,真正折磨人的不是改,是改完之后那种不确定。

你对着报告改了三十处,心里没底:够了吗?总重复率现在到多少了?想知道答案,只能再交一次、再等一次、再花一次钱。改完再查,查完发现还差两个点,再改再查。这个循环是很多人对降重最深的怨气来源。

其实 iThenticate 的在线交互式报告里有一组功能可以大幅缓解这件事:排除匹配(Exclude Match)和排除来源(Exclude Source),配合几个排除过滤器,能让你在不重新提交的前提下,估算出"这些地方改到位之后,总重复率大概会落在哪"。

这篇把它讲透:功能到底能干什么、五个过滤器分别怎么起作用、经典版和新版有哪些区别、完整工作流怎么走、以及五个很容易踩的坑。

先说最重要的一句,免得后面误会:这是估算工具,不是降重工具。 具体边界第一节就讲。


一、先把边界说清楚:它不是"一键降重"

这个技巧在网上流传时经常被吹过头,所以先把话说明白。

它做的事: 把你判断"这一处我有把握改到不重复"的匹配,从相似度计算里手动去掉,然后看总重复率变成多少。

它没做的事:并没有把你改写后的文本替换回报告里重新比对。系统不知道你改成了什么,它只是按你的指令把这段从分母里拿掉了。

所以这中间存在一个假设:你假设这些句子已经改写到不再与原文重复。假设成立,估算就接近真实;假设不成立(你只换了几个同义词,语意比对照样命中),估算就偏乐观。

结论是: 这个方法能把"完全不知道"变成"有个大概",这已经很值钱了。但它替代不了改完之后的正式复查,尤其是你要投的期刊有硬性红线的时候。

关于阈值,一个稳妥的做法是留出缓冲:如果你的目标是总重复率 20% 以内,用这个方法估算到 15% 左右再收手,而不是估到 19.5% 就觉得稳了。缓冲留给两件事:你的改写可能没有想象中彻底,以及期刊那边的报告设置可能和你不一样(第六节详说)。


二、准备工作:你手上得是"在线交互式报告"

这一步卡住很多人。

能用这组功能的: iThenticate 2.0 的在线相似度报告(Similarity Report),在浏览器里打开、能点、能选、右侧有侧边栏的那个。

不能用的: 从用户中心直接下载下来的 PDF 报告。PDF 是快照,点不动。

所以如果你的查重渠道只给你一个 PDF 文件,这个方法你用不上。这也是选平台时值得考虑的一点:支持在线查看报告,比只发一份 PDF 有用得多,因为在线报告能改设置、能实时看到重复率变化、能手动排除。

顺便说一下下载的两种方式,很多人搞混:

  • 方式一:用户中心的"下载报告"。默认是排除参考文献的
  • 方式二:在线报告右上角,选择下载 Similarity Report。内容更全,结果与方式一一致。

关键区别在于:方式二会实时反映你对设置的更改。 你在在线报告里勾选了"包含参考文献重复"并保存,再下载,重复率会显著升高。这就是为什么同一篇稿子会出现两个不一样的数字,多数时候不是系统出错,是设置不同。

还有一件事要先确认:你用的是经典版报告还是新版增强报告。 两个版本的排除功能不完全一样,下一节的对照表会讲。官方帮助中心里有一篇《Which version of the Similarity Report am I using?》专门教怎么判断。


三、五个排除过滤器:逐个讲清楚,附版本对照

排除过滤器在侧边栏右上角的 Filters 按钮里。点开之后你会看到两组东西:

  • Compare submissions against:选这次比对哪些库(学生库、互联网内容、期刊出版物);
  • Exclusion filters:从相似度计算里去掉某些类型的内容。

选完之后要点 Apply Filters 才生效,然后点 Back to Similarity Report 回到总览。

五个过滤器,先看版本可用性:

过滤器 经典版报告 新版增强报告 一句话作用
Exclude bibliography(排除参考文献) 自动识别并忽略参考文献区
Exclude quoted text(排除引用文字) 有,名为 Exclude Quotes 忽略引号内和块引用的文字
Exclude cited text(排除已标注引用的文字) 没有 连引注和对应整句一起排除
Exclude small matches(排除小段匹配) 没有 低于设定词数的匹配不显示
Exclude small sources(排除小来源) 只有经典版有 无(被上一项取代) 整体贡献很小的来源整个去掉

下面逐个说细节,这些细节决定你能不能用对。

3.1 Exclude bibliography:它是靠关键词认参考文献的

这个过滤器自动识别参考文献区并忽略掉,让它不去抬高重复率。

但它怎么"认"出参考文献区? 靠一套起始词和终止词。

起始词(出现这些词就开始排除后面的内容)包含一大批写法,常见的有:bibliography、references、reference list、references cited、works cited、cited works、literature cited、citations、endnotes、footnotes、selected references、sources、sources cited、used literature 等等,几十种。非英文稿件也会用常见起止短语来识别。

终止词(出现这些词就恢复检查)是:appendix、appendices、glossary、table、tables、acknowledgment、acknowledgments、acknowledgement、acknowledgements、exhibits、figure、figures、chart、charts。

这两个清单直接推出两条实用结论:

结论一:参考文献的标题一定要写规范。 你写 References 或 Bibliography,系统认得;你自创一个花式标题,或者干脆不写标题直接列文献,自动排除可能失效,重复率就虚高了。

结论二:参考文献后面接了附录,检查会恢复。 这本来是对的设计(附录该查),但如果你的排版是"参考文献 → 附录 → 补充文献列表",那第二段文献列表会被查进去。遇到重复率莫名偏高,翻到文末看一眼结构。

还有一个隐藏机制值得知道: 官方说明里提到,如果处理你这份稿件时排除算法临时不可用,系统会退回到用上面那套起止短语做兜底。如果报告里参考文献的匹配仍然出现,可以过一段时间重新提交,以便用上更完善的排除算法。这解释了一个常见困惑:同一份稿子两次提交,参考文献的处理居然不一样。

3.2 Exclude quoted text:认八种引号,但块引用只认 Word

这个过滤器忽略引号内的文字块引用。经典版里叫 Exclude Quotes,行为一样。

它认的引号有八种:

"..." · '...' · «...» · »...« · „…" · 《...》 · 〈...〉 · 『...』

注意里面有中文的书名号和单书名号,也有日文的引号。引号里的引号也算。

块引用有个硬条件: 官方说明写得很清楚,缩进的整段引文,只有在原文件是 .doc 或 .docx 的时候才会被排除。

这条太容易踩了。你把稿子导成 PDF 提交,Word 里辛苦排好的缩进块引用,系统识别不到,那几段就照样算进重复率。要用这个功能,就用 .docx 提交。

3.3 Exclude cited text:新版独有,会连整句一起排除

这个过滤器在经典版里没有,只有新版增强报告才有。

它做的是:识别常见的文中引注方式,把引注和它对应的文字一起从匹配里去掉。具体行为分两种:

  • 如果是引号里的内容,引号内的部分被过滤;
  • 如果是没加引号的引注,对应的整句被过滤

第二条是重点。它不是只去掉那个 (Smith, 2020),而是把那句话整句拿掉。这个功能对于"我确实规范转述并标了引"的段落非常有用,但也意味着开着它看到的重复率会明显低于关着它的,你得清楚自己在看哪个数字。

官方同样提到了兜底机制:如果提交时引注与文献识别不可用,报告会退回到基于标题的排除;可以之后重新提交以使用机器学习的排除方式。如果不方便重新提交、又想保留原始提交信息,可以改用"排除单个来源"作为备选办法

3.4 Exclude small matches:默认 8 词,最低也是 8 词

打开这个设置之后,要填一个阈值(Set match exclusion threshold)。

默认值是 8 个词,意思是只有 8 词及以上的匹配才会出现在报告里。你可以往上加,但8 词是允许的最小值,不能再往下调。

用途是去噪:专业术语、固定表述、方法学套话,这些短语命中一大片,但没有实际抄袭意义。把阈值往上调一点,报告立刻清爽,你能看清真正需要处理的大段重复。

但要小心两件事: 一是你调高阈值看到的重复率会下降,这个下降不是你改出来的;二是期刊那边用的阈值不一定和你一样,所以别把调高阈值后的漂亮数字当成投稿把握。

(关于小段匹配的具体词数门槛,不同版本口径有差异,网上流传的 8 词、9 词、11 词说法都能找到。以你实际用的这一版报告里显示的数值为准,不要照抄别人的截图。)

3.5 Exclude small sources:经典版专属

这个设置只存在于经典版报告,界面上标为 Exclude sources that are less than,可以按词数或百分比设一个门槛,把总匹配量低于门槛的整个来源去掉。

注意它和 small matches 的区别:它作用在来源层面,不是匹配层面。 它不是隐藏某一处高亮,而是把某个网站、某本期刊、某份稿件的所有高亮一起去掉。新版里这个选项被 Exclude small matches 取代了,官方的说法是后者更聚焦、更实用。


四、手动排除:Exclude Match 和 Exclude Source 的界面路径

过滤器是批量的,手动排除是逐条的,这才是"边改边看"真正依赖的功能。

排除单条匹配(Exclude Match):

  1. 在侧边栏选 Match Groups
  2. 点正文里的某处高亮,或者点右侧来源卡片;
  3. 选中之后,正文旁边或来源卡片上会出现 Exclude Match 按钮,点它。

这一处匹配就从相似度计算里去掉了,总重复率随之下降。

排除整个来源(Exclude Source):

  1. 在侧边栏选 Sources
  2. 点正文高亮把对应来源带到侧边栏,或者直接点来源卡片;
  3. 点来源卡片上的 Exclude Source 图标。

这会把这个来源的所有匹配一次性去掉,高亮消失,重复率相应调整。适用场景是这个来源整体与本次评估无关,比如你自己之前的预印本、被允许使用的参考材料。

怎么撤销: 只要用过排除,Overall Similarity(总相似度)标题下方就会显示排除的条数。点这个链接,会列出所有被排除的项。想恢复某一项,点它的 Include Source 图标;想全部恢复,点 Include All Sources

这个"排除计数"很重要,第六节会说为什么。

一个实测的量级参考: 有个案例是摘要里有几句被标、全文重复率 38%,排除其中某一句后,那处高亮消失、总重复率降到 36%。也就是说,单句的量级通常是 1 到 2 个百分点。心里有这个数,你就能反推:"我要从 38% 降到 15%,大概需要处理二十来处,不是改三五句能解决的。"


五、完整工作流:六步

把上面的零件串起来,是这么一套流程。

第一步,先把设置调到"和期刊一致"的基准状态。

在动手排除之前,先确认过滤器的状态。建议的基准是:排除参考文献开着,其余过滤器关着。 理由是绝大多数期刊看的是"不含参考文献"的总重复率,而引用类排除各家标准不一,开着容易高估自己。

先记下这个基准状态下的总重复率,这是你的起点数字。

第二步,按"体量"给高亮排序,不要从头改到尾。

在 Sources 面板里看每个来源贡献了多少百分比。优先处理占比大的、连续成片的那几处,一处可能顶你改十处零散小句。零散的两三词命中往往是术语,性质上不算问题,最后再看。

第三步,逐处判断:这一处我改得动吗?

三种情况分别处理:

  • 能改:常规的转述型重复,你有把握改成自己的表述。改,然后排除,看数字。
  • 不该改:规范引用的直接引文、必须精确的定义、通用方法学表述。这类不要盲目排除,要么保留(它本来就不该算你的问题),要么核对是否已经加了正确的引注和引号。
  • 改不动:仪器型号、试剂名称、公式、标准术语。留着,最后统一看它们加起来多少。

第四步,改一处,排除一处,看一次数字。

这是这套方法最有价值的地方:你能实时看到自己离目标还有多远,而不是改完二十处之后两眼一黑。

第五步,估算到目标加缓冲就收手。

目标 20% 以内,估到 15% 附近就停。别追求把估算数字压到极低,那多半是靠调过滤器调出来的,不是改出来的。

第六步,改完之后,把改写后的稿子正式重查一次。

这一步不能省。第一节说过,报告不知道你实际改成了什么。估算是为了少查几次,不是为了一次都不查。 尤其是有硬红线的投稿,最后一版一定要有一份真实报告。


六、五个坑,踩过的人都很痛

坑一:把"排除"当成"降重"。

最严重的一个误解。你在自己的报告里排除得再干净,稿子里的文字一个字没变。期刊那边重新跑一次,原来的重复率会原样回来。排除只改变你的视图,不改变你的稿子。

坑二:把调过滤器调出来的低数字当成成绩。

同一份稿子,把"包含参考文献"关掉、把"排除引用文字"和"排除已标注引用"都打开、再把 small matches 阈值往上拉,重复率能低到让人开心。但这个数字和期刊看到的不是一回事。看数字的时候一定同时看设置。

坑三:期刊的设置和你不一样。

这是同一篇稿子出现两个数字最常见的原因,不是系统不准。有的期刊看含参考文献的,有的看不含的;有的按总重复率,有的更看单一来源占比。投稿要求怎么写的,就按那个口径去看你的报告。 单一来源的上限通常比总重复率更容易触雷,别只盯总数。

坑四:排除记录是能看到的。

用过排除之后,总相似度下面就挂着排除条数,点开是完整清单。所以如果你是把报告发给导师、编辑或者服务方看,你排除了什么、排除了多少,对方一目了然。排除个别确实无关的来源没问题,把二十处都排掉再说"我只有 8%",这份报告的可信度就没了。

官方在说明里也提醒了一句:排除功能是为了让分数更公平,但它不能替代人的判断,剩下的匹配仍然需要人去看,判断是规范引用还是可能的抄袭。

坑五:字段代码没处理,先白忙一场。

这是个前置问题:如果你用 EndNote、Zotero 插入的文献是带域代码的,重复率可能天然虚高,而且参考文献的自动排除也容易失效。稳妥做法是提交前把域代码转成纯文本(Word 里全选后 Ctrl+Shift+F9),另存一份用于查重,原稿留着继续编辑。

先解决这个,再谈排除,否则你排除掉的可能只是格式问题造出来的假重复。


七、分场景:不同投稿目标,操作重点不一样

投 SCI 期刊: 基准状态用"排除参考文献",看总重复率和单一来源两个数字。常见的经验区间是总重复率 20% 以内、单一来源 3% 以内;一区和顶刊更严,15% 以内更稳妥。以目标期刊的明文要求为准,这些区间只是通行经验。

投 EI 会议: 不少会议是含参考文献计算的,口径完全不同。所以基准状态要跟着变:把参考文献那一项按会议要求设置。用同一份"排除参考文献"的报告去估会议的门槛,会严重低估。

中文毕业论文(本科/硕博): 一切以本校当年的通知为准。学校指定的系统、算的是哪个口径(是否含参考文献、是否含致谢)、红线是多少,每所学校都不一样,每年还在调。iThenticate 这套操作对英文稿有用,中文毕业论文最终还是要过学校指定的系统。

只是想自己摸底: 那就把设置调到最保守(参考文献排除、其他都关),看到的数字比真实情况更严格一点,心里更有底。


八、常见问题

问:排除之后,报告能恢复原样吗? 能。总相似度下面点开排除清单,单项恢复点 Include Source,全部恢复点 Include All Sources。这个操作是可逆的,放心试。

问:排除掉的高亮,重新提交还会出现吗? 会。排除是这份报告上的视图设置,跟你的稿子无关。重新提交是一次新的比对。

问:为什么我下载的 PDF 和在线看到的数字不一样? 大概率是设置不同。用户中心直接下载的报告默认排除参考文献;在线报告右上角下载的那份会实时反映你改过的设置。核对一下两边的过滤器状态就清楚了。

问:Exclude small matches 我能不能设成 3 个词? 不能。8 词是允许的最小值,只能往上调。

问:块引用为什么没被排除? 最常见的原因是你提交的是 PDF。官方说明写明,缩进的块引用只有原文件是 .doc 或 .docx 时才会被排除。

问:我的参考文献明明写了 References,为什么还是被算进去了? 两种可能。一是文献列表后面出现了终止词(appendix、table、figure、acknowledgment 等),检查从那里恢复了;二是提交时排除算法临时不可用,走了兜底方案,官方建议过一段时间重新提交

问:先降重还是先降 AI 率? 先降重,再看 AI 率。原因很简单:降重要做的是改写,改写会改变文风的统计特征,AI 率会跟着变。反过来先压 AI 率,等你降重再改一遍,前面的功夫白做。而且降重时千万别用改写工具批量过一遍,那是重复率降了、AI 率上去了的经典操作。

问:我要交给期刊的报告,能不能带着排除记录交? 可以,但要清楚对方看得到你排除了什么。建议交一份"基准设置、无手动排除"的报告,把该说明的情况写在信里,比一份被排除得很干净的报告更可信。


最后

这套方法的价值,说到底是把降重从"盲改"变成"看着数字改"

它不神奇:不会替你改一个字,也不会让期刊那边的数字变好看。它只做一件事,就是让你在改的过程中知道自己走到哪了。对于要改二三十处的稿子,这一件事已经能省下好几轮反复。

用的时候记住两条就不会出错:排除只改变视图,不改变稿子;估算之后,最后一版还是要有一份真实的报告。


查个重 · chagechong.com

重复率检测 · AI 率检测 · 图片检测

24 小时自助提交,报告在线可查,可调设置、可看匹配来源、可手动排除。

查个重,查得准。想你所想,帮你阻挡。

报告仅为文字匹配结果,是否构成抄袭需结合引用规范判断。


参考来源

  1. iThenticate Guides, Managing filters and exclusions in the new, enhanced Similarity Report(更新于 2025-11-14):https://guides.ithenticate.com/hc/en-us/articles/27839726023565-Managing-filters-and-exclusions-in-the-new-enhanced-Similarity-Report
  2. iThenticate Guides, How exclusion filters refine the Similarity Report(更新于 2025-11-14,含起止词完整清单、引号类型、8 词阈值说明):https://guides.ithenticate.com/hc/en-us/articles/27870922360333-How-exclusion-filters-refine-the-Similarity-Report
  3. iThenticate Guides, Using filters and exclusion settings in the classic report(经典版设置):https://guides.ithenticate.com/hc/en-us/articles/27244752082701-Using-filters-and-exclusion-settings-in-the-classic-report
  4. iThenticate Guides, Which version of the Similarity Report am I using?:https://guides.ithenticate.com/hc/en-us/articles/27838602531085-Which-version-of-the-Similarity-Report-am-I-using
  5. iThenticate Guides, Overview of the new Similarity Report experience:https://guides.ithenticate.com/hc/en-us/articles/27838877807245-Overview-of-the-new-Similarity-Report-experience
  6. Crossref, Working with your Similarity Report:https://www.crossref.org/documentation/similarity-check/ithenticate-account-use/similarity-report-use/
  7. 实测量级(38% 排除单句后降至 36%)与"下载报告默认排除参考文献":整理自公开经验分享,个案数据仅供量级参考。

报告仅为文字匹配与特征分析结果,是否构成抄袭需结合引用规范判断;涉及具体期刊要求,以该期刊 Instructions for Authors 为准。

阅读下一篇
AI 能不能帮你画论文里的图?Elsevier 把图分成了三类,待遇完全不同
2026-07-25 · 全文 4664 字 · 预计阅读 12 分钟
AI 能不能帮你画论文里的图?Elsevier 把图分成了三类,待遇完全不同