降重这件事,真正折磨人的不是改,是改完之后那种不确定。
你对着报告改了三十处,心里没底:够了吗?总重复率现在到多少了?想知道答案,只能再交一次、再等一次、再花一次钱。改完再查,查完发现还差两个点,再改再查。这个循环是很多人对降重最深的怨气来源。
其实 iThenticate 的在线交互式报告里有一组功能可以大幅缓解这件事:排除匹配(Exclude Match)和排除来源(Exclude Source),配合几个排除过滤器,能让你在不重新提交的前提下,估算出"这些地方改到位之后,总重复率大概会落在哪"。
这篇把它讲透:功能到底能干什么、五个过滤器分别怎么起作用、经典版和新版有哪些区别、完整工作流怎么走、以及五个很容易踩的坑。
先说最重要的一句,免得后面误会:这是估算工具,不是降重工具。 具体边界第一节就讲。
一、先把边界说清楚:它不是"一键降重"
这个技巧在网上流传时经常被吹过头,所以先把话说明白。
它做的事: 把你判断"这一处我有把握改到不重复"的匹配,从相似度计算里手动去掉,然后看总重复率变成多少。
它没做的事: 它并没有把你改写后的文本替换回报告里重新比对。系统不知道你改成了什么,它只是按你的指令把这段从分母里拿掉了。
所以这中间存在一个假设:你假设这些句子已经改写到不再与原文重复。假设成立,估算就接近真实;假设不成立(你只换了几个同义词,语意比对照样命中),估算就偏乐观。
结论是: 这个方法能把"完全不知道"变成"有个大概",这已经很值钱了。但它替代不了改完之后的正式复查,尤其是你要投的期刊有硬性红线的时候。
关于阈值,一个稳妥的做法是留出缓冲:如果你的目标是总重复率 20% 以内,用这个方法估算到 15% 左右再收手,而不是估到 19.5% 就觉得稳了。缓冲留给两件事:你的改写可能没有想象中彻底,以及期刊那边的报告设置可能和你不一样(第六节详说)。
二、准备工作:你手上得是"在线交互式报告"
这一步卡住很多人。
能用这组功能的: iThenticate 2.0 的在线相似度报告(Similarity Report),在浏览器里打开、能点、能选、右侧有侧边栏的那个。
不能用的: 从用户中心直接下载下来的 PDF 报告。PDF 是快照,点不动。
所以如果你的查重渠道只给你一个 PDF 文件,这个方法你用不上。这也是选平台时值得考虑的一点:支持在线查看报告,比只发一份 PDF 有用得多,因为在线报告能改设置、能实时看到重复率变化、能手动排除。
顺便说一下下载的两种方式,很多人搞混:
- 方式一:用户中心的"下载报告"。默认是排除参考文献的。
- 方式二:在线报告右上角,选择下载 Similarity Report。内容更全,结果与方式一一致。
关键区别在于:方式二会实时反映你对设置的更改。 你在在线报告里勾选了"包含参考文献重复"并保存,再下载,重复率会显著升高。这就是为什么同一篇稿子会出现两个不一样的数字,多数时候不是系统出错,是设置不同。
还有一件事要先确认:你用的是经典版报告还是新版增强报告。 两个版本的排除功能不完全一样,下一节的对照表会讲。官方帮助中心里有一篇《Which version of the Similarity Report am I using?》专门教怎么判断。
三、五个排除过滤器:逐个讲清楚,附版本对照
排除过滤器在侧边栏右上角的 Filters 按钮里。点开之后你会看到两组东西:
- Compare submissions against:选这次比对哪些库(学生库、互联网内容、期刊出版物);
- Exclusion filters:从相似度计算里去掉某些类型的内容。
选完之后要点 Apply Filters 才生效,然后点 Back to Similarity Report 回到总览。
五个过滤器,先看版本可用性:
| 过滤器 | 经典版报告 | 新版增强报告 | 一句话作用 |
|---|---|---|---|
| Exclude bibliography(排除参考文献) | 有 | 有 | 自动识别并忽略参考文献区 |
| Exclude quoted text(排除引用文字) | 有,名为 Exclude Quotes | 有 | 忽略引号内和块引用的文字 |
| Exclude cited text(排除已标注引用的文字) | 没有 | 有 | 连引注和对应整句一起排除 |
| Exclude small matches(排除小段匹配) | 没有 | 有 | 低于设定词数的匹配不显示 |
| Exclude small sources(排除小来源) | 只有经典版有 | 无(被上一项取代) | 整体贡献很小的来源整个去掉 |
下面逐个说细节,这些细节决定你能不能用对。
3.1 Exclude bibliography:它是靠关键词认参考文献的
这个过滤器自动识别参考文献区并忽略掉,让它不去抬高重复率。
但它怎么"认"出参考文献区? 靠一套起始词和终止词。
起始词(出现这些词就开始排除后面的内容)包含一大批写法,常见的有:bibliography、references、reference list、references cited、works cited、cited works、literature cited、citations、endnotes、footnotes、selected references、sources、sources cited、used literature 等等,几十种。非英文稿件也会用常见起止短语来识别。
终止词(出现这些词就恢复检查)是:appendix、appendices、glossary、table、tables、acknowledgment、acknowledgments、acknowledgement、acknowledgements、exhibits、figure、figures、chart、charts。
这两个清单直接推出两条实用结论:
结论一:参考文献的标题一定要写规范。 你写 References 或 Bibliography,系统认得;你自创一个花式标题,或者干脆不写标题直接列文献,自动排除可能失效,重复率就虚高了。
结论二:参考文献后面接了附录,检查会恢复。 这本来是对的设计(附录该查),但如果你的排版是"参考文献 → 附录 → 补充文献列表",那第二段文献列表会被查进去。遇到重复率莫名偏高,翻到文末看一眼结构。
还有一个隐藏机制值得知道: 官方说明里提到,如果处理你这份稿件时排除算法临时不可用,系统会退回到用上面那套起止短语做兜底。如果报告里参考文献的匹配仍然出现,可以过一段时间重新提交,以便用上更完善的排除算法。这解释了一个常见困惑:同一份稿子两次提交,参考文献的处理居然不一样。
3.2 Exclude quoted text:认八种引号,但块引用只认 Word
这个过滤器忽略引号内的文字和块引用。经典版里叫 Exclude Quotes,行为一样。
它认的引号有八种:
"..." · '...' · «...» · »...« · „…" · 《...》 · 〈...〉 · 『...』
注意里面有中文的书名号和单书名号,也有日文的引号。引号里的引号也算。
块引用有个硬条件: 官方说明写得很清楚,缩进的整段引文,只有在原文件是 .doc 或 .docx 的时候才会被排除。
这条太容易踩了。你把稿子导成 PDF 提交,Word 里辛苦排好的缩进块引用,系统识别不到,那几段就照样算进重复率。要用这个功能,就用 .docx 提交。
3.3 Exclude cited text:新版独有,会连整句一起排除
这个过滤器在经典版里没有,只有新版增强报告才有。
它做的是:识别常见的文中引注方式,把引注和它对应的文字一起从匹配里去掉。具体行为分两种:
- 如果是引号里的内容,引号内的部分被过滤;
- 如果是没加引号的引注,对应的整句被过滤。
第二条是重点。它不是只去掉那个 (Smith, 2020),而是把那句话整句拿掉。这个功能对于"我确实规范转述并标了引"的段落非常有用,但也意味着开着它看到的重复率会明显低于关着它的,你得清楚自己在看哪个数字。
官方同样提到了兜底机制:如果提交时引注与文献识别不可用,报告会退回到基于标题的排除;可以之后重新提交以使用机器学习的排除方式。如果不方便重新提交、又想保留原始提交信息,可以改用"排除单个来源"作为备选办法。
3.4 Exclude small matches:默认 8 词,最低也是 8 词
打开这个设置之后,要填一个阈值(Set match exclusion threshold)。
默认值是 8 个词,意思是只有 8 词及以上的匹配才会出现在报告里。你可以往上加,但8 词是允许的最小值,不能再往下调。
用途是去噪:专业术语、固定表述、方法学套话,这些短语命中一大片,但没有实际抄袭意义。把阈值往上调一点,报告立刻清爽,你能看清真正需要处理的大段重复。
但要小心两件事: 一是你调高阈值看到的重复率会下降,这个下降不是你改出来的;二是期刊那边用的阈值不一定和你一样,所以别把调高阈值后的漂亮数字当成投稿把握。
(关于小段匹配的具体词数门槛,不同版本口径有差异,网上流传的 8 词、9 词、11 词说法都能找到。以你实际用的这一版报告里显示的数值为准,不要照抄别人的截图。)
3.5 Exclude small sources:经典版专属
这个设置只存在于经典版报告,界面上标为 Exclude sources that are less than,可以按词数或百分比设一个门槛,把总匹配量低于门槛的整个来源去掉。
注意它和 small matches 的区别:它作用在来源层面,不是匹配层面。 它不是隐藏某一处高亮,而是把某个网站、某本期刊、某份稿件的所有高亮一起去掉。新版里这个选项被 Exclude small matches 取代了,官方的说法是后者更聚焦、更实用。
四、手动排除:Exclude Match 和 Exclude Source 的界面路径
过滤器是批量的,手动排除是逐条的,这才是"边改边看"真正依赖的功能。
排除单条匹配(Exclude Match):
- 在侧边栏选 Match Groups;
- 点正文里的某处高亮,或者点右侧来源卡片;
- 选中之后,正文旁边或来源卡片上会出现 Exclude Match 按钮,点它。
这一处匹配就从相似度计算里去掉了,总重复率随之下降。
排除整个来源(Exclude Source):
- 在侧边栏选 Sources;
- 点正文高亮把对应来源带到侧边栏,或者直接点来源卡片;
- 点来源卡片上的 Exclude Source 图标。
这会把这个来源的所有匹配一次性去掉,高亮消失,重复率相应调整。适用场景是这个来源整体与本次评估无关,比如你自己之前的预印本、被允许使用的参考材料。
怎么撤销: 只要用过排除,Overall Similarity(总相似度)标题下方就会显示排除的条数。点这个链接,会列出所有被排除的项。想恢复某一项,点它的 Include Source 图标;想全部恢复,点 Include All Sources。
这个"排除计数"很重要,第六节会说为什么。
一个实测的量级参考: 有个案例是摘要里有几句被标、全文重复率 38%,排除其中某一句后,那处高亮消失、总重复率降到 36%。也就是说,单句的量级通常是 1 到 2 个百分点。心里有这个数,你就能反推:"我要从 38% 降到 15%,大概需要处理二十来处,不是改三五句能解决的。"
五、完整工作流:六步
把上面的零件串起来,是这么一套流程。
第一步,先把设置调到"和期刊一致"的基准状态。
在动手排除之前,先确认过滤器的状态。建议的基准是:排除参考文献开着,其余过滤器关着。 理由是绝大多数期刊看的是"不含参考文献"的总重复率,而引用类排除各家标准不一,开着容易高估自己。
先记下这个基准状态下的总重复率,这是你的起点数字。
第二步,按"体量"给高亮排序,不要从头改到尾。
在 Sources 面板里看每个来源贡献了多少百分比。优先处理占比大的、连续成片的那几处,一处可能顶你改十处零散小句。零散的两三词命中往往是术语,性质上不算问题,最后再看。
第三步,逐处判断:这一处我改得动吗?
三种情况分别处理:
- 能改:常规的转述型重复,你有把握改成自己的表述。改,然后排除,看数字。
- 不该改:规范引用的直接引文、必须精确的定义、通用方法学表述。这类不要盲目排除,要么保留(它本来就不该算你的问题),要么核对是否已经加了正确的引注和引号。
- 改不动:仪器型号、试剂名称、公式、标准术语。留着,最后统一看它们加起来多少。
第四步,改一处,排除一处,看一次数字。
这是这套方法最有价值的地方:你能实时看到自己离目标还有多远,而不是改完二十处之后两眼一黑。
第五步,估算到目标加缓冲就收手。
目标 20% 以内,估到 15% 附近就停。别追求把估算数字压到极低,那多半是靠调过滤器调出来的,不是改出来的。
第六步,改完之后,把改写后的稿子正式重查一次。
这一步不能省。第一节说过,报告不知道你实际改成了什么。估算是为了少查几次,不是为了一次都不查。 尤其是有硬红线的投稿,最后一版一定要有一份真实报告。
六、五个坑,踩过的人都很痛
坑一:把"排除"当成"降重"。
最严重的一个误解。你在自己的报告里排除得再干净,稿子里的文字一个字没变。期刊那边重新跑一次,原来的重复率会原样回来。排除只改变你的视图,不改变你的稿子。
坑二:把调过滤器调出来的低数字当成成绩。
同一份稿子,把"包含参考文献"关掉、把"排除引用文字"和"排除已标注引用"都打开、再把 small matches 阈值往上拉,重复率能低到让人开心。但这个数字和期刊看到的不是一回事。看数字的时候一定同时看设置。
坑三:期刊的设置和你不一样。
这是同一篇稿子出现两个数字最常见的原因,不是系统不准。有的期刊看含参考文献的,有的看不含的;有的按总重复率,有的更看单一来源占比。投稿要求怎么写的,就按那个口径去看你的报告。 单一来源的上限通常比总重复率更容易触雷,别只盯总数。
坑四:排除记录是能看到的。
用过排除之后,总相似度下面就挂着排除条数,点开是完整清单。所以如果你是把报告发给导师、编辑或者服务方看,你排除了什么、排除了多少,对方一目了然。排除个别确实无关的来源没问题,把二十处都排掉再说"我只有 8%",这份报告的可信度就没了。
官方在说明里也提醒了一句:排除功能是为了让分数更公平,但它不能替代人的判断,剩下的匹配仍然需要人去看,判断是规范引用还是可能的抄袭。
坑五:字段代码没处理,先白忙一场。
这是个前置问题:如果你用 EndNote、Zotero 插入的文献是带域代码的,重复率可能天然虚高,而且参考文献的自动排除也容易失效。稳妥做法是提交前把域代码转成纯文本(Word 里全选后 Ctrl+Shift+F9),另存一份用于查重,原稿留着继续编辑。
先解决这个,再谈排除,否则你排除掉的可能只是格式问题造出来的假重复。
七、分场景:不同投稿目标,操作重点不一样
投 SCI 期刊: 基准状态用"排除参考文献",看总重复率和单一来源两个数字。常见的经验区间是总重复率 20% 以内、单一来源 3% 以内;一区和顶刊更严,15% 以内更稳妥。以目标期刊的明文要求为准,这些区间只是通行经验。
投 EI 会议: 不少会议是含参考文献计算的,口径完全不同。所以基准状态要跟着变:把参考文献那一项按会议要求设置。用同一份"排除参考文献"的报告去估会议的门槛,会严重低估。
中文毕业论文(本科/硕博): 一切以本校当年的通知为准。学校指定的系统、算的是哪个口径(是否含参考文献、是否含致谢)、红线是多少,每所学校都不一样,每年还在调。iThenticate 这套操作对英文稿有用,中文毕业论文最终还是要过学校指定的系统。
只是想自己摸底: 那就把设置调到最保守(参考文献排除、其他都关),看到的数字比真实情况更严格一点,心里更有底。
八、常见问题
问:排除之后,报告能恢复原样吗? 能。总相似度下面点开排除清单,单项恢复点 Include Source,全部恢复点 Include All Sources。这个操作是可逆的,放心试。
问:排除掉的高亮,重新提交还会出现吗? 会。排除是这份报告上的视图设置,跟你的稿子无关。重新提交是一次新的比对。
问:为什么我下载的 PDF 和在线看到的数字不一样? 大概率是设置不同。用户中心直接下载的报告默认排除参考文献;在线报告右上角下载的那份会实时反映你改过的设置。核对一下两边的过滤器状态就清楚了。
问:Exclude small matches 我能不能设成 3 个词? 不能。8 词是允许的最小值,只能往上调。
问:块引用为什么没被排除? 最常见的原因是你提交的是 PDF。官方说明写明,缩进的块引用只有原文件是 .doc 或 .docx 时才会被排除。
问:我的参考文献明明写了 References,为什么还是被算进去了? 两种可能。一是文献列表后面出现了终止词(appendix、table、figure、acknowledgment 等),检查从那里恢复了;二是提交时排除算法临时不可用,走了兜底方案,官方建议过一段时间重新提交。
问:先降重还是先降 AI 率? 先降重,再看 AI 率。原因很简单:降重要做的是改写,改写会改变文风的统计特征,AI 率会跟着变。反过来先压 AI 率,等你降重再改一遍,前面的功夫白做。而且降重时千万别用改写工具批量过一遍,那是重复率降了、AI 率上去了的经典操作。
问:我要交给期刊的报告,能不能带着排除记录交? 可以,但要清楚对方看得到你排除了什么。建议交一份"基准设置、无手动排除"的报告,把该说明的情况写在信里,比一份被排除得很干净的报告更可信。
最后
这套方法的价值,说到底是把降重从"盲改"变成"看着数字改"。
它不神奇:不会替你改一个字,也不会让期刊那边的数字变好看。它只做一件事,就是让你在改的过程中知道自己走到哪了。对于要改二三十处的稿子,这一件事已经能省下好几轮反复。
用的时候记住两条就不会出错:排除只改变视图,不改变稿子;估算之后,最后一版还是要有一份真实的报告。
查个重 · chagechong.com
重复率检测 · AI 率检测 · 图片检测
24 小时自助提交,报告在线可查,可调设置、可看匹配来源、可手动排除。
查个重,查得准。想你所想,帮你阻挡。
报告仅为文字匹配结果,是否构成抄袭需结合引用规范判断。
参考来源
- iThenticate Guides, Managing filters and exclusions in the new, enhanced Similarity Report(更新于 2025-11-14):https://guides.ithenticate.com/hc/en-us/articles/27839726023565-Managing-filters-and-exclusions-in-the-new-enhanced-Similarity-Report
- iThenticate Guides, How exclusion filters refine the Similarity Report(更新于 2025-11-14,含起止词完整清单、引号类型、8 词阈值说明):https://guides.ithenticate.com/hc/en-us/articles/27870922360333-How-exclusion-filters-refine-the-Similarity-Report
- iThenticate Guides, Using filters and exclusion settings in the classic report(经典版设置):https://guides.ithenticate.com/hc/en-us/articles/27244752082701-Using-filters-and-exclusion-settings-in-the-classic-report
- iThenticate Guides, Which version of the Similarity Report am I using?:https://guides.ithenticate.com/hc/en-us/articles/27838602531085-Which-version-of-the-Similarity-Report-am-I-using
- iThenticate Guides, Overview of the new Similarity Report experience:https://guides.ithenticate.com/hc/en-us/articles/27838877807245-Overview-of-the-new-Similarity-Report-experience
- Crossref, Working with your Similarity Report:https://www.crossref.org/documentation/similarity-check/ithenticate-account-use/similarity-report-use/
- 实测量级(38% 排除单句后降至 36%)与"下载报告默认排除参考文献":整理自公开经验分享,个案数据仅供量级参考。

