首页专栏正文

原始数据怎么归档:一套能执行的方案,以及它在十年后值多少钱

原始数据怎么归档:一套能执行的方案,以及它在十年后值多少钱

我们写过五个论文被翻旧账的案例,跨度分别是 20 年、14 年、十余年、10 年、25 年。

把它们排在一起,会看到一个非常清楚的规律:跨度长短不重要,处理结果的差别只由一个变量决定。

案例 发表年 问题被提出 最终处理 差别在哪
PTEN 论文(Cancer Research 2005 二十年后被图片检测工具发现异常 撤稿 未见有效的原始数据回应
Neuron 论文 2011 2018 年被质疑图片剪切与重复 勘误 作者最终找到了原始数据
乳腺癌论文 约 2015 打假人举报 撤稿 举报后长期无实质回应
Joachim Boldt 系列 2000 年代 十余年前案发 累计撤稿 240 篇 系统性造假
Eliezer Masliah 系列 跨 25 年 2024 年系统性调查 免职,波及药物审批 系统性造假

看第一行和第二行。 两篇都是图片问题,都是发表十几二十年后被翻出来,一篇撤稿,一篇勘误。

差别在于 Neuron 那篇的作者最终拿出了原始数据,证明问题出在图片整理环节,而不是数据本身。

从"被质疑"到"能自证"之间隔着的,就是你当年有没有把原始文件存下来。

这件事的成本几乎是零(存个文件夹),价值却要在十年后才兑现。这篇给一套能真正执行下去的方案。


一、先想清楚:你到底在防什么

归档不是为了整齐,是为了在特定时刻拿得出东西。所以先明确要应对哪些场景。

场景一:投稿时期刊直接要。

这已经是常态了。Elsevier 的政策明确写着,作者可能被要求提供 AI 使用的文档记录,以及原始、未经处理的图像,供编辑评估。顶刊对 Western blot 的普遍要求是显示完整的膜边界和分子量标记,不接受只交裁切好的条带。

场景二:审稿人质疑某个结果。

"请提供图 3b 的原始数据"这种意见,回不回得上来,决定你是补个材料还是改结论。

场景三:论文发表后被质疑(可能是十年后)。

上面那张表说的就是这个。

场景四:国内高校要求投稿前先备案。

有高校在通报学术打假事件后,采取的措施是要求发表论文前先提交实验原始数据、备案审核通过才能投稿。这个做法如果扩散,归档就从"建议"变成"流程"。

场景五:合作者离职、学生毕业。

这是最高频、也最少被当回事的一种。课题组里数据丢失的头号原因不是硬盘坏了,是人走了。

这五个场景对归档的要求不一样: 前两个要求"找得快",第三个要求"存得久",第四个要求"格式合规",第五个要求"不依赖某个人"。一套好的方案要同时满足这四点。


二、什么算"原始数据":三个层次

很多人归档失败,是因为对"原始"的理解太窄,只存了最后那张图。

第一层:仪器直出的文件。

显微镜的原始格式文件(不是导出的 JPG)、测序的下机数据、质谱的原始谱图、示波器的波形文件、问卷平台导出的原始应答表。

判断标准:这个文件是设备或平台产生的,你没有对它做过任何处理。

第二层:处理过程与中间产物。

分析脚本或代码、处理参数与阈值设置、软件版本号、中间步骤的输出文件、统计分析的完整输出(不只是最后报告的那几个数)。

这一层最容易被漏掉,但它恰恰是"可复现"的核心。 拿得出原图但说不清怎么处理成最终图的,仍然答不上审稿人的问题。

第三层:过程记录。

实验日期、操作人、样本编号与来源、试剂批次、仪器型号与参数、异常情况的记录(那次失败的重复、那批有问题的试剂)。

第三层的价值在于它证明"这是真的做过的事"。 一份带着失败记录和批次差异的实验记录,可信度远高于一份完美无瑕的。


三、一套能执行的归档方案

原则只有一条:结构简单到你在赶 deadline 的时候也愿意照做。 复杂的方案没人能坚持。

3.1 目录结构:按论文,不按时间

很多人按日期建文件夹,结果论文投稿时要在十几个日期文件夹里翻。正确的锚点是论文,不是时间。

推荐结构:

项目名_第一作者_年份/
├── 00_manuscript/          最终稿、各投稿版本、cover letter
├── 01_raw/                 仪器直出文件,只读,永不修改
│   ├── 20260315_WB_batch1/
│   └── 20260402_imaging_s1/
├── 02_processing/          脚本、参数、软件版本说明
├── 03_intermediate/        中间产物
├── 04_figures/             按图编号
│   ├── Fig1/
│   │   ├── Fig1a_source/   这张图用到的原始文件(可用快捷方式)
│   │   ├── Fig1a_final.tif
│   │   └── Fig1_README.txt 这张图怎么从原始文件做出来的
│   └── Fig2/
├── 05_records/             实验记录、伦理批件、样本清单
└── 06_submission/          投稿相关:检测报告、AI 声明、修回材料

这个结构里最关键的是 04_figures/ 下面按图编号分的子文件夹,以及每张图的 README。 因为被质疑时,问题永远是"图 3b 是怎么来的",而不是"你 2026 年 3 月做了什么"。

3.2 每张图配一个 README:五行就够

这是整套方案里性价比最高的一件事。五行文字,十年后价值连城。

Fig 3b
原始文件:01_raw/20260402_imaging_s1/s1_ch2_z05.czi
处理软件:ImageJ 1.54f
处理步骤:仅调整亮度/对比度(linear,整图统一),未做局部处理
拼接情况:无拼接 / 由 s1、s2 两次采集拼接,接缝位置见 Fig3b_note.png
操作人与日期:张三,2026-04-03

为什么这五行有用: 审稿人或质疑者问的所有问题,答案都在这五行里。而且它逼你在做图的当下就想清楚"我做了什么",很多无意的不规范就是在这一步被自己发现的。

3.3 命名规则:三条

  • 日期用 YYYYMMDD(能自动按时间排序);
  • 不用中文、空格和特殊符号(跨系统、跨软件时最容易出问题的就是这个);
  • 文件名里带上关键信息:日期_实验类型_样本编号_重复次数。

3.4 一条硬规矩:01_raw/ 只读

原始文件夹里的东西,永远不修改、不覆盖、不改名。 需要处理就复制出来到别的文件夹处理。

操作上可以把这个文件夹设成只读,或者干脆存在一份不常动的备份介质上。

这条规矩的意义在于:只要 01_raw/ 是干净的,其他任何环节出问题都能重来。

3.5 备份:三份,两种介质,一份异地

这是备份的通行原则(3-2-1),科研数据同样适用:

  • 三份拷贝(工作副本 + 本地备份 + 异地备份);
  • 两种不同介质(比如本地硬盘 + 机构存储/云盘);
  • 一份在异地(防火灾、被盗、设备统一报废)。

对课题组的额外提醒:别把唯一一份存在学生的个人电脑或个人网盘里。 人一走,账号一注销,数据就没了。这是最常见的丢失方式,没有之一。

3.6 时间成本:投稿时一次性做,两小时

不用从头就完美执行。现实的做法是:写论文的时候,边定稿边归档。

每完成一张图,顺手做三件事:把用到的原始文件拷进 Fig X_source/、写那五行 README、确认命名规范。一张图五分钟,十张图不到一小时。

投稿前再花一小时补齐 05_records/06_submission/,整套就成型了。


四、期刊要你交的时候,怎么交

4.1 交什么,看它问什么

问"原始未处理的图像": 交仪器直出文件或它的无损导出(TIF),不要交插进 Word 或 PPT 之后再导出的版本(那已经被压缩和缩放过了)。Western blot 交完整膜,带分子量标记。

问"底层数据": 交能重现该图的数据表,加上生成该图的脚本或步骤说明。只给一张数字表而不说明怎么算的,通常还会被追问一轮。

问"图片是否经过处理": 如实说明。调整亮度对比度本身不是问题,前提是整图统一调整、幅度合理、并且说清楚。 有问题的是局部处理、选择性增强、以及不说明。

问"AI 使用记录": 按 Elsevier 的要求,给出工具名称、版本、用途和你的监督程度。这就是为什么 06_submission/ 里要单独存一份 AI 使用记录,不然投稿几个月后你自己也想不起来当时用的是哪个版本。

4.2 一个常被问到的边界:调亮度算不算处理

算,而且必须说明。

Elsevier 的政策里有一条容易被忽略:原始研究图像不得用 AI 工具创建或修改,这也包括对亮度、对比度、色彩平衡的调整,这些只能用成熟的图像处理软件来做。

为什么连这个都管: 亮度和对比度不是"美化",它们直接影响读者能看到什么。一个 Western blot 条带,对比度拉高一点,弱信号可能就"消失"了;亮度压一点,背景噪声就"干净"了。这两个操作在造假案例里出现的频率极高。

所以正确的做法是:可以调,但整图统一调、幅度合理、在 README 和必要时在文中说明。 那五行 README 里专门有一行是写这个的。


四之二、课题组层面:把它变成制度,而不是自觉

个人做归档靠自律就够了,课题组做归档靠自律一定失败。因为最需要归档的那批人(马上要毕业的学生、刚发完文章的博后),恰好是最没动力做的人。

三条能真正落地的做法:

第一,把归档挂钩到已有的节点,不新增流程。

不要单独设一个"归档检查"环节,没人会认真对待。挂到三个已有的节点上:

  • 投稿前:稿子发出去之前,把 04_figures/ 补齐(每张图的源文件 + 那五行 README)。这个节点最自然,因为你本来就在整理图。
  • 接收后:把最终版、检测报告、AI 使用声明归入 06_submission/
  • 离组前:完成交接检查。

第二,离组交接必须有清单,而且要有人签字确认。

最常见的数据丢失方式不是硬盘坏,是人走了。学生毕业、博后跳槽,账号一注销,个人电脑一格式化,数据就没了。

交接清单就用那套目录结构: 逐个文件夹确认存在、能打开、命名规范。由一个不是当事人的人来验收(比如实验室管理员或者接手这个课题的人),签字确认。

这条听起来官僚,但它是唯一有效的。 口头的"数据我拷给你了",三年后没有任何证明力。

第三,公共存储位置要固定,且不依赖个人账号。

用机构提供的存储或课题组统一的存储,不要用某个人的个人网盘账号。个人账号会随着人的离开而消失,或者因为容量到期被清空。

一个额外的建议:定期做一次"能不能打开"的抽查。 每年抽几个老项目,随机打开几个原始文件试试。备份最常见的失效方式不是丢失,是备份了但打不开(格式过时、软件停更、文件损坏而没人发现)。


五、这套方案顺带解决的四件事

归档做好之后,有几件事会变得容易,很多人事先没意识到。

第一,图片检测出问题时,你能快速定位。

投稿前跑图片检测,很多被标出来的问题不是造假,是无意的复用:对照组的图两篇论文都用了、同一批实验取错了编号、补充材料里的图和正文重了。有了按图编号的归档,一分钟就能确认到底是哪种情况。 没有的话,你得在几百个文件里找。

第二,合作者和学生离开时,交接有据可依。

把归档结构定成组内规范,人走的时候按目录清单交接,比"你把数据拷给我"靠谱得多。

第三,写下一篇论文时能复用。

同一批实验往往支撑多篇论文。归档清楚之后,第二篇的图能快速追到源头,也能避免无意中重复使用同一张图(这正是自我剽窃和图片重复的高发场景)。

第四,做数据可得性声明时不慌。

越来越多期刊要求写 Data Availability Statement。归档做好的人,写这句话是照抄目录;没做的人,是临时编。


六、常见问题

问:数据量太大,全存下来不现实怎么办? 分层处理。第一层(仪器直出)必须全存,这是不可再生的。第二层的中间产物可以只存关键节点。第三层(记录)本身占不了多少空间。如果原始数据实在太大(比如影像或测序),至少保留元数据、校验值和存放位置说明,并写清楚在哪能取到。

问:多久之后可以删? 各机构、各基金、各期刊的要求不同,常见的最短年限是若干年,但从上面那五个案例看,十年是个现实的下限,二十年也不夸张。稳妥做法是查一下你所在单位和资助方的数据保存要求,按最长的那个执行。

问:学生毕业了,数据在他电脑上怎么办? 这件事只能提前做,事后基本没救。 把"离组前完成数据交接并通过检查"设成组内硬规定,交接清单就用第三节那套目录结构。

问:原始文件格式很老,以后打不开怎么办? 这是真实风险。做法是:原始格式和一份通用格式各存一份。 比如显微镜的专有格式保留,同时导出一份无损 TIF;专有软件的工程文件保留,同时导出一份 CSV。再加一个说明文件,写清楚原始格式是什么、用什么软件版本产生的。

问:这套方案和查重、AI 率检测是什么关系? 是互补的四关。重复率、AI 率、图片这三关有工具能测;"这张图是不是这次实验拍的""这个数是不是真做出来的",任何工具都判断不了,只有原始数据能证明。 检测帮你在投稿前发现问题,原始数据帮你在被质疑时自证。两者缺一不可。

问:我已经发表的论文,现在补归档还来得及吗? 来得及,而且值得做。优先补你的代表作和被引用最多的那几篇,因为它们被质疑的概率最高、波及面最大。有研究发现高被引论文撤稿后的引用降幅更大、也更受关注。

问:如果数据确实已经找不回来了呢? 诚实面对。如果被质疑而拿不出数据,主动说明情况、说清楚为什么、并提出可行的补救方案(比如重做关键实验),比含糊其辞或长期不回应好得多。上面那张表里,几个走向撤稿的案例,共同点之一就是长期没有实质性回应


最后

这篇讲的东西一点都不高级:建几个文件夹、定个命名规则、每张图写五行说明、做好备份。

它唯一的难点是"现在做,十年后才用得上"。

但那张表已经把账算得很清楚了:同样是十几二十年后被翻出来的图片问题,一篇勘误,一篇撤稿,区别就是有没有原始数据。

而且现在这件事的兑现周期正在变短。期刊投稿时就可能要原始未处理图,有高校要求发表前先提交原始数据备案,图片检测工具在普及。十年后才用得上的假设,本身可能已经过时了。

顺带把整套自查说完整:投稿前重复率、AI 率、图片这三关跑一遍,参考文献逐条核一遍。这四关管的是"交出去之前别出问题",归档管的是"交出去之后被问也答得上来"。

前者花几小时,后者花几分钟,但只有后者是十年有效的。


查个重 · chagechong.com

重复率检测 · AI 率检测 · 图片检测

图片检测支持图像重复、拼接、克隆与 AI 生成特征识别,投稿前先发现无意的复用。24 小时自助提交,报告在线可查。

查个重,查得准。想你所想,帮你阻挡。

报告仅为图像比对与文字匹配结果,是否构成不端需结合原始数据与期刊规范判断。检测能发现问题,自证仍需原始数据。


参考来源

  1. Elsevier, Generative AI policies for journals(2026 年 6 月更新;原始研究图像不得用 AI 创建或修改,含亮度、对比度、色彩平衡;可能被要求提供 AI 使用文档与原始未处理图像):https://www.elsevier.com/about/policies-and-standards/generative-ai-policies-for-journals
  2. Elsevier, Artwork and media instructions:https://www.elsevier.com/about/policies-and-standards/author/artwork-and-media-instructions
  3. Elsevier, Article Correction, Retraction and Removal Policy(撤稿情形清单):https://www.elsevier.com/about/policies-and-standards/article-withdrawal
  4. COPE Council, Retraction Guidelines(第三版,2025 年 9 月):https://publicationethics.org/guidance/guideline/retraction-guidelines
  5. PTEN 论文(Cancer Research, 2005)二十年后撤稿、Neuron 论文(2011)历时 14 年以勘误落定,相关 PubPeer 讨论与公开撤稿/勘误记录。
  6. Retraction Watch, Now, 240: More than a decade later, journals are still retracting Joachim Boldt's papers(2026-07-15):https://retractionwatch.com/2026/07/15/joachim-boldt-retractions-journals-more-than-decade-later/
  7. Retraction Watch, Harvard cancer researchers earn retraction for image duplication(2026-07-16):https://retractionwatch.com/2026/07/16/harvard-cancer-researchers-earn-retraction-for-image-duplication/
  8. Eliezer Masliah 长达 25 年图像造假案相关公开报道。
  9. 国内高校在通报学术打假事件后要求发表前提交实验原始数据备案的公开报道。
  10. 关于高被引论文撤稿后引用降幅更大的预印本研究,见 Retraction Watch Weekend reads(2026-07-25)收录:https://retractionwatch.com/2026/07/25/weekend-reads-young-girls-death-after-gene-therapy-never-made-public-fda-retracts-lettuce-test-result-ada-delays-editorial-publication-after-controversy/

报告仅为文字匹配与特征分析结果,是否构成抄袭需结合引用规范判断;涉及具体期刊要求,以该期刊 Instructions for Authors 为准。

阅读下一篇
iThenticate 1.0 还有 5 个月停服,续订通道去年底就关了
2026-08-02 · 全文 3529 字 · 预计阅读 9 分钟
iThenticate 1.0 还有 5 个月停服,续订通道去年底就关了