企业信誉 常见问题 期刊大全
期刊
投稿邮箱

mlunwenvip@163.com

医学论文投稿前原始数据归档规范:核心留存文件清单梳理(完整可追溯归档规范)

发表日期 2026-08-26 10:19:15    84

很多课题组在投稿之前都面临这样一个状况:临近投稿时,才急急忙忙地拼凑文件、汇总数据,文件夹里全是各种“最终版文件”。统计人员发过来“分析数据_最终版.xlsx”,研究生又交上“最终版_修改后.xlsx”,负责画图的同学只留了 PDF 成品图,而 PI 的电脑里还有一份更早,但实际上正文中使用的数据结果表。

直到审稿人提出疑问,团队才发现有许多问题难以回答:论文表格里的 1078 例患者,源于哪一版原始数据?图 2 的统计结果是用哪段代码、哪些参数计算出来的?研究中剔除的 122 条无效病例,为什么要排除,筛查标准是什么?

大多数时候,没人能迅速、清晰、完整且有依据地给出答案。这也是医学论文返修、撤稿以及科研诚信遭到质疑的常见原因:只有结果,没有过程;只有成品文件,没有可追查的证据。

核心提醒:投稿归档的数据包,可不是把所有文件随便打包就行。合格的科研数据包,要保证不管是谁、什么时候,都能弄清楚:数据从哪里来,经历了哪些清理和修改,哪一版代码生成了哪张图表,每次修改是谁操作的、依据什么规则,真正做到科研过程可追查、可复核、可重现。

医学论文投稿前原始数据归档规范:核心留存文件清单梳理(完整可追溯归档规范)

一、为什么不能只留存“最终版 Excel”?

不少课题组习惯只保留最后定稿的分析数据表,觉得“结果正确、图表没问题,就可以投稿”。然而,在医学科研诚信审查和期刊终审中,仅有最终结果,本身就是个严重问题。

按照 2021 年版《医学科研诚信和相关行为规范》的要求,医学论文对应的研究资料、原始记录、实验数据、影像资料要齐全、完整、真实,而且可追溯。论文发表之后,原始数据、实验记录、生物信息资料、统计过程文件,都要按照单位要求统一归档,长期保存,以备检查。同时,该规范还明确要求医疗机构和科研单位,要建立科研过程可追溯制度和科研档案留存体系。

另外,《科学技术研究档案管理规定》涵盖了科研的整个流程,包括研究立项、方案设计、实施记录、数据处理、统计分析、成果产出、投稿归档等环节。要是出现学术争议、稿件返修、科研失信核查等情况,期刊编辑部、科研管理部门都可以要求作者提供原始数据、处理日志、分析代码和过程记录,必要时还会重新开展实验、委托第三方复核、核查数据来源。

所以,科研归档的关键不是证明“最终结果正确”,而是能够回答这些问题:原始数据从哪儿来?异常数据、缺失数据、无效样本是怎么处理的?最终用于分析的人群是怎么筛选出来的?论文里每个统计数字对应哪一版数据、哪段代码?每次数据修改、样本调整是谁操作的、依据什么标准?

二、投稿前的数据包,需要留存七层完整的证据链

能通过期刊审核、经得起科研诚信核查的标准数据包,至少要完整保留七层文件,层层嵌套、环环相扣,形成一个可追查的体系。

1. 研究治理与合规文件

这是整个研究合法合规的依据,也是期刊首先会核查的内容。包括研究方案全文、伦理批件及其每次修改的文件、知情同意书或豁免审批的依据、预设统计分析计划、临床试验注册信息、数据使用授权协议、研究重要决策记录等。重点在于:论文中的研究人群、纳入排除标准、研究时间、主要和次要结局指标,必须和伦理获批版本、注册版本一致,避免前后表述不一致。

2. 原始数据只读层

原始数据是所有分析的基础,绝对不能直接修改、覆盖或删除。要完整保存从 HIS 系统、EMR 电子病历、随访系统、实验检测平台、公共数据库导出的原始文件,并记录导出时间、检索条件、字段范围、操作人员。把原始数据设置为只读,所有清理、修改、转换操作都在副本上进行,从源头上保护原始科研记录。涉及患者隐私的敏感字段单独存放到受限目录,分析时使用去除标识的数据。

3. 标准化数据字典

没有数据字典的数据,根本没办法进行复核。数据字典要详细记录所有变量的名称、临床定义、操作判断标准、测量时间、计量单位、合法取值范围、缺失值编码规则、原始来源字段、派生变量计算方法等。比如,对于“吸烟史 = 1”,要明确它代表曾经吸烟、目前仍在吸烟,还是达到特定吸烟量,避免因为变量定义不清楚导致结果产生争议。

4. 数据清洗日志与队列筛选记录

所有数据预处理过程都必须有记录,不能私自修改、筛选。完整保存识别重复值的记录、检查和处理异常值的方法、统一单位的过程、校正日期偏差、处理缺失值的规则、样本纳入和排除的全过程记录以及人工判断的依据。每条处理规则都要明确写明:发现的问题、处理依据、受影响的样本数量、处理后的检查结果,确保每次数据调整都有可靠依据。

5. 分析数据、代码与运行环境信息

保存最终标准化分析数据集、整套数据清理脚本、统计分析代码、图表绘制代码。同时记录软件版本、插件包版本、随机种子参数、模型设定参数、完整运行日志。对于没有使用代码操作的项目,保存标准化操作步骤、参数截图和操作记录,截图只能作为辅助,不能作为唯一证据,这样才能保证后续能完全重现所有统计结果。

6. 结果—论文精准映射表

这是解决“数据不匹配、版本混乱”问题的关键文件。建立标准化的映射台账,明确对应关系:论文中的段落位置、对应的数据文件版本、对应代码文件、对应输出的图表文件、复核责任人。确保论文中的每个关键数字、每张表格、每幅图表,都能准确找到对应的唯一数据版本和分析代码,避免版本混乱。

7. 投稿归档与版本说明文件

完整保存初次投稿、每次修改的稿件、返修回复信、补充材料、期刊提交文件、最终录用定稿。标注清楚每次投稿对应的数据和代码版本。在文件夹顶层放一个 README 说明文件,写明项目负责人、数据分析师、复核人、归档时间、备份路径、访问权限和保管规范,让整个流程规范归档。

三、实操案例:1200 例病历的完整证据链示范

以一个回顾性队列研究为例:项目从医院 HIS 系统导出 1200 条住院病历数据,经过多轮筛选,最终选定 1078 例样本,整个过程都要记录下来:

最初导出 1200 条病历数据 → 去除 52 条重复数据,剩下 1148 条 → 排除 29 条不在研究时间范围内的无效样本,剩下 1119 条 → 排除 41 条无法确定主要结局的残缺记录,最终确定 1078 例研究对象。同时,针对 63 条单位不统一的检验数据,依据原始报告进行标准化换算,并全程保存对照表和处理记录,这对最终纳入人数没有影响。

合格的数据包不会只留存“最终 1078 例数据集”,而是完整保存原始导出文件、多轮筛选规则、排除的样本索引、单位换算对照表、数据清理脚本、全套分析代码、各版本输出的图表。要是审稿人对样本量、筛选逻辑、数据偏差提出疑问,团队能够直接提供可重现、可核实、可追查的完整证据,而不是靠回忆来解释。

四、论文结果和数据要一一对应、全程统一

映射表是防止医学论文出错、被撤稿的关键工具,其标准格式如下,可以直接使用:

Table 1 → analysis_v1.3 → 01_table1.R → table1_v1.3.xlsx

Figure 2 → analysis_v1.3 → 04_forestplot.R → figure2_v1.3.pdf

摘要核心结果 → Table 2 第 3 行 → 主分析模型 M1

通过这个映射体系,能够快速检查摘要、正文、表格、图注、补充材料中的所有数字是不是来自同一版本的数据,彻底避免“各处数据不一致”这种低级错误。ICMJE 在 2026 年 1 月更新的投稿规范中特别强调:所有作者都应该能够核查研究原始数据和分析过程,期刊编辑有权查看数据访问记录、分析参与记录和复核过程。

五、抛弃“最终版、最新版、真最终版”这类混乱的命名方式

缺乏规则的命名是科研数据混乱的根源。建议课题组统一采用标准化命名规范:项目名_数据类型_阶段_主版本.次版本_日期,比如:

LungCohort_analysis_dataset_v1.3_20260728.csv

要严格遵守三条版本规则:原始文件始终不覆盖、不修改;每次数据调整、代码更新都记录在 CHANGELOG 日志中;对外投稿、对内总结都使用同一有效版本,论文中的所有图表、数据、结论都基于该版本的结果,避免多个版本混用。

六、投稿前的 12 项终极自查清单

投稿前一项一项检查,确保归档没有漏洞:

  1. 原始数据完整保存,设为只读,其来源、检索条件、导出记录都能清晰查询;

  2. 研究方案、伦理批件、临床试验注册、统计计划和论文表述完全一致;

  3. 数据字典涵盖变量定义、测量时间、单位规则、缺失编码和派生逻辑;

  4. 样本纳入和排除的全过程可追溯,能从原始数据逐步核对到最终确定的人群;

  5. 数据清理、单位转换、派生变量生成都有明确规则或代码记录;

  6. 最终分析数据集能通过原始数据和清理代码完全重现;

  7. 统计软件版本、参数设置、随机种子、运行日志都已保存归档;

  8. 所有表格、图片、关键结果都完成了数据 - 代码 - 结果的映射匹配;

  9. 摘要、正文、图表、补充材料中的所有数字一致,没有矛盾;

  10. 患者隐私标识都已去除,文件访问权限设置规范;

  11. 数据负责人、分析人、复核人、归档人责任明确,整个过程可追溯;

  12. 至少进行过一次独立复算,关键结果能够稳定重现。

七、科研归档的三个常见误区

误区一:只保存最终 Excel 结果。最终数据集已经经过筛选、清理、计算,没办法还原原始状态和处理过程,不能作为科研归档的完整证据。

误区二:把文件放在共享盘就认为是完成归档了。缺乏权限管理、版本锁定、责任人记录的共享盘文件,很容易被覆盖、删除、修改,不属于有效的科研归档。

误区三:压缩包内文件数量越多,归档就越完整。科研数据归档的关键在于证据链能够闭环追查,而不是文件数量的多少,没用的文件再多也不能提高科研合规性。

数据归档风险边界说明

科研数据归档是为了完善科研追查、满足投稿和诚信核查的要求,但这不意味着数据可以随便公开共享。涉及患者隐私、人类遗传资源、生物样本数据、受限数据库、合作涉密数据,必须严格按照伦理批件、知情同意条款、数据使用协议和单位管理制度执行。同时,完整的数据归档能够避免流程和合规方面的风险,但解决不了研究设计缺陷、选择偏差、混杂偏差和测量误差等科研本身的方法问题。

写在最后:马上就能做的优化

不用一次性把所有文件都整理好,可以从最简单的逆向追查开始改进:随便选论文里最关键的一张表格或一组结果,进行完整的逆向追查:论文数值 → 输出图表 → 分析代码 → 最终数据集 → 清洗日志 → 原始导出数据。链条上存在不一致或者无法查询的环节,就是当前数据包急需填补的漏洞。