企业信誉 常见问题 期刊大全
期刊
投稿邮箱

mlunwenvip@163.com

临床病例数据库实操全教程|一篇回顾性队列论文怎么写:从流程图、表格到 Methods 和 Results

发表日期 2026-08-13 17:03:58    72

临床科研中,不少医生都会碰到这样的难题:经过数据筛选、统计建模、结果校验等步骤,拿到病例筛选流程图、基线特征表(Table 1)、Cox 回归结果、比例风险假设检验以及敏感性分析等一系列成果后,开始写论文时却毫无头绪。既不知道方法部分(Methods)开头该怎么写,也不清楚结果部分(Results)该按什么顺序汇报。

一般来说,这个难题并非因为“不会造句、文笔不好”,而是写作逻辑有问题,没有把前期的研究设计、数据处理、统计方案和分析结果系统地整理成一条能让读者和审稿人查证、复核、重现的论文主线。

实际上,一篇规范、严谨、返修率低的回顾性队列论文,不是从空白的 Word 文档开始的,而是基于一套既定的研究文件。Methods 部分要清楚地回答“研究是如何开展的”,把研究的全过程呈现出来;Results 部分则要客观地展示“研究数据的真实结果”。这两个关键部分不能脱离前期的数据筛选规则、变量定义标准、统计分析预案和标准化结果输出,自己瞎编内容。

从研究结果包到论文初稿的核心路径

一、写论文前的准备:先整理全套“结果包”再动笔

正式写正文之前,千万别一边写一边找资料、东拼西凑内容。靠谱的写作思路是:先整理并核对好全套研究成果,建立起“研究文件—论文内容”的对应关系,保证论文里的数据、说法和规则都有出处。

写本研究项目论文之前,要完整地核对整理以下这些核心材料:明确的研究问题卡片、完整的病例筛选日志、标准化的数据字典、数据清洗和质量控制报告、缺失值处理记录、变量编码对照表、因果有向无环图(DAG)和预设的混杂调整集、正式的统计分析计划书、基线特征表(Table 1)、多模型 Cox 回归结果、模型诊断报告以及全套的稳健性和敏感性分析结果。

这里给临床研究者推荐一个实用的写作技巧:制作“研究文件—论文段落”对应表,实现精准写作。病例筛选日志对应正文里研究对象和流程图的描述;数据字典对应暴露指标、结局指标和协变量的定义说明;统计分析计划对应 Methods 里的统计学方法部分;各类模型输出结果支撑 Results 部分的内容;数据质量控制日志为数据管理和可靠性论证提供依据。

整个过程要遵循一个核心原则:论文里的样本量数字、变量定义、模型设置、效应量和置信区间,都要能准确对应原始文件或统计输出结果。没有出处、临时想出来或者后期修改的内容,不能写进正文,从根源上避免数据矛盾、逻辑错误和学术不端的风险。

二、Methods 部分怎么写:精准浓缩研究决策,而非编写教科书

刚开始写论文的人经常会犯一个错误,就是把 Methods 部分写成统计学教科书,花大量篇幅去解释“Cox 回归”“比例风险模型”等概念。其实,高质量临床论文的方法部分是为了让同行和审稿人理解并能重现研究的操作细节,不需要科普基础理论,只要精准浓缩并清晰呈现这项研究特有的决策和实施流程就行。

规范的回顾性队列论文 Methods 部分要包含六个核心模块,逻辑要连贯,要素要完整。

1. 研究设计和数据来源

本研究采用单中心回顾性队列研究设计,数据来自一家三甲医院内分泌科住院电子病历系统和标准化随访数据库。文中用的是合成教学数据,仅用于临床科研方法学示范教学,不代表真实临床研究结论,也不会泄露患者隐私。

要注意,正式发表的真实研究要补充一些关键要素,比如明确的研究起止时间、医院伦理委员会审批编号、知情同意豁免说明以及数据获取和使用权限说明,确保研究符合临床科研伦理规范。

2. 研究对象和队列构建

本研究的对象是成人 2 型糖尿病合并高血压的住院患者。把患者首次完全符合入组标准的住院日期定为索引日期,同时作为队列随访的起始时间。原始数据库有 1200 条住院记录,按照预设的入选和排除标准逐步筛选。

首先去掉重复住院的病例,然后排除非 2 型糖尿病确诊患者、没有高血压合并症的患者、未成年患者、关键基线变量严重缺失的病例以及没有有效随访记录、结局事件无法判断的病例,最后形成一个包含 960 例研究对象的主分析队列。

本研究采用标准化的样本量变化口径:1200→1119→1071→1035→1030→1008→960。流程图、正文、摘要、表格和补充材料里的样本量数字要保持一致,别让人看了混淆。

3. 暴露指标、结局事件和随访规则

本研究主要关注的暴露因素是患者在索引住院期间测量的基线糖化血红蛋白(HbA1c),在主要分析中把它作为连续变量纳入模型,效应量统一解释为:HbA1c 每升高 1 个百分点,心血管事件发生风险的变化幅度。
研究的主要结局是从索引日期起 365 天内患者首次发生的主要不良心血管事件(MACE),包括急性心肌梗死、缺血性脑卒中和心血管死亡。把非心血管死亡看成竞争风险事件,随访结束规则以首次事件发生为准,也就是随访到首次 MACE 事件、非心血管死亡、患者失访或者达到 365 天随访周期,哪个先发生就以哪个为准。
要记住核心规则:本研究只关注首次事件结局,就算患者在随访期间多次发生心血管不良事件,主要分析中也只算首次 MACE 事件,不能把多次事件计数当作结局指标,保证结局定义统一规范。

4. 协变量筛选和数据管理策略

本研究的协变量都是根据临床专业知识和预设的因果框架(DAG)选的,避免了临床研究中常见的依据单因素分析 P 值选混杂变量的错误做法,减少了选择性偏差。
研究设置了两个调整模型:最小调整模型纳入年龄、性别、当前吸烟状态、既往冠心病病史、糖尿病肾病病史等基础混杂因素;充分调整模型在最小调整模型的基础上,增加收缩压、甘油三酯水平、糖尿病病程等核心临床混杂变量,逐步消除混杂因素的干扰,提高结果的可靠性。
数据管理部分要详细说明质量控制流程,包括原始数据数值保留规则、单位统一修正、异常值检查和标记、数据质量管控、缺失变量处理方案。本研究最终选定的 960 例主分析队列中,主模型所需变量数据完整无缺失,所以主要分析直接在这个完整队列中进行,没有用多重插补法,只是把它作为备用的质量控制方法。

5. 统计学分析方法

本研究所有的统计分析都严格按照临床队列研究规范来做。连续变量根据数据分布特点,分别用平均数±标准差或者中位数(四分位数)来描述组间差异;分类变量用例数和构成比(%)表示。
用 Cox 比例风险回归模型来评估基线 HbA1c 水平和患者 1 年内首次发生 MACE 事件风险的关系,先后构建未调整模型、最小调整模型、充分调整模型,逐步消除混杂因素的影响。同时,通过 Schoenfeld 残差法和时间交互检验严格验证模型的比例风险假设;用限制性立方样条(RCS)分析来探究变量间潜在的非线性关系;通过方差膨胀因子(VIF)检验评估模型是否存在多重共线性问题。此外,还进行亚组分层分析、时间节点地标分析(landmark)和竞争风险分析,完善模型诊断和结果验证工作。

三、Results 部分怎么写:按研究顺序客观汇报

结果部分写作的核心原则是还原研究的实际顺序,不能只选阳性结果,也别提前突出明显结论,避免打乱分析逻辑。最稳妥、也符合期刊要求的汇报顺序是:研究对象和随访事件→基线特征分布→Cox 主分析结果→模型诊断检验→稳健性和敏感性分析。不要先提明显的阳性结果,也不能把未调整模型的结果当作最终研究结论。

1. 研究对象的基本情况和随访事件

本研究原始数据库有 1200 条住院记录,经过严格筛选,去掉 81 条重复住院记录,还剩下 1119 名患者;再排除 48 例非 2 型糖尿病患者、36 例没有高血压合并症的患者、5 例未成年患者、22 例关键基线变量缺失的患者以及 48 例没有有效随访、结局无法判断的患者,最后选了 960 例研究对象作为主分析队列。
在这 960 例研究患者中,有 116 例在 1 年随访期内首次发生 MACE 事件,累计发生率是 12.1%。其中缺血性脑卒中 52 例、急性心肌梗死 40 例、心血管死亡 24 例。随访期间,有 23 例发生非心血管死亡事件,62 例患者在 365 天随访周期结束前失访。整个队列总观察人时为 849.9 人年,MACE 事件发生率为 13.6/100 人年。
要特别注意:12.1%是随访期内累计发生比例,侧重病例占比;13.6/100 人年是基于实际观察人时计算的发病密度,侧重时间维度的事件发生强度,二者统计学意义不同,不能混用或替换。

2. 研究对象的基线特征

本研究选的 960 例患者平均年龄是 62.31±9.75 岁,男性 521 例,占比 54.3%;队列平均基线 HbA1c 水平是 7.76±0.85%。
对比不同组可以发现,发生 MACE 事件的患者通常年龄更大、糖尿病病程更长、基线 HbA1c 水平更高、eGFR 水平更低,而且冠心病、糖尿病肾病患病率更高。要强调的是,这部分只是未校正情况下不同组间基线差异的描述,只能体现组间分布特点,不能直接认定为独立危险因素,相关因果关系和独立效应要通过多变量模型验证。

3. Cox 回归主分析结果

未考虑混杂因素的原始模型显示,患者基线 HbA1c 每升高 1 个百分点,1 年内首次发生 MACE 事件的风险比 HR = 1.59,95%CI:1.29~1.97。
用年龄、性别、吸烟状态、冠心病、糖尿病肾病等因素进行最小程度校正后,效应量变小了,HR 降到了 1.26,95%CI:1.01~1.58,这种关联仍然有统计学意义。
进一步加入收缩压、甘油三酯、糖尿病病程等因素进行充分混杂校正后,HR 降到了 1.09,95%CI:0.85~1.41,统计学区间跨越无效值 1。
这组结果的关键不是单个模型的阳性显著性,而是随着混杂变量的增加,HbA1c 和 MACE 之间的关联效应明显减小。Results 部分只要客观如实地呈现数据变化就行,变化背后的机制、原因和临床意义留在 Discussion 部分详细说,避免结果和讨论内容重复。

4. 模型诊断和稳健性检验结果

Schoenfeld 残差检验和时间交互检验结果表明,本研究数据不完全符合恒定比例风险假设,传统单一 Cox 模型用全年恒定效应解释有局限性。进一步的 90 天分段时序分析显示:随访前 90 天,HbA1c 每升高 1 个百分点,对应 MACE 风险 HR = 1.63;90 天后的随访期,HR 降到了 0.91,这说明 HbA1c 与心血管事件的关联强度在不同时间差异很大,早期关联更强,后期明显减弱。
限制性立方样条分析没有发现两者间存在明显的非线性关系,方差膨胀因子检验也没显示模型存在明显多重共线性问题。按年龄、性别分层的亚组分析也没有发现明显的交互效应。
此外,30 天地标分析、剔除可能存在质量问题病例的敏感性分析、以非心血管死亡为竞争事件的 Fine - Gray 模型分析结果都和主分析趋势一致,这表明本研究的核心结果稳定可靠。

四、论文里图表怎么配:简洁精准,各有作用

回顾性队列论文的图表配置要遵循“少而精,图表皆有意义”的原则,不要堆砌图表,关键是要和写作逻辑相符、能支持论文结论。正文中最好保留四个核心图表:
Figure 1:研究对象筛选流程图,清楚地展示病例入选、排除过程以及样本量的变化情况。
Table 1:整个队列、发生 MACE 事件组、未发生 MACE 事件组的完整基线特征对比。
Table 2:未调整、最小调整、充分调整三套 Cox 回归模型的主要效应结果。
Figure 2:时间分段效应图或模型诊断验证图,直观地呈现时间差异和模型拟合效果。
像 RCS 曲线、VIF 结果、亚组森林图、landmark 分析、Fine - Gray 竞争风险等辅助结果,可以根据目标期刊的篇幅要求放在补充材料中,让正文逻辑更清晰、重点更突出。

五、常见错误自查清单:避开易修改之处

结合临床论文经常遇到的修改问题,总结了 Methods 和 Results 部分写作时容易犯的错误,写完论文后可以一项一项检查:

  1. Methods 部分提到实际没做的模型和分析,导致研究方案和实际操作不一致。

  2. Results 部分只说阳性、明显的未调整结果,隐瞒校正后没有统计学差异的核心结论。

  3. 错误解读和夸大基线组间差异,把它当成独立危险因素。

  4. 流程图、正文、摘要、表格里的样本量表述不一样,前后矛盾。

  5. 发现比例风险假设不成立后,还用单一 HR 值解释全年恒定风险效应。

六、可参照的标准化写作步骤

为了帮助临床医生高效规范地写论文,整理出了五步写作流程:
第一步:制作全文数据溯源表,明确所有数值、图表、结论对应的原始文件、分析脚本和输出结果来源,杜绝编造内容。
第二步:先完成研究对象、变量定义、统计方法这三个基础部分的写作,严格按照前期方案来,别凭记忆写。
第三步:按照“队列构建—随访事件—基线特征—主模型分析—模型诊断—稳健性检验”的固定顺序写 Results 部分。
第四步:从多个方面核对全文,保证流程图、正文、摘要、表格、补充材料里的数字表述一致。
第五步:明确各部分的功能,Results 部分只客观报告观察结果,机制解释、临床意义说明、研究意义分析留在 Discussion 部分。

七、结果表述要规范:保持科学严谨

写论文的时候,有些人容易给出绝对化的结论,引起审稿人的质疑。结合本研究结果,应该避免绝对化、因果性的表述,避开两种错误结论:一是不能直接认定“基线 HbA1c 是 MACE 的独立危险因素”;二是不能得出“降低 HbA1c 就能减少心血管事件发生”的治疗性结论。
规范严谨的表述是:在未调整模型和最小混杂调整模型中,较高的基线 HbA1c 水平与患者 1 年内首次发生 MACE 事件的风险呈正相关;经过充分校正预设临床混杂因素后,这种关联效应明显减弱,统计学置信区间跨越无效值。模型诊断显示,HbA1c 与 MACE 之间的关联存在时间差异,随访早期关联强度较高,90 天后没有明显的统计学关联。
要明确声明:本研究是单中心、回顾性、观察性队列研究,结果只是探索性关联结论,无法确定因果关系,不能直接用来指导临床治疗决策。

写在最后

从原始病历数据、统计分析结果到规范合格的队列学术论文,难点不是语句修饰和术语运用,而是保证研究设计的真实和一致。Methods 部分要还原研究的实施过程,Results 部分要客观呈现数据的真实情况。确定好研究说法、把握好核心数据、理清逻辑框架后再动笔,是降低返修率、避免逻辑错误、提高论文质量的关键。