← 返回课程总览

LECTURE 44 · 锁库、统计交付与归档

派生变量和计算规则如何避免“各算各的”?

适合人群:医院、主要研究者(PI)、临床研究团队、数据管理人员中国法规校准版
本讲导读年龄、基线、变化值、量表总分、访视归窗和终点事件常常不是直接录入值,而是由多个原始变量按规则派生;规则不统一,结果就不会统一。

内容解读

年龄、基线、变化值、量表总分、访视归窗和终点事件常常不是直接录入值,而是由多个原始变量按规则派生;规则不统一,结果就不会统一。

在IIT临床研究中,年龄、基线、变化值、量表总分、访视归窗和终点事件常常不是直接录入值,而是由多个原始变量按规则派生;规则不统一,结果就不会统一。 这不仅是研究结束阶段的技术安排,也决定数据状态能否被准确理解、分析过程能否被复核,以及最终结论是否经得起追溯。

问题不在表面

一些项目在EDC、Excel和统计程序中分别计算同一指标,公式、舍入、缺失处理和基线选择却不一致。结果是页面显示值、数据清理值和最终分析值彼此冲突,团队只能在报告阶段逐个解释。

本讲核心结论

每个重要派生变量都应有唯一或清楚分层的规范,说明输入变量、来源、时间窗、顺序、公式、单位、精度、缺失与边界处理以及版本。用于录入提示的操作性计算与用于正式推断的统计派生可以不同,但必须明确用途和关系。

问题为什么发生

第一,简单公式也隐藏日期取整、舍入顺序和重复测量选择。第二,量表和复合终点常有最低答题数或替代规则。第三,规则散落在系统配置、统计代码和个人工作表中,会导致修改无法同步。

一个典型场景

某项目的年龄在EDC中按入组日计算,统计程序按随机日计算;对只记录出生年月的受试者,两处采用的补日期规则也不同。最终基线年龄分层出现数例不一致,并影响亚组人数。

四步改进路径

更可执行的改进路径可以分为四步。第1,建立关键派生变量清单并指定正式用途和责任角色;第2,编写包含输入、算法、精度、缺失和边界处理的派生规范;第3,用典型、异常和边界测试病例验证不同系统中的计算;第4,对规则变更实施版本控制并评估所有受影响数据集和输出。核心是让每个决策对应明确的数据版本、责任角色和证据记录,使数据从清理完成到分析与归档保持连续可追溯。

项目自查清单

判断提示:若其中两项以上无法明确回答,说明项目仍存在需要优先处理的数据管理风险。

  • 关键派生变量是否都有书面、版本化且可执行的算法?已满足 / 待改进
  • 基线、时间窗、重复测量、缺失和舍入规则是否明确?已满足 / 待改进
  • EDC显示计算与统计分析派生的用途和差异是否被说明?已满足 / 待改进
  • 规则是否通过边界案例验证并能追溯到原始输入变量?已满足 / 待改进

NEED SUPPORT?

把这份清单用于您的真实项目

我们可协助完成方案数据审阅、CRF设计、EDC建库、质量管理与数据资产沉淀。

预约项目诊断 →