← 返回课程总览

LECTURE 31 · 数据采集与质量控制

缺失数据如何做到“可解释、可追踪、可分析”?

适合人群:医院、主要研究者(PI)、临床研究团队、数据管理人员中国法规校准版
本讲导读空白本身没有含义。只有区分未发生、未检查、未知、拒绝、失访、不适用和技术失败,缺失数据才可能被正确解释和分析。

内容解读

空白本身没有含义。只有区分未发生、未检查、未知、拒绝、失访、不适用和技术失败,缺失数据才可能被正确解释和分析。

在IIT临床研究中,空白本身没有含义。只有区分未发生、未检查、未知、拒绝、失访、不适用和技术失败,缺失数据才可能被正确解释和分析。 这不仅是日常操作安排,更直接影响数据能否及时发现问题、支持研究决策并在分析时保持可信。

问题不在表面

一些项目把所有缺失都留空,或用0、999、NA混在数据字段中表示不同情况。系统看似完成率很高,实际无法判断是真实零值、未采集,还是项目流程没有执行。

本讲核心结论

缺失管理应从CRF设计开始:为不同缺失情形提供受控原因,保留应采集与实际采集的关系,并对关键数据缺失建立及时追问、升级和影响评估。不能为了“补齐”而推测或编造数值。

问题为什么发生

第一,不同缺失机制会影响统计方法和结果解释。第二,关键终点缺失可能反映失访、执行困难或受试者风险。第三,若缺失原因只记录在自由文本或聊天记录中,统计数据集无法系统使用。

一个典型场景

某研究中量表总分为空,有的受试者未到访,有的只漏答一个条目,有的因病情无法完成。数据库只保留空白,统计时无法判断是否可以按量表规则计算,也无法区分失访与部分缺项。

四步改进路径

更可执行的改进路径可以分为四步。第1,定义项目级缺失、未知、不适用和未实施的受控原因;第2,在访视、表单和字段层面记录应发生状态与实际状态;第3,对关键数据缺失及时发起澄清并追踪补充可能性;第4,定期分析缺失率、原因分布、中心差异和对终点的影响。核心不是增加程序或文件数量,而是让问题被及时识别、由正确角色处理,并留下完整、可复核的证据链。

项目自查清单

判断提示:若其中两项以上无法明确回答,说明项目仍存在需要优先处理的数据管理风险。

  • 数据库是否能够区分主要缺失原因,而不是只保留空白?已满足 / 待改进
  • 是否禁止用真实可能取值代替缺失编码?已满足 / 待改进
  • 关键终点和安全数据缺失是否有及时追踪与升级?已满足 / 待改进
  • 是否定期评估缺失模式、中心差异及分析影响?已满足 / 待改进

NEED SUPPORT?

把这份清单用于您的真实项目

我们可协助完成方案数据审阅、CRF设计、EDC建库、质量管理与数据资产沉淀。

预约项目诊断 →