← 返回课程总览

LECTURE 71 · AI就绪数据与AI治理

什么样的临床研究数据才算“AI就绪”?

适合人群:医院、主要研究者(PI)、临床研究团队、数据管理人员中国法规校准版法规基准日:2026年8月4日
本讲导读AI就绪不是把更多病历、影像和检验数据堆到同一个平台,而是让数据在特定研究目的下具有明确含义、可靠质量、合法来源和可追溯处理过程。

内容解读

AI就绪不是把更多病历、影像和检验数据堆到同一个平台,而是让数据在特定研究目的下具有明确含义、可靠质量、合法来源和可追溯处理过程。

在医院IIT临床研究管理中,AI就绪不是把更多病历、影像和检验数据堆到同一个平台,而是让数据在特定研究目的下具有明确含义、可靠质量、合法来源和可追溯处理过程。 这不仅关系到某一模型的技术表现,也决定AI应用能否保护受试者权益、维护数据完整性,并在真实研究环境中持续、可信地运行。

问题不在表面

一些团队认为数据量越大,模型就越可靠,于是先汇聚数据、后补字段解释和质量规则。最终同名变量含义不同,时间点混乱,缺失机制不清,训练记录也无法追溯。数据规模扩大后,原有偏差和错误反而被更稳定地学习下来。

本讲核心结论

AI就绪数据至少应具备六项基础:用途明确,来源和权限合法,变量与时间语义一致,质量适合预定任务,人群和场景具有代表性,以及从原始数据到模型输入的转换可重现。是否“就绪”必须相对于具体任务判断;适合病例筛选的数据,不一定适合终点判定或个体风险预测。

问题为什么发生

第一,模型会同时学习真实规律、测量差异和流程习惯。第二,常规诊疗数据的缺失和记录频率通常不是随机的。第三,数据清洗、筛选和派生规则会直接改变模型看到的研究对象,因此这些处理本身也是需要控制的研究过程。

一个典型场景

某团队用多年电子病历预测患者脱落,但不同年份预约系统和随访方式发生变化,早期“失访”字段并不等同于后期定义。模型离线表现很好,部署后却把流程变化误当作患者风险,无法支持实际干预。

四步改进路径

更可执行的改进路径可以分为四步。第1,从明确的临床或数据管理任务定义最小必要的数据需求;第2,建立来源、变量、时间、单位、缺失和质量说明,并确认合规基础;第3,形成可版本化的数据加工管道和数据集说明书;第4,用代表性、稳定性和任务适用性指标完成AI就绪评估。核心是把AI从一次性的技术试验纳入临床研究的数据、质量、伦理和风险管理体系,并保留足以验证和追溯的证据。

中国法规校准

适用口径:AI就绪首先必须是合法、合规和伦理可用。训练、验证或评估使用医疗健康、基因等敏感个人信息时,应核对处理合法基础、告知与同意安排、最小必要、保存期限和个人信息保护影响评估;用于科技活动的,还应依《科技伦理审查办法(试行)》开展伦理风险评估并接受相应审查。数据质量提升不能突破原批准用途和授权边界。

法规基准日:2026年8月4日。具体项目仍须结合研究类型及本机构要求确认。

项目自查清单

判断提示:若其中两项以上无法明确回答,说明项目或机构仍存在需要优先处理的AI数据与治理风险。

  • AI数据集是否具有明确合法基础、伦理批准、用途边界和最小必要范围?已满足 / 待改进
  • 敏感个人信息处理前是否完成影响评估并落实严格保护措施?已满足 / 待改进
  • 数据质量、标签和可用性改进是否未突破原同意与批准用途?已满足 / 待改进
  • AI科技活动是否完成科技伦理风险评估并进入适用审查流程?已满足 / 待改进

NEED SUPPORT?

把这份清单用于您的真实项目

我们可协助完成方案数据审阅、CRF设计、EDC建库、质量管理与数据资产沉淀。

预约项目诊断 →