← 返回课程总览

LECTURE 75 · AI就绪数据与AI治理

如何识别训练数据中的代表性不足与算法偏倚?

适合人群:医院、主要研究者(PI)、临床研究团队、数据管理人员中国法规校准版法规基准日:2026年8月4日
本讲导读总体性能良好,不代表所有受试者都获得相同质量的结果。样本来源、就医机会、设备差异和历史流程都可能让模型对部分群体表现较差。

内容解读

总体性能良好,不代表所有受试者都获得相同质量的结果。样本来源、就医机会、设备差异和历史流程都可能让模型对部分群体表现较差。

在医院IIT临床研究管理中,总体性能良好,不代表所有受试者都获得相同质量的结果。样本来源、就医机会、设备差异和历史流程都可能让模型对部分群体表现较差。 这不仅关系到某一模型的技术表现,也决定AI应用能否保护受试者权益、维护数据完整性,并在真实研究环境中持续、可信地运行。

问题不在表面

一些研究只比较性别或年龄比例是否接近总体,就认为不存在偏倚;也有团队看到亚组样本少,便不报告亚组结果。公平性被简化为一个统计指标,忽略模型错误在不同群体中的实际后果。

本讲核心结论

偏倚评估应从数据形成过程开始,分析纳入与排除、测量、标签、缺失、医疗可及性和中心流程对不同群体的影响。除预设关键亚组性能外,还需考察错误类型、校准、阈值和临床后果。样本不足本身就是重要发现,应通过补充数据、限制用途、调整流程或加强人工复核处理。

问题为什么发生

第一,历史数据反映既有资源配置和诊疗行为,不等同于客观疾病规律。第二,平均指标会掩盖人数较少但风险较高的群体。第三,不同任务中的公平目标可能冲突,必须结合研究目的和错误后果做出透明选择。

一个典型场景

某随访风险模型主要来自城市三级医院,对流动人口和偏远地区患者的数据缺失更多。模型把“缺少就诊记录”理解为低风险,导致恰恰需要更多支持的人群较少获得提醒。

四步改进路径

更可执行的改进路径可以分为四步。第1,绘制数据形成路径并识别选择、测量、标签和缺失偏倚;第2,预先定义与疾病、服务可及性和错误后果相关的关键亚组;第3,比较各亚组的性能、校准、错误类型及工作流影响;第4,通过补充数据、限制适用范围、阈值或人工监督降低伤害。核心是把AI从一次性的技术试验纳入临床研究的数据、质量、伦理和风险管理体系,并保留足以验证和追溯的证据。

中国法规校准

适用口径:《科技伦理审查办法(试行)》要求遵循公平公正、合理控制风险和公开透明原则。代表性不足或算法偏倚可能使特定年龄、性别、疾病、地区或弱势群体承担不成比例风险;伦理审查和持续监测应查看受影响群体、补救措施和退出条件,而不能只报告总体性能。

法规基准日:2026年8月4日。具体项目仍须结合研究类型及本机构要求确认。

项目自查清单

判断提示:若其中两项以上无法明确回答,说明项目或机构仍存在需要优先处理的AI数据与治理风险。

  • 是否按关键亚组评估代表性、性能差异和不成比例风险?已满足 / 待改进
  • 公平性目标、可接受差异和补救措施是否在伦理审查材料中说明?已满足 / 待改进
  • 弱势或代表不足群体是否有额外保护和可用替代路径?已满足 / 待改进
  • 运行期是否监测偏倚变化并设置暂停、纠正和重新审查阈值?已满足 / 待改进

NEED SUPPORT?

把这份清单用于您的真实项目

我们可协助完成方案数据审阅、CRF设计、EDC建库、质量管理与数据资产沉淀。

预约项目诊断 →