内容解读
总体性能良好,不代表所有受试者都获得相同质量的结果。样本来源、就医机会、设备差异和历史流程都可能让模型对部分群体表现较差。
在医院IIT临床研究管理中,总体性能良好,不代表所有受试者都获得相同质量的结果。样本来源、就医机会、设备差异和历史流程都可能让模型对部分群体表现较差。 这不仅关系到某一模型的技术表现,也决定AI应用能否保护受试者权益、维护数据完整性,并在真实研究环境中持续、可信地运行。
问题不在表面
一些研究只比较性别或年龄比例是否接近总体,就认为不存在偏倚;也有团队看到亚组样本少,便不报告亚组结果。公平性被简化为一个统计指标,忽略模型错误在不同群体中的实际后果。
本讲核心结论
偏倚评估应从数据形成过程开始,分析纳入与排除、测量、标签、缺失、医疗可及性和中心流程对不同群体的影响。除预设关键亚组性能外,还需考察错误类型、校准、阈值和临床后果。样本不足本身就是重要发现,应通过补充数据、限制用途、调整流程或加强人工复核处理。
问题为什么发生
第一,历史数据反映既有资源配置和诊疗行为,不等同于客观疾病规律。第二,平均指标会掩盖人数较少但风险较高的群体。第三,不同任务中的公平目标可能冲突,必须结合研究目的和错误后果做出透明选择。
某随访风险模型主要来自城市三级医院,对流动人口和偏远地区患者的数据缺失更多。模型把“缺少就诊记录”理解为低风险,导致恰恰需要更多支持的人群较少获得提醒。
四步改进路径
更可执行的改进路径可以分为四步。第1,绘制数据形成路径并识别选择、测量、标签和缺失偏倚;第2,预先定义与疾病、服务可及性和错误后果相关的关键亚组;第3,比较各亚组的性能、校准、错误类型及工作流影响;第4,通过补充数据、限制适用范围、阈值或人工监督降低伤害。核心是把AI从一次性的技术试验纳入临床研究的数据、质量、伦理和风险管理体系,并保留足以验证和追溯的证据。
CHINA REGULATORY CALIBRATION
中国法规校准
适用口径:《科技伦理审查办法(试行)》要求遵循公平公正、合理控制风险和公开透明原则。代表性不足或算法偏倚可能使特定年龄、性别、疾病、地区或弱势群体承担不成比例风险;伦理审查和持续监测应查看受影响群体、补救措施和退出条件,而不能只报告总体性能。
法规基准日:2026年8月4日。具体项目仍须结合研究类型及本机构要求确认。项目自查清单
判断提示:若其中两项以上无法明确回答,说明项目或机构仍存在需要优先处理的AI数据与治理风险。
- ✓是否按关键亚组评估代表性、性能差异和不成比例风险?已满足 / 待改进
- ✓公平性目标、可接受差异和补救措施是否在伦理审查材料中说明?已满足 / 待改进
- ✓弱势或代表不足群体是否有额外保护和可用替代路径?已满足 / 待改进
- ✓运行期是否监测偏倚变化并设置暂停、纠正和重新审查阈值?已满足 / 待改进
NEED SUPPORT?
把这份清单用于您的真实项目
我们可协助完成方案数据审阅、CRF设计、EDC建库、质量管理与数据资产沉淀。
预约项目诊断 →