← 返回课程总览

LECTURE 77 · AI就绪数据与AI治理

AI模型评估为什么不能只看AUC或准确率?

适合人群:医院、主要研究者(PI)、临床研究团队、数据管理人员中国法规校准版法规基准日:2026年8月4日
本讲导读单一总体指标无法说明模型在真实工作流中是否有用。临床研究需要把区分能力、校准、错误成本、阈值和实际增益一起评价。

内容解读

单一总体指标无法说明模型在真实工作流中是否有用。临床研究需要把区分能力、校准、错误成本、阈值和实际增益一起评价。

在医院IIT临床研究管理中,单一总体指标无法说明模型在真实工作流中是否有用。临床研究需要把区分能力、校准、错误成本、阈值和实际增益一起评价。 这不仅关系到某一模型的技术表现,也决定AI应用能否保护受试者权益、维护数据完整性,并在真实研究环境中持续、可信地运行。

问题不在表面

不少论文选择最高AUC的模型,却不报告置信区间、校准和阈值依据。类别不平衡时,准确率可能很高但漏掉大多数关键事件;换到不同患病率或中心后,阳性预测值又会明显变化。

本讲核心结论

性能评价应与预期用途相匹配。分类任务通常需报告敏感度、特异度、预测值、区分度和校准,并给出不确定性;连续预测需评价误差分布和临床可接受范围。还应与现行流程或简单基线比较,评估不同阈值下的净收益、资源负担和错误后果。

问题为什么发生

第一,指标会受患病率、样本构成和阈值影响。第二,排序正确不等于概率可信,风险预测尤其需要校准。第三,模型增加大量假阳性可能拖垮数据管理或临床团队,即使AUC有所提升也未必值得采用。

一个典型场景

某AE预警模型AUC达到0.90,但为了捕获少量真实事件,每百名受试者产生四十条额外提醒。中心无法及时复核,最终高风险提醒也被淹没,实际流程表现不如原有规则。

四步改进路径

更可执行的改进路径可以分为四步。第1,依据用途和错误后果预先确定主要、次要性能指标;第2,报告置信区间、校准、阈值及关键亚组结果;第3,与现行工作流、简单规则或临床基线进行可比评价;第4,开展工作流试验,评估净收益、负担、响应和真实错误。核心是把AI从一次性的技术试验纳入临床研究的数据、质量、伦理和风险管理体系,并保留足以验证和追溯的证据。

中国法规校准

适用口径:中国现行法律法规并未为所有临床研究AI规定统一的AUC、准确率或阈值。性能标准应由预期用途、受试者风险、错误可逆性和研究关键程度决定,并在方案、统计计划和伦理材料中预先说明。若AI构成或支持药品、医疗器械注册活动,还须叠加相应注册法规和技术指导原则。

法规基准日:2026年8月4日。具体项目仍须结合研究类型及本机构要求确认。

项目自查清单

判断提示:若其中两项以上无法明确回答,说明项目或机构仍存在需要优先处理的AI数据与治理风险。

  • 性能指标和阈值是否由预期用途、错误后果和受试者风险预先确定?已满足 / 待改进
  • 是否明确不存在适用于所有临床研究AI的单一法定性能指标?已满足 / 待改进
  • 关键亚组、校准、稳定性和失败模式是否进入验证与伦理材料?已满足 / 待改进
  • 涉及药械注册证据时是否另行核对相应法规和技术指导原则?已满足 / 待改进

NEED SUPPORT?

把这份清单用于您的真实项目

我们可协助完成方案数据审阅、CRF设计、EDC建库、质量管理与数据资产沉淀。

预约项目诊断 →