← 返回课程总览

LECTURE 74 · AI就绪数据与AI治理

AI模型的标签和“金标准”如何建立?

适合人群:医院、主要研究者(PI)、临床研究团队、数据管理人员中国法规校准版法规基准日:2026年8月4日
本讲导读模型学到什么,首先由标签决定。标签若来自不一致诊断、未验证代码或单名专家判断,模型再复杂也只能复制其中的不确定性和偏差。

内容解读

模型学到什么,首先由标签决定。标签若来自不一致诊断、未验证代码或单名专家判断,模型再复杂也只能复制其中的不确定性和偏差。

在医院IIT临床研究管理中,模型学到什么,首先由标签决定。标签若来自不一致诊断、未验证代码或单名专家判断,模型再复杂也只能复制其中的不确定性和偏差。 这不仅关系到某一模型的技术表现,也决定AI应用能否保护受试者权益、维护数据完整性,并在真实研究环境中持续、可信地运行。

问题不在表面

项目常直接把出院诊断、收费代码或历史报告当作金标准,没有说明形成时间、诊断依据和误分类风险。多人标注时只报告最终结果,不保存原始意见、分歧处理和标注者背景,导致标签质量无法评估。

本讲核心结论

参考标准应与预期用途相匹配,并在方案中定义来源、时间窗、证据层级、标注规则和不确定类别。需要专家判断时,应开展培训、盲法或独立标注,评估一致性,并以预设机制处理分歧。无法获得绝对金标准时,应诚实说明参考标准的局限,开展敏感性分析。

问题为什么发生

第一,临床结局可能随观察时间和检测方法改变。第二,常规记录中的代码常服务于诊疗或结算,并非为模型任务设计。第三,强迫把模糊病例标成二元结果会隐藏真实不确定性,使性能指标产生虚假的确定感。

一个典型场景

某模型用病历中的“感染”诊断作为标签,但部分中心依据培养结果,另一些中心依据经验治疗。模型最终主要学习了各中心的诊断习惯,而不是统一的感染状态。

四步改进路径

更可执行的改进路径可以分为四步。第1,依据预期用途定义参考标准、证据来源和判定时间窗;第2,编制标注手册并培训标注者,保留版本和示例;第3,采用独立标注、一致性评估和预设分歧裁决机制;第4,量化标签不确定性并开展误分类或敏感性分析。核心是把AI从一次性的技术试验纳入临床研究的数据、质量、伦理和风险管理体系,并保留足以验证和追溯的证据。

中国法规校准

适用口径:人工标注和金标准建立会处理医疗健康等敏感个人信息,并可能引入对个体或群体的不利推断。项目应限定标注者、数据范围和环境,约定保密与退出,记录分歧解决和专家责任;若标注结果将用于影响个人权益的自动化决策,应在个人信息保护影响评估和科技伦理审查中明确其风险。

法规基准日:2026年8月4日。具体项目仍须结合研究类型及本机构要求确认。

项目自查清单

判断提示:若其中两项以上无法明确回答,说明项目或机构仍存在需要优先处理的AI数据与治理风险。

  • 标注者是否仅接触完成任务所需的最小数据,并受保密与退出控制?已满足 / 待改进
  • 标签定义、专家资格、分歧解决和金标准责任是否可追溯?已满足 / 待改进
  • 敏感推断及对个体或群体的不利影响是否进入影响评估和伦理审查?已满足 / 待改进
  • 外包标注是否明确受托关系、禁止复用、转委托和删除验证?已满足 / 待改进

NEED SUPPORT?

把这份清单用于您的真实项目

我们可协助完成方案数据审阅、CRF设计、EDC建库、质量管理与数据资产沉淀。

预约项目诊断 →