← 返回课程总览

LECTURE 73 · AI就绪数据与AI治理

训练集、验证集和测试集如何真正保持独立?

适合人群:医院、主要研究者(PI)、临床研究团队、数据管理人员中国法规校准版法规基准日:2026年8月4日
本讲导读数据集拆分不是简单按比例随机切分。若同一患者、同一中心或相邻时间记录跨集合出现,模型可能提前“见过”测试环境,性能会被高估。

内容解读

数据集拆分不是简单按比例随机切分。若同一患者、同一中心或相邻时间记录跨集合出现,模型可能提前“见过”测试环境,性能会被高估。

在医院IIT临床研究管理中,数据集拆分不是简单按比例随机切分。若同一患者、同一中心或相邻时间记录跨集合出现,模型可能提前“见过”测试环境,性能会被高估。 这不仅关系到某一模型的技术表现,也决定AI应用能否保护受试者权益、维护数据完整性,并在真实研究环境中持续、可信地运行。

问题不在表面

常见做法是把所有记录随机分为70%、15%和15%,却忽略同一受试者有多次就诊、同一影像有多个切片,或同一中心模板高度相似。研究者反复查看测试集结果并调参后,测试集也事实上参与了模型开发。

本讲核心结论

拆分单位应与独立推断单位一致,通常按受试者、中心、机构或时间分组,并在建模前固定规则。训练集用于拟合,验证集用于选择和调参,最终测试集只用于一次或严格受控的独立评估。高风险或可推广任务还应尽量采用外部机构、后续时间或前瞻性数据验证。

问题为什么发生

第一,记录相关性会造成数据泄漏。第二,随机拆分无法检验跨中心、设备、流程或时间的可迁移性。第三,每次查看测试结果并调整模型,都会让最终性能逐渐适应这个测试集。

一个典型场景

某影像模型按图片随机拆分,同一患者的不同切片进入训练和测试集合。模型识别了患者和设备特征,测试AUC很高;换到另一家医院后性能明显下降,说明原测试并未模拟真实推广环境。

四步改进路径

更可执行的改进路径可以分为四步。第1,根据研究问题确定受试者、中心、设备或时间等独立拆分单位;第2,在开发前固定排除、抽样、拆分和重复记录处理规则;第3,限制测试集访问并记录每次评估、调参与重用情况;第4,使用外部、时间外或前瞻性数据评估真实迁移能力。核心是把AI从一次性的技术试验纳入临床研究的数据、质量、伦理和风险管理体系,并保留足以验证和追溯的证据。

中国法规校准

适用口径:训练集、验证集和测试集的独立性属于方法学要求,但数据划分、复制和跨团队访问仍受原伦理批准、个人信息处理目的及最小必要原则约束。为防止泄漏而建立的权限隔离、版本固化和访问日志,应同时服务于方法学可信度与个人信息安全,不能因数据来自同一医院就默认可无限复制使用。

法规基准日:2026年8月4日。具体项目仍须结合研究类型及本机构要求确认。

项目自查清单

判断提示:若其中两项以上无法明确回答,说明项目或机构仍存在需要优先处理的AI数据与治理风险。

  • 数据划分、复制和跨团队访问是否处于原伦理和个人信息用途边界内?已满足 / 待改进
  • 训练、验证和测试集是否在权限、版本和日志层面真正隔离?已满足 / 待改进
  • 测试集接触例外是否有批准、理由和影响评估记录?已满足 / 待改进
  • 研究结束后各数据副本是否按保存与删除规则受控处置?已满足 / 待改进

NEED SUPPORT?

把这份清单用于您的真实项目

我们可协助完成方案数据审阅、CRF设计、EDC建库、质量管理与数据资产沉淀。

预约项目诊断 →