← 返回课程总览

LECTURE 54 · 报告、共享与数据资产

去标识化为什么不只是删除姓名和住院号?

适合人群:医院、主要研究者(PI)、临床研究团队、数据管理人员中国法规校准版法规基准日:2026年8月4日
本讲导读删除直接身份字段只能降低显性识别风险。罕见病、精确日期、自由文本、影像标记和多字段组合仍可能让个体被重新识别。

内容解读

删除直接身份字段只能降低显性识别风险。罕见病、精确日期、自由文本、影像标记和多字段组合仍可能让个体被重新识别。

在IIT临床研究中,删除直接身份字段只能降低显性识别风险。罕见病、精确日期、自由文本、影像标记和多字段组合仍可能让个体被重新识别。 这不仅关系到研究成果能否被准确报告,也决定研究数据能否在保护受试者权益的前提下形成可持续、可复核和可复用的数据资产。

问题不在表面

常见做法是从Excel中删除姓名、电话和身份证号后就称为匿名数据,忽视研究编号对应表、极端年龄、具体中心、罕见诊断和叙述性文本。也有人过度删除关键变量,导致共享数据失去科学价值,却仍不能证明风险已经足够低。

本讲核心结论

去标识化应以具体使用场景和攻击路径为基础,区分编码化、去标识化与依法达到的匿名化。项目需盘点直接标识符、准标识符、自由文本和文件元数据,结合删除、泛化、日期偏移、分组、抑制及受控访问等措施,并评估数据接收者、环境和外部可链接信息。

问题为什么发生

第一,识别风险来自字段组合和外部数据匹配,不只来自单一字段。第二,数据越细,研究价值通常越高,隐私风险也可能越高。第三,技术处理若没有合同、权限、日志和禁止再识别要求配合,无法形成完整保护。

一个典型场景

某罕见病数据集删除了姓名和身份证号,却保留精确出生日期、就诊日期、地区和罕见并发症。研究者通过公开报道即可推断一名受试者身份,说明数据并未因删除直接标识符而自动匿名。

四步改进路径

更可执行的改进路径可以分为四步。第1,按数据类型和共享场景识别直接标识符、准标识符及可链接信息;第2,设定可接受风险和最低必要数据,选择相称的技术处理措施;第3,由独立或具备能力的角色进行重识别风险评估和可用性验证;第4,配合访问控制、协议、日志、禁止再识别及泄露响应持续管理。核心是让研究结果、共享决定和二次利用均对应清楚的数据版本、授权边界、责任角色和证据记录。

中国法规校准

适用口径:《个人信息保护法》所称匿名化,是指个人信息经处理无法识别特定自然人且不能复原;未达到该标准的编码化、假名化或一般去标识化数据仍属于个人信息。医疗健康、基因、生物识别以及不满14周岁未成年人的个人信息属于敏感个人信息,处理时应具有特定目的、充分必要性并采取严格保护措施;依法基于同意处理的,还应取得单独同意或监护人同意。

法规基准日:2026年8月4日。具体项目仍须结合研究类型及本机构要求确认。

项目自查清单

判断提示:若其中两项以上无法明确回答,说明项目仍存在需要优先处理的数据管理风险。

  • 项目是否以“无法识别且不能复原”判断匿名化,而非仅删除直接标识符?已满足 / 待改进
  • 医疗健康、基因、生物识别和不满14周岁未成年人信息是否按敏感个人信息管理?已满足 / 待改进
  • 基于同意处理敏感个人信息时,是否依法取得单独同意或监护人同意?已满足 / 待改进
  • 去标识化是否同时配合最小必要、权限、日志、禁止再识别和风险评估?已满足 / 待改进

NEED SUPPORT?

把这份清单用于您的真实项目

我们可协助完成方案数据审阅、CRF设计、EDC建库、质量管理与数据资产沉淀。

预约项目诊断 →