Training Data Governance for Brain Foundation Models
本文认为,利用神经数据训练大脑基础模型会因脑信息的敏感性而产生新的伦理与治理挑战,并提出了一个多学科框架来应对有关隐私、知情同意、偏见、利益共享及治理方面的担忧。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于《脑基础模型训练数据治理》一文的解释,通过简单的概念和富有创意的类比进行了拆解。
大局观:一种新型的“大脑大厨”
想象一下,多年来科学家们一直在烹饪非常特定的菜肴。如果他们想做一份“癫痫汤”,他们只会收集与癫痫相关的食材。如果他们想做一份“ADHD(多动症)沙拉”,他们就只收集多动症的食材。这些就是旧的 AI 模型:任务特定型。它们擅长做一件事,但对其他任何事都毫无用处。
现在,一种名为脑基础模型(Brain Foundation Models)的新趋势已经到来。你可以把它们想象成一位大师级主厨,这位主厨不只是做一道菜。相反,这位主厨会品尝一切——来自医院、研究实验室,甚至是佩戴睡眠监测头带的人们的数百万小时脑部记录(如 EEG、fMRI 等)。通过品尝一切,主厨学会了人类大脑的“通用风味”。一旦训练完成,这位主厨可以瞬间做出癫痫汤、ADHD 沙拉,甚至是一杯“睡眠奶昔”,而无需重新学习。
问题在于: 本文认为,虽然这位大师级主厨非常出色,但我们喂养给他们的食材方式正在制造一场巨大的伦理混乱。我们正在将那些最初为了非常特定、受到严格保护的原因(例如针对某种罕见疾病的临床试验)而收集的食材,直接倒进一个巨大的、开放的搅拌碗里,用来训练一款商业产品。本文提出了疑问:这样做可以吗?谁拥有这些食材?我们如何确保主厨不会毁掉这顿饭,或者伤害提供食物的人?
第一部分:食材从哪里来?
本文解释说,为了训练这位大师级主厨,开发者正在“缝合”两种主要的类型数据:
- 公共档案(社区粮仓): 这些是来自医院和大学的数十年之久的数据库。它们是为特定研究(如研究癫痫)而收集的,并公开分享以助力科学发展。
- 商业流(私人花园): 这些是来自销售可穿戴设备(如 EEG 头带)或侵入式脑植入物公司的最新数据流。
“缝合”的问题:
想象一下,一名开发者从“社区粮仓”中取走了一罐“癫痫数据”(当时人们同意将其用于医学研究),然后将其与“私人花园”中的“冥想数据”(用户同意将其用于睡眠应用)混合在一起。接着,他们用这锅巨大的、混合在一起的炖菜来训练他们的大师级主厨。
- 风险: 最初提供“癫痫数据”的人,从未同意将他们的脑电模式用于训练一款可能被卖给公司、或被用于完全不同用途(如监测员工压力水平)的商业 AI。
第二部分:五大忧虑领域
本文将伦理担忧归纳为五个类别。以下是它们的通俗含义:
1. 隐私: “指纹”问题
脑部数据是独特的,就像指纹一样。即使你删除了姓名,通常仍然可以识别出数据属于谁。
- 类比: 想象你在公共公园里在玻璃杯上留下了独特的指纹。如果别人拥有一个指纹数据库,他们可以将你的杯子与你的脸匹配起来。
- 论文的担忧: 由于这些新的 AI 模型如此强大,它们可能能够从旧的匿名医疗记录中“重新识别”出个人身份。更糟的是,仅仅通过观察他们的脑波,它们可能就能猜出你从未告诉过他们的信息,比如“这个人患有某种罕见疾病”或“这个人现在感到压力很大”。
2. 知情同意:“空白支票”问题
如今人们提供脑部数据时,会签署一份表格,声明:“我同意研究人员将此用于未来的健康研究。”
- 类比: 想象你签署了一份表格,说:“我同意让你在未来的歌唱比赛中使用我的声音。”但你没预料到,所谓的“未来歌唱”竟然意味着你的声音被用来训练一个能写政治演说或监视邻居的机器人。
- 论文的担忧: 旧的表格并没有预见到“基础模型”。人们并未同意将他们的数据混合进一个可以用于任何地方、任何用途的巨大商业 AI 中。本文提出了疑问:“未来研究”这个词的范畴是否足够宽泛,足以涵盖这种行为?
3. 偏差:“扭曲的镜子”问题
AI 模型的效果取决于它们“吃”进去的数据。如果数据仅来自富有的、白人的、西方社会的群体,那么 AI 就会认为那才是“正常”的大脑。
- 类比: 想象一面只能反射蓝眼睛人的镜子。如果你把一个棕眼睛的人放在镜子前,镜子会显示:“错误:您不存在。”
- 论文的担忧: 大多数脑部数据来自特定的群体(WEIRD 群体:西方、受过教育、工业化、富裕、民主化)。如果我们用这些数据来训练大师级主厨,AI 可能对某些人效果很好,但对其他人则会表现糟糕,甚至因为他们的脑部模式在 AI 看来显得“不同”而导致误诊。
4. 利益共享:“免费午餐”问题
公共医院和大学投入了数百万美元和多年的努力来收集这些脑部数据。现在,私营公司正利用这些免费数据来构建价值数十亿美元的产品。
- 类比: 想象一个社区花园,每个人都在种西红柿。这时一家大公司来了,免费拿走了所有的西红柿,做成了高级番茄酱,并以此牟利。而园丁们却什么也没得到。
- 论文的担忧: 公司利用公共数据致富是否公平?医院或捐赠数据的人是否应该获得利润分成,或者至少获得使用该技术的更好机会?
5. 治理:“西部荒野”问题
我们有针对医院的法律(HIPAA),也有针对消费类 App 的法律(隐私法),但对于“脑 AI”还没有明确的法律。
- 类比: 想象一种新型车辆,它既是汽车,又是船,还是飞机。我们有关于汽车的规则,也有关于船的规则,但没有人知道哪些规则适用于这种新型混合体。
- 论文的担忧: 由于数据从医院(严格规则)跳转到消费类 App(宽松规则),再到商业 AI(没有特定规则),原有的保护机制消失了。本文指出,我们需要专门针对这个“脑 AI”领域制定新规则。
论文建议我们怎么做?
作者并不声称自己拥有所有答案,但他们提出了一些“基准保障措施”(交通规则)作为起点:
- 保持透明: 开发者必须清晰列出他们使用了哪些数据以及数据的来源(就像 AI 的营养标签一样)。
- 收紧知情同意: 新的数据收集表格需要明确说明:“您的数据可能会被用于训练通用型 AI,而不仅仅是用于某项特定的研究。”
- 控制访问: 如果风险过高,不要让所有人都能下载模型。相反,可以让人们通过一个安全的“沙盒”或 API 来使用它,从而防止被滥用。
- 分享利益: 如果一家公司利用公共数据赚了钱,他们应该给予回报,例如为提供数据的医院提供更好的工具使用权。
- 倾听各方声音: 我们需要建立包括医生、患者、伦理学家和公众在内的委员会,随着技术的成长,共同决定这些规则应如何演变。
总结
本文结论指出,脑基础模型是一个强大的新工具,有望彻底改变医学和神经科学。然而,我们目前正在匆忙建造引擎,却忘了检查刹车。我们需要停下来,在让 AI 奔跑之前,先搞清楚如何治理训练数据(即食材),否则我们可能会破坏患者、科学家与公众之间的信任。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。