Lost but not erased: Finding traces of a forgotten language in neural speech models
本研究表明,在接受第二语言训练的神经语音模型中仍存在被遗忘的母语痕迹,这表明语言习得中的关键期效应源于基础表征的固化,而非成熟过程中塑性的丧失。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人们通常认为语言是一项必须在童年特定窗口期内学习的技能,即存在一个生物学上的截止期限,过了这个期限,大脑失去以同样轻松程度吸收新声音和模式的能力。这种被称为“关键期”的概念表明,如果孩子在生命早期停止使用母语,这种语言就会永远消失,被大脑的成熟所抹除。然而,有人对这种简单的抹除论提出了质疑。国际收养儿童——那些从原生家庭被带往新国家抚养的孩子——往往会完全失去说或听懂第一种语言的能力。成年后,他们对这种语言没有意识层面的记忆。然而,仔细的测试表明,这些人重新学习母语声音的速度比从未听过该语言的人要快得多。这种遗忘的知识能以惊人的速度回归的现象表明,这种语言并非真的被删除了,而仅仅是被隐藏了。长期以来困扰科学家的问题在于:这是因为人类大脑拥有一种特殊的、有时限性的生物机制来保留这些痕ę迹,还是仅仅是人类或人工智能等学习系统构建其基础时的一种自然结果?
为了调查这一点,研究人员转向了人工智能,特别是旨在识别语音的计算机模型。这些模型并非生物;它们不会像人类那样生长、老化或成熟。相反,它们纯粹通过数据暴露来进行学习,这使其成为分离“经验影响”与“生物影响”的完美工具。科学家训练这些模型理解一种语言(例如德语),然后突然将训练数据切换到一种完全不同的语言(例如法语)。这种设置模拟了国际收养儿童的经历,迫使模型放弃第一种语言并掌握第二种语言。正如预期的那样,模型很快失去了识别第一种语言的能力,其表现水平下降到了与随机猜测无异的水平,同时在学习新语言方面变得高度精通。从表面上看,第一种语言似乎已经消失了,就像人类收养儿童的情况一样。
然而,当研究人员观察模型的内部结构时,他们发现第一种语言并未消失。模型的架构是由层级构建的,类似于一座多层建筑,底层处理基础细节,高层处理复杂含义。研究人员发现,丢失语言的痕迹依然存在,但它们几乎完全集中在网络中最底层、最基础的层级中。这些早期层级负责处理基本的语音模式——即语音的原始构建模块——然后再将它们组合成单词或句子。即使模型在学习新语言的过程中花费了数千小时,这些底层层级仍然保留着原始语言的统计特征。处理复杂语法和词汇的高层层级已被完全覆盖,但基础部分却顽固地保持不变。
为了测试这些隐藏的痕迹是否真的有用,研究人员要求模型重新学习其丢失的语言。那些经历过早期暴露的模型能够显著更快地重新学习第一种语言。事实上,它们达到高准确度所需的步骤比从未听过该语言的模型减少了约百分之十四。这种速度优势证明了这些痕迹不仅仅是消极的残留物,而是具有功能的。这些模型本质上是在利用旧有的、基础性的声音图谱来构建新的语言技能,从而获得了领先优势。至关重要的是,当研究人员将快速学习模型的底层层级替换为从未学习过第一种语言的模型层级时,这种速度优势便消失了。这证实了这种益处专门来自于那些早期、根深蒂固的层级。
研究还探讨了产生这些持久痕迹所需的初始暴露时长。他们发现,这种效应并非简单的“时间越长越好”。相反,随着模型学习第一种语言的时间增加,痕迹会逐渐增强,在达到一定时间后达到顶峰,如果训练继续过久,则开始缓慢下降。这表明存在一个优化窗口,使这些基础性的表征变得根深蒂固,之后它们就会变得稳定且难以改变。研究人员认为,这种行为并不需要特殊的生物钟或成熟期限。相反,这似乎是学习系统运作的一种自然结果:一旦系统建立了一个稳定的基础,就很难在不破坏其上方所有构建物稳定性的情况下,完全重写这个基础。
这些发现为语言学习中的关键期提供了新的视角。与其说这是一个关闭的生物窗口,不如说早期经验难以被抹除,可能仅仅是系统自身结构的结果。早期的学习创造了一个持久的、低层级的脚手架,支撑着未来的所有学习。当输入发生变化时,系统会调整其高层功能以适应新语言,但基础层级依然存在,保留着过去的痕迹。这意味着在国际收养儿童身上看到的“节省效应”可能不是人类生物学的谜团,而是学习本身的一种普遍属性。语言并没有被抹除;它被埋藏在深厚的基础之中,等待着在系统再次被要求在其上进行构建时被重新挖掘。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。