Mi:dm 2.0 Korea-centric Bilingual Language Models
KT 推出了 Mi:dm 2.0,这是一个包含 11.5B 和 2.3B 参数变体的双语大语言模型家族,该系列利用全面的数据流水线和文化对齐,在韩国特定基准测试上实现了最先进的性能,同时在 MIT 许可协议下支持研究与商业应用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教会一个机器人不仅要理解韩语,还要理解韩国文化的灵魂。这正是 KT(韩国电信)团队在他们的新作 Mi:dm 2.0 中所做的事情。
把大多数现有的 AI 模型想象成背诵了句型手册的游客。它们可以用韩语说“你好”和“谢谢”,但它们可能并不理解你为什么要鞠躬,不知道在面对老板与朋友时该如何使用恰当的礼貌程度,也不理解笑话中深层的历史引用。然而,Mi:dm 2.0 的设计目标是成为一名当地居民。它不仅会说这种语言,它还像是在韩国社会中生活一样去思考、推理并感知。
以下是他们构建这款 AI 的过程分解,使用了简单的类比:
1. 问题所在:“游客” vs. “当地人”
作者注意到,虽然许多 AI 模型可以讲韩语,但它们往往听起来很不自然,或者忽略了文化细微差别。这就像是一个游客试图在当地市场点菜,却因为不知道当地习俗而不小心冒犯了厨师。现有的模型训练数据要么规模太小,要么质量太低,或者根本无法捕捉到韩国生活的特定“氛围”。
2. 解决方案:一种“文化饮食”
为了解决这个问题,团队不仅仅是给 AI 喂更多的数据,而是喂给它更好的数据。他们像厨师准备美食大餐一样对待训练数据:
- 食材(数据): 他们并没有从互联网上胡乱抓取。他们建立了一个严格的“质量控制”流程。想象一个筛子,它过滤掉破碎的句子、粗鲁的评论和令人困惑的文本,只保留清晰、高质量且具有文化相关性的故事、新闻和书籍。
- 合成补充剂: 由于高质量的韩语数据很稀缺(就像寻找一种特定的稀有香料),他们创建了“合成”数据。他们将现有的知识重新改写成新的格式,比如将枯燥的百科全书条目转化为教科书课程,或将新闻报道转化为对话,以确保 AI 从多样化的来源中学习。
- 均衡的菜单: 他们注意到 AI 吃得“人文”(历史、文学)太多,而“STEM”(科学、数学)不够。因此,他们刻意烹饪了额外的“STEM 菜肴”,以确保 AI 营养均衡,不会因为饮食单一而“生病”。
3. 两个模型:“主厨”与“折叠小刀”
他们发布了两个版本的 AI 以适应不同的需求:
- Mi:dm 2.0 Base (115 亿参数): 可以把这看作是主厨。它体量庞大、功能强大,能够处理复杂的任务,如深度推理、撰写长篇故事或解决困难的数学问题。它是通过将一个较小的 80 亿参数模型进行“拉伸”(增加更多层)来构建的,从而在不改变其基本结构的情况下使其变得更聪明。
- Mi:dm 2.0 Mini (23 亿参数): 这是折叠小刀。它小巧、轻便,旨在运行在电力有限的设备上(如手机或笔记本电脑)。他们对“主厨”的知识进行了“修剪”,保留了最重要的技能,使其无需庞大的厨房也能出色工作。
4. 训练过程:从“阅读”到“对话”
- 预训练(阅读图书馆): 首先,AI 阅读了数百万份文档,以学习语言、事实和逻辑的基础知识。
- 后训练(学徒期): 在阅读之后,AI 进入了一个专门的学徒阶段。他们教授了它特定的技能:
- 遵循指令: 学习如何说“是的,先生”并完全按照你的要求去做,而不仅仅是做它“认为”你想让它做的事。
- 安全性: 学习什么不应该说。他们教它识别有害话题(如仇恨言论或非法行为),并礼貌地拒绝参与,表现得像个负责任的成年人。
- 工具使用: 教它如何使用外部工具,例如计算器或搜索引擎,以获取实时答案。
5. 结果:通过“当地测试”
团队使用特殊的韩国测试(类似于文化智商测试)将 Mi:dm 2.0 与其他著名的 AI 模型进行了对比。
- 结论: Mi:dm 2.0 不仅通过了测试,而且表现优异。它在理解韩国历史、文化和复杂社会情况方面的得分高于其他模型。
- “大海捞针”: 他们测试了 AI 是否能在海量文档中找到极其微小的信息(就像在大海里捞针)。Mi:dm 2.0 在这方面表现出色,证明了它可以在长篇、详细的对话中处理信息而不迷失方向。
- 安全性: 当面对旨在诱导 AI 说出恶意或危险内容的陷阱问题时,Mi:dm 2.0 比竞争对手更能守住底线,显示出它拥有强大的“道德准则”。
总结
Mi:dm 2.0 是一款双语(韩语-英语)AI,经过专门工程设计,使其具有以韩国为中心的特性。它不是一个碰巧会说韩语的通用机器人,而是通过摄取高质量、富有文化内涵的数据成长起来的,从而理解韩国社会的细微差别、幽默感和价值观。无论你需要一个处理复杂任务的强大大脑(Base),还是一个处理日常任务的灵巧助手(Mini),这款 AI 的设计初衷都是为了让你感觉它不像一台机器,而更像是一位博学的当地朋友。
注:论文指出这些模型根据 MIT 许可证发布,可用于研究和商业用途;开发者也承认,尽管他们在努力实现安全性,但没有 AI 是完美的,仍可能会犯错。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。