← 最新论文
💻 computer science

Mi:dm 2.0 Korea-centric Bilingual Language Models

KT 推出了 Mi:dm 2.0,这是一个包含 11.5B 和 2.3B 参数变体的双语大语言模型家族,该系列利用全面的数据流水线和文化对齐,在韩国特定基准测试上实现了最先进的性能,同时在 MIT 许可协议下支持研究与商业应用。

原作者: Donghoon Shin, Sejung Lee, Soonmin Bae, Hwijung Ryu, Changwon Ok, Hoyoun Jung, Hyesung Ji, Jeehyun Lim, Jehoon Lee, Ji-Eun Han, Jisoo Baik, Mihyeon Kim, Riwoo Chung, Seongmin Lee, Wonjae Park, Yoonseo
发布于 2026-01-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Donghoon Shin, Sejung Lee, Soonmin Bae, Hwijung Ryu, Changwon Ok, Hoyoun Jung, Hyesung Ji, Jeehyun Lim, Jehoon Lee, Ji-Eun Han, Jisoo Baik, Mihyeon Kim, Riwoo Chung, Seongmin Lee, Wonjae Park, Yoonseok Heo, Youngkyung Seo, Seyoun Won, Boeun Kim, Cheolhun Heo, Eunkyeong Lee, Honghee Lee, Hyeongju Ju, Hyeontae Seo, Jeongyong Shim, Jisoo Lee, Junseok Koh, Junwoo Kim, Minho Lee, Minji Kang, Minju Kim, Sangha Nam, Seongheum Park, Taehyeong Kim, Euijai Ahn, Hong Seok Jeung, Jisu Shin, Jiyeon Kim, Seonyeong Song, Seung Hyun Kong, Sukjin Hong, Taeyang Yun, Yu-Seon Kim, A-Hyun Lee, Chae-Jeong Lee, Hye-Won Yu, Ji-Hyun Ahn, Song-Yeon Kim, Sun-Woo Jung, Eunju Kim, Eunji Ha, Jinwoo Baek, Yun-ji Lee, Wanjin Park, Jeong Yeop Kim, Eun Mi Kim, Hyoung Jun Park, Jung Won Yoon, Min Sung Noh, Myung Gyo Oh, Wongyoung Lee, Yun Jin Park, Young S. Kwon, Hyun Keun Kim, Jieun Lee, YeoJoo Park

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教会一个机器人不仅要理解韩语,还要理解韩国文化的灵魂。这正是 KT(韩国电信)团队在他们的新作 Mi:dm 2.0 中所做的事情。

把大多数现有的 AI 模型想象成背诵了句型手册的游客。它们可以用韩语说“你好”和“谢谢”,但它们可能并不理解你为什么要鞠躬,不知道在面对老板与朋友时该如何使用恰当的礼貌程度,也不理解笑话中深层的历史引用。然而,Mi:dm 2.0 的设计目标是成为一名当地居民。它不仅会说这种语言,它还像是在韩国社会中生活一样去思考、推理并感知。

以下是他们构建这款 AI 的过程分解,使用了简单的类比:

1. 问题所在:“游客” vs. “当地人”

作者注意到,虽然许多 AI 模型可以讲韩语,但它们往往听起来很不自然,或者忽略了文化细微差别。这就像是一个游客试图在当地市场点菜,却因为不知道当地习俗而不小心冒犯了厨师。现有的模型训练数据要么规模太小,要么质量太低,或者根本无法捕捉到韩国生活的特定“氛围”。

2. 解决方案:一种“文化饮食”

为了解决这个问题,团队不仅仅是给 AI 喂更多的数据,而是喂给它更好的数据。他们像厨师准备美食大餐一样对待训练数据:

  • 食材(数据): 他们并没有从互联网上胡乱抓取。他们建立了一个严格的“质量控制”流程。想象一个筛子,它过滤掉破碎的句子、粗鲁的评论和令人困惑的文本,只保留清晰、高质量且具有文化相关性的故事、新闻和书籍。
  • 合成补充剂: 由于高质量的韩语数据很稀缺(就像寻找一种特定的稀有香料),他们创建了“合成”数据。他们将现有的知识重新改写成新的格式,比如将枯燥的百科全书条目转化为教科书课程,或将新闻报道转化为对话,以确保 AI 从多样化的来源中学习。
  • 均衡的菜单: 他们注意到 AI 吃得“人文”(历史、文学)太多,而“STEM”(科学、数学)不够。因此,他们刻意烹饪了额外的“STEM 菜肴”,以确保 AI 营养均衡,不会因为饮食单一而“生病”。

3. 两个模型:“主厨”与“折叠小刀”

他们发布了两个版本的 AI 以适应不同的需求:

  • Mi:dm 2.0 Base (115 亿参数): 可以把这看作是主厨。它体量庞大、功能强大,能够处理复杂的任务,如深度推理、撰写长篇故事或解决困难的数学问题。它是通过将一个较小的 80 亿参数模型进行“拉伸”(增加更多层)来构建的,从而在不改变其基本结构的情况下使其变得更聪明。
  • Mi:dm 2.0 Mini (23 亿参数): 这是折叠小刀。它小巧、轻便,旨在运行在电力有限的设备上(如手机或笔记本电脑)。他们对“主厨”的知识进行了“修剪”,保留了最重要的技能,使其无需庞大的厨房也能出色工作。

4. 训练过程:从“阅读”到“对话”

  • 预训练(阅读图书馆): 首先,AI 阅读了数百万份文档,以学习语言、事实和逻辑的基础知识。
  • 后训练(学徒期): 在阅读之后,AI 进入了一个专门的学徒阶段。他们教授了它特定的技能:
    • 遵循指令: 学习如何说“是的,先生”并完全按照你的要求去做,而不仅仅是做它“认为”你想让它做的事。
    • 安全性: 学习什么不应该说。他们教它识别有害话题(如仇恨言论或非法行为),并礼貌地拒绝参与,表现得像个负责任的成年人。
    • 工具使用: 教它如何使用外部工具,例如计算器或搜索引擎,以获取实时答案。

5. 结果:通过“当地测试”

团队使用特殊的韩国测试(类似于文化智商测试)将 Mi:dm 2.0 与其他著名的 AI 模型进行了对比。

  • 结论: Mi:dm 2.0 不仅通过了测试,而且表现优异。它在理解韩国历史、文化和复杂社会情况方面的得分高于其他模型。
  • “大海捞针”: 他们测试了 AI 是否能在海量文档中找到极其微小的信息(就像在大海里捞针)。Mi:dm 2.0 在这方面表现出色,证明了它可以在长篇、详细的对话中处理信息而不迷失方向。
  • 安全性: 当面对旨在诱导 AI 说出恶意或危险内容的陷阱问题时,Mi:dm 2.0 比竞争对手更能守住底线,显示出它拥有强大的“道德准则”。

总结

Mi:dm 2.0 是一款双语(韩语-英语)AI,经过专门工程设计,使其具有以韩国为中心的特性。它不是一个碰巧会说韩语的通用机器人,而是通过摄取高质量、富有文化内涵的数据成长起来的,从而理解韩国社会的细微差别、幽默感和价值观。无论你需要一个处理复杂任务的强大大脑(Base),还是一个处理日常任务的灵巧助手(Mini),这款 AI 的设计初衷都是为了让你感觉它不像一台机器,而更像是一位博学的当地朋友。

注:论文指出这些模型根据 MIT 许可证发布,可用于研究和商业用途;开发者也承认,尽管他们在努力实现安全性,但没有 AI 是完美的,仍可能会犯错。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →