← 最新论文
💬 NLP

Typhoon-S: Minimal Open Post-Training for Sovereign Large Language Models

本文介绍了 Typhoon S,这是一个结合了监督微调、在策略蒸馏以及结合 InK-GRPO 的小规模 RFT 的极简且开放的后训练方案,旨在证明在学术规模的资源下,无需依赖大规模指令语料库或复杂的强化学习流水线,即可开发出能够胜任泰语法律推理等特定区域任务的高质量、主权级大语言模型。

原作者: Kunat Pipatanakul, Pittawat Taveekitworachai

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Kunat Pipatanakul, Pittawat Taveekitworachai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个才华横溢、世界级的学生(一个大语言模型),他能说流利的英语和中文,但却对特定国家的当地方言、文化和法律感到陌生。通常,为了解决这个问题,大型科技公司会投入巨额资金、超级计算机和无穷无尽的数据。但如果一个规模较小的团队,比如一所大学或政府部门,想要创造属于自己的“主权”AI,既能理解当地语境,又不需要耗费数十亿美元的预算,该怎么办?

这篇论文介绍了 Typhoon-S,这是一种教导这些 AI 模型既能成为得力的通用助手,又能成为当地高风险任务(如泰国法律)专家的“极简配方”,且仅需极少的资源。

他们是如何实现的,可以分为两个主要部分:

第一部分:让 AI “可被收纳”(通用助手)

目标: 将一个原始的、聪明的基座模型转变为一个礼貌、乐于助人、能够遵循指令、编写代码并在当地语言中自然聊天的助手。

问题: 如果你只是教模型新的指令(监督式微调或 SFT),它往往会变得“脆弱”。这就像一个只背下了教科书答案的学生,一旦老师问了一个稍微不同的问题或者混合了语言,就会陷入恐慌。

解决方案:“影子训练”技术(在策略蒸馏/On-Policy Distillation)
作者使用了两步走的过程:

  1. 授课 (SFT): 他们首先给模型提供了一小部分高质量的英泰混合指令数据。这就像是给学生进行了一次速成班训练。
  2. 影子训练 (OPD): 模型不再仅仅是死记硬背答案,而是被要求生成自己的答案,而一个“教师”模型(一个更聪明的 AI)会在实时过程中观察并进行纠正。
    • 类比: 想象一名音乐系学生正在练习一首曲子。在旧的方法中,他们只是听录音并尝试模仿。而在这种新方法中,学生在演奏,而一位大师级音乐家坐在旁边,在学生演奏的同时低声进行纠正。这有助于学生学习如何从自己的错误中恢复,使其更加稳健和灵活。

结果: 他们仅通过在小型 GPU 集群(大约是一个大学实验室的规模)上进行几天的训练就实现了这一目标。最终得到的模型 Typhoon-S-8B 成为了一个强大的通用助手,能够流畅地进行聊天、编程以及在英文和泰文之间切换,足以媲美规模更大的模型。

第二部分:赋予 AI “主权能力”(当地专家)

目标: 教导模型处理复杂的、高风险的当地任务,特别是泰国法律推理,在这种任务中,它需要理解当地法律并使用工具来寻找答案。

问题: 标准的 AI 训练通常只是强化模型已经掌握的知识。如果模型不知道某项特定的泰国法律,标准的训练并不会神奇地教会它这个新事实。此外,标准训练并不会教导 AI 如何使用工具(如搜索引擎)来查找信息。

解决方案:“双脑”训练法 (InK-GRPO)
作者发明了一种名为 注入知识 GRPO (InK-GRPO) 的新训练方法。

  • 大脑游戏: 想象 AI 正在玩一个解开法律谜题的游戏。
    • 大脑 A(玩家): 它尝试利用奖励机制(类似于电子游戏中的得分)来提高自己的推理能力。
    • 大脑 B(读者): 在大脑 A 玩游戏时,大脑 B 会静静地阅读一叠泰国法律文件。
    • 奇迹之处: 系统会在这两种模式之间随机切换。有时 AI 在玩游戏;有时它在阅读文件。这使得 AI 能够在学习如何解决问题的同时,学习新的事实(法律)。

工具使用者 (Agentic RFT):
他们还教导了 AI 使用工具。

  • 类比: 与其试图记住世界上所有的法律,不如教导 AI 说:“我不知道那项具体的法律,让我搜索一下数据库”,然后阅读文件,最后给出答案。
  • 他们训练 AI 按照以下循环进行操作:思考 -> 搜索 -> 阅读 -> 思考 -> 回答。

结果: Typhoon-S-4B 法律智能体 在泰国法律推理方面表现得极其出色。令人惊讶的是,这个只有 40 亿参数的小型模型,在被给予相同的搜索工具时,其表现实际上超越了规模大得多的知名模型 (GPT-5)。

宏观图景

这篇论文证明了,你并不需要一台庞大的超级计算机来构建一个强大的、具有主权的 AI。

  • 对于通用用途: 简单的“授课”与“影子训练”组合 (SFT + OPD) 就足以让模型变得聪明且乐于助人。
  • 对于当地专业领域: 一种巧妙结合“玩游戏”与“读教科书”的方法 (InK-GRPO),可以让一个小模型有效地学习新的本地事实并使用工具。

成本: 他们完成这一切所使用的资源仅相当于一个典型的大学实验室(在 4 到 8 块高端 GPU 上进行几天的训练),这证明了在创造具有主权意识、本土化的 AI 时,巧妙的设计单纯的规模暴力更为重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →