← 最新论文
💻 computer science

STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator

STELLAR-E 是一个完全自动化的两阶段框架,用于生成高质量、可定制的合成数据集以进行严格的 LLM 应用评估,它在实现与现有基准相当的评估质量的同时,为手动数据收集提供了一种可扩展且高效的替代方案。

原作者: Alessio Sordo, Lingxiao Du, Meeka-Hanna Lenisa, Evgeny Bogdanov, Maxim Romanovsky

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Alessio Sordo, Lingxiao Du, Meeka-Hanna Lenisa, Evgeny Bogdanov, Maxim Romanovsky

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位主厨,正试图训练一台非常聪明的厨房机器人(即大型语言模型,或 LLM)来烹制特定菜肴。为了教导它,你需要一本包含数千个问答的食谱书(即数据集)。

问题:
通常,获取这些食谱是一场噩梦。你必须聘请人类专家来编写它们,这既缓慢又昂贵,而且如果食谱涉及秘密家庭配方(私有数据)或严格的卫生法规,往往根本不可能实现。此外,大多数食谱书仅用英语编写,这让讲意大利语、斯瓦希里语或其他语言的厨师被排除在外。

解决方案:STELLAR-E
本文的作者构建了一台名为STELLAR-E的机器。你可以把它想象成一个自动化的“食谱工厂”,它能够瞬间打印出高质量、定制化的食谱书,支持任何语言,且无需任何人类作家或现有的秘密食谱。

以下是该工厂的运作方式,分解为简单步骤:

1. 蓝图(主题生成)

工厂不会凭空猜测要问什么,而是先让一个智能 AI 头脑风暴,列出一系列“主题”(例如“意大利面”或“德国银行法规”)。随后,它扮演一位严格的编辑,剔除任何过于模糊或无关的主题。

2. 编写问题(指令生成)

一旦有了好的主题,工厂就会生成实际的问题。但它不会只写一次就寄希望于好运,而是使用**“反馈循环”**:

  • AI 编写一个问题。
  • 一个“裁判 AI"对其进行评分。
  • 如果评分太低,AI 必须重写该问题。
  • 这个过程反复进行,直到问题完美无缺。
  • 类比: 这就像一名学生反复重写论文,直到老师给出 A+,而不是仅仅提交初稿。

3. 增加难度(难度增强)

有时,AI 生成的问题过于简单,比如问“天空是什么颜色的?”。工厂拥有一个特殊模块,会对问题进行改写,使其更具挑战性,确保机器人厨师必须真正动脑筋才能回答。

4. 检查多样性(多样性增强)

如果工厂不小心打印出 100 个意思完全相同的问题,那就是浪费时间。该系统使用“语义扫描器”(一种能理解词语含义的工具)来检查问题之间的距离。如果两个问题过于相似,系统就会删除其中一个。这确保了最终的书本包含广泛多样的独特挑战。

5. 最终考试(评估)

工厂不仅仅止步于制作书本;它还会测试机器人厨师。他们利用该系统创建了英语和意大利语的测试书,并将其与真实的人类编写测试书进行了比较。

他们发现了什么?

  • “足够好”的标准: 合成(AI 制作)的测试书在质量上与真实的人类编写测试书非常接近。事实上,AI 制作的书籍仅比真实书籍“容易”约5.7%
  • 小型机器人的陷阱: 研究发现,虽然大型、强大的 AI 模型能很好地应对合成测试,但小型、较弱的 AI 模型发现真实的人类测试比 AI 制作的测试难得多。似乎 AI 制作的测试无意中包含了“作弊码”或模式,小型机器人可以利用这些来获得高分,而真实的人类测试则 genuinely 更加困难。
  • 语言至关重要: 该系统在英语和意大利语中均表现良好,证明你无需将英语测试翻译成其他语言即可获得良好结果;你可以直接原生生成它们。

结论
STELLAR-E 是一个工具,允许公司即时创建自定义、私有且多语言的测试套件。它解决了“我们没有足够的数据来测试我们的 AI"这一问题。虽然这些测试并非完全等同于人类制作的测试(尤其是对小型 AI 模型而言),但它们足够好,可以作为一种快速、廉价且可靠的替代方案,无需雇佣成百上千的人类编辑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →