BengaliMCQ: Automatic Generation and Answer Prediction of Academic Multiple-Choice Questions in a Low-Resource Language
该论文介绍了一种结构感知检索增强生成框架,该框架将孟加拉语教科书建模为层级图,从而显著提升了这种低资源语言在多项选择题生成和答案预测方面的表现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,大型语言模型已成为阅读、写作和推理的强大工具。这些系统可以处理海量的文本,但它们面临着一个实际的限制:它们无法一次性阅读整个图书馆。当被要求根据一章长篇教科书生成特定类型的题目时,模型往往会迷失在庞大的文字量中,从而忽略最重要的细节。为了解决这个问题,研究人员使用了一种称为“检索增强生成”的技术。这种方法就像一位图书管理员,在把书交给老师之前,先为学生找到所需的准确页面。然而,寻找这些页面的标准方法通常将教科书视为平铺的句子列表,忽略了章节、标题和段落是如何组织的。这在处理像孟加拉语这样数字资源较少、难以训练此类系统的语言时尤为困难,导致结果往往不准确或不相关。
孟加拉国布拉克大学(BRAC University)的一个研究小组致力于解决这一问题,他们教计算机理解书籍的结构,而不仅仅是其中的文字。他们开发了一个名为 BengaliMCQ 的系统,旨在为学生自动创建多项选择题,并以高准确度回答这些问题,同时全程使用孟加拉语。该系统并没有将整本教科书喂给人工智能,而是首先构建了一张书籍的地图。它将教科书视为一个层级结构,将章节连接到标题,将标题连接到段落,再将段落连接到单个句子。这张地图让计算机能够看到思想是如何从一个部分流向另一个部分的,就像家谱展示亲属之间的关系一样。
为了使这张地图发挥作用,研究人员训练了一个专门的计算机程序来导航它。他们创建了一个包含数千个样本问题及其对应答案段落的数据集。通过这种训练,系统学会了识别书中哪些部分与特定主题最相关。当用户要求系统针对“光合作用”或“孟加拉文学”等主题生成问题时,系统不会扫描整本书,而是利用其地图仅检索出五个最重要的段落。这些简短且集中的摘录随后被发送给大型语言模型,由其编写高质量的问题或寻找正确答案。这个过程极大地减少了计算机需要处理的信息量,使任务变得更快、更精准。
这种方法的测试结果令人瞩目。在与标准技术进行对比测试时,新系统在寻找正确信息方面表现得远优于后者。当其他方法往往难以定位正确段落时,研究人员的系统能始终如一地识别出最相关的文本。当他们测试系统的题目生成能力时,输出的内容不仅更准确,而且更具多样性和教学意义。或许最令人印象深刻的是,该系统实现了 91.41% 的答案预测准确率。这意味着,当给定一个往届考试的问题时,系统能正确识别答案超过十分之九次的概率。相比之下,那些试图一次性阅读整本书或使用缺乏结构化搜索方法的其他方法表现明显较差,经常迷失在无关文本的噪音中。
研究人员还发现,书籍的结构是他们成功的关键因素。当他们移除代表文本层级的连接(例如章节与子标题之间的联系)时,系统的性能便会崩溃。这证明了理解材料的组织方式比仅仅获取文字本身要重要得多。他们还发现,当系统被训练去寻找特定数量的相关句子并忽略过于微弱的联系时,效果最好。通过微调这些设置,他们确保了系统只关注思想之间最强的联系。
为了确保其工作质量不仅限于计算机评分,团队还聘请了人类专家来评审生成的题目。两位文学和科学领域的专家对系统创建的随机题目样本进行了评估。专家们认为绝大多数题目都具有相关性和实用性,其中生物学题目得分最高。这种人工验证证实了该系统不仅仅是在模仿模式,而是确实在产出符合真实课堂标准的教学内容。研究还强调了一个显著的效率提升:通过使用这种结构化方法,系统将需要处理的文本量从超过 43,000 字减少到了仅 1,651 字,且没有丢失任何必要的上下文。
尽管取得了这些成功,研究人员也承认其工作并非没有局限性。用于教导系统的训练数据是由其他人工智能模型生成的,这意味着在基础阶段存在产生错误或“幻觉”的可能性。此外,人工评估仅限于一小组专家和特定的主题。团队建议,未来的工作应涉及完全由人类策划的更大规模数据集,以进一步提高可靠性。尽管如此,这项研究为低资源语言的教育技术展示了一条清晰的路径。通过尊重教科书的自然结构并利用其来引导人工智能,我们可以创造出既高度准确又与学习过程深度相关的工具,从而弥合复杂技术与学生及教师日常需求之间的鸿沟。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。