← 最新论文
💬 NLP

Quantization Effects on Bangla Language Understanding in Large Language Models: A Systematic Evaluation

本文首次对训练后量化对孟加拉语理解的影响进行了系统性评估,结果表明,虽然量化通常能保持形态复杂低资源语言的性能,但其影响在不同模型架构和量化格式之间存在显著差异,其中侧重推理的任务比侧重理解的任务更易受到影响。

原作者: Ismail Hossain, Nafi Ullah Shafin, Mohammad Abdullah Al Mumin

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Ismail Hossain, Nafi Ullah Shafin, Mohammad Abdullah Al Mumin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是能够以惊人的流利度阅读、书写和通过人类语言进行推理的强大计算机程序。它们已成为从起草电子邮件到解决复杂逻辑谜题等各种用途的重要工具。然而,这些模型规模庞大,需要消耗大量的计算机内存来运行,通常需要许多个人和组织无法负担得起的专用且昂贵的硬件。为了让这些工具能在笔记本电脑和手机等日常设备上运行,工程师们使用了一种称为“训练后量化”的技术。这个过程本质上是一种压缩模型内部知识的方法,通过降低其数值的精度来节省空间并提高性能,而无需从头开始重新训练整个系统。虽然这种压缩在结构相对简单的英语中效果良好,但对于像孟加拉语(由超过 2.3 亿人使用)这样具有更复杂语法和书写系统的语言,这种方法是否依然有效,目前尚不明确。

来自孟加拉国的一个研究小组为了测试这种不确定性,着手研究了不同类型的压缩如何影响大语言模型理解孟加拉语的能力。他们选择了三个不同的模型家族,规模从 70 亿到 200 亿个参数不等,并在五个旨在衡量语言理解能力的任务上对它们进行了测试。这些任务范围广泛,从阅读理解(模型根据短文回答问题)到常识推理(要求模型使用关于世界运作方式的一般知识),以及涉及科学和逻辑的复杂推理任务。研究人员将以原始高精度格式运行的模型与使用三种不同方法进行压缩后的版本进行了对比,实际上是在询问:这些模型在被挤压进更小的空间后,是否仍能清晰地思考。

结果揭示了一个充满鲜明对比的故事,而非统一的规律。当研究人员使用一种称为 GPTQ 的特定方法压缩模型时,结果非常稳定。其中两个模型家族 Qwen 和 LLaMA 几乎保留了它们原有的孟加拉语理解能力。事实上,在某些推理任务中,压缩后的版本表现得与未压缩的原版一样好,甚至略好,准确率下降不到 1.5%。这表明对于这些特定的架构,该压缩技术足够温和,足以保留语言所需的复杂细节。

然而,对于第三个模型家族——一个名为 GPT-OSS 的、拥有 200 亿个参数的较大模型,在使用另一种称为 GGUF 的方法进行压缩时,情况发生了剧变。该模型的处理能力严重受损。在需要逻辑推理和常识知识的任务中,其准确率骤降高达 57%。它仿佛忘记了如何通过问题进行思考,在处理以前能轻松应对的基础逻辑和常识问题时步履蹒跚。该模型唯一保持相对稳定的领域是阅读理解,即它只需要从提供的文本中寻找事实。这表明,导致失败的主要原因不是语言本身,而是模型被压缩的具体方式。

研究还强调,并非所有的语言任务都同样脆弱。在所有测试的模型中,执行复杂推理和运用常识的能力比单纯阅读并从段落中召回事实的能力要敏感得多。这一模式在测试的所有模型家族中均成立,表明进行推理所需的“脑力体操”比简单地将单词与答案进行匹配更容易受到数据压缩的影响。研究人员指出,虽然孟加拉语复杂的黏着性质(即通过连接许多部分来构建单词)在理论上可能使其更难压缩,但数据表明,模型架构和压缩方法的选择比语言本身的语言复杂性更为重要。

对于希望将这些工具带到南亚及其他地区设备的开发者和组织而言,研究结果提供了一条清晰的路径。研究表明,使用 GPTQ 压缩方法配合 Qwen 或 LLaMA 等模型,可以在不牺牲推理或理解语言能力的情况下,在标准消费级硬件上进行部署。相反,对于某些类型的模型,在执行复杂推理任务时依赖 GGUF 格式可能会导致严重的失败。这项工作是一份至关重要的指南,它表明虽然我们可以缩小这些强大工具的体积以适配更小的设备,但我们必须选择正确的模型与压缩技术的组合,以确保它们保持敏锐且可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →