← 最新论文
💬 NLP

Benchmarking PyCaret AutoML Against IndoBERT Fine-Tuning for Sentiment Analysis on Indonesian IKN Twitter Data

本文表明,针对关于印尼新首都努山塔拉(IKN)的非正式印尼语推特评论进行二元情感分析时,对 IndoBERT 模型进行微调的表现显著优于经典的 PyCaret AutoML 方法,其准确率达到 89.59%,而后者仅为 77.57%。

原作者: Mutia Alfi Mayzaroh, Dwi Fitria Ningsih, Nindi Destriani, Martin C. T. Manullang

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Mutia Alfi Mayzaroh, Dwi Fitria Ningsih, Nindi Destriani, Martin C. T. Manullang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图理解公共广场上庞大而嘈杂的人群的情绪。这群人正在讨论一个重大的新项目:印尼的新首都 IKN。人们在推特上大声表达观点——有人欢呼,有人抱怨。你的任务是判断这群人总体上是开心还是不满。

这篇论文就像是为两位受雇解开情绪变幻之谜的“侦探”出具的成绩单。

两位侦探

侦探 1:“自动整理者”(PyCaret 与机器学习)
这位侦探就像一位高效、循规蹈矩的助手。他们使用一种名为PyCaret的工具,这就像一个能自动整理推文的“智能工具箱”。

  • 工作方式: 他们查看推文并统计特定词汇出现的频率(就像词频计数器)。他们尝试了三种不同的策略:
    1. 逻辑回归: 一种直线型猜测器。
    2. 朴素贝叶斯: 一种基于词汇模式的概率猜测器。
    3. 支持向量机(SVM): 一种试图将开心推文与悲伤推文区分开来的边界绘制器。
  • 结果: “直线型猜测器”(逻辑回归)是其中表现最好的。它正确判断了约**77.5%**的推文。它是一个扎实可靠的员工,但有时会错过俚语或讽刺的细微差别。

侦探 2:“超级阅读者”(IndoBERT 与深度学习)
这位侦探是一位天才,在见到任何一条推文之前,就已经阅读过数百万本印尼语书籍和文章。这就是IndoBERT,一种“Transformer"模型。

  • 工作方式: 这位侦探不只是数词,而是理解语境。他们知道单词"sakit"(生病)可能意味着“我身体病了”,也可能意味着“这个项目很糟糕”,具体取决于句子。他们专门针对印尼语进行了训练,因此能理解当地的俚语、缩写以及人们在社交媒体上杂乱无章的打字方式。
  • 结果: 这位侦探正确判断了约**89.6%**的推文。他们敏锐得多,捕捉到了第一位侦探错过的细微差别。

对决:记分牌

研究人员利用 1,472 条关于新首都的真实推文进行了一场公平的比赛。他们将推文分为训练集(学习)和测试集(考试)。

  • 机器学习团队(PyCaret): 他们能做到的最好成绩是77.57% 的准确率
  • 深度学习团队(IndoBERT): 他们取得了89.59% 的准确率

差距: “超级阅读者”以超过12 个百分点的优势击败了“自动整理者”。在猜测情绪的世界里,这是一次巨大的胜利。

为什么“超级阅读者”赢了?

论文用一个简单的类比来解释这一点:

  • 自动整理者就像只懂得词汇字典定义的人。如果你说“这个项目很sick",他们可能会认为你是指它字面上生病了,或者因为"sick"在俚语中也可以表示“酷”而感到困惑。
  • 超级阅读者就像在互联网上长大的母语者。他们知道推文中的"sick"通常意味着“很棒”或“糟糕透顶”,具体取决于语气。他们理解句子的氛围,而不仅仅是词汇。

代价:聪明的代价

这里存在一种权衡。

  • 自动整理者很轻量。它可以在普通笔记本电脑上快速运行,不需要超级计算机。如果你资源有限,它非常合适。
  • 超级阅读者很沉重。它需要大量的计算能力,训练时间也更长。这就像开法拉利:它更快、更精准,但耗油更多,需要更大的车库。

结论

论文总结道,如果你想要最准确地了解印尼人在社交媒体上对新首都的感受,你应该使用IndoBERT模型。它比传统方法更能处理推特那种杂乱、非正式且充满俚语的特性。

然而,如果你没有强大的计算机,或者需要一个快速简单的答案,逻辑回归模型(传统工具中最好的)仍然是一个不错的选择,尽管准确率稍低。

简而言之: 对于理解复杂、充满对话且俚语繁多的印尼互联网,“超级阅读者”(深度学习)是明确的赢家,将“自动整理者”(机器学习)远远甩在身后。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →