← 最新论文
💻 computer science

Sentiment Analysis of Indonesian Spotify Reviews Using Machine Learning and BiLSTM

本文在 70,155 条经过清洗的印尼语 Spotify 评论上对经典机器学习模型与 BiLSTM 深度学习模型进行了基准测试,发现尽管 BiLSTM 取得了最高的整体加权 F1 分数,但结合 SMOTE 的决策树在所有三个情感类别中均展现出更优的均衡性能,尤其针对少数类中的中性类别。

原作者: Uliano Wilyam Purba, Andre Hadiman Rotua Parhusip, Sahid Maulana, Luluk Muthoharoh, Ardika Satria, Martin C. T. Manullang

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Uliano Wilyam Purba, Andre Hadiman Rotua Parhusip, Sahid Maulana, Luluk Muthoharoh, Ardika Satria, Martin C. T. Manullang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一家拥有海量用户的音乐流媒体应用(如 Spotify)的老板,手头堆积着来自印尼用户的 10 万封来信。其中有些是情书(“积极”),有些是愤怒的咆哮(“消极”),还有些只是模棱两可的耸肩或抱怨,难以归入上述任何一类(“中性”)。你的目标是构建一个机器人,能够阅读这些信件并自动将它们分入正确的堆中。

本文是对两类不同机器人进行这场“分拣任务竞赛”的成绩报告。

两位竞争者

  1. 传统团队(机器学习):可以将它们想象为三位非常聪明、经验丰富的图书管理员(支持向量机、多项式朴素贝叶斯和决策树)。它们擅长观察单个单词并统计其出现频率。它们速度快、效率高,且无需超级计算机即可运行。
  2. 深度学习团队(BiLSTM):这是一个由神经网络(双向长短期记忆网络)构建的单一高度复杂的机器人。不妨将这个机器人想象成一名侦探,它不仅仅查看单词,还试图理解句子的“故事”和“流向”,通过从左到右以及从右到左的阅读来捕捉完整的上下文。

赛况设置:赛道不平等的竞赛

研究人员组织了这场竞赛,但存在一个关键问题:赛场大小并不完全相同。

  • 清洁团队:在竞赛开始前,所有信件都经过了清理。俚语被修正(例如将"gak"改为"tidak"),拼写错误被删除,不必要的词语也被剔除。这对所有参赛者都是一样的。
  • 传统团队的赛道:这三位图书管理员得以阅读全部 7 万多封经过清理的信件。他们拥有完整的数据集供学习。
  • 深度学习机器人的赛道:这个高级机器人仅被允许阅读2 万封较小的样本。为什么?因为研究人员是在没有强大显卡的标准计算机(CPU)上工作的。让这个大机器人在全部数据山上进行训练将耗时太久,因此他们给它分配了一个较小但具有代表性的切片。

结果:谁赢了?

1. 传统团队的表现
在三位图书管理员中,决策树是当之无愧的赢家。

  • 工作原理:它构建了一个规则流程图来分拣信件。
  • 得分:它获得了0.727的“加权 F1 分数”。
  • 关键点:它在分拣所有三堆(积极、消极和中性)方面表现相当均衡。它没有忽视“中性”信件。

2. 深度学习机器人的表现
BiLSTM 机器人是一个 powerhouse(强力选手),但它有一个盲点。

  • 得分:它取得了更高的总体得分,为0.807
  • 问题:它在识别“积极”和“消极”信件方面表现出色,但在“中性”类别上完全失败。它在“中性”类别上的得分为0.000。它基本上完全忽略了这个类别,这可能是因为在它的训练切片中,与其他类别相比,“中性”信件的数量太少。

核心启示:权衡取舍

本文以一个简单的类比作为结论:

  • 如果你想要判断评论总体是开心还是悲伤的最佳准确率,**深度学习机器人(BiLSTM)**是更好的选择。它就像一辆在直道上速度快得惊人的跑车,但无法应对急转弯。
  • 如果你需要对所有三个类别(包括棘手、安静的“中性”类别)都保持公平传统决策树是更好的选择。它就像一辆可靠的 SUV,虽然速度不是最快,但能很好地应对各种地形,不会落下任何乘客。

为什么会发生这种情况?

  • “中性”问题:“中性”评论属于少数派(仅占数据的约 6%)。深度学习机器人在没有特殊帮助的情况下,基于小样本进行训练,学会了忽略少数群体以最大化其总体得分。传统团队使用了一种称为SMOTE的技术(这就像人为地为机器人创建更多的“中性”示例供其学习),这帮助他们公平地对待所有群体。
  • 数据差距:深度学习机器人拥有的学习样本较少(14,000 对 70,000)。即使样本较少,它在“积极/消极”分类上仍然击败了传统模型,这表明对于简短的印尼语评论而言,理解单词的序列是非常强大的。

最终结论

研究人员并未止步于数字;他们将两个机器人上线,供任何人测试。他们发现,虽然花哨的深度学习模型总体更强大,但当你需要捕捉每一类评论(而不仅仅是那些大声的评论)时,更简单的机器学习模型更加平衡和可靠。

简而言之:花哨的机器人更快、更强,但简单的图书管理员对人群中的安静声音更加公平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →