← 最新论文
💬 NLP

Classification of Public Opinion on the Free Nutritional Meal Program on YouTube Media Using the LSTM Method

本研究采用长短期记忆(LSTM)方法对 7,733 条关于印度尼西亚免费营养餐计划的 YouTube 评论进行情感分类,整体准确率达到 89%,同时揭示由于数据集中存在严重的类别不平衡,模型性能显著偏向负面情感。

原作者: Berliana Enda Putri, Lisa Diani Amelia, Muhammad Zaky Zaiddan, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Manullang

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Berliana Enda Putri, Lisa Diani Amelia, Muhammad Zaky Zaiddan, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Manullang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网,尤其是 YouTube,就像一个巨大而嘈杂的城镇广场。在这个广场上,政府宣布了一项新计划:“免费营养餐计划”(MBG),这就像一项旨在让孩子们吃得更好的大型学校午餐倡议。

研究人员在这篇论文中没有发放纸质问卷来询问人们的看法,而是选择倾听这个“城镇广场”里的嘈杂声。他们抓取了人们在观看有关该餐计划的视频时留下的7,733 条评论

以下是他们所做的工作及其发现的大致分解:

问题:噪音太多,声音太杂

研究人员注意到,这个“城镇广场”非常不平衡。在每 100 条评论中,约有88 条是抱怨或愤怒的(负面),而只有12 条是开心或支持的(正面)。这就像一场音乐会,88 人在嘘声,只有 12 人在鼓掌。

工具:一个“超级记忆”机器人(LSTM)

为了理清这堆文本,他们使用了一个名为LSTM(长短期记忆)的计算机程序。

把 LSTM 想象成一个拥有极佳记忆的超级智能机器人

  • 普通计算机可能会逐字阅读句子,等到读到结尾时,往往已经忘记了开头。
  • LSTM 机器人则能记住整个句子。它明白,如果有人说“不好”,那么“好”这个词实际上并不意味着他们开心;“不”字改变了整个含义。这对于理解人类语言至关重要。

他们首先在一个较小的数据集上训练了这个机器人,然后在它从未见过的新评论集上进行了测试。

结果:机器人非常擅长听到嘘声,却不擅长听到掌声

当他们测试这个机器人时,情况如下:

  1. 总体得分:机器人获得了89% 的准确率。这听起来很棒,就像在考试中得了 A。
  2. “嘘声”(负面情绪):机器人在这里表现极佳。它94% 的时间都能正确识别出愤怒的评论。它确切地知道人们何时对餐计划感到不满。
  3. “掌声”(正面情绪):这是机器人失足的地方。它只有55% 的时间能正确识别出开心的评论。

为什么机器人在开心评论上失败了?
想象一下,你在教一只狗捡东西。如果你扔出 88 次红球,只扔出 12 次蓝球,这只狗最终每次都会猜“红球”,因为这是最稳妥的赌注。这正是发生在这个机器人身上的情况。由于训练数据中负面评论多得多,机器人学会了几乎每次都猜“负面”。它变得偏向于多数派。

结论

该论文总结道,虽然这个“超级记忆”机器人(LSTM)是理解 YouTube 上印尼语文本的有力工具,但当数据不平衡时,它存在盲点。

  • 奏效的部分:它在发现批评和负面意见方面非常出色。
  • 未奏效的部分:它难以发现正面意见,因为根本没有足够的例子来正确教导这个机器人。

研究人员建议,未来如果希望机器人更加公平,他们需要要么找到更多开心的评论来教导它,要么使用一种技巧,让机器人格外关注那些稀有的开心评论。在此之前,这个机器人是一个出色的“投诉探测器”,但却是一个不靠谱的“赞美发现者”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →