Auditing Exposure to Harmful Content on TikTok using Multimodal Language Models: A Cross-National, Age-Stratified Study
这项研究表明,多模态大语言模型可以为审计 TikTok 在法国、意大利和瑞典暴露于有害内容的情况提供一种具有成本效益且可扩展的方法,并揭示了与被动滚动相比,基于关键词的搜索会显著增加有害内容的暴露量,且安全过滤器经常低估显性伤害。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每天,都有数以百万计的年轻人打开应用程序观看短视频,信任着屏幕会向他们展示他们可能感兴趣的内容。在幕后,复杂的计算机程序决定了下一个会出现什么视频,通过学习每一次点击、暂停和跳过,来构建个性化的推送内容。虽然这些系统旨在增强用户粘性,但有时也会将用户推向危险或令人不安的内容,例如宣传自残、饮食失调或暴力的材料。由于这些算法作为公司服务器内部的“黑盒”运行,独立研究人员一直难以看清年轻用户究竟看到了什么。检查每一段视频非常困难,而且关于什么属于有害内容的规则会因语言和国家而异。由于缺乏明确的衡量暴露程度的方法,很难判断安全措施是否真正发挥了作用,或者是否正在辜负那些它们本应保护的人。
为了解决这个问题,来自意大利米兰理工大学的一个研究小组对 TikTok 在法国、意大利和瑞典这三个欧洲国家进行了审计。他们想看看该应用会向不同年龄段(从青少年到成年人)的用户展示哪些视频。研究人员并没有雇佣大量的人员去观看成千上万个视频,而是转向了一种新型的人工智能,称为多模态语言模型。这些先进的计算机系统可以同时阅读文本、聆听音频并观察图像,就像人类一样。研究人员首先在由人类专家标记的一组小规模视频上测试了几种此类 AI 系统。他们发现,当一个特定的模型在看到一段视频中的八张静态图像以及文本描述时,能够以足以进行大规模应用的准确水平识别有害内容。这种方法使他们能够以大约五十美元的成本分析近 37,000 个视频,如果仅靠人工审核员,这项任务将极其昂贵且缓慢。
该研究使用了模拟真实用户的计算机账号,并设定了特定年龄:十三岁、十六岁、十九岁和四十岁。这些账号分别设置在法国、意大利和瑞典,以观察应用在不同地区的表现。研究人员让这些账号在没有任何其他操作的情况下浏览其主视频流,记录算法选择向其展示的内容。他们还进行了第二次测试,即账号主动搜索与有害话题相关的特定词汇(如“自杀”或“赌博”),以观察应用的反应。结果显示,用户在被动滚动浏览与主动搜索时所看到的内容存在显著差异。当账号仅仅是滚动浏览时,有害内容的比例因国家而异。意大利在每个年龄组中显示的有害视频率最高,对于一个十九岁的虚拟人格而言,其看到的视频中近一半被标记为有害。相比之下,法国和瑞el典的比例较低,尽管这类内容依然存在。
然而,当账号开始搜索时,情况发生了剧烈变化。当研究人员输入与伤害相关的关键词时,应用立即返回了大量的有害内容,其比例跃升至 35% 到 56% 之间。这与被动滚动相比是一个巨大的增幅,表明该应用在被要求寻找此类内容时非常高效,甚至在搜索瞬间没有任何可见的警告或拦截。有趣的是,这种有害内容的激增是暂时的。一旦搜索结束,账号回到滚动浏览状态,其信息流会在几分钟内恢复到正常的、较低水平的有害内容水平。这表明算法并不会因为一次搜索就永久性地“污染”用户的推送内容,但它确实会在用户请求时提供即时的危险材料访问。
研究还发现,用户的年龄重要性不如其所在的国家重要。在法国和瑞典,青少年看到的有害内容量低于成年人,这符合安全规则的设计初衷。但在意大利,最年轻的用户看到的有害内容与成年人一样多,甚至更多,这表明安全过滤器在该特定地区并未按预期工作。研究人员指出,他们使用的人工智能并非完美无缺;它会漏掉一些视频,有时也会拒绝分析其他视频,特别是那些含有非常露骨裸露内容的视频。这意味着他们报告的数据很可能是保守的估计,实际的有害内容量可能会略高。尽管存在这些局限性,该研究证明了使用先进 AI 来审计社交媒体平台是一种可行且经济的方式,可以跨越不同语言和国家进行监测。它强调了虽然应用的搜索功能是通往有害内容的主要门户,但被动的信息流也因地理位置而产生巨大差异,其中意大利的年轻用户暴露风险最为显著。研究结果表明,平台公司需要更仔细地审视其如何管理搜索结果,以及如何针对不同地区定制安全措施,而不是假设一种“一刀切”的方法就能保护全球范围内的儿童。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。