✨ 要点🔬 技术摘要
想象一下,互联网是一座巨大且繁忙的城市。在这座城市里,有图书馆(搜索引擎)、有人们向任何愿意倾听的人大声提供建议的广场(社交媒体论坛),还有一些承诺会回答你提出的任何问题的友好机器人(对话式人工智能)。对大多数人来说,这座城市是一个寻找食谱、学习数学或与朋友聊天的地方。但对某些人来说,这座城市已变成了一个陷阱。当有人通过手机或电脑被跟踪、骚扰或控制时,他们往往会奔向这座数字城市寻求帮助,希望能找到一条逃离危险的地图。这就是“技术辅助型虐待”的世界——我们用来建立联系的工具(如 GPS 追踪器、即时通讯应用和智能家居设备)正被转化为武器。研究人员一直在追问一个大问题:如果受害者跑进这座数字城市寻求帮助,这座城市会将他们引向安全,还是会不小心将他们带入更黑暗的小巷?
一支研究团队决定在这座数字城市里扮演侦探,以找出答案。他们不仅询问了机器人或阅读了标牌;他们利用过去十年中受害者实际提出的数千个问题,构建了一个大规模的模拟系统。他们将这些问题视为“试驾”,将它们发送到互联网的三个不同部分:谷歌搜索(Google Search)、Reddit(一个巨大的在线论坛)以及各种 AI 聊天机器人。他们想看看这些回答是否有用、是否安全以及是否友善。
结果就像一场带有惊险跌落的过山车之旅。首先,他们发现谷歌搜索和大型通用型 AI 机器人其实非常擅长找到正确的“类型”的答案。如果你问“如何停止某人追踪我的手机?”,它们通常会找到一个讨论手机追踪的网页或机器人回复。然而,“切题”并不等同于“安全”。研究人员发现,超过 65% 的情况下,当受害者点击搜索结果时,他们会撞上危险的陷阱——指向网络钓鱼诈骗或恶意软件的链接。这就像图书馆给了你正确的书,但书里却充满了毒药。
在 Reddit 这个“城镇广场”上,情况则有所不同。虽然人们通常愿意交谈,但提供的建议很少有用。不到一半的问题得到了真正的回答,而且即便得到了回答,建议也往往含糊不清或不完整。更糟的是,大约有 20% 的情况下,那些大声提供建议的人实际上是刻薄、有毒或在责备受害者的。这就像是在广场上询问方向,得到的却是被人群指责或被告知“快点走”而不是得到一张地图。
最令人惊讶的转折来自机器人。研究人员测试了专门为帮助虐待受害者而设计的特殊聊天机器人,原本期待它们能成为故事中的英雄。然而,那些通用的 AI 机器人(那些可以回答从“如何烤蛋糕”到“如何修理电脑”等各种问题的机器人)给出的技术性建议竟然比专门的机器人还要好。那些专门的机器人经常无法回答问题,或者给出笼统、无用的回复。但问题在于:即使是那些表现较好的通用型机器人也存在重大缺陷。虽然它们擅长给出修复电脑的步骤,但往往无法理解问题背后的恐惧。它们经常给出在技术上可行但在现实中对受害者极其危险的建议,比如告诉某人“直接注销账号”,却没警告说这可能会销毁用于抓捕施虐者所需的证据。此外,它们也很少提到在哪里可以找到真正的真人帮助,比如求助热线或避难所。
最后,这项研究表明,尽管数字城市拥有丰富的信息,但它目前还不是一个安全的地方。我们现有的工具——无论是搜索引擎、论坛还是专门的机器人——本身都还不够好。它们可能给了你正确的词汇,但往往忽略了最重要的部分:在尝试逃脱的过程中确保你的安全。研究人员得出结论,我们需要重建这些数字助手,使它们不仅要聪明,还要谨慎、友善并深度感知风险,从而确保下一次有人奔向互联网寻求帮助时,他们找到的是救命稻草而非陷阱。
技术摘要:数字时代的求助困境
问题陈述 技术辅助虐待(Technology-facilitated abuse, TFA)涉及滥用数字工具(如智能手机、位置追踪器和智能家居设备)来跟踪、骚扰、监控或控制受害者。由于正式的支持系统往往缺乏专业的数字安全知识,且受害者出于隐私或污名化担忧而经常犹豫是否寻求正式帮助,许多人转向在线资源寻求指导。然而,这些数字渠道所提供的指导在质量、安全性以及是否符合创伤知情(trauma-informed)方面仍不为人所知。不准确或不安全的建议可能会影响受害者的风险感知,并导致有害的安全关键决策。目前缺乏实证性的、大规模的评估研究,来通过统一的技术与安全维度框架,比较不同在线支持系统(网页搜索、同伴论坛和对话式人工智能)对真实受害者查询的响应情况。
研究方法 作者利用一个源自十年间(2014–2024年)r/Stalking 版块叙述内容的受害者中心数据集,对在线支持系统进行了大规模评估。
数据集构建:
数据收集: 通过 Reddit API 和 Pushshift 存档收集了 3,266 条公开帖子和 32,162 条评论。
分类法开发: 通过跨学科团队(计算机科学与社会工作)的迭代开放编码,作者识别了 11 类技术滥用类别(例如:监视、未经授权的访问、图像篡改)。
查询提取: 利用大语言模型(Llama3.3 和 GPT-4),团队从叙述中提取了 5,926 个求助问题。
过滤: 自动分类器根据 TFA 相关性和发布者角色进行过滤,最终得到包含 2,797 个受害者撰写的 TFA 查询的数据集。
模拟求助行为: 研究模拟了在三个平台上的受害者交互:
网页搜索: 对每个受害者查询进行 Google 搜索,检索前 10 个 URL(共计 27,970 个网页)。
同伴支持论坛: 使用与原始 r/Stalking 帖子相关的现有评论串(17,714 条评论)。
对话式人工智能: 评估了五个系统:三个通用型 LLM(GPT-5、Claude Opus 4.1、Gemini-2.5-Pro)和两个领域特定聊天机器人(HopeChat、Ruth AI)。该部分使用了 50 个查询样本。
统一评估框架: 使用混合人工-LLM 方法,从两个维度对响应进行评估:
技术维度: 相关性、技术准确性、技术可操作性、技术说服力和易理解性。
社会/安全维度:
Google 搜索: 社会工程风险(通过 VirusTotal 检测恶意链接)。
Reddit: 毒性(通过 Perspective API 检测)。
LLMs/聊天机器人: 创伤知情指标,包括共情与人性化、话语权与选择权、偏见、风险知情指导以及支持信息。
核心贡献
受害者中心的数据集与分类法: 通过混合方法流程创建了一个包含 2,797 个真实的受害者撰写的 TFA 查询的数据集,并将其分为 11 种技术滥用类型。
全面的跨平台框架: 一个整合了技术指标与 TFA 特定社会及安全构件(如风险知情指导、社会工程风险)的统一评估框架。
可扩展的方法论: 验证了自动化分类器和“LLM 作为评判者”(LLM-as-a-Judge)流水线,这些方法与人类判断保持了高度一致,从而实现了大规模评估。
实证洞察: 通过系统性比较,揭示了不同平台间支持质量与安全风险的显著差异。
关键结果
相关性: Google 搜索和通用型 LLM 提供了高度相关的指导(分别为 91% 和约 88–96%),而 Reddit 评论中仅有 52% 包含相关答案。领域特定聊天机器人 HopeChat 的相关性较低(72%)。
技术准确性:
Google 搜索: 48.1% 的响应为“部分支持”,但 17.3% 提供了“破坏性指导”(例如,建议重置设备以销毁证据)。
Reddit: 没有帖子被判定为“完全支持”;63.3% 为“部分支持”,13.3% 为“破坏性指导”。
LLMs: 通用型 LLM(Claude, GPT, Gemini)达到了 65–80% 的“完全/部分支持”率,但仍有 20–26% 的案例生成了“破坏性指导”(例如,建议受害者解除对施虐者的屏蔽)。领域特定聊天机器人的表现较差,HopeChat 在超过 50% 的情况下出现了“未提供内容”的情况。
可操作性: 通用型 LLM 最具可操作性(45–75% 可操作),能提供分步指令。Google 搜索多为“信息性”(51%)而非可操作性(11%),而 Reddit 的可操作性最低(1%)。
安全风险:
Google 搜索: 65.5% 的受害者查询遇到了至少一个恶意二级 URL(多为网络钓鱼)。
Reddit: 超过 20% 的查询收到了至少一条具有毒性的评论。
LLMs/聊天机器人: 虽然通用型 LLM 比专门的聊天机器人表现出更高的共情能力,但所有系统都频繁未能提供风险知情指导或将受害者引导至专门的支持资源(如热线电话、法律援助)。一些模型对受害者的心理健康或家庭情况做出了未经证实的假设。
意义与主张 本文声称,目前的 TFA 受害者数字支持基础设施存在严重缺陷。虽然 Google 搜索和通用型 LLM 比同伴论坛或专门的聊天机器人提供更具相关性和可操作性的技术指导,但没有任何一个 被评估的系统能够持续提供安全、创伤知情的支持。
关键发现挑战了“领域特定工具更优越”的假设;专门的聊天机器人在表现上始终逊于通用型 LLM。此外,研究强调“求助行为本身可以成为一个威胁向量”,因为受害者经常暴露在恶意链接和有毒言论之中。作者认为,技术正确性是不够的;支持系统在设计时必须将安全性、可操作性和创伤知情护理作为核心优先级,以避免给脆弱用户引入新的风险。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。