Authority Signals in AI Cited Health Sources: A Framework for Evaluating Source Credibility in ChatGPT Responses
本研究引入了一个权威信号框架,用于评估 ChatGPT 健康回复中的来源可信度,发现 100 个问题样本中引用的 615 个来源里,超过 75% 源自既定的机构组织,而非替代性健康信息提供者。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正走进一个巨大且混乱的图书馆,这里的管理员是一个名叫 ChatGPT 的超级聪明的机器人。你问它:“我该如何缓解头痛?”或者“什么是糖尿病?”这个机器人并不会瞎猜;它会冲向书架,抓起一叠书,通过阅读这些书来回答你。
这篇论文就像是一份侦探报告,调查的是那个机器人究竟抓取了哪些书,以及它为什么选择这些书。
问题所在:信任机器人的书架
越来越多的人在向机器人寻求健康建议。有些人甚至用它来进行自我诊断。问题在于,我们并不总是知道机器人拿起的是一本由世界著名医生撰写的书籍,还是一本由没有任何医学背景的人编写的小册子。
研究人员想要建立一个“信任清单”来观察机器人是否在挑选最可靠的来源。他们将这个清单称为权威信号框架(Authority Signals Framework)。你可以把它想象成对机器人从书架上取下的每一本书进行的四部分检查:
- 谁写的?(作者资历/Author Credentials)——封面上有医生的名字,还是匿名的?
- 谁出版的?(机构隶属/Institutional Affiliation)——是来自像梅奥医学中心(Mayo Clinic)这样的知名医院、政府机构,还是一个随机的博客?
- 如何经过审核?(质量保证/Quality Assurance)——专家是否核实了事实?是否引用了其他研究?信息是否是最新的?
- 机器人是如何找到它的?(数字权威/Digital Authority)——这本书是否有特殊的“数字标签”(比如条形码),让机器人更容易识别它?
调查过程
研究人员扮演了图书管理员的角色。他们选取了 100 个常见的健康问题(例如“流感的症状有哪些?”),并要求 ChatGPT 对其进行回答。随后,他们检查了机器人在回答中引用的每一个网站。总共,他们分析了 615 个不同的来源。
他们的发现:“三大”策略
研究发现,机器人通常表现得比较稳妥,但不同类型的网站使用不同的技巧来引起注意。
1. “名声在外”策略(占 75% 的时间)
大多数时候(超过 75%),机器人会抓取来自成熟机构的书籍。这些是重量级选手:梅奥医学中心、克利夫兰医学中心、英国国民医疗服务体系(NHS)、维基百科以及政府卫生网站。
- 类比: 这些是健康界的“名人”。它们不需要大声疾呼或穿着华丽的服装来吸引注意力;它们的声誉本身就在发挥作用。即使每页都没有标注医生姓名或没有最新的“数字标签”,机器人依然信任它们,因为它们既有名又权威。
2. “努力工作”策略(商业网站)
其余的来源主要是商业健康网站(如健康博客或产品网站)。这些网站没有知名医院那样的声誉,因此必须更加努力地吸引机器人的注意。
- 类比: 这些是试图登上舞台的“弱势群体”。为了赢得机器人的青睐,它们穿着“数字服装”(被称为 schema markup 的技术标签)、撰写非常长且详细的文章,并在页面上贴上巨大的标签,写着“经医学审核”。它们试图通过勾选“信任清单”上的每一个选项,来证明自己与著名的医院一样优秀。
3. “新鲜度”策略(专业执业网站)
一些来源是个人医生或小型诊所的网站。
- 类比: 这些网站依靠成为“新鲜农产品”来生存。它们的文章通常拥有最新的日期。机器人似乎很喜欢它们保持更新这一点,即便它们并不是图书馆里名气最大的那些。
令人惊讶的细节
- 匿名性很普遍: 在大约三分之二的来源中,机器人甚至无法辨别出是谁撰写了文章。没有列出任何作者姓名。
- 引用文献很罕见: 只有约 40% 的来源实际列出了用于支持其主张的研究或数据。
- “AI”因素: 当研究人员检查内容是由人类还是另一台 AI 撰写时,发现约 23% 的分析内容似乎是 AI 生成的。
核心结论
研究得出结论,目前 ChatGPT 主要依赖名声和声誉(机构权威)来挑选其健康来源。它更倾向于选择“大品牌”而非其他。
然而,论文警告说,随着互联网的演变,较小的或商业性的网站可能会开始使用“技巧”(如更好的数字标签或极新的日期)来诱导机器人选择它们,而不是选择受信任的医院。这项研究设定了一个“基准线”——即当前图书馆的一个快照——以便我们可以观察并看看未来机器人是否会开始选择不同的书籍。
重要提示: 作者强调这是一篇预印本(草稿),尚未经过同行评审。他们也明确表示,这项研究不应被用于做出实际的医疗决策。它仅仅是关于机器人目前如何阅读这座图书馆的一份地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。