Towards Consistent Detection of Cognitive Distortions: LLM-Based Annotation and Dataset-Agnostic Evaluation
本文提出利用多个独立的 LLM 运行来生成认知扭曲检测这一主观任务的一致性标注,并引入了一种基于科恩 kappa 系数的数据集无关评估框架,证明了 LLM 生成的数据相较于人工标注数据能带来更优越的模型性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教计算机识别“认知扭曲”。这些扭曲就像思维陷阱或扭曲的思维方式(例如,“我一次考试没考好,所以我就是个彻底的失败者”),当人们与心理健康问题作斗争时,这些内容经常出现在他们的文字中。
问题在于,识别这些陷阱极具主观性。即使是人类专家,也常常对某个特定句子是否包含扭曲意见不一。这就像让五个人判断一朵云是否像兔子;有人说像,有人说不像,而且没有“正确”的答案。这种分歧使得数据变得“嘈杂”,难以用于训练计算机。
本文提出了两个巧妙的解决方案来解决这一混乱局面。
1. “机器人众包”策略(更优质的标注)
研究人员没有让某个人或某个 AI 只做出一次猜测,而是让一个大语言模型(LLM)——具体来说是 GPT-4——连续五次查看同一段文本。
- 类比:想象你试图在一个杂乱的房间里寻找一个隐藏的物品。如果你只看一次,可能会漏掉它,或者看错东西。但如果你看了五次,并且每次都在完全相同的位置看到了那个物品,你就可以非常有把握地确认它确实存在。
- 方法:他们让 AI 运行了五次。如果 AI 在五次尝试中有四次或五次给出了相同的标签(例如,“这是‘非黑即白思维’"),他们就将该标签接受为“真相”。如果 AI 感到困惑,每次给出的答案都不同,他们就将该文本标记为模棱两可。
- 结果:这种“共识”方法创建了一个比原始人工标注数据更干净、更一致的数据集。当他们在这个“机器人共识”数据上训练一个新的计算机模型时,其表现明显优于在杂乱的人工数据上训练的模型。
2. “公平竞赛”指标(更优质的评估)
通常,为了判断哪个计算机模型更好,研究人员会比较它们在测试中的得分(如 F1 分数)。但如果测试题目不同,这种比较就不公平。这就像比较一名运动员在平坦跑道上的成绩与另一名运动员在泥泞上坡小径上的成绩。你不能只看数字;条件至关重要。
- 类比:想象两名学生参加了不同的数学考试。一份试卷很简单,另一份很难。如果学生 A 在难题上得了 80%,而学生 B 在简单题上得了 90%,谁实际上更优秀?你需要知道他们比随机猜测好多少。
- 方法:作者引入了一种新的成功衡量方式,称为数据集无关评估。他们不只是看原始分数,而是计算模型比“随机猜测者”(即随机选择答案的人)好多少。他们使用了一种名为**科恩卡帕系数(Cohen's Kappa)**的统计工具对此进行标准化处理。
- 结果:这使得他们能够公平地比较在不同数据集上训练的模型。即使考虑到数据的难度,在“机器人共识”标签上训练的模型仍然显示出,它们比在人工标签上训练的模型学习得更有效。
人工核查(现实检验)
随后,研究人员请三位人类心理学专家审查结果。他们向专家展示成对的句子:一句由原始人工标注,另一句由“机器人共识”标注。
- 结果:专家们感到困惑。他们无法就哪个标签更好达成一致。事实上,专家之间的分歧程度几乎与原始数据所暗示的分歧程度一样大。
- 启示:这并没有证明机器人是“对”的而人类是“错”的。相反,它突显了数据本身就很棘手。许多文本片段并没有清晰地陈述扭曲的思维;它们只是描述了一个事件或一种情绪。如果没有治疗师进行追问,通常无法确切知道那个人在想什么。这种“噪音”不仅仅存在于标注中,也存在于原始材料本身。
总结
本文认为,对于检测心理健康模式这类主观任务:
- 一致性是关键:让 AI 多次对同一事物进行标注,并且只信任它重复给出的答案,这比信任单个人或单次 AI 猜测能创建出更可靠的数据集。
- 公平比较很重要:当模型在不同类型的数据上进行训练时,你需要一种特殊的指标(如“随机猜测”基线)来公平地比较模型。
- 数据是瓶颈:即使有更好的标注方法,如果原始文本没有清晰地表达思维过程,也很难准确识别扭曲。
作者得出结论,虽然大语言模型可以作为一致、可靠的“标注者”来清理嘈杂的数据,但最终的挑战仍然是我们要分析的文本的质量和清晰度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。