← 最新论文
🤖 AI

A Positive Case for Faithfulness: LLM Self-Explanations Help Predict Model Behavior

本文引入了归一化可模拟性增益(Normalized Simulatability Gain, NSG),这一新指标表明,尽管存在一些误导性实例,但大语言模型的自我解释显著增强了在多样化任务中预测模型行为的能力,并优于来自外部模型的解释。

原作者: Harry Mayne, Justin Singh Kang, Dewi Gould, Kannan Ramchandran, Adam Mahdi, Noah Y. Siegel

发布于 2026-10-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Harry Mayne, Justin Singh Kang, Dewi Gould, Kannan Ramchandran, Adam Mahdi, Noah Y. Siegel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →