Can Large Language Models Detect Contradicted Biomedical Evidence? A Dual-Annotator Benchmark Audit
本研究は、現在の大型言語モデルおよび検索拡張生成システムが、生成された生物医学的な回答と検索された根拠との間の矛盾を検出することに著しく失敗し、それらをしばしば不十分なものと誤分類していることを示しており、それによって、このような自動検証器が臨床的な自律的スクリーニングにはまだ準備ができていないことを浮き彫りにしている。