The Confident Liar: Diagnosing Multi-Agent Debate with Log-Probabilities and LLM-as-Judge
यह शोध पत्र मल्टी-एजेंट डिबेट सिस्टम में आंतरिक आत्मविश्वास संकेतों (लॉग-प्रोबेबिलिटीज), बाहरी एलएलएम-एज़-जज (LLM-as-judge) मूल्यांकनों और अंतिम कार्य सटीकता के बीच संबंध की जांच करता है, जिससे यह पता चलता है कि आत्मविश्वास मेट्रिक्स "ऑडिटर" (Auditor) एजेंट की तुलना में "कंस्ट्रक्टर" (Constructor) एजेंट के लिए तर्क की गुणवत्ता और विफलता का पता लगाने के साथ काफी अधिक मजबूती से संरेखित होते हैं।