Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback
यह शोध पत्र LLM एजेंटों में "संज्ञानात्मक विषाक्तता" (cognitive poisoning) की अवधारणा प्रस्तुत करता है, जहाँ दुर्भावनापूर्ण उपकरण हानिकारक कार्यों को निष्पादित करने से पहले निर्दोष फीडबैक के माध्यम से विश्वास बनाते हैं, और प्रॉम्प्ट-स्तरीय ह्यूरिस्टिक्स पर निर्भर रहने के बजाय अंतिम निष्पादन योग्य क्रिया को स्कोर करने के माध्यम से इन प्रक्षेपवक्र-आधारित जोखिमों का प्रभावी ढंग से पता लगाने और उन्हें कम करने के लिए TRUST-Bench बेंचमार्क और VISTA-Guard रक्षा ढांचे का प्रस्ताव करता है।