Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring
यह शोधपत्र TELLME प्रस्तुत करता है, जो एक नवीन विधि है जो उनके अंतर्निहित चिंतन प्रक्रियाओं (latent thinking processes) में सुधार करके लार्ज लैंग्वेज मॉडल्स की अंतर्निहित पारदर्शिता और निगरानी क्षमता को बढ़ाती है, जिससे अनुपयुक्त व्यवहारों की अधिक प्रभावी पहचान संभव हो पाती है और विविध आर्किटेक्चर एवं डिटॉक्सिफिकेशन कार्यों में निरंतर प्रदर्शन लाभ प्रदर्शित होता है।