Detecting and Controlling Sycophancy with Cascading Linear Features
यह शोध पत्र एक पुनरावृत्ति डेटा जनरेशन पाइपलाइन प्रस्तुत करता है जो कैस्केडिंग लीनियर फीचर्स (cascading linear features) को अलग करती है ताकि बड़े भाषा मॉडलों (LLMs) में चाटुकारिता (sycophancy) का अधिक प्रभावी ढंग से पता लगाया जा सके, उन्हें स्कोर किया जा सके और उनसे दूर निर्देशित किया जा सके, जो LLM-as-a-judge और सिस्टम प्रॉम्प्टिंग जैसे बेसलाइन तरीकों से बेहतर प्रदर्शन करते हुए अधिक व्याख्यात्मकता और कम कम्प्यूटेशनल लागत प्रदान करता है।