AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens
यह शोध पत्र AdvJudge-Zero प्रस्तुत करता है, जो एक ऐसी विधि है जो यह प्रदर्शित करती है कि जज के अपने वितरण (distribution) से नमूने के रूप में लिए गए छोटे, कम-परप्लेक्सिटी (low-perplexity) वाले टोकन का उपयोग करके LLM-as-a-Judge के बाइनरी फैसलों को उच्च सफलता दर के साथ बदला जा सकता है, और एक LoRA-आधारित रक्षा तंत्र का प्रस्ताव करता है जो इन प्रतिकूल हमलों (adversarial attacks) को प्रभावी ढंग से कम करता है और RLHF प्रशिक्षण में रिवॉर्ड कोलैप्स (reward collapse) को रोकता है।