PoisonForge: Task-Level Targeted Poisoning Benchmark for Instruction-Tuned LLMs
यह शोध पत्र PoisonForge प्रस्तुत करता है, जो एक ऐसा बेंचमार्क है जो यह प्रदर्शित करता है कि केवल 1% निर्मित उदाहरणों के साथ कार्य-स्तरीय डेटा पॉइजनिंग (data poisoning), इंस्ट्रक्शन-ट्यून्ड LLMs को लक्षित कार्य आउटपुट्स में हमलावर द्वारा निर्दिष्ट संस्थाओं (entities) को शामिल करने के लिए सफलतापूर्वक मजबूर कर सकती है और साथ ही अन्य स्थानों पर सामान्य प्रदर्शन भी बनाए रख सकती है, जो यह प्रकट करता है कि हमले की सफलता के प्राथमिक चालक मॉडल का पैमाना नहीं बल्कि पॉइजनिंग के डिज़ाइन विकल्प हैं।