← नवीनतम पेपर
💬 NLP

SteerEval: Inference-time Interventions Strengthen Multilingual Generalization in Neural Summarization Metrics

यह शोध पत्र यह प्रदर्शित करता है कि बहुभाषी न्यूरल सारांशीकरण मेट्रिक्स को एक अंग्रेजी आंतरिक पिवट (English internal pivot) की ओर निर्देशित करने के लिए इन्फरेंस-टाइम हस्तक्षेप (inference-time interventions) लागू करने से विविध भाषाओं में मानवीय निर्णयों के साथ उनका सहसंबंध महत्वपूर्ण रूप से सुधर जाता है।

मूल लेखक: Silvia Casola, Ryan Soh-Eun Shim, Felicia Körner, Yuchen Mao, Barbara Plank

प्रकाशित 2026-01-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Silvia Casola, Ryan Soh-Eun Shim, Felicia Körner, Yuchen Mao, Barbara Plank

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "STEEREVAL: Inference-time Interventions" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ स्पष्टीकरण दिया गया है।

बड़ी समस्या: "अनुवाद में खो जाना" (Lost in Translation) मूल्यांकन

कल्पना कीजिए कि आपके पास विशेषज्ञ जजों (AI मॉडल्स) की एक टीम है जिनका काम छात्रों के निबंधों को ग्रेड देना है। ये जज बहुभाषी हैं; वे अंग्रेजी, स्पेनिश, जापानी, योरूबा और कई अन्य भाषाओं में पढ़ और लिख सकते हैं।

हालाँकि, शोधकर्ताओं ने एक अजीब गड़बड़ी का पता लगाया: ये जज गुप्त रूप से अंग्रेजी में सोचते हैं।

भले ही वे एक जापानी निबंध पढ़ रहे हों, उनका आंतरिक मस्तिष्क इसे पहले अंग्रेजी में अनुवाद करने की कोशिश करता है ताकि वे इसे समझ सकें। यदि निबंध ऐसी भाषा में लिखा गया है जो अंग्रेजी के साथ आंतरिक तर्क (logic) में अच्छी तरह से "मैच" नहीं करती, तो जज भ्रमित हो जाता है। वे एक बेहतरीन निबंध को कम स्कोर दे सकते हैं क्योंकि आंतरिक अनुवाद थोड़ा अजीब या कठिन महसूस हुआ। यह इस बात पर संदेह पैदा करता है कि ये AI जज अंग्रेजी के अलावा अन्य भाषाओं में वास्तव में कितने सक्षम हैं।

समाधान: मस्तिष्क को "स्टीयर" करना (Steering the Brain)

लेखकों ने इस समस्या को ठीक करने के लिए एक चतुर तरीका निकाला जिसे Steering कहा गया। वे पूरे AI को फिर से प्रशिक्षित (retrain) नहीं करना चाहते थे (जो जज को चार साल के लिए वापस स्कूल भेजने जैसा होता)। इसके बजाय, वे वे काम करते समय ही जज के मस्तिष्क में थोड़ा बदलाव करना चाहते थे।

AI के आंतरिक विचारों को एक सड़क पर चलती कार की तरह समझें।

  • समस्या: कार सड़क से भटक रही है क्योंकि इंजन (AI) सब कुछ अंग्रेजी में अनुवाद करने की कोशिश कर रहा है, जिससे किसी विदेशी भाषा के आने पर कार डगमगा जाती है।
  • समाधान: शोधकर्ताओं ने एक छोटा सा "स्टीयरिंग व्हील" हस्तक्षेप जोड़ा। उन्होंने एक विशिष्ट दिशा वेक्टर (एक गणितीय तीर) की गणना की जो विदेशी भाषा और अंग्रेजी के बीच के अंतर को दर्शाता है।
  • क्रिया: ठीक उसी क्षण जब AI किसी वाक्य के बारे में सोच रहा होता है, वे कार के पहियों को धीरे से "अंग्रेजी केंद्र" (English center) की ओर वापस धकेल देते हैं। यह बिना कार के इंजन को बदले, तुरंत किया जाता है।

उन्होंने इसे करने के दो तरीके आजमाए:

  1. वेक्टर स्टीयरिंग (Vector Steering): एक विशिष्ट दिशा में एक विशिष्ट मात्रा में बल लगाने जैसा।
  2. मैप स्टीयरिंग (Map Steering): विदेशी भाषा के विचारों को सीधे एक अंग्रेजी मानचित्र (English map) पर प्रोजेक्ट करने जैसा।

उन्हें क्या पता चला

शोधकर्ताओं ने इसका परीक्षण सारांश मूल्यांकन (Summarization Evaluation) कार्य पर किया (यह ग्रेड देना कि एक सारांश कितना अच्छा है)। उन्होंने 8 अलग-अलग भाषाओं का परीक्षण किया, जिनमें स्पेनिश जैसी व्यापक रूप से बोली जाने वाली भाषाओं से लेकर योरूबा जैसी छोटी भाषाएं शामिल थीं।

जब उन्होंने AI को "स्टीयर" किया, तो यह हुआ:

  • "नशे में धुत्त" जज होश में आ गए: उन भाषाओं के लिए जहाँ AI पहले बहुत खराब प्रदर्शन कर रहा था (ऐसे स्कोर देना जो मानव विशेषज्ञों से मेल नहीं खाते थे), स्टीयरिंग ने एक बड़ा अंतर पैदा किया। यह एक भ्रमित जज को साफ चश्मा देने जैसा था। कुछ मामलों में, मानव निर्णय के साथ मेल खाने की AI की क्षमता दोगुनी या तिगुनी हो गई।
  • यह हर जगह काम आया: इससे कोई फर्क नहीं पड़ा कि उन्होंने एक छोटा AI इस्तेमाल किया या बड़ा; स्टीयरिंग ने मदद की। यह विभिन्न प्रकार के AI आर्किटेक्चर पर भी काम कर गया।
  • "इंग्लिश पिवट" सिद्धांत की पुष्टि हुई: तथ्य यह कि AI को अंग्रेजी की ओर धकेलने से अन्य भाषाओं में इसके प्रदर्शन में सुधार हुआ, ने उनके सिद्धांत को सिद्ध कर दिया: AI वास्तव में अंग्रेजी को एक केंद्रीय "हब" या पिवट पॉइंट के रूप में उपयोग करता है। उस हब के साथ विदेशी भाषा के विचारों को संरेखित करके, AI कार्य को बेहतर ढंग से समझ पाया।

एक सरल उपमा: यूनिवर्सल ट्रांसलेटर हेडसेट

कल्पना कीजिए कि AI ने एक हेडसेट पहना हुआ है जो उसके द्वारा सुनी जाने वाली हर चीज़ को प्रोसेस करने से पहले स्वचालित रूप से अंग्रेजी में अनुवाद करता है।

  • स्टीयरिंग के बिना: जब कोई योरूबा बोलता है, तो हेडसेट उसका अनुवाद करता है, लेकिन अनुवाद थोड़ा "गलत" होता है। AI परेशान हो जाता है और खराब ग्रेड देता है।
  • स्टीयरिंग के साथ: शोधकर्ता वास्तविक समय (real-time) में हेडसेट की सेटिंग्स को ट्यून करते हैं। वे हेडसेट को बताते हैं, "हे, जब आप योरूबा सुनें, तो सुनिश्चित करें कि अंग्रेजी अनुवाद बिल्कुल वैसा ही लगे जैसा एक मूल अंग्रेजी वक्ता कहेगा।" अचानक, AI बारीकियों को पूरी तरह समझ जाता है और निष्पक्ष ग्रेड देता है।

मुख्य निष्कर्ष

यह पेपर दिखाता है कि विभिन्न भाषाओं को समझने में बेहतर बनाने के लिए आपको AI मॉडल को फिर से बनाने की आवश्यकता नहीं है। आपको बस उनके आंतरिक सोचने की प्रक्रिया को धीरे से उस भाषा की ओर धकेलने की आवश्यकता है जिसमें वे सबसे सहज हैं (अंग्रेजी), जबकि वे काम कर रहे होते हैं। यह सरल "धक्का" (nudge) उन्हें सभी प्रकार की भाषाओं के लिए बहुत सटीक जज बनाता है, विशेष रूप से उन भाषाओं के लिए जिन्हें संभालना AI के लिए आमतौर पर कठिन होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →