← नवीनतम पेपर
💬 NLP

Judge Circuits

यह शोध पत्र 'पोज़िशन-अवेयर एज एट्रिब्यूशन पैचिंग' (Position-aware Edge Attribution Patching) का उपयोग यह प्रकट करने के लिए करता है कि LLMs के पास निर्णयों के लिए एक साझा, विरल "लेटेंट इवैल्यूएटर" (Latent Evaluator) सब-ग्राफ़ होता है जो प्रारूप-विशिष्ट आउटपुट शाखाओं से संरचनात्मक रूप से अलग (decoupled) है, जो यह स्पष्ट करता है कि बेंचमार्क विश्वसनीयता अक्सर वास्तविक मूल्यांकन गुणवत्ता के बजाय फॉर्मेटर ज्योमेट्री (formatter geometry) को क्यों मापती है।

मूल लेखक: Nils Feldhus, Tanja Baeumel, Elena Golimblevskaia, Qianli Wang, Van Bach Nguyen, Aaron Louis Eidt, Christopher Ebert, Wojciech Samek, Jing Yang, Vera Schmitt, Sebastian Möller, Simon Ostermann

प्रकाशित 2026-05-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nils Feldhus, Tanja Baeumel, Elena Golimblevskaia, Qianli Wang, Van Bach Nguyen, Aaron Louis Eidt, Christopher Ebert, Wojciech Samek, Jing Yang, Vera Schmitt, Sebastian Möller, Simon Ostermann

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "जज सर्किट्स" (Judge Circuits) पेपर का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

बड़ी समस्या: "चंचल जज" (The Fickle Judge)

कल्पना कीजिए कि आपने एक बहुत ही बुद्धिमान AI को जज के रूप में काम पर रखा है। आप उससे किसी कहानी को 1 से 5 स्टार के पैमाने पर रेटिंग देने के लिए कहते हैं। वह कहानी को 5 देता है।
फिर, आप उसी AI से बिल्कुल वही सवाल पूछते हैं, लेकिन आप फॉर्मेट को थोड़ा सा बदल देते हैं: नंबर मांगने के बजाय, आप उससे पूछते हैं कि क्या कहानी अच्छी है या नहीं (हाँ या ना में)। अचानक, वह कहता है "नहीं।"

यही वह समस्या है जिसकी यह पेपर जांच करता है। लार्ज लैंग्वेज मॉडल्स (LLMs) को एक सुसंगत (consistent) जज होना चाहिए, लेकिन वे अक्सर केवल इसलिए अलग उत्तर देते हैं क्योंकि सवाल का फॉर्मेट बदल गया (जैसे, नंबर बनाम शब्द)। यह उन्हें चीजों को ऑटोमैटिक तरीके से ग्रेड करने के लिए अविश्वसनीय बनाता है।

जांच: मस्तिष्क के अंदर देखना

शोधकर्ताओं ने केवल सवालों और जवाबों को नहीं देखा; उन्होंने AI के "मस्तिष्क" (इसके आंतरिक कंप्यूटर कोड) के अंदर झाँका ताकि यह देखा जा सके कि भ्रम कहाँ होता है। उन्होंने PEAP नामक एक विशेष उपकरण का उपयोग किया (इसे एक हाई-टेक एक्स-रे की तरह समझें) जो AI द्वारा निर्णय लेने की प्रक्रिया के दौरान सूचना के मार्ग का पता लगाता है।

उन्होंने पाया कि AI का मस्तिष्क वास्तव में एक दो-भागों वाले कारखाने की तरह बना हुआ है:

1. "कोर जज" (द लेटेंट इवैल्यूएटर - The Latent Evaluator)

AI की मध्य परतों (middle layers) के गहराई में, न्यूरॉन्स की एक छोटी, विशिष्ट टीम होती है। आइए उन्हें कोर जज (Core Judges) कहें।

  • वे क्या करते हैं: वे कहानी को पढ़ते हैं, उसके बारे में सोचते हैं, और एक ठोस, आंतरिक राय बनाते हैं। वे तय करते हैं, "यह एक अच्छी कहानी है।"
  • मुख्य खोज: यह टीम तब भी वही रहती है जब आप स्टार रेटिंग, हाँ/ना उत्तर, या सत्य/असत्य का फैसला मांगते हैं। वे मशीन के भीतर "सत्य बोलने वाले" हैं। यदि आप उन्हें बंद कर देते हैं, तो AI निर्णय लेना पूरी तरह से भूल जाता है, लेकिन उसे तथ्य (जैसे राष्ट्रपति कौन हैं) याद रहते हैं।

2. "अनुवादक" (द टास्क फॉर्मेटर्स - The Task Formatters)

एक बार जब कोर जज यह तय कर लेता है कि कहानी अच्छी है, तो वे अपनी राय को कारखाने की लाइन के बिल्कुल अंत में स्थित एक अलग टीम को सौंप देते हैं। आइए इन अनुवादकों को अनुवादक (Translators) कहें।

  • वे क्या करते हैं: उनका एकमात्र काम उस आंतरिक राय ("अच्छी कहानी") को लेना और उसे आपके द्वारा मांगे गए विशिष्ट फॉर्मेट में बदलना है।
    • यदि आपने सितारों के लिए पूछा, तो वे "5" लिखते हैं।
    • यदि आपने हाँ/ना के लिए पूछा, तो वे "हाँ" लिखते हैं।
  • समस्या: शोधकर्ताओं ने पाया कि ये अनुवादक नाजुक और असंगत हैं। कभी-कभी, "हाँ/ना" वाला अनुवादक फॉर्मेट से भ्रमित हो जाता है और गलती से "नहीं" लिख देता है, भले ही कोर जज ने कहा हो कि कहानी अच्छी है।

प्रयोग: विभाजन को सिद्ध करना

इसे सिद्ध करने के लिए, शोधकर्ताओं ने फॉर्मेट ट्रांसफर इंजेक्शन (Format Transfer Injection) नामक एक चतुर प्रयोग किया।

कल्पना कीजिए कि कोर जज अपना काम पूरा कर चुका है और उसके पास एक चमकता हुआ "अच्छी कहानी" का सिग्नल है। शोधकर्ताओं ने उस सटीक सिग्नल को लिया और उसे एक अलग कार्य (जो आमतौर पर "बुरी कहानी" कहता है) के "अनुवादकों" में जबरन डाल दिया।

  • परिणाम: अधिकांश मामलों में, "बुरी कहानी" वाला अनुवादक अचानक अपना मन बदल लेता है और "अच्छी कहानी" (या "हाँ") कहने लगता है।
  • अर्थ: इससे सिद्ध हुआ कि कोर जज शुरू से ही सही काम कर रहा था। गलती सोचने में नहीं थी; यह अंत में होने वाले अनुवाद (translation) में थी। "अनुवादक" ही वह कमजोर कड़ी हैं जो AI को असंगत बनाते हैं।

कुछ AI मॉडल दूसरों से बेहतर क्यों हैं

पेपर में यह भी पाया गया कि यह "दो-भागों वाला कारखाना" विशिष्ट मॉडल आर्किटेक्चर पर निर्भर करता है, न कि केवल इस पर कि मॉडल कितना बड़ा है।

  • मॉड्यूलर मॉडल (जैसे Qwen): इन मॉडल्स में एक बहुत ही साफ अलगाव होता है। कोर जज और अनुवादक अलग-अलग कमरों में होते हैं। यदि आप अनुवादकों को तोड़ देते हैं, तो भी कोर जज पूरी तरह से काम करते रहते हैं।
  • एंटैंगल्ड मॉडल (जैसे Gemma-3-12B): इन मॉडल्स में, कोर जज और अनुवादक एक उलझे हुए ढेर की तरह आपस में गुंथे हुए होते हैं। यदि आप अनुवादकों को ठीक करने की कोशिश करते हैं, तो आप अनजाने में कोर जज को भी खराब कर देते हैं। यह उन्हें ठीक करना कठिन बनाता है।

मुख्य निष्कर्ष (The Takeaway)

पेपर निष्कर्ष निकालता है कि जब एक AI जज असंगत उत्तर देता है, तो यह आमतौर पर इसलिए नहीं होता क्योंकि AI सोचने या मूल्यांकन करने में बुरा है। बल्कि इसलिए होता है क्योंकि आउटपुट फॉर्मेटिंग (जवाब लिखने का तरीका) में गड़बड़ी हो रही है।

उपमा सारांश (The Analogy Summary):
AI को एक शानदार शेफ (कोर जज) के रूप में समझें जो जानता है कि भोजन कितना स्वादिष्ट है।

  • यदि आप शेफ को समीक्षा लिखने के लिए कहते हैं, तो वे "5 स्टार" लिखते हैं।
  • यदि आप उन्हें सिर हिलाने के लिए कहते हैं, तो वे "हाँ" में सिर हिलाते हैं।
  • लेकिन कभी-कभी, वेटर (अनुवादक) जो शेफ का ऑर्डर ग्राहक तक ले जाता है, भ्रमित हो जाता है। वेटर "5 स्टार" सुन सकता है लेकिन गलती से ग्राहक को बता सकता है कि "खाना बहुत बुरा है" क्योंकि वेटर भाषाओं के बीच स्विच करने में बुरा है।

समस्या शेफ के स्वाद की नहीं है; समस्या वेटर के अनुवाद की है। AI जजों को ठीक करने के लिए, हमें शेफ को फिर से प्रशिक्षित करने की आवश्यकता नहीं है; हमें बस वेटर को ठीक करने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →