← नवीनतम पेपर
🤖 machine learning

Learning Where It Matters: Geometric Anchoring for Robust Preference Alignment

यह शोध पत्र ज्योमेट्रिक एंकर प्रिफरेंस ऑप्टिमाइज़ेशन (GAPO) का प्रस्ताव करता है, जो एक नवीन संरेखण विधि है जो डायरेक्ट प्रिफरेंस ऑप्टिमाइज़ेशन में स्थिर संदर्भ नीति (static reference policy) को एक गतिशील, ज्यामिति-जागरूक प्रतिकूल एंकर (dynamic, geometry-aware adversarial anchor) से बदल देती है ताकि प्राथमिकता युग्मों को अनुकूल रूप से पुन: भारित (reweight) किया जा सके, जिससे मानक बेंचमार्क पर मजबूत प्रदर्शन बनाए रखते हुए शोर युक्त पर्यवेक्षण और वितरण बेमेल (distributional mismatch) के विरुद्ध सुदृढ़ता बढ़ाई जा सके।

मूल लेखक: Youngjae Cho, Jongsuk Kim, Ji-Hoon Kim

प्रकाशित 2026-05-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Youngjae Cho, Jongsuk Kim, Ji-Hoon Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Learning Where It Matters: Geometric Anchoring for Robust Preference Alignment" शोध पत्र का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

बड़ी तस्वीर: AI को एक "तनाव परीक्षण" (Stress Test) के साथ सिखाना

कल्पना कीजिए कि आप एक नए कर्मचारी (एक AI मॉडल) को ईमेल लिखना सिखा रहे हैं। आप उन्हें ईमेल के जोड़े दिखाते हैं: एक "अच्छा" (पसंद किया गया) है और एक "बुरा" (पसंद न किया गया) है। लक्ष्य यह है कि AI को अच्छे वाले ईमेल की तरह लिखना सिखाया जाए।

अधिकांश वर्तमान तरीके (जैसे DPO या SimPO) एक सख्त बॉस की तरह काम करते हैं जो कहता है: "अगर तुमने सही उत्तर दिया, तो बहुत बढ़िया! अगर गलत हुआ, तो अगली बार और बेहतर कोशिश करना।" वे इस बात को मापते हैं कि AI "अच्छे" उत्तर से कितना दूर है और उसे वापस धकेलते हैं।

समस्या: कभी-कभी, AI गलती से "अच्छा" उत्तर सही दे देता है, या "बुरा" उत्तर वास्तव में केवल एक अजीब मामला (edge case) होता है। यदि AI केवल अनुमान लगा रहा है, तो एक मानक बॉस उसे गलत दिशा में बहुत अधिक धकेल सकता है, जिससे वह स्पष्ट रूप से सोचना भूल सकता है (जिसे "रीजनिंग टैक्स" कहा जाता है) या शोर वाले डेटा (noisy data) से भ्रमित हो सकता है।

समाधान (GAPO): लेखक एक नई विधि प्रस्तावित करते हैं जिसे जियोमेट्रिक एंकर प्रेफरेंस ऑप्टिमाइजेशन (GAPO) कहा जाता है। केवल यह जाँचने के बजाय कि उत्तर अभी सही है या नहीं, GAPO एक कठिन सवाल पूछता है: "यदि मैं AI को सबसे खराब दिशा में थोड़ा सा धकेलों, तो क्या उसे अभी भी सही उत्तर पता होगा?"


मुख्य उपमा: "डगमगाती मेज" का परीक्षण (The Wobbly Table Test)

कल्पना कीजिए कि AI का ज्ञान एक मेज है।

  • मानक तरीके: वे देखते हैं कि मेज अभी समतल है या नहीं। यदि यह समतल है, तो वे कहते हैं, "अच्छा काम किया!" और आगे बढ़ जाते हैं।
  • GAPO: वे देखते हैं कि मेज समतल है, लेकिन फिर वे मेज को एक हल्का, साझा धक्का (एक "निराशावादी प्रोब" या pessimistic probe) भी देते हैं ताकि यह देख सकें कि क्या वह डगमगाती है।

1. "साझा निराशावादी प्रोब" (धक्का)

एक मानक प्रशिक्षण सत्र में, AI उदाहरणों के एक बैच (मान लीजिए 10 ईमेल) को देखता है। GAPO उस औसत दिशा की गणना करता है जहाँ AI उन सभी 10 उदाहरणों में सबसे अधिक संघर्ष कर रहा है। इसके बाद, यह एक "निराशावादी एंकर" (pessimistic anchor) बनाता है—AI का एक काल्पनिक संस्करण जिसे उस विशिष्ट कमजोरी की दिशा में थोड़ा धकेला गया है।

इसे एक तनाव परीक्षण (stress test) के रूप में सोचें। AI को वास्तव में बदला नहीं जा रहा है; हम बस एक "क्या होगा अगर" परिदृश्य का अनुकरण (simulate) कर रहे हैं जहाँ AI वर्तमान में जो कर रहा है उसमें थोड़ा कमजोर हो गया है।

2. "एंकर गैप" (डगमगाहट)

अब, GAPO प्रत्येक व्यक्तिगत ईमेल उदाहरण को फिर से देखता है, लेकिन इस बार वह पूछता है: "यदि AI इस 'धकेले गए' (pushed) अवस्था में होता, तो यह विशिष्ट उदाहरण कितना बदतर दिखता?"

  • छोटा गैप (स्थिर/Stable): यदि धक्का देने के बाद भी AI जानता है कि उत्तर अच्छा है, तो यह एक स्थिर उदाहरण है। यह एक मजबूत मेज की तरह है जो धक्का देने पर नहीं डगमगाती। GAPO कहता है, "बहुत बढ़िया, इस उदाहरण पर भरोसा करें! प्रशिक्षण में इसे पूरा महत्व दें।"
  • बड़ा गैप (भंगुर/Brittle): यदि धक्का देने के बाद AI अचानक सोचने लगता है कि "बुरा" उत्तर वास्तव में अच्छा है, तो यह एक भंगुर उदाहरण है। यह एक डगमगाती मेज की तरह है जो आसानी से पलट जाती है। इससे संकेत मिलता है कि AI केवल अनुमान लगा रहा है या लेबल शायद शोर वाला (गलत) है। GAPO कहता है, "रुको, यह अस्थिर है। इस उदाहरण पर उतना भरोसा न करें। इसका भार कम कर दें।"

3. परिणाम: स्मार्ट रीवेटिंग (Smart Reweighting)

GAPO "डगमगाते" उदाहरणों को पूरी तरह से फेंकता नहीं है। यह बस उनकी आवाज़ को धीमा कर देता है।

  • स्थिर उदाहरणों को तेज़ आवाज़ (उच्च भार) मिलती है।
  • भंगुर उदाहरणों को एक फुसफुसाहट (कम भार) मिलती है।

यह AI को कठिन लेकिन विश्वसनीय उदाहरणों से सीखने में मदद करता है और उन शोर वाले, भ्रमित करने वाले उदाहरणों को अनदेखा करने में मदद करता है जो उसके तर्क (logic) को बिगाड़ सकते हैं।


यह क्यों महत्वपूर्ण है (शोध पत्र के दावे)

शोध पत्र का दावा है कि इस "तनाव परीक्षण" दृष्टिकोण से तीन मुख्य लाभ होते हैं:

  1. बेहतर निर्देश पालन (Instruction Following): AI निर्देशों का पालन करने में बेहतर हो जाता है। परीक्षणों में, GAPO ने "AlpacaEval" और "Arena-Hard" जैसे बेंचमार्क पर अन्य शीर्ष तरीकों को पछाड़ दिया।
  2. दिमाग को तेज रखना: AI प्रशिक्षण में एक आम समस्या यह है कि जैसे-जैसे यह निर्देशों का पालन करने में बेहतर होता है, यह तर्क (reasoning) करने में कमजोर हो जाता है (जैसे गणित के सवाल हल करना)। GAPO इसे ठीक करता है। यह तर्क करने की क्षमता खोए बिना निर्देश पालन में सुधार करता है।
  3. खराब डेटा के प्रति प्रतिरोधक क्षमता: वास्तविक दुनिया का डेटा अव्यवस्थित होता है। कभी-कभी लेबल गलती से बदल दिए जाते हैं (जैसे, एक बुरे ईमेल को "अच्छा" लेबल कर दिया गया)।
    • मानक तरीके इन गलतियों से भ्रमित हो जाते हैं।
    • GAPO स्वाभाविक रूप से इन्हें पहचान लेता है। क्योंकि "डगमगाते" (शोर वाले) उदाहरण तनाव परीक्षण के दौरान ढह जाते हैं, GAPO स्वचालित रूप से उन्हें कम भार देता है। शोध पत्र दिखाता है कि बिना यह बताए कि "यह डेटा शोर वाला है," यह विधि खुद ही समझ जाती है और मजबूत बनी रहती है।

GAPO क्या नहीं है (सीमाओं का स्पष्टीकरण)

  • यह कोई जादुई फिल्टर नहीं है: GAPO खराब डेटा को हटाता नहीं है। यह बस उससे कम प्रभावित होने के लिए सीखता है।
  • यह केवल "कठिन" उदाहरणों के बारे में नहीं है: कभी-कभी एक कठिन उदाहरण केवल एक बहुत ही कठिन लेकिन सही उदाहरण होता है। GAPO कठिन चीजों को अनदेखा नहीं करता है; यह उन चीजों को अनदेखा करता है जो अस्थिर या भंगुर हैं।
  • यह मुफ्त नहीं है: शोध पत्र स्वीकार करता है कि इस पद्धति को प्रति स्टेप लगभग दोगुना कंप्यूटर समय लगता है क्योंकि इसे अतिरिक्त "तनाव परीक्षण" सिमुलेशन चलाना पड़ता है। हालाँकि, वे दिखाते हैं कि इस अतिरिक्त समय के बावजूद, यह मानक प्रशिक्षण को लंबे समय तक चलाने की तुलना में तेजी से और बेहतर सीखता है।

एक वाक्य में सारांश

GAPO AI को केवल यह सिखाकर नहीं कि वह उत्तर जानता है, बल्कि उसे धीरे से धकेलकर यह देखकर सिखाता है कि क्या उसका ज्ञान ठोस है, जिससे वह डगमगाते, शोर वाले उदाहरणों को अनदेखा कर सके और वास्तव में जो महत्वपूर्ण है उस पर ध्यान केंद्रित कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →