← नवीनतम पेपर
🤖 machine learning

HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs

यह शोध पत्र HiPO (Hierarchical Preference Optimization) का प्रस्ताव करता है, जो डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (DPO) का एक नवीन विस्तार है, जो प्रतिक्रियाओं को तर्क संबंधी खंडों (reasoning segments) में विभाजित करता है ताकि सूक्ष्म, खंड-विशिष्ट प्रशिक्षण सक्षम किया जा सके, जिससे मानक DPO की तुलना में जटिल तर्क कार्यों पर बड़े भाषा मॉडलों के तार्किक प्रवाह, निरंतरता और प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Darsh Kachroo, Adriana Caraeni, Arjun Prasaath Anbazhagan, Brennan Lagasse, Kevin Zhu

प्रकाशित 2026-04-23
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Darsh Kachroo, Adriana Caraeni, Arjun Prasaath Anbazhagan, Brennan Lagasse, Kevin Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े अराजक छात्र (एक AI) को जटिल गणित की समस्याएं हल करना सिखा रहे हैं।

समस्या: "सब-कुछ-या-कुछ-नहीं" वाला दृष्टिकोण (The "All-or-Nothing" Approach)

वर्तमान में, अधिकांश AI प्रशिक्षण विधियाँ (जैसे DPO) एक सख्त शिक्षक की तरह काम करती हैं जो केवल अंतिम परीक्षा के पेपर को देखती हैं।

  • परिदृश्य: छात्र एक लंबा, बिखरा हुआ निबंध लिखता है। वह प्रश्न को गलत समझने से शुरुआत करता है, फिर बीच में अपने तर्क (logic) में खो जाता है, लेकिन किसी तरह वह सही अंतिम उत्तर तक पहुँच जाता है।
  • पुराना तरीका: शिक्षक कहता है, "बहुत बढ़िया! तुम्हें सही उत्तर मिल गया!" और उसे एक गोल्ड स्टार देता है।
  • दोष: छात्र यह नहीं सीख पाता कि समस्या को कैसे हल किया जाए। अगली बार, वह प्रश्न को फिर से गलत समझ सकता है या भ्रमित करने वाला स्पष्टीकरण लिख सकता है, लेकिन क्योंकि वह भाग्य से सही अंतिम उत्तर तक पहुँच गया था, वह सोचता है कि वह सब कुछ सही कर रहा है। वह प्रक्रिया के बीच में अपनी बुरी आदतों को सुधारना कभी नहीं सीख पाता।

समाधान: HiPO (द "सेगमेंटेड कोच")

HiPO को एक ऐसे शिक्षक के रूप में न देखें जो केवल अंतिम पेपर को ग्रेड देता है, बल्कि एक विशेषज्ञ कोच के रूप में देखें जो छात्र के काम को तीन अलग-अलग हिस्सों में तोड़ता है और प्रत्येक पर अलग से फीडबैक देता है।

HiPO हर उत्तर को तीन "सेगमेंट" में विभाजित करता है:

  1. स्पष्टीकरण (Rq): "क्या आपने वास्तव में समझा कि प्रश्न क्या पूछ रहा है?"
  2. सोचने की प्रक्रिया (Mt): "क्या आपका चरण-दर-चरण तर्क सही है? क्या आपने अच्छी योजना बनाई?"
  3. अंतिम उत्तर (A): "क्या संख्या या परिणाम सही है?"

यह कैसे काम करता है: "वेटेड स्कोर" का उदाहरण

कल्पना कीजिए कि आप एक ट्रिएथलीट (AI) को प्रशिक्षित कर रहे हैं।

  • पुराना तरीका (DPO): आपको केवल इस बात की परवाह है कि वे दौड़ पूरी करें। यदि वे तैराकी खराब करते हैं, साइकिलिंग धीमी करते हैं, लेकिन दौड़ तेज भागकर जीत जाते हैं, तो आप कहते हैं, "अच्छा काम किया!"
  • HiPO तरीका: आप उन्हें तीन अलग-अलग कॉलम वाला एक स्कोरकार्ड देते हैं: तैराकी, साइकिलिंग और दौड़ना।
    • यदि AI प्रश्न समझने में बुरा है (तैराकी), तो आप कंप्यूटर को बता सकते हैं: "हमारी प्रशिक्षण ऊर्जा का 60% तैराकी को ठीक करने पर केंद्रित करें, और केवल 10% दौड़ने पर।"
    • यदि AI उत्तर देने में अच्छा है लेकिन तर्क (logic) में खराब है (साइकिलिंग), तो आप कह सकते हैं: "दौड़ने के स्कोर को अभी छोड़ दें; आइए साइकिलिंग तकनीक को ठीक करें।"

यह AI को विशिष्ट क्षेत्रों में विशेषज्ञ बनने की अनुमति देता है। यह जटिल प्रश्नों को बेहतर ढंग से समझने के लिए सीख सकता है, या अधिक तार्किक रूप से सोचने के लिए सीख सकता है, बिना एक साथ सब कुछ ठीक करने की कोशिश में भ्रमित हुए।

परिणाम: क्या हुआ?

शोधकर्ताओं ने गणित की समस्याओं का उपयोग करके दो अलग-अलग "छात्रों" (AI मॉडल: Qwen और Llama) पर इसका परीक्षण किया।

  • "सोचने वाला" छात्र (Llama): यह मॉडल अंतिम उत्तर देने में अच्छा था लेकिन तर्क (logic) में खो जाता था। जब HiPO ने इसे विशेष रूप से सोचने की प्रक्रिया (Meta-thinking) पर ध्यान केंद्रित करने के लिए कहा, तो यह कठिन प्रतियोगिता गणित की समस्याओं को हल करने में बहुत बेहतर हो गया।
  • "स्पष्टीकरण वाला" छात्र (Qwen): यह मॉडल तर्क में अच्छा था लेकिन अक्सर प्रश्न को गलत समझ लेता था। जब HiPO ने इसे प्रश्न को स्पष्ट करने (Clarifying the Query) पर ध्यान केंद्रित करने के लिए कहा, तो इसके स्कोर में काफी सुधार हुआ।

यह क्यों महत्वपूर्ण है

वास्तविक दुनिया में, हमें केवल वह AI नहीं चाहिए जो सही उत्तर दे; हमें वह चाहिए जो स्पष्ट रूप से सोचे।

  • पारदर्शिता (Transparency): यदि कोई AI गलती करता है, तो HiPO हमें यह देखने में मदद करता है कि वह कहाँ विफल हुआ (क्या उसने प्रॉम्प्ट को गलत समझा? क्या उसने कोई चरण छोड़ दिया?)।
  • दक्षता (Efficiency): यह उन पिछली विधियों की तुलना में सस्ता और तेज़ है जिनके लिए जटिल, बहु-चरणीय प्रशिक्षण की आवश्यकता होती थी।
  • अनुकूलन क्षमता (Adaptability): जैसे एक मानव कोच एथलीट की कमजोरियों के आधार पर प्रशिक्षण योजना को समायोजित कर सकता है, वैसे ही HiPO डेवलपर्स को AI को विशिष्ट प्रकार की तर्क क्षमता के लिए बेहतर बनाने के लिए ट्यून करने की अनुमति देता है।

संक्षेप में: HiPO AI के मस्तिष्क को एक "ब्लैक बॉक्स" के रूप में मानना बंद कर देता है जो केवल अंतिम परिणाम की परवाह करता है। इसके बजाय, यह बॉक्स को खोलता है, उसके गियर (तर्क के चरणों) को देखता है, और उन विशिष्ट पेंचों को कसता है जो ढीले हैं, जिसके परिणामस्वरूप एक स्मार्ट, अधिक विश्वसनीय और अधिक तार्किक मशीन प्राप्त होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →