← नवीनतम पेपर
🤖 machine learning

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

एक्स्ट्रा (ExTra) एक GRPO-संगत फ्रेमवर्क है जो विविध सही समाधानों के लिए नवीनता पुरस्कारों (novelty rewards) और आसान एवं कठिन रीजनिंग कार्यों पर मानक RLVR की सीमाओं को दूर करने के लिए एंट्रॉपी-निर्देशित प्रीफिक्स पुनर्जनन (entropy-guided prefix regeneration) को जोड़कर भाषा मॉडल सुदृढीकरण शिक्षण (reinforcement learning) को बढ़ाता है, जिससे सटीकता और इन्फरेंस-टाइम कवरेज में महत्वपूर्ण सुधार होता है।

मूल लेखक: Wenyang Hu, Junxiang Jia, Zhen Shu, Daniel Dahlmeier, See-Kiong Ng, Bryan Kian Hsiang Low

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenyang Hu, Junxiang Jia, Zhen Shu, Daniel Dahlmeier, See-Kiong Ng, Bryan Kian Hsiang Low

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान छात्र (एक AI भाषा मॉडल) को कठिन गणित की समस्याएं हल करना सिखा रहे हैं। आप एक विधि का उपयोग करते हैं जिसे Reinforcement Learning कहा जाता है, जहाँ छात्र समस्या को हल करने का प्रयास करता है, यदि वह सही है तो उसे "थम्स अप" (अंगूठा ऊपर) मिलता है, और यदि वह गलत है तो "थम्स डाउन" (अंगूठा नीचे) मिलता है। लक्ष्य छात्र को इन थम्स अप और थम्स डाउन से सीखने में मदद करना है ताकि वह समय के साथ बेहतर हो सके।

यह शोध पत्र एक नई शिक्षण विधि पेश करता है जिसे ExTra (Exploratory Trajectory Optimization) कहा जाता है। यह दो विशिष्ट समस्याओं को ठीक करता है जो तब होती हैं जब छात्र प्रयासों के एक समूह से सीखने की कोशिश करता है।

वे दो समस्याएँ जिन्हें ExTra हल करता है

1. "बहुत आसान" वाली समस्या (बोरिंग क्लास)
कल्पना कीजिए कि आप छात्र को एक बहुत ही आसान गणित की समस्या देते हैं, जैसे 2+22+2

  • क्या होता है: छात्र 10 बार प्रयास करता है, और हर बार वह "4" लिखता है।
  • समस्या: चूंकि हर उत्तर एक जैसा और सही है, इसलिए शिक्षक (AI सिस्टम) भ्रमित हो जाता है। सीखने के लिए प्रयासों के बीच कोई अंतर नहीं रह जाता। छात्र सोचने के नए तरीके आज़माना बंद कर देता है और बस उसी उबाऊ पैटर्न को दोहराता रहता है। वह एक ढर्रे में "फँस" जाता है, जिससे उसकी रचनात्मक रूप से सोचने की क्षमता कम हो जाती है।
  • ExTra का समाधान: यह एक "Novelty Bonus" (नवीनता बोनस) जोड़ता है। यदि छात्र सही उत्तर (2+2=42+2=4) प्राप्त करता है लेकिन इसे पहले के मुकाबले एक अनोखे, अलग तरीके से समझाता है, तो उसे अतिरिक्त अंक मिलते हैं। यह छात्र को आसान समस्याओं को हल करने के अलग-अलग तरीकों को आज़माने के लिए प्रोत्साहित करता है, जिससे उसका मस्तिष्क सक्रिय और विविध बना रहता है।

2. "बहुत कठिन" वाली समस्या (डेड एंड/बंद रास्ता)
अब कल्पना कीजिए कि आप छात्र को एक अत्यंत कठिन समस्या देते हैं, जैसे कि एक जटिल ओलंपियाड गणित का प्रश्न।

  • क्या क्या होता है: छात्र 10 बार प्रयास करता है, और हर बार वह या तो अटक जाता है या गलत उत्तर देता है।
  • समस्या: शिक्षक देखता है कि 10 बार विफलता मिली है और उसे समझ नहीं आता कि क्या किया जाए। सीखने के लिए कोई "थम्स अप" नहीं है। आमतौर पर, सिस्टम उन सभी 10 प्रयासों को फेंक देता है और शून्य से फिर से शुरू कर देता है, जिससे छात्र द्वारा किए गए पिछले पूरे काम की बर्बादी होती है।
  • ExTra का समाधान: सब कुछ फेंक देने के बजाय, ExTra एक स्मार्ट हाइकिंग गाइड की तरह काम करता है।
    • यह छात्र के असफल प्रयासों को देखता है और पूछता है: "वे कहाँ लगभग सही थे?"
    • यह एक विशेष संकेत का उपयोग करता है जिसे Entropy (जो कि यह मापने जैसा है कि प्रत्येक चरण पर छात्र कितना "भ्रमित" या "अनिश्चित" था) कहा जाता है। यह उत्तर के उस हिस्से को ढूंढता है जहाँ छात्र सबसे कम भ्रमित था।
    • यह उस विशिष्ट "लगभग-सही" हिस्से को लेता है और कहता है: "ठीक है, इस हिस्से को बनाए रखते हुए बाकी समस्या को यहाँ से पूरा करने की कोशिश करो।"
    • यह छात्र की प्रगति को बचाता है और उसे एक मजबूत शुरुआती बिंदु से नए रास्तों को खोजने के लिए निर्देशित करता है, न कि शून्य से शुरू होने के लिए।

यह मिलकर कैसे काम करता है

सोचिए कि ExTra एक कोच की तरह है जो दो चीजें एक साथ करता है:

  1. आसान कार्यों के लिए: वे छात्र से कहते हैं, "बहुत अच्छा! लेकिन अगली बार इसे बिल्कुल नए तरीके से समझाने की कोशिश करें ताकि हम और सीख सकें।" (यह Novelty Reward है)।
  2. कठिन कार्यों के लिए: वे कहते हैं, "आप यहाँ अटक गए थे, लेकिन आप इस वाक्य तक बहुत अच्छा कर रहे थे। आइए इस वाक्य को रखें और वहीं से पहेली को पूरा करने की कोशिश करें।" (यह Entropy-Guided Regeneration है)।

परिणाम

शोधकर्ताओं ने इसका परीक्षण छह अलग-अलग गणितीय बेंचमार्क (जैसे AIME और MATH) पर किया। उन्होंने ExTra की तुलना मानक विधि (जिसे GRPO कहा जाता है) से की।

  • बेहतर सटीकता (Better Accuracy): AI ने पहली बार में ही अधिक सही उत्तर दिए।
  • बेहतर कवरेज (Better Coverage): यदि आप AI को समस्या हल करने के लिए 16 बार प्रयास करने देते हैं, तो ExTra के पास उन 16 प्रयासों में से कम से कम एक सही उत्तर खोजने की बहुत अधिक संभावना होती है। इसका मतलब है कि AI केवल सोचने के एक विशिष्ट तरीके में बेहतर नहीं हुआ; इसने समस्याओं को हल करने के कई विविध तरीके सीखे।
  • दक्षता (Efficiency): इसने अतिरिक्त कंप्यूटर समय खर्च किए बिना या हर चरण के लिए मानव ग्रेडिंग की आवश्यकता के बिना ये परिणाम प्राप्त किए। इसने यह पता लगा लिया कि क्या काम कर रहा है, सिर्फ AI की अपनी सोचने की प्रक्रिया को देखकर।

संक्षेप में, ExTra AI को सिखाता है कि जब चीजें आसान हों तो विविध (diverse) कैसे बनें और जब चीजें कठिन हों तो लचीला (resilient) कैसे बनें, जिससे यह सुनिश्चित होता है कि वह दोहराव के चक्र में या चुनौती का सामना करते समय हार मान लेने में न फँसे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →