← नवीनतम पेपर
🤖 AI

Cross-Entropy Games and Frost Training

यह शोध पत्र फ्रॉस्ट ट्रेनिंग (Frost Training) को प्रस्तुत करता है, जो एक नवीन विधि है जो एम्बेडिंग स्पेस में रिवॉर्ड फंक्शन ग्रेडिएंट्स का लाभ उठाती है—जिसका उपयोग पहले जेलब्रेकिंग के लिए किया गया था—LLM-as-a-judge कार्यों के लिए मोंटे कार्लो-आधारित पॉलिसी ऑप्टिमाइज़ेशन को त्वरित और उन्नत करने के लिए, जिसके परिणामस्वरूप उच्च-स्कोर वाले आउटपुट और तेज़ प्रशिक्षण अभिसरण (convergence) प्राप्त होता है।

मूल लेखक: Arthur Renard, Franck Gabriel, Valentin Hartmann, Clément Hongler

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arthur Renard, Franck Gabriel, Valentin Hartmann, Clément Hongler

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कहानी लिखना सिखा रहे हैं। आप उसे एक वाक्य की शुरुआत और उसका बिल्कुल अंत देते हैं, और उससे बीच का हिस्सा भरने के लिए कहते हैं। इसे "इनफिलिंग" (infilling) कार्य कहा जाता है।

आमतौर पर, रोबोट को सिखाने के लिए, आप मोंटे कार्लो (Monte Carlo) नामक विधि का उपयोग करते हैं। इसे "अनुमान लगाओ और जाँचो" के खेल की तरह समझें।

  1. रोबोट बीच के हिस्से का अनुमान लगाता है।
  2. एक सख्त शिक्षक ("जज") उसे पढ़ता है और उसे एक स्कोर देता है।
  3. यदि स्कोर अच्छा है, तो रोबोट सीखता है; यदि यह बुरा है, तो वह फिर से प्रयास करता है।
  4. रोबोट तब तक यादृच्छिक (random) अनुमान लगाता रहता है जब तक कि वह एक बेहतरीन उत्तर पाने के लिए भाग्यशाली न हो जाए।

समस्या यह है कि यह धीमा और बर्बादी भरा है। रोबोट एक भयानक वाक्य का अनुमान लगा सकता है, कम स्कोर प्राप्त कर सकता है, और फिर दूसरा भयानक वाक्य का अनुमान लगा सकता है, बिना यह समझे कि वह क्यों बुरा था या उसे ठीक करने के लिए क्या करना चाहिए, केवल स्कोर को देखकर।

नया विचार: "फ्रॉस्ट ट्रेनिंग" (Frost Training)

Xent Labs के लेखकों ने एक नया तरीका प्रस्तावित किया है जिसे "फ्रॉस्ट ट्रेनिंग" कहा जाता है। वे "फ्रॉस्ट" नाम कवि रॉबर्ट फ्रॉस्ट और उनकी कविता द रोड नॉट टेकन (The Road Not Taken) को एक श्रद्धांजलि के रूप में देते हैं। विचार यह है कि रोबोट द्वारा किए गए हर अनुमान के "पड़ोस" (neighborhood) को देखना।

केवल रोबोट के अच्छे उत्तर का अनुमान लगाने की प्रतीक्षा करने के बजाय, फ्रॉस्ट ट्रेनिंग हर अनुमान के "पड़ोस" को देखने के लिए एक गणितीय ट्रिक का उपयोग करती है।

उपमा: अंधे यात्री बनाम दिशा-सूचक यंत्र वाला गाइड

  • मानक प्रशिक्षण (GRPO): कल्पना कीजिए कि एक अंधा यात्री पहाड़ की चोटी खोजने की कोशिश कर रहा है। वह एक कदम लेता है, महसूस करता है कि क्या जमीन ऊँची है, और यदि हाँ, तो वह आगे बढ़ता है। यदि वह किसी गड्ढे में कदम रखता है, तो वह वापस जाता है। उसे केवल उस स्थान के बारे में पता होता है जहाँ वह खड़ा है।
  • फ्रॉस्ट ट्रेनिंग: उसी यात्री की कल्पना करें, लेकिन अब उसके पास एक कम्पास (दिशा-सूचक यंत्र) है जो उसके चारों ओर के हर दिशा में थोड़ा ऊपर की ओर इशारा करता है। भले ही यात्री एक घाटी में खड़ा हो, कम्पास उसे बताता है, "हे, अगर तुम बस एक कदम बाईं ओर बढ़ते, तो तुम ऊंचे होते।"

पेपर की भाषा में, यह "कम्पास" ग्रेडिएंट (gradient) है। क्योंकि "जज" (स्कोरिंग सिस्टम) एक प्रकार का AI है जो गणित (क्रॉस-एन्ट्रॉपी) का उपयोग करता है, इसमें एक छिपा हुआ, सुचारू ढांचा होता है। शोधकर्ताओं ने महसूस किया कि वे इस "कम्पास" सिग्नल की गणना कर सकते हैं यह देखने के लिए कि यदि रोबोट अपने वाक्य में केवल एक शब्द को दूसरे शब्द से बदल दे तो स्कोर कैसे बदलेगा।

यह कैसे काम करता है (द "फ्रॉस्ट-जीआरपीओ" एल्गोरिदम)

यहाँ वह चरण-दर-चरण प्रक्रिया दी गई है जिसका वे उपयोग करते हैं, जिसे सरल बनाया गया है:

  1. अनुमान (The Guess): रोबोट ("प्लेयर") कहानी के कुछ अलग-अलग मध्य भाग लिखता है।
  2. "क्या-होता-अगर" स्कैन (The "What-If" Scan): शिक्षक द्वारा रोबोट के उत्तरों को ग्रेड करने से पहले ही, फ्रॉस्ट सिस्टम उन उत्तरों के हर एक शब्द को जल्दी से स्कैन करता है। यह पूछता है: "क्या होगा अगर हम इस शब्द को उस शब्द से बदल दें?"
    • यह इन नए, "क्या-होटा-अगर" वाले संस्करणों के स्कोर का अनुमान लगाने के लिए एक त्वरित गणितीय शॉर्टकट (टेलर एक्सपेंशन) का उपयोग करता है, बिना उन्हें पूरी तरह से लिखे।
  3. बदलाव (The Swap): यदि गणित कहता है, "इस शब्द को बदलने से कहानी बहुत बेहतर हो जाएगी," तो सिस्टम उस नए संस्करण को चुन लेता है।
  4. असली परीक्षण (The Real Test): सिस्टम फिर यह सुनिश्चित करने के लिए सख्त शिक्षक से इन "क्या-होता-अगर" वाले संस्करणों को ग्रेड करने के लिए कहता है कि गणित सही था या नहीं।
  5. अपग्रेड (The Upgrade): यदि कोई "क्या-होता-अगर" वाला संस्करण रोबोट के मूल अनुमान से वास्तव में बेहतर है, तो सिस्टम रोबोट के मूल अनुमान को इस बेहतर संस्करण से बदल देता है।
  6. सीखना (Learning): रोबोट फिर इस अपग्रेड किए गए, बेहतर संस्करण से सीखता है।

यह बेहतर क्यों है (परिणाम)

पेपर ने एक विशिष्ट कार्य पर इसका परीक्षण किया: कहानियों में गायब टेक्स्ट को भरना। उन्होंने अपने नए "फ्रॉस्ट" तरीके की तुलना मानक "जीआरपीओ" (GRPO) पद्धति से की।

  • तेजी से सर्वोत्तम शिखर खोजना: एक "बेस्ट-ऑफ-के" (Best-of-K) सेटिंग में (जहाँ आप कई प्रयासों में से एक एकल सर्वश्रेष्ठ उत्तर देखते हैं), फ्रॉस्ट ट्रेनिंग ने मानक पद्धति की तुलना में बहुत तेजी से उच्च-स्कोर वाले उत्तर खोजे। यह ऐसा था जैसे कम्पास वाला यात्री आधे समय में पहाड़ की चोटी खोज लेता है।
  • रचनात्मकता बनाए रखना: मानक प्रशिक्षण अक्सर रोबोट को "कोलैप्स" (collapse) कर देता है। वह गलतियाँ करने से डर जाता है और एक ही सुरक्षित, उबाऊ वाक्यांश दोहराने लगता है। फ्रॉस्ट ट्रेनिंग ने रोबोट के उत्तरों को उच्च-गुणवत्तापूर्ण बनाने के साथ-साथ उन्हें विविध और रचनात्मक (उच्च एंट्रॉपी) बनाए रखा।
  • दक्षता (Efficiency): उन्होंने दिखाया कि फ्रॉस्ट ट्रेनिंग मानक पद्धति के समान परिणाम प्राप्त कर सकती है, लेकिन कम "फॉरवर्ड पासेज" (गणनात्मक चरणों) के साथ, या समान कंप्यूटिंग शक्ति के साथ बेहतर परिणाम दे सकती है।

निष्कर्ष

पेपर का दावा है कि क्रॉस-एन्ट्रॉपी गेम्स (जहाँ इनाम इस बात पर आधारित होता है कि एक वाक्य कितना सही होने की संभावना है) नामक विशिष्ट कार्यों के परिवार के लिए, हमें केवल अंधे अनुमानों पर निर्भर रहने की आवश्यकता नहीं है। रोबोट के अनुमानों में छोटे, स्मार्ट बदलावों का सुझाव देने के लिए छिपे हुए "ग्रेडिएंट" सिग्नल (कम्पास) का उपयोग करके, इससे पहले कि हम उन्हें ग्रेड करें, हम रोबोट को बहुत तेजी से बेहतर, अधिक रचनात्मक कहानियाँ लिखने के लिए प्रशिक्षित कर सकते हैं।

उन्होंने इसे यह दिखाकर प्रमाणित किया कि उनका तरीका, फ्रॉस्ट-जीआरपीओ (Frost-GRPO), उच्चतम-स्कोर वाले टेक्स्ट पूर्णता खोजने में मानक पद्धति की तुलना में लगातार बेहतर प्रदर्शन करता है और रोबोट की लेखन शैली को विविध और स्वाभाविक बनाए रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →