← नवीनतम पेपर
💬 NLP

POLARIS: Guiding Small Models to Write Long Stories

यह शोधपत्र POLARIS को प्रस्तुत करता है, जो एक कम-कंप्यूट (low-compute) GRPO प्रशिक्षण रेसिपी है जो LLM-as-a-judge रिवार्ड्स को मानव-संदर्भ इंजेक्शन (human-reference injection) के साथ जोड़ता है ताकि Qwen3.5-9B जैसे छोटे मॉडलों को उच्च-गुणवत्ता वाली, लंबी कहानियाँ उत्पन्न करने में सक्षम बनाया जा सके जो बड़े मॉडलों के बराबर हों और साथ ही मजबूत लंबाई पालन (length adherence) और सामान्यीकरण (generalization) बनाए रखें।

मूल लेखक: Rishanth Rajendhran, Jenna Russell, Mohit Iyyer, John Frederick Wieting

प्रकाशित 2026-06-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rishanth Rajendhran, Jenna Russell, Mohit Iyyer, John Frederick Wieting

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ POLARIS पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रचनात्मक उपमाओं (analogies) में विभाजित किया गया है।

बड़ी समस्या: छोटे लेखक थक जाते हैं

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान लेकिन छोटा रोबोट लेखक (एक "छोटा मॉडल") है। यदि आप इसे एक छोटी कहानी लिखने के लिए कहते हैं, तो यह बहुत अच्छा करता है। लेकिन यदि आप इसे एक लंबा उपन्यास लिखने के लिए कहते हैं, तो दो बुरी चीजें होती हैं:

  1. यह हार मान लेता है: यह कहानी पूरी होने से बहुत पहले ही लिखना बंद कर देता है।
  2. यह अपना मानसिक संतुलन खो देता है: जैसे-जैसे कहानी लंबी होती जाती है, यह अस्त-व्यस्त, दोहराव वाली या उबाऊ होती जाती है।

बड़े, महंगे सुपर-कंप्यूटर (जैसे "फ्रंटियर मॉडल्स") लंबी कहानियाँ अच्छी तरह लिख सकते हैं, लेकिन वे अधिकांश लोगों के उपयोग के लिए बहुत महंगे हैं। इस पेपर के लेखकों ने पूछा: "क्या हम एक छोटे, सस्ते रोबोट को बिना किसी सुपरकंप्यूटर की आवश्यकता के लंबी, उच्च-गुणवत्ता वाली कहानियाँ लिखना सिखा सकते हैं?"

समाधान: POLARIS

उन्होंने एक प्रशिक्षण रेसिपी बनाई जिसे POLARIS कहा जाता है। इसे रोबोट के लिए एक विशेष कोचिंग पद्धति समझें। केवल रोबोट को अकेले अभ्यास करने देने के बजाय, उन्होंने इसके प्रशिक्षण शिविर (training camp) में दो गुप्त सामग्रियां जोड़ीं।

सामग्री 1: "सख्त संपादक" (The LLM Judge)

आमतौर पर, जब AI को प्रशिक्षित किया जाता है, तो आप एक साधारण "स्कोरकार्ड" का उपयोग करते हैं जो केवल "अच्छा" या "बुरा" कहता है। यह एक शिक्षक की तरह है जो छात्र को बिना यह बताए कि क्यों केवल "C" ग्रेड देता है।

POLARIS एक फ्रंटियर LLM जज (एक बहुत ही उन्नत AI) का उपयोग करता है जो एक सख्त संपादक के रूप में कार्य करता है।

  • यह कैसे काम करता है: केवल एक स्कोर देने के बजाय, यह संपादक कहानी को पढ़ता है और एक विस्तृत रूब्रिक (एक चेकलिस्ट) भरता है।
  • चेकलिस्ट: यह 16 अलग-अलग चीजों को देखता है, जैसे "क्या पात्र की आवाज़ स्पष्ट थी?" (अच्छा) या "क्या कहानी दोहराव वाली हो गई?" (बुरा)।
  • उपमा: एक लेखन कार्यशाला की कल्पना करें जहाँ एक प्रसिद्ध लेखक आपकी कहानी पढ़ता है और आपको विशिष्ट नोट्स देता है: "आपका संवाद बहुत सख्त है," या "अंत जल्दबाजी में किया गया लगता है।" रोबोट इन विशिष्ट नोट्स से सीखता है, न कि केवल एक सामान्य ग्रेड से।

सामग्री 2: "मानवीय लंगर" (Human-Reference Injection)

यह सबसे अनूठा हिस्सा है। एक विशिष्ट प्रशिक्षण समूह में, रोबोट 5 अलग-अलग कहानियाँ बनाता है, और कंप्यूटर सीखने के लिए उनमें से सबसे अच्छी को चुनता है। लेकिन कभी-कभी, सभी 5 कहानियाँ औसत दर्जे की होती हैं, और रोबोट "ठीक-ठाक" लेकिन "शानदार" कहानियाँ लिखने के चक्र में फंस जाता है।

POLARIS हर समूह में एक मानवीय लंगर (Human Anchor) जोड़ता है।

  • यह कैसे काम करता है: प्रत्येक प्रॉम्प्ट के लिए, सिस्टम रोबोट को मजबूर करता है कि वह अपने स्वयं के प्रयासों के साथ एक वास्तविक मानव-लिखित कहानी को देखे।
  • उपमा: कल्पना कीजिए कि छात्रों का एक समूह गणित की समस्या हल करने की कोशिश कर रहा है। आमतौर पर, वे केवल एक-दूसरे के उत्तरों की तुलना करते हैं। लेकिन इस कक्षा में, शिक्षक बोर्ड पर एक पूरी तरह से हल किया गया उदाहरण रखता है। छात्र केवल अनुमान नहीं लगा रहे हैं; उनके पास एक "ध्रुव तारे" (North Star) जैसा लक्ष्य है जिसकी ओर उन्हें बढ़ना है। भले ही रोबोट मानव कहानी की नकल न करे, लेकिन उस उच्च-गुणवत्ता वाले उदाहरण को देखना रोबोट की "महत्वाकांक्षा" को ऊँचा बनाए रखता है और उसे कम-गुणवत्ता वाला लेखन स्वीकार करने से रोकता है।

परिणाम: वह "छोटा" मॉडल जो बड़े मॉडलों को टक्कर देता है

लेखकों ने एक मानक 9-बिलियन-पैरामीटर मॉडल (Qwen3.5-9B) को लिया और लगभग 1,400 लघु कथाओं का उपयोग करके इस पद्धति से प्रशिक्षित किया।

  • आश्चर्य: भले ही रोबोट को केवल 4,000 शब्दों तक की कहानियों पर प्रशिक्षित किया गया था, इसने 12,000 शब्दों (3 गुना लंबा!) तक की कहानियाँ लिखना सीख लिया (बिना गुणवत्ता खोए)!
  • तुलना:
    • बेस मॉडल बनाम: यह अनप्रशिक्षित संस्करण की तुलना में बहुत बेहतर है।
    • विशाल मॉडल्स बनाम: यह उन मॉडल्स के लगभग बराबर प्रदर्शन करता है जो 3 गुना बड़े (27 बिलियन पैरामीटर्स) और बहुत अधिक महंगे हैं।
    • "तनाव परीक्षण" (Stress Test): अधिकांश छोटे मॉडल लंबी कहानियाँ लिखने के लिए कहे जाने पर विफल हो जाते हैं। POLARIS एकमात्र छोटा मॉडल है जो मजबूत बना रहा, कहानी को सुसंगत रखा और मांगी गई लंबाई को वास्तव में पूरा किया।

यह क्यों महत्वपूर्ण है

यह पेपर तर्क देता है कि "लंबाई सामान्यीकरण" (Length Generalization - वह क्षमता जो आपको प्रशिक्षित किए गए से अधिक लंबा लिखने में सक्षम बनाती है) एक बेहतरीन तनाव परीक्षण है।

  • रूपक (Metaphor): यदि आप एक धावक को 1-मील की दौड़ के लिए प्रशिक्षित करते हैं, तो वह 2 मील पर थक सकता है। यदि वह बिना रुके 3 मील दौड़ सकता है, तो यह साबित करता है कि उसमें वास्तविक सहनशक्ति है, न कि केवल छोटी गति का विस्फोट।
  • POLARIS ने साबित किया कि सही "कोचिंग" (सख्त संपादक और मानवीय लंगर) के साथ, एक छोटे मॉडल में एक विशाल मॉडल की सहनशक्ति हो सकती है।

सारांश

POLARIS एक चतुर, कम लागत वाली प्रशिक्षण पद्धति है जो छोटे AI मॉडल्स को लंबी, रचनात्मक कहानियाँ लिखना सिखाती है:

  1. उन्हें एक स्मार्ट AI संपादक से विस्तृत, विशिष्ट फीडबैक देकर।
  2. उन्हें उच्च-गुणवत्ता वाले मानव उदाहरण दिखाकर ताकि वे ऊंचे लक्ष्य की ओर बढ़ सकें।

परिणामस्वरूप, एक छोटा, किफायती AI मिलता है जो विशाल, महंगे मॉडलों की तरह लंबी कहानियाँ लिखता है, और इसके लिए किसी सुपरकंप्यूटर की आवश्यकता नहीं होती।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →