← नवीनतम पेपर
💬 NLP

CHIMERA: Compact Synthetic Data for Generalizable LLM Reasoning

यह शोधपत्र CHIMERA को प्रस्तुत करता है, जो 9K उच्च-गुणवत्ता वाले, क्रॉस-डोमेन रीजनिंग नमूनों का एक संक्षिप्त, पूर्णतः स्वचालित सिंथेटिक डेटासेट है, जो कोल्ड-स्टार्ट, डोमेन कवरेज और एनोटेशन बॉटलनेक चुनौतियों पर विजय प्राप्त करके एक छोटे 4B मॉडल को बहुत बड़े फ्रंटियर मॉडल्स के तुलनीय रीजनिंग प्रदर्शन प्राप्त करने में सक्षम बनाता है।

मूल लेखक: Xinyu Zhu, Yihao Feng, Yanchao Sun, Xianzhi Du, Pingzhi Li, Olli Saarikivi, Yun Zhu, Yu Meng

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinyu Zhu, Yihao Feng, Yanchao Sun, Xianzhi Du, Pingzhi Li, Olli Saarikivi, Yun Zhu, Yu Meng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ CHIMERA पेपर का स्पष्टीकरण है, जिसे सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

बड़ी समस्या: "खाली क्लासरूम" की दुविधा

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अनुभवहीन छात्र (एक छोटा AI मॉडल) को एक जासूस की तरह जटिल रहस्यों को सुलझाना सिखाना चाहते हैं। ऐसा करने के लिए, आपको हल किए गए मामलों से भरी एक पाठ्यपुस्तक की आवश्यकता है।

हालाँकि, हमारे पास वर्तमान में जो पुस्तकें हैं, उनमें तीन बड़ी समस्याएँ हैं:

  1. द कोल्ड स्टार्ट (शुरुआती हिचकिचाहट): अधिकांश मौजूदा पुस्तकों में केवल अंतिम उत्तर होता है (जैसे, "बटलर ने यह किया!")। वे सोचने की प्रक्रिया (सुराग, निष्कर्ष, गलत रास्ते) नहीं दिखाते हैं। जासूसी की सोचने की प्रक्रिया देखे बिना, छात्र यह नहीं सीख सकता कि कैसे सोचा जाता है।
  2. एक ही विषय का जाल: हमारे पास मौजूद लगभग सभी पुस्तकें गणित (Math) के बारे में हैं। यदि आप छात्र को जीव विज्ञान (Biology), इतिहास (History), या साहित्य (Literature) के बारे में सिखाना चाहते हैं, तो आप हाथ मलते रह जाएंगे। छात्र गणित का जीनियस तो बन जाएगा, लेकिन बाकी सब चीजों में पूरी तरह विफल रहेगा।
  3. मानवीय बाधा (The Human Bottleneck): इन विस्तृत "सोचने की प्रक्रिया" वाली पुस्तकों को लिखना अविश्वसनीय रूप से कठिन है। इसके लिए विशेषज्ञों को हाथ से लिखने के लिए पीएचडी-स्तर के विशेषज्ञों की आवश्यकता होती है। यह इतना महंगा और धीमा है कि हम अगली पीढ़ी के AI को प्रशिक्षित करने के लिए पर्याप्त पुस्तकें नहीं बना सकते।

समाधान: CHIMERA (एक "स्मार्ट फोटोकॉपी मशीन")

शोधकर्ताओं ने CHIMERA बनाया है। इसे एक विशाल पुस्तकालय के रूप में नहीं, बल्कि एक अत्यधिक क्यूरेटेड, संक्षिप्त "मास्टर क्लास" किट के रूप में सोचें।

लाखों पन्ने हाथ से लिखने की कोशिश करने के बजाय, उन्होंने एक फैक्ट्री बनाई है जो छोटे AI मॉडलों के लिए पाठ्यपुस्तकें लिखने के लिए उपलब्ध सबसे स्मार्ट AI मॉडलों का उपयोग करती है।

यहाँ बताया गया है कि उनकी फैक्ट्री कैसे काम करती है, चरण-दर-चरण:

1. मेनू विस्तार (विषय विस्तार - Subject Expansion)

केवल "गणित" कहने के बजाय, फैक्ट्री एक सुपर-स्मार्ट AI से पूछती है: "मुझे गणित, भौतिकी, रसायन विज्ञान, इतिहास, साहित्य और जीव विज्ञान के अंतर्गत आने वाले हर एक विषय की सूची दें।"

  • उपमा: यह एक शेफ की तरह है जो केवल "सब्जियों" के बजाय दुनिया के हर संभव घटक (ingredient) की सूची मांग रहा है। अंत में उनके पास "क्वांटम फिजिक्स" से लेकर "19वीं सदी की कविता" तक 1,000 विशिष्ट विषय होते हैं।

2. रेसिपी जनरेटर (समस्या निर्माण - Problem Generation)

उन 1,000 विषयों में से प्रत्येक के लिए, फैक्ट्री AI को एक विशिष्ट, कठिन पहेली बनाने के लिए कहती है।

  • उपमा: AI केवल "2+2=4" नहीं लिखता। यह एक जटिल, पीएचडी-स्तर की पहेली लिखता है जैसे, "इन विशिष्ट चरों (variables) का उपयोग करके एक विशिष्ट तारे पर ब्लैक होल के गुरुत्वाकर्षण खिंचाव की गणना करें।"
  • सुरक्षा जाँच: पहेली को सहेजने से पहले, दो अन्य सुपर-स्मार्ट AI निरीक्षकों के रूप में कार्य करते हैं। वे जाँचते हैं: "क्या यह प्रश्न वास्तव में हल करने योग्य है? क्या उत्तर सही है?" यदि पहेली त्रुटिपूर्ण है, तो उसे कचरे में फेंक दिया जाता है।

3. मास्टर डिटेक्टिव का वॉकथ्रू (समाधान संश्लेषण - Solution Synthesis)

यह सबसे महत्वपूर्ण हिस्सा है। एक बार जब एक वैध पहेली बन जाती है, तो फैक्ट्री एक "मास्टर डिटेक्टिव" AI (एक बहुत बड़े, शक्तिशाली मॉडल) से इसे हल करने के लिए कहती है।

  • जादू: मास्टर डिटेक्टिव केवल उत्तर नहीं देता। वह अपने विचारों की एक लंबी, विस्तृत डायरी लिखता है। वह कहता है, "सबसे पहले, मैंने X को देखा। फिर मुझे एहसास हुआ कि Y गलत था। इसलिए मैंने Z को आज़माया..."
  • यह "डायरी" ही चेन-ऑफ-थॉट (CoT) है। यह चरण-दर-चरण तर्क है जिसे छोटे छात्र AI को सीखने की आवश्यकता है।

CHIMERA विशेष क्यों है?

आप सोच सकते हैं, "रुको, यदि वे AI से AI डेटा बना रहे हैं, तो क्या यह केवल गलतियों की नकल नहीं है?"

शोधकर्ता तर्क देते हैं कि गुणवत्ता > मात्रा (Quality > Quantity)

  • पुराना तरीका: एक मॉडल में 1 मिलियन सरल गणितीय समस्याओं को डाल देना (जैसे किसी छात्र को 1 मिलियन आसान वर्कशीट खिलाना)।
  • CHIMER का तरीका: एक छात्र को 9,000 अत्यंत कठिन, विविध समस्याएँ और उनके पूर्ण, विस्तृत स्पष्टीकरण देना।

परिणाम:
उन्होंने एक छोटे AI मॉडल (केवल 4 बिलियन पैरामीटर्स वाला, जो AI की दुनिया में बहुत छोटा है) को इस 9,000-नमूना "मास्टर क्लास" पर प्रशिक्षित किया।

जादुई ट्रिक:
प्रशिक्षण के बाद, यह छोटा 4B मॉडल तर्क करने में इतना अच्छा हो गया कि यह ह्यूमैनिटीज़ लास्ट एग्जाम (Humanity's Last Exam) (एक ऐसा टेस्ट जिसे वर्तमान AI के लिए असंभव माना जाता है) और उन्नत गणित प्रतियोगिताओं जैसे कठिन परीक्षणों पर विशाल मॉडलों (जैसे 235-बिलियन-पैरामीटर वाले दिग्गजों) को हराने या उनके बराबर पहुँचने में सक्षम था।

मुख्य निष्कर्ष (The Takeaway)

CHIMERA को एक विशेषज्ञ, उच्च-तीव्रता वाले ट्यूशन प्रोग्राम के रूप में देखें।

AI को ढेर सारा जंक फूड (विशाल, निम्न-गुणवत्ता वाला डेटा) खिलाने के बजाय, उन्होंने इसे एक छोटा, पूरी तरह से संतुलित, स्वादिष्ट भोजन (संक्षिप्त, उच्च-गुणवत्ता वाला, विविध डेटा) खिलाया।

भविष्य के लिए सबक: हमें बड़े और बड़े दिमाग बनाने की ज़रूरत नहीं है; हमें बस उन्हें बेहतर तरीके से सिखाने की ज़रूरत है। दूसरे AI के लिए उच्च-गुणवत्ता वाले "सोचने के मार्गदर्शकों" को उत्पन्न करने के लिए AI का उपयोग करके, हम छोटे, सस्ते मॉडलों को बिना मानव विशेषज्ञों की सेना के, अविश्वसनीय रूप से स्मार्ट बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →