← नवीनतम पेपर
💬 NLP

Multilingual TinyStories: A Synthetic Combinatorial Corpus of Indic Children's Stories for Training Small Language Models

यह शोध पत्र 'मल्टीलिंगुअल टिनीस्टोरीज' (Multilingual TinyStories) को प्रस्तुत करता है, जो 17 भारतीय भाषाओं में 132,000 से अधिक बच्चों की कहानियों का एक बड़े पैमाने का सिंथेटिक कॉर्पस है, जिसे स्मॉल लैंग्वेज मॉडल्स (Small Language Models) के प्रशिक्षण के लिए डेटा की कमी को दूर करने हेतु नेटिव मॉडल जनरेशन और क्रॉस-लिंगुअल ट्रांसलेशन के हाइब्रिड पाइपलाइन के माध्यम से तैयार किया गया है।

मूल लेखक: Deepon Halder, Angira Mukherjee

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Deepon Halder, Angira Mukherjee

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नन्हे, उत्साही पिल्ले को बोलना सिखाने की कोशिश कर रहे हैं। यदि आप उस पर एक विशाल, अराजक विश्वकोश (encyclopedia) फेंक देते हैं, तो पिल्ला भ्रमित हो जाएगा। लेकिन यदि आप उसे खरगोशों, जंगलों और खोए हुए खिलौनों की सरल, छोटी और स्पष्ट कहानियाँ देते हैं, तो वह भाषा के नियमों को जल्दी और खुशी-खुशी सीख जाता है।

यह शोध पत्र उन सरल कहानियों की एक विशाल लाइब्रेरी बनाने के बारे में है, लेकिन एक ट्विस्ट के साथ: यह 17 अलग-अलग भारतीय भाषाओं में लिखी गई है, जिनमें से कई के पास कंप्यूटरों के सीखने के लिए पर्याप्त अच्छी किताबें नहीं हैं।

यहाँ इस लाइब्रेरी को बनाने की कहानी है, जिसे सरल रूप में समझाया गया है:

1. समस्या: "खाली बुकशेल्फ़"

लंबे समय से, सबसे स्मार्ट कंप्यूटर दिमाग (AI मॉडल्स) मुख्य रूप से अंग्रेजी पर प्रशिक्षित रहे हैं। वे उन छात्रों की तरह हैं जिन्होंने केवल अंग्रेजी की पाठ्यपुस्तकें पढ़ी हैं। यदि आप उन्हें हिंदी, तमिल या उर्दू सिखाने की कोशिश करते हैं, तो वे संघर्ष करते हैं क्योंकि उन भाषाओं में पर्याप्त साफ, सरल और उच्च गुणवत्ता वाली कहानियाँ उपलब्ध नहीं हैं। मौजूदा डेटा अक्सर अस्त-व्यस्त होता है, जैसे पुराने समाचार पत्रों और रैंडम इंटरनेट कमेंट्स का ढेर।

शोधकर्ता इसे स्मॉल लैंग्वेज मॉडल्स (SLMs) के लिए ठीक करना चाहते थे। इन मॉडल्स को "पिल्ले के आकार के" AI के रूप में सोचें। वे विशाल AI की तुलना में छोटे, सस्ते और तेज़ होते हैं, लेकिन उन्हें ठीक से सीखने के लिए बहुत विशिष्ट, साफ प्रशिक्षण डेटा की आवश्यकता होती है।

2. समाधान: एक "कहानी फैक्ट्री"

मौजूदा कहानियों को खोजने के बजाय (जो दुर्लभ हैं), टीम ने उन्हें बनाने (manufacture) का निर्णय लिया। उन्होंने दो मुख्य मशीनों के साथ एक "स्टोरी फैक्ट्री" बनाई:

  • द मास्टर शेफ (Sarvam-M): 7 भाषाओं के लिए, उन्होंने Sarvam-M नामक एक शक्तिशाली AI का उपयोग किया। लेकिन उन्होंने केवल इसे "एक कहानी लिखने" के लिए नहीं कहा। ऐसा करना उबाऊ और दोहराव वाला होता।

  • द स्लॉट मशीन (Combinatorial Prompts): इसके बजाय, उन्होंने AI के लिए एक "स्लॉट मशीन" बनाई। उन्होंने एक टेम्पलेट बनाया जिसमें खाली स्लॉट्स थे, जैसे कि 'मैड्स लिब्स' (Mad Libs) गेम:

    • पात्र (Character): [एक जिज्ञासु खरगोश]
    • स्थान (Setting): [एक जादुई जंगल]
    • समस्या (Problem): [एक खोई हुई लालटेन]
    • सीख (Lesson): [साहस]

    उन्होंने इन स्लॉट्स को लाखों बार आपस में मिलाया और बदला। इसने AI को लाखों अद्वितीय कहानियाँ लिखने के लिए मजबूर किया जो इतनी सरल थीं कि एक 5 साल के बच्चे को समझ आ सकें, जिससे यह सुनिश्चित हुआ कि कंप्यूटर जटिल शब्दों से भ्रमित हुए बिना व्याकरण और कहानी कहने के मूल नियमों को सीख सके।

3. विस्तार: "अनुवादक पुल" (The Translator Bridge)

उनके पास 7 भाषाओं में बेहतरीन कहानियाँ थीं, लेकिन उन्हें 17 भाषाओं की आवश्यकता थी। अन्य 10 भाषाओं को प्राप्त करने के लिए, उन्होंने एक अनुवादक पुल का उपयोग किया।

  • उन्होंने गुजराती को अपना "बेस कैंप" चुना क्योंकि AI ने इस भाषा में सबसे साफ कहानियाँ लिखी थीं।
  • उन्होंने Google Translate का उपयोग करके उन गुजराती कहानियों को सावधानीपूर्वक अन्य 10 भाषाओं (जैसे उर्दू, संस्कृत और मणिपुरी) में अनुवादित किया।
  • सुरक्षा जाल (The Safety Net): उन्होंने यह सुनिश्चित करने के लिए एक सख्त फ़िल्टर जोड़ा कि कहानियों में कोई अंग्रेजी शब्द या लैटिन अक्षर "लीक" न हों। यदि किसी कहानी में कोई भटकता हुआ अंग्रेजी शब्द मिलता, तो उसे कचरे में डाल दिया जाता था। वे चाहते थे कि कहानियाँ शुद्ध और मूल (native) हों।

4. परिणाम: एक विशाल लाइब्रेरी

परिणामस्वरूप एक डेटासेट मिला जिसे Multilingual TinyStories कहा जाता है।

  • आकार: इसमें 1,32,000 से अधिक कहानियाँ हैं।
  • पैमाना: यह लगभग 94 मिलियन शब्द (tokens) है।
  • विविधता: यह 17 भाषाओं को कवर करता है, जिनमें से कुछ को AI अनुसंधान में बहुत कम देखा जाता है।

5. यह क्यों महत्वपूर्ण है

इस डेटासेट को छोटे AI मॉडल्स के लिए एक जिम के रूप में सोचें।

  • इससे पहले, भारतीय भाषाएँ सीखने की कोशिश कर रहे छोटे AI मॉडल्स भारी, जंग लगे वजन (अव्यवस्थित डेटा) उठाने की कोशिश कर रहे थे।
  • अब, उनके पास संतुलित, हल्के डंबल (साफ, सरल कहानियाँ) का एक सेट है।
  • यह शोधकर्ताओं को ऐसे छोटे, अधिक कुशल AI मॉडल्स को प्रशिक्षित करने की अनुमति देता है जो इन भाषाओं को धाराप्रवाह समझ और बोल सकें, जिससे तकनीक भारत के लाखों और लोगों के लिए सुलभ हो सके।

एक कमी (सीमाएँ)

लेखक अपनी खामियों के बारे में ईमानदार हैं। चूंकि कहानियाँ एक कंप्यूटर द्वारा बनाई गई हैं, इसलिए कभी-कभी तर्क थोड़ा अजीब हो सकता है (जैसे कि एक खरगोश बिना रॉकेट के चंद्रमा पर उड़ जाता है)। साथ भी, अनुवादित कहानियाँ शायद बिल्कुल वैसी न लगें जैसे एक मानव दादी कहानी सुनाती हैं; उनकी शब्दावली थोड़ी "रोबोटिक" लग सकती है। लेकिन भाषा के मूल सिद्धांतों को सिखाने के लिए, यह एक शानदार शुरुआती बिंदु है।

संक्षेप में: उन्होंने 17 भारतीय भाषाओं में लाखों सरल, साफ बच्चों की कहानियाँ छापने के लिए एक फैक्ट्री बनाई, जिससे छोटे कंप्यूटर दिमागों को उनकी स्थानीय भाषाओं को बोलने और समझने के लिए एक आदर्श प्रशिक्षण मैदान मिल सका।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →