Characterizing Narrative Content in Web-scale LLM Pretraining Data
यह शोध पत्र एक नवीन ढांचे और डेटासेट, NarraDolma को प्रस्तुत करता है, जो वेब-स्केल एलएलएम (LLM) प्रीट्रेनिंग डेटा की सूक्ष्म-स्तरीय नैरेटिव संरचना को स्पष्ट करता है, यह प्रकट करते हुए कि नैरेटिव गुण मापने योग्य रूप से मौजूद हैं लेकिन वर्तमान क्यूरेशन प्रथाओं द्वारा अनदेखा किए जाने वाले तरीकों से स्रोतों और विषयों में असमान रूप से वितरित हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत बड़ी पार्टी के लिए एक विशाल केक बना रहे हैं। रेसिपी में "मैदा" (flour) डालने को कहा गया है, लेकिन आपको नहीं पता कि आपके पास किस तरह का मैदा है। क्या यह बारीक, रेशमी केक वाला मैदा है? या मोटा गेहूं का आटा? या इसमें रेत मिली हुई है?
लंबे समय तक, "लार्ज लैंग्वेज मॉडल्स" (LLMs)—जो चैटबॉट्स जैसे टूल्स के पीछे के सुपर-स्मार्ट AI दिमाग हैं—बनाने वाले वैज्ञानिक अपने "मैदे" (इंटरनेट टेक्स्ट जिस पर वे ट्रेनिंग करते हैं) को बिना यह जाने मिलाते रहे कि उसके विशिष्ट घटक क्या हैं। वे जानते थे कि उसके कुछ हिस्से "विषाक्त" (toxic) हैं या "गणित के बारे में" हैं, लेकिन वे उसके अंदर की कहानियों के बारे में ज्यादा नहीं जानते थे।
यह पेपर उन खाद्य वैज्ञानिकों की एक टीम की तरह है जिन्होंने उस मैदे के विशाल ढेर को सूक्ष्मदर्शी (microscope) से देखने का फैसला किया। वे यह जानना चाहते थे कि: उसमें वास्तव में कितनी कहानी है, और वह कैसी दिखती है?
यहाँ उनकी जांच का विवरण दिया गया है:
1. रेसिपी बुक (द फ्रेमवर्क)
शोधकर्ताओं ने केवल यह नहीं पूछा कि "क्या यह एक कहानी है?" (हाँ/नहीं)। इसके बजाय, उन्होंने मानव कहानियों के आधार पर एक विस्तृत फ्लेवर प्रोफाइल बनाया। उन्होंने "कहानी सुनाने" (storytelling) को तीन मुख्य सामग्रियों में विभाजित किया:
- अभिनेता (एजेंसी/Agency): कौन कार्य कर रहा है? क्या हम उनकी आँखों से दुनिया देख रहे हैं? क्या हम उनकी भावनाओं को महसूस कर रहे हैं या उनके विचार सुन रहे हैं? (इसे कहानी का "हृदय" समझें)।
- मंच (सेटिंग/Setting): यह कहाँ और कब हो रहा है? क्या यह कहीं का भी एक अस्पष्ट स्थान है, या 1920 के पेरिस का एक विशिष्ट, धूल भरा कमरा है? (इसे "पृष्ठभूमि" समझें)।
- कथानक (घटनाएँ/Plot): वास्तव में क्या हो रहा है? क्या चीजें बदल रही हैं? क्या यह कारण-और-प्रभाव की एक श्रृंखला है, या बस चीजों की एक सूची है? (इसे "क्रिया" समझें)।
उन्होंने इन्हें 1 से 5 तक रेट किए जा सकने वाले 11 विशिष्ट "डायल" या स्लाइडर्स में बदल दिया।
2. टेस्ट टेस्ट (द डेटा)
उन्होंने इंटरनेट टेक्स्ट का एक विशाल पुस्तकालय लिया जिसे DOLMA कहा जाता है (जो बहुत बड़ा है—3 ट्रिलियन शब्द, एक ऐसे पुस्तकालय की तरह जिसे पढ़ने में आपको पूरा जीवन लग जाएगा)।
- चरण 1: वे इसे पूरा नहीं पढ़ सकते थे। इसलिए, उन्होंने एक रोबोट सहायक (एक मॉडल जिसे NARRABERT कहा जाता है) बनाया।
- चरण 2: पहले, उन्होंने 400 रैंडम अंशों को पढ़ने और उन 11 डायलों पर रेटिंग देने के लिए मानव विशेषज्ञों को काम पर रखा। यह "गोल्ड स्टैंडर्ड" था।
- चरण 3: फिर उन्होंने रोबोट सहायक को इंसानों की नकल करने के लिए प्रशिक्षित किया।
- चरण 4: वह रोबोट 3 मिलियन अंशों से गुजरा और उन सभी को रेट किया। उन्होंने एक नया मानचित्र बनाया जिसे NARRADOLMA कहा गया।
3. चौंकाने वाले निष्कर्ष
जब उन्होंने मानचित्र को देखा, तो उन्हें तीन बड़ी चीजें मिलीं:
क. कहानियाँ केवल "चालू" या "बंद" नहीं होतीं।
यह किसी लाइट स्विच की तरह नहीं है जहाँ कोई टेक्स्ट या तो कहानी है या नहीं। यह एक डिमेर स्विच (dimmer switch) की तरह है। कुछ टेक्स्ट बहुत धुंधले (उबाऊ तथ्य) होते हैं, कुछ बहुत उज्ज्वल (नाटकीय उपन्यास), और अधिकांश बीच में कहीं होते हैं। शोधकर्ताओं ने पाया कि इंटरनेट में "कहानी सुनाना" एक निरंतर, बहु-आयामी परिदृश्य है, न कि एक सरल श्रेणी।
ख. "मैदा" असमान रूप से मिला हुआ है।
यदि आप सोचते हैं कि "Reddit" कहानियों से भरा है और "Wikipedia" तथ्यों से भरा है, तो आप काफी हद तक सही हैं, लेकिन यह अधिक जटिल है।
- Reddit और किताबें "आंतरिक भावनाओं" और "चरित्र के विचारों" से भरे मसालों के डिब्बे की तरह हैं। वे "अभिनेता" (Actor) वाले डायल पर उच्च हैं।
- Wikipedia और समाचार एक मानचित्र की तरह हैं। वे "घटनाओं" (Events) और "समय/स्थान" (Time/Place) पर उच्च हैं लेकिन "भावनाओं" (Feelings) पर कम हैं।
- यात्रा और फूड ब्लॉग एक पेंटिंग की तरह हैं। वे "संवेदी विवरणों" (महक, दृश्य) पर उच्च हैं लेकिन "संघर्ष" (Conflict) पर कम हैं।
ग. आप केवल अधिक किताबें जोड़कर "अधिक कहानियाँ" नहीं जोड़ सकते।
शोधकर्ताओं ने पाया कि यहाँ तक कि एक ही स्रोत (जैसे Reddit) के भीतर भी, "कहानी सुनाना" बहुत भिन्न होता है। कुछ Reddit पोस्ट शुद्ध ड्रामा हैं; अन्य केवल तकनीकी प्रश्न हैं।
- रूपक (Metaphor): कल्पना कीजिए कि आप अपने केक को अधिक "फूला हुआ" बनाना चाहते हैं। आप सोच सकते हैं, "मैं बस और अधिक केक वाला मैदा डाल दूँगा!" लेकिन यदि उस आटे की बोरी में वास्तव में केक वाले मैदा, रेत और बजरी का मिश्रण है, तो केवल उस बोरी को और अधिक जोड़ने से गारंटी नहीं मिलती कि आपका केक अधिक फूला हुआ बनेगा। आपको यह जानने की जरूरत है कि उस बोरी का कौन सा विशिष्ट हिस्सा अच्छा मैदा है।
4. यह क्यों मायने रखता है
यह पेपर निष्कर्ष निकालता है कि जो लोग AI मॉडल बनाते हैं, वे अपने डेटा स्रोतों (जैसे "Reddit" या "News") के साथ ऐसे व्यवहार करते हैं जैसे कि वे सभी एक ही प्रकार के कहानीकार हों। वे नहीं हैं।
यदि एक AI मुख्य रूप से "समाचार" (उच्च घटनाएँ, कम भावनाएँ) पर प्रशिक्षित है, तो वह तथ्यों की रिपोर्ट करने में अच्छा हो सकता है लेकिन मानवीय भावनाओं को समझने में बुरा। यदि यह "Reddit" (उच्च भावनाएँ, कम संरचना) पर प्रशिक्षित है, तो यह सहानुभूति (empathy) में अच्छा हो सकता है लेकिन तार्किक कारण-और-प्रभाव (logical cause-and-effect) में बुरा।
मुख्य बात (The Bottom Line):
इस पेपर ने कोई नया AI नहीं बनाया या किसी टूटे हुए AI को ठीक नहीं किया। इसके बजाय, इसने इंटरनेट की कहानियों के लिए एक मापने वाला टेप (measuring tape) बनाया। इसने हमें दिखाया कि हमारे डेटा का "कहानी" वाला हिस्सा अव्यवस्थित, विविध और असमान रूप से वितरित है। इससे पहले कि हम AI को बेहतर कहानियाँ सुनाना सिखा सकें, हमें पहले यह समझना होगा कि वर्तमान में मिश्रण में किस तरह की कहानियाँ मौजूद हैं।
शोधकर्ताओं ने अपना मापने वाला टेप (मॉडल) और अपना मानचित्र (डेटासेट) उपयोग के लिए जारी कर दिया है, ताकि भविष्य में हम सभी बेहतर केक बनाना शुरू कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।