← नवीनतम पेपर
💬 NLP

Testimole-Conversational: A 30-Billion-Word Italian Discussion Board Corpus (1996-2024) for Language Modeling and Sociolinguistic Research

यह शोध पत्र "Testimole-conversational" को प्रस्तुत करता है, जो कि 1996 से 2024 तक के इतालवी चर्चा बोर्ड संदेशों का एक निःशुल्क उपलब्ध 30-बिलियन-शब्दों का संग्रह है, जिसे मूल इतालवी लार्ज लैंग्वेज मॉडल्स के प्री-ट्रेनिंग में सहायता करने और भाषाविज्ञान, समाजभाषाविज्ञान तथा ऑनलाइन सामाजिक संपर्क के अनुसंधान को सुगम बनाने के लिए डिज़ाइन किया गया है।

मूल लेखक: Matteo Rinaldi, Rossella Varvara, Viviana Patti

प्रकाशित 2026-04-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Matteo Rinaldi, Rossella Varvara, Viviana Patti

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल, डिजिटल टाइम कैप्सूल है जिसने लगभग 30 वर्षों से इतालवी इंटरनेट उपयोगकर्ताओं की बातचीत, बहस, चुटकुलों और सलाह को इकट्ठा किया है। वास्तव में TestiMole-Conversational यही है।

यहाँ शोधकर्ताओं ने क्या किया, यह क्यों महत्वपूर्ण है, और उन्होंने इसे कैसे बनाया, इसका सरल विवरण दिया गया है, जिसमें कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है।

🏛️ मुख्य विचार: इतालवी चैट का एक "डिजिटल पुस्तकालय"

पिछले तीन दशकों में, इंटरनेट एक नया "टाउन स्क्वायर" (चौपाल) बन गया है जहाँ लोग बात करने के लिए इकट्ठा होते हैं। इंटरनेट से पहले, यदि आप जानना चाहते थे कि इतालवी लोग अनौपचारिक रूप से कैसे बोलते हैं, तो आप उन्हें किसी कैफे में सुन सकते थे या कोई उपन्यास पढ़ सकते थे। लेकिन उपन्यास बहुत परिष्कृत (polished) होते हैं, और कैफे के क्षणभंगुर होते हैं।

यह शोध पत्र 30 बिलियन शब्दों (यह आपके पूरे जीवन की किताबों के पुस्तकालय को पढ़ने जैसा है) का एक विशाल संग्रह पेश करता है, जो दो विशिष्ट प्रकार के ऑनलाइन "टाउन स्क्वेयर्स" से लिया गया है:

  1. Usenet (पुराने जमाने का बुलेटिन बोर्ड): इसे इंटरनेट के "दादा-दादी" की तरह समझें। 90 के दशक में शुरू हुआ, यह एक विकेंद्रीकृत प्रणाली थी जहाँ लोग वैश्विक समूहों में संदेश पोस्ट करते थे। यह एक विशाल, अराजक पुस्तकालय की तरह है जहाँ कोई भी किसी विषय पर चिल्ला सकता था, और दुनिया भर के लोग उसका उत्तर देते थे।
  2. Forums (आधुनिक सामुदायिक केंद्र): ये वे वेबसाइटें हैं जिन्होंने 2000 के दशक में जगह ली (जैसे Reddit या विशिष्ट शौक वाली साइटें)। ये अधिक व्यवस्थित हैं, जिनमें कारों, खाना पकाने, राजनीति या तकनीकी सहायता के लिए विशिष्ट कमरे हैं।

शोधकर्ताओं ने केवल कुछ पन्ने नहीं उठाए; उन्होंने फ़ोरम से 470 मिलियन संदेश और Usenet से 90 मिलियन संदेशों को इकट्ठा किया, जो 1996 से 2024 तक के वर्षों को कवर करते हैं।

🤖 हमें इसकी आवश्यकता क्यों है? ("AI" का दृष्टिकोण)

आप पूछ सकते हैं, "इस पुरानी चैट को क्यों बचाना है?"

1. AI को स्वाभाविक रूप से इतालवी बोलना सिखाना
कल्पना कीजिए कि आप एक रोबोट को इतालवी बोलना सिखाने की कोशिश कर रहे हैं। यदि आप केवल उसे पाठ्यपुस्तकें और समाचार लेख खिलाते हैं, तो रोबोट एक सख्त, औपचारिक समाचार एंकर की तरह सुनाई देगा। वह यह नहीं जान पाएगा कि "हे, क्या हाल है?" कैसे कहना है या स्लैंग (slang) को कैसे समझना है।

  • उपमा: इस कॉर्पस को AI के मस्तिष्क के लिए एक जिम के रूप में सोचें। इन वास्तविक, अव्यवस्थित, अनौपचारिक बातचीत पर प्रशिक्षण देकर, AI इतालवी भाषा की "आत्मा" सीखता है। वह सीखता है कि जब लोग निराश होते हैं, उत्साहित होते हैं, या किसी दोस्त को टूटा हुआ टोस्टर ठीक करने में मदद कर रहे होते हैं, तो वे वास्तव में कैसे बात करते हैं। यह ऐसे चैटबॉट्स बनाने के लिए महत्वपूर्ण है जो मानवीय महसूस हों, न कि रोबोटिक।

2. समाजशास्त्रियों के लिए एक टाइम मशीन
चूंकि डेटा दिनांकित (dated) है, इसलिए शोधकर्ता भाषा को वास्तविक समय में विकसित होते देख सकते हैं।

  • उपमा: यह संस्कृति की स्लो-मोशन फिल्म देखने जैसा है। आप देख सकते हैं कि शब्द "troll" पहली बार कब आया, या कैसे लोगों ने 2001 में "smartphone" का उपयोग करना शुरू किया, इससे पहले कि यह लोकप्रिय हुआ हो। आप देख सकते हैं कि 20 वर्षों में राजनीतिक बहसें कैसे बदलीं। यह इस बात का इतिहास कैद करता है कि इतालवी ऑनलाइन कैसे संवाद करते थे, इसे इससे पहले सुरक्षित करता है कि सर्वर बंद हो जाएं और डेटा गायब हो जाए।

🛠️ उन्होंने इसे कैसे बनाया? ("डिजिटल पुरातत्व")

इसे एकत्र करना आसान नहीं था। यह एक दबे हुए शहर को खोदने जैसा था जहाँ हर इमारत अलग तरह की ईंटों से बनी थी और कुछ पहले से ही ढह रही थीं।

  • चुनौती: इंटरनेट अव्यवस्थित है। कुछ फ़ोरम एक प्रकार के सॉफ़्टवेयर का उपयोग करते हैं, अन्य दूसरे का। कुछ पेज तेज़ी से लोड होते हैं; अन्य टूटे हुए होते हैं।
  • समाधान: टीम ने कस्टम "स्क्रैपिंग" स्क्रिप्ट (डिजिटल रोबोट) लिखी जो इन साइटों पर जाने के लिए बनाई गई थीं। उन्हें बहुत सावधान रहना पड़ा ताकि:
    • डेटा को साफ किया जा सके: केवल बातचीत प्राप्त करने के लिए विज्ञापनों और नेविगेशन बार को हटा दिया जाए।
    • गोपनीयता की रक्षा की जा सके: उन्होंने प्रत्येक वास्तविक उपयोगकर्ता नाम को एक सामान्य आईडी (जैसे "User_123") से बदल दिया। यह भीड़ की फोटो में चेहरों को धुंधला करने जैसा है ताकि आप व्यक्तियों की पहचान किए बिना भीड़ के व्यवहार का अध्ययन कर सकें।
    • "ऑफ-टॉपिक" शोर को संभालना: उन्हें यह तय करना था कि अच्छी बातचीत को कैसे रखें और स्पैम को कैसे हटा दें।

⚠️ सावधानी (यह पूर्ण नहीं है)

लेखक अपनी सीमाओं के बारे में ईमानदार हैं।

  • यह अव्यवस्थित है: वास्तविक इंटरनेट बातचीत में अपशब्द, बहस और यहाँ तक कि गलत सूचनाएँ भी शामिल होती हैं।
  • उपमा: यदि आप मानव व्यवहार का अध्ययन कर रहे होते, तो आप ऐसा पुस्तकालय नहीं चाहेंगे जिसमें केवल आदर्श, विनम्र भाषण हों। आपको यह समझने के लिए वास्तविक बहस की भी आवश्यकता है कि लोग वास्तव में कैसे प्रतिक्रिया देते हैं। हालाँकि, यदि आप एक AI को ग्राहक सेवा एजेंट बनने के लिए प्रशिक्षित कर रहे हैं, तो आप नहीं चाहेंगे कि वह अपशब्द सीखना सीखे। इसलिए, यह डेटा एक दोधारी तलवार है: यह अनुसंधान के लिए अविश्वसनीय रूप से मूल्यवान है, लेकिन इसका उपयोग सावधानी से किया जाना चाहिए।

🚀 निचोड़

TestiMole-Conversational एक विशाल बचाव मिशन है। इंटरनेट नाजुक है; वेबसाइटें मर जाती हैं, और डेटा खो जाता है। इस परियोजना ने इतालसीय डिजिटल इतिहास के एक बड़े हिस्से को बचाया है।

  • AI के लिए: यह इतालवी चैटबॉट्स को स्वाभाविक रूप से बोलने में मदद करने वाला गुप्त सूत्र (secret sauce) है।
  • मानव के लिए: यह एक टाइम कैप्सूल है जो हमें यह अध्ययन करने की अनुमति देता है कि पिछले 30 वर्षों में हम ऑनलाइन कैसे बदले हैं, बहस की है और जुड़े हैं।

यह इंटरनेट के अराजक शोर को एक संरचित, मूल्यवान संसाधन में बदल देता है जो हमें अपनी तकनीक और स्वयं को समझने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →