← नवीनतम पेपर
💬 NLP

Swiss Parliaments Corpus Re-Imagined (SPC_R): Enhanced Transcription with RAG-based Correction and Predicted BLEU

यह शोध पत्र स्विस पार्लियामेंट कॉर्पस री-इमेजिन्ड (SPC_R) को प्रस्तुत करता है, जो स्विस जर्मन संसदीय बहसों का 555 घंटों का एक उच्च-गुणवत्ता वाला लॉन्ग-फॉर्म डेटासेट है, जिसे Whisper Large-v3 के साथ ऑडियो को ट्रांसक्राइब करके, दो-चरणीय GPT-4o सुधार प्रक्रिया के माध्यम से इसे परिष्कृत करके, और पिछले वाक्य-स्तर के संस्करणों की तुलना में 6-पॉइंट BLEU सुधार प्राप्त करने के लिए अनुमानित BLEU और सिमेंटिक पूर्णता स्कोर के आधार पर खंडों को फ़िल्टर करके बनाया गया है।

मूल लेखक: Vincenzo Timmel, Manfred Vogel, Daniel Perruchoud, Reza Kakooee

प्रकाशित 2026-03-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vincenzo Timmel, Manfred Vogel, Daniel Perruchoud, Reza Kakooee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास स्विस संसद के पुराने रेडियो प्रसारणों का एक विशाल, धूल भरा पुस्तकालय है। ये केवल साधारण प्रसारण नहीं हैं; ये घंटों लंबे वाद-विवाद हैं जो स्विस जर्मन (एक कठिन, बोली-प्रधान संस्करण) में बोले गए हैं, लेकिन आधिकारिक लिखित रिकॉर्ड स्टैंडर्ड जर्मन में हैं।

इस शोध पत्र का लक्ष्य एक आदर्श "शब्दकोश" बनाना है जो बोले गए ऑडियो को लिखित पाठ (टेक्स्ट) से मिला सके, ताकि कंप्यूटर स्विस जर्मन को समझना सीख सकें। लेखक इस नए पुस्तकालय को SPC_R कहते हैं।

इसे उन्होंने एक सरल कहानी के माध्यम से कैसे बनाया, यहाँ बताया गया है:

1. समस्या: "जल्दबाज मुंशी" (The Hasty Scribe)

कल्पना कीजिए कि आपने इन 801 घंटों के वाद-विवादों को सुनने और उन्हें टाइप करने के लिए एक बहुत तेज़, बहुत बुद्धिमान रोबोट मुंशी (जिसे Whisper कहा जाता है) को काम पर रखा है।

  • अच्छी खबर: रोबोट तेज़ है और सामान्य विचार सही पकड़ लेता है।
  • बुरी खबर: वह विवरणों के मामले में थोड़ा लापरवाह है। वह "Alba Rutschi" सुनता है लेकिन "Alberucci" लिख देता है। वह किसी विशिष्ट राजनीतिक दल का नाम सुनता है और उसे गलत कर देता है। यह एक ऐसे छात्र की तरह है जो कहानी तो समझ जाता है लेकिन मुख्य पात्रों के नाम लिखने में बार-बार गलती करता रहता है।

2. समाधान: "दो-चरणीय संपादक" (The Two-Step Editor)

रोबोट की गलतियों को सुधारने के लिए, लेखकों ने केवल एक इंसान को हर एक शब्द पढ़ने के लिए नहीं रखा (क्योंकि इसमें बहुत समय लगता), बल्कि उन्होंने दो अलग-अलग AI "संपादकों" का उपयोग करके एक स्मार्ट एडिटिंग पाइपलाइन बनाई।

चरण A: तथ्य-जांचकर्ता (RAG + GPT-4o)

सबसे पहले, उन्होंने रोबोट के बिखरे हुए ड्राफ्ट को एक सुपर-स्मार्ट संपादक (GPT-4o) को दिया। लेकिन इस संपादक के पास एक गुप्त हथियार था: संदर्भ (Context)

  • उपमा: कल्पना कीजिए कि संपादक एक राजनेता "हंस" के बारे में एक वाक्य को ठीक करने की कोशिश कर रहा है। बिना संदर्भ के, संपादक अनुमान लगा सकता है। लेकिन, सिस्टम उस ऑडियो स्निपेट के ठीक बगल में आधिकारिक बैठक के विवरण (सत्य का स्रोत) को भी संपादक को प्रदान करता है।
  • जादू: RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) नामक तकनीक का उपयोग करते हुए, सिस्टम आधिकारिक विवरणों में सटीक पैराग्राफ ढूंढ लेता है जो ऑडियो स्निपेट से मेल खाता है। फिर संपादक कहता है, "आह, रोबोट ने 'Alberucci' लिखा है, लेकिन आधिकारिक विवरण में 'Alberucci' है। चलिए इसे ठीक करते हैं।"
  • परिणाम: इस चरण ने नामों की लगभग सभी गलतियों को ठीक कर दिया, जिससे नामों और स्थानों के लिए सटीकता दर 72% से बढ़कर 100% हो गई।

चरण B: गुणवत्ता निरीक्षक (GPT-4o-mini)

एक बार जब टेक्स्ट को साफ कर दिया गया, तो उन्हें यह जानने की आवश्यकता थी: "क्या यह खंड वास्तव में रखने योग्य पर्याप्त अच्छा है?"

  • उपमा: कल्पना कीजिए कि एक फिल्म निर्देशक एक कच्चे टेक (raw take) को देख रहा है। कुछ दृश्य बेहतरीन हैं; कुछ अस्पष्ट या भ्रमित करने वाले हैं। निर्देशक को यह तय करने की आवश्यकता है कि अंतिम फिल्म के लिए कौन से क्लिप रखने हैं।
  • उपकरण: उन्होंने एक दूसरे, छोटे AI (GPT-4o-mini) का उपयोग एक "न्यायाधीश" के रूप में किया। इसने सुधारे गए टेक्स्ट को देखा और इसे 0 से 3 तक का स्कोर दिया।
    • स्कोर 3: उत्तम।
    • स्कोर 2: व्याकरण की मामूली चूक, लेकिन अर्थ स्पष्ट है।
    • स्कोर 1: गलत नाम या मुख्य शब्द।
    • स्कोर 0: कचरा।

3. "क्रिस्टल बॉल" (बिना मनुष्यों के गुणवत्ता का पूर्वानुमान)

यहाँ सबसे चतुर हिस्सा है। आमतौर पर, यह जानने के लिए कि ट्रांसक्रिप्शन अच्छा है या नहीं, आपको एक इंसान की आवश्यकता होती है जो इसकी तुलना "वास्तविक" उत्तर से करे। यह महंगा और धीमा है।

लेखकों ने रोबोट मुंशी (Whisper) के भीतर एक क्रिस्टल बॉल की खोज की।

  • उपमा: जब रोबोट मुंशी कोई शब्द लिखता है, तो वह खुद से फुसफुसाता है, "मुझे 99% यकीन है कि यह 'cat' है।" यदि वह कहता है, "मैं केवल 50% आश्वस्त हूँ," तो यह एक चेतावनी का संकेत है।
  • खोज: उन्होंने रोबोट के आत्मविश्वास और अंतिम टेक्स्ट की गुणवत्ता के बीच एक सीधा संबंध पाया। उन्होंने एक गणितीय सूत्र (एक "Predicted BLEU") बनाया जो रोबोट के आत्मविश्वास को देखता है और किसी भी इंसान के देखने से पहले ही गुणवत्ता स्कोर का पूर्वानुमान लगा लेता है।
  • परिणाम: वे किसी भी इंसान को पहले से पढ़ने के लिए नियुक्त किए बिना, खराब क्लिप्स को स्वचालित रूप से फ़िल्टर कर सके।

4. अंतिम उत्पाद

इन चरणों को मिलाकर, उन्होंने 801 घंटों के कच्चे ऑडियो से शुरुआत की।

  • उन्होंने कम-आत्मविश्वास वाले, बिखरे हुए हिस्सों को बाहर निकाल दिया।
  • उन्होंने केवल उच्च-गुणवत्ता वाले, सुधारे गए खंडों को रखा।
  • परिणाम: 555 घंटों का एक निर्मल पुस्तकालय जो स्विस जर्मन ऑडियो को सटीक रूप से स्टैंडर्ड जर्मन टेक्स्ट के साथ जोड़ता है।

यह क्यों मायने रखता है?

इस डेटासेट को AI के लिए ट्रेनिंग व्हील्स (सीखने के सहायक उपकरण) के रूप में सोचें।
इससे पहले, स्विस जर्मन को समझने की कोशिश करने वाले AI मॉडल उन छात्रों की तरह थे जो गलतियों से भरी पाठ्यपुस्तक के साथ भाषा सीखने की कोशिश कर रहे हैं। अब, उनके पास एक ऐसी पाठ्यपुस्तक है जिसे एक सुपर-इंटेलिजेंट संपादक द्वारा प्रूफरीड किया गया है और एक सख्त न्यायाधीश द्वारा सत्यापित किया गया है।

यह नया डेटासेट AI को निम्नलिखित में सक्षम बनाता है:

  1. स्विस जर्मन को बहुत बेहतर ढंग से समझना (सटीकता में 6 अंक का सुधार, जो इस क्षेत्र में बहुत बड़ा है)।
  2. लोगों और स्थानों के नामों को सही ढंग से पहचानना (वास्तविक दुनिया के उपयोग के लिए महत्वपूर्ण)।
  3. छोटे, अलग-थलग वाक्यों के बजाय लंबी, निरंतर बातचीत से सीखना।

संक्षेप में, लेखकों ने एक बिखरे हुए, कठिन उपयोग वाले डेटा के ढेर को लिया, उसे AI संपादकों और फिल्टरों के एक हाई-टेक कारखाने से गुजारा, और एक प्रीमियम उत्पाद तैयार किया जो कंप्यूटर को अंततः स्विस जर्मन "बोलने" में मदद करेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →