← नवीनतम पेपर
💬 NLP

RECOVER: Robust Entity Correction via agentic Orchestration of hypothesis Variants for Evidence-based Recovery

यह शोध पत्र RECOVER को प्रस्तुत करता है, जो एक एजेंटिक फ्रेमवर्क है जो दुर्लभ और डोमेन-विशिष्ट एंटिटी त्रुटियों को मजबूती से सुधारने के लिए कई ASR परिकल्पनाओं और टूल-उपयोग करने वाले LLMs का लाभ उठाता है, जिससे विविध डेटासेट्स में एंटिटी रिकॉल और वर्ड एरर रेट में महत्वपूर्ण सुधार प्राप्त होता है।

मूल लेखक: Abhishek Kumar, Aashraya Sachdeva

प्रकाशित 2026-03-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abhishek Kumar, Aashraya Sachdeva

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं एक जासूस के रूप में, लेकिन आपका एकमात्र गवाह एक बहुत तेज़, बहुत आत्मविश्वासी, लेकिन थोड़ी कम सुनने वाला सहायक है जिसका नाम Whisper है।

Whisper सुनता है कि क्या बातचीत हो रही है और जो उसे सुनाई देता है उसे लिख देता है। आमतौर पर, वह बहुत अच्छा काम करता है। लेकिन जब बात विशिष्ट, कठिन नामों की आती है—जैसे कि कोई दुर्लभ दवा, कोई स्टॉक टिकर, या किसी पायलट का कॉल साइन—तो Whisper अक्सर उन्हें गलत समझ लेता है। वह "cytiva" को "sitiva" समझ सकता है या पूरा शब्द ही छोड़ सकता है। वित्त (finance) या चिकित्सा (medicine) जैसे क्षेत्रों में, इन नामों को गलत समझना सिर्फ एक टाइपिंग की गलती नहीं है; यह एक आपदा है।

यह पेपर RECOVER को पेश करता है, जो एक नया "सुपर-डिटेक्टिव" दल है जिसे पूरी कहानी को फिर से लिखे बिना Whisper की गलतियों को ठीक करने के लिए डिज़ाइन किया गया है।

यहाँ बताया गया है कि RECOVER कैसे काम करता है, जिसे सरल चरणों और कुछ रचनात्मक उपमाओं (analogies) में विभाजित किया गया है:

1. "बहु-अनुमान" रणनीति (Multi-Hypothesis Generation)

आमतौर पर, Whisper आपको केवल एक संस्करण देता है कि क्या कहा गया था। RECOVER अधिक स्मार्ट है। यह Whisper से एक ही ऑडियो को पाँच बार सुनने के लिए कहता है, लेकिन हर बार, यह Whisper को थोड़ा "ढीला" या अधिक रचनात्मक होने के लिए कहता है।

  • उपमा: कल्पना कीजिए कि पाँच अलग-अलग दोस्तों से एक अस्पष्ट वाक्य को ट्रांसक्राइब करने के लिए कहना।
    • दोस्त A ने "Cytiva" सुना।
    • दोस्त B ने "Sitiva" सुना।
    • दोस्त C ने "Cytiva" स्पष्ट रूप से सुना।
    • दोस्त D ने "Sativa" सुना।
    • दोस्त E ने "Cytiva" सुना।

भले ही वे असहमत हों, लेकिन तथ्य यह है कि उनके अनुमानों में से कुछ ने सही पकड़ा है, तो RECOVER के पास एक सुराग मिलता है। यदि सही उत्तर कम से कम एक अनुमान में मौजूद है, तो RECOVER के पास उसे खोजने का मौका होता है।

2. "वांटेड पोस्टर" खोज (Dynamic Entity Retrieval)

RECOVER जानता है कि बातचीत में कौन से नाम होने चाहिए (जैसे कि 6,000 दवाओं की सूची या 400 पायलट कॉल साइन)। यह बेतरतीब ढंग से अनुमान नहीं लगाना चाहता; यह ऑडियो को "वांटेड पोस्टर" से मिलाना चाहता है।

  • उपमा: इसे एक क्लब के बाउंसर की तरह सोचें। बाउंसर के पास वीआईपी (VIP) की एक सूची होती है। जब कोई अंदर आने की कोशिश करता है, तो बाउंसर केवल उसके चेहरे को नहीं देखता; वह यह भी जाँचता है कि क्या नाम एक वीआईपी जैसा सुनाई देता है, कैसा दिखता है, या स्पेलिंग में समान है या नहीं।
  • RECOVER, Whisper के पाँच अनुमानों को लेता है और उन्हें "वांटेड पोस्टर" सूची के विरुद्ध स्कैन करता है। यह उन शीर्ष 200 संभावित उम्मीदवारों को ढूंढता है जो सही नाम हो सकते हैं (उदाहरण के लिए, "sitiva" को "cytiva" से मिलाना, भले ही उनकी स्पेलिंग थोड़ी गलत हो)।

3. "एजेंटिक टीम" (तीन उपकरण)

यह RECORE का मुख्य हिस्सा है। एक अकेला रोबोट सब कुछ करने के बजाय, यह तीन विशिष्ट एजेंटों (उपकरणों) के एक दल का उपयोग करता है जो एक प्रोडक्शन क्रू की तरह मिलकर काम करते हैं:

  • उपकरण 1: संपादक (Fuse Hypotheses)

    • काम: यह तय करना कि पाँच अनुमानों में से सबसे अच्छा शुरुआती बिंदु कौन सा है।
    • कैसे: यह "वांटेड पोस्टर" सूची को देखता है। किस अनुमान में सबसे अधिक सही नाम हैं? यह उसी को चुनता है। या, यह एक बहुत ही स्मार्ट AI (LLM) का उपयोग करके सबसे अच्छे को चुन सकता है।
    • उपमा: एक फिल्म संपादक द्वारा पाँच अलग-अलग कैमरा एंगल से लिए गए बेहतरीन शॉट (take) को चुनना।
  • उपकरण 2: सुधारक (Propose Corrections)

    • काम: चुने हुए टेक्स्ट को देखता है और कहता है, "हे, यह शब्द गलत लग रहा है। चलिए इसे हमारी सूची के सही वीआईपी नाम से बदल देते हैं।"
    • शर्त: यह AI बहुत सख्त है। इसे केवल विशिष्ट नामों को बदलने की अनुमति है। यह व्याकरण को नहीं बदल सकता, लहजा (tone) नहीं बदल सकता, या नए शब्द नहीं बना सकता। यह एक स्पेल-चेकर की तरह है जो केवल संज्ञाओं (proper nouns) को ठीक करता है।
    • उपमा: एक सर्जन जो केवल एक विशिष्ट टूटी हुई हड्डी को ठीक करने के लिए अधिकृत है और बाकी शरीर को छूने से वर्जित है।
  • उपकरण 3: निरीक्षक (Verify & Apply)

    • काम: परिवर्तन को स्थायी बनाने से पहले सुधारक (Fixer) के काम की दोबारा जाँच करना।
    • नियम:
      1. क्या नया शब्द वास्तव में वीआईपी सूची में है?
      2. क्या सुधारक ने केवल कैपिटलाइजेशन (जैसे, "cytiva" को "Cytiva" में) बदला है? यदि हाँ, तो इसे अनदेखा करें।
      3. क्या नया शब्द वास्तव में पुराने वाले के समान है? (आप केवल इसलिए "Star" को "Cytiva" में नहीं बदल सकते क्योंकि आप बदलना चाहते हैं)।
    • उपमा: एक फैक्ट्री में गुणवत्ता नियंत्रण निरीक्षक। यदि सुधारक एक पेंच (screw) को केले से बदलने की कोशिश करता है, तो निरीक्षक हाथ मारकर कहता है, "नहीं, यह अनुमत नहीं है।"

यह एक बड़ी बात क्यों है?

अधिकांश पिछले तरीके या तो अनुमान लगाकर या स्पीच सिस्टम के भीतर जटिल गणित का उपयोग करके त्रुटियों को ठीक करने का प्रयास करते थे। लेकिन RECOVER विशेष है क्योंकि:

  1. यह एक "ब्लैक बॉक्स" सुधारक है: इसे यह जानने की आवश्यकता नहीं है कि Whisper अंदर से कैसे काम करता है। यह बस आउटपुट लेता है और उसे ठीक करता है। इसका मतलब है कि आप इसे किसी भी स्पीच सिस्टम के साथ उपयोग कर सकते हैं।
  2. यह मतिभ्रम (Hallucinations) को रोकता है: AI अक्सर चीजें बनाना पसंद करता है (मतिभ्रम)। "निरीक्षक" उपकरण और सख्त नियमों का उपयोग करके, RECOVER यह सुनिश्चित करता है कि AI केवल उन्हीं चीजों को ठीक करे जिनके बारे में वह आश्वस्त है।
  3. यह संकट टाल देता है: वित्त, चिकित्सा और एयर ट्रैफिक कंट्रोल में परीक्षणों के दौरान, RECOVER ने इन कठिन नामों में त्रुटियों को 8% से 46% तक कम कर दिया। इसने उन शब्दों को भी ढूँढ निकाला जो मूल टेक्स्ट में पूरी तरह से गायब थे और उन्हें ठीक किया, जबकि बाकी बातचीत को स्वाभाविक बनाए रखा।

निष्कर्ष

RECOVER एक अत्यधिक कुशल संपादक की तरह है जिसके पास सहायकों की एक टीम है। यह एक अव्यवस्थित ट्रांसक्रिप्ट को सुनता है, महत्वपूर्ण नामों की एक मास्टर सूची के साथ मिलान करता है, और सावधानीपूर्वक गलत नामों को सही नामों से बदल देता है—बिना बाकी कहानी को बिगाड़े। यह एक "ठीक-ठाक" ट्रांसक्रिप्शन को एक "परफेक्ट" ट्रांसक्रिप्शन में बदल देता है, विशेष रूप से उन शब्दों के लिए जो सबसे महत्वपूर्ण हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →