← नवीनतम पेपर
💬 NLP

MedFabric and EtHER: A Data-Centric Framework for Word-Level Fabrication Generation and Detection in Medical LLMs

यह शोध पत्र MedFabric को प्रस्तुत करता है, जो यथार्थवादी शब्द-स्तरीय चिकित्सा फैब्रिकेशन्स (fabrications) उत्पन्न करने के लिए एक डेटा-केंद्रित पाइपलाइन है, और ETHER को, जो इस डेटासेट का लाभ उठाकर मेडिकल LLM आउटपुट्स के भीतर सूक्ष्म तथ्यात्मक विचलन की पहचान करने में मौजूदा अत्याधुनिक विधियों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Tung Sum Thomas Kwok, Qian Qian, Xiaofeng Lin, Dongxu Zhang, Jun Han, Zhichao Yang, Davin Hill, Tamer Soliman, Sanjit Singh Batra, Robert Tillman, Guang Cheng

प्रकाशित 2026-05-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tung Sum Thomas Kwok, Qian Qian, Xiaofeng Lin, Dongxu Zhang, Jun Han, Zhichao Yang, Davin Hill, Tamer Soliman, Sanjit Singh Batra, Robert Tillman, Guang Cheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान रोबोट सहायक है जो चिकित्सा सलाह लिख सकता है। यह आत्मविश्वास से बोलने और भारी-भरकम शब्दों का सही उपयोग करने में माहिर है। लेकिन कभी-कभी, यह आत्मविश्वास के साथ गलत बातें भी बना देता है। चिकित्सा की दुनिया में, यह खतरनाक है। यदि रोबोट कहता है कि एक दवा किसी बीमारी को ठीक करती है जबकि वह नहीं करती, तो यह एक "गढ़ंत सूचना" (fabrication) है।

यह शोध पत्र इन विशिष्ट प्रकार के झूठ को पकड़ने के लिए एक नया सिस्टम पेश करता है, जिसे EtHER कहा जाता है, और इसे सिखाने के लिए एक नया प्रशिक्षण मैदान, जिसे MedFabric कहा जाता है।

यहाँ इसे बनाने की कहानी सरल भाषा में दी गई है:

समस्या: "शैली" का जाल (The "Style" Trap)

लेखकों ने देखा कि रोबोट के झूठ को पकड़ने के पिछले प्रयासों में एक बड़ी खामी थी। वे सुरक्षा गार्डों की तरह थे जो केवल व्यक्ति के कपड़ों को देखते थे, उसके आईडी कार्ड को नहीं।

  • पुराना तरीका: जब शोधकर्ता परीक्षण करने के लिए नकली चिकित्सा उत्तर बनाते थे, तो वे लिखने की शैली को बहुत अधिक बदल देते थे। नकली उत्तर रोबोटिक और अजीब लगते थे, जबकि असली उत्तर मानवीय लगते थे।
  • गलती: डिटेक्टरों (detectors) ने वास्तविक झूठ को पहचानने के बजाय "रोबोटिक शैली" को पहचानना सीख लिया। वे किसी उत्तर को केवल इसलिए गलत घोषित कर देते थे क्योंकि वह सुनने में अजीब था, लेकिन वे उस नकली उत्तर को पकड़ने में विफल रहे जो सुनने में बिल्कुल सटीक लग रहा था।
  • परिणाम: जब रोबोट ने ऐसा झूठ लिखा जो शैली के मामले में बिल्कुल इंसान जैसा था (वही वाक्य संरचना, वही लहजा), तो डिटेक्टर भ्रमित हो गए और विफल रहे।

समाधान भाग 1: MedFabric (द "परफेक्ट फोर्जर")

इसे ठीक करने के लिए, लेखकों ने एक नया प्रशिक्षण डेटासेट बनाया जिसे MedFabric कहा जाता है। इसे एक जासूसी फिल्म के मास्टर फोर्जर (नकली बनाने वाले) के रूप में समझें।

  1. चरण 1: शैली परिवर्तन (The Style Shift): उन्होंने वास्तविक, मानव-लिखित चिकित्सा तथ्यों को लिया और एक AI से उन्हें फिर से लिखने के लिए कहा। लक्ष्य अर्थ बदलना नहीं था, बल्कि मानव पाठ को ठीक वैसा ही बनाना था जैसा AI की स्वाभाविक लेखन शैली होती है। अब, "असली" और "नकली" उत्तर शैली के मामले में बिल्कुल एक जैसे दिखते हैं।
  2. चरण 2: सूक्ष्म झूठ (The Subtle Lie): इसके बाद, उन्होंने AI से उस पुनर्गठित पाठ के आधार पर एक झूठ बनाने के लिए कहा। लेकिन यहाँ चाल यह थी कि झूठ बहुत छोटा होना चाहिए। यह कोई पूरी नई कहानी नहीं थी; यह केवल एक या दो शब्द बदलने जैसा था।
    • असली: "यह दवा चूहों (mice) पर काम करती है।"
    • नकली: "यह दवा रैट्स (rats) पर काम करती है।"
  3. चरण 3: गुणवत्ता जांच (The Quality Check): उन्होंने यह सुनिश्चित करने के लिए एक सख्त फिल्टर का उपयोग किया कि नकली उत्तर असली के इतना समान हो कि एक इंसान भी उसे तुरंत नोटिस न कर सके।

परिणाम स्वरूप MedFabric प्राप्त हुआ: ऐसे चिकित्सा वाक्यों का संग्रह जहाँ "सत्य" और "झूठ" जुड़वा भाई-बहन हैं। वे दिखने, सुनने और महसूस करने में एक जैसे हैं, सिवाय एक सूक्ष्म तथ्यात्मक त्रुटि के।

समाधान भाग 2: EtHER (द "वर्ड-लेवल डिटेक्टिव")

अब जब उनके पास ये ट्रिकी "जुड़वा" वाक्य थे, तो उन्हें एक ऐसे जासूस की आवश्यकता थी जो शैली से न धोखा खाए। उन्होंने EtHER (इवैलुएट हॉलुसिनेशन विद टेबल डिकंपोजिशन एंड वर्ड मास्किंग) बनाया।

पूरे पैराग्राफ को पढ़कर अनुमान लगाने के बजाय, EtHER इस समस्या को तीन चरणों में तोड़ देता है, जैसे कि एक फोरेंसिक अकाउंटेंट करता है:

  1. Text2Table (द ऑर्गनाइज़र):
    कल्पना कीजिए कि चिकित्सा पाठ कागजों का एक बिखरा हुआ ढेर है। EtHER इस ढेर को एक व्यवस्थित स्प्रेडशीट (टेबल) में छाँट देता है। यह विशिष्ट तथ्यों (जैसे "दवा X" और "चूहों पर काम करती है") को निकालता है और उन्हें अपने अलग बॉक्स में रखता है। यह डिटेक्टर को फैंसी वाक्य संरचनाओं से विचलित होने से रोकता है।

  2. वर्ड मास्किंग और फिलिंग (द पज़ल):
    EtHER उन व्यवस्थित बॉक्सों को लेता है और एक "खाली स्थान भरो" खेल खेलता है। यह एक शब्द को ढंक देता है (जैसे "Mice") और AI से पूछता है कि एक विश्वसनीय चिकित्सा डेटाबेस के आधार पर वहाँ कौन सा शब्द होना चाहिए।

    • यदि मूल वाक्य में "Rats" (झूठ) था, लेकिन डेटाबेस कहता है "Mice", तो AI खाली स्थान को "Mice" से भरने की कोशिश करेगा।
    • जब EtHER मूल झूठ ("Rats") की तुलना भरे हुए सच ("Mice") से करता है, तो अंतर स्पष्ट हो जाता है।
  3. हाइब्रिड इवैल्यूएशन (द डबल चेक):
    अंत में, EtHER अंतिम निर्णय लेने के लिए दो उपकरणों का उपयोग करता है:

    • मैथ टूल (गणित का उपकरण): यह शब्दों के बीच की दूरी को गणित (एम्बेडिंग्स) का उपयोग करके मापता है ताकि यह देखा जा सके कि वे अलग हैं या नहीं।
    • ब्रेन टूल (मस्तिष्क का उपकरण): यह एक स्मार्ट AI से तर्क करने के लिए कहता है कि अंतर क्या है।
      इन दोनों को मिलाकर, EtHER उस "रैंडम गेसिंग" (तुक्का लगाने) से बचता है जो तब होता है जब आप केवल एक बार AI से सवाल पूछते हैं।

परिणाम: यह क्यों मायने रखता है

लेखकों ने अपने नए "जुड़वा" डेटासेट (MedFabric) का उपयोग करके अन्य शीर्ष डिटेक्टरों के मुकाबले EtHER का परीक्षण किया।

  • पुराने डिटेक्टर: जब झूठ सूक्ष्म (उच्च समानता वाले) थे, तो पुराने डिटेक्टर बुरी तरह विफल रहे, और उनकी सटीकता 50% से नीचे गिर गई (जो कि लगभग तुक्का लगाने के बराबर है)। वे अभी भी "कपड़ों" (शैली) को देख रहे थे, न कि "आईडी" (तथ्यों) को।
  • EtHER: क्योंकि EtHER ने विशिष्ट शब्दों और तथ्यों को देखा, वह मजबूत बना रहा। इसने मौजूदा सर्वश्रेष्ठ डिटेक्टरों से 15% से अधिक बेहतर प्रदर्शन किया।

संक्षेप में: यह शोध पत्र तर्क देता है कि एक स्मार्ट झूठे को पकड़ने के लिए, आप केवल यह नहीं देख सकते कि वे कैसे बात करते हैं। आपको एक ऐसा सिस्टम बनाना होगा जो उनके वाक्यों को व्यक्तिगत शब्दों में तोड़ दे और उन्हें एक-एक करके तथ्यों के साथ जाँचे। EtHER बिल्कुल यही करता है, एक ऐसे डेटासेट (MedFabric) का उपयोग करके जो सिस्टम को यह कौशल सीखने के लिए मजबूर करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →