← नवीनतम पेपर
💬 NLP

LLM StructCore: Schema-Guided Reasoning Condensation and Deterministic Compilation

यह शोध पत्र LLM StructCore प्रस्तुत करता है, जो एक दो-चरणीय, स्कीमा-निर्देशित ढांचा है जो 134-आइटम वाले क्लिनिकल केस रिपोर्ट फॉर्म भरने के चुनौतीपूर्ण कार्य को एक भाषा-अज्ञेय (language-agnostic) LLM-आधारित रीजनिंग सारांश और उसके बाद एक नियत (deterministic) कंपाइलर में विभाजित करता है, जो शोर (noise) और सख्त आउटपुट बाधाओं को प्रभावी ढंग से प्रबंधित करते हुए CL4Health 2026 डिस्पनिया (Dyspnea) चुनौती पर मजबूत प्रदर्शन प्राप्त करता है।

मूल लेखक: Serhii Zabolotnii

प्रकाशित 2026-04-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Serhii Zabolotnii

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक डॉक्टर हैं जो एक बिखरे हुए, हाथ से लिखे गए मरीज के नोट के आधार पर एक विशाल, 134-प्रश्नों वाला बीमा फॉर्म (एक केस रिपोर्ट फॉर्म) भरने की कोशिश कर रहे हैं। वह नोट स्लैंग, संक्षिप्त शब्दों और अधूरी जानकारियों से भरा है। यदि आप गलत अनुमान लगाते हैं, तो बीमा कंपनी पूरे फॉर्म को खारिज कर देगी। यदि आप उन चीजों को खाली छोड़ देते हैं जिन्हें भरना चाहिए था, तो आपको दंडित किया जाएगा।

यह पेपर एक चतुर दो-चरणीय प्रणाली जिसे LLM StructCore कहा जाता है, का वर्णन करता है जो काम को एक "रचनात्मक विचारक" और एक "सख्त रोबोट" के बीच विभाजित करके इस समस्या को हल करता है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है:

समस्या: "134-आइटम का दुस्वप्न"

आमतौर पर, लोग एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) से एक नोट पढ़ने और एक साथ सभी 134 बॉक्स भरने के लिए कहते हैं।

  • समस्या: AI भ्रमित हो जाता है। यह तथ्य गढ़ सकता है (हैलुसिनेशन), फॉर्मेटिंग बिगाड़ सकता है, या इस बात को भूल सकता है कि कोई विशिष्ट आइटम "अज्ञात" (unknown) है।
  • परिणाम: फॉर्म खारिज कर दिया जाता है क्योंकि AI बहुत अधिक रचनात्मक होने की कोशिश करता है।

समाधान: "आर्किटेक्ट और बिल्डर"

लेखकों ने महसूस किया कि उन्हें सोचने और नियमों का पालन करने को अलग करने की आवश्यकता है। उन्होंने एक दो-चरणीय पाइपलाइन बनाई:

चरण 1: "कार्यकारी सहायक" (रचनात्मक विचारक)

AI से 134 बॉक्स भरने के लिए कहने के बजाय, वे उससे एक बहुत सरल काम करने के लिए कहते हैं: मरीज की कहानी को केवल 9 श्रेणियों में सारांशित करना।

  • उपमा: कल्पना कीजिए कि एक व्यस्त CEO (AI) है जो 100 पन्नों की रिपोर्ट से परेशान है। CEO को एक स्प्रेडशीट भरने के लिए कहने के बजाय, आप उनसे अपने सहायक को भेजने के लिए 9-बुलेट पॉइंट वाला एक ईमेल लिखने के लिए कहते हैं।
    • बुलेट 1: मरीज कौन है? (डेमोग्राफिक्स)
    • बुलेट 2: उनके वाइटल साइन्स क्या हैं? (वाइटल्स)
    • बुलेट 3: कौन से लैब टेस्ट हुए? (लैब्स)
    • ...और इसी तरह 9 श्रेणियों के लिए।
  • ट्रिक: AI को कड़ाई से ईमानदार रहने के लिए कहा जाता है। यदि नोट में किसी चीज़ का उल्लेख नहीं है, तो AI को "Unknown" लिखना होगा। वह अनुमान नहीं लगाता। वह बस बिखरे हुए नोट को एक साफ, संरचित सारांश में बदल देता है।
  • यह क्यों काम करता है: क्योंकि AI को 134 विशिष्ट बॉक्स के बजाय केवल 9 बकेट (buckets) को प्रबंधित करना होता है, वह शायद ही कभी गलतियाँ करता है। यह एक शेफ से "सामग्री की सूची बनाने" के लिए कहने जैसा है, न कि "पूरा भोजन पूरी तरह से पकाने" के लिए।

चरण 2: "सख्त रोबोट" (डिटरमिनिस्टिक कंपाइलर)

एक बार जब AI अपना 9-बुलेट सारांश पूरा कर लेता है, तो एक मानक कंप्यूटर कोड (कोई AI नहीं) कार्यभार संभाल लेता है।

  • उपमा: कल्पना कीजिए कि एक सख्त फैक्ट्री रोबोट है जिसे CEO का 9-बुलेट वाला ईमेल प्राप्त होता है। उसका काम उन 9 बिंदुओं को अंतिम 134-बॉक्स वाले फॉर्म में अनुवादित करना है।
  • यह कैसे काम करता है:
    1. अनुवाद: यह पढ़ता है "Heart rate: 105 bpm (fast)" और स्वचालित रूप से "Heart Rate" वाले बॉक्स में "Tachycardic" (आधिकारिक चिकित्सा शब्द) भर देता है।
    2. तथ्य-जांच (Fact-Checking): इसके पास एक नियम पुस्तिका है। यदि CEO के नोट में "इतिहास में कैंसर" (History of cancer) लिखा है, लेकिन रोबोट देखता है कि शब्द "स्क्रीनिंग" या "पारिवारिक इतिहास" (family history) है, तो वह जानता है कि "सक्रिय कैंसर" (Active Cancer) वाले बॉक्स को नहीं भरना है। यह गलत अलार्म को रोकने के लिए एक सुरक्षा द्वार के रूप में कार्य करता है।
    3. रिक्त स्थानों को भरना: यदि CEO के सारांश में किसी विशिष्ट आइटम का उल्लेख नहीं किया गया था, तो रोबोट स्वचालित रूप से इसे "Unknown" के रूप में चिह्नित कर देता है (जो कि गायब जानकारी के लिए सही उत्तर है)।
  • यह क्यों महान है: रोबोट कभी थकते नहीं हैं, कभी भ्रमित (hallucinate) नहीं होते, और हमेशा नियमों का सटीक पालन करते हैं। यदि इनपुट समान है, तो आउटपुट हमेशा समान होता है।

यह एक बड़ी बात क्यों है

  1. यह भाषा-निरपेक्ष (Language-Agnostic) है: "कार्यकारी सहायक" (चरण 1) अंग्रेजी, इतालवी या किसी भी भाषा में नोट पढ़ सकता है। "रोबोट" (चरण 2) बस अवधारणाओं को आधिकारिक फॉर्म में अनुवादित करता है। यह सिस्टम इतालवी नोट्स के लिए उतना ही अच्छा काम करता जितना कि अंग्रेजी के लिए, बिना पुन: प्रोग्राम किए।
  2. यह छोटे कंप्यूटरों पर काम करता है: क्योंकि AI को केवल 9 श्रेणियों का आसान सारांश बनाने का काम करना है, आपको इसे चलाने के लिए बहुत महंगे, विशाल कंप्यूटर की आवश्यकता नहीं है। आप इसे लैपटॉप या स्थानीय सर्वर पर भी चला सकते हैं, जो उन अस्पतालों के लिए बेहतरीन है जो रोगी डेटा को क्लाउड पर भेजने के बजाय निजी रखना चाहते हैं।
  3. यह विश्वसनीय है: प्रतियोगिता में, इस सिस्टम ने 0.63 (1.0 में से) का स्कोर प्राप्त किया, जो विजेता के बहुत करीब था। सबसे अच्छी बात यह है कि यह सिस्टम 100% पुनरुत्पादनीय (reproducible) है। यदि आप इसे फिर से चलाते हैं, तो आपको बिल्कुल वही परिणाम मिलता है।

निष्कर्ष

यह पेपर हमें सिखाता है कि जटिल, उच्च-जोखिम वाले कार्यों के साथ काम करते समय, AI से एक साथ सब कुछ करने के लिए न कहें।

  • AI को रचनात्मक सारांशकर्ता (चरण 1) बनने दें।
  • कोड को सख्त नियम-पालक (चरण 2) बनने दें।

काम को विभाजित करके, उन्होंने एक अराजक, त्रुटि-पूर्ण प्रक्रिया को एक स्वच्छ, विश्वसनीय मशीन में बदल दिया जो उच्च सटीकता के साथ चिकित्सा फॉर्म भरती है और इसमें कोई भ्रम (hallucinations) नहीं होता।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →