SciMIF: Understanding Multimodal Instruction Following in Scientific Domains
यह शोधपत्र SciMIF को प्रस्तुत करता है, जो एक नवीन बेंचमार्क है जिसमें जटिल वैज्ञानिक निर्देशों पर मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए एक व्यापक वर्गीकरण और उच्च-सटीकता वाली डेटा पाइपलाइन शामिल है, जो विभिन्न विषयों में प्रदर्शन के महत्वपूर्ण अंतरों को प्रकट करता है और मॉडल के बढ़ते पैमाने के बावजूद सूक्ष्म बाधाओं का पालन करने में वर्तमान सीमाओं को उजागर करता है।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: SciMIF
समस्या विवरण
वैज्ञानिक क्षेत्रों में मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) का अनुप्रयोग बुनियादी प्रश्न-उत्तर से विकसित होकर जटिल प्रतिमानों जैसे कि स्वायत्त वैज्ञानिक एजेंटों तक पहुँच गया है। हालाँकि, वर्तमान मूल्यांकन विधियाँ मुख्य रूप से वैज्ञानिक शुद्धता (क्या अंतिम उत्तर तथ्यात्मक रूप से सटीक है) पर ध्यान केंद्रित करती हैं, न कि निर्देश अनुपालन (क्या मॉडल स्पष्ट परिचालन बाधाओं को पूरा करता है) पर।
मौजूदा सामान्य-उद्देश्य वाले निर्देश-अनुपालन बेंचमार्क (जैसे, IF-Eval, FollowBench) प्रारूप, लंबाई और शैली पर बाधाओं का आकलन करते हैं लेकिन उनमें डोमेन-विशिष्ट वैज्ञानिक बाधाओं का अभाव है। इसके विपरीत, मौजूदा वैज्ञानिक बेंचमार्क (जैसे, SciBench, MMMU) तर्क और ज्ञान का मूल्यांकन करते हैं लेकिन जटिल, बहु-चरणीय परिचालन निर्देशों का पालन करने की मॉडल की क्षमता का व्यवस्थित रूप से परीक्षण नहीं करते हैं। यह अंतराल दो विशिष्ट क्षमताओं को अस्पष्ट करता है: एक मॉडल अनुरोधित इकाइयों या प्रारूपों का उल्लंघन करते हुए भी वैज्ञानिक रूप से सही उत्तर दे सकता है, या वह वैध वैज्ञानिक तर्क पर निर्भर रहते हुए भी एक प्रारूप का सख्ती से पालन कर सकता है। इसके अलावा, वैज्ञानिक निर्देश अनुपालन डोमेन-विशिष्ट ज्ञान, अंतरविषयक विविधताओं (interdisciplinary variations) और मल्टीमॉडल इनपुट (जैसे, आणविक संरचनाएं, माइक्रोस्कोपी चित्र) पर अपनी निर्भरता के कारण अद्वितीय रूप से चुनौतीपूर्ण है।
कार्यप्रणाली
1. वैज्ञानिक बाधाओं का वर्गीकरण (Taxonomy)
लेखक SciMIF (साइंटिफिक मल्टीमॉडल इंस्ट्रक्शन फॉलोइंग) प्रस्तुत करते हैं, जो केमिस्ट्री, भूगोल, जीव विज्ञान, सामग्री विज्ञान (Materials Science) और भौतिकी जैसे पाँच वैज्ञानिक विषयों में MLLMs का मूल्यांकन करने के लिए डिज़ाइन किया गया एक बेंचमार्क है।
इन विषयों के 22 विशिष्ट कार्यों के विश्लेषण के आधार पर, लेखकों ने एक पदानुक्रमित वर्गीकरण (hierarchical taxonomy) बनाया है जिसमें शामिल हैं:
- 10 कार्यात्मक बाधा समूह (Functional Constraint Groups): ये डोमेनों में साझा आवश्यकताओं को कैप्चर करते हैं, जिनमें प्रक्रिया (Procedure), संख्या (Number), विधि (Method), इकाई (Unit), प्रारूप (Format), शब्दावली (Terminology), परिशुद्धता (Precision), अक्षर (Letter), संरचना (Structure), और चयन (Selection) शामिल हैं।
- विषय-विशिष्ट इंस्टेंशिएशन (Discipline-Specific Instantiations): जबकि कार्यात्मक समूह साझा हैं, उनके ठोस अर्थ भिन्न होते हैं। उदाहरण के लिए, केमिस्ट्री में एक "शब्दावली" बाधा वैध आणविक नामकरण की आवश्यकता रखती है, भूगोल में पदानुक्रमित पते (hierarchical addresses) की, और सामग्री विज्ञान में लक्षण वर्णन तकनीकों (characterization techniques) की।
- बाधा सूची (Constraint Inventory): अंतिम बेंचमार्क में 10 समूहों से प्राप्त 42 विशिष्ट बाधाएं शामिल हैं, जिन्हें प्रत्येक विषय की परंपराओं के अनुकूल बनाया गया है।
2. डेटा निर्माण पाइपलाइन
SciMIF को चार-चरणीय पाइपलाइन के माध्यम से 13 मौजूदा वैज्ञानिक डेटासेट्स (कुल 2,527 नमूने) को व्यवस्थित रूप से संवर्धित करके बनाया गया है:
- सीड तैयारी (Seed Preparation): एक प्रश्न (), वैकल्पिक दृश्य इनपुट (), संदर्भ उत्तर (), और कार्य प्रकार () वाले नमूनों का चयन करना।
- बाधा पहचान (Constraint Recognition): रेडंडेंसी (दोहराव) से बचने के लिए मूल क्वेरी में पहले से ही निहित बाधाओं की पहचान करना।
- बाधा इंजेक्शन (Constraint Injection):
- वैज्ञानिक बाधाएं: कार्य प्रकार के अनुकूल डोमेन-विशिष्ट बाधाओं को इंजेक्ट करना।
- सामान्य बाधाएं: संदर्भ उत्तर की वैज्ञानिक शुद्धता को बदले बिना सामान्य परिचालन बाधाओं (जैसे, आउटपुट प्रारूप, कैपिटलाइजेशन) को इंजेक्ट करना।
- सत्यापन: एक स्वचालित डबल-चेक यह सुनिश्चित करता है कि इंजेक्ट की गई बाधा क्वेरी में मौजूद है और ग्राउंड-ट्रुथ उत्तर वैध बना हुआ है।
- मानवीय सत्यापन (Human Verification): दो एनोटेटर्स तार्किक सुसंगतता, प्रवाह और बाधा निष्ठा (fidelity) के लिए नमूनों की समीक्षा करते हैं। समस्याग्रस्त नमूनों को संशोधित या हटा दिया जाता है।
3. मूल्यांकन मेट्रिक्स
बेंचमार्क प्रदर्शन का आकलन करने के लिए तीन मेट्रिक्स का उपयोग करता है:
- बाधा संतुष्टि दर (Constraint Satisfaction Rate - CSR): सभी निर्देशों में संतुष्ट बाधाओं का औसत अनुपात।
- निर्देश संतुप्ति दर (Instruction Satisfaction Rate - ISR): उन निर्देशों का अनुपात जहाँ सभी संबंधित बाधाएं पूरी तरह से संतुष्ट होती हैं।
- विघटित आवश्यकता अनुपालन अनुपात (Decomposed Requirements Following Ratio - DRFR): कुल बाधाओं की संख्या में व्यक्तिगत विघटित आवश्यकताओं के स्तर पर अनुपालन को मापता है।
सत्यापन के लिए स्क्रिप्ट-आधारित विधियों (प्रारूप और इकाइयों जैसे नियतात्मक चेक के लिए) और LLM-एज़-ए-जज प्रोटोकॉल (तर्क चरणों जैसे सिमेंटिक चेक के लिए) का उपयोग किया जाता है।
मुख्य परिणाम
1. विषयों के बीच प्रदर्शन में असमानता
स्टेट-ऑफ-द-आर्ट क्लोज्ड-सोर्स (जैसे, GPT-5.2, Claude-Sonnet-4.6) और ओपन-सोर्स (जैसे, Qwen3.5, InternVL3.5) मॉडल्स के मूल्यांकन से महत्वपूर्ण भिन्नता का पता चलता है:
- केमिस्ट्री सबसे बड़ी चुनौती पेश करती है, जिसमें उच्चतम प्रदर्शन करने वाला मॉडल (GPT-5.2) केवल 46.33% का ISR प्राप्त करता है।
- जीव विज्ञान और सामग्री विज्ञान उच्च प्रदर्शन (ISR ~72–78%) दिखाते हैं।
- भूगोल भी स्थानिक पदानुक्रम (spatial hierarchies) के कारण महत्वपूर्ण कठिनाइयाँ प्रस्तुत करता है।
- भौतिकी आम तौर पर उच्चतम DRFR स्कोर (92.2% औसत) देता है।
2. मॉडल स्केल और आर्किटेक्चर
- स्केलिंग विरोधाभास (Scaling Paradox): मॉडल पैरामीटर्स बढ़ाने से निर्देश अनुपालन में रैखिक सुधार नहीं होता है। उदाहरण के लिए, Qwen3.5 श्रृंखला में, 122B मॉडल ने 27B मॉडल (51.37% ISR) की तुलना में थोड़ा खराब प्रदर्शन (50.41% ISR) किया।
- क्लोज्ड बनाम ओपन सोर्स: क्लोज्ड-सोर्स मॉडल सभी विषयों में ओपन-सोर्स समकक्षों की तुलना में लगातार बेहतर प्रदर्शन करते हैं, जो डेटा गुणवत्ता और अलाइनमेंट रणनीतियों में लाभ का सुझाव देते हैं।
3. बाधा डोमेन विश्लेषण
- सामान्य बनाम वैज्ञानिक बाधाएं: मॉडल सामान्य बाधाओं (फॉर्मेटिंग/स्ट्रक्चर) की तुलना में वैज्ञानिक बाधाओं (जो कार्य से सिमेंटिक रूप से जुड़ी हैं) पर काफी बेहतर प्रदर्शन करते हैं। GPT-5.2 के लिए, वैज्ञानिक बाधाओं पर DRFR 88.74% था बनाम सामान्य बाधाओं पर 74.65%।
- सूक्ष्म चुनौतियाँ (Fine-Grained Challenges): मॉडल अक्षर (Letter) और संख्या (Number) बाधाओं के साथ सबसे अधिक संघर्ष करते हैं, जिसके लिए सटीक प्रतीकात्मक प्रसंस्करण और डोमेन-विशिष्ट एंटिटी रिकग्निशन (जैसे, रासायनिक बंधों को गिनना बनाम पात्रों को गिनना) की आवश्यकता होती है।
4. शुद्धता बनाम अनुपालन
एक महत्वपूर्ण निष्कर्ष वैज्ञानिक शुद्धता और निर्देश अनुपालन के बीच कमजोर जुड़ाव है:
- केवल ~30% नमूनों ने वैज्ञानिक शुद्धता और पूर्ण निर्देश अनुपालन दोनों प्राप्त किए (सही और पालन किया गया)।
- लगभग 20% नमूने वैज्ञानिक रूप से सही थे लेकिन बाधाओं का उल्लंघन करते थे (सही लेकिन उल्लंघन किया गया)।
- 30% से अधिक नमूनों ने निर्देशों का पालन किया लेकिन गलत वैज्ञानिक उत्तर दिए (गलत लेकिन पालन किया गया)।
- सांख्यिकीय विश्लेषण (पियर्सन टेस्ट) पुष्टि करता है कि हालांकि शुद्धता और अनुपालन सकारात्मक रूप से जुड़े हुए हैं, इस जुड़ाव की शक्ति मामूली ( गुणांक 0.06 से 0.20 के बीच) है, जो दर्शाता है कि वे अलग-अलग क्षमताएं हैं।
महत्व और योगदान
पेपर तीन प्राथमिक योगदानों का दावा करता है:
- विशेषज्ञ-व्युत्पन्न वर्गीकरण (Expert-Derived Taxonomy): पाँच विषयों और दस कार्यात्मक समूहों में फैले वैज्ञानिक बाधाओं का एक व्यापक वर्गीकरण स्थापित करना, जो साझा क्षमताओं और डोमेन-विशिष्ट आवश्यकताओं दोनों को कैप्चर करता है।
- स्केलेबल फ्रेमवर्क: मौजूदा वैज्ञानिक कार्यों को निर्देश-अनुपालन मूल्यांकन में बदलने की एक पद्धति, जो संदर्भ उत्तरों को बदले बिना निहित बाधाओं को पहचानती है और संगत बाधाओं को इंजेक्ट करती है।
- बेंचमार्क और मूल्यांकन: SciMIF का निर्माण और प्रतिनिधि MLLMs का मूल्यांकन, जो प्रकट करता है:
- प्रदर्शन में पर्याप्त विषयगत भिन्नता।
- सूक्ष्म बाधाओं के साथ गंभीर कठिनाइयाँ।
- वैज्ञानिक शुद्धता और निर्देश अनुपालन के बीच एक स्पष्ट अंतर।
लेखक निष्कर्ष निकालते हैं कि वर्तमान MLLMs सख्त परिचालन बाधाओं की आवश्यकता वाले कठोर वैज्ञानिक अनुप्रयोगों के लिए अभी तक विश्वसनीय नहीं हैं। वे सुझाव देते कि भविष्य के अनुसंधान को डोमेन-अवेयर इंस्ट्रक्शन अलाइनमेंट, सूक्ष्म बाधाओं के लिए बाहरी उपकरणों (जैसे, सिम्बोलिक इंजन) को एकीकृत करने, और शुद्धता एवं अनुपालन को अलग-अलग मानने के बजाय संयुक्त रूप से प्राप्त करने के लिए अनुकूलित करने पर ध्यान केंद्रित करना चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।