Using a Human-AI Teaming Approach to Create and Curate Scientific Datasets with the SCILIRE System
यह शोध पत्र SCILIRE को प्रस्तुत करता है, जो एक मानव-AI टीमिंग सिस्टम है जो शोधकर्ताओं को AI द्वारा निकाले गए वैज्ञानिक डेटा को पुनरावृत्ति के माध्यम से सत्यापित, सुधार और क्यूरेट करने में सक्षम बनाता है, जिससे निष्कर्षण की सटीकता (extraction fidelity) में सुधार होता है और कई डोमेन में कुशल डेटासेट निर्माण की सुविधा मिलती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक वैज्ञानिक हैं जो लाखों बिखरे हुए, अव्यवस्थित किताबों (वैज्ञानिक शोध पत्रों) से ज्ञान का एक विशाल, व्यवस्थित पुस्तकालय बनाने की कोशिश कर रहे हैं। अतीत में, आपको पेन और कागज लेकर बैठना पड़ता, हर एक किताब को पढ़ना पड़ता और मैन्युअल रूप से महत्वपूर्ण तथ्यों को एक स्प्रेडशीट में कॉपी करना पड़ता। यह धीमा, थका देने वाला और हजारों किताबों के लिए असंभव है।
हाल ही में, हमें एक सुपर-फास्ट रोबोट सहायक (AI) मिला है जो इन किताबों को पढ़ सकता है और हमारे लिए स्प्रेडशीट भर सकता है। लेकिन एक पेंच है: रोबोट थोड़ा अनाड़ी है। वह कभी-कभी चीजें मनगढ़ंत बना लेता है (hallucinations), विवरण छोड़ देता है, या जटिल तालिकाओं (tables) से भ्रमित हो जाता है। यदि आप केवल रोबोट को अकेले चलने देंगे, तो अंतिम स्प्रेडशीट गलतियों से भरी होगी।
SCILIRE एक नया सिस्टम है जिसे इस समस्या को ठीक करने के लिए डिज़ाइन किया गया है। यह केवल रोबोट को अकेले काम करने नहीं देता; यह मानव विशेषज्ञ और AI के बीच एक टीम बनाता है।
यहाँ बताया गया है कि SCILIRE कैसे काम करता है, कुछ सरल उपमाओं (analogies) का उपयोग करते हुए:
1. "पायलट" चरण: एक प्रशिक्षु (Apprentice) को प्रशिक्षित करना
कल्पना कीजिए कि आप एक नए प्रशिक्षु को एक विशिष्ट प्रकार के दुर्लभ सिक्के को छाँटने का प्रशिक्षण दे रहे हैं। आप उन्हें केवल सिक्कों का एक ट्रक भरकर नहीं देते और कहते "जाओ।"
- SCILIRE क्या करता है: आप AI को कागजों का एक छोटा, प्रबंधनीय ढेर (शायद 10) देकर शुरुआत करते हैं। AI डेटा निकालने की कोशिश करता है।
- मानव की भूमिका: आप, विशेषज्ञ, AI के काम को देखते हैं। आप कहते हैं, "नहीं, यह गलत है," या "वास्तव में, यह यह मान (value) है।" आप गलतियों को ठीक करते हैं।
- जादू: हर बार जब आप एक गलती सुधारते हैं, तो सिस्टम केवल आगे नहीं बढ़ता है। यह आपकी सुधार से सीखता है। यह आपके सुधार को एक "गोल्ड स्टैंडर्ड" उदाहरण के रूप में सहेज लेता है।
2. "डायनेमिक सैंपलिंग" का कमाल: एक स्मार्ट ट्यूटर
यही वह गुप्त सूत्र है जो SCILIRE को अन्य उपकरणों से अलग बनाता है।
- अन्य उपकरण: एक ऐसे ट्यूटर की कल्पना करें जो आपको हर बार वही उदाहरण प्रश्न देता है जब आप अटक जाते हैं, भले ही वह आपकी वर्तमान समस्या के लिए प्रासंगिक न हो।
- SCILIRE: एक ऐसे ट्यूटर की कल्पना करें जो आपकी विशिष्ट वर्तमान समस्या को देखता है, याद रखता है कि आपने पहले किस प्रकार की गलती की थी, और कहता है, "हे, याद है जब हमने उस दूसरे पेपर में इस तरह की समस्या को ठीक किया था? आइए उस उदाहरण का उपयोग इस एक को हल करने के लिए करने में मदद लें।"
- परिणाम: जैसे-जैसे आप अधिक डेटा को ठीक करते हैं, AI अगले बैच के लिए सही उत्तर का अनुमान लगाने में बेहतर होता जाता है, क्योंकि यह लगातार आपके अपने सुधारों से सबसे प्रासंगिक उदाहरणों को निकालता रहता है।
3. "बैच" चरण: एक असेंबली लाइन
एक बार जब AI ने अपने छोटे "पायलट" समूह से बारीकियां सीख ली हैं, तो आप बाकी लाइब्रेरी (हजारों पेपर) के लिए "Go" बटन दबाते हैं।
- क्योंकि AI को आपके विशिष्ट सुधारों पर प्रशिक्षित किया गया है, इसलिए अब यह अपने आप काम करने की तुलना में बहुत कम गलतियाँ करता है।
- आप अभी भी काम की जाँच करते हैं, लेकिन आप गलतियों को ठीक करने के बजाय अच्छे काम को सत्यापित करने में अधिक समय बिताते हैं।
4. "फ्लैशलाइट" फीचर: विश्वास करें लेकिन जाँचें भी
AI के साथ सबसे बड़ी आशंकाओं में से एक यह है कि यह नहीं जानना कि इसने एक उत्तर क्यों दिया।
- SCILIRE का समाधान: यह एक टॉर्च (flashlight) की तरह काम करता है। जब AI आपकी स्प्रेडशीट में एक सेल भरता है, तो यह मूल PDF में उस सटीक वाक्य को हाइलाइट करता है जिसका इसने साक्ष्य के रूप में उपयोग किया है। यदि AI कहता है "तापमान 50 डिग्री था," तो आप एक बटन पर क्लिक कर सकते हैं, और यह सीधे उस पैराग्राफ पर पहुँच जाएगा जहाँ लिखा है "50 डिग्री।"
- यह आपको पूरे दस्तावेज़ को दोबारा पढ़े बिना तुरंत काम को सत्यापित करने की अनुमति देता है।
यह एक बड़ी बात क्यों है?
- पैमाना (Scale): पहले, एक टीम को 1,000 पेपरों का डेटासेट तैयार करने में महीनों लग सकते थे। SCILIRE के साथ, एक व्यक्ति इसे बहुत कम समय में कर सकता है।
- गुणवत्ता (Quality): क्योंकि मनुष्य सुधार करने के लिए लूप में हैं, इसलिए अंतिम डेटा बहुत अधिक सटीक होता है यदि AI अकेले काम करता।
- दक्षता (Efficiency): यह डेटा एंट्री के उबाऊ, दोहराव वाले कार्य को एक सहयोगात्मक खेल में बदल देता है जहाँ आप जितना अधिक काम करते हैं, AI उतना ही स्मार्ट होता जाता है।
संक्षेप में: SCILIRE एक ऐसे सुपर-फास्ट इंटर्न की तरह है जो सीखने के लिए उत्सुक है। उन्हें गलती करने पर नौकरी से निकालने के बजाय, आप उन्हें सुधारते हैं, और वे तुरंत उस सबक का उपयोग अगले कार्य को पूरी तरह से करने के लिए करते हैं। यह "मानव बनाम AI" के संघर्ष को "मानव + AI" की एक सुपर-टीम में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।