SANE Schema-aware Natural-language Evaluation of Biological Data
यह शोध पत्र SANE को पेश करता है, जो स्वचालित रूप से जनरेट किए गए बेंचमार्क का उपयोग करने वाला एक स्कीमा-जागरूक मूल्यांकन प्रतिमान (paradigm) है, जो यह प्रदर्शित करता है कि फ्यू-शॉट लार्ज लैंग्वेज मॉडल्स बिना फाइन-ट्यूनिंग के जैविक सूक्ष्मदर्शी डेटा (biological microscopy data) के लिए सटीक SQL क्वेरीreliably जनरेट कर सकते हैं, बशर्ते कि इनपुट सुव्यवस्थित हों और अस्पष्टता से सुरक्षित हों।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास जैविक प्रयोगों का एक विशाल, अविश्वसनीय रूप से विस्तृत पुस्तकालय है। इसके अंदर लाखों रिकॉर्ड हैं कि विभिन्न कोशिकाएं विभिन्न दवाओं के प्रति कैसे प्रतिक्रिया करती हैं। इस पुस्तकालय में एक विशिष्ट तथ्य खोजने के लिए, आपको आमतौर पर एक ऐसे लाइब्रेरियन की आवश्यकता होती है जो SQL नामक एक बहुत ही सख्त, जटिल भाषा बोलता हो। यदि आप वह भाषा नहीं बोलते हैं, तो किताबें बंद रहेंगी और आप उस जानकारी तक नहीं पहुँच पाएंगे जिसकी आपको आवश्यकता है।
हाल ही में, हमें एक नया उपकरण मिला है: AI असिस्टेंट (लार्ज लैंग्वेज मॉडल्स) जो सामान्य मानवीय भाषा को समझ सकते हैं। आप उनसे पूछ सकते हैं, "दवा X से कितनी कोशिकाएं प्रभावित हुईं?" और वे उस उत्तर को प्राप्त करने के लिए उसे पुस्तकालय की गुप्त भाषा में अनुवाद करने का प्रयास करते हैं।
समस्या:
ये AI असिस्टेंट स्मार्ट हैं, लेकिन उनकी एक बुरी आदत है। कभी-कभी, जब उन्हें उत्तर नहीं पता होता है, तो वे चीजें बनाना शुरू कर देते हैं (एक व्यवहार जिसे "हैलुसिनेशन" या भ्रम पैदा करना कहा जाता है)। एक वैज्ञानिक पुस्तकालय में, मनगढ़ंत बातें बनाना खतरनाक है। साथ ही, वे पुस्तकालय की जटिल संरचना से अक्सर भ्रमित हो जाते हैं।
समाधान: SANE
लेखकों ने SANE (स्कीमा-अवेयर नेचुरल-लैंग्वेज इवैल्यूएशन) नामक एक नया सिस्टम बनाया है। SANE को एक विशेष प्रशिक्षण मैदान और परीक्षण ट्रैक के रूप में समझें, जिसे विशेष रूप से इस जैविक पुस्तकालय के लिए डिज़ाइन किया गया है।
SANE इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:
- "ग्राउंड ट्रुथ" मैप (वास्तविक सत्य का मानचित्र): केवल यह अनुमान लगाने के बजाय कि क्या AI सही है, SANE वास्तविक डेटाबेस संरचना (स्कीमा) और वास्तविक प्रयोगों को देखता है और स्वचालित रूप से परीक्षण प्रश्नों की एक विशाल सूची और उनके सटीक सही उत्तर बनाता है। यह एक मास्टर कुंजी होने जैसा है जो हर एक किताब के स्थान को जानती है।
- "गार्डरेल्स" (सुरक्षा घेरा): सिस्टम केवल AI को भटकने नहीं देता। यह AI को एक "चीट शीट" (डेटाबेस संरचना) और सख्त नियम (गार्डरेल्स) देता है ताकि वह उत्तर देने से पहले यह जान सके कि पुस्तकालय वास्तव में कैसे व्यवस्थित है।
- "ट्रैफिक कोप" (यातायात पुलिस): डेटा प्राप्त करने का प्रयास करने से पहले, SANE AI से एक सरल प्रश्न पूछता है: "क्या आपके पास उत्तर देने के लिए पर्याप्त जानकारी है?"
- यदि उपयोगकर्ता ने एक अस्पष्ट प्रश्न पूछा है (जैसे कि बिना यह बताए कि कौन सी कोशिकाएं, "कोशिकाओं के बारे में बताएं"), तो AI को अनुमान लगाने के बजाय यह कहना सिखाया जाता है, "मुझे अधिक विवरण चाहिए।"
- यदि प्रश्न स्पष्ट है, तो AI डेटा प्राप्त करने के लिए उसे गुप्त SQL भाषा में अनुवाद करता है।
उन्होंने क्या पाया:
शोधकर्ताओं ने वास्तविक प्रयोगों पर आधारित 572 विभिन्न प्रश्नों के साथ SANE सिस्टम का उपयोग करके एक AI असिस्टेंट का परीक्षण किया। उन्होंने AI को कुछ नया नहीं सिखाया; उन्होंने बस उसे सही निर्देश (प्रॉम्प्ट्स) और चीट शीट दी।
- स्कोर: AI ने 97.2% उत्तर सही दिए। यह अविश्वसनीय रूप से उच्च है।
- गलतियाँ: जब AI गलत हुआ, तो यह आमतौर पर इसलिए नहीं था क्योंकि उसने फर्जी नंबरों का आविष्कार किया था। इसके बजाय, वह इसलिए विफल हुआ क्योंकि:
- मनुष्य ने एक भ्रमित करने वाला प्रश्न पूछा था (उदाहरण के लिए, किसी दवा के असली नाम के बजाय उसके निकनेम का उपयोग करना)।
- AI बहुत अधिक सतर्क था और स्पष्टीकरण मांग रहा था जब उसे इसकी आवश्यकता नहीं थी, या उसने स्पष्टीकरण नहीं मांगा जब उसे इसकी आवश्यकता थी।
- उसने प्रश्न के एक सूक्ष्म विवरण को मिस कर दिया।
बड़ी सीख:
आपको इस जटिल जैविक डेटा तक पहुँचने के लिए डेटाबेस विशेषज्ञ होने की आवश्यकता नहीं है, और न ही आपको एक नए AI मॉडल को प्रशिक्षित करने के लिए महीनों बिताने की आवश्यकता है। यदि आप AI को डेटा संरचना का एक स्पष्ट मानचित्र देते हैं और उसे अस्पष्ट प्रश्नों के मामले में सावधान रहने के लिए कहते हैं, तो वह एक विश्वसनीय शोध सहायक के रूप में कार्य कर सकता है।
संक्षेप में: SANE यह सिद्ध करने का एक तरीका है कि एक AI जटिल वैज्ञानिक डेटा के लिए एक भरोसेमंद लाइब्रेरियन बन सकता है, जब तक कि हम उसे सही नियम और शेल्फ का एक स्पष्ट मानचित्र दें। मुख्य बाधा AI की बुद्धिमत्ता नहीं है, बल्कि मनुष्य के प्रश्नों की स्पष्टता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।