Comparing AI and Human Coding of NIH Grant Abstracts to Identify Innovations in Opioid Addiction Treatment
यह अध्ययन प्रदर्शित करता है कि जब सावधानीपूर्वक प्रॉम्प्ट दिया जाता है, तो ChatGPT-4.0 ओपिओइड एडिक्शन उपचार पर केंद्रित NIH अनुदान सारांशों के भीतर नवाचारों के उच्च गुणवत्ता वाले, विस्तृत और पूर्ण विवरण उत्पन्न करने में मानव कोडर्स से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप ओपिओइड (opioid) की लत से लड़ने के 118 अलग-अलग व्यंजनों (रेसिपी) वाली एक विशाल कुकबुक में "सीक्रेट सॉस" खोजने की कोशिश कर रहे हैं। ये रेसिपी वास्तव में NIH (एक बड़ी सरकारी स्वास्थ्य संस्था) के अनुदान आवेदन (grant applications) हैं, और लक्ष्य यह पता लगाना है कि किनमें सबसे रचनात्मक और क्रांतिकारी विचार हैं।
परंपरागत रूप से, आप विशेषज्ञ खाद्य आलोचकों (मानव कोडर) की एक टीम को हर एक रेसिपी को पढ़ने, यह बताने के लिए कि उसमें क्या खास है, उसका सारांश लिखने और फिर अन्य आलोचकों द्वारा उन सारांशों को ग्रेड देने के लिए काम पर रखेंगे। यह एक धीमा, थकाऊ काम है, और कभी-कभी आलोचक थक जाते हैं या सूक्ष्म विवरणों को मिस कर देते हैं।
नया प्रयोग: सुपर-रीडर रोबोट
इस अध्ययन ने एक बड़ा सवाल पूछा: क्या होगा अगर हम एक सुपर-स्मार्ट AI रोबोट (विशेष रूप से, ChatGPT-4.0) को पढ़ने और सारांश लिखने का काम सौंप दें? क्या यह मानव विशेषज्ञों से बेहतर काम कर पाएगा?
उन्होंने इसे इस तरह से टेस्ट किया, एक सरल उपमा का उपयोग करते हुए:
प्रतियोगिता: उन्होंने दोनों टीमों को समान 118 अनुदान "रेसिपी" दीं।
- टीम A: वास्तविक मानव शोधकर्ता।
- टीम B: AI रोबोट।
दोनों टीमों को बिल्कुल समान निर्देश दिए गए: "इसे पढ़ें और हमें इस विचार का सबसे अभिनव (innovative) हिस्सा बताएं।"
टेस्ट टेस्ट (स्वाद परीक्षण): एक बार जब दोनों टीमों ने अपने सारांश लिख लिए, तो उन्हें एक ब्लाइंड टेस्ट (blind taste test) के लिए रखा गया। जजों के एक पैनल (कुछ इंसान, कुछ स्वयं AI) ने 1 से 5 के पैमाने पर सारांशों को रेट किया। उन्होंने दो चीजों की तलाश की:
- गहराई (Depth): विवरण कितना समृद्ध और विस्तृत था? (जैसे, क्या आलोचक ने सिर्फ यह कहा कि "यह तीखा है," या क्या उन्होंने समझाया कि वह तीखापन क्यों काम करता है?)
- प्रासंगिकता (Relevance): क्या सारांश ने वास्तव में रेसिपी के मुख्य बिंदु को पकड़ा था?
चौंका देने वाला परिणाम
परिणाम आश्चर्यजनक थे। AI रोबोट ने न केवल मुकाबला किया, बल्कि उसने मानव टीम को पूरी तरह से पछाड़ दिया।
- मानव स्कोर: मानव-लिखित सारांशों को औसतन लगभग 3.3 का स्कोर मिला (एक ठोस "B" ग्रेड)।
- AI स्कोर: रोबोट-लिखित सारांशों को औसतन 4.5 का स्कोर मिला ("A" ग्रेड)।
सांख्यिकीय रूप से, यह कोई इत्तेफाक नहीं था; यह एक स्पष्ट जीत थी। AI उन विवरणों में अधिक गहराई तक जाने और सूचनाओं को मानव पाठकों की तुलना में अधिक स्पष्टता और पूर्णता के साथ निकालने में सक्षम था।
निष्कर्ष
इसे एक उच्च-शक्ति वाले माइक्रोस्कोप बनाम एक आवर्धक लेंस (magnifying glass) के रूप में सोचें। मानव शोधकर्ता आवर्धक लेंस वाले लोगों की तरह हैं—वे अच्छे हैं, लेकिन वे सूक्ष्म विवरणों को मिस कर सकते हैं या थक सकते हैं। AI एक हाई-टेक माइक्रोस्कोप की तरह है जो पूरे पन्ने को तुरंत स्कैन कर सकता है और लेजर सटीकता के साथ सबसे महत्वपूर्ण हिस्सों को हाइलाइट कर सकता है।
सरल शब्दों में:
यह पेपर यह साबित करता है कि जब आप एक AI को स्पष्ट निर्देश देते हैं, तो वह वास्तव में जटिल वैज्ञानिक विचारों को मनुष्यों की तुलना में बेहतर और अधिक विस्तार से पढ़ और सारांशित कर सकता है। इसका मतलब है कि वैज्ञानिक अपने शोध की गति बढ़ाने के लिए AI को एक सुपर-असिस्टेंट के रूप में उपयोग कर सकते हैं, जिससे यह सुनिश्चित हो सके कि वे लत के इलाज के लिए सबसे शानदार नए विचारों को मिस न करें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।