← नवीनतम पेपर
🤖 AI

Sound Agentic Science Requires Adversarial Experiments

यह शोध पत्र तर्क देता है कि एलएलएम-आधारित वैज्ञानिक एजेंटों को केवल विश्वसनीय लेकिन अपुष्ट आख्यान उत्पन्न करने से रोकने के लिए, उन्हें ऐसे उपकरणों से परिवर्तित किया जाना चाहिए जो सम्मोहक दावे गढ़ने के बजाय उन दावों को गलत सिद्ध करने के लिए डिज़ाइन किए गए प्रतिकूल प्रयोगों को प्राथमिकता देते हैं।

मूल लेखक: Dionizije Fa, Marko Culjak

प्रकाशित 2026-04-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dionizije Fa, Marko Culjak

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: विज्ञान का "फास्ट-फूड" संस्करण

कल्पना कीजिए कि आप एक फूड क्रिटिक (खाद्य समीक्षक) हैं। आमतौर पर, जब कोई शेफ यह साबित करना चाहता है कि उसकी नई रेसिपी स्वादिष्ट है, तो उसे सामग्री जुटाने, अलग-अलग कुकिंग तापमान का परीक्षण करने और लोगों को चखने के लिए आमंत्रित करने में हफ्तों बिताने पड़ते हैं। इसमें समय लगता है, और यदि खाना खराब निकला, तो शेफ असफल हो जाता है।

अब, कल्पना कीजिए कि एक जादुई रोबोट शेफ रसोई में प्रवेश करता है। यह रोबोट सेकंडों में एक व्यंजन के 1,000 अलग-अलग संस्करण तैयार कर सकता है। यदि आप रोबोट को कहते हैं, "मेरे लिए एक ऐसा व्यंजन बनाओ जिसका स्वाद स्ट्रॉबेरी जैसा हो," तो वह चीनी, एसिड और फल के हर संभावित संयोजन को पागलों की तरह आज़माएगा जब तक कि उसे कोई ऐसा संयोजन न मिल जाए जो थोड़ा बहुत स्ट्रॉबेरी जैसा स्वाद दे सके। फिर वह वह एक व्यंजन आपके सामने पेश करेगा और कहेगा, "देखो, मैंने सिद्ध कर दिया है कि यह संयोजन स्ट्रॉबेरी का सार है!"

समस्या यह नहीं है कि रोबोट झूठ बोल रहा है; समस्या यह है कि रोबोट "तर्कसंगत" पैटर्न खोजने में बहुत माहिर है। वह उन 999 असफल प्रयासों को अनदेखा कर देता है जिनका स्वाद कुछ भी नहीं था या जिनका स्वाद साबुन जैसा था, क्योंकि वे "सफल" नहीं थे।

यह लेख तर्क देता है कि AI एजेंट वैज्ञानिक अनुसंधान के लिए वही रोबोट शेफ बनते जा रहे हैं।


मुख्य तर्क: "सत्यापन अंतराल" (The Verification Gap)

लेखक बताते हैं कि AI सॉफ्टवेयर में कैसे मदद करता है और विज्ञान में कैसे मदद करता है, इसके बीच एक बड़ा अंतर है:

  • सॉफ्टवेयर में ("बिल्डिंग ब्लॉक्स" दृष्टिकोण): यदि कोई AI एक पुल बनाने के लिए कोड लिखता है, तो आप तुरंत उसका परीक्षण कर सकते हैं। आप पुल पर भार डालते हैं, और यदि वह ढह जाता है, तो AI को पता चल जाता है कि वह विफल रहा। "वास्तविकता" (पुल) तुरंत, कठोर फीडबैक देती है। यह एक छात्र द्वारा गणित के सवाल हल करने जैसा है: यदि उत्तर गलत है, तो शिक्षक तुरंत उसे लाल निशान से काट देता है।
  • विज्ञान में ("डिटेक्टिव" दृष्टिकोण): यदि कोई AI चिकित्सा डेटा के विशाल ढेर को देखता है और कहता है, "जो लोग ब्लूबेरी खाते हैं वे लंबे समय तक जीवित रहते हैं," तो आप केवल डेटा को दोबारा देखकर यह "परीक्षण" नहीं कर सकते कि यह सच है या नहीं। डेटा केवल अतीत की एक झलक है। यह जानने के लिए कि क्या यह सच है, आपको वास्तविक दुनिया में जाना होगा, क्लिनिकल ट्रायल करना होगा और देखना होगा कि क्या लोगों को ब्लूबेरी देने से वास्तव में उनके जीवन में कोई बदलाव आता है।

खतरा: AI एजेंट डेटा को इतनी तेज़ी से प्रोसेस कर सकते हैं कि वे वास्तविक दुनिया में मानव वैज्ञानिकों के परीक्षण करने के समय से पहले ही हजारों "तर्कसंगत" वैज्ञानिक दावे (जैसे ब्लूबेरी वाला उदाहरण) पैदा कर सकते हैं। हम "शायद" के ढेर में डूब रहे हैं जबकि "निश्चितता" के लिए तरस रहे हैं।


"मैजिक ट्रिक" प्रयोग

यह साबित करने के लिए कि यह कितना आसान है, शोधकर्ताओं ने वास्तविक स्वास्थ्य डेटा का उपयोग करके दो AI एजेंटों के बीच एक "द्वंद्व" कराया:

  • एजेंट A को निर्देश दिया गया था: "इस प्रमाण को खोजें कि विटामिन D अवसाद (depression) को रोकने में मदद करता है।"
  • एजेंट B को निर्देश दिया गया था: "इस प्रमाण को खोजें कि विटामिन D का अवसाद से कोई संबंध नहीं है।"

भले ही वे बिल्कुल एक ही डेटा को देख रहे थे, लेकिन एजेंटों ने अपने गणित को "ट्वीक" करने में सफलता पाई—जैसे कि उन्होंने किस आयु वर्ग को देखा या अन्य किन कारकों को ध्यान में रखा—जब तक कि दोनों "जीत" नहीं गए। एजेंट A ने एक संबंध खोज लिया; एजेंट B को कुछ नहीं मिला।

दोनों ही अपने गणित में "तकनीकी रूप से" सही थे, लेकिन वे एक ही वास्तविकता के बारे में दो पूरी तरह से अलग कहानियाँ बता रहे थे।


समाधान: "डेविल्स एडवोकेट" (Devil’s Advocate) बनें

लेखक यह नहीं कह रहे हैं कि हमें विज्ञान से AI को प्रतिबंधित कर देना चाहिए। इसके बजाय, वे एक नया नियम प्रस्तावित करते हैं: "असत्यता-प्रथम मानक" (Falsification-First Standard)।

एक सुंदर, सम्मोहक कहानी (नैरेटिव) बनाने के बजाय, हमें AI का उपयोग परम संशयवादी (Ultimate Skeptic) के रूप में करना चाहिए।

यदि कोई AI एक संभावित चिकित्सा संबंधी सफलता खोजता है, तो हमें उससे यह नहीं पूछना चाहिए कि, "क्या आप एक पेपर लिख सकते हैं जो समझा सके कि यह क्यों सच है?" इसके बजाय, हमें उसे आदेश देना चाहिए: "जितनी भी कोशिश कर सको, यह साबित करने की कोशिश करो कि यह एक झूठ है। हर संभव तरीका खोजो जिससे यह परिणाम एक गलती, एक इत्तेफाक या एक संयोग हो सकता है।"

रूपक परिवर्तन (Metaphorical Shift):
हमें AI को एक जनसंपर्क एजेंट (PR Agent) (जो हमें अच्छा दिखाने में मदद करता है) के रूप में उपयोग करना बंद करना होगा और इसे एक डिफेंस अटॉर्नी (Defense Attorney) (जो हर तर्क में खामियां ढूंढने की कोशिश करता है) के रूप में उपयोग करना शुरू करना होगा।

एक वाक्य में सारांश:

AI "वैज्ञानिक सत्यों" को उतनी तेज़ी से उत्पन्न कर सकता है जितनी तेज़ी से हम उन्हें सत्यापित कर सकते हैं, इसलिए हमें तर्क बनाने के लिए AI का उपयोग करना बंद करना चाहिए और उन्हें तोड़ने की कोशिश करने के लिए उपयोग करना शुरू करना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →