← नवीनतम पेपर
🤖 AI

FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents

यह शोध पत्र FirstResearch को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो संरचित "रिसर्च क्वेश्चन सर्टिफिकेट्स" (अनुसंधान प्रश्न प्रमाणपत्र) उत्पन्न करके LLM-संचालित वैज्ञानिक खोज की ऑडिटेबिलिटी (लेखापरीक्षा योग्यता) को बढ़ाता है जो स्पष्ट रूप से तंत्र, धारणाओं और असत्य सिद्ध करने योग्य परिकल्पनाओं को परिभाषित करते हैं, और प्रारंभिक मूल्यांकनों में मौजूदा बेसलाइन की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Yufeng Wang

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yufeng Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, विद्वान रोबोट से एक नया वैज्ञानिक विचार सोचने के लिए कहते हैं। वह रोबोट कह सकता है, "आइए अध्ययन करें कि AI एजेंट नए कौशल कैसे सीखते हैं!" यह सुनने में बहुत अच्छा लगता है, लेकिन यदि आप उससे पूछते हैं, "हमें कैसे पता चलेगा कि यह काम कर रहा है? वह कौन सी विशिष्ट चीज़ होगी जो आपको गलत साबित कर देगी?" तो वह रोबोट लड़खड़ा सकता है। वह एक अस्पष्ट उत्तर देता है जो सुनने में तर्कसंगत लगता है लेकिन वास्तव में वैज्ञानिक जांच के सामने टिक नहीं पाता।

यह शोध पत्र FirstResearch नामक एक प्रणाली पेश करता है ताकि इस समस्या को ठीक किया जा सके। इसे वैज्ञानिक खोज के बिल्कुल पहले चरण के लिए एक "क्वालिटी कंट्रोल इंस्पेक्टर" (गुणवत्ता नियंत्रण निरीक्षक) के रूप में समझें।

यह कैसे काम करता है, इसके लिए कुछ रोजमर्रा के उपमाओं का उपयोग किया गया है:

1. समस्या: "अस्पष्ट विचार" का जाल

वर्तमान AI वैज्ञानिक उन उत्साही इंटर्न की तरह हैं जो सुंदर रिपोर्ट लिख सकते हैं और प्रयोग चला सकते हैं। लेकिन कभी-कभी, उनका शुरुआती विचार एक ऐसी रेसिपी की तरह होता है जिसमें लिखा हो, "एक स्वादिष्ट केक बनाएं।" इसमें यह नहीं बताया गया है कि किस प्रकार का केक, कैसे मिलाना है, या अगर आप अंडे भूल गए तो क्या होगा। यदि केक विफल हो जाता है, तो आपको पता नहीं चलेगा कि यह आटे की वजह से था, ओवन की वजह से, या इस बात की वजह से कि आप अंडे भूल गए थे।

विज्ञान में, यदि आप स्पष्ट रूप से यह नहीं बता सकते कि क्या आपकी किसी विचार को गलत साबित कर सकता है (एक "फालसीफायर" या खंडन योग्य तत्व), तो आपने वास्तव में एक अच्छा प्रश्न नहीं पूछा है।

2. समाधान: "रिसर्च क्वेश्चन सर्टिफिकेट" (अनुसंधान प्रश्न प्रमाण पत्र)

FirstResearch AI को कोई भी वास्तविक काम करने की अनुमति देने से पहले एक रिसर्च क्वेश्चन सर्टिफिकेट भरने के लिए मजबूर करता है। इस सर्टिफिकेट को एक बिल्डिंग परमिट या फ्लाइट प्लान की तरह समझें।

एक विमान उड़ान भरने से पहले, पायलट को एक फॉर्म भरना चाहिए जिसमें लिखा हो:

  • बुनियादी बातें: यहाँ भौतिकी के नियम क्या हैं? (प्रिमिटिव परिभाषाएं)
  • मान्यताएं: हम क्या मान रहे हैं कि सच है?
  • इंजन: यह वास्तव में कैसे काम करता है? (मैकेनिज्म मॉडल)
  • द्वंद्व: वह विशिष्ट समस्या या तनाव क्या है जिसे हम हल करने की कोशिश कर रहे हैं?
  • परीक्षण: वह एक सरल प्रयोग क्या है जो हमें गलत साबित कर सकता है?
  • "ओप्स" योजना: यदि प्रयोग विफल हो जाता है, तो आप अपनी योजना के किस विशिष्ट भाग को बदलते हैं?

यदि AI इस फॉर्म को स्पष्ट रूप से नहीं भर सकता, तो सिस्टम उसे रोक देता है। यह AI को तब तक प्रयोग नहीं करने देता जब तक कि "फ्लाइट प्लान" ठोस न हो जाए।

3. "गेटकीपर" (रिपेयर शॉप)

इस सिस्टम में एक स्मार्ट गेटकीपर है। यदि AI एक ऐसा सर्टिफिकेट जमा करता है जो बहुत अस्पष्ट है (जैसे, "हम देखेंगे कि क्या यह बेहतर होता है"), तो गेटकीपर उसे रिपेयर शॉप (मरम्मत की दुकान) में वापस भेज देता है।

  • यह कहता है: "यह बहुत सामान्य है। आपको एक विशिष्ट 'टिपिंग पॉइंट' (निर्णायक बिंदु) या 'फेलियर मोड' (विफलता का तरीका) खोजना होगा।"
  • यह AI को अपने प्रश्न को तब तक तेज करने के लिए मजबूर करता है जब तक कि वह परीक्षण के लिए पर्याप्त विशिष्ट न हो जाए।

4. परिणाम: क्या यह काम कर गया?

लेखकों ने 10 अलग-अलग विषयों पर, जो यह बताते हैं कि AI एजेंट कैसे सीखते हैं, इस प्रणाली का अन्य AI विधियों (जैसे "AI साइंटिस्ट" या "एजेंट लैबोरेटरी") के विरुद्ध परीक्षण किया।

  • जज: उन्होंने विचारों को ग्रेड देने के लिए दो अलग-अलग शक्तिशाली AI "जजों" (DeepSeek और Gemini) का उपयोग किया।
  • स्कोर: FirstResearch ने 4.86 में से 4.86 स्कोर किया, जबकि अगले सबसे अच्छे सिस्टम ने 4.38 स्कोर किया।
  • "सर्टिफिकेट" का प्रमाण: यह साबित करने के लिए कि सर्टिफिकेट ही असली सफलता का मंत्र था, उन्होंने एक परीक्षण चलाया जहाँ उन्होंने सर्टिफिकेट की आवश्यकता को हटा दिया। स्कोर गिरकर 5 में से 1 से भी कम हो गया। यह दर्शाता है कि यह संरचित रूप ही था जिसने विचारों को अच्छा बनाया, न कि केवल AI की सामान्य बुद्धिमत्ता।

निचोड़

यह शोध पत्र यह दावा नहीं करता कि FirstResearch अभी एक पूरी तरह से स्वायत्त वैज्ञानिक है जो बीमारियों का इलाज कर सकती है या नई सामग्रियों की खोज कर सकती है। इसके बजाय, यह दावा करता है कि किसी भी कार्य को शुरू करने से पहले AI को एक संरचित "परमिट" (सर्टिफिकेट) लिखने के लिए मजबूर करने से उसके वैज्ञानिक प्रश्न बहुत अधिक स्पष्ट, परीक्षण योग्य और मनुष्यों द्वारा जांचने में आसान हो जाते हैं।

यह एक "शायद यह अच्छा है" वाले विचार को एक "यहाँ बताया गया है कि हम वास्तव में इसका परीक्षण कैसे करेंगे" वाले योजना में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →