← नवीनतम पेपर
💻 computer science

DRACULA: Hunting for the Actions Users Want Deep Research Agents to Execute

यह शोध पत्र DRACULA प्रस्तुत करता है, जो वैज्ञानिक गहन अनुसंधान (Scientific Deep Research) एजेंटों के लिए मध्यवर्ती कार्यों (intermediate actions) पर विशेषज्ञ उपयोगकर्ता फीडबैक को कैप्चर करने वाला पहला डेटासेट है, जो यह प्रकट करता है कि उपयोगकर्ता के चयन इतिहास का लाभ उठाना पसंदीदा कार्यों के पूर्वानुमान में महत्वपूर्ण रूप से सुधार करता है और केवल यह तय करने के बजाय कि कार्यों को कैसे निष्पादित किया जाए, यह तय करने की महत्वपूर्ण चुनौती को उजागर करता है कि किन कार्यों को निष्पादित किया जाए।

मूल लेखक: Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Rachel Rudinger, Eunsol Choi, Jordan Lee Boyd-Graber, Doug Downey, Aakanksha Naik

प्रकाशित 2026-04-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Rachel Rudinger, Eunsol Choi, Jordan Lee Boyd-Graber, Doug Downey, Aakanksha Naik

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रिसर्च असिस्टेंट (एक AI एजेंट) है जो हजारों वैज्ञानिक शोध पत्रों को पढ़ सकता है और आपके लिए एक लंबी, विस्तृत रिपोर्ट लिख सकता है। अतीत में, यदि आपको अंतिम रिपोर्ट पसंद नहीं आती थी, तो आप केवल कह सकते थे, "यह बुरा है," या "यह अच्छा है।" लेकिन यह एक शेफ को यह बताने जैसा है कि "सूप का स्वाद गलत है," बिना यह बताए कि उन्होंने बहुत अधिक नमक डाला, प्याज डालना भूल गए, या लहसुन जला दिया। आपको यह नहीं पता कि कौन सा चरण गलत हुआ, इसलिए शेफ यह नहीं सीख सकता कि अगली बार इसे कैसे ठीक किया जाए।

यह शोध पत्र, DRACULA, इन रिसर्च असिस्टेंट्स से बात करने का एक नया तरीका पेश करता है। केवल अंतिम सूप का स्वाद लेने के बजाय, शोधकर्ताओं ने उपयोगकर्ताओं से सूप बनने से पहले ही उसके सामग्रियों और चरणों का स्वाद लेने के लिए कहा।

यहाँ बताया गया है कि उन्होंने क्या किया और क्या पाया, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "ब्लैक बॉक्स" रिपोर्ट

आमतौर पर, जब एक AI रिसर्च रिपोर्ट लिखता है, तो वह रास्ते में सैकड़ों छोटे निर्णय लेता है: मुझे कौन से पेपर पढ़ने चाहिए? क्या मुझे एक चार्ट जोड़ना चाहिए? क्या मुझे इस अवधारणा को एक उदाहरण के साथ समझाना चाहिए?
पहले, उपयोगकर्ता केवल अंतिम परिणाम देखते थे। यदि रिपोर्ट उबाऊ थी, तो AI को यह नहीं पता चलता था कि यह इसलिए थी क्योंकि उसने गलत पेपर चुने थे या इसलिए क्योंकि लिखने की शैली बहुत नीरस थी। यह एक "ब्लका बॉक्स" था।

2. समाधान: "रेसिपी कार्ड" दृष्टिकोण

शोधकर्ताओं ने एक ऐसी प्रणाली बनाई जहाँ, AI द्वारा रिपोर्ट लिखने से पहले, वह उपयोगकर्ता को संभावित कार्यों का एक मेनू (एक रेसिपी कार्ड की तरह) प्रस्तुत करता है।

  • मेनू: "मैं डेटासेट पर एक अनुभाग जोड़ सकता हूँ," "मैं इसे एक वास्तविक दुनिया के उदाहरण के साथ समझा सकता हूँ," या "मैं केवल पिछले पांच वर्षों के शोध पर ध्यान केंद्रित कर सकता हूँ।"
  • उपयोगकर्ता का काम: उपयोगकर्ता उन कार्यों को चुनता है जिन्हें वे चाहते हैं (जैसे रेसिपी पर चेक बॉक्स लगाना) और बताता है कि क्यों।
  • परिणाम: AI फिर केवल उन्हीं चयनित कार्यों का उपयोग करके रिपोर्ट लिखता है। अंत में, उपयोगकर्ता निर्णय लेता है: "क्या आपने वास्तव में वही किया जो मैंने आपसे कहा था?"

उन्होंने 19 विशेषज्ञ कंप्यूटर विज्ञान शोधकर्ताओं से 8,000 से अधिक ऐसे "एक्शन चॉइस" और 5,000 "एग्जीक्यूशन चेक" एकत्र किए।

3. बड़ी खोज: "आप क्या चाहते हैं यह जानना" "करने" से अधिक कठिन है

शोधकर्ताओं ने दो आश्चर्यजनक चीजें पाईं:

  • AI आदेशों का पालन करने में वास्तव में काफी अच्छा है। एक बार जब उपयोगकर्ता कहता है, "एक चार्ट जोड़ें," तो AI आमतौर पर एक अच्छा चार्ट बना सकता है।
  • AI सबसे पहले यह अनुमान लगाने में बहुत खराब है कि आप क्या चाहते हैं। AI अक्सर गलत कार्यों का सुझाव देता है। वह एक चार्ट जोड़ने का सुझाव दे सकता है जब उपयोगकर्ता केवल एक सरल सारांश चाहता था।

उपमा: एक वेटर की कल्पना करें जो आपके द्वारा ऑर्डर किए गए तरीके से (मिडियम-रेयर, लहसुन के मक्खन के साथ) स्टेक पकाने में माहिर है। लेकिन वह वेटर यह अनुमान लगाने में बहुत खराब है कि आप वास्तव में सलाद चाहते थे। समस्या खाना पकाने में नहीं है; समस्या अनुमान लगाने में है।

4. "मन पढ़ने" का प्रयोग

टीम ने पूछा: क्या हम एक कंप्यूटर को यह अनुमान लगाने के लिए प्रशिक्षित कर सकते हैं कि एक मानव क्या चुनेगा?
उन्होंने AI मॉडल को विभिन्न सुरागों को देखकर उपयोगकर्ता के विकल्पों की भविष्यवाणी करना सिखाने की कोशिश की:

  • सुराग A: उपयोगकर्ता ने पहले कौन से पेपर पढ़े हैं? (बहुत मददगार नहीं)।
  • सुराग B: उपयोगकर्ता ने क्या कहा कि उन्हें क्या पसंद है? (जैसे, "मुझे छोटी रिपोर्ट पसंद हैं")। (बहुत मददगार नहीं)।
  • सुराग C: उपयोगकर्ता ने अतीत में वास्तव में कौन से कार्य चुने थे? (यह विजेता था)।

सबक: लोगों के कार्य उनके शब्दों से अधिक बोलते हैं। यदि आप एक दोस्त को कहते हैं, "मुझे तीखा भोजन पसंद है," लेकिन आप हमेशा हल्का सूप ऑर्डर करते हैं, तो आपके दोस्त को यह सुनना चाहिए कि आप क्या ऑर्डर करते हैं, न कि जो आप कहते हैं। AI ने सीखा कि यह देखना कि उपयोगकर्ता के पिछले "चेकमार्क" क्या थे, यह अनुमान लगाने का सबसे अच्छा तरीका था कि वे आगे क्या चुनेंगे।

5. "मन बदलने" की समस्या

शोधकर्ताओं ने यह भी पाया कि मानवीय प्राथमिकताएं जटिल होती हैं। कभी-कभी, एक उपयोगकर्ता आज एक क्रिया चुनता है, लेकिन यदि आप उनसे कुछ महीनों बाद फिर से पूछें, तो वे कुछ अलग चुन सकते हैं क्योंकि उनके लक्ष्य बदल गए हैं।

  • उदाहरण: एक उपयोगकर्ता आज "विस्तृत तकनीकी चरणों" को चाह सकता है क्योंकि वह एक प्रोजेक्ट बना रहा है। अगले महीने, वह केवल बुनियादी बातें समझने के लिए "उच्च-स्तरीय सारांश" चाह सकता है।
  • सीख: आप हमेशा के लिए पूरी तरह से भविष्यवाणी नहीं कर सकते कि एक मनुष्य क्या चाहता है। कभी-कभी, आपको बस उनसे पूछना ही पड़ता है (जैसे कि "रेसिपी कार्ड" मेनू) क्योंकि उनके लक्ष्य हवा की तरह बदलते रहते हैं।

6. अंतिम परिणाम: एक बेहतर "रेसिपी"

चूंकि उन्होंने सीखा कि पिछले कार्यों को देखना मदद करता है, इसलिए उन्होंने एक ऐसी प्रणाली बनाई है जो बेहतर सुझाव देने के लिए उपयोगकर्ता के इतिहास का उपयोग करती है।

  • जब एक उपयोगकर्ता, जिसका इतिहास "तुलना तालिकाओं" (comparison tables) को चुनने का है, एक नया प्रश्न पूछता है, तो सिस्टम अधिक संभावना के साथ सुझाव देता है, "क्या मुझे एक तुलना तालिका जोड़नी चाहिए?"
  • इससे उपयोगकर्ता उनके सुझावों से बहुत अधिक खुश हुए, भले ही सिस्टम उनके बारे में सब कुछ पूरी तरह से नहीं जानता था।

सारांश

DRACULA एक डेटासेट और एक अध्ययन है जो दिखाता है कि AI रिसर्च एजेंटों के लिए, रिपोर्ट लिखना सबसे कठिन काम नहीं है; बल्कि यह पता लगाना है कि कौन से कदम उठाने हैं ताकि रिपोर्ट उपयोगी बन सके। उपयोगकर्ताओं को काम शुरू होने से पहले कदम (क्रियाएं) चुनने देकर, और उन विकल्पों का अध्ययन करके, हम ऐसा AI बना सकते हैं जो हमें बेहतर समझता है।

शोध पत्र निष्कर्ष निकालता है कि जबकि AI काम करने में बेहतर हो रहा है, असली चुनौती यह तय करना है कि क्या काम करना है। इसे हल करने का सबसे अच्छा तरीका यह सुनना है कि उपयोगकर्ता वास्तव में क्या करते हैं, न कि केवल वह जो वे कहते हैं कि वे चाहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →