← नवीनतम पेपर
🤖 AI

Asking What Matters: Reward-Driven Clarification for Software Engineering Tasks

यह शोध पत्र CLARITI को प्रस्तुत करता है, जो एक 8B-पैरामीटर वाला मॉडल है जिसे रिवॉर्ड-ड्रिवन रिइन्फोर्समेंट लर्निंग के माध्यम से प्रशिक्षित किया गया है जो कार्य-प्रासंगिक और उपयोगकर्ता-उत्तर देने योग्य जानकारी को प्राथमिकता देकर सॉफ्टवेयर इंजीनियरिंग में स्पष्टीकरण दक्षता को अनुकूलित करता है, और 41% कम प्रश्नों के साथ GPT-5-स्तर की समाधान दर प्राप्त करता है।

मूल लेखक: Sanidhya Vijayvargiya, Vijay Viswanathan, Graham Neubig

प्रकाशित 2026-04-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sanidhya Vijayvargiya, Vijay Viswanathan, Graham Neubig

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ (AI एजेंट) हैं जो ग्राहक (उपयोगकर्ता) द्वारा दिए गए रेसिपी कार्ड के आधार पर एक जटिल व्यंजन बनाने की कोशिश कर रहे हैं।

समस्या:
अक्सर, ग्राहक का रेसिपी कार्ड अधूरा होता है। वे कह सकते हैं, "मेरे लिए एक स्पाइसी पास्ता बनाओ," लेकिन वे यह बताना भूल जाते हैं कि:

  • तीखापन कितना "स्पाइसी" है? (क्या यह केवल हल्की सी मिठास है या आग लगाने वाला खतरा?)
  • क्या उन्हें ग्लूटेन से एलर्जी है?
  • उनके पेंट्री में किस तरह का पास्ता उपलब्ध है?

यदि शेफ गलत अनुमान लगाता है, तो वह रसोई जला सकता है (सॉफ्टवेयर विफल हो जाता है) या बहुत सारी सामग्री बर्बाद कर सकता है (कंप्यूटेशन का समय)।

पुराना तरीका:
पहले, AI शेफ या तो:

  1. अंधाधुंध अनुमान लगाते थे: "मैं थोड़ा मिर्च डाल दूँगा!" (अक्सर विफल)।
  2. सब कुछ एक साथ पूछते थे: "आपका नाम क्या है? आपका ब्लड टाइप क्या है? आपके ओवन का सटीक तापमान क्या है? क्या आपको धनिया पसंद है? पेरू की राजधानी क्या है?" (यह उपयोगकर्ता को अभिभूत कर देता है, जिससे वे परेशान हो जाते हैं और बात करना बंद कर देते हैं)।

नया समाधान: "CLARITI" (स्मार्ट वेटर)
यह पेपर एक नया AI सिस्टम पेश करता है जिसे CLARITI कहा जाता है। CLARITI को एक शेफ के रूप में नहीं, बल्कि एक अत्यधिक प्रशिक्षित, सुपर-स्मार्ट वेटर के रूप में सोचें जो जानता है कि सबसे अच्छा परिणाम प्राप्त करने के लिए क्या और कैसे पूछना है, बिना ग्राहक को परेशान किए।

CLARITI इस प्रकार काम करता है, जिसे तीन सरल चरणों में विभाजित किया गया है:

1. "क्या महत्वपूर्ण है" फ़िल्टर (कार्य प्रासंगिकता)

शोधकर्ताओं ने महसूस किया कि सभी गायब जानकारी समान नहीं होती है।

  • उपमा: यदि ग्राहक कहना भूल गया कि "मुझे मूंगफली से एलर्जी है," तो यह महत्वपूर्ण जानकारी (Critical Information) है। यदि वे भूल गए कि "मुझे नीली प्लेट पसंद है," तो यह कम प्राथमिकता वाली जानकारी (Low Priority Information) है।
  • विज्ञान: टीम ने हजारों सॉफ्टवेयर बग्स का विश्लेषण किया और एक गणितीय उपकरण (Shapley values) का उपयोग किया ताकि यह पता लगाया जा सके कि कौन से छूटे हुए विवरण वास्तव में AI को समस्या हल करने से रोकते हैं। उन्होंने पाया कि ठोस त्रुटि संदेश (जैसे "बर्तन फट गया!") अस्पष्ट विवरणों (जैसे "इसका स्वाद ठीक नहीं था") की तुलना में बहुत अधिक महत्वपूर्ण हैं।
  • CLARITI का कदम: प्लेट के रंग के बारे में पूछने के बजाय, CLARITI तुरंत पूछता है, "क्या बर्तन फट गया? यदि हाँ, तो मुझे धुआं दिखाएं!" यह "नीली प्लेट" के सवालों के बजाय "मूंगफली की एलर्जी" वाले सवालों को प्राथमिकता देता है।

2. "क्या आप उत्तर दे सकते हैं?" फ़िल्टर (उपयोगकर्ता उत्तरक्षमता)

सही प्रश्न पूछना तब बेकार है जब ग्राहक को उत्तर पता ही न हो।

  • उपमा: एक वेटर को ग्राहक से यह नहीं पूछना चाहिए, "आपने जो आटा खरीदा है उसकी आंतरिक रासायनिक संरचना क्या है?" ग्राहक को इसके बारे में कोई अंदाजा नहीं होगा! वे बता सकते हैं, "मैंने 5वीं स्ट्रीट के स्टोर से आटा खरीदा है," या "यहाँ आटे की थैली है।"
  • विज्ञान: टीम ने इस बात का अध्ययन किया कि कौन से प्रश्न एक इंसान के लिए उत्तर देना आसान बनाते हैं। उन्होंने पाया कि अच्छे प्रश्न:
    • दृश्य साक्ष्य मांगते हैं (जैसे, "त्रुटि संदेश दिखाएं")।
    • विशिष्ट होते हैं (जैसे, "कौन सा Python संस्करण?" के बजाय "कौन सा संस्करण?")।
    • जिनका दायरा छोटा होता है (जैसे, "इस एक फंक्शन का कोड दिखाएं" के बजाय "अपने पूरे ऐप को समझाएं")।
  • CLARITI का कदम: यह असंभव प्रश्न पूछने से बचता है। यह उन चीजों के लिए पूछता है जिन्हें उपयोगकर्ता देख सकता है या कॉपी-पेस्ट कर सकता है, जैसे कि स्क्रीनशॉट या एक विशिष्ट एरर कोड।

3. "कम ही अधिक है" रणनीति (दक्षता)

सबसे आश्चर्यजनक खोज यह थी कि कम प्रश्न पूछना बेहतर है।

  • उपमा: कल्पना करें कि एक वेटर एक साधारण ऑर्डर के लिए 10 प्रश्न पूछता है। ग्राहक थक जाता है और बस कहता है, "जो भी हो, आप तय कर लीजिए।" लेकिन यदि वेटर केवल 2 सटीक प्रश्न पूछता है, तो ग्राहक खुश होता है और एक बेहतरीन उत्तर देता है।
  • परिणाम: CLARITI बड़े, महंगे AI मॉडल्स (जैसे GPT-5) के समान ही सॉफ्टवेयर समस्याओं को हल करता है, लेकिन यह 41% कम प्रश्न पूछता है। यह अनावश्यक बातों को हटा देता है।

गुप्त नुस्खा: रिवॉर्ड सिस्टम (पुरस्कार प्रणाली)

उन्होंने CLARITI को इतना स्मार्ट कैसे बनाया? उन्होंने केवल इसे "मददगार बनो" नहीं बताया। उन्होंने एक बहु-चरणीय रिवॉर्ड सिस्टम (लेवल वाले वीडियो गेम की तरह) बनाया:

  1. लेवल 1 (कोई पुनरावृत्ति नहीं): यदि आप ऐसा प्रश्न पूछते हैं जिसका उत्तर उपयोगकर्ता पहले ही दे चुका है, तो आपको शून्य अंक मिलते हैं।
  2. लेवल 2 (कॉपी-पेस्ट नहीं): यदि आप हर समस्या के लिए एक ही सामान्य प्रश्न पूछते हैं, तो आपको शून्य अंक मिलते हैं।
  3. लेवल 3 (क्या वे उत्तर दे सकते हैं?): यदि उपयोगकर्ता संभवतः उत्तर नहीं जान सकता, तो आपको शून्य अंक मिलते हैं।
  4. लेवल 4 (क्या यह महत्वपूर्ण है?): यदि आपने "मूंगफली की एलर्जी" के बजाय "नीली प्लेट" के बारे में पूछा, तो आपको कम अंक मिलते हैं।

AI को इन चारों स्तरों में अधिकतम अंक प्राप्त करने के लिए प्रशिक्षित करके, इसने एक आदर्श वेटर बनना सीखा: जितने संभव हो सके उतने कम, सबसे महत्वपूर्ण और सबसे उत्तर देने योग्य प्रश्न पूछना।

मुख्य निष्कर्ष

यह पेपर हमें सिखाता है कि AI के लिए अच्छा काम करने के लिए, इसे केवल "स्मार्ट" होने की आवश्यकता नहीं है; इसे सहानुभूतिपूर्ण और कुशल होने की भी आवश्यकता है। इसे यह जानने की आवश्यकता है कि वास्तव में कौन सी जानकारी समस्या को हल करती है और मानव के समय और ज्ञान की सीमाओं का सम्मान करना चाहिए।

CLARITI यह सिद्ध करता है कि सही प्रश्न पूछकर (अधिक प्रश्नों के बजाय), AI बड़े मॉडल्स के समान ही जटिल सॉफ्टवेयर समस्याओं को हल कर सकता है, लेकिन बहुत कम घर्षण (friction) के साथ।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →