← नवीनतम पेपर
💻 computer science

ReqElicitGym: An Evaluation Environment for Interview Competence in Conversational Requirements Elicitation

यह शोधपत्र ReqElicitGym प्रस्तुत करता है, जो एक नया डेटासेट और ओरकल यूजर्स (oracle users) वाला एक स्वचालित और पुनरुत्पादक मूल्यांकन वातावरण है, जिसका उपयोग संवादात्मक आवश्यकता निष्कर्षण (conversational requirements elicitation) में एलएलएम (LLMs) की साक्षात्कार क्षमता का व्यवस्थित रूप से आकलन करने के लिए किया गया है, जो यह प्रकट करता है कि वर्तमान मॉडल अंतर्निहित आवश्यकताओं को खोजने में संघर्ष करते हैं और अक्सर प्रभावी प्रश्न संवाद में बहुत देर से पूछते हैं।

मूल लेखक: Dongming Jin, Zhi Jin, Zheng Fang, Linyu Li, XiaoTian Yang, Yuanpeng He, Xiaohong Chen

प्रकाशित 2026-02-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dongming Jin, Zhi Jin, Zheng Fang, Linyu Li, XiaoTian Yang, Yuanpeng He, Xiaohong Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "ReqElicitGym" शोध पत्र का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी तस्वीर: "साइलेंट पार्टनर" की समस्या

कल्प‌ना कीजिए कि आपने अपने सपनों का घर बनाने के लिए एक बेहद बुद्धिमान और तेज़ आर्किटेक्ट (एक AI) को काम पर रखा है। आप उसे कहते हैं, "मुझे एक रसोई वाला घर चाहिए।"

आर्किटेक्ट तुरंत ब्लूप्रिंट बनाना शुरू कर देता है। लेकिन रुकिए! आपने यह नहीं बताया कि:

  • क्या आपको चूल्हा चाहिए या माइक्रोवेव?
  • क्या आपको बीच में एक आइलैंड (island) चाहिए?
  • क्या आप दीवारों पर नीला रंग चाहते हैं या बेज (beige)?
  • क्या आपको सिंक के ऊपर खिड़की चाहिए?

क्योंकि आर्किटेक्ट ने ये सवाल नहीं पूछे, इसलिए वह एक ऐसा घर बनाता है जो दिखने में तो अच्छा है लेकिन आपके काम का नहीं है। सॉफ्टवेयर की दुनिया में इसे "Requirements Elicitation Failure" (आवश्यकता जुटाने में विफलता) कहा जाता है। AI कोड लिखने (घर बनाने) में तो बहुत अच्छा है, लेकिन वह यह जानने के लिए सही सवाल पूछने में बहुत बुरा है कि वास्तव में आपको क्या चाहिए।

यह शोध पत्र ReqElicitGym नामक एक नया टूल पेश करता है ताकि यह परीक्षण किया जा सके कि AI एक "निर्माता" के बजाय एक "जासूस" बनने में कितना कुशल है।


ReqElicitGym क्या है? (द "इंटरव्यू डोजो")

ReqElicitGym को एक सिम्युलेटेड इंटरव्यू डोजो या AI इंटरव्यूअर्स के लिए एक फ्लाइट सिम्युलेटर के रूप में समझें।

पहले, यदि आप यह परीक्षण करना चाहते थे कि क्या कोई AI लोगों का इंटरव्यू लेने में अच्छा है, तो आपको "ग्राहकों" की भूमिका निभाने के लिए वास्तविक मनुष्यों को काम पर रखना पड़ता था। यह महंगा, धीमा और असंगत था (एक इंसान बातूनी हो सकता था, दूसरा शांत)।

ReqElicitGym खेल बदल देता है क्योंकि यह तीन मुख्य भागों के साथ एक पूरी तरह से स्वचालित, डिजिटल प्लेग्राउंड बनाता है:

1. "हिडन ट्रेजर मैप" (डेटासेट)

शोधकर्ताओं ने 101 अलग-अलग परिदृश्य बनाए (जैसे "एक स्टॉक ट्रेडिंग वेबसाइट बनाएं" या "एक जॉब बोर्ड बनाएं")।

  • शुरुआती सुराग: उपयोगकर्ता एक अस्पष्ट अनुरोध देता है ("मुझे एक स्टॉक वेबसाइट चाहिए")।
  • छिपा हुआ खजाना (Implicit Requirements): विवरणों की एक गुप्त सूची (600+ विशिष्ट विवरण) जो उपयोगकर्ता बताना भूल गया है (जैसे, "बैकग्राउंड सफेद होना चाहिए," "रिपोर्ट्स में मार्केट ट्रेंड्स दिखने चाहिए")।
  • अंतिम मानचित्र: वेबसाइट आवश्यकताओं का पूर्ण, सटीक संस्करण।

AI का काम सवाल पूछकर उस "छिपे हुए खजाने" को ढूंढना है।

2. "रोबोट कस्टमर" (द ओरकल यूजर)

एक वास्तविक मानव के बजाय, सिस्टम एक अत्यधिक उन्नत AI (GPT-5.1) का उपयोग ग्राहक की भूमिका निभाने के लिए करता है।

  • नियम: इस रोबोट कस्टमर को ईमानदार लेकिन निष्क्रिय रहने के लिए प्रोग्राम किया गया है। यह किसी भी छिपे हुए विवरण को केवल तभी प्रकट करेगा जब इंटरव्यू लेने वाला व्यक्ति उसे अनलॉक करने के लिए बिल्कुल सही सवाल पूछेगा।
  • उपमा: एक वीडियो गेम NPC (नॉन-प्लेयर कैरेक्टर) की कल्पना करें जो आपको तिजोरी का पासवर्ड तब तक नहीं बताएगा जब तक आप यह नहीं पूछते, "पासवर्ड क्या है?" यदि आप केवल "दरवाजा खोलो" कहते हैं, तो वह चुप रहता है। यह इंटरव्यू लेने वाले AI को जानकारी निकालने के लिए वास्तव में मेहनत करने के लिए मजबूर करता है।

3. "सख्त जज" (द टास्क इवैल्यूएटर)

जब इंटरव्यू चल रहा होता है, तो एक तीसरा AI रेफरी के रूप में कार्य करता है। वह इंटरव्यू लेने वाले द्वारा पूछे गए हर सवाल को देखता है और उन्हें स्कोर देता है:

  • क्या आपने "स्पष्टीकरण" (Clarification) वाला सवाल पूछा (जो कहा गया उसे चेक करना)?
  • क्या आपने "प्रोब" (Probe) वाला सवाल पूछा (नई जानकारी के लिए गहराई तक जाना)?
  • क्या आपने वास्तव में एक छिपी हुई आवश्यकता को खोजा?
  • क्या आपने बहुत जल्दी बात करना बंद कर दिया?

उन्होंने क्या पाया? (द "रिपोर्ट कार्ड")

शोधकर्ताओं ने 7 सबसे स्मार्ट AI (जैसे GPT-4, Claude, Gemini, आदि) को इस जिम के माध्यम से टेस्ट किया। यहाँ क्या हुआ:

1. "साइलेंट मेजॉरिटी" की समस्या

सबसे अच्छे AI ने भी केवल लगभग 32% छिपी हुई आवश्यकताओं को ही खोजा।

  • उपमा: यह एक ऐसे जासूस की तरह है जिसने हत्या की गुत्थी तो सुलझा ली, लेकिन यह पूछना भूल गया कि पीड़ित कौन था, वह वहां क्यों था, या हथियार क्या था। उसने शव तो ढूंढ लिया, लेकिन पूरी कहानी मिस कर दी।

2. "सोचने" का विरोधाभास (CoT बनाम Non-CoT)

शोधकर्ताओं ने दो मोड का परीक्षण किया:

  • डायरेक्ट मोड: AI तुरंत एक सवाल पूछता है।
  • थिंकिंग मोड (Chain of Thought): AI को सवाल पूछने से पहले "कदम-दर-कदम सोचने" के लिए कहा जाता है।
  • परिणाम: "थिंकिंग" मोड ने AI को सवाल तेजी से और अधिक कुशलता से पूछने में मदद की, लेकिन इसने उन्हें अधिक छिपे हुए विवरण खोजने में मदद नहीं की। वे गलत होने में कुशल थे, या आसान सवालों को पूछने में कुशल थे जबकि कठिन सवालों को अनदेखा कर रहे थे।

3. "स्टाइल ब्लाइंडनेस" (शैली के प्रति अंधापन)

AI फंक्शन (साइट कैसे काम करती है) और कंटेंट (क्या डेटा दिखाया जाता है) के बारे में पूछने में ठीक थे।

  • विफलता: वे स्टाइल (रंग, फोंट, लेआउट) के बारे में पूछने में बहुत खराब थे।
  • उपमा: यदि आप किसी AI को वेबसाइट डिजाइन करने के लिए कहते हैं, तो वह एक बेहतरीन इंजन और एक शानदार डैशबोर्ड बनाएगा, लेकिन वह पूरी चीज़ को कॉमिक सैन्स (Comic Sans) फोंट के साथ नियॉन हरे रंग में पेंट कर सकता है क्योंकि उसने कभी यह पूछने के बारे में नहीं सोचा कि "आपको कौन से रंग पसंद हैं?"

4. "प्रोब" की लत

AI ने "प्रोबिंग" सवाल (व्यापक, खुले अंत वाले अनुमान) पूछना पसंद किया लेकिन "क्लैरिफिकेशन" सवाल (विवरणों की जांच करना) पूछने से परहेज किया।

  • उपमा: यह एक वेटर की तरह है जो बार-बार अनुमान लगाता रहता है, "क्या आपको स्टेक चाहिए?" "क्या आपको चिकन चाहिए?" "क्या आपको फिश चाहिए?" बजाय इसके कि वह बस पूछे, "आपने क्या ऑर्डर किया था?" वे स्पष्ट करने के बजाय बेतहाशा अनुमान लगा रहे थे।

यह क्यों मायने रखता है?

यह शोध पत्र एक चेतावनी है। हम इस बात पर जुनूनी हैं कि AI कितनी अच्छी तरह कोड लिख सकता है (घर बनाना), लेकिन हम इस बात को नजरअंदाज कर रहे हैं कि वह ब्रीफ (निर्देश) को कितनी अच्छी तरह समझ सकता है (सही सवाल पूछना)।

यदि हम इसे ठीक नहीं करते हैं, तो हमारे पास लाखों ऐसे सॉफ्टवेयर प्रोजेक्ट होंगे जो तकनीकी रूप से तो परफेक्ट होंगे, लेकिन उन लोगों के लिए पूरी तरह से बेकार होंगे जिन्होंने उनके लिए भुगतान किया है। ReqElicitGym हमें AI को बेहतर श्रोता और बेहतर जासूस बनने के लिए प्रशिक्षित करने का एक तरीका प्रदान करता है, जिससे यह सुनिश्चित होता है कि जब वे आपका सॉफ्टवेयर बनाएं, तो वह वास्तव में आपकी आवश्यकताओं के अनुरूप हो।

मुख्य बात: AI एक जीनियस बिल्डर है, लेकिन फिलहाल, वह एक बहुत बुरा इंटरव्यूअर है। हमें इसे निर्माण शुरू करने से पहले सही सवाल पूछना सिखाने की जरूरत है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →