← नवीनतम पेपर
🤖 AI

CDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement Recipes

यह शोध पत्र CDR-Bench प्रस्तुत करता है, जो संयोजी (compositional), क्रम-संवेदनशील डेटा परिशोधन कार्यों पर LLMs के मूल्यांकन के लिए एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल प्रक्रियात्मक विश्वसनीयता की कमी के कारण जटिल, बहु-चरणीय रेसिपीज़ को निष्ठापूर्वक निष्पादित करने में लगातार विफल रहते हैं।

मूल लेखक: Yuchen Huang, Xiang Li, Zhenqing Ling, Sijia Li, Qianli Shen, Daoyuan Chen, Yi R. Fung, Yaliang Li

प्रकाशित 2026-07-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuchen Huang, Xiang Li, Zhenqing Ling, Sijia Li, Qianli Shen, Daoyuan Chen, Yi R. Fung, Yaliang Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान सहायक (एक AI) है जो सरल निर्देशों का पालन करने में माहिर है। यदि आप उनसे कहते हैं, "इस पन्ने से लाल स्याही हटा दें," तो वे इसे पूरी तरह से करते हैं। यदि आप उनसे कहते हैं, "वर्तनी (spelling) ठीक करें," तो वे वह भी कर देते हैं।

लेकिन क्या होता है यदि आप उन्हें एक जटिल, बहु-चरणीय रेसिपी (विधि) देते हैं? जैसे: "पहले, लाल स्याही हटाओ, फिर वर्तनी ठीक करो, फिर जाँच करो कि क्या पन्ना 10 पंक्तियों से लंबा है, और यदि यह लंबा है, तो इसे रखो; यदि नहीं, तो इसे फेंक दो।"

यह शोध पत्र, CDR-Bench, एक विशाल, कठोर 'टेस्ट किचन' की तरह है जिसे यह देखने के लिए डिज़ाइन किया गया है कि क्या ये AI सहायक वास्तव में क्रम या चरणों को छोड़े बिना ऐसी जटिल, बहु-चरणीय रेसिपी का पालन कर सकते हैं।

समस्या: "रेसिपी" बनाम "परिणाम"

लेखकों ने पाया कि हालांकि AI मॉडल इस बात में अच्छे हैं कि वे ऐसा दिखा सकें कि उन्होंने रेसिपी का पालन किया है, लेकिन वे विशिष्ट चरणों के क्रम को ईमानदारी से निष्पादित (faithfully executing) करने में अक्सर विफल हो जाते हैं।

इसे केक बनाने के उदाहरण से समझें।

  • परमाणु कार्य (Atomic Task): "चीनी डालें।" (AI इसे पूरी तरह से करता है)।
  • संयोजन कार्य (Compositional Task): "चीनी डालें, फिर मिलाएँ, फिर आटा डालें, फिर फिर से मिलाएँ।" (AI चीनी मिलाने से पहले आटा डाल सकता है, या दूसरी बार मिलाने को भूल सकता है)।
  • क्रम-संवेदनशील कार्य (Order-Sensitive Task): यहाँ मामला पेचीदा हो जाता है। कल्पना कीजिए कि एक नियम है: "यदि बैटर बहुत पतला है, तो इसे फेंक दें।"
    • क्रम A: आटा डालें (इससे मिश्रण गाढ़ा होता है) -> मोटाई की जाँच करें -> रख लें
    • क्रम B: मोटाई की जाँच करें (यह पतला है) -> फेंक दें -> (आप कभी आटा डालने तक नहीं पहुँच पाते)।

AI अक्सर केक का अंतिम रूप सही बना लेता है, लेकिन उसने केक बनाने की प्रक्रिया में गलती कर दी। वह केक को तब भी रख सकता है जब उसे फेंक देना चाहिए था, या इसके विपरीत, केवल इसलिए क्योंकि उसने चरणों का पालन ठीक उसी क्रम में नहीं किया जैसा आपने कहा था।

टेस्ट किचन: CDR-Bench

शोधकर्ताओं ने CDR-Bench नामक एक विशाल परीक्षण बनाया जिसमें 3,400 से अधिक अलग-अलग "रेसिपियाँ" शामिल हैं जो चार वास्तविक दुनिया के परिदृश्यों को कवर करती हैं:

  1. वेब रिफाइनमेंट (Web Refinement): अव्यवस्थित वेब पेजों को साफ करना।
  2. LaTeX रिफाइनमेंट: वैज्ञानिक दस्तावेजों को ठीक करना।
  3. RAG तैयारी (RAG Preparation): सर्च इंजन के लिए डेटा तैयार करना।
  4. गोपनीयता रेडैक्शन (Privacy Redaction): नाम, ईमेल और फोन नंबरों को छिपाना।

उन्होंने 29 अलग-अलग "टूल्स" (जैसे ईमेल हटाने का टूल, विराम चिह्न ठीक करने का टूल, शब्दों की गिनती करने का टूल) बनाए और उन्हें हजारों अलग-अलग रेसिपी में मिला दिया।

उन्होंने क्या खोजा

जब उन्होंने आज के सबसे स्मार्ट 10 से अधिक AI मॉडलों का परीक्षण किया, तो परिणाम आश्चर्यजनक और थोड़े चिंताजनक थे:

  1. "कंपोजिशन गैप" (The Composition Gap): जब AI को केवल एक काम करना होता था, तो वह बहुत अच्छा था (लगभग 30-80% सफलता)। लेकिन जैसे ही आपने 3 या 4 चरणों को एक साथ जोड़ा, इसकी सफलता दर तेजी से गिर गई। यह एक ऐसे संगीतकार की तरह है जो एक एकल नोट तो पूरी तरह से बजा सकता है लेकिन पूरा गाना बजाने के लिए कहा जाने पर बिखर जाता है।
  2. क्रम से अधिक फर्क पड़ता है: यदि आप दो चरणों का क्रम बदल देते हैं (जैसे, "नाम छिपाएं" फिर "लंबाई की जाँच करें" बनाम "लंबाई की जाँच करें" फिर "नाम छिपाएं"), तो AI अक्सर पूरी तरह से विफल हो जाता है। कुछ परीक्षणों में, 5% से भी कम मॉडल हर बार क्रम को सही कर सके।
  3. "स्टॉप" बटन की विफलता: कई रेसिपी में एक चरण शामिल होता है जो कहता है, "यदि टेक्स्ट बहुत छोटा है, तो रुकें और इसे हटा दें।" AI अक्सर इस स्टॉप साइन को अनदेखा कर देता है, प्रोसेसिंग जारी रखता है, और एक ऐसा परिणाम देता है जिसे उसे नहीं बनाना चाहिए था।
  4. सोचना हमेशा मदद नहीं करता: भले ही शोधकर्ताओं ने AI को "चरण-दर-चरण सोचें" या "कार्य करने से पहले योजना बनाएं" कहा, फिर भी मॉडल सख्त परिचालन क्रम के साथ संघर्ष करते रहे। वे एक अच्छी योजना लिख सकते थे, लेकिन वे हमेशा इसे पूरी तरह से निष्पादित नहीं कर सके।

"विश्वसनीय झूठ" (Plausible Lie) का रूपक

यह शोध पत्र सुझाव देता है कि वर्तमान AI उन अभिनेताओं की तरह हैं जो एक विश्वसनीय अंत का अभिनय करने (improvising a plausible ending) में बहुत अच्छे हैं।

  • लक्ष्य: आप चाहते हैं कि अभिनेता एक सख्त पटकथा का पालन करे।
  • वास्तविकता: अभिनेता पटकथा पढ़ता है, सामान्य भाव को समझता है, और फिर एक सुखद अंत तक पहुँचने के लिए बीच के हिस्सों को खुद से बना लेता है जो सही दिखता है।
  • समस्या: डेटा रिफाइनमेंट में, "बीच के हिस्से" (सफाई, फ़िल्टरिंग और जाँच का सटीक क्रम) अत्यंत महत्वपूर्ण हैं। यदि अभिनेता एक चरण छोड़ देता है या क्रम बदल देता है, तो अंतिम "साफ" डेटा ठीक लग सकता है, लेकिन वह वास्तव में खराब या असुरक्षित हो सकता है।

निष्कर्ष

यह शोध पत्र निष्कर्ष निकालता है कि हम केवल यह मानकर नहीं चल सकते कि AI जटिल डेटा सफाई कार्यों को अकेले संभालने के लिए तैयार है। जबकि वे एकल कार्यों के लिए उत्कृष्ट हैं, उनमें प्रक्रियात्मक निष्ठा (procedural faithfulness) की कमी है—यानी निर्देशों के अनुक्रम का बिना भटके, छोड़े या पुनर्व्यवस्थित किए, सख्ती से पालन करने की क्षमता।

जब तक AI लिखित रेसिपी का बिल्कुल वैसे ही पालन करने के लिए भरोसेमंद नहीं हो जाता, तब तक मनुष्यों को केवल अंतिम व्यंजन की जाँच करने के बजाय "खाना पकाने की प्रक्रिया" पर कड़ी नज़र रखनी होगी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →