← नवीनतम पेपर
🤖 AI

A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks

मौजूदा एजेंट बेंचमार्क की संतृप्ति और सीमित टूल-उपयोग कवरेज को संबोधित करने के लिए, यह शोध पत्र TASTE पेश करता है, जो एक स्वचालित विधि है जो चुनौतीपूर्ण, उच्च-कवरेज τc\tau^c-Bench उत्पन्न करने के लिए टूल अनुक्रमों को विकसित करके कार्य निर्माण प्रक्रिया को उलट देती है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल इन अधिक जटिल और विविध कार्यों का सामना करने पर महत्वपूर्ण प्रदर्शन गिरावट का शिकार होते हैं।

मूल लेखक: Tomer Keren, Nitay Calderon, Asaf Yehudai, Yotam Perlitz, Michal Shmueli-Scheuer, Roi Reichert

प्रकाशित 2026-05-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Tomer Keren, Nitay Calderon, Asaf Yehudai, Yotam Perlitz, Michal Shmueli-Scheuer, Roi Reichert

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह परीक्षण करने की कोशिश कर रहे हैं कि एक नया रोबोट शेफ खाना बनाने में कितना कुशल है।

समस्या: "आसान मेनू" खत्म हो चुका है
अभी हमारे पास एक मानक परीक्षण मेनू (जिसे τ\tau-Bench कहा जाता है) है जहाँ रोबोट को "सैंडविच बनाना" या "पिज्जा ऑर्डर करना" जैसे निर्देशों का पालन करना होता है। समस्या यह है कि सबसे स्मार्ट रोबोट शेफ ने पहले से ही इस मेनू को रट लिया है। वे बेहतरीन स्कोर प्राप्त करते हैं, लेकिन यह इसलिए नहीं है क्योंकि वे जीनियस हैं; बल्कि इसलिए क्योंकि परीक्षण बहुत आसान और दोहराव वाला है। यह बिल्कुल वैसा ही है जैसे कोई छात्र गणित के टेस्ट में A+ प्राप्त करता है क्योंकि शिक्षक उससे केवल एक अंक वाली संख्याओं को जोड़ने के लिए कहता है।

साथ ही, नए, कठिन परीक्षण प्रश्न बनाना एक बुरा सपना है। इसके लिए मनुष्यों को बैठने, जटिल कहानियाँ लिखने, यह तय करने कि रोबोट को सटीक रूप से क्या कदम उठाने चाहिए, और यह जाँचने की आवश्यकता होती है कि कहानी का अर्थ बनता है या नहीं। यह धीमा, महंगा है, और हमें केवल उन्हीं प्रकार की कहानियों तक सीमित कर देता है जो मनुष्य सोच पाते हैं।

समाधान: TASTE (द "रिवर्स रेसिपी" मशीन)
लेखकों ने TASTE (टास्क सिंथेसिस फ्रॉम टूल सीक्वेंस इवोल्यूशन) नामक एक नई प्रणाली बनाई है। एक कहानी से शुरू करके उसके चरणों को समझने के बजाय, TASTE इस प्रक्रिया को उल्टा कर देता है।

इसे इस तरह सोचें:

  1. "टूल सीक्वेंस" (चरण): सबसे पहले, सिस्टम क्रियाओं की हजारों यादृच्छिक सूचियाँ बनाता है, जैसे "फ्रिज खोलें, दूध उठाएं, गिलास में डालें, फ्रिज बंद करें।"
  2. "प्लॉसिबिलिटी फ़िल्टर" (स्वाद परीक्षण): यह इन सूचियों को देखने के लिए एक सुपर-स्मार्ट AI जज का उपयोग करता है और कहता है, "नहीं, यह असंभव है। आप फ्रिज खोलने से पहले दूध नहीं डाल सकते," या "हाँ, यह घटनाओं का एक वैध क्रम है।" यह अपनी गलतियों से सीखता है, वैध बनाम अमान्य चरणों को पहचानने में बेहतर होता जाता है।
  3. "क्लस्टरिंग" (स्वाद के आधार पर समूहीकरण): यह वैध अनुक्रमों को एक साथ समूहित करता है। यदि एक समूह "नाश्ता बनाने" के बारे में है और दूसरा "सैंडविच बनाने" के बारे में है, तो यह सुनिश्चित करने के लिए कि परीक्षण विभिन्न परिदृश्यों को कवर करे, यह प्रत्येक समूह से सबसे प्रतिनिधि उदाहरण चुनता है।
  4. "इवोल्यूशन" (मसाला लगाना): यही असली सीक्रेट सॉस है। एक बार जब इसके पास एक बुनियादी कार्य (जैसे, "पिज्जा ऑर्डर करें") होता है, तो यह जानबूझकर इसे कठिन बनाता है। यह ऐसा कर सकता है:
    • ग्राहक (सिम्युलेटेड यूजर) को अपने ऑर्डर का विवरण भूलने के लिए प्रेरित करना।
    • मेनू में "डिकॉय" (भटकाने वाले) विकल्प जोड़ना जो सही दिखते हैं लेकिन वास्तव में गलत हैं (जैसे कि एक पिज्जा जो बिक चुका है)।
    • ग्राहक को असहयोगी या भ्रमित करने वाला बनाना।

परिणाम: τc\tau^c-Bench
इस विधि का उपयोग करके, उन्होंने एक नया, बहुत कठिन परीक्षण बनाया जिसे τc\tau^c-Bench कहा जाता है।

जब उन्होंने "चैंपियन" रोबोट शेफ (जैसे Gemini-3-Flash) का इस नए मेनू पर परीक्षण किया, तो परिणाम चौंकाने वाले थे।

  • पुराने, आसान मेनू पर, इन रोबोटों का स्कोर 0.90 (लगभग पूर्ण) था।
  • नए, TASTE-जनरेटेड मेनू पर, उनका स्कोर 0.30 या उससे कम गिर गया।

यह क्यों मायने रखता है
यह पेपर तर्क देता है कि पुराने परीक्षणों पर उच्च स्कोर एक "गलत सूचना" (false alarm) था। रोबोट वास्तव में जटिल, वास्तविक दुनिया की समस्याओं को हल करने में उतने अच्छे नहीं थे; वे बस पुराने टेस्ट प्रश्नों को रट चुके थे।

नई विधि सिद्ध करती है कि:

  • कवरेज: नए परीक्षण रोबोटों को उपकरणों और संयोजनों की एक बहुत विस्तृत श्रृंखला का उपयोग करने के लिए मजबूर करते हैं, न कि केवल उन्हीं कुछ पुराने तरीकों का।
  • कठिनाई: परीक्षण वास्तव में कठिन हैं क्योंकि उनमें भ्रम, अधूरी जानकारी और पेचीदा परिदृश्य शामिल हैं।
  • स्वचालन (ऑटोमेशन): हमें अब इन कठिन परीक्षणों को लिखने के लिए मनुष्यों की आवश्यकता नहीं है। सिस्टम चुनौतीपूर्ण, वैध और विविध कार्यों की एक अंतहीन आपूर्ति उत्पन्न कर सकता है ताकि जैसे-जैसे रोबोट स्मार्ट होते जाएं, उनका परीक्षण किया जा सके।

संक्षेप में, TASTE एक ऐसी मशीन है जो स्वचालित रूप से AI एजेंटों के लिए "बॉस बैटल्स" (कठिन मुकाबले) का आविष्कार करती है, जिससे हम यह सुनिश्चित कर सकें कि हम एक ऐसे रोबोट के बीच अंतर कर सकें जिसने स्क्रिप्ट रट ली है और एक ऐसे रोबोट के बीच जो वास्तव में सोच सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →