← नवीनतम पेपर
💬 NLP

SynAE: A Framework for Measuring the Quality of Synthetic Data for Tool-Calling Agent Evaluations

यह शोधपत्र SynAE को प्रस्तुत करता है, जो एक बहु-अक्षीय मूल्यांकन ढांचा (multi-axis evaluation framework) है जिसे कार्य निर्देशों, टूल कॉल्स, आउटपुट और डाउनस्ट्रीम प्रदर्शन का विश्लेषण करके टूल-कॉलिंग एजेंटों के लिए सिंथेटिक डेटासेट की वैधता, निष्ठा (fidelity) और विविधता का आकलन करने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि सिंथेटिक डेटा की गुणवत्ता को स्पष्ट करने के लिए कोई भी एकल मीट्रिक पर्याप्त नहीं है।

मूल लेखक: Shuaiqi Wang, Aadyaa Maddi, Zinan Lin, Giulia Fanti

प्रकाशित 2026-05-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuaiqi Wang, Aadyaa Maddi, Zinan Lin, Giulia Fanti

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक नई रेसिपी को बेहतर बनाने की कोशिश कर रहे हैं। आमतौर पर, आप अपने व्यंजन का स्वाद असली सामग्री का उपयोग करके चखते हैं। लेकिन कभी-कभी, आप असली बाजार का उपयोग नहीं कर सकते (शायद यह बहुत महंगा है, या सामग्रियां गुप्त हैं)। इसलिए, आप सिंथेटिक सामग्रियों (synthetic ingredients) के साथ खाना पकाने का निर्णय लेते—नकली सब्जियां और लैब में बनाई गई कृत्रिम मीट।

समस्या क्या है? आपको नहीं पता कि आपकी नकली सामग्री वास्तव में असली चीज़ जैसी होगी या नहीं, या क्या वह आपके व्यंजन को बिखेर देगी।

यह पेपर SynAE पेश करता है, जो एक "टेस्ट-टेस्टर" फ्रेमवर्क है जिसे विशेष रूप से आपके ग्राहकों (इस मामले में, AI एजेंटों) को परोसने से पहले आपकी सिंथेटिक सामग्रियों की गुणवत्ता की जांच करने के लिए डिज़ाइन किया गया है।

SynAE कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "नकली डेटा" का अंधा धब्बा (The "Fake Data" Blind Spot)

AI एजेंटों (स्मार्ट प्रोग्राम जो सर्च इंजन या कैलकुलेटर जैसे टूल्स का उपयोग कर सकते हैं) का परीक्षण करने की आवश्यकता होती है। आमतौर पर, डेवलपर्स उनका परीक्षण असली डेटा (मदद मांगने वाले वास्तविक लोगों के रिकॉर्ड) पर करते हैं। लेकिन असली डेटा अक्सर निजी, संवेदनशील या सब कुछ परीक्षण करने के लिए बहुत छोटा होता है।

इसलिए, डेवलपर्स सिंथेटिक डेटा बनाते हैं—कंप्यूटर द्वारा उत्पन्न नकली बातचीत और कार्य जो वास्तविक जीवन की नकल करते हैं।

  • जोखिम: सिर्फ इसलिए कि नकली डेटा असली डेटा जैसा दिखता है, इसका मतलब यह नहीं है कि वह असली डेटा की तरह काम भी करेगा। यह दिखने में एकदम सही हो सकता है लेकिन जब AI इसे इस्तेमाल करने की कोशिश करता है, तो विफल हो सकता है।
  • अंतराल (Gap): अब तक, इस बात को मापने के लिए कोई मानक "रूलर" (पैमाना) नहीं था कि यह नकली डेटा वास्तव में कितना अच्छा या बुरा है।

2. समाधान: SynAE (गुणवत्ता नियंत्रण निरीक्षक)

SynAE एक फ्रेमवर्क है जो असली डेटासेट (स्वर्ण मानक/gold standard) की तुलना सिंथेटिक डेटासेट (नकली डेटा) से करता है। यह केवल "अच्छा" या "बुरा" नहीं कहता; यह तीन विशिष्ट गुणों को मापता है:

A. वैधता (Validity): "क्या यह वास्तव में काम करता है?"

  • उपमा: कल्पना कीजिए कि एक नकली रेसिपी कहती है "5 कप चीनी डालें।" यदि आप इसका पालन करते हैं, तो आपका केक जल जाता है। वह अवैध (invalid) है।
  • SynAE क्या जाँचता है: यह पूछता है, "यदि एक AI इन नकली निर्देशों का पालन करता है, तो क्या वह वास्तव में कार्य को पूरा करता है?" यह जाँचता है कि क्या टूल कॉल (जैसे बटन क्लिक करना) और अंतिम उत्तर तर्कसंगत हैं और समस्या को हल करते हैं। यदि निर्देश भ्रमित करने वाले हैं या किसी डेड एंड (बंद रास्ते) की ओर ले जाते हैं, तो SynAE इसे "अवैध" के रूप में चिह्नित करता है।

B. फिडेलिटी (Fidelity): "क्या यह असली चीज़ जैसा महसूस होता है?"

  • उपमा: कल्पना कीजिए कि एक मोम का फल है। यह एक सेब जैसा दिखता है, लेकिन यदि आप इसे काटते हैं, तो यह सख्त और बेस्वाद होता है। इसमें एक असली सेब जैसी "फिडेलिटी" (वफादारी/समानता) की कमी है।
  • SynAE क्या जाँचता है: यह नकली डेटा की असली डेटा से तुलना करता है ताकि यह देखा जा सके कि वे कितने समान हैं।
    • संरचना (Structure): क्या नकली बातचीत में असली बातचीत की तरह ही आगे-पीछे होने का तालमेल है?
    • पैटर्न (Patterns): क्या नकली एजेंट असली एजेंटों की तरह ही एक ही क्रम और आवृत्ति में टूल्स का उपयोग करते हैं?
    • सामग्री (Content): क्या नकली प्रश्न और उत्तर अर्थ संबंधी (semantically) रूप से असली वाले के करीब हैं?
      अगर नकली डेटा वास्तविक दुनिया से बहुत अलग है, तो इसकी फिडेलिटी कम है।

C. विविधता (Diversity): "क्या यह उबाऊ है या दिलचस्प?"

  • उपमा: कल्पना कीजिए कि एक प्लेलिस्ट जहाँ एक ही गाना 100 बार बजता है। वह विविध नहीं है। अब कल्पना कीजिए कि एक प्लेलिस्ट जिसमें 100 अलग-अलग शैलियाँ (genres) हैं। वह विविध है।
  • SynAE क्या जाँचता है: यह मापता कि सिंथेटिक डेटा विभिन्न प्रकार के परिदृश्यों को कवर करता है या नहीं। यदि नकली डेटा बार-बार केवल कुछ ही प्रकार के प्रश्नों को दोहराता है, तो इसमें विविधता कम है। यह बुरा है क्योंकि AI नई, अजीब स्थितियों को संभालने के लिए नहीं सीख पाएगा।

3. उन्होंने इसका परीक्षण कैसे किया

लेखकों ने केवल इसके बारे में बात नहीं की; उन्होंने एक "स्ट्रेस टेस्ट" लैब बनाई। उन्होंने वास्तविक डेटासेट लिए और उन्हें विशेष रूप से कुछ तरीकों से खराब किया ताकि यह देखा जा सके कि क्या SynAE त्रुटियों को पकड़ पाता है:

  • "ब्लैंक फिलिंग" टेस्ट: उन्होंने वास्तविक निर्देशों को लिया और यादृच्छिक (random) शब्दों को छिपा दिया, जिससे AI को बाकी शब्दों का अनुमान लगाने के लिए मजबूर होना पड़ा। जैसे-जैसे उन्होंने अधिक शब्द छिपाए, डेटा बदतर होता गया। SynAE ने सही ढंग से पता लगाया कि फिडेलिटी गिर गई (यह अब असली चीज़ जैसा नहीं रहा) लेकिन विविधता बढ़ गई (अनुमान इधर-उधर के थे)।
  • "कॉपी-पेस्ट" टेस्ट: उन्होंने कुछ वास्तविक उदाहरण लिए और उन्हें 100 बार कॉपी किया। SynAE ने सही ढंग से चिह्नित किया कि विविधता गिर गई (सब एक जैसा था) भले ही फिडेलिटी उच्च बनी रही (यह अभी भी असली चीज़ जैसा दिख रहा था)।
  • "ब्रोकन टूल" टेस्ट: उन्होंने निर्देश तो रखे लेकिन AI को उपयोग करने के लिए गलत टूल्स दे दिए। SynAE ने पकड़ लिया कि वैधता खत्म हो गई थी क्योंकि कार्यों को पूरा नहीं किया जा सकता था।

4. बड़ी खोज

सबसे महत्वपूर्ण निष्कर्ष यह है कि कोई भी एक संख्या पूरी कहानी नहीं बताती।

  • आपके पास ऐसा डेटा हो सकता है जो बहुत वैध (valid) है (यह काम करता है) लेकिन जिसकी विविधता कम (low diversity) है (यह उबाऊ है)।
  • आपके पास ऐसा डेटा हो सकता है जो बहुत विविध (diverse) है (यह रोमांचक है) लेकिन जिसकी फिडेलिटी कम (low fidelity) है (यह वास्तविक दुनिया जैसा नहीं दिखता)।
  • आपके पास ऐसा डेटा हो सकता है जो बिल्कुल परफेक्ट दिखता है (उच्च फिडेलिटी) लेकिन टूटा हुआ (low validity) है।

निष्कर्ष

SynAE AI डेवलपर्स के लिए एक मल्टी-एक्सिस डैशबोर्ड की तरह है। यह अनुमान लगाने के बजाय कि उनका नकली डेटा अच्छा है या नहीं, वे SynAE का उपयोग यह देखने के लिए कर सकते हैं कि यह कहाँ विफल हो रहा है। क्या यह बहुत दोहराव वाला है? क्या यह वास्तविकता से बहुत अलग है? क्या यह वास्तव में टूटा हुआ है?

पेपर यह निष्कर्ष निकालता है कि अपने AI एजेंटों का परीक्षण करने के लिए सिंथेटिक डेटा पर भरोसा करने से पहले, आपको इस तरह के विस्तृत, बहु-आयामी चेकअप की आवश्यकता है ताकि यह सुनिश्चित हो सके कि आप अपने AI को ऐसे "मोम के फल" पर प्रशिक्षित नहीं कर रहे हैं जो असली दिखता तो है लेकिन उसमें कोई स्वाद नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →