← नवीनतम पेपर
💬 NLP

GAICo: A Deployed and Extensible Framework for Evaluating Diverse and Multimodal Generative AI Outputs

GAICo एक तैनात, ओपन-सोर्स पायथन फ्रेमवर्क है जो पुनरुत्पादकता और सिस्टम विश्वसनीयता को बढ़ाने के लिए मेट्रिक्स, विज़ुअलाइज़ेशन टूल्स और रिपोर्टिंग क्षमताओं के एक एकीकृत, विस्तार योग्य सुइट के माध्यम से विविध, मल्टीमॉडल जेनरेटिव एआई आउटपुट्स के मूल्यांकन को मानकीकृत और सुव्यवस्थित करता है।

मूल लेखक: Nitin Gupta, Pallav Koppisetti, Kausik Lakkaraju, Biplav Srivastava

प्रकाशित 2026-03-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nitin Gupta, Pallav Koppisetti, Kausik Lakkaraju, Biplav Srivastava

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हाई-टेक किचन के हेड शेफ हैं। आपने जटिल भोजन बनाने के लिए AI शेफ (जेनेरेटिव AI) की एक टीम को काम पर रखा है। कुछ शेफ रेसिपी लिखने (टेक्स्ट) में माहिर हैं, कुछ खाना सजाने (इमेज) में अद्भुत हैं, और कुछ खाना पकाने की सरसराहट की आवाज़ों (ऑडियो) को रिकॉर्ड करने में विशेषज्ञ हैं।

समस्या यह है कि अब तक, इन सभी अलग-अलग व्यंजनों का एक साथ स्वाद लेने का कोई तरीका नहीं था। यदि कोई भोजन खराब होता, तो आपको पता नहीं चलता कि रेसिपी लिखने वाले ने निर्देश गलत लिखे थे, या प्लेटिंग आर्टिस्ट ने खाना गिरा दिया था, या साउंड इंजीनियर ने बहुत अधिक शोर रिकॉर्ड कर लिया था। डेवलपर्स हर एक व्यंजन के लिए अपने स्वयं के, बिखरे हुए "टेस्टिंग स्क्रिप्ट्स" लिखने में फंसे हुए थे, जिससे यह तुलना करना असंभव हो गया था कि वास्तव में सबसे अच्छा शेफ कौन है।

पेश है GAICo: द यूनिवर्सल फूड क्रिटिक (सार्वभौमिक खाद्य आलोचक)।

यह पेपर GAICo (जेनेरेटिव AI कंपैरेटर) को पेश करता है, जो एक नया, ओपन-सोर्स टूल है जो AI के लिए एक सुपर-स्मार्ट, मानकीकृत खाद्य आलोचक के रूप में कार्य करता है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: AI टेस्टिंग का "टॉवर ऑफ बेबेल"

GAICo से पहले, यदि आप एक ऐसे AI का परीक्षण करना चाहते थे जो यात्रा योजना लिखता था, मानचित्र बनाता था और वॉयस गाइड रिकॉर्ड करता था, तो आपको तीन पूरी तरह से अलग उपकरणों का उपयोग करना पड़ता था।

  • टेक्स्ट को जांचने के लिए, आप एक "टेक्स्ट रूलर" का उपयोग करते थे।
  • मानचित्र को जांचने के लिए, आप एक "पिक्सेल रूलर" का उपयोग करते थे।
  • आवाज़ को जांचने के लिए, आप एक "साउंड मीटर" का उपयोग करते थे।

यह केक की ऊंचाई को टेप माप से, उसके वजन को रूलर से और उसके स्वाद को स्केल से मापने की कोशिश करने जैसा था। यह भ्रमित करने वाला, धीमा था और आप आसानी से यह नहीं कह सकते थे कि "टेक्स्ट शेफ बेहतरीन है, लेकिन वॉयस शेफ को प्रशिक्षण की आवश्यकता है।"

2. समाधान: एक यूनिवर्सल "टेस्टिंग मेनू"

GAICo एक एकल, एकीकृत टूलकिट (एक पायथन लाइब्रेरी) है जो सभी भाषाएँ बोल सकती है। चाहे AI आउटपुट टेक्स्ट का एक पैराग्राफ हो, चरणों की एक सूची (जैसे यात्रा योजना), शेयर की कीमतों का पूर्वानुमान (टाइम-सीरीज), एक इमेज हो, या एक गाना, GAICo के पास इसके लिए एक विशिष्ट "रूलर" है।

  • "BaseMetric" (द यूनिवर्सल फोर्क): कल्पना कीजिए कि एक ऐसा कांटा है जो सूप, स्टेक और आइसक्रीम खा सकता है। GAICo में एक कोर डिज़ाइन है जो आपको किसी भी नए तरीके से गुणवत्ता मापने के लिए प्लग इन करने की अनुमति देता है। यदि आप कल AI आर्ट को आंकने का नया तरीका आविष्कार करते हैं, तो आप बस उसे GAICo में "स्नैप" कर सकते हैं, और यह तुरंत काम करेगा।
  • "Experiment" (द हेड क्रिटिक): यह सबसे आसान हिस्सा है। 5 अलग-अलग AI मॉडल को टेस्ट करने के लिए 50 लाइन का कोड लिखने के बजाय, आप बस "हेड क्रिटिक" (Experiment क्लास) को बताते हैं: "यहाँ शेफ A, शेफ B और शेफ C के व्यंजन हैं। यहाँ वह आदर्श व्यंजन है जिसे वे मैच करना चाहते हैं। जाओ, उन सभी का स्वाद लो और मुझे एक रिपोर्ट दो।"
    • यह स्वचालित रूप से स्कोर की गणना करता है।
    • यह सुंदर चार्ट (जैसे रडार चार्ट) बनाता है ताकि आप देख सकें कि कौन मजबूत है और कौन कमजोर।
    • यह आपको बताता है कि आपके नियमों के आधार पर कोई व्यंजन पास हुआ या फेल।

3. वास्तविक दुनिया का परीक्षण: "AI ट्रैवल एजेंट"

इसे काम करने के लिए सिद्ध करने हेतु, लेखकों ने एक जटिल "AI ट्रैवल एजेंट" सिस्टम बनाया। कल्पना कीजिए कि तीन अलग-अलग टीमें पेरिस की 3-दिवसीय यात्रा बनाने की कोशिश कर रही हैं:

  • टीम A उपलब्ध सर्वोत्तम उपकरणों का उपयोग करती है।
  • टीम B ओपन-सोर्स टूल्स का उपयोग करती है।
  • टीम C गूगल के टूल्स का उपयोग करती है।

प्रत्येक टीम को निम्नलिखित उत्पन्न करना था:

  1. एक प्लान: एक टेक्स्ट इटिनररी (जैसे, "दोपहर 2 बजे एफिल टॉवर देखें")।
  2. एक इमेज: एफिल टॉवर की एक तस्वीर।
  3. ऑडियो: यात्रा का वर्णन करने वाली एक वॉयस रिकॉर्डिंग।

GAICo के बिना: डेवलपर्स को यह जांचने के लिए अलग-अलग स्क्रिप्ट लिखने में हफ्तों बिताने पड़ते कि क्या टेक्स्ट समझ में आता है, चित्र सही दिखते हैं, या ऑडियो स्पष्ट है। वे डेटा के समुद्र में खो जाते।

GAICo के साथ: उन्होंने पूरे सिस्टम को मिनटों में "हेड क्रिटिक" के माध्यम से चलाया।

  • परिणाम: GAICo ने एक रहस्य उजागर किया! टीम B का "प्लान राइटर" (टेक्स्ट AI) शेड्यूल बनाने में बहुत खराब था, लेकिन उनका "इमेज आर्टिस्ट" वास्तव में काफी अच्छा था। टीम C योजना बनाने में बेहतरीन थी लेकिन उनका "वॉयस एक्टर" रोबोटिक लग रहा था।
  • लाभ: क्योंकि GAICo ने "प्लान" स्कोर को "इमेज/ऑडियो" स्कोर से अलग कर दिया, डेवलपर्स को पता चल गया कि किसे निकालना है और किसे काम पर रखना है। उन्हें अनुमान लगाने की जरूरत नहीं पड़ी; डेटा ने उन्हें ठीक बताया कि समस्या कहाँ थी।

4. यह क्यों मायने रखता है: "तेजी से और सुरक्षित रूप से आगे बढ़ना"

सोचिए कि AI विकास एक कार बनाने जैसा है।

  • GAICo से पहले: आप इंजन, ब्रेक और रेडियो को तीन अलग-अलग लोगों द्वारा तीन अलग-अलग उपकरणों के साथ टेस्ट कर रहे थे। यदि कार खराब होती, तो आपको नहीं पता चलता कि कौन सा हिस्सा विफल हुआ।
  • GAICo के साथ: आपके पास एक स्वचालित परीक्षण स्टेशन है जो इंजन, ब्रेक और रेडियो को एक साथ चेक करता है और आपको एक एकल, स्पष्ट रिपोर्ट कार्ड देता है।

यह कंपनियों को सक्षम बनाता है:

  • तेजी से आगे बढ़ना: वे कस्टम टेस्ट लिखने में समय बर्बाद नहीं करते हैं। वे बस अपना नया AI मॉडल प्लग करते हैं और तुरंत परिणाम प्राप्त करते हैं।
  • सुरक्षित रूप से आगे बढ़ना: वे AI के बुरे व्यवहार को जल्दी पकड़ सकते हैं। यदि कोई AI खराब यात्रा सलाह देने लगता है या आपत्तिजनक चित्र बनाने लगता है, तो GAICo उत्पाद के जनता के पास जाने से पहले ही विशिष्ट विफलता को पहचान लेता है।

सारांश

GAICo AI टेस्टिंग के लिए "स्विस आर्मी नाइफ" है। यह AI आउटपुट (टेक्स्ट, इमेज, साउंड, प्लान्स) की तुलना करने के अव्यवस्थित, भ्रमित करने वाले काम को एक स्वच्छ, मानकीकृत और आसान प्रक्रिया में बदल देता है। यह डेवलपर्स को अनुमान लगाने के बजाय यह सटीक रूप से जानने में मदद करता है कि उनका AI वास्तव में कितना अच्छा है, जिससे यह सुनिश्चित होता है कि हमारे द्वारा बनाए गए AI सिस्टम विश्वसनीय, उच्च गुणवत्ता वाले और सभी के लिए सुरक्षित हैं।

इसकी रिलीज़ के बाद से, हजारों डेवलपर्स ने इसे डाउनलोड किया है, जो यह साबित करता है कि समुदाय इस तरह के टूल के लिए वास्तव में उत्सुक था ताकि AI विस्फोट को व्यवस्थित किया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →