← नवीनतम पेपर
💬 NLP

Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment

यह शोध पत्र HUMANS बेंचमार्क प्रस्तुत करता है, जो लार्ज ऑडियो मॉडल्स के लिए एक कुशल मूल्यांकन ढांचा है जो केवल 50 उदाहरणों के सुव्यवस्थित उपसमुच्चयों का उपयोग करके पूर्ण बेंचमार्क के साथ उच्च सहसंबंध प्राप्त करता है और, रिग्रेशन मॉडलिंग के माध्यम से, मानव उपयोगकर्ता प्राथमिकताओं की भविष्यवाणी करने में रैंडम उपसमुच्चयों और पूर्ण बेंचमार्क दोनों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Woody Haosheng Gan, William Held, Diyi Yang

प्रकाशित 2026-05-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Woody Haosheng Gan, William Held, Diyi Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक विशाल सूप के लिए 18 अलग-अलग नए व्यंजनों का स्वाद लेने की कोशिश कर रहे हैं। प्रत्येक सूप की पूरी रेसिपी बुक में 16,000 सामग्रियां (ingredients) सूचीबद्ध हैं। हर सूप के लिए हर एक सामग्री को चखना वर्षों का समय लेगा और बहुत महंगा पड़ेगा। आपको यह पता लगाने का एक तेज़ तरीका चाहिए कि कौन सा सूप सबसे अच्छा है, बिना सब कुछ चखे।

यह पेपर लार्ज ऑडियो मॉडल्स (LAMs) के लिए इसी तरह का शॉर्टकट खोजने के बारे में है—वे AI दिमाग जो कंप्यूटर को बात करने, सुनने और आवाज़ समझने की क्षमता देते हैं।

यहाँ इस कहानी का विवरण है कि कैसे शोधकर्ताओं ने सरल उपमाओं (analogies) का उपयोग करके इस समस्या को हल किया:

1. समस्या: "चखने के लिए बहुत बड़ी" सूप

इन AI वॉयस मॉडल्स का मूल्यांकन करना महंगा और धीमा है। उन्हें ठीक से टेस्ट करने के लिए, आपको आमतौर पर उन्हें हजारों अलग-अलग ऑडियो कार्यों (जैसे भाषण पहचानना, प्रश्न पूछना, या टूल्स का उपयोग करना) के माध्यम से चलाना पड़ता है।

  • लागत: एक मॉडल को 16,000 आइटमों के पूरे "मेन्यू" पर टेस्ट करने में सैकड़ों डॉलर और कंप्यूटर का सैकड़ों घंटे का समय लग सकता है।
  • अंतराल (Gap): भले ही आप उन सभी का परीक्षण कर लें, लेकिन उनके स्कोर यह नहीं बता सकते कि आप वास्तव में किस चीज़ की परवाह करते हैं। एक मॉडल एक टेस्ट में परफेक्ट स्कोर प्राप्त कर सकता है, लेकिन एक मानव उपयोगकर्ता के लिए वह रोबोट जैसा लग सकता है।

2. पहली खोज: "टेस्टिंग स्पून" (चखने वाला चम्मच)

शोधकर्ताओं ने पूछा: क्या हम केवल सूप का एक छोटा सा चम्मच चखकर यह जान सकते हैं कि कौन सा बर्तन सबसे अच्छा है?

उन्होंने 16,000-आइटम वाले मेन्यू से एक छोटा सा सैंपल चुनने के 10 अलग-अलग तरीके आजमाए। उन्होंने पाया कि यदि आप सही 50 आइटम चुनते हैं (जो कुल डेटा का केवल 0.3% है), तो आप पूरे टेस्ट स्कोर की 93% से अधिक सटीकता के साथ भविष्यवाणी कर सकते हैं।

  • उपमा: यह 16,000-सामग्री वाली रेसिपी बुक से 50 विशिष्ट सामग्रियां चुनने जैसा है। यदि आप सही 50 चुनते हैं (वे जो एक अच्छे शेफ और एक बुरे शेफ के बीच का अंतर दिखाते हैं), तो आप पूरे व्यंजन को बनाए बिना ही जान सकते हैं कि उसका स्वाद कैसा होगा।
  • परिणाम: उन्होंने एक "बेस्ट सबसेट" (Best Subset) विधि बनाई। बहुत छोटे सैंपल (30 आइटमों से कम) के लिए, उन्होंने एंकर पॉइंट्स (सबसे प्रतिनिधि "एंकर" आइटम चुनना) नामक विधि का उपयोग किया। बड़े सैंपल (50+ आइटम) के लिए, उन्होंने कंबाइंड एम्बेडिंग (ध्वनि, अर्थ और प्रदर्शन डेटा को मिलाकर सबसे अच्छे आइटम चुनना) विधि का उपयोग किया।

3. दूसरी खोज: "मानव स्वाद परीक्षण" (Human Taste Test)

यह जानना कि कौन सा मॉडल उच्चतम कंप्यूटर स्कोर प्राप्त करता है, पर्याप्त नहीं है। शोधकर्ता जानना चाहते थे: क्या कंप्यूटर स्कोर उस चीज़ से मेल खाता है जिसे मनुष्य वास्तव में पसंद करते हैं?

उन्होंने 776 लोगों को 7 अलग-अलग AI वॉयस असिस्टेंट के साथ 10 मिनट की वास्तविक बातचीत करने के लिए काम पर रखा। उन्होंने मनुष्यों से पूछा: "क्या आपको यह पसंद आया? क्या यह स्वाभाविक था? क्या इसने आपकी मदद की?"

  • आश्चर्य: यहाँ तक कि विशाल टेस्ट (16,000-आइटम वाला मेन्यू) भी मानव भावनाओं के साथ केवल 85% मेल खाता था।
  • "रोबोट" की समस्या: मनुष्यों ने उन चीजों के बारे में शिकायत की जिन्हें कंप्यूटर टेस्ट नहीं पकड़ पाते। उन्हें इस बात से ज्यादा फर्क नहीं पड़ा कि "क्या इसने शब्द को सही ढंग से सुना?" (जिसे टेस्ट अच्छी तरह मापते हैं)। उन्हें इन चीजों की चिंता थी:
    • "क्या यह रोबोट जैसा लग रहा था?" (42% शिकायतें)
    • "क्या यह बहुत अधिक शब्दबहुल (wordy) था?" (17% शिकायतें)
    • "क्या बातचीत का प्रवाह अजीब था?" (18% शिकायतें)

4. समाधान: "मैजिक प्रेडिक्टर" (जादुई भविष्यवक्ता)

चूंकि कंप्यूटर स्कोर पूरी तरह से मानवीय भावनाओं से मेल नहीं खाते थे, इसलिए शोधकर्ताओं ने एक रिग्रेशन मॉडल (एक स्मार्ट गणितीय फॉर्मूला) बनाया।

केवल कच्चे टेस्ट स्कोर को देखने के बजाय, उन्होंने फॉर्मूले को यह सिखाया कि वह 50-आइटम वाले छोटे सबसेट को देखे और अनुमान लगाए कि एक इंसान उस मॉडल को कैसे रेट करेगा।

  • जादू: जब उन्होंने इस फॉर्मूले को स्मार्टली चुने गए 50 आइटमों पर प्रशिक्षित किया, तो इसने मानव संतुष्टि की 98% सटीकता के साथ भविष्यवाणी की।
  • ट्विस्ट: यह 16,000-आइटम वाले पूर्ण टेस्ट का उपयोग करने से भी बेहतर था!
  • सबक: मात्रा से अधिक गुणवत्ता (Quality over Quantity)। 100 आइटमों की एक सावधानीपूर्वक चुनी गई सूची ने 16,000 की विशाल, अव्यवस्थित सूची की तुलना में मानव खुशी की बेहतर भविष्यवाणी की। बड़ी सूची के अतिरिक्त आइटमों ने केवल "शोर" (noise) जोड़ा और भविष्यवाणी को भ्रमित किया।

5. अंतिम उत्पाद: "HUMANS"

शोधकर्ताओं ने अपने निष्कर्षों को HUMANS नामक एक नए बेंचमार्क के रूप में जारी किया।

  • यह क्या है: ऑडियो टेस्ट का एक छोटा, कुशल सेट।
  • यह कैसे काम करता है: आप अपने AI मॉडल को इन कुछ आइटम्स पर चलाते हैं, उनके परिणाम को उनके "मैजिक प्रेडिक्टर" फॉर्मूले में डालते हैं, और यह आपको बताता है कि वास्तविक मनुष्य उस मॉडल से कितने खुश होंगे।
  • यह क्यों महत्वपूर्ण है: यह पैसा बचाता है, समय बचाता है, और वास्तव में वह बताता है जो मायने रखता है: उपयोगकर्ता संतुष्टि (User Satisfaction)।

सारांश

AI को टेस्ट करने के पुराने तरीके को एक 10,000 पन्नों के विश्वकोश (encyclopedia) के हर पन्ने को पढ़ने की कोशिश करने के रूप में सोचें ताकि यह तय किया जा सके कि कौन सा सबसे अच्छा है। यह धीमा और उबाऊ है।

यह पेपर कहता है: "नहीं, बस हमारे द्वारा आपके लिए चुने गए 50 सबसे महत्वपूर्ण पन्ने पढ़ें। यदि आप उन्हें पढ़ते हैं, तो आप जानेंगे कि किताब महान है। और यदि आप उन 50 पन्नों पर अपने विशेष 'मानव-अनुभूति' कैलकुलेटर का उपयोग करते हैं, तो आप बिल्कुल जान पाएंगे कि लोग उसे पढ़ना कितना पसंद करेंगे।"

उन्होंने साबित किया कि "कम ही अधिक है" (Less is more), बशर्ते कि वह "कम" सही प्रकार का हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →