GEM-Bench: A Benchmark for Ad-Injected Response Generation within Generative Engine Marketing
यह शोध पत्र GEM-Bench प्रस्तुत करता है, जो जनरेटिव इंजन मार्केटिंग में विज्ञापन-इंजेक्टेड प्रतिक्रिया निर्माण के लिए पहला व्यापक बेंचमार्क है, जो क्यूरेटेड डेटासेट, एक बहु-आयामी मूल्यांकन मीट्रिक और बेसलाइन समाधान प्रदान करता है ताकि वर्तमान विधियों में जुड़ाव (engagement) और उपयोगकर्ता संतुष्टि के बीच के ट्रेड-ऑफ को उजागर किया जा सके और भविष्य के अनुसंधान को निर्देशित किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप किसी से रास्ता पूछने या सलाह लेने के लिए एक मददगार, जानकार लाइब्रेरियन (एक AI चैटबॉट) के पास जाते हैं। पुराने दिनों में, यह लाइब्रेरियन आपको बस जवाब दे देता। लेकिन अब, लाइब्रेरी पैसे कमाने की कोशिश कर रही है और लाइब्रेरियन के वाक्यों के बीच में स्थानीय दुकानों के छोटे विज्ञापन डाल रही है।
समस्या क्या है? यदि लाइब्रेरियन आपके निर्देशों के बीच में चिल्लाकर "यह खरीदो!" कहे, तो यह असभ्य और भ्रमित करने वाला लगता है। यदि वे बहुत सूक्ष्म (subtle) होते हैं, तो कोई विज्ञापन देखता ही नहीं है।
यह पेपर GEM-Bench पेश करता है, जो मूल रूप से एक "रिपोर्ट कार्ड" और एक "खेल का मैदान" है, जिससे यह पता लगाया जा सके कि उपयोगकर्ताओं को परेशान किए बिना यह विज्ञापन करने का काम कैसे किया जाए।
यहाँ उनके काम का सरल शब्दों में विवरण दिया गया है:
1. समस्या: "सेल्समैन" बनाम "सहायक"
लेखकों ने देखा कि मौजूदा AI बेंचमार्क (AI को ग्रेड देने के लिए उपयोग किए जाने वाले परीक्षण) विज्ञापनों का परीक्षण करने में खराब हैं। यह एक शेफ को गणित का टेस्ट देने जैसा है; इसका कोई मतलब नहीं बनता।
- पुराना तरीका (Ad-Chat): कल्पना करें कि लाइब्रेरियन को कहा गया है, "आप पहले एक सेल्सपर्सन हैं, सहायक बाद में।" वे अपने पहले ही विचार में विज्ञापन को बुनने की कोशिश करते हैं। परिणाम? वे अक्सर किसी उत्पाद का उल्लेख करने के चक्कर में गलत निर्देश दे देते हैं, या वे एक धोंधले सेल्समैन की तरह लगते हैं।
- लक्ष्य: हमें एक ऐसा AI चाहिए जो पहले एक मददगार दोस्त की तरह काम करे, और उसके बाद ही स्वाभाविक रूप से किसी उत्पाद का सुझाव दे, जैसे कि कहना, "बस लें, और वैसे भी, उस बस कंपनी का एक बेहतरीन ऐप है।"
2. समाधान: GEM-Bench (द टेस्ट किचन)
इसे ठीक करने के लिए, टीम ने GEM-Bench बनाया, जो एक टूलकिट है जिसके तीन मुख्य भाग हैं:
- डेटासेट्स (सामग्री): उन्होंने तीन अलग-अलग "मेन्यू" एकत्र किए हैं।
- दो मेन्यू चैटबॉट्स के लिए हैं (जैसे यात्रा के सुझाव या रेसिपी के विचार मांगना)।
- एक मेन्यू सर्च इंजन के लिए है (जैसे त्वरित सारांश प्राप्त करने के लिए "बेस्ट रनिंग शूज़" टाइप करना)।
- उनके पास डालने के लिए वास्तविक विज्ञापनों का एक "कैटलॉग" भी है।
- ग्रेडिंग सिस्टम (स्वाद परीक्षण): केवल यह जाँचने के बजाय कि व्याकरण सही है या नहीं, उन्होंने जवाबों को ग्रेड देने का एक नया तरीका बनाया। वे देखते हैं कि:
- प्रवाह (Flow): क्या वाक्य सहज लगता है, या यह रास्ते में एक झटके जैसा महसूस होता है?
- विश्वास (Trust): क्या आप उत्तर पर विश्वास करते हैं, या यह एक घोटाले जैसा लगता है?
- क्लिक-थ्रू (Click-Through): क्या उपयोगकर्ता वास्तव में लिंक पर क्लिक करना चाहता था?
- नई विधि (Ad-LLM): उन्होंने काम करने के लिए "रोबोटों की एक टीम" (एक मल्टी-एजेंट फ्रेमवर्क) बनाई है।
- रोबोट 1 बिना किसी विज्ञापन के एक आदर्श उत्तर लिखता है।
- रोबोट 2 उस उत्तर से मेल खाने वाला सबसे अच्छा विज्ञापन ढूंढता है।
- रोबोट 3 यह पता लगाता है कि विज्ञापन को कहाँ डाला जाए ताकि प्रवाह न टूटे।
- रोबोट 4 वाक्य को फिर से लिखता है ताकि वह स्वाभाविक लगे।
3. उन्हें क्या मिला (परिणाम)
उन्होंने "पुराने तरीके" (Ad-Chat) की तुलना अपने "नए तरीके" (Ad-LLM) से की और कुछ दिलचस्प ट्रेड-ऑफ पाए:
- "सेल्समैन" विफल होता है: पुराना तरीका जो उत्तर देते समय बेचने की कोशिश करता है, अक्सर तथ्यों को गलत कर देता है। उपयोगकर्ता विश्वास खो देते हैं क्योंकि AI ऐसा लगता है जैसे वह उन्हें कुछ बेचने की बहुत अधिक कोशिश कर रहा है।
- "नई टीम" गुणवत्ता में जीतती है: नया तरीका (Ad-LLM) उत्तर को सटीक और विश्वसनीय रखता है। उपयोगकर्ताओं को लगता है कि उन्हें वास्तविक मदद मिल रही है, और विज्ञापन एक व्यवधान के बजाय एक उपयोगी सुझाव जैसा लगता है।
- उपमा: यह एक वेटर के बीच अंतर करने जैसा है जो आपके मुख्य भोजन के दौरान मिठाई बेचने के लिए बीच में टोकता है (पुराना तरीका) बनाम एक वेटर जो आपके मुख्य भोजन के समाप्त होने के बाद एकदम सही मिठाई लाता है (नया तरीका)।
- सावधानी (लागत): "नई टीम" को चलाना अधिक महंगा है। इसे अधिक कंप्यूटर पावर और समय की आवश्यकता होती है क्योंकि इसे उत्तर लिखना, विज्ञापन ढूंढना और फिर वाक्य को फिर से लिखना पड़ता है। यह एक संपादक की टीम के बजाय एक व्यक्ति के बजाय संपादकों की पूरी टीम को काम पर रखने जैसा है।
- बहुत अधिक विज्ञापन बुरा है: यदि आप एक उत्तर में 5 विज्ञापन डालने की कोशिश करते हैं, तो गुणवत्ता गिर जाती है। उपयोगकर्ता चिढ़ जाते हैं, और वे क्लिक करना बंद कर देते हैं। यह एक रेडियो स्टेशन की तरह है जो 30 सेकंड का गाना बजाता है और फिर 2 मिनट के विज्ञापन चलाता है; लोग बस उसे बंद कर देते हैं।
4. निचोड़
पेपर निष्कर्ष निकालता है कि जबकि सरल तरीके लोगों को विज्ञापन पर क्लिक करवा सकते हैं, वे उपयोगकर्ता के अनुभव और विश्वास को खराब कर देते हैं। सबसे अच्छा दृष्टिकोण एक शानदार उत्तर पहले बनाना है, और फिर सावधानीपूर्वक और विनम्रता से विज्ञापन डालना है।
हालाँकि, इसे पूरी तरह से करने के लिए अधिक कंप्यूटिंग पावर और पैसे की आवश्यकता होती है। अन्य शोधकर्ताओं के परीक्षण के लिए टीम ने GEM-Bench बनाया है कि कैसे अच्छे उत्तर, खुश उपयोगकर्ता, और लाभ के बीच संतुलन बनाया जाए बिना बजट बिगाड़े या ग्राहक को परेशान किए।
संक्षेप में: आप एक मददगार बातचीत में जबरदस्ती सेल्स पिच नहीं डाल सकते। आपको पहले एक अच्छा मददगार होना होगा, और फिर एक स्मार्ट सेल्समैन। GEM-Bench वह उपकरण है जो यह पता लगाने में मदद करता है कि इसे बिल्कुल कैसे किया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।