← नवीनतम पेपर
💬 NLP

Interactor: Agentic RL oriented Iterative Creation for Ad Description Generation in Sponsored Search

यह शोध पत्र Interactor को प्रस्तुत करता है, जो एक एजेंटिक सुदृढीकरण लर्निंग (reinforcement learning) फ्रेमवर्क है जो जनरेटिव रिवॉर्ड मॉडल्स के साथ मल्टी-टर्न इंटरैक्शन के माध्यम से प्रायोजित खोज (sponsored search) में विज्ञापन विवरणों को पुनरावृत्ति से परिष्कृत करता है, जिससे ज्ञान की समृद्धि और लैंडिंग पेज की निरंतरता में महत्वपूर्ण सुधार होता है और सफल ऑनलाइन परिनियोजन (deployment) प्राप्त होता है।

मूल लेखक: Penghui Wei, Jiayu Wu, Chao Ye, Zhi Guo, Shuanglong Li, Lin Liu

प्रकाशित 2026-06-16
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Penghui Wei, Jiayu Wu, Chao Ye, Zhi Guo, Shuanglong Li, Lin Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नींबू पानी (lemonade) का स्टॉल चला रहे हैं, लेकिन केवल "नींबू पानी!" चिल्लाने के बजाय (जो कि एक विज्ञापन शीर्षक/ad title की तरह है), आपके पास एक लंबा, विस्तृत मेनू बोर्ड है जहाँ आप यह समझा सकते हैं कि आपका नींबू पानी क्यों खास है।

यह पेपर INTERACTOR नामक एक नए सिस्टम का परिचय देता है जो एक सुपर-स्मार्ट, आत्म-सुधार करने वाले मार्केटिंग असिस्टेंट की तरह काम करता है, ताकि सर्च विज्ञापनों के लिए वे लंबे, विस्तृत विवरण लिखे जा सकें।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "वन-शॉट" (One-Shot) की गलती

अधिकांश वर्तमान AI उपकरण एक ही बार में विज्ञापन का विवरण लिखने की कोशिश करते हैं, जैसे कोई छात्र बिना रफ कार्य (scratchpad) के परीक्षा दे रहा हो। वे कभी-कभी इसे सही कर लेते हैं, लेकिन अक्सर दो बड़ी गलतियाँ करते हैं:

  • वे चीजें बना लेते हैं: वे कह सकते हैं कि आपका नींबू पानी "ऑर्गेनिक नींबू" से बना है, जबकि आपके सप्लायर केवल साधारण नींबू बेचते हैं (इसे लैंडिंग पेज के प्रति अविश्वसनीय/unfaithful होना कहा जाता है)।
  • वे बहुत अस्पष्ट होते हैं: वे केवल यह कह सकते हैं कि "इसका स्वाद अच्छा है" बजाय इसके कि यह समझाएं कि नींबू भोर के समय हाथ से चुने गए थे (यह विश्व ज्ञान/world knowledge को मिस करना है)।

क्योंकि AI तुरंत उपयोगकर्ता की प्रतिक्रिया नहीं देख पाता, इसलिए वह एक ही तरह की गलतियाँ करता रहता है।

2. समाधान: "कोच और प्लेयर" (Coach and Player) लूप

INTERACTOR खेल बदल देता है। एक वन-शॉट टेस्ट के बजाय, यह विज्ञापन लेखन को एक प्लेयर (विज्ञापन लिखने वाला AI) और एक कोच (विशेषज्ञ AI जजों का एक समूह) के बीच एक मल्टी-टर्न बातचीत में बदल देता है।

यहाँ स्टेप-बाय-स्टेप लूप दिया गया है:

  1. प्लेयर एक ड्राफ्ट बनाता है: AI विज्ञापन का पहला संस्करण लिखता है।
  2. कोच इसकी समीक्षा करता है: कोच केवल एक स्कोर (जैसे "8/10") नहीं देता। यह लाल पेन लेकर एक सख्त संपादक की तरह काम करता है। यह कहता है:
    • "आपने 'फ्री शिपिंग' का दावा किया, लेकिन आपकी वेबसाइट कहती है 'डिलीवरी शुल्क लागू है'। यह एक झूठ है। इसे ठीक करें।"
    • "आपने यह उल्लेख नहीं किया कि काला तिल बालों के स्वास्थ्य में मदद करता है, जो कि वास्तव में उपयोगकर्ता पूछ रहा है। इसे जोड़ें।"
  3. प्लेयर सुधार करता है: AI कोच के नोट्स पढ़ता है, उन पर विचार करता है, और त्रुटियों को ठीक करने के लिए विज्ञापन को फिर से लिखता है।
  4. दोहराव: यह कई बार होता है जब तक कि विज्ञापन एकदम सही न हो जाए।

3. असली मंत्र: "एजेंटिक आरएल" (Agentic RL)

यह पेपर इसे "एजेंटिक रीइन्फोर्समेंट लर्निंग" (Agentic Reinforcement Learning) कहता है। इसे एक कुत्ते को प्रशिक्षित करने जैसा समझें, लेकिन यहाँ कुत्ता इतना स्मार्ट है कि वह समझ सके कि उसे इनाम या सुधार क्यों मिला।

  • पारंपरिक RL: AI को "अच्छा काम किया!" या "बुरा काम किया!" का संकेत मिलता है। वह अनुमान लगाता है कि आगे क्या करना है।
  • INTERACTOR (एजेंटिक RL): AI को तर्कपूर्ण फीडबैक (reasoning feedback) मिलता है। उसे पता होता है कि कौन सा वाक्य गलत था और क्यों। यह उसे बहुत तेज़ी से सीखने और बहुत बेहतर विवरण लिखने में सक्षम बनाता है।

4. परिणाम: "बनावटीपन" (Fluff) से "तथ्यों" (Facts) तक

इस पेपर का परीक्षण बाइडु (Baidu) के सर्च इंजन के वास्तविक डेटा पर किया गया।

  • पहले: AI विज्ञापन अक्सर "बनावटी" (खाली शब्दों से भरे हुए) या "भ्रामक/हैलुसिनेटेड" (तथ्य बनाने वाले) होते थे।
  • बाद में: INTERACTOR सिस्टम द्वारा बनाए गए विज्ञापन ऐसे थे:
    • ज्ञान-समृद्ध (Knowledge-Rich): उन्होंने वास्तव में वास्तविक तथ्यों के साथ उपयोगकर्ता के प्रश्न का उत्तर दिया।
    • विश्वसनीय (Faithful): वे सख्ती से वही थे जो विज्ञापनदाता की वेबसाइट वास्तव में प्रदान कर रही थी।
    • अधिक क्लिक: क्योंकि विज्ञापन बेहतर थे, इसलिए अधिक लोगों ने उन पर क्लिक किया, और कंपनी ने अधिक पैसा कमाया।

5. वास्तविक दुनिया का प्रभाव

पेपर बताता है कि मई 2026 से, यह सिस्टम एक प्रमुख सर्च इंजन पर लाइव चल रहा है। यह केवल एक सिद्धांत नहीं है; यह वर्तमान में विज्ञापनदाताओं को बेहतर विज्ञापन लिखने में मदद कर रहा है और उपयोगकर्ताओं को अधिक प्रासंगिक जानकारी खोजने में मदद कर रहा है, जिससे सर्च इंजन का राजस्व भी बढ़ रहा है।

संक्षेप में: INTERACTOR एक AI लेखक को विशेषज्ञ संपादकों की एक टीम देने जैसा है जो केवल पेपर को ग्रेड नहीं करते, बल्कि लेखक के साथ बैठकर हर एक गलती को तब तक ठीक करने में मदद करते हैं जब तक कि विज्ञापन एकदम सही न हो जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →