← नवीनतम पेपर
💬 NLP

From Unstructured to Structured: LLM-Guided Attribute Graphs for Entity Search and Ranking

यह शोध पत्र एक दो-चरणीय LLM-निर्देशित ढांचे का प्रस्ताव करता है जो बिना किसी प्रशिक्षण डेटा की आवश्यकता के कुशल, उच्च-सटीक इकाई खोज और रैंकिंग को सक्षम करने के लिए असंरचित ई-कॉमर्स डेटा से संरचित विशेषता ग्राफ (structured attribute graphs) का निर्माण करता है।

मूल लेखक: Yilun Zhu, Nikhita Vedula, Shervin Malmasi

प्रकाशित 2026-05-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yilun Zhu, Nikhita Vedula, Shervin Malmasi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप ऑनलाइन एक विशिष्ट वस्तु, जैसे कि "लाल, वायरलेस, नॉइज़-कैंसलिंग हेडफ़ोन" के लिए खरीदारी कर रहे हैं। आप चाहते हैं कि सिस्टम आपको अन्य ऐसे हेडफ़ोन दिखाए जो लगभग बिल्कुल उसी के समान हों, न कि केवल कोई भी हेडफ़ोन जो लाल रंग का हो।

यह पेपर एक नया तरीका बताता है जिससे इस तरह का सर्च इंजन पहले से कहीं बेहतर बनाया जा सकता है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

समस्या: "बिखरी हुई मेज" बनाम "व्यवस्थित फाइलिंग कैबिनेट"

पारंपरिक रूप से, सर्च इंजन उत्पाद विवरणों को एक बिखरी हुई मेज की तरह देखते हैं। वे टेक्स्ट के पूरे पैराग्राफ को पढ़ते हैं (जैसे, "यह अद्भुत लाल हेडफ़ोन वायरलेस क्षमताओं वाला है और शोर को रोकता है...")। क्योंकि यह टेक्स्ट असंरचित (unstructured) है और एक उत्पाद से दूसरे उत्पाद में बहुत भिन्न होता है, कंप्यूटर अक्सर विशिष्ट विवरणों को मिस कर देता है। वह दो उत्पादों को केवल इसलिए समान मान सकता है क्योंकि दोनों में "लाल" शब्द का उपयोग किया गया है, भले ही एक छोटा ईयरबड हो और दूसरा बड़ा ओवर-ईयर हेडसेट।

समाधान: एक दो-चरणीय "अनुवादक और न्यायाधीश" प्रणाली

लेखकों ने एक ऐसी प्रणाली बनाई है जो दो चरणों वाली प्रक्रिया के रूप में कार्य करती है: पहले एक अनुवादक (Translator), और दूसरा एक न्यायाधीश (Judge)

चरण 1: अनुवादक (ऑफलाइन चरण)

इससे पहले कि कोई वास्तव में खोज (search) करे, सिस्टम सभी बिखरे हुए उत्पाद विवरणों को लेता है और एक शक्तिशाली AI (एक लार्ज लैंग्वेज मॉडल) का उपयोग एक अनुवादक के रूप में करता है।

  • यह क्या करता है: यह बिखरे हुए टेक्स्ट को पढ़ता है और विशिष्ट, व्यवस्थित तथ्य निकालता है, जैसे कि एक लाइब्रेरियन किताबों को व्यवस्थित करता है। यह प्रत्येक प्रकार के उत्पाद के लिए एक "स्कीमा" (एक चेकलिस्ट) बनाता है।
    • उदाहरण: एक टीवी के लिए, यह "स्क्रीन साइज" और "रेज़ोल्यूशन" को देखता है। एक शर्ट के लिए, यह "मटेरियल" और "साइज" को देखता है।
  • परिणाम: यह बिखरे हुए पैराग्राफ को तथ्यों की एक साफ, संरचित सूची में बदल देता है (जैसे, रंग: लाल, प्रकार: वायरलेस, विशेषता: नॉइज़ कैंसलिंग)।
  • ग्राफ: यह फिर इन तथ्यों को एक विशाल जाल (ग्राफ) में जोड़ता है। कल्पना कीजिए कि एक मकड़ी का जाल है जहाँ "उत्पाद" नोड्स का एक सेट हैं और "विशेषताएं" (जैसे "लाल" या "वायरलेस") दूसरे सेट हैं। यह एक स्पष्ट मानचित्र बनाता है कि उत्पाद अपने विशिष्ट गुणों के आधार पर एक-दूसरे से कैसे संबंधित हैं, न कि केवल उनके शब्दों के आधार पर।

चरण 2: न्यायाधीश (ऑनलाइन चरण)

जब आप वास्तव में किसी उत्पाद के लिए खोज करते हैं, तो सिस्टम AI से फिर से पूरे बिखरे हुए विवरण को पढ़ने के लिए नहीं कहता है।

  • शॉर्टकट: यह पहले संभावित मैचों का एक छोटा समूह (उम्मीदवार) ढूंढता है जो एक तेज़, मानक खोज का उपयोग करता है।
  • तुलना: इसके बाद यह AI से एक न्यायाधीश के रूप में कार्य करने के लिए कहता है। चरण 1 में बनाए गए साफ, व्यवस्थित सूचियों को देखने के बजाय, AI पूरे 700 शब्दों के टेक्स्ट को नहीं पढ़ता है।
  • उपमा: कल्पना कीजिए कि आप दो रेज़्यूमे (CV) की तुलना कर रहे हैं।
    • पुराना तरीका: आप प्रत्येक उम्मीदवार के जीवन की पूरी कहानी पढ़ते हैं। इसमें बहुत समय लगता है और आप विवरण मिस कर सकते हैं।
    • नया तरीका: आपके पास एक स्प्रेडशीट है जहाँ प्रत्येक उम्मीदवार का "अनुभव के वर्ष," "डिग्री," और "वेतन" एक ही कॉलम में है। आप तुरंत तुलना करने के लिए बस कॉलम को देख सकते हैं।

यह एक बड़ी बात क्यों है

पेपर का दावा है कि यह विधि तीन मुख्य कारणों से गेम-चेंजर है:

  1. यह अधिक स्मार्ट है: विशिष्ट तथ्यों (जैसे "50-इंच स्क्रीन" बनाम "55-इंच स्क्रीन") की तुलना करके, न कि टेक्स्ट से अनुमान लगाकर, सिस्टम बेहतर मिलान पाता है। परीक्षणों में, इसने सही उत्पादों को खोजने की सटीकता में 5% से अधिक सुधार किया।
  2. यह तेज़ और सस्ता है: क्योंकि AI को पूरे बिखरे हुए विवरण को नहीं पढ़ना पड़ता, यह बहुत कम जानकारी को प्रोसेस करता है। पेपर कहता है कि इसने AI द्वारा पढ़े जाने वाले डेटा की मात्रा को 57% कम कर दिया है।
    • उपमा: यह एक वकील को 300 पन्नों का उपन्यास भेजने के बजाय 1-पेज का सारांश भेजने जैसा है। वकील बहुत तेज़ी से उत्तर दे सकता है और इसमें कम लागत आती है।
  3. यह बिना ट्रेनिंग के काम करता है: यह प्रणाली "जीरो-शॉट" (zero-shot) है, जिसका अर्थ है कि इसे "अच्छे" और "बुरे" मिलान के हजारों उदाहरणों के साथ सिखाने की आवश्यकता नहीं है। यह तुरंत डेटा की संरचना को समझने के लिए अपनी सामान्य बुद्धिमत्ता का उपयोग करता है।

वास्तविक दुनिया का प्रभाव

लेखकों ने पहले से ही एक प्रमुख ई-कॉमर्स कंपनी में इसका एक संस्करण तैनात किया है। उन्होंने पाया कि यह न केवल उपयोगकर्ताओं के लिए बेहतर उत्पाद ढूंढता है (जिससे वे अधिक खुश होते हैं), बल्कि यह भी पैसे बचाता है क्योंकि AI बहुत अधिक कुशलता से काम करता है।

संक्षेप में, उन्होंने उत्पाद विवरणों के एक अराजक पुस्तकालय को एक पूरी तरह से व्यवस्थित डेटाबेस में बदल दिया है, जिससे AI को उत्पादों के बीच निष्पक्ष, सटीक और तेज़ तुलना करने की अनुमति मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →