← नवीनतम पेपर
💬 NLP

PETRA: Transforming Web Text for Petroleum-Engineering Domain Adaptation

यह शोध पत्र PETRA को प्रस्तुत करता है, जो एक बड़े पैमाने का डेटासेट और पाइपलाइन है जो शोर वाले सार्वजनिक वेब टेक्स्ट को क्यूरेटेड पेट्रोलियम-इंजीनियरिंग डेटा और सिंथेटिक सुपरविजन में परिवर्तित करता है ताकि डोमेन-विशिष्ट प्रासंगिकता लेबल की कमी को दूर करते हुए डेंस रिट्रीवल और रीरैंकिंग प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके।

मूल लेखक: Kirill Dubovikov (Mohamed bin Zayed University of Artificial Intelligence), Omar El Mansouri (Mohamed bin Zayed University of Artificial Intelligence), Hachem Madmoun (Mohamed bin Zayed University of
प्रकाशित 2026-06-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kirill Dubovikov (Mohamed bin Zayed University of Artificial Intelligence), Omar El Mansouri (Mohamed bin Zayed University of Artificial Intelligence), Hachem Madmoun (Mohamed bin Zayed University of Artificial Intelligence), Yanda Li (Mohamed bin Zayed University of Artificial Intelligence), Sandeep Kumar (Mohamed bin Zayed University of Artificial Intelligence), Aya El Mir (Mohamed bin Zayed University of Artificial Intelligence), Supriyo Ghosh (Inception AI), Writabrata Bhattacharya (Inception AI), Adrian Garcia-Garcia (Inception AI), Onkar Pandit (Inception AI), Sunil Kumar Sahu (Inception AI), Federico Castanedo (Inception AI), Larry Murray (Inception AI), Martin Takac (Mohamed bin Zayed University of Artificial Intelligence), Salem Lahlou (Mohamed bin Zayed University of Artificial Intelligence)

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप इंटरनेट के आकार के पुस्तकालय के भीतर छिपी एक विशिष्ट, छोटी सी निर्देश पुस्तिका (instruction manual) खोजने की कोशिश कर रहे हैं। समस्या यह है कि पुस्तकालय अस्त-व्यस्त है। इसमें खाना पकाने, इतिहास और फिक्शन की किताबें भी शामिल हैं, जिनमें आपके आवश्यक तकनीकी मैनुअल भी मिले हुए हैं। इसके अलावा, तकनीकी मैनुअल के शब्द अजीब संक्षिप्त नामों और शब्दावली (जैसे "EUR" या "OOIP") से भरे हुए हैं जिन्हें एक सामान्य सर्च इंजन नहीं समझ पाता है।

यह वह चुनौती है जिसे PETRA पेपर पेट्रोलियम इंजीनियरिंग उद्योग के लिए हल करता है।

यहाँ उन्होंने जो किया है उसका एक सरल विवरण दिया गया है, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है:

1. समस्या: "शोर भरा पुस्तकालय" (The "Noisy Library")

पेट्रोलियम इंजीनियरों को सुरक्षित और कुशल निर्णय लेने के लिए विशाल मात्रा में टेक्स्ट में से विशिष्ट तथ्यों को खोजने की आवश्यकता होती है। हालाँकि, मानक सर्च इंजन एक ऐसे लाइब्रेरियन की तरह हैं जो केवल किताब के शीर्षक को देखते हैं। यदि आप पूछते हैं, "मैं कुएं में रिसाव (leak) को कैसे ठीक करूँ?", तो लाइब्रेरियन आपको "कुआं" (Well) शीर्षक वाली एक किताब दिखा सकता है जो वास्तव में बगीचे के वाटर वेल (water well) के बारे में है, न कि तेल के कुएं के बारे में।

इंटरनेट के पास उत्तर हैं, लेकिन वे "शोर" (अप्रासंगिक टेक्स्ट, डुप्लिकेट, खराब फॉर्मेटिंग) में दबे हुए हैं और सर्च इंजन तेल और गैस विशेषज्ञों की विशिष्ट "बोली" को समझने के लिए प्रशिक्षित नहीं हैं।

2. समाधान: PETRA (एक "सुपर-फ़िल्टर और ट्यूटर")

लेखकों ने PETRA (Petroleum Engineering Text for Retrieval Adaptation) नामक एक सिस्टम बनाया है। इसे एक दो-चरणीय प्रक्रिया के रूप में सोचें जो पुस्तकालय को साफ करती है और लाइब्रेरियन को "ऑइल इंजीनियर" की भाषा बोलना सिखाती है।

चरण A: पुस्तकालय की सफाई (Corpus Curation)

सबसे पहले, उन्होंने सार्वजनिक वेब टेक्स्ट (जैसे विकिपीडिया, वैज्ञानिक शोध पत्र और तकनीकी PDF) का एक विशाल ढेर लिया और उसे एक हाई-टेक फ़िल्टर से गुजारा।

  • द गेटकीपर (The Gatekeeper): उन्होंने एक स्मार्ट AI क्लासिफायर (एक "बाउंसर") का उपयोग किया जो ऊर्जा से संबंधित किसी भी चीज़ को पहचानने में 98.4% सटीक है। यदि कोई दस्तावेज़ तेल, गैस या ऊर्जा के बारे में नहीं है, तो उसे बाहर निकाल दिया जाता है।
  • गुणवत्ता नियंत्रण (The Quality Control): उन्होंने शेष दस्तावेजों को छोटे, प्रबंधनीय "चंक्स" (जैसे एक किताब को अलग-अलग पन्नों में काटना) में विभाजित किया। फिर उन्होंने एक विशाल AI (Mistral-Large) का उपयोग करके प्रत्येक चंक की जांच की। यदि कोई चंक केवल बकवास (gibberish), डुप्लिकेट था, या अपने आप में कोई अर्थ नहीं रखता था, तो उसे फेंक दिया गया।
  • परिणाम: वे अंततः 1.36 मिलियन उच्च-गुणवत्ता वाले चंक्स के एक शुद्ध, क्यूरेटेड पुस्तकालय के साथ समाप्त हुए, जो विशेष रूप से तेल और गैस के बारे में थे।

चरण B: लाइब्रेरियन को सिखाना (Synthetic Supervision)

अब उनके पास साफ किताबें थीं, लेकिन उनके पास सर्च इंजन को प्रशिक्षित करने के लिए "प्रश्न और उत्तर" की सूची नहीं थी। वे मनुष्यों से लाखों प्रश्न लिखने के लिए नहीं कह सकते थे, इसलिए उन्होंने AI को AI को सिखाने के लिए उपयोग किया।

  • क्विज़ मेकर (The Quiz Maker): उन्होंने एक AI से एक टेक्स्ट के चंक को देखने और तीन प्रकार के प्रश्न आविष्कार करने के लिए कहा जो एक वास्तविक इंजीनियर पूछ सकता है (जैसे, एक प्राकृतिक प्रश्न, एक तथ्य कथन, या एक त्वरित कीवर्ड खोज)।
  • "ट्रिकी" डिस्ट्रैक्टर्स (The "Tricky" Distractors): सर्च इंजन को स्मार्ट बनाने के लिए, उन्हें यह सिखाने की आवश्यकता थी कि क्या नहीं चुनना है। उन्होंने AI से "हार्ड नेगेटिव्स" (hard negatives) लिखने के लिए कहा। ये ऐसे उत्तर हैं जो सही उत्तर के बहुत समान दिखते हैं लेकिन वास्तव में गलत होते हैं (उदाहरण के लिए, सही उत्तर "Refinery A" के बारे में है, लेकिन नकली उत्तर "Refinery B" के बारे में है जिसमें बिल्कुल समान विवरण हैं)। यह सर्च इंजन को केवल सामान्य विषय पर ध्यान देने के बजाय विशिष्ट विवरणों पर ध्यान देने के लिए मजबूर करता है।
  • शिक्षक (The Teacher): उन्होंने एक सुपर-स्मार्ट AI (शिक्षक) का उपयोग इन अभ्यास परीक्षणों को ग्रेड करने के लिए किया, जिससे सबसे अच्छे और सबसे खराब उत्तरों को स्कोर दिया गया।

3. प्रशिक्षण: ट्रेड-ऑफ को सीखना

उन्होंने इस नए डेटा का उपयोग करके दो अलग-अलग "सर्च ब्रेन्स" (search brains) को प्रशिक्षित किया:

  1. पहला ब्रेन (Retriever): यह उम्मीदवारों की एक शॉर्टलिस्ट खोजने के लिए पूरे पुस्तकालय को तेजी से स्कैन करता है।
  2. दूसरा ब्रेन (Reranker): यह शॉर्टलिस्ट को लेता है और सबसे अच्छे वाले को चुनने के लिए उन्हें ध्यान से पढ़ता है।

"स्कोर फ्यूजन" (Score Fusion) का कमाल:
उन्होंने एक समस्या पाई: यदि वे सर्च इंजन को केवल तेल डेटा पर प्रशिक्षित करते, तो वह तेल के उत्तर खोजने में बहुत अच्छा हो जाता लेकिन सामान्य उत्तर (जैसे, "फ्रांस की राजधानी क्या है?") खोजने की क्षमता भूल जाता।
इसे ठीक करने के लिए, उन्होंने स्कोर फ्यूजन नामक तकनीक का उपयोग किया। कल्पना कीजिए कि सर्च इंजन की दो आवाजें हैं:

  • आवाज A: सामान्य विशेषज्ञ (सब कुछ में अच्छा, तेल में ठीक-ठाक)।
  • आवाज B: तेल विशेषज्ञ (तेल में बेहतरीन, बाकी सब में बुरा)।
    उन्होंने दोनों आवाजों को बोलने दिया और उनके स्कोर को मिला दिया। इस तरह, सिस्टम तेल के लिए अच्छा बना रहता है बिना एक सामान्य सर्च इंजन के रूप में कार्य करने की अपनी क्षमता खोए।

4. परिणाम: एक स्मार्ट सर्च

जब उन्होंने इस नए सिस्टम का परीक्षण किया:

  • तेल डोमेन में: यह सही तकनीकी दस्तावेजों को खोजने में काफी बेहतर हो गया। एक विशिष्ट परीक्षण में, इसने अपनी सटीकता स्कोर को 0.703 से 0.763 तक सुधार लिया।
  • सामान्य विज्ञान में: इसने एक सार्वजनिक अर्थ विज्ञान (Earth Science) बेंचमार्क में 44% का सुधार किया।
  • सीखा गया सबक: उन्होंने कुछ चीजें आजमाईं जो काम नहीं करती थीं। उदाहरण के लिए, केवल AI-जनित प्रश्नों पर उच्च सटीकता होने का मतलब यह नहीं था कि सर्च इंजन वास्तविक जीवन में अच्छा काम करेगा। कुंजी यह सुनिश्चित करना था कि "अभ्यास परीक्षण" बिल्कुल "वास्तविक परीक्षाओं" (उन वास्तविक खोज परिणामों की तरह जो सिस्टम बाद में देखेगा) की तरह दिखें।

सारांश

PETRA एक ऐसी रेसिपी है जो बिखरे हुए, शोर भरे इंटरनेट को तेल इंजीनियरों के लिए एक विशिष्ट, उच्च-गुणवत्ता वाले पुस्तकालय में बदलने के लिए है। यह डेटा को साफ करने के लिए AI का उपयोग करता है, अभ्यास परीक्षण उत्पन्न करने के लिए AI का उपयोग करता है, और एक चतुर "दो-आवाज" प्रणाली का उपयोग करता है ताकि यह सुनिश्चित हो सके कि सर्च इंजन तेल में विशेषज्ञ बनने के साथ-साथ एक सामान्य सर्च इंजन के रूप में कार्य करने की अपनी क्षमता को न खो दे।

महत्वपूर्ण नोट: पेपर स्पष्ट रूप से बताता है कि यह सिस्टम वर्तमान में एक "ह्यूमन-इन-द-लूप" सहायक के रूप में यूजर टेस्टिंग में है। इसका मतलब है कि यह मानव इंजीनियरों को दस्तावेज़ खोजने में मदद करता है; यह स्वायत्त निर्णय (autonomous decisions) नहीं लेता है या अपने आप कार्य नहीं करता है। यह मनुष्यों के पढ़ने और सत्यापित करने के लिए सही प्रक्रियाओं को सामने लाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →