← नवीनतम पेपर
💬 NLP

Querying Structured Data Through Natural Language Using Language Models

यह शोध पत्र एक ओपन-सोर्स पद्धति प्रस्तुत करता है जो संरचित गैर-पाठ्य डेटासेट के लिए निष्पादन योग्य क्वेरी उत्पन्न करने हेतु सिंथेटिक डेटा का उपयोग करके एक कॉम्पैक्ट 8B लैंग्वेज मॉडल को फाइन-ट्यून करता है, जो रिट्रीवल ऑगमेंटेड जनरेशन (RAG) के एक प्रभावी विकल्प के रूप में संसाधन-सीमित वातावरण में उच्च सटीकता और सामान्यीकरण प्राप्त करता है।

मूल लेखक: Hontan Valentin-Micu, Bunea Andrei-Alexandru, Tantaroudas Nikolaos Dimitrios, Popovici Dan-Matei

प्रकाशित 2026-04-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hontan Valentin-Micu, Bunea Andrei-Alexandru, Tantaroudas Nikolaos Dimitrios, Popovici Dan-Matei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से विस्तृत लाइब्रेरी है, लेकिन किताबों के बजाय, यह संख्याओं वाली स्प्रेडशीट्स से भरी हुई है: जैसे अस्पताल तक पैदल जाने में कितना समय लगता है, किराने की दुकान तक साइकिल चलाने की दूरी कितनी है, और स्पेन के एक विशिष्ट क्षेत्र में हर फार्मेसी ठीक कहाँ स्थित है।

अब, कल्पना कीजिए कि आप इस लाइब्रेरी से एक सवाल पूछना चाहते हैं जैसे, "किन छोटे कस्बों में 10 मिनट की ड्राइव के भीतर अस्पताल है?"

यदि आप एक मानक AI (जैसे वे जो निबंध लिखते हैं या आपसे चैट करते हैं) से पूछते हैं, तो वह भ्रमित हो सकता है। वह कहानियाँ पढ़ने का आदी है, संख्याओं को क्रंच करने का नहीं। वह उत्तर का "अनुमान" लगाने या कुछ भी बना देने की कोशिश कर सकता है क्योंकि वह वास्तव में गणित नहीं कर सकता या सटीक निर्देशांक (coordinates) नहीं खोज सकता।

यह पेपर इस समस्या को हल करने का एक चतुर नया तरीका पेश करता है। इसे सरल भाषा में समझाया गया है:

1. समस्या: वह "लाइब्रेरियन" जो संख्याएं नहीं पढ़ सकता

आज के अधिकांश AI सिस्टम रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम की तरह काम करते हैं। इसे एक ऐसे लाइब्रेरियन के रूप में सोचें जो किताबें खोजने में बहुत अच्छा है। यदि आप पूछते हैं, "अस्पतालों के बारे में बताओ," तो लाइब्रेरियन अस्पतालों के बारे में एक पैराग्राफ ढूंढता है और उसे आपको पढ़कर सुना देता है।

लेकिन यदि आप पूछते हैं, "कौन सा शहर कार से अस्पताल से 4.2 मिनट की दूरी पर है?" तो लाइब्रेरियन विफल हो जाता है। क्यों? क्योंकि उत्तर किसी किताब में नहीं है; यह एक स्प्रेडशीट की एक विशिष्ट पंक्ति (row) में है। लाइब्रेरियन गणित को "पढ़" नहीं सकता।

2. समाधान: AI को एक "अनुवादक" बनना सिखाना

AI से उत्तर का अनुमान लगाने के लिए कहने के बजाय, लेखकों ने अपने AI को एक अनुवादक (Translator) की तरह कार्य करने के लिए प्रशिक्षित किया।

जब आप साधारण अंग्रेजी में एक प्रश्न पूछते हैं, तो AI सीधे उत्तर देने की कोशिश नहीं करता है। इसके बजाय, यह आपके प्रश्न को एक कंप्यूटर कमांड (जैसे कोई गुप्त कोड या SQL क्वेरी) में अनुवादित करता है जिसे डेटाबेस समझ सके।

  • आप पूछते हैं: "निकटतम अस्पताल कहाँ है?"
  • AI सोचता है: "मुझे निकटतम अस्पताल की खोज (search) करनी होगी।"
  • AI डेटाबेस से बात करता है: GET_NEAREST(category="hospital", location="Durango")
  • डेटाबेस जवाब देता है: "यह 0.4 किमी दूर है।"
  • AI वापस आपको अनुवाद करके बताता है: "निकटतम अस्पताल 0.4 किमी दूर है।"

3. सीक्रेट सॉस: अभ्यास टेस्ट बनाना

सबसे बड़ी बाधा यहाँ थी: AI को यह "कंप्यूटर कोड" बोलना सिखाने के लिए, आपको आमतौर पर उन हजारों उदाहरणों की आवश्यकता होती है जहाँ लोग प्रश्न पूछते हैं और कंप्यूटर सही कोड देता है। लेकिन इस विशिष्ट क्षेत्र के लिए इन विशिष्ट प्रश्नों का कोई डेटासेट उपलब्ध नहीं था।

इसलिए, टीम ने एक सिंथेटिक ट्रेनिंग फैक्ट्री (Synthetic Training Factory) बनाई।
कल्पना कीजिए कि उन्होंने एक सुपर-स्मार्ट रोबोट (एक बड़ा AI) को हजारों अभ्यास टेस्ट आविष्कार करने के लिए काम पर लगाया।

  1. रोबोट ने स्प्रेडशीट को देखा।
  2. उसने प्रश्न आविष्कार किए जैसे, "पार्क से बेकरी कितनी दूर है?"
  3. उसने उस प्रश्न का उत्तर देने के लिए सही कंप्यूटर कोड लिखा।
  4. उसने ऐसे 44,000 "प्रश्न + उत्तर + कोड" के जोड़े बनाए।

इसने छोटे AI को अध्ययन करने के लिए एक विशाल अभ्यास लाइब्रेरी दी, जिससे उसने सीखा कि मानवीय शब्दों को डेटाबेस कमांड में बिल्कुल कैसे अनुवादित किया जाए।

4. "छोटे कंप्यूटर" पर "छोटा दिमाग"

आमतौर पर, इस तरह का स्मार्ट काम करने के लिए, आपको एक विशाल, महंगे सुपरकंप्यूटर दिमाग (एक विशाल AI मॉडल) की आवश्यकता होती है जिसे चलाना बहुत महंगा पड़ता है।

लेखकों ने कुछ अलग किया। उन्होंने एक छोटे, हल्के AI मॉडल (लगभग एक मानक लैपटॉप एप्लिकेशन के आकार का) को लिया और उसे "फाइन-ट्यून" किया।

  • उपमा (Analogy): कल्पना कीजिए कि आपने एक सामान्य-उद्देश्य वाले स्मार्ट असिस्टेंट को एक विशेष प्रशिक्षण शिविर (boot camp) दिया। उन्होंने उसे सब कुछ नहीं सिखाया; उन्होंने बस उसे एक विशिष्ट कार्य सिखाया: स्पेनिश कस्बों के बारे में प्रश्नों को डेटाबेस क्वेरी में अनुवाद करना।
  • परिणाम: यह छोटा, विशिष्ट मॉडल अपने एक काम में अविश्वसनीय रूप से कुशल हो गया। यह एक विशाल डेटा सेंटर के बजाय एक मानक गेमिंग कंप्यूटर (एक उपभोक्ता ग्राफिक्स कार्ड) पर चल सकता था। यह एक स्विस आर्मी नाइफ को एक अत्यधिक केंद्रित लेजर-कटिंग टूल में बदलने जैसा है।

5. यह क्यों महत्वपूर्ण है

  • गोपनीयता और लागत: क्योंकि यह ओपन-सोर्स है और छोटे हार्डवेयर पर चलता है, इसलिए आपको अपना डेटा Google या OpenAI जैसी बड़ी टेक कंपनियों को भेजने की आवश्यकता नहीं है। आप इसे स्थानीय और सस्ता रख सकते हैं।
  • विश्वसनीयता: AI "हैलुसिनेट" (मनगढ़ंत बातें बनाना) नहीं करता है। यह सख्ती से डेटाबेस के नियमों का पालन करता है। यदि डेटा कहता है कि अस्पताल 5 मिनट की दूरी पर है, तो AI 5 मिनट ही कहेगा।
  • लचीलापन: उन्होंने दिखाया कि यह कई भाषाओं (स्पेनिश, फ्रेंच, कैटलन, आदि) में काम करता है और यहाँ तक कि उन कस्बों के साथ भी जिन्हें AI ने पहले कभी नहीं देखा था, जो यह साबित करता है कि इसने वास्तव में तर्क (logic) सीखा है, न कि केवल उत्तरों को रटा है।

निचोड़

यह पेपर एक छोटे, किफायती AI को मानवीय जिज्ञासा और ठंडे, कठोर डेटा के बीच एक सेतु (bridge) के रूप में कार्य करने के लिए सिखाने के बारे में है। मनुष्यों को जटिल डेटाबेस भाषाएँ सीखने के लिए मजबूर करने के बजाय, उन्होंने एक ऐसा सिस्टम बनाया है जो हमें बस साधारण अंग्रेजी में प्रश्न पूछने की अनुमति देता है, और AI गणित और खोज का सारा भारी काम संभाल लेता है, और वह भी एक ऐसी मशीन पर जो आप शायद इलेक्ट्रॉनिक्स स्टोर से खरीद सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →