← नवीनतम पेपर
💬 NLP

RuleChef: Grounding LLM Task Knowledge in Human-Editable Rules

RuleChef एक ओपन-सोर्स फ्रेमवर्क है जो लर्निंग फेज के दौरान एनएलपी (NLP) कार्यों के लिए मानव-संपादन योग्य, नियतात्मक नियमों को संश्लेषित और पुनरावृत्ति से परिष्कृत करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिसके परिणामस्वरूप तेज़ और निरीक्षण योग्य सिस्टम प्राप्त होते हैं जिन्हें इन्फरेंस (inference) के समय LLMs की आवश्यकता नहीं होती है।

मूल लेखक: Ádám Kovács, Nadia Verdha, Gábor Recski

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ádám Kovács, Nadia Verdha, Gábor Recski

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, रचनात्मक सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो भाषा को समझने में माहिर है लेकिन थोड़ा "ब्लैक बॉक्स" जैसा है। आप इसे दस्तावेज़ों को छाँटने या नाम खोजने के लिए कह सकते हैं, लेकिन आप आसानी से यह नहीं देख सकते कि इसने कोई निर्णय क्यों लिया, और आप इसे आसानी से यह नहीं बता सकते कि "वह विशेष चीज़ करना बंद करो।"

RuleChef एक नया फ्रेमवर्क है जो एक अनुवादक और गुणवत्ता नियंत्रण प्रबंधक (quality control manager) की तरह कार्य करता है। यह स्मार्ट असिस्टेंट के ज्ञान को लेता है और उसे सरल, पारदर्शी और संपादन योग्य "if-then" निर्देशों (नियमों) में बदल देता है जिसे एक कंप्यूटर तुरंत चला सकता है।

यह कैसे काम करता है, यहाँ कुछ रचनात्मक उपमाओं का उपयोग किया गया है:

1. लक्ष्य: "अंतर्ज्ञान" से "लिखित कानून" तक

एक मानक AI मॉडल को एक मास्टर शेफ की तरह समझें जो एक बेहतरीन भोजन बना सकता है लेकिन रेसिपी नहीं समझा सकता। यदि भोजन का स्वाद गलत है, तो आपको अनुमान लगाना होगा कि क्या गलत हुआ।
RuleChef उस शेफ के अंतर्ज्ञान को एक लिखित कुकबुक (पाक पुस्तिका) में बदलना चाहता है। एक बार जब कुकबुक लिख दी जाती है, तो कोई भी इसे पढ़ सकता है, सामग्री की जांच कर सकता है, और देख सकता है कि कोई व्यंजन किस तरह से तैयार हुआ। इसका परिणाम एक ऐसा सिस्टम है जो तेज़, पूर्वानुमानित और ठीक करने में आसान है।

2. प्रक्रिया: "ड्राफ्ट, आलोचना और पॉलिश" लूप

RuleChef केवल एक बार AI से रेसिपी नहीं मांगता और फिर उम्मीद नहीं करता कि सब सही होगा। यह एक कठोर प्रशिक्षण शिविर चलाता है:

  • पहला ड्राफ्ट (संश्लेषण - Synthesis): आप AI को एक कार्य विवरण देते हैं (जैसे, "सभी फोन नंबर खोजें") और कुछ उदाहरण देते हैं। AI नियमों का एक पहला ड्राफ्ट (जैसे, एक regex पैटर्न) लिखता है।
  • टेस्ट ड्राइव (मूल्यांकन - Evaluation): सिस्टम इन नियमों को एक "अभ्यास परीक्षा" (डेटा का एक सेट जिसे AI ने पहले नहीं देखा है) पर परखता है।
  • आलोचना (परिष्करण - Refinement): सिस्टम देखता है कि उसके नियम कहाँ विफल रहे। क्या उन्होंने कोई फोन नंबर छोड़ दिया? क्या उन्होंने गलती से कोई तारीख पकड़ ली? यह उनकी गलतियों को एक साथ समूहित करता है।
  • मरम्मत (पैचिंग - Patching): AI को ये विशिष्ट गलतियाँ दिखाई जाती हैं और नियमों को ठीक करने के लिए कहा जाता है।
    • महत्वपूर्ण नियम: AI को अभ्यास परीक्षा को याद करने की अनुमति नहीं है। यदि कोई नया नियम अभ्यास परीक्षा पर सिस्टम को बदतर बनाता है, तो उसे खारिज कर दिया जाता है। यह सुनिश्चित करता है कि नियम पैटर्न सीखते हैं, न कि केवल विशिष्ट उदाहरणों को।

3. "ह्यूमन-इन-द-लूप" (मानव की भागीदारी) फीचर

कभी-कभी, सबसे अच्छा AI भी मूर्खतापूर्ण गलती कर सकता है। RuleChef मानव विशेषज्ञों को हस्तक्षेप करने की अनुमति देता है।

  • उपमा: कल्पना कीजिए कि एक मानव संपादक कुकबुक पढ़ रहा है और कहता है, "हे, यह नियम कहता है 'स्लैश के साथ किसी भी संख्या को मिलाएँ,' लेकिन यह केस नंबरों जैसे '1432/03' को भी पकड़ रहा है जो मात्राएँ नहीं हैं।"
  • मानव एक सरल नोट टाइप करता है: "स्लैश वाले नंबरों को इस तरह से मैच न करें।"
  • RuleChef उस नोट को लेता है, AI से उस विशिष्ट नियम को फिर से लिखने के लिए कहता है, और इसे फिर से टेस्ट करता है। यह पूरे AI को फिर से प्रशिक्षित किए बिना मानवीय फीडबैक के प्रति सिस्टम को अविश्वसनीय रूप से अनुकूल बनाता है।

4. "ऑब्जर्वेशन मोड" (देखकर सीखना)

क्या होगा यदि आपके पास शुरू करने के लिए उदाहरणों की सूची नहीं है? RuleChef का एक "स्पाय मोड" है।

  • उपमा: कल्पना कीजिए कि आपके पास एक नया कर्मचारी (AI) है जो पहले से ही काम कर रहा है। RuleChef उस कर्मचारी को काम करते हुए देखता है, जो वह करता है उसे रिकॉर्ड करता है, और फिर एक नियम पुस्तिका लिखने की कोशिश करता है जो यह समझा सके कि कर्मचारी ने वे निर्णय क्यों लिए।
  • एक बार जब नियम पुस्तिका पर्याप्त अच्छी हो जाती है, तो सिस्टम धीमे, महंगे AI से मदद माँगना बंद कर सकता है और अधिकांश कार्यों के लिए केवल तेज़, लिखित नियमों का उपयोग कर सकता है।

5. यह क्यों मायने रखता है?

इस पेपर का परीक्षण दो मुख्य कार्यों पर किया गया:

  1. टेक्स्ट में विशिष्ट चीजें खोजना (जैसे नाम, तारीखें, या कोर्ट केस नंबर)।
  2. ग्राहक सेवा के प्रश्नों को छाँटना (जैसे "मैं अपना पासवर्ड बदलना चाहता हूँ" बनाम "मेरा बैंक ब्रांच कहाँ है?")।

परिणाम:

  • गति: अंतिम नियम प्रणाली अविश्वसनीय रूप से तेज़ है (प्रति दस्तावेज़ मिलीसेकंड में), जबकि मूल AI को सेकंड लगते हैं।
  • पारदर्शिता: आप नियमों को देख सकते हैं और उन्हें समझ सकते हैं।
  • सटीकता: उन कार्यों के लिए जहाँ चीजें समान दिखती हैं (जैसे तारीखें या फोन नंबर), नियम अक्सर AI की तुलना में अधिक सटीक थे। कठिन कार्यों के लिए, नियम अभी भी बहुत अच्छे थे, और उन्हें एक "प्रथम फ़िल्टर" के रूप में उपयोग किया जा सकता था ताकि आसान मामलों को पकड़ा जा सके, जिससे कठिन मामलों के लिए AI बच सके।

सारांश

RuleChef एक ऐसा टूल है जो एक स्मार्ट AI का उपयोग एक सरल, मानव-पठनीय निर्देश मैनुअल लिखने के लिए करता है। यह लगातार उस मैनुअल का परीक्षण करता है, मानवीय फीडबैक के आधार पर गलतियों को सुधारता है, और यह सुनिश्चित करता है कि निर्देश इतने सामान्य हों कि वे नए डेटा पर भी काम कर सकें। अंतिम परिणाम एक ऐसा सिस्टम है जो तेज़, सस्ता और भरोसेमंद है क्योंकि आप देख सकते हैं कि यह वास्तव में कैसे काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →