← नवीनतम पेपर
💬 NLP

Programming by Backprop: An Instruction is Worth 100 Examples When Finetuning LLMs

यह शोध पत्र प्रोग्रामिंग बाय बैकप्रॉप (PBB) को प्रस्तुत करता है, जो एक ऐसा प्रशिक्षण शासन (training regime) है जो बड़े भाषा मॉडलों को घोषणात्मक निर्देशों (declarative instructions) से पुन: प्रयोज्य प्रक्रियात्मक व्यवहारों (reusable procedural behaviors) को कुशलतापूर्वक प्राप्त करने में सक्षम बनाता है, जिससे केवल प्रदर्शन उदाहरणों (demonstration examples) से सीखने की तुलना में 100 गुना अधिक सैंपल दक्षता प्राप्त होती है।

मूल लेखक: Jonathan Cook, Silvia Sapora, Arash Ahmadian, Akbir Khan, Tim Rocktaschel, Jakob Foerster, Laura Ruis

प्रकाशित 2026-02-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jonathan Cook, Silvia Sapora, Arash Ahmadian, Akbir Khan, Tim Rocktaschel, Jakob Foerster, Laura Ruis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अत्यंत बुद्धिमान लेकिन शाब्दिक अर्थ समझने वाले (literal-minded) रोबोट को खाना बनाना सिखा रहे हैं।

पुराना तरीका (मानक प्रशिक्षण):
आमतौर पर, रोबोट को कोई नया व्यंजन सिखाने के लिए, आपको उसे डिश बनाने की प्रक्रिया चरण-दर-चरण दिखानी पड़ती है। आप कहते हैं, "देखो मैं प्याज काट रहा हूँ, फिर इसे भून रहा हूँ, फिर मसाला डाल रहा हूँ।" आपको रोबोट को पैटर्न याद कराने के लिए यह सैकड़ों बार करना पड़ता है। यदि आप उसे कोई नया व्यंजन सिखाना चाहते हैं, तो आपको भी उसे वह विशिष्ट डिश सैकड़ों बार दिखानी होगी। यह धीमा, डेटा-भारी और महंगा है।

नया तरीका (प्रोग्रामिंग बाय बैकप्रॉप - PBB):
यह शोध पत्र एक नया तरीका पेश करता है जिसे प्रोग्रामिंग बाय बैकप्रॉप (PBB) कहा जाता है। रोबोट को खाना बनाने की प्रक्रिया सैकड़ों बार दिखाने के बजाय, आप बस उसे लिखित रेसिपी (निर्देश) थमा देते हैं और कहते हैं, "यह रहा नियम। इसे सीख लो।"

इस शोध पत्र की मुख्य बात यह है: "एक निर्देश 100 उदाहरणों के बराबर है।"

यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करके यहाँ दिया गया है:

1. मूल विचार: ज्ञान को "कंपाइल" करना

एक कंप्यूटर प्रोग्राम के बारे में सोचें। आप कोड (निर्देश) लिख सकते हैं, और कंप्यूटर उसे हर बार रन करता है।

  • मानक AI: AI आपको कोड को 100 बार चलते हुए देखकर सीखता है। यह कार्यों को याद करता है।
  • PBB: AI कोड को एक बार पढ़ता है, तर्क (logic) को समझता है, और इसे सीधे अपने मस्तिष्क (इसके आंतरिक वेट्स/weights) में "कंपाइल" कर लेता है। अब, जब आप इसे कार्य करने के लिए कहते हैं, तो इसे दोबारा कोड देखने की आवश्यकता नहीं होती; तर्क पहले से ही इसके न्यूरॉन्स में निर्मित हो चुका होता है।

2. दो प्रशिक्षण रेसिपी (करिकुलम)

लेखकों ने पाया कि आप केवल रोबोट के सामने रेसिपी नहीं फेंक सकते और उम्मीद नहीं कर सकते कि वह तुरंत काम करने लगेगा। आपको एक विशिष्ट प्रशिक्षण कार्यक्रम की आवश्यकता है। उन्होंने दो दृष्टिकोणों का परीक्षण किया:

A. प्रोएक्टिव PBB (द "अपरेंटिस" या प्रशिक्षु विधि)

  • चरण 1: आप रोबोट को बहुत सारी अलग-अलग रेसिपी (निर्देश) और साथ में वास्तविक खाना बनाना (उदाहरण) सिखाते हैं। रोबोट "रेसिपी पढ़ने" और "खाना बनाने" के बीच के संबंध को सीखता है।
  • चरण 2: आप रोबोट को एक नई रेसिपी देते हैं जो उसने पहले कभी नहीं देखी है, लेकिन आप उसे खाना बनाना नहीं दिखाते। आप बस कहते हैं, "यह रहा टेक्स्ट, इसे समझो।"
  • परिणाम: क्योंकि रोबोट ने चरण 1 में रेसिपी से सीखना पहले ही सीख लिया था, इसलिए वह नए रेसिपी को तुरंत अपने मस्तिष्क में "कंपाइल" कर सकता है और उसे निष्पादित (execute) कर सकता है।

B. रेट्रोएक्टिव PBB (द "थ्योरी फर्स्ट" या सिद्धांत प्रथम विधि)

  • चरण 1: आप रोबोट को हजारों रेसिपी (निर्देश) देते हैं लेकिन कोई भी खाना बनाने का उदाहरण नहीं देते। रोबोट रेसिपी के टेक्स्ट को याद कर लेता है लेकिन उसे अभी तक खाना बनाना नहीं आता। यह एक कुकबुक को शुरू से अंत तक पढ़ने जैसा है लेकिन कभी रसोई में न जाने जैसा।
  • चरण 2: इसके बाद, आप रोबोट को कुछ विशिष्ट व्यंजन बनाना सिखाते हैं।
  • परिणाम: अचानक, रोबोट "जाग" जाता है। खाना बनाने के उदाहरण एक चाबी की तरह काम करते हैं जो चरण 1 में संग्रहीत ज्ञान को अनलॉक कर देते हैं। वह महसूस करता है, "ओह! मैंने जो रेसिपी पहले याद की थी, उसका अर्थ यह है कि मुझे यह करना चाहिए!" अब वह उस तर्क को उन नई रेसिपी पर लागू कर सकता है जिन्हें उसने पहले नहीं देखा है।

3. यह क्यों महत्वपूर्ण है (जादू)

  • अत्यधिक दक्षता: उनके प्रयोगों में, AI को एक एकल निर्देश देने से लगभग उतना ही काम हुआ जितना उसे 100 उदाहरण दिखाने से होता। यह बहुत सारा समय और डेटा बचाता है।
  • पूर्वाग्रह (Biases) को ठीक करना: कल्पना कीजिए कि आप रोबोट को केवल इसलिए "नमक" के साथ खाना बनाना सिखाते हैं क्योंकि आपके पास केवल वही उपलब्ध है। रोबोट सोचेगा कि सभी भोजन में नमक की आवश्यकता होती है। लेकिन यदि आप उसे "स्वाद अनुसार सीजन करें" का निर्देश देते हैं, तो वह सामान्य नियम सीख जाता है और वह केवल नमक के प्रति पक्षपाती नहीं होगा। PBB मॉडल को केवल उदाहरणों की नकल करने के बजाय नियम सीखने में मदद करता है।
  • कोड बनाम शब्द: शोध पत्र में पाया गया कि रोबोट तब सबसे अच्छा सीखता है जब निर्देश कोड (जैसे Python) में लिखे होते हैं न कि प्राकृतिक भाषा (जैसे अंग्रेजी वाक्य) में। यह ऐसा है जैसे रोबोट निर्देश के "गणित" को उसकी "कहानी" की तुलना में बेहतर समझता है। हालांकि, जैसे-जैसे रोबोट बड़े और अधिक स्मार्ट होते जा रहे हैं, वे प्राकृतिक भाषा के निर्देशों को समझने में भी बेहतर हो रहे हैं।

4. कमी (The Catch)

यह शोध पत्र स्वीकार करता है कि यह "कंपाइल" किया गया ज्ञान अभी पूर्ण नहीं है।

  • यदि आप रोबोट को अभी (चैट में) निर्देश देते हैं, तो यह पूरी तरह से काम करता है।
  • यदि आप रोबोट द्वारा प्रशिक्षण से निर्देश को "याद" रखने पर भरोसा करते हैं (PBB), तो यह लगभग 80-90% ही उतना अच्छा काम करता है। यह थोड़ा "शोर भरा" (noisy) है, जैसे रेडियो में कुछ स्टैटिक (static) हो, लेकिन यह काम चला देता है।

बड़ी तस्वीर

यह शोध बताता है कि हमें AI को हर एक कार्य के लाखों उदाहरण खिलाने की आवश्यकता नहीं है। इसके बजाय, हम उन्हें चीजें करने के नियम और तर्क सिखा सकते हैं।

सुरक्षा चेतावनी:
यह एक दोधारी तलवार है। यदि हम केवल उसके प्रशिक्षण डेटा में निर्देश लिखकर AI में व्यवहारों को "प्रोग्राम" कर सकते हैं, तो हमें बहुत सावधान रहना होगा। यदि हम अनजाने में प्रशिक्षण डेटा में कोई खतरनाक निर्देश शामिल कर देते हैं, तो AI उस खतरनाक व्यवहार को अपने मस्तिष्क में "कंपाइल" कर सकता है और बाद में उसे निष्पादित कर सकता है, भले ही हमने चैट के दौरान उसे स्पष्ट रूप से ऐसा करने के लिए न कहा हो।

संक्षेप में: PBB एक छात्र को गणित के सिद्धांतों को सिखाने जैसा है ताकि वह किसी भी समस्या को हल कर सके, बजाय इसके कि उसे 1,000 विशिष्ट होमवर्क प्रश्नों के उत्तर रटा दिए जाएं। यह तेज़ है, स्मार्ट है, और यह हमारे सोचने के तरीके को बदल देता है कि AI को कैसे प्रशिक्षित किया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →