← नवीनतम पेपर
🤖 AI

SoftSkill: Behavioral Compression for Contextual Adaptation

यह शोध पत्र SoftSkill को प्रस्तुत करता है, जो प्राकृतिक-भाषा व्यवहार संबंधी निर्देशों को संक्षिप्त, प्रशिक्षित निरंतर संदर्भ वेक्टर्स (continuous context vectors) में संकुचित करने की एक विधि है ताकि खोज और गणित जैसे कार्यों पर फ्रोजन लैंग्वेज मॉडल्स के प्रदर्शन को बढ़ाया जा सके, जो टोकन ओवरहेड को काफी कम करते हुए मानक प्रॉम्प्टिंग और मौजूदा अनुकूलन तकनीकों दोनों से बेहतर प्रदर्शन करता है।

मूल लेखक: Xijia Tao, Yihua Teng, Xinyu Fu, Ziru Liu, Kecheng Chen, Yuzhi Zhao, Suiyun Zhang, Rui Liu, Lingpeng Kong

प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xijia Tao, Yihua Teng, Xinyu Fu, Ziru Liu, Kecheng Chen, Yuzhi Zhao, Suiyun Zhang, Rui Liu, Lingpeng Kong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ SoftSkill पेपर का हिंदी अनुवाद दिया गया है:

मुख्य विचार: "मैनुअल पढ़ने" से "अंतर्ज्ञान (Gut Feeling) होने" तक

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट (एक Large Language Model) है जो कई काम कर सकता है, लेकिन उसे अभी तक आपके काम के विशिष्ट नियम नहीं पता हैं।

पुराना तरीका (Textual Skills/शब्द आधारित कौशल):
वर्तमान में, इस रोबोट को नया कौशल सिखाने के लिए, आप इसे साधारण अंग्रेजी में लिखी गई एक लंबी, विस्तृत निर्देश पुस्तिका (Markdown फाइल्स) देते हैं।

  • समस्या: हर बार जब रोबोट कोई कार्य करने की कोशिश करता है, तो उसे पहले यह पूरी मैनुअल पढ़नी पड़ती है। यह एक शेफ से ऐसा कहने जैसा है कि प्याज काटने से पहले वह 50 पन्नों की कुकबुक पढ़ ले। यह रोबोट की "वर्किंग मेमोरी" (context) में बहुत अधिक जगह घेर लेता है, और रोबोट को उन शब्दों को कार्यों में बदलने के लिए लगातार प्रयास करना पड़ता है। कभी-कभी, मैनुअल इतनी लंबी होती है कि वह वास्तविक प्रश्न के लिए जगह ही नहीं छोड़ती।

नया तरीका (SoftSkill):
SoftSkill पेपर पूछता है: क्या होगा अगर हम उस लंबी मैनुअल को एक छोटे, अदृश्य "अंतर्ज्ञान" या मानसिक शॉर्टकट में बदल सकें?

रोबोट को हर बार टेक्स्ट खिलाने के बजाय, हम इसे एक बार प्रशिक्षित करते हैं ताकि वह उस मैनुअल के सार को एक छोटे, 32-शब्दों के "मानसिक नोट" (एक continuous vector) में समाहित कर सके। एक बार प्रशिक्षित होने के बाद, रोबोट को अब मैनुअल पढ़ने की आवश्यकता नहीं होती। वह बस इस छोटे से मानसिक नोट को अपने साथ रखता है, और वह तुरंत "जान" जाता है कि उसे कैसे व्यवहार करना है।


यह कैसे काम करता है: "घोस्ट नोट" (Ghost Note) का उदाहरण

रोबोट को पियानो बजाने वाले एक संगीतकार के रूप में सोचें।

  1. मैनुअल (Hard Skill): यह संगीत की एक शीट है जिसमें एक विशिष्ट गाना बजाने के निर्देशों के रूप में 2,000 नोट्स दिए गए हैं। संगीतकार को बजाने से पहले हर नोट को पढ़ना पड़ता है।
  2. SoftSkill (संपीड़न/Compression): शोधकर्ता उस 2,000-नोट वाली शीट को लेते हैं और संगीतकार को गाने के एहसास को आत्मसात करने के लिए प्रशिक्षित करते हैं। वे एक छोटा "घोस्ट नोट" (केवल 32 नोट्स लंबा) बनाते हैं जो एक ट्रिगर के रूप में कार्य करता है।
    • प्रक्रिया: वे संगीतकार को शीट संगीत और गाना बजाने का सही तरीका दिखाते हैं। फिर वे उस छोटे से "घोस्ट नोट" को तब तक ट्यून करते हैं जब तक कि संगीतकार शीट संगीत देखे बिना ही गाना बिल्कुल सही तरीके से न बजाने लगे।
    • परिणाम: संगीतकार शीट संगीत को अपनी जेब में रखता है (संदर्भ के लिए या मनुष्यों को यह बताने के लिए कि कौशल क्या है), लेकिन प्रदर्शन के दौरान, वह केवल छोटे से "घोस्ट नोट" का उपयोग करता है।

उन्होंने वास्तव में क्या पाया

पेपर का परीक्षण तीन मुख्य प्रकार के कार्यों पर किया गया:

1. सरल प्रश्न (द "क्विज़ शो" टेस्ट)

  • SearchQA और LiveMath: जब रोबट को खोज संबंधी प्रश्नों के उत्तर देने या गणित की समस्याओं को हल करने की आवश्यकता थी, तो "घोस्ट नोट" ने अद्भुत काम किया।
    • जीत: इसने सैकड़ों या हजारों शब्दों लंबे मैनुअल को केवल 32 "आभासी शब्दों" (virtual words) से बदल दिया।
    • स्कोर: रोबोट ने लंबी मैनुअल पढ़ने की तुलना में बेहतर स्कोर प्राप्त किया, और यह लगभग उतना ही अच्छा था जितना कि यदि हमने रोबोट के पूरे मस्तिष्क को फिर से प्रशिक्षित किया होता (जो बहुत अधिक महंगा है)।
    • उदाहरण: यह केक बनाने के "कैसे बनाएं" के 50 पन्नों की निर्देश पुस्तिका को एक छोटे स्टिकी नोट से बदलने जैसा है जिस पर लिखा है "350° पर बेक करें"। रोबोट को ठीक पता चल जाता है कि क्या करना है।

2. जटिल क्रियाएं (द "रसोई में रोबोट" टेस्ट)

  • ALFWorld और Office Tasks: जब रोबोट को जटिल, बहु-चरणीय क्रियाएं करनी होती थीं (जैसे आभासी रसोई में मग खोजना या स्प्रेडशीट को नियंत्रित करना), तो "घोस्ट नोट" उतना सटीक नहीं था।
    • सीमा: इसने रोबोट को शुरुआत करने और बिना किसी निर्देश के काम करने की तुलना में बेहतर करने में मदद की, लेकिन यह इन कठिन, लंबे समय तक चलने वाले कार्यों के लिए लंबी मैनुल की पूरी तरह से जगह नहीं ले सका। रोबोट कभी-कभी योजना के बाद के चरणों को भूल जाता था।
    • उदाहरण: घोस्ट नोट ने रोबोट को "मग उठाना" याद रखने में मदद की, लेकिन उसे "मग उठाएं -> मेज तक चलें -> पानी डालें -> तापमान सत्यापित करें" जैसे पूरे क्रम को याद रखने में संघर्ष करना पड़ा।

मुख्य निष्कर्ष (जो पेपर दावा करता है)

  • यह एक संपीड़न (Compression) तकनीक है: आप एक विशाल निर्देश मैनुअल को बिना बहुत कुछ खोए (और कभी-कभी प्रदर्शन बढ़ाकर) एक छोटे, अदृश्य मानसिक शॉर्टकट में सिकोड़ सकते हैं।
  • "घोस्ट" "टेक्स्ट" से बेहतर है: केवल मैनुअल के टेक्स्ट को पेस्ट करना पर्याप्त नहीं है। "घोस्ट नोट" (प्रशिक्षित सॉफ्ट डेल्टा) वास्तव में व्यवहार सीखता है, न कि केवल शब्द। यदि आप बिना प्रशिक्षित किए केवल एक रैंडम "घोस्ट नोट" का उपयोग करते, तो यह बुरी तरह विफल हो जाता।
  • "लॉस" (Loss) स्कोर पर भरोसा न करें: सिर्फ इसलिए कि रोबोट "सीख" रहा है (अपनी त्रुटि दर कम कर रहा है), इसका मतलब यह नहीं है कि वह वास्तव में कार्य में बेहतर हो रहा है। शोधकर्ताओं ने पाया कि केवल प्रशिक्षण नंबरों को देखने के बजाय, सबसे अच्छे संस्करण को चुनने के लिए उन्हें वास्तविक समस्याओं पर रोबोट का परीक्षण करना पड़ा।
  • यह हर चीज़ के लिए जादू नहीं है: यह प्रश्न पूछने और उत्तरों को फॉर्मेट करने के लिए बहुत अच्छा काम करता है। यह जटिल, बहु-चरणीय रोबोट व्यवहारों के लिए अभी भी एक विकासशील प्रक्रिया है।

निचोड़ (Bottom Line)

SoftSkill एक रोबोट को सड़क के नियमों की एक लंबी किताब देकर गाड़ी चलाना सिखाने जैसा है, फिर उसे तब तक प्रशिक्षित करना जब तक कि उसमें सड़क का एक सहज "एहसास" न आ जाए। एक बार प्रशिक्षित होने के बाद, आप भारी नियम पुस्तिका को फेंक सकते हैं और बस रोबोट को एक छोटी सी कुंजी (32-टोकन प्रीफिक्स) दे सकते हैं जो तुरंत सही व्यवहार को अनलॉक कर देती है। यह स्थान बचाता है, गति बढ़ाता है, और अक्सर हर बार नियमों को पढ़ने की तुलना में बेहतर काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →