← नवीनतम पेपर
💬 NLP

Annotation-Efficient Universal Honesty Alignment

यह शोध पत्र EliCal प्रस्तुत करता है, जो एक एनोटेशन-कुशल दो-चरणीय ढांचा है जो बड़े भाषा मॉडलों में सार्वभौमिक ईमानदारी संरेखण (honesty alignment) प्राप्त करने के लिए कम खर्चीली आत्म-संगति उद्दलन (self-consistency elicitation) को न्यूनतम शुद्धता लेबलिंग के साथ जोड़ता है, जिसे नए जारी किए गए HonestyBench बेंचमार्क द्वारा मान्य किया गया है।

मूल लेखक: Shiyu Ni, Keping Bi, Jiafeng Guo, Minghao Tang, Jingtong Wu, Zengxin Han, Xueqi Cheng

प्रकाशित 2026-03-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shiyu Ni, Keping Bi, Jiafeng Guo, Minghao Tang, Jingtong Wu, Zengxin Han, Xueqi Cheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: अति-आत्मविश्वासी रोबोट

कल्पना कीजिए कि आपके पास एक बेहद बुद्धिमान लेकिन अति-आत्मविश्वासी रोबोट सहायक है। वह लगभग किसी भी सवाल का जवाब दे सकता है, लेकिन उसमें एक घातक दोष है: उसे यह नहीं पता कि वह कब केवल अनुमान लगा रहा है।

यदि आप उससे पूछें, "फ्रांस की राजधानी क्या है?", तो वह 100% आत्मविश्वास के साथ कहेगा "पेरिस"।
यदि आप उससे पूछें, "काल्पनिक ग्रह 'ज़ोग' (Zog) की राजधानी क्या है?", तो वह भी 100% आत्मविश्वास के साथ "ज़ोग-प्राइम" कह सकता है, भले ही वह मनगढ़ंत बात बोल रहा हो।

यह खतरनाक है। वास्तविक दुनिया में, हमें चाहिए कि AI अपनी सीमाओं को जानता हो। हम चाहते हैं कि वह कहे, "मैं पेरिस के बारे में 90% निश्चित हूँ, लेकिन मैं ज़ोग-प्राइम के बारे में केवल 10% निश्चित हूँ, इसलिए मुझे शायद किसी इंसान से मदद लेनी चाहिए।" अपनी जानकारी और अपनी अनिश्चितता को पहचानने की इस क्षमता को होनेस्टी अलाइनमेंट (Honesty Alignment) कहा जाता है।

पुराना तरीका: लाखों ट्यूटर्स को काम पर रखना

रोबोट को ईमानदार बनाना सिखाने के लिए, शोधकर्ता आमतौर पर "कैलिब्रेशन" (Calibration) नामक विधि का उपयोग करते थे।

  • उपमा (Analogy): कल्पना कीजिए कि आप एक छात्र को अपनी परीक्षाओं को सटीक रूप से ग्रेड करना सिखाना चाहते हैं। पुराना तरीका यह था कि छात्र को 10,000 अभ्यास परीक्षाएँ दी जाएँ, हर एक को पूरी तरह से ग्रेड किया जाए, और फिर छात्र को उत्तर दिखाए जाएँ ताकि वह सीख सके।
  • समस्या: उन 10,000 "पूरी तरह से ग्रेड की गई" परीक्षाओं को बनाना अविश्वसनीय रूप से महंगा और धीमा है। आपको हर उत्तर की जाँच करने के लिए मानव विशेषज्ञों की आवश्यकता होती है। यह ऐसा है जैसे एक छात्र को यह सिखाने के लिए कि "मुझे नहीं पता" कैसे कहना है, लाखों ट्यूटर्स को काम पर रखना।

नया समाधान: "EliCal" (दो-चरणीय नृत्य)

इस पेपर के लेखक EliCal (एलीकेशन-देन-कैलिब्रेशन) नामक एक स्मार्ट और सस्ता तरीका प्रस्तावित करते हैं। इसे एक दो-चरणीय नृत्य की तरह समझें:

चरण 1: "ग्रुप चैट" चेक-इन (Elicitation)

मानव ट्यूटर्स को काम पर रखने के बजाय, रोबोट को एक ग्रुप चैट में एक ही सवाल का जवाब 20 बार देने के लिए कहा जाता है।

  • उपमा: कल्पना कीजिए कि रोबोट अपने ही 20 क्लोन के साथ एक कमरे में है। वे सभी उस सवाल का जवाब देते हैं।
    • यदि 19 क्लोन "पेरिस" कहते हैं और 1 "लंदन" कहता है, तो रोबोट को एहसास होता है, "हे, हम में से अधिकांश सहमत हैं! मुझे विश्वास होना चाहिए।"
    • यदि क्लोन आपस में बहस कर रहे हैं और अलग-अलग उत्तर दे रहे हैं, तो रोबोट को एहसास होता, "ओह, हम सब भ्रमित हैं। मुझे अनिश्चित होना चाहिए।"
  • जादू: रोबोट इस "सामूहिक सहमति" (group consensus) को देखना सीख जाता है और महसूस करता है, "ओह, मैं अपने ही विचारों को देखकर जान सकता हूँ कि मैं कितना आश्वस्त हूँ।" यह चरण शून्य मानव ट्यूटर्स का उपयोग करता है और रोबोट को यह सिखाता है कि आत्मविश्वास को महसूस कैसे किया जाए।

चरण 2: "स्पॉट चेक" (Calibration)

अब जब रोबोट यह जान गया है कि आत्मविश्वास को महसूस कैसे किया जाए, तो उसे बस उस भावना को एक संख्या (जैसे "80% निश्चित") में अनुवादित करना सीखना है।

  • उपमा: 10,000 परीक्षाओं को ग्रेड करने के बजाय, एक शिक्षक को केवल 1,000 (या शायद 560,000 में से केवल 1,000!) को ग्रेड करने की आवश्यकता होती है।
  • शिक्षक कहता है, "जब आपने 'सामूहिक सहमति' महसूस की थी, तब आप 10 में से 9 बार सही थे। इसलिए, 'सामूहिक सहमति' का अर्थ 90% आत्मविश्वास है।"
  • क्योंकि रोबोट ने चरण 1 में पहले से ही यह सीख लिया था कि आत्मविश्वास कैसे महसूस किया जाए, उसे केवल एक स्केल (पैमाना) सीखने के लिए थोड़े से मानवीय फीडबैक की आवश्यकता है।

परिणाम: एक सुपर-एफिशिएंट टीचर

यह पेपर इस विचार का परीक्षण करने के लिए HonestyBench (560,000 प्रश्नों का एक विशाल पुस्तकालय) नामक एक बड़ा प्लेग्राउंड पेश करता है।

  • पुराना तरीका (केवल कैलिब्रेशन): वास्तव में अच्छा होने के लिए 560,000 मानव-ग्रेड किए गए उत्तरों की आवश्यकता थी।
  • नया तरीका (EliCal): केवल 1,000 मानव-ग्रेड किए गए उत्तरों (काम का केवल 0.18%!) की आवश्यकता थी, फिर भी यह लगभग समान स्तर की ईमानदारी प्राप्त करने में सक्षम था।

यह गाड़ी चलाना सीखने जैसा है। पुराना तरीका यह था कि आप एक ड्राइविंग इंस्ट्रक्टर के साथ 10,000 मील तक गाड़ी चलाएं जो बगल में बैठकर सुधार के लिए चिल्ला रहा हो। नया तरीका यह है कि आप 10,000 मील तक एक "सिम्युलेटर" के साथ गाड़ी चलाएं जो आपको बताता है कि आप भटक रहे हैं (चरण 1), और फिर एक मानव इंस्ट्रक्टर केवल 10 मिनट के लिए आता है ताकि आपको बता सके कि ब्रेक को कितनी जोर से दबाना है (चरण 2)।

यह क्यों महत्वपूर्ण है?

  1. पैसे बचाता है: अब हमें डेटा को लेबल करने के लिए मानव सेनाओं की आवश्यकता नहीं है।
  2. बेहतर सामान्यीकरण (Generalization): क्योंकि रोबोट ने अपने स्वयं के आंतरिक संकेतों (ग्रुप चैट) पर भरोसा करना सीखा है (न कि केवल विशिष्ट उत्तरों को रटना), वह उन नए प्रकार के सवालों के सामने भी ईमानदार रहता है जिन्हें उसने पहले नहीं देखा है।
  3. विश्वसनीय AI: यह हमें ऐसा AI बनाने में मदद करता है जो हमें आत्मविश्वास के साथ झूठ नहीं बोलेगा। वह जानता होगा कि कब कहना है, "मुझे यकीन नहीं है, मुझे एक किताब देखनी चाहिए," जो भविष्य के सुरक्षित और विश्वसनीय AI की कुंजी है।

संक्षेप में: यह पेपर AI को अपनी "अंतरात्मा की आवाज" (सस्ते, स्वचालित स्व-चेक का उपयोग करके) सुनना सिखाता है और फिर बहुत कम मानवीय सहायता का उपयोग करता है ताकि उसे उस भावना पर भरोसा करना सिखाया जा सके। यह ईमानदारी है, लेकिन कम बजट में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →