AG-CoT: Verified Algorithmic Traces for LLM Program Synthesis on Clifford Circuits
यह शोध पत्र प्रदर्शित करता है कि सत्यापित आरोंसन-गोट्समैन (Aaronson-Gottesman) चेन-ऑफ-थॉट ट्रेसेस पर भाषा मॉडलों को प्रशिक्षित करना, सत्यापनकर्ता-फिल्टर्ड निरंतरता प्रशिक्षण (verifier-filtered continuation training) के साथ मिलकर, सर्किट-मात्र बेसलाइन की तुलना में क्वांटम त्रुटि सुधार के लिए सही क्लिफोर्ड सर्किट (Clifford circuits) संश्लेषित करने की सटीकता में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
क्वांटम कंप्यूटिंग के उभरते क्षेत्र में, वैज्ञानिक ऐसी मशीनें बनाना सीख रहे हैं जो उप-परमाणु दुनिया के विचित्र नियमों पर काम करती हैं। इन मशीनों को काम करने के योग्य बनाने के लिए, शोधकर्ताओं को सॉफ्टवेयर लिखना होगा—जिसे क्वांटम सर्किट कहा जाता है—जो एक विशिष्ट, वांछित परिणाम तक पहुँचने के लिए सूचना की छोटी इकाइयों का हेरफेर करता है। एक क्वांटम सर्किट को निर्देशों के एक सेट के रूप में समझें जो एक कण को शुरुआती बिंदु से एक सटीक गंतव्य तक ले जाने के लिए निर्देशित करता है। चुनौती यह है कि ये निर्देश अविश्वसनीय रूप से नाजुक होते हैं; एक गलत कदम भी कण को गलत जगह भेज सकता है, जिससे पूरी गणना बेकार हो सकती है। वर्षों से, कंप्यूटर वैज्ञानिक आर्टिफिशियल इंटेलिजेंस को इन सर्किट्स को स्वचालित रूप से लिखना सिखाने की कोशिश कर रहे हैं, इस उम्मीद में कि मशीनें क्वांटम प्रयोगों के लिए आवश्यक जटिल तर्क (लॉजिक) को डिजाइन करना सीख सकेंगी। हालाँकि, एक बड़ी बाधा बनी हुई है: एक एआई अक्सर ऐसा कोड बना सकता है जो सतह पर बिल्कुल सही दिखता है, प्रोग्रामिंग भाषा के सभी व्याकरण संबंधी नियमों का पालन करता है, और बिना क्रैश हुए चलता भी है, फिर भी वह सटीक क्वांटम अवस्था (स्टेट) तैयार करने में विफल रहता है जिसकी आवश्यकता थी। कोड वैध है, लेकिन परिणाम गलत है।
एक नया अध्ययन इस विशिष्ट समस्या पर ध्यान केंद्रित करके इसे हल करता है, जो क्लिफ़ोर्ड सर्किट (Clifford circuit) नामक एक विशेष प्रकार के क्वांटम सर्किट पर आधारित है। ये सर्किट इसलिए विशेष हैं क्योंकि वे त्रुटि सुधार (एरर करेक्शन) और अन्य महत्वपूर्ण कार्यों के लिए पर्याप्त शक्तिशाली हैं, फिर भी उनमें एक अद्वितीय गणितीय गुण है जो उन्हें एक मानक कंप्यूटर पर पूर्ण सटीकता के साथ जांचने की अनुमति देता है। अधिकांश क्वांटम सिमुलेशन के विपरीत, जिनमें संभावनाओं की एक असंभव संख्या को ट्रैक करने की आवश्यकता होती है, इन सर्किट्स को सटीक रूप से और तेजी से सत्यापित किया जा सकता है। शोधकर्ताओं ने इस लाभ का उपयोग बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के लिए एक प्रशिक्षण प्रणाली बनाने हेतु किया। केवल एआई से अंतिम कोड का अनुमान लगाने के लिए कहने के बजाय, उन्होंने इसे अपना काम दिखाना सिखाया। सिस्टम ने एआई के लिए एक चरण-दर-चरण तार्किक ट्रेस (logical trace) उत्पन्न करना अनिवार्य कर दिया—एक तर्क की श्रृंखला जो यह समझाती है कि शुरुआती अवस्था को लक्षित अवस्था में कैसे बदला जाए—इससे पहले कि उसे अंतिम प्रोग्राम लिखने की अनुमति दी जाए। इस ट्रेस की जाँच एक सख्त सत्यापनकर्ता (verifier) द्वारा की जाती थी, जो एक डिजिटल रेफरी की तरह था जिसने पुष्टि की कि क्या तर्क सही था और क्या परिणामी सर्किट वास्तव में सही क्वांटम अवस्था तैयार करता है। केवल उन्हीं उदाहरणों को रखा गया जहाँ एआई ने तर्क को सही ढंग से और अंतिम परिणाम को सही ढंग से प्राप्त किया, ताकि मॉडल को आगे सिखाया जा सके।
इन दृष्टिकोण के परिणाम चौंकाने वाले थे। जब शोधकर्ताओं ने हजारों विभिन्न क्वांटम लक्ष्यों पर एआई का परीक्षण किया, तो वे मॉडल जिन्होंने सत्यापित, चरण-दर-चरण ट्रेस के साथ सीखा था, उन्होंने केवल अंतिम कोड पर प्रशिक्षित मॉडलों की तुलना में नाटकीय रूप से बेहतर प्रदर्शन किया। परीक्षण किए गए मॉडलों में से एक के लिए, सही समाधानों की संख्या कुछ ही से बढ़कर एक ही सेट की समस्याओं में दो सौ से अधिक हो गई। एक अन्य मॉडल परिवार में, सफलता दर दो प्रतिशत से भी कम से बढ़कर लगभग नौ प्रतिशत हो गई। अध्ययन ने पाया कि केवल एआई को अंतिम उत्तर दिखाना पर्याप्त नहीं था; सही करने के लिए एआई को रूपांतरण के मध्यवर्ती चरणों को समझना आवश्यक था। इसके अलावा, शोधकर्ताओं ने पाया कि भले ही एआई ने व्याकरणिक रूप से पूर्ण और भौतिक रूप से वैध कोड बनाया हो, फिर भी वह अक्सर गलत क्वांटम अवस्था तैयार करता था। एक वैध प्रोग्राम और एक सही परिणाम के बीच का यह अंतर एक महत्वपूर्ण अंतर्दृष्टि है, जो सिद्ध करता है कि कोड के सिंटैक्स (syntax) की जाँच करना पर्याप्त नहीं है। सबसे सफल मॉडल वे थे जिन्होंने सत्यापित ट्रेसेस से सीखा और फिर उन्हें केवल अपने स्वयं के सफल प्रयासों पर प्रशिक्षित करके और अधिक परिष्कृत किया गया, जिससे सटीक सत्यापन द्वारा संचालित सुधार का एक चक्र बना।
शोधकर्ताओं ने यह भी पता लगाया कि क्या यह विधि बहुत बड़े, अधिक शक्तिशाली एआई मॉडलों तक विस्तार कर सकती है। उन्होंने पाया कि हालांकि ये बड़े मॉडल नियमों का पालन करने वाला और वैध क्वांटम सर्किट परिवार के भीतर रहने वाला कोड लगभग पूरी तरह से लिख सकते थे, फिर भी वे विशिष्ट ट्रेस-आधारित प्रशिक्षण के मार्गदर्शन के बिना सटीक लक्ष्य अवस्था तक पहुँचने के लिए संघर्ष करते थे। सबसे उन्नत मॉडलों के साथ भी, सटीक अवस्था तैयार करने की सफलता दर अपेक्षाकृत कम रही, जो एकल प्रयासों के लिए छह प्रतिशत के आसपास थी। हालाँकि, जब शोधकर्ताओं ने मॉडल को प्रत्येक समस्या के लिए कई अलग-अलग उम्मीदवार (कैंडिडेट्स) उत्पन्न करने की अनुमति दी और सर्वश्रेष्ठ को चुनने के लिए सत्यापनकर्ता का उपयोग किया, तो सही समाधानों का कवरेज काफी बढ़ गया। यह सुझाव देता है कि जबकि एआई क्वांटम कोड लिखने की यांत्रिकी में बेहतर हो रहा है, वास्तविक कठिनाई उस गहरे अर्थपूर्ण समझ (semantic understanding) में निहित है जो यह सुनिश्चित करने के लिए आवश्यक है कि कोड वास्तव में वही करे जो इरादा है। अध्ययन निष्कर्ष निकालता है कि क्वांटम प्रयोगों को डिजाइन करने में एक विश्वसनीय साथी बनने के लिए, एआई को न केवल कोड उत्पन्न करने के लिए, बल्कि ऐसे कोड को उत्पन्न करने के लिए प्रशिक्षित किया जाना चाहिए जिसे उसके परिणाम में सटीक रूप से सत्यापित किया गया हो, जो एक ऐसे प्रोग्राम और एक काम करने वाले प्रोग्राम के बीच के अंतर को पाटता है जो केवल चलता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।