← नवीनतम पेपर
🤖 AI

HERMES: Towards Efficient and Verifiable Mathematical Reasoning in LLMs

यह शोध पत्र हर्मिस (Hermes) को प्रस्तुत करता है, जो एक नवीन टूल-असिस्टेड एजेंट है जो मौजूदा दृष्टिकोणों की तुलना में बड़े भाषा मॉडलों (large language models) में अधिक सटीक, कुशल और सत्यापन योग्य गणितीय तर्क प्राप्त करने के लिए लीन (Lean) में अनौपचारिक तर्क को औपचारिक रूप से सत्यापित प्रमाणों के साथ अंतर्निहित करता है।

मूल लेखक: Azim Ospanov, Zijin Feng, Jiacheng Sun, Haoli Bai, Xin Shen, Farzan Farnia

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Azim Ospanov, Zijin Feng, Jiacheng Sun, Haoli Bai, Xin Shen, Farzan Farnia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही कठिन गणितीय पहेली को हल करने की कोशिश कर रहे हैं। आपके पास एक प्रतिभाशाली लेकिन थोड़ा भुलक्कड़ सहायक है (Large Language Model, या LLM), जो विचार मंथन (brainstorming) करने और लंबे, रचनात्मक स्पष्टीकरण लिखने में माहिर है। हालाँकि, यह सहायक कभी-कभी छोटी तार्किक गलतियाँ कर देता है, भ्रमित हो जाता है, या ऐसे तथ्यों को "भ्रमित होकर सच मान लेता है" (hallucinates) जो सुनने में सही लगते हैं लेकिन वास्तव में सत्य नहीं होते।

दूसरी ओर, आपके पास एक सख्त, अडिग गणितीय न्यायाधीश (Mathematical Judge) है (एक औपचारिक प्रमाण प्रणाली जिसे Lean कहा जाता है)। यह न्यायाधीश कभी गलती नहीं करता, लेकिन यह बहुत कठोर है। यह आपके रचनात्मक विचार मंथन को नहीं समझता; यह केवल पूरी तरह से संरचित, औपचारिक कोड को ही स्वीकार करता है। यदि आप इसे एक बिखरा हुआ स्पष्टीकरण देते हैं, तो यह केवल "Error" कहता है।

Hermes एक नया टूल है जो इन दोनों के बीच एक अनुवादक और गुणवत्ता नियंत्रण प्रबंधक के रूप में कार्य करता है। यह आपके रचनात्मक सहायक को स्वतंत्र रूप से काम करने देता है लेकिन उसे हर कुछ चरणों के बाद रोकने के लिए न्यायाधीश से पूछता है: "क्या यह विशिष्ट चरण वास्तव में सत्य है?"

Hermes कैसे काम करता है, इसे सरल भागों में यहाँ दिया गया है:

1. समस्या: "लंबी यात्रा" बनाम "कठोर परीक्षा"

  • पुराना तरीका (अनौपचारिक तर्क - Informal Reasoning): आपका सहायक पूरे समाधान को एक लंबी विचार प्रक्रिया के रूप में लिखने का प्रयास करता है। यह लचीला और तेज़ है, लेकिन यदि वह शुरुआत में ही गलत दिशा में मुड़ जाता है, तो वह अपनी गलती का एहसास करने से पहले लंबे समय तक गलत दिशा में चलता रह सकता है। यह अपनी आँखें बंद करके कार चलाने जैसा है, इस उम्मीद में कि आप दीवार से नहीं टकराएंगे।
  • दूसरा तरीका (औपचारिक प्रमाण - Formal Proving): आपका सहायक शुरुआत से ही सख्त कोड लिखने का प्रयास करता है। यह पूरी तरह से सटीक है, लेकिन यह इतना धीमा और कठिन है कि सहायक अक्सर अटक जाता है या हार मान लेता है। यह एक घर बनाने जैसा है जहाँ हर एक ईंट बिछाने से पहले उसे ब्लूप्रिंट के साथ जाँचा जाता है।

2. Hermes का समाधान: "चेकपॉइंट" प्रणाली

Hermes दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को मिलाता है। यह आपके सहायक को अपने रचनात्मक स्पष्टीकरण के कुछ चरण लिखने देता है, फिर एक "चेकपॉइंट" चलाने के लिए रुकता है।

  • अनुवादक (Formalization Module): जब सहायक कहता है, "इसलिए, कोण 45 डिग्री है," तो Hermes उस वाक्य को सख्त कोड में अनुवादित करता है जिसे न्यायाधीश समझता है।
  • न्यायाधीश (Prover Module): सख्त न्यायाधीश उस कोड की जाँच करता है।
    • यदि यह पास हो जाता है: बहुत अच्छा! Hermes उस चरण को एक मेमोरी बैंक (Memory Bank) में सहेज लेता है और सहायक को बताता है, "आप ठीक हैं, आगे बढ़ें।"
    • यदि यह विफल हो जाता है: न्यायाधीश कहता है, "नहीं, यह गलत है।" Hermes सहायक को बताता है, "रुकिए! आपने यहाँ एक गलती की है। वापस जाइए और इसे ठीक कीजिए।"
  • मेमोरी बैंक (Memory Bank): क्योंकि गणितीय समस्याओं में अक्सर तर्क की लंबी श्रृंखलाएं होती हैं, इसलिए Hermes उन सभी चरणों को याद रखता है जो चेक में पास हुए थे। यह सुनिश्चित करता है कि सहायक उन नियमों को न भूले जिन्हें उसने पहले ही सिद्ध कर दिया है, जिससे पूरा तर्क सुसंगत बना रहता है।

3. यह बेहतर क्यों है (परिणाम)

पेपर ने विभिन्न AI मॉडलों का उपयोग करके कठिन गणित प्रतियोगिताओं (जैसे AIME और HARDMath2) पर Hermes का परीक्षण किया।

  • सटीकता (Accuracy): Hermes ने AI को बहुत अधिक स्मार्ट बना दिया। सबसे कठिन समस्याओं पर, इसने AI की सफलता दर को 40% तक सुधार दिया। इसने AI को गलत उत्तर आत्मविश्वास के साथ देने से रोका।
  • दक्षता (Efficiency): आप सोच सकते हैं कि हर चरण की जाँच करना धीमा और महंगा होगा। आश्चर्यजनक रूप से, Hermes अन्य तरीकों की तुलना में वास्तव में तेज़ और सस्ता (कंप्यूटर शक्ति के मामले में) था जो 5 या 10 अलग-अलग उत्तर उत्पन्न करने और उनमें से सर्वश्रेष्ठ चुनने का प्रयास करते हैं। यह एक सीधे, सत्यापित पथ के मुकाबले एक भूलभुलैया में 10 अलग-अलग रास्ते आज़माने जैसा है।
  • स्पष्टता (Clarity): अन्य तरीकों के विपरीत जो केवल यह कहते हैं कि "इस उत्तर के सही होने की संभावना 80% है," Hermes विशिष्ट चरणों पर स्पष्ट "हाँ" या "नहीं" देता है, जिससे यह देखना आसान हो जाता है कि कोई उत्तर क्यों सही या गलत है।

निचोड़ (The Bottom Line)

Hermes आपके रचनात्मक गणित सहायक को एक स्मार्ट, स्वचालित संपादक देने जैसा है जो वास्तविक समय में उसके काम की जाँच करता है। यह सहायक को रचनात्मक रूप से सोचने से नहीं रोकता; यह बस यह सुनिश्चित करता है कि वह किसी खाई में न गिर जाए। परिणाम एक ऐसा गणित-हल करने वाला AI है जो न केवल अधिक सटीक है बल्कि अधिक कुशल और विश्वसनीय भी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →