🤖 machine learning

Gradient Smoothing: Coupling Layer-wise Updates for Improved Optimization

यह शोध पत्र "ग्रेडिएंट स्मूथिंग" (Gradient Smoothing) का परिचय देता है, जो एक गणनात्मक रूप से कुशल अनुकूलन ढांचा है जो मॉडल आर्किटेक्चर या प्रशिक्षण उद्देश्यों को संशोधित किए बिना, आर्किटेक्चरल ब्लॉक्स के बीच संरचनात्मक संबंधों का लाभ उठाते हुए, लेयर-वार अपडेट पर डेप्थ-वाइज स्मूथिंग लागू करके डीप न्यूरल नेटवर्क के प्रशिक्षण और सामान्यीकरण (generalization) में सुधार करता है।

Haoming Meng, Anton Sugolov, Vardan Papyan2026-07-01
🤖 AI

BayesBench: Evaluating LLM Belief Trajectories Under Multi-Turn Evidence Accumulation

यह शोध पत्र BayesBench प्रस्तुत करता है, जो सिमुलेशन वातावरणों का एक समूह है जो यह मूल्यांकन करता है कि बड़े भाषा मॉडल (LLMs) बहु-चरण (multi-turn) बातचीत के दौरान तर्कसंगत बेयसियन विश्वास अपडेट (Bayesian belief updates) के कितने करीब अनुमान लगाते हैं, जिससे यह पता चलता है कि हालांकि स्केलिंग से लेटेंट इन्फरेंस (latent inference) में सुधार होता है, लेकिन यह सटीक डाउनस्ट्रीम भविष्यवाणियों में विश्वसनीय रूप से परिवर्तित नहीं होता है।

Ankur Samanta, Akshayaa Magesh, Tal Lancewicki, Ayush Jain, Youliang Yu, Paul Sajda, Kaveh Hassani, Aditya Modi, Daniel (…)2026-07-01
💬 NLP

Test-Time Verification for Text-to-SQL via Outcome Reward Models

यह शोध पत्र GradeSQL प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो Text-to-SQL विश्वसनीयता को बढ़ाने के लिए सीखे गए सिमेंटिक स्कोरर्स के रूप में Outcome Reward Models (ORMs) का लाभ उठाता है, यह प्रदर्शित करते हुए कि ORM-आधारित सत्यापन BIRD और Spider बेंचमार्क पर पारंपरिक ह्यूरिस्टिक विधियों जैसे कि execution-based Best-of-N और Majority Voting की तुलना में काफी बेहतर प्रदर्शन करता है।

Mattia Tritto, Giuseppe Farano, Dario Di Palma, Gaetano Rossiello, Fedelucio Narducci, Dharmashankar Subramanian, Tommas (…)2026-07-01
🤖 AI

Beyond expert users: agents should help users construct preferences, not just elicit them

यह शोध पत्र तर्क देता है कि एआई एजेंटों को केवल उपयोगकर्ताओं की पसंद को प्राप्त करने के बजाय, आवश्यक डोमेन ज्ञान प्रदान करके उपयोगकर्ताओं को उनकी पसंद बनाने में सक्रिय रूप से मदद करनी चाहिए, जो एक ऐसी चुनौती है जिसे प्रस्तावित CoPref फ्रेमवर्क और CoShop बेंचमार्क द्वारा रेखांकित किया गया है जो यह प्रकट करते हैं कि वर्तमान फ्रंटियर मॉडल कई संवाद दौरों के बावजूद उपयोगकर्ता की समझ का विस्तार करने में संघर्ष करते हैं।

Irena Saracay, Ludwig Schmidt, Carlos Guestrin2026-07-01
💬 NLP

Training Therapeutic Judges and Multi-Agent Systems for Human-Aligned Mental Health Support

यह शोध पत्र TheraAlign को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो एक विशिष्ट मूल्यांकनकर्ता (TheraJudge) को क्रियात्मक, बहु-आयामी प्रतिक्रिया प्रदान करने के लिए प्रशिक्षित करके मानसिक स्वास्थ्य सहायता को बढ़ाता है, जो एक बहु-एजेंट परिशोधन प्रणाली (TheraAgent) को चिकित्सीय प्रतिक्रियाओं की सुरक्षा, प्रासंगिकता और सहानुभूति में महत्वपूर्ण सुधार करने के लिए प्रेरित करता है।

Mizanur Rahman, Abeer Badawi, Elahe Rahimi, Laleh Seyyed-Kalantari, Frank Rudzicz, Enamul Hoque, Elham Dolatabadi2026-07-01
💻 computer science

How Human Feedback Shapes AI-generated Community Notes

यह शोध पत्र X पर सहयोगात्मक नोट्स के एक विशाल संग्रह का विश्लेषण करता है ताकि यह प्रदर्शित किया जा सके कि हालांकि मानवीय फीडबैक AI द्वारा तैयार की गई सामग्री की उपयोगिता में महत्वपूर्ण सुधार करता है—विशेष रूप से तथ्यात्मक सुधारों और दावों को चुनौती देने के माध्यम से—ये हाइब्रिड नोट्स सीमित भागीदारी के कारण अपनाने में बाधाओं का सामना करते हैं और अंततः उन पोस्टों को लक्षित करके एक पूरक भूमिका निभाते हैं जिन्हें विशुद्ध रूप से मानवीय या केवल AI-आधारित मॉडरेशन द्वारा अनदेखा कर दिया जाता है।

Soham De, Isaac Slaughter, Jiawei Guo, Qiao-Yun Cheng, Jiayuan Yan, Sruti Banerjee, Martin Saveski2026-07-01
🤖 AI

Investigating Multi-Agent Deliberation in Law

यह शोध पत्र एआई-संचालित कानूनी तर्क के लिए कानूनी प्रक्रियाओं से प्रेरित मल्टी-एजेंट विचार-विमर्श ढांचों की जांच करता है, जो यह प्रदर्शित करता है कि हालांकि वे बेसलाइन लार्ज लैंग्वेज मॉडल्स के तुलनीय प्रदर्शन प्राप्त करते हैं, फिर भी वे जटिल मामलों को हल करने और बहु-परिप्रेक्ष्य आलोचनात्मक सोच को संभालने में विशिष्ट लाभ प्रदान करते हैं।

Cor Steging, Ludi van Leeuwen, Tadeusz Zbiegień2026-07-01
🤖 AI

Why Solve It Twice? Hierarchical Accumulation of Skills for Transfer-Efficient ML Engineering

यह शोध पत्र HASTE को प्रस्तुत करता है, जो एक पदानुक्रमित बहु-एजेंट प्रणाली (hierarchical multi-agent system) है जो कुशल ज्ञान हस्तांतरण को सक्षम करने के लिए ML इंजीनियरिंग कौशल को वैश्विक, डोमेन और प्रतियोगिता-विशिष्ट स्तरों में व्यवस्थित करती है, जिससे नियंत्रित परीक्षणों में 100% पदक दर और पूर्ण बेंचमार्क पर 77.3% की उपलब्धि प्राप्त होती है और फ्लैट या कोल्ड-स्टार्ट दृष्टिकोणों की तुलना में कंप्यूट लागत और परिशोधन पुनरावृत्तियों (refinement iterations) को काफी कम किया जाता है।

Yongbin Kim, Yashar Talebirad, Osmar R. Zaiane2026-07-01
💻 computer science

Budget-Adaptive Routing: Skipping the Weak When the Strong Answers Anyway

यह शोध पत्र एज-क्लाउड इन्फरेंस के लिए एक बजट-अनुकूली रूटिंग फ्रेमवर्क प्रस्तावित करता है जो ऑफलोड बजट के आधार पर 'वीक-स्किपिंग' और 'वीक-कंडीशन्ड' एस्टिमेटर्स के बीच गतिशील रूप से चयन करता है, जिससे लेटेंसी कम होती है और अत्याधुनिक विधियों तथा यहाँ तक कि अकेले स्ट्रॉन्ग क्लाउड मॉडल की तुलना में भी उच्च सटीकता प्राप्त होती है।

Wei Geng, Nitinder Mohan, Jörg Ott2026-07-01
🤖 machine learning

Behavior Cloning is Not All You Need: The Optimality of On-Policy Distillation for Noisy Expert Feedback

यह शोध पत्र एक नॉइज़ी एक्सपर्ट मॉडल (noisy expert model) प्रस्तुत करता है जो सैद्धांतिक रूप से यह स्पष्ट करता है कि लैंग्वेज मॉडल ट्रेनिंग में ऑन-पॉलिसी डिस्टिलेशन (on-policy distillation), ऑफलाइन बिहेवियर क्लोनिंग (offline behavior cloning) की तुलना में अक्सर बेहतर प्रदर्शन क्यों करता है, यह प्रदर्शित करते हुए कि जहाँ ऑफलाइन नॉइजी ट्रेजेक्टरीज (noisy trajectories) से सीखना घातीय सैंपल कॉम्प्लेक्सिटी (exponential sample complexity) का कारण बनता है, वहीं विशिष्ट शोर की स्थितियों के तहत एक नॉइज़ी एक्सपर्ट के साथ ऑनलाइन इंटरैक्शन हॉरिजन (horizon) पर बहुपद निर्भरता (polynomial dependence) प्राप्त कर सकता है।

Ved Sriraman, Peihan Liu, Daniel Hsu, Adam Block2026-07-01