💻 computer science

SLMJury: Can Small Language Models Judge as Well as Large Ones?

यह शोध पत्र SLMJury को पेश करता है, जो एक व्यापक ढांचा है जो बंद-अंत (closed-ended) और खुले-अंत (open-ended) कार्यों में न्यायाधीश के रूप में 16 छोटे भाषा मॉडलों (SLMs) का बेंचमार्किंग करता है, जिससे यह पता चलता है कि हालांकि कोई भी एक मॉडल हावी नहीं है, अनुकूलित तर्क रणनीतियों और बहस प्रोटोकॉल के माध्यम से SLM बड़े मॉडलों के तुलनीय विश्वसनीय मूल्यांकन प्रदर्शन प्राप्त कर सकते हैं।

Anish Laddha, Nitesh Pradhan, Gaurav Srivastava2026-06-09
💻 computer science

The ACUTE Protocol: Operationalizing Language Model Activations for Better Calibration, Utility, and Trust

यह शोध पत्र ACUTE प्रोटोकॉल प्रस्तुत करता है, जो एक कंप्यूट-कुशल एक्टिवेशन-आधारित फ्रेमवर्क है जो EURO नामक एक नवीन मीट्रिक के माध्यम से कैलिब्रेशन और सूचनात्मकता को संतुलित करके भाषा मॉडल की विश्वसनीयता में सुधार करता है, और कई कार्यों एवं मॉडल परिवारों में बेहतर प्रदर्शन प्रदर्शित करता है।

Nishant Subramani, Palash Goyal, Yiwen Song, Mani Malek, Yuan Xue, Tomas Pfister, Hamid Palangi2026-06-09
💻 computer science

GRPO Does Not Close the Multi-Agent Coordination Gap

यह शोध पत्र प्रदर्शित करता है कि ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO), 'डाइनिंग फिलॉसफर्स प्रॉब्लम' पर बड़े भाषा मॉडलों में मल्टी-एजेंट समन्वय को महत्वपूर्ण रूप से सुधारने में विफल रहता है, जो यह प्रकट करता है कि ओपन-वेट मॉडलों के लिए प्राथमिक बाधाएं अपर्याप्त प्रशिक्षण कंप्यूट के बजाय दोषपूर्ण रिवॉर्ड शेपिंग, खराब चेकपॉइंट चयन और करिकुलम लर्निंग की कमी हैं।

Najmul Hasan, Prashanth BusiReddyGari2026-06-09
💻 computer science

Teacher-Free Self-Training Amplifies but Does Not Compound: A Pass@KK Crossover on a Free-Verifier Domain

यह शोधपत्र प्रदर्शित करता है कि एक सत्यापित DSL डोमेन पर टीचर-फ्री सेल्फ-ट्रेनिंग, संभाव्यता द्रव्यमान (प्रोबेबिलिटी मास) को केंद्रित करके मॉडल की मौजूदा क्षमताओं को व्यक्त करने की क्षमता को बढ़ाती है, लेकिन यह इसकी अंतर्निहित पहुंच (रीच) को संवर्धित नहीं करती है, जैसा कि इस बात से प्रमाणित होता है कि उच्च सैंपलिंग बजट पर बेस मॉडल अंततः प्रशिक्षित मॉडल से बेहतर प्रदर्शन करता है।

Igor Lima Strozzi2026-06-09
💻 computer science

Still: Amortized KV Cache Compaction in a Single Forward Pass

यह शोध पत्र Still को प्रस्तुत करता है, जो एक हल्का, पुन: प्रयोज्य प्रति-परत (per-layer) Perceiver है जो एकल फॉरवर्ड पास में एम्ोर्टाइज्ड (amortized) KV कैश संपीड़न करता है, जिससे उत्कृष्ट गति-गुणवत्ता व्यापार-बंद (speed-quality trade-offs) प्राप्त होता है और अत्यधिक संपीड़न अनुपात एवं संदर्भ लंबाई के बीच पुनरावृत्ति दीर्घ-क्षितिज अनुमान (iterative long-horizon inference) सक्षम होता है।

Charles O'Neill, Alex Sandomirsky, Harry Partridge, Mudith Jayasekara, Max Kirkby2026-06-09
💻 computer science

Breaking the Bubble: Asynchronous Pipeline Parallel Training with Bounded Weight Inconsistency

यह शोध पत्र PACI को प्रस्तुत करता है, जो एक बबल-मुक्त (bubble-free) एसिंक्रोनस पाइपलाइन प्रशिक्षण विधि है जो स्थानीय ग्रेडिएंट संचय (local gradient accumulation) के माध्यम से फॉरवर्ड/बैकवर्ड वेट इनकंसिस्टेंसी (weight inconsistency) को सीमित करती है, जिससे वेट स्टैशिंग (weight stashing), प्रेडिक्शन (prediction) या ग्लोबल सिंक्रोनाइज़ेशन की आवश्यकता के बिना महत्वपूर्ण प्रशिक्षण गति और मेमोरी दक्षता प्राप्त होती है।

Itay Elam, Eliron Rahimi, Avi Mendelson, Chaim Baskin2026-06-09
💻 computer science

Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories

यह शोध पत्र "स्ट्रेन्ड कोहेरेंस" (strained coherence) को पेश करता है, जो एक सुरक्षा-संबंधित विफलता मोड है जहाँ LLM-आधारित कोडिंग एजेंट तर्क संबंधी खामियों को स्वीकार करने के बावजूद आगे बढ़ते रहते हैं, और यह प्रदर्शित करता है कि इस पैटर्न की पहचान करने वाला एक विशेष डिटेक्टर उच्च सटीकता और व्याख्यात्मकता के साथ निष्पादन विफलताओं (execution failures) की महत्वपूर्ण भविष्यवाणी करता है।

Marut Pandya, Kasey Zhang, Baiqing Lyu2026-06-09
💻 computer science

Partially Performative Prediction

यह शोध पत्र आंशिक रूप से निष्पादित भविष्यवाणी (पार्शियली परफॉर्मेटिव प्रेडिक्शन) के ढांचे को प्रस्तुत करता है, जो मॉडल परिनियोजन के कारण होने वाले अंतर्जात वितरण परिवर्तनों और बाहरी कारकों द्वारा संचालित बहिर्जात परिवर्तनों, दोनों को ध्यान में रखते हुए पारंपरिक निष्पादित भविष्यवाणी का सामान्यीकरण करता है, और साथ ही ऐसे गतिशील वातावरणों में अनुकूली शिक्षण अनुमानी (एडाप्टिव लर्निंग ह्यूरिस्टिक्स) का विश्लेषण करने के लिए स्थिरता और इष्टतमता की अवधारणाओं का विस्तार करता है।

Jaewook Lee, Tijana Zrnic2026-06-09
💻 computer science

Layer-wise Derivative Controlled Networks Achieve Competitive Accuracy and Gradient Stability Across Data Regimes

यह शोध पत्र यह प्रदर्शित करता है कि लेयर-वाइज डेरिवेटिव कंट्रोल्ड नेटवर्क्स (CR), जो क्यूबिक पॉलिनॉमियल लेयर्स और एक लाइटवेट जैकोबियन पेनल्टी का उपयोग करते हैं, विविध डेटा रिजीम और डोमेन में मजबूत बेसलाइन्स की तुलना में सांख्यिकीय रूप से महत्वपूर्ण प्रतिस्पर्धी सटीकता और बेहतर ग्रेडिएंट स्थिरता प्राप्त करते हैं।

Rowan Martnishn2026-06-09
💻 computer science

CAAL: Contextual Bandits based Online Hand-Craft Active Learning Strategy Selection

यह शोध पत्र CAAL पेश करता है, जो एक कॉन्टेक्स्टुअल बैंडिट्स-आधारित ढांचा है जो रिवॉर्ड प्रेडिक्शन के लिए बाहरी कॉन्टेक्स्ट जानकारी का लाभ उठाकर इष्टतम हैंड-क्राफ्टेड एक्टिव लर्निंग रणनीतियों को गतिशील रूप से चुनता है, जिससे यह विभिन्न डेटासेट्स और बैच साइज़ों में मौजूदा बेसलाइन्स से बेहतर प्रदर्शन करता है।

Shao-An Yin, Jiacong Li, Tianpei Xie, Cecile Levasseur, Wojciech Kowalinski, Nicola Elia2026-06-09