💻 computer science

Self-CTRL: Self-Consistency Training with Reinforcement Learning

यह शोध पत्र Self-CTRL को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो भाषा मॉडलों के स्व-स्पष्टीकरणों को उनके वास्तविक व्यवहार के साथ संरेखित करती है, जिससे संभाव्य तर्क (probabilistic reasoning) और संवैधानिक एआई (constitutional AI) कार्यों में पारदर्शिता, ऑडिटेबिलिटी और सुरक्षा में महत्वपूर्ण सुधार होता है।

Itamar Pres, Laura Ruis, Melat Ghebreselassie, Belinda Z. Li, Jacob Andreas2026-06-19
💻 computer science

Redact or Keep? A Fully Local AI Cascade for Educational Dialogue De-Identification

यह शोध पत्र एक पूर्णतः स्थानीय एआई कैस्केड फ्रेमवर्क प्रस्तावित करता है जो शैक्षिक संवाद को वि-पहचानित (de-identify) करने के लिए कार्य को दो-चरणीय गोपनीयता ट्राइएज प्रक्रिया के रूप में पुनर्गठित करके, समान-परिवार के एलएलएम-केवल बेसलाइन और वाणिज्यिक एपीआई दोनों से बेहतर प्रदर्शन करता है, जिससे डेटा गवर्नेंस से समझौता किए बिना व्यक्तिगत नामों और पाठ्यचर्या संबंधी शब्दों के बीच अंतर करने में उच्च सटीकता प्राप्त होती है।

Haocheng Zhang, Zhuqian Zhou, Kirk Vanacore, Bakhtawar Ahtisham, René F. Kizilcec2026-06-19
💻 computer science

RankGraph-2: Lifecycle Co-Design for Billion-Node Graph Learning in Recommendation

RankGraph-2 एक लाइफसाइकिल को-डिज़ाइन फ्रेमवर्क है जिसे मेटा (Meta) में तैनात किया गया है जो अरबों नोड्स वाले समानता-आधारित रिट्रीवल (similarity-based retrieval) के लिए ग्राफ कंस्ट्रक्शन, रिप्रेजेंटेशन लर्निंग और रियल-टाइम सर्विंग को संयुक्त रूप से अनुकूलित करता है ताकि बेहतर रिकॉल, कम कम्प्यूटेशनल लागत और मापने योग्य व्यावसायिक प्रभाव प्राप्त किया जा सके।

Renzhi Wu, Zikun Cui, Junjie Yang, Tai Guo, Hong Li, Xian Chen, Li Yu, Ke Pan, Sri Reddy, Mahesh Srinivasan, Nipun Mathu (…)2026-06-19
💻 computer science

LLMZero: Discovering Adaptive Training Strategies for RL Post-Training via LLM Agents

यह शोध पत्र LLMZero को प्रस्तुत करता है, जो एक LLM एजेंट सिस्टम है जो निरंतर बढ़ते हुए क्षमता और दोलन करते हुए रेगुलराइजेशन मापदंडों द्वारा अभिलक्षित अनुकूल, बहु-चरणीय RL पोस्ट-ट्रेनिंग रणनीतियों की खोज के लिए ट्री सर्च का उपयोग करता है, जो विविध कार्यों में फिक्स्ड शेड्यूल्स, ग्रिड सर्च और रैंडम सर्च की तुलना में काफी बेहतर प्रदर्शन करते हैं।

Haoyang Fang, Wei Zhu, Boran Han, Alex Zhang, Zhenyu Pan, Shuo Yang, Shuai Zhang, Jiading Gai, Peng Tang, Cuixiong Hu, X (…)2026-06-19
💻 computer science

CAOA -- Completion-Assisted Object-CAD Alignment

यह शोध पत्र CAOA को प्रस्तुत करता है, जो एक संदर्भ-जागरूक पॉइंट क्लाउड कंप्लीशन मॉड्यूल को समरूपता-जागरूक पोज़ एस्टीमेशन एल्गोरिदम के साथ जोड़ता है ताकि शोर वाले इनडोर RGB-D स्कैनों से CAD मॉडल को संरेखित करने की सटीकता में महत्वपूर्ण सुधार किया जा सके, जिसे एक नई सिंथेटिक-टू-रियल डेटा रणनीति और S2C-Completion बेंचमार्क डेटासेट द्वारा समर्थित किया गया है।

Hiranya Garbha Kumar, Minhas Kamal, Balakrishnan Prabhakaran2026-06-19
💻 computer science

Veriphi: Attack-Guided Neural Network Verification with Dataset-Dependent Training Methods

यह शोध पत्र Veriphi को प्रस्तुत करता है, जो एक GPU-त्वरित सत्यापन प्रणाली है जो प्रतिकूल हमलों (adversarial attacks) को औपचारिक प्रमाणन (formal certification) के साथ जोड़ती है ताकि यह प्रदर्शित किया जा सके कि न्यूरल नेटवर्क प्रशिक्षण विधियों की प्रभावशीलता मौलिक रूप से डेटासेट पर निर्भर है, जो इस धारणा को चुनौती देती है कि प्रमाणित प्रशिक्षण (certified training) सार्वभौमिक रूप से प्रतिकूल प्रशिक्षण (adversarial training) से बेहतर प्रदर्शन करता है।

Pratik Deshmukh, Kartik Arya, Vasili Savin2026-06-19
💻 computer science

Structured Representation Learning with Locally Linear Embeddings and Adaptive Feature Fusion

संरचित मैनिफोल्ड्स (structured manifolds) और अनुकूली गेटिंग (adaptive gating) के तंत्रिका वैज्ञानिक सिद्धांतों से प्रेरित, यह शोध पत्र एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचे का प्रस्ताव करता है जो डायनेमिक्स-विशिष्ट और रिवॉर्ड-विशिष्ट विशेषताओं को अलग करने और उन्हें गतिशील रूप से संलयित करने के लिए स्थानीय रैखिक एम्बेडिंग (locally linear embeddings) और एक अटेंशन मैकेनिज्म का उपयोग करता है, जिससे बेंचमार्क कार्यों पर सीखने की दक्षता और प्रदर्शन में सुधार होता है।

Somjit Nath, Jackson J Cone, Derek Nowrouzezahrai, Samira Ebrahimi Kahou2026-06-19
💻 computer science

MagpieTTS-LF: Inference-Time Long-Form Speech Generation Without Training on Long-Form data

मैगपाई टीटीएस-एलएफ (MagpieTTS-LF) एक इन्फरेंस-टाइम विधि है जो सॉफ्ट अटेंशन प्रायर्स (soft attention priors), एक स्टेटफुल इन्फरेंस एल्गोरिदम और हिस्ट्री-अवेयर टेक्स्ट एनकोडिंग को पेश करके, मॉडल को पुनरप्रशिक्षित किए बिना, प्रोसोडिक ड्रिफ्ट (prosodic drift) और स्पीकर विसंगतियों को हल करते हुए सुसंगत, दीर्घ-रूप भाषण उत्पादन को सक्षम बनाता है।

Subhankar Ghosh, Jason Li, Paarth Neekhara, Shehzeen Hussain, Ryan Langman, Xuesong Yang, Roy Fejgin2026-06-19
💻 computer science

SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR

यह शोध पत्र यह प्रदर्शित करता है कि अत्यधिक सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) रोलआउट वितरण को संकुचित कर सकती है, जिससे एंट्रॉपी कोलैप्स (entropy collapse) होता है जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) प्रशिक्षण में रैंक इनवर्जन और प्रदर्शन में गिरावट का कारण बनता है, एक ऐसा विफलता मोड जिसे प्री-आरएल (pre-RL) एंट्रॉपी और प्रारंभिक GRPO डायनेमिक्स की निगरानी करके अनुमानित और कम किया जा सकता है।

Siddharth Aphale, Kelly Liu2026-06-19
💻 computer science

Neural Phase Correlation

यह शोध पत्र "न्यूरल फेज कोरिलेशन" प्रस्तुत करता है, जो शास्त्रीय फेज कोरिलेशन विधि का एक सीखा हुआ सामान्यीकरण है जो रिजिड और नॉन-रिजिड विरूपणों को संभालने के लिए ट्रांसफॉर्मेशन बेसिस को सीखता है, चिकित्सा इमेज रजिस्ट्रेशन में अत्याधुनिक प्रदर्शन प्राप्त करता है और अवलोकन युग्मों से क्वांटम मैकेनिकल गुणों को सफलतापूर्वक पुनर्प्राप्त करता है।

Cole Reynolds2026-06-19