💻 computer science

An In-depth Study of LLM Contributions to the Bin Packing Problem

यह शोध पत्र इस दावे को चुनौती देता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) बिन पैकिंग समस्या में गणितीय खोज को महत्वपूर्ण रूप से आगे बढ़ाते हैं, यह प्रदर्शित करते हुए कि उनके द्वारा उत्पन्न ह्यूरिस्टिक्स (heuristics) अपारदर्शी हैं और समस्या के उदाहरण वास्तव में इतने सरल हैं कि उन्हें अधिक कुशल, व्याख्या योग्य और सामान्यीकरण योग्य एल्गोरिदम द्वारा हल किया जा सकता है, जिससे LLM-जनित वैज्ञानिक योगदानों के कठोर सत्यापन की आवश्यकता पर प्रकाश पड़ता है।

Julien Herrmann, Guillaume Pallez2026-06-19
💻 computer science

RippleBench: Capturing Ripple Effects Using Existing Knowledge Repositories

यह शोध पत्र रिपलबेंच (RippleBench) को प्रस्तुत करता है, जो एक स्वचालित पाइपलाइन है जो भाषा मॉडल अनलर्निंग के "रिपल प्रभावों" (ripple effects) को मापने के लिए मौजूदा ज्ञान भंडारों का लाभ उठाता है, जिससे यह पता चलता है कि संबंधित अवधारणाओं पर प्रदर्शन में गिरावट अनलर्निंग पद्धति का एक सुसंगत गुण है न कि मूल मॉडल का।

Roy Rinberg, Usha Bhalla, Igor Shilov, Flavio P. Calmon, Rohit Gandikota2026-06-19
🤖 AI

Creativity Reconsidered: Generative AI and the Problem of Intentional Agency

यह शोध पत्र तर्क देता है कि रचनात्मकता के लिए एक आवश्यक आवश्यकता के रूप में 'इरादतन एजेंसी स्थिति' (Intentional Agency Condition) को त्याग दिया जाना चाहिए, और इसके बजाय 'रचनात्मक क्षमता' (creative ability) का प्रस्ताव देता है, जो एक ऐसा ढांचा है जो कथित इरादतनता के महत्व को सुरक्षित रखते हुए जनरेटिव एआई (generative AI) के रचनात्मक आउटपुट को समाहित करता है।

James S. Pearson, Matthew J. Dennis, Marc Cheong2026-06-19
🤖 AI

Bi-Anchor Interpolation Solver for Accelerating Generative Modeling

यह शोध पत्र बायो-एंकर इंटरपोलेशन सॉल्वर (BA-solver) का प्रस्ताव करता है, जो एक हल्का और प्रशिक्षण-कुशल तरीका है जो एक फ्रोजन बैकबोन को एक छोटे साइडनेट (SideNet) के साथ जोड़कर फ्लो मैचिंग जनरेशन को तेज करता है, ताकि बहुमुखीता से समझौता किए बिना या अत्यधिक प्रशिक्षण लागत उठाए बिना मात्र 5-10 न्यूरल फंक्शन इवैल्यूएशन में उच्च-निष्ठा वाला संश्लेषण प्राप्त किया जा सके।

Hongxu Chen, Hongxiang Li, Zhen Wang, Long Chen2026-06-19
🤖 AI

Stabilizing the Q-Gradient Field for Policy Smoothness in Actor-Critic Methods

यह शोध पत्र PAVE का प्रस्ताव करता है, जो एक क्रिटिक-केंद्रित (critic-centric) रेगुलेराइज़ेशन फ्रेमवर्क है जो पॉलिसी ऑसिलेशन्स (policy oscillations) को Q-फंक्शन की डिफरेंशियल ज्योमेट्री (differential geometry) से सैद्धांतिक रूप से जोड़कर और एक्टर में संशोधन किए बिना Q-ग्रेडिएंट वोलैटिलिटी (Q-gradient volatility) को अनुभवजन्य रूप से कम करके, एक्टर-क्रिटिक विधियों में पॉलिसी स्मूथनेस (policy smoothness) को स्थिर करता है।

Jeong Woon Lee, Kyoleen Kwak, Daeho Kim, Hyoseok Hwang2026-06-19
🤖 AI

LoRDO: Distributed Low-Rank Optimization with Infrequent Communication

यह शोध पत्र LoRDO का प्रस्ताव करता है, जो एक वितरित प्रशिक्षण ढांचा (डिस्ट्रीब्यूटेड ट्रेनिंग फ्रेमवर्क) है जो सबस्पेस एक्सप्लोरेशन को बहाल करने के लिए एक फुल-रैंक क्वासी-हाइपरबोलिक अपडेट पेश करके लो-रैंक ऑप्टिमाइज़ेशन को विरल संचार (इन्फ्रीक्वेंट कम्युनिकेशन) के साथ एकीकृत करता है, जिससे मानक DDP प्रदर्शन के साथ लगभग समानता प्राप्त करते हुए संचार ओवरहेड को लगभग 10 गुना कम किया जा सकता है।

Andrej Jovanović, Alex Iacob, Mher Safaryan, Ionut-Vlad Modoranu, Lorenzo Sani, William F. Shen, Xinchi Qiu, Dan Alistar (…)2026-06-19
🤖 AI

Flickering Multi-Armed Bandits

यह शोध पत्र गतिशील क्रिया उपलब्धता बाधाओं के तहत अनुक्रमिक निर्णय लेने को मॉडल करने के लिए फ्लिकरिंग मल्टी-आर्म्ड बैंडिट्स (FMAB) ढांचे को प्रस्तुत करता है, जो एक दो-चरणीय लेज़ी रैंडम वॉक एल्गोरिदम का प्रस्ताव करता है जो स्टोकेस्टिक रूप से विकसित होने वाले ग्राफ वातावरण में सूचना प्राप्ति और नेविगेशन ओवरहेड के बीच संतुलन बनाकर निकट-इष्टतम उप-रैखिक रिग्रेट (sublinear regret) प्राप्त करता है।

Sourav Chakraborty, Amit Kiran Rege, Claire Monteleoni, Lijun Chen2026-06-19
🤖 AI

Reinforcement-aware Knowledge Distillation for LLM Reasoning

यह शोध पत्र RL-aware Distillation (RLAD) का प्रस्ताव करता है, जो एक विधि है जो वितरण बेमेल (distribution mismatch) और उद्देश्य हस्तक्षेप (objective interference) को दूर करने के लिए Trust Region Ratio Distillation (TRRD) ऑब्जेक्टिव के माध्यम से सुदृढीकरण शिक्षण (reinforcement learning) में चयनात्मक अनुकरण (selective imitation) को एकीकृत करती है, जिससे छोटे भाषा मॉडल अन्वेषण (exploration) और दोहन (exploitation) को संतुलित करते हुए बड़े शिक्षकों से प्रभावी ढंग से लंबी चेन-ऑफ-थॉट (chain-of-thought) तर्क क्षमताओं को विरासत में प्राप्त कर पाते हैं।

Zhaoyang Zhang, Shuli Jiang, Yantao Shen, Yuting Zhang, Dhananjay Ram, Shuo Yang, Zhuowen Tu, Wei Xia, Stefano Soatto2026-06-19
🤖 AI

Mitigating Legibility Tax with Decoupled Prover-Verifier Games

यह शोध पत्र एक डिकपल्ड प्रूवर-वेरिफायर गेम फ्रेमवर्क का प्रस्ताव करता है जो एक ट्रांसलेटर मॉडल को प्रशिक्षित करके "लेजिबिलिटी टैक्स" को कम करता है ताकि सॉल्वर के सही लेकिन अनचेकेबल आउटपुट्स को एक सत्यापन योग्य प्रारूप में परिवर्तित किया जा सके, जिससे सटीकता को बनाए रखते हुए जांचने की क्षमता को बढ़ाया जा सके।

Yegon Kim, Juho Lee2026-06-19
💻 computer science

Dynamic In-Group Persona Generation for Enhancing Human-AI Rapport

यह शोध पत्र अंतर-वैयक्तिक डोमेन में मानव-एआई तालमेल (रैपो) को बढ़ाने के लिए एक नवीन पद्धति प्रस्तुत और मान्य करता है, जो उपयोगकर्ता की प्राथमिक चिंताओं को साझा करते हुए पृष्ठभूमि विवरणों में भिन्न होने वाले सिंथेटिक इन-ग्रुप व्यक्तित्वों (इन-ग्रुप पर्सोना) को गतिशील रूप से उत्पन्न करती है, जिसे एक मानव-विषय अध्ययन यह दर्शाता है कि यह बेसलाइन एजेंटों की तुलना में कथित तालमेल, व्यक्तिगत प्रासंगिकता और जुड़ाव में महत्वपूर्ण सुधार करता है।

Yoonseok Oh, Inseo Jung, Jinkyu Kim, Jungbeom Lee, Minwoo Kang, Suhong Moon2026-06-19