💬 NLP

BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting

यह शोध पत्र BacktestBench को प्रस्तुत करता है, जो 6 मिलियन मार्केट रिकॉर्ड्स से प्राप्त 18,000 से अधिक एनोटेटेड कार्यों वाला स्वचालित क्वांटिटेटिव बैकटेस्टिंग के लिए पहला बड़े पैमाने का बेंचमार्क है, साथ ही AutoBacktest को भी प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जिसे प्राकृतिक भाषा रणनीतियों को पुनरुत्पादित बैकटेस्ट में अनुवादित करने और 23 मुख्यधारा के LLMs की क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Zhensheng Wang, Wenmian Yang, Qingtai Wu, Lequan Ma, Yiquan Zhang, Weijia Jia2026-05-19
🤖 machine learning

A More Word-like Image Tokenization for MLLMs

यह शोध पत्र डिसेंटेंगल्ड विजुअल टोकेनाइजेशन (DiVT) का प्रस्ताव करता है, जो एक नवीन विधि है जो इमेज पैच एम्बेडिंग्स को सुसंगत सिमेंटिक इकाइयों में क्लस्टर करती है और इमेज की जटिलता के आधार पर टोकन बजट को गतिशील रूप से समायोजित करती है, जिससे मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को काफी कम मेमोरी और लेटेंसी लागत के साथ विजुअल इनपुट्स को अधिक कुशलता से और अनुकूल रूप से प्रोसेस करने में सक्षम बनाया जा सके।

Hyun Lee, Hyemin Jeong, Yejin Kim, Hyungwook Choi, Hyunsoo Cho, Soo Kyung Kim, Joonseok Lee2026-05-19
💻 computer science

BLAgent: Agentic RAG for File-Level Bug Localization

BLAgent एक नवीन एजेंटिक रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो कोड स्ट्रक्चर-अवेयर एनकोडिंग, ड्यूल-परस्पेक्टिव क्वेरी ट्रांसफॉर्मेशन और टू-फेज एजेंटिक रीरैंकिंग के माध्यम से फ़ाइल-लेवल बग लोकलाइजेशन को बेहतर बनाता है, जिससे SWE-bench Lite पर स्टेट-ऑफ-द-आर्ट सटीकता प्राप्त होती है और साथ ही लागत में उल्लेखनीय कमी आती है और डाउनस्ट्रीम ऑटोमेटेड प्रोग्राम रिपेयर सफलता में सुधार होता है।

Md Afif Al Mamun, Gias Uddin2026-05-19
💻 computer science

Reconciling Contradictory Views on the Effectiveness of SFT in LLMs: An Interaction Perspective

यह शोध पत्र बड़े भाषा मॉडलों (LLMs) पर सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) की असंगत प्रभावशीलता को समझाने के लिए एक इंटरैक्शन-आधारित परिप्रेक्ष्य प्रस्तावित करता है, जो यह प्रकट करता है कि SFT शुरुआत में शोर जैसे इंटरैक्शन (noise-like interactions) को हटा देता है लेकिन यदि प्रशिक्षण एक संक्षिप्त डिनोइजिंग चरण के बाद भी जारी रहता है, तो यह जल्दी ही ओवरफिटेड इंटरैक्शन की ओर ले जाता है।

Junpeng Zhang, Lei Cheng, Guoxi Zhang, Hua Cai, Qing Xu, Quanshi Zhang2026-05-19
💻 computer science

Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling

यह शोध पत्र Babel को पेश करता है, जो एक कुशल ब्लैक-बॉक्स जेलब्रेकिंग फ्रेमवर्क है जो पुनरावृत्ति, फीडबैक-संचालित अस्पष्टीकरण सैंपलिंग (obfuscation sampling) का उपयोग करके LLMs में सुरक्षा-महत्वपूर्ण अटेंशन हेड्स के विरल वितरण का लाभ उठाता है ताकि GPT-4o और Claude-3.5-Haiku जैसे फ्रंटियर मॉडल्स पर उच्च क्वेरी दक्षता के साथ अत्याधुनिक अटैक सक्सेस रेट प्राप्त किया जा सके।

Ziwei Wang, Jing Chen, Ruichao Liang, Zhi Wang, Yebo Feng, Ju Jia, Ruiying Du, Cong Wu, Yang Liu2026-05-19
🔢 mathematics

Unleashing LLMs in Bayesian Optimization: Preference-Guided Framework for Scientific Discovery

यह शोध पत्र LLM-गाइडेड बायेसियन ऑप्टिमाइज़ेशन (LGBO) प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो पारंपरिक विधियों की कोल्ड-स्टार्ट और स्केलेबिलिटी सीमाओं को दूर करने के लिए ऑप्टिमाइज़ेशन लूप में लार्ज लैंग्वेज मॉडल प्राथमिकताओं को निरंतर एकीकृत करता है, जिससे वैज्ञानिक खोज के लिए ड्राई बेंचमार्क और वास्तविक दुनिया के वेट-लैब प्रयोगों दोनों में काफी तेज़ अभिसरण (कन्वर्जेंस) प्राप्त होता है।

Xinzhe Yuan, Zhuo Chen, Jianshu Zhang, Huan Xiong, Nanyang Ye, Yuqiang Li, Qinying Gu2026-05-19
💻 computer science

LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injectio

यह शोध पत्र LivePI प्रस्तुत करता है, जो अग्रणी AI एजेंटों पर सात वास्तविक दुनिया के इनपुट सतहों और पांच दुर्भावनापूर्ण लक्ष्यों के माध्यम से अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन जोखिमों का मूल्यांकन करने वाला एक संरचित बेंचमार्क है, जो महत्वपूर्ण कमजोरियों (10.7%–29.6% सफलता दर) को उजागर करता है और उपयोगिता बनाए रखते हुए इन खतरों को कम करने में दो-स्तरीय रक्षा रणनीति की प्रभावशीलता को प्रदर्शित करता है।

Lei Zhao, Abhay Bhaskar, Edgar Dobriban2026-05-19
💬 NLP

Predictive Prefetching for Retrieval-Augmented Generation

यह शोध पत्र रिट्रीवल-ऑगमेंटेड जनरेशन के लिए एक उन्नत एसिंक्रोनस रिट्रीवल फ्रेमवर्क प्रस्तावित करता है जो सिमेंटिक प्रिकर्सर्स (semantic precursors) पर आधारित प्रेडिक्टिव प्रीफेचिंग का उपयोग करता है ताकि सिंक्रोनस बेसलाइन के तुलनीय उत्तर गुणवत्ता बनाए रखते हुए लेटेंसी को काफी कम किया जा सके और टाइम-टू-फर्स्ट-टोकन में सुधार किया जा सके।

Wuyang Zhang, Shichao Pei2026-05-19
🤖 machine learning

MARR: Module-Adaptive Residual Reconstruction for Low-Bit Post-Training Quantization

यह शोधपत्र MARR का प्रस्ताव करता है, जो लो-बिट पोस्ट-ट्रेनिंग क्वांटाइजेशन के लिए एक मॉड्यूल-एडेप्टिव रेसिडुअल रिकंस्ट्रक्शन विधि है, जो एलएलएम (LLMs) और वीआईटी (ViTs) के प्रदर्शन को महत्वपूर्ण रूप से सुधारने के लिए संचित-त्रुटि सुधार (accumulated-error correction) और हेसियन-अनुमान पूर्वाग्रह (Hessian-approximation bias) को प्रभावी ढंग से संतुलित करने हेतु मॉड्यूल-विशिष्ट स्केलिंग गुणांकों को गतिशील रूप से असाइन करने के लिए एक PID-आधारित रणनीति का उपयोग करता है।

Le Su, Xing Luo, Zhi Jin2026-05-19
📊 statistics

Unveiling Memorization-Generalization Coexistence: A Case Study on Arithmetic Tasks with Label Noise

यह शोध पत्र इस बात की जांच करता है कि कैसे ओवर-पैरामीटराइज्ड न्यूरल नेटवर्क शोर वाले लेबल (noisy labels) को याद करने और अंकगणितीय कार्यों पर सामान्यीकरण (generalize) करने का कार्य एक साथ करते हैं, जो यह प्रकट करता है कि यद्यपि शोर एक आंतरिक सामान्यीकरण संरचना के आउटपुट को दबा देता है, फिर भी इस संरचना को भारी लेबल शोर के तहत भी आवृत्ति-आधारित विधियों (frequency-based methods) के माध्यम से प्रभावी ढंग से पुनर्प्राप्त किया जा सकता है।

Linyu Liu, Pinyan Lu2026-05-19