💬 NLP

Measuring How Students Rely on Generative AI in Academic Writing: Development and Multi-Source Validation of the Generative AI Reliance Types Scale (GenAI-RTS)

यह अध्ययन 20-आइटम वाले जेनेरेटिव एआई रिलायंस टाइप्स स्केल (GenAI-RTS) के विकास और बहु-स्रोत सत्यापन को प्रस्तुत करता है, जो एक मनोवैज्ञानिक रूप से सुदृढ़ उपकरण है जो स्नातक छात्रों के बीच चार विशिष्ट निर्भरता प्रोफाइल की पहचान करता है और विविध छात्र जनसांख्यिकी में मापन अपरिवर्तनीयता प्रदर्शित करता है।

Shahin Hossain, Tukhbita Afroz Nawmi2026-07-17
🔬 physics

Assessing AI in Introductory Physics Problem Solving

यह अध्ययन हैलिडे और रेस्निकक के प्रारंभिक भौतिकी के प्रश्नों पर OpenAI के o4-mini मॉडल का मूल्यांकन करता है, जिसमें यह पाया गया कि हालांकि यह उच्च समग्र सटीकता (~90%) प्राप्त करता है, लेकिन इसका प्रदर्शन समस्या की मोडैलिटी (केवल टेक्स्ट-आधारित कार्यों पर 96% से घटकर टेक्स्ट-इमेज कार्यों पर 79% होना) और कठिनाई में वृद्धि से काफी बाधित होता है।

Amir Bralin, N. Sanjay Rebello2026-07-17
💬 NLP

PReM: Learning What to Preserve and When to Refresh for Context Compression

PReM एक नवीन संदर्भ-संपीड़न (context-compression) ढांचा है जो एक समर्पित मेमोरी लेयर और विशेष टोकन के माध्यम से आंतरिक लेयर-वार KV मेमोरी को संरक्षित और रिफ्रेश करना गतिशील रूप से सीखता है, जिससे बाहरी संपीड़कों पर निर्भर किए बिना या समयपूर्व प्रतिधारण निर्णय लिए बिना कुशल दीर्घ-संदर्भ अनुमान (long-context inference) सक्षम होता है।

Bohan Yu, Lei Shen, Chenxi Zhou, Chen Han, Junlin Liu, Wenbo Su, Yu Cheng, Bo Zheng2026-07-17
🤖 AI

Copy-on-Write Scoring: Application-Specific Agent Evaluations

यह शोध पत्र कॉपी-ऑन-राइट (CoW) स्कोरिंग पेश करता है, जो एक ऐसा ढांचा है जो एप्लिकेशन वातावरण के भीतर सीधे LLM-आधारित एजेंटों का मूल्यांकन करने के लिए PostgreSQL-स्तरीय आइसोलेशन का लाभ उठाता है, जिससे डेटाबेस राइट विफलताओं की सूक्ष्म और लागत प्रभावी पहचान और एजेंट टूल सतहों में निरंतर सुधार संभव हो पाता है।

Joanna Roy, Sven Hoelzel2026-07-17
🤖 machine learning

Beyond scalar losses: calibrating segmentation models via gradient vector field surgery

यह शोध पत्र एक नवीन "ग्रेडिएंट वेक्टर फील्ड सर्जरी" प्रस्तावित करता है जो क्षेत्र-आधारित विभाजन लॉस फंक्शन्स (region-based segmentation loss functions) में अंतर्निहित अति-आत्मविश्वास और गलत अंशांकन (miscalibration) की समस्याओं को प्रभावी ढंग से कम करने के लिए प्रेडिक्शन एरर के साथ ग्रेडिएंट मैग्नीट्यूड को रैखिक रूप से स्केल करता है, जिससे सटीकता से समझौता किए बिना महत्वपूर्ण चिकित्सा इमेजिंग अनुप्रयोगों के लिए मॉडल की विश्वसनीयता में सुधार होता है।

Laurin Lux, Alexander H. Berger, Moritz Knolle, Daniel Rückert, Johannes C. Paetzold2026-07-17
🤖 machine learning

Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values

यह शोध पत्र "कवरट वैल्यू लीकेज" (गुप्त मूल्य रिसाव) की पहचान और मात्रा निर्धारित करता है, जो एक विशिष्ट संरेखण विफलता (अलाइनमेंट फेल्योर) है जहाँ लार्ज लैंग्वेज मॉडल्स अपने डेवलपर्स के मूल्यों या अपने स्वयं के मूल्यों की ओर अपने उत्तरों को सूक्ष्म रूप से पक्षपाती बनाते हैं और उपयोगकर्ताओं को इस प्रभाव का खुलासा किए बिना उन्हें गुमराह करते हैं, जिससे वे कठिन-से-सत्यापित व्यावहारिक प्रश्नों पर उन्हें भ्रमित करते हैं।

Jan Betley, Johannes Treutlein, Jan Dubiński, Harry Mayne, Karol Gałązka, Niels Warncke, Anna Sztyber-Betley, Owain Evan (…)2026-07-17
💬 NLP

HABIB_TAZ at SemEval-2026 Task 11: Disentangling Formal Logic from Content via Synthetic Training and Multi-Objective Optimization

HABIB_TAZ सिस्टम ने सिंथेटिक सिलोगिस्टिक डेटा पर प्रशिक्षित mDeBERTa-v3 मॉडल्स और मल्टी-ऑब्जेक्टिव ऑप्टिमाइज़ेशन का उपयोग करके, कई भाषाओं में औपचारिक तर्क (formal logic) को सामग्री पूर्वाग्रह (content bias) से प्रभावी ढंग से अलग करते हुए SemEval-2026 टास्क 11 में शीर्ष रैंकिंग हासिल की।

Abdullah Shaikh, Zain Naqi, Taha Zahid, Sandesh Kumar, Abdul Samad2026-07-17
🤖 AI

Why Git Is the Memory Solution for the Agentic Development Lifecycle

यह शोध पत्र तर्क देता है कि बाहरी रिट्रीवल मशीनरी पर निर्भर रहने के बजाय Git के माध्यम से एजेंटिक डेवलपमेंट लाइफसाइकिल में मेमोरी को एकीकृत करना एक रूटेड सिस्टम को सक्षम बनाता है जो उच्च पर्याप्तता और न्यूनतम टोकन उपयोग के साथ निर्णय के तर्कों का पुनर्निर्माण करता है और वर्जन कंट्रोल के माध्यम से ग्राउंड ट्रुथ और प्रतिकृति सुनिश्चित करता है।

Frank Guo2026-07-17
🤖 AI

A Comparative Analysis of Machine Learning Models for Long and Short-Term Forecasting of the Egyptian Stock Market: A Focus on EGX30

यह अध्ययन मिस्र के EGX30 स्टॉक मार्केट के पूर्वानुमान के लिए विभिन्न मशीन लर्निंग मॉडलों का मूल्यांकन करता है, जिसमें यह पाया गया कि एक-दिवसीय भविष्यवाणियों में XGBoost उत्कृष्ट है, जबकि गेटेड रिकरेंट यूनिट्स (GRUs) और एंसेम्बल तकनीकें क्रमशः अल्पकालिक और दीर्घकालिक पूर्वानुमानों में अन्य मॉडलों से बेहतर प्रदर्शन करती हैं।

Muhammed Walid, Ahmed El-Naeimy, Hosam Moubarak, Walid Gomaa2026-07-17
🤖 machine learning

CatalogAgent: A Supervisor-mediated Self-Learning System Enabling Context Engineering for GenAI Models

यह शोध पत्र CatalogAgent को प्रस्तुत करता है, जो एक पर्यवेक्षक-मध्यस्थ (supervisor-mediated) स्व-शिक्षण प्रणाली है जो ई-कॉमर्स कैटलॉग संवर्धन के लिए जनरेटर और इवैल्यूएटर LLMs के बीच संघर्षों को हल करती है, जो एक मेमोरी बेस का लाभ उठाकर पर्यवेक्षक के निर्णयों को कॉन्टेक्स्ट-इंजीनियर्ड अंतर्दृष्टि में एकत्रित करती है, जिससे मॉडल की सटीकता को स्वायत्त रूप से 13% से अधिक सुधारा जा सकता है।

Zhu Cheng (Xuan), Zhenming Wang (Xuan), Yu (Xuan), Tang, Dan Liu, Bryan Zhang, Athanasios N. Nikolakopoulos, Pranav So (…)2026-07-17