📊 statistics

On Using Large Language Models to Enhance Clinically-Driven Missing Data Recovery Algorithms in Electronic Health Records

यह अध्ययन प्रदर्शित करता है कि ICD-10-आधारित "रोडमैप" एल्गोरिदम को परिष्कृत करने के लिए नैदानिक विशेषज्ञता के साथ बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) को संयोजित करना, गायब इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड डेटा की सटीक और स्केलेबल रिकवरी को सक्षम बनाता है, जो पारंपरिक, संसाधन-गहन विशेषज्ञ चार्ट समीक्षाओं के तुलनीय प्रदर्शन प्राप्त करता है।

Sarah C. Lotspeich, Abbey Collins, Brian J. Wells, Ashish K. Khanna, Joseph Rigdon, Lucy D'Agostino McGowan2026-06-10
🤖 machine learning

Influence Dynamics and Stagewise Data Attribution

यह शोध पत्र सिंगुलर लर्निंग थ्योरी (singular learning theory) पर आधारित एक स्टेजवाइज डेटा एट्रिब्यूशन फ्रेमवर्क प्रस्तुत करता है, जो यह प्रकट करता है कि प्रशिक्षण डेटा का प्रभाव गतिशील और गैर-एकदिष्ट (non-monotonic) है, जिसमें विशिष्ट बदलाव और साइन फ्लिप (sign flips) होते हैं जो खिलौना मॉडलों (toy models) और लार्ज लैंग्वेज मॉडल्स (LLMs) दोनों में सिमेंटिक पदानुक्रमों (semantic hierarchies) के प्रगतिशील शिक्षण के साथ संरेखित होते हैं।

Jin Hwa Lee, Matthew Smith, Maxwell Adam, Jesse Hoogland2026-06-10
🔢 mathematics

On the Condition Number Dependency in Bilevel Optimization

यह शोध पत्र एक नॉनकॉन्वेक्स (nonconvex) अपर लेवल और स्ट्रॉन्गली कॉन्वेक्स (strongly convex) लोअर लेवल वाले बाइलेवल ऑप्टिमाइज़ेशन के लिए नए ओरेकल कॉम्प्लेक्सिटी लोअर बाउंड्स स्थापित करता है, जो बाइलेवल और मिनिमैक्स समस्याओं के बीच कंडीशन नंबर डिपेंडेंसी (condition number dependency) में एक प्रमाणित अंतर को प्रदर्शित करता है और इन परिणामों को हाई-ऑर्डर स्मूथ (high-order smooth), स्टोकेस्टिक (stochastic), और कॉन्वेक्स हाइपर-ऑब्जेक्टिव (convex hyper-objective) सहित विभिन्न सेटिंग्स तक विस्तारित करता है।

Lesi Chen, Jingzhao Zhang2026-06-10
💬 NLP

When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models

यह शोध पत्र पहचानता है कि रिवॉर्ड मॉडल्स के लिए मानक ब्रैडली-टेरी लॉस (Bradley-Terry loss) एक रिप्रेजेंटेशन डिस्टेंस बायस (representation distance bias) से ग्रस्त है जो प्रेडिक्शन एरर के बजाय फीचर डिस्टेंस के आधार पर असंगत ग्रेडिएंट अपडेट का कारण बनता है, और यह नॉर्मबीटी (NormBT) प्रस्तावित करता है, जो एक हल्का नॉर्मलाइजेशन स्कीम है जो इस समस्या को कम करता है और विशेष रूप से सूक्ष्म-स्तरीय रीजनिंग कार्यों पर प्रदर्शन में उल्लेखनीय सुधार करता है।

Tong Xie, Andrew Bai, Yuanhao Ban, Yunqi Hong, Haoyu Li, Cho-Jui Hsieh2026-06-10
🤖 machine learning

SCOPE: Sequential Causal Optimization of Process Interventions

यह शोध पत्र SCOPE प्रस्तुत करता है, जो एक प्रिसक्रिप्टिव प्रोसेस मॉनिटरिंग दृष्टिकोण है जो अवलोकन संबंधी डेटा से क्रमिक हस्तक्षेपों को अनुकूलित करने के लिए बैकवर्ड इंडक्शन और कॉज़ल लर्नर्स का उपयोग करता है, जो प्रमुख प्रदर्शन संकेतकों (KPIs) में सुधार के लिए हस्तक्षेपों को संरेखित करने में मौजूदा विधियों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Jakob De Moor, Hans Weytjens, Johannes De Smedt, Jochen De Weerdt2026-06-10
🔬 physics

Pushing the limits of one-dimensional NMR spectroscopy for automated structure elucidation using artificial intelligence

यह शोध पत्र ट्रांसफॉर्मर आर्किटेक्चर पर आधारित एक डीप लर्निंग फ्रेमवर्क प्रस्तुत करता है जो केवल एक-आयामी 1^1H और 13^{13}C NMR स्पेक्ट्रा का उपयोग करके 40 गैर-हाइड्रोजन परमाणुओं तक वाले कार्बनिक अणुओं के लिए स्वचालित डे नोवो (de novo) संरचना स्पष्टीकरण को सफलतापूर्वक प्राप्त करता है, और 60.4% मामलों में शीर्ष 15 भविष्यवाणियों के भीतर लक्षित अणु की सही पहचान करता है।

Frank Hu, Jonathan M. Tubb, Dimitris Argyropoulos, Sergey Golotvin, Mikhail Elyashberg, Grant M. Rotskoff, Matthew W. Ka (…)2026-06-10
💬 NLP

AI Application Gives Users Real-Time Feedback on the Level of Peace in the Social Media Videos They Watch

यह शोध पत्र एक ऐसे एआई अनुप्रयोग को प्रस्तुत करता है जो यूट्यूब वीडियो ट्रांसक्रिप्ट का वास्तविक समय में विश्लेषण करने के लिए लार्ज लैंग्वेज मॉडल्स का उपयोग करता है, जो शांति से संबंधित पांच सामाजिक आयामों को सफलतापूर्वक मापता है और उपयोगकर्ताओं को उनके मीडिया आहार पर फीडबैक प्रदान करता है, जो पारंपरिक सेंटिमेंट एनालिसिस से बेहतर प्रदर्शन करता है और लिखित पाठ पर प्रशिक्षित मॉडल्स की बोलचाल की भाषा पर लागू होने वाली सीमाओं को प्रदर्शित करता है।

P. Gilda (Columbia University), P. Dungarwal (Columbia University), A. Thongkham (Columbia University), E. T. Ajayi (St (…)2026-06-10
🤖 machine learning

MMD Guidance: Training-Free Distribution Adaptation for Diffusion Models via Maximum Mean Discrepancy Guidance

यह शोध पत्र MMD गाइडेंस (MMD Guidance) का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त (training-free) विधि है जो रिवर्स डिफ्यूजन प्रक्रिया में मैक्सिमम मीन डिसक्रेपेंसी (Maximum Mean Discrepancy) ग्रेडिएंट्स को शामिल करके पूर्व-प्रशिक्षित डिफ्यूजन मॉडल्स को उपयोगकर्ता-विशिष्ट लक्षित वितरणों के अनुकूल बनाती है, जिससे सीमित संदर्भ डेटा के साथ प्रभावी वितरण संरेखण प्राप्त किया जाता है और नमूना निष्ठा (sample fidelity) भी सुरक्षित रहती है।

Matina Mahdizadeh Sani, Nima Jamali, Mohammad Jalali, Farzan Farnia2026-06-10
🤖 AI

Unifying Ranking and Generation in Query Auto-Completion via Retrieval-Augmented Generation and Multi-Objective Alignment

यह शोध पत्र क्वेरी ऑटो-कंप्लीशन के लिए एक एकीकृत ढांचे को प्रस्तुत करता है जो इस कार्य को रिट्रीवल-ऑगमेंटेड जनरेशन और मल्टी-ऑब्जेक्टिव डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन का उपयोग करके एंड-टू-एंड लिस्ट जनरेशन के रूप में पुनर्गठित करता है, जिससे पारंपरिक रिट्रीवल पाइपलाइनों और जेनेरेटिव हैलुसिनेशन की सीमाओं को संबोधित करते हुए ऑफलाइन मेट्रिक्स, मानवीय प्राथमिकता और ऑनलाइन उपयोगकर्ता जुड़ाव में महत्वपूर्ण सुधार प्राप्त होता है।

Kai Yuan, Anthony Zheng, Jia Hu, Divyanshu Sheth, Hemanth Velaga, Kylee Kim, Matteo Guarrera, Besim Avci, Jianhua Li, Xu (…)2026-06-10