🤖 AI

JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models

JoyNexus पोस्ट-ट्रेनिंग विजन-लैंग्वेज-एक्शन (VLA) मॉडल्स के लिए एक एकीकृत, मल्टी-टेनेंट सेवा है जो प्रशिक्षण, इन्फरेंस और एनवायरनमेंट घटकों को अलग करती है ताकि कुशल संसाधन साझाकरण, क्रॉस-टेनेंट शेड्यूलिंग और ग्रुप बैचिंग को सक्षम बनाया जा सके, जिससे पारंपरिक आइसोलेटेड सिंगल-टेनेंट निष्पादन की तुलना में कुल GPU समय कम होता है और उपयोगिता में सुधार होता है।

Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei Zhang, Xiaolong Xiang, Mingxi Luo, Jing Long, Che (…)2026-07-20
💻 computer science

What Does It Take to Research with AI? A Rapid Review of Competencies to Train LLM-Literate Researchers

40 चयनित लेखों की यह त्वरित समीक्षा एलएलएम-साक्षर (LLM-literate) शोधकर्ताओं के लिए आठ आवश्यक दक्षताओं की पहचान करती है, जो इस बात पर जोर देती है कि विज्ञान में प्रभावी और जिम्मेदार एआई उपयोग तकनीकी ज्ञान के बजाय डोमेन विशेषज्ञता, आलोचनात्मक निरीक्षण और नैतिक जवाबदेही पर अधिक निर्भर करता है।

Danilo Monteiro Ribeiro, Ronnie de Souza Santos, Rodrigo Siqueira, Breno Andrade, Rafael Batista Duarte, Gilberto Hida (…)2026-07-20
🔬 physics

CADAQUES: A Cost-Aware Dual Architecture for Query-Efficient Autonomous Discovery

यह शोध पत्र CADAQUES को प्रस्तुत करता है, जो एक ओपन-सोर्स पायथन फ्रेमवर्क है जो एक एकीकृत बहु-आयामी बजट को प्रबंधित करने के लिए डिस्कवरी लूप को एक ओरेकल (Oracle) और एक ड्राइवर (Driver) में अलग करके क्वेरी और निर्णय लागतों को प्रथम श्रेणी के प्रिमिटिव्स (first-class primitives) के रूप में मानता है, और इस्िंग मॉडल (Ising model) प्रयोगों के माध्यम से यह प्रदर्शित करता है कि यह लागत-जागरूक, मल्टी-फिडेलिटी दृष्टिकोण पारंपरिक निश्चित-लागत रणनीतियों की तुलना में अधिक सटीक और सुदृढ़ परिणाम देता है।

Jorge Bravo-Abad2026-07-20
💻 computer science

Efficient Code Analysis via Graph Representation Learning-Guided Large Language Models

यह शोध पत्र एक ग्राफ-निर्देशित ढांचे का प्रस्ताव करता है जो एक प्रोजेक्ट के ग्राफ प्रतिनिधित्व के भीतर प्रमुख दुर्भावनापूर्ण कोड क्षेत्रों की पहचान करने के लिए ग्राफ न्यूरल नेटवर्क का लाभ उठाता है, जिससे बड़े भाषा मॉडल (Large Language Models) को खंडित दुर्भावनापूर्ण व्यवहारों के अधिक कुशल और सटीक पता लगाने के लिए इन महत्वपूर्ण क्षेत्रों पर अपना ध्यान केंद्रित करने के लिए निर्देशित किया जा सके और अप्रासंगिक संदर्भ हस्तक्षेप को कम किया जा सके।

Hang Gao, Tao Peng, Baoquan Cui, Hong Huang, Fengge Wu, Junsuo Zhao, Jian Zhang2026-07-17
💻 computer science

Correctness, confidence, and context: Framing software assurance in the AI age

यह शोध पत्र तर्क देता है कि जनरेटिव एआई की सांख्यिकीय प्रकृति, जो औपचारिक कठोरता के बजाय संभाव्य भविष्यवाणियों पर निर्भर करती है और मानवीय अंतर्निहित संदर्भ को समझने में संघर्ष करती है, एक व्यवस्थित इंजीनियरिंग दृष्टिकोण की आवश्यकता को अनिवार्य बनाती है ताकि कोड विशिष्टताओं से आगे बढ़कर तकनीकों के ऐसे लागत प्रभावी और तर्कसंगत संयोजन विकसित किए जा सकें जो किसी प्रणाली की उद्देश्य के लिए उपयुक्तता सुनिश्चित कर सकें और सॉफ्टवेयर आश्वासन को पुनर्गठित कर सकें।

Mary Shaw2026-07-17
💬 NLP

Eta Given Delta: Defining LLM Tool Efficiency With Marginal Tool Utility

यह शोध पत्र एलएलएम (LLM) एजेंट प्रक्षेप पथों (trajectories) में उपयोगी टूल कॉल्स की दर का सीधे मूल्यांकन और अनुकूलन करने के लिए "टूल एफिशिएंसी" (tool efficiency) और "मार्जिनल टूल यूटिलिटी" (marginal tool utility) को नए मात्रात्मक मेट्रिक्स के रूप में प्रस्तुत करता है, जिसका उद्देश्य पारंपरिक सटीकता-आधारित मूल्यांकनों के पूरक के रूप में लीन (leaner) टूल सूट्स के निर्माण को निर्देशित करना है।

Nyx Iskandar2026-07-17
🤖 AI

Structured Feedback Improves Repair in an LLM Agent Loop

यह शोध पत्र VeriHarness को प्रस्तुत करता है, जो एक कोड-नियंत्रित एजेंट लूप है जो यह प्रदर्शित करता है कि LLMs को विफलता के स्थान, प्रेक्षित मानों और स्वीकार्य विकल्पों से युक्त संरचित फीडबैक प्रदान करने से कच्चे निदान (raw diagnostics) या अपूर्ण फीडबैक की तुलना में पुनरावृत्ति कार्यों में मरम्मत सफलता दर में महत्वपूर्ण सुधार होता है।

Jaideep Ray, Ankit Goyal2026-07-17
🤖 machine learning

Quantize with Confidence? An Empirical Study of Quantization for Code Generation

यह शोध पत्र कई बेंचमार्क पर बड़े कोड मॉडल्स पर छह अत्याधुनिक क्वांटाइजेशन विधियों का अनुभवजन्य मूल्यांकन करता है, जिससे यह पता चलता है कि जहाँ सुरक्षा स्थिर रहती है, वहीं AQLM जैसी तकनीकें पूर्ण-परिशुद्धता (full-precision) प्रदर्शन के बराबर हो सकती हैं जबकि अन्य जटिल प्रॉम्प्ट्स पर काफी घट जाती हैं, जिससे संसाधन-सीमित हार्डवेयर पर कोड जनरेशन मॉडल्स को तैनात करने के लिए व्यावहारिक मार्गदर्शन प्राप्त होता है।

Saima Afrin, Md. Zahidul Haque, Antonio Mastropaolo2026-07-17
🤖 AI

ToolAlignBench: Investigating Alignment Conflicts in Tool-Calling Enabled LLMs

यह शोध पत्र ToolAlignBench प्रस्तुत करता है, जो यह उजागर करता है कि सुरक्षा-संरेखित (safety-aligned) टूल-कॉलिंग LLMs अक्सर परस्पर विरोधी सुरक्षा मूल्यों (जैसे कि व्हिसलब्लोइंग) पर कार्य करने के लिए परिनियोजन निर्देशों (deployment instructions) को दरकिनार कर देते हैं, जिससे विनियमित उद्योगों में महत्वपूर्ण उत्तरदायित्व जोखिम उत्पन्न होते हैं।

Aryan Keluskar, Amrita Bhattacharjee, Huan Liu2026-07-17
🤖 AI

Copy-on-Write Scoring: Application-Specific Agent Evaluations

यह शोध पत्र कॉपी-ऑन-राइट (CoW) स्कोरिंग पेश करता है, जो एक ऐसा ढांचा है जो एप्लिकेशन वातावरण के भीतर सीधे LLM-आधारित एजेंटों का मूल्यांकन करने के लिए PostgreSQL-स्तरीय आइसोलेशन का लाभ उठाता है, जिससे डेटाबेस राइट विफलताओं की सूक्ष्म और लागत प्रभावी पहचान और एजेंट टूल सतहों में निरंतर सुधार संभव हो पाता है।

Joanna Roy, Sven Hoelzel2026-07-17