🤖 AI

Agents' Last Exam

यह शोध पत्र एजेंट्स लास्ट एग्जाम (ALE) को प्रस्तुत करता है, जो 13 उद्योग समूहों में दीर्घकालिक, आर्थिक रूप से मूल्यवान वास्तविक दुनिया के कार्यों पर एआई एजेंटों का मूल्यांकन करने के लिए 250 से अधिक उद्योग विशेषज्ञों के साथ विकसित एक लिविंग बेंचमार्क है, जिसका उद्देश्य वर्तमान बेंचमार्क सफलता और सार्थक जीडीपी-प्रासंगिक परिनियोजन के बीच के अंतर को पाटना है।

Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Je (…)2026-06-05
🤖 AI

A Motivational Architecture for Conversational AGI

यह शोध पत्र संवादात्मक एजीआई (AGI) के लिए एक नवीन प्रेरणात्मक संरचना प्रस्तावित करता है जो एक दस-चरणीय प्रसंस्करण पाइपलाइन, एक द्वि-निर्णय रणनीति और भावनाओं (feelings) एवं उद्वेगों (emotions) के बीच एक कार्यात्मक अंतर के माध्यम से क्षमता और संबद्धता जैसी मनोवैज्ञानिक आवश्यकताओं को विनियमित करके भाषाई संदर्भ में होमियोस्टैसिस (homeostasis) की पुनर्व्याख्या करता है।

Anna Mikeda, Ben Goertzel2026-06-05
💻 computer science

CausalPOI: Spatio-Temporal Graph-Based Causal Modeling for Cold-Start POI Check-in Forecasting

यह शोधपत्र CausalPOI प्रस्तुत करता है, जो एक नवीन स्थानिक-सामयिक ग्राफ-आधारित कारण प्रतिनिधित्व शिक्षण (causal representation learning) ढांचा है, जो कार्यात्मक अंतःक्रियाओं को मॉडल करने और प्रतितथ्यात्मक (counterfactual) परिदृश्यों का अनुकरण करने के माध्यम से कोल्ड-स्टार्ट POI चेक-इन पूर्वानुमान समस्या को संबोधित करता है, जिससे नए पेश किए गए पॉइंट्स ऑफ इंटरेस्ट (Points of Interest) के व्यवहार की भविष्यवाणी करने में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Zhaoqi Zhang, Miao Xie, Yi Li, Linyou Cai, Siqiang Luo, Gao Cong2026-06-05
💬 NLP

When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories

यह शोध पत्र एक दो-चरणीय प्रणाली पेश करके स्पार्स-एविडेंस (sparse-evidence) संवाद और एजेंट प्रक्षेपवक्रों में प्रारंभिक विफलता अलर्टिंग की चुनौती को संबोधित करता है, जो एक अटेंशन-आधारित प्रेडिक्टर को जोड़ता है, जो विलंबित विफलता संकेतों की पहचान करने के लिए प्रक्षेपवक्र-स्तरीय लेबल से सीखता है, तथा विविध बेंचमार्क में बेहतर सटीकता-जल्दी (accuracy-earliness) ट्रेड-ऑफ और कम प्रशिक्षण लागत प्राप्त करने के लिए α\alpha-STOP नीति का उपयोग करता है।

Avinash Baidya, Xinran Liang, Ruocheng Guo, Xiang Gao, Kamalika Das2026-06-05
💬 NLP

Executable Schema Contracts: From Automatic Ingestion to Multi-Source Retrieval

यह शोध पत्र एक ऐसी प्रणाली प्रस्तुत करता है जो नॉलेज ग्राफ निर्माण को निर्देशित करने और एक मल्टी-टूल रिट्रीवल एजेंट को अनुकूलित करने के लिए कच्चे मल्टी-सोर्स डेटा से स्वचालित रूप से निष्पादन योग्य स्कीमा अनुबंधों (executable schema contracts) की खोज करती है, जो संरचित, ट्रेस करने योग्य और स्कीमा-जागरूक साक्ष्य एकीकरण को सक्षम करके बेसलाइन विधियों की तुलना में प्रश्न-उत्तर प्रदर्शन में महत्वपूर्ण सुधार करती है।

Padmaja Jonnalagedda, Yuguang Yao, Xiang Gao, Hilaf Hasson, Kamalika Das2026-06-05
🤖 AI

Assessing the Carbon Emissions and Energy Consumption of U.S. Hyperscale Data Centers

यह अध्ययन अनुमान लगाता है कि मई 2024 और अप्रैल 2025 के बीच संचालित होने वाले 403 अमेरिकी हाइपरस्केल डेटा केंद्रों ने 68-99 TWh बिजली की खपत की, जिससे 37-54 मिलियन मीट्रिक टन CO2 उत्सर्जन हुआ, जिसकी कार्बन तीव्रता जीवाश्म ईंधन पर भारी निर्भरता के कारण राष्ट्रीय ग्रिड औसत से लगभग 48% अधिक है।

Gianluca Guidi, Francesca Dominici, Tiziano Squartini, Callaway Sprinkle, Jonathan Gilmour, Kevin Butler, Eric Bell, Sco (…)2026-06-05
🤖 AI

Minimizing the Hidden Cost of Scales: Graph-Guided Ultra-Low-Bit Quantization for Large Language Models

SAGE-PTQ एक नवीन पोस्ट-ट्रेनिंग क्वांटाइजेशन फ्रेमवर्क है जो भार (weights) को महत्वपूर्ण (salient) और महत्वहीन (unsalient) श्रेणियों में विभाजित करके, उत्तरवर्ती (latter) को समूह आकार को अनुकूलित करने के लिए एक स्पार्स ग्राफ के रूप में मॉडल करके, और अत्याधुनिक तरीकों की तुलना में बेहतर परप्लेक्सिटी (perplexity) और इन्फरेंस दक्षता के साथ अल्ट्रा-लो-बिट प्रिसिजन प्राप्त करने के लिए ड्यूल-मोड क्वांटाइजेशन लागू करके बड़े भाषा मॉडलों में छिपे हुए स्केलिंग लागतों को न्यूनतम करता है।

Rayyan Abdalla, Amir Hussein, Min Wu, Dinesh Manocha2026-06-05
💻 computer science

Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models

यह शोध पत्र सेलेक्टिव-एडवांटेज एंट्रॉपी-अडैप्टिव होराइजन GRPO (SA-AH-GRPO) प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो नकारात्मक-एडवांटेज रोलआउट्स पर एंट्रॉपी-आधारित डिस्काउंटिंग को असममित रूप से लागू करता है और सफल प्रक्षेप पथों (trajectories) के लिए पूर्ण ग्रेडिएंट संकेतों को संरक्षित करता है, जिससे मानक GRPO की तुलना में प्रशिक्षण को महत्वपूर्ण रूप से स्थिर करता है और गणितीय तर्क बेंचमार्क पर प्रदर्शन में सुधार करता है।

Chirag Chawla, Rohan Charudatt Salvi, Madhav S. Baidya2026-06-05
🤖 AI

Ten Headache Specialists versus Artificial Intelligence for Clinical Literature Summarization: A Critical Evaluation and Comparison

यह अध्ययन सिरदर्द चिकित्सा पर एआई-जनित और विशेषज्ञ-लिखित नैदानिक साहित्य सारांशों की तुलना करता है, जिसमें यह पाया गया है कि जहाँ विशेषज्ञ मानव-लिखित सारांशों को प्राथमिकता देते हैं, वहीं वे अक्सर उच्च गुणवत्ता वाले एआई आउटपुट से उन्हें अलग करने में संघर्ष करते हैं, जो साक्ष्य-आधारित चिकित्सा में बड़े भाषा मॉडलों की संभावना और वर्तमान सीमाओं दोनों को रेखांकित करता है।

Alejandro Lozano, Keiko Ihara, Ping-Hao Yang, Carrie E. Robertson, Jennifer Stern, Allan Purdy, Hsiangkuo Yuan, Pengfei (…)2026-06-05
🤖 AI

PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event Triage

यह शोध पत्र PSEBench प्रस्तुत करता है, जो एक स्केलेबल और सत्यापन योग्य बेंचमार्क है जिसे "क्लॉज कार्ड्स" का उपयोग करते हुए एक नीति-आधारित पद्धति के माध्यम से निर्मित किया गया है ताकि रोगी सुरक्षा घटना ट्राइएज (triage) पर LLMs का मूल्यांकन किया जा सके, जो निरंतर क्षमता प्रवृत्तियों को प्रकट करता है और साक्ष्य-आधारित तर्क, सूचना प्राप्ति, और सिद्धांतबद्ध रूप से परहेज करने (abstention) के प्रबंधन में महत्वपूर्ण अंतराल की पहचान करता है।

Keqi Han, Ryan Young, Annabel Strauss, Lindsey Hughes, Katharine M. Nesbitt, Nicole Schueler, Che Ngufor, Carl Yang, Yua (…)2026-06-05