🧬 biology

scBench-Long: Verifiable Benchmarking of Long-Horizon Single-Cell Biology

यह शोध पत्र scBench-Long को प्रस्तुत करता है, जो 21 जटिल, दीर्घकालिक (long-horizon) सिंगल-सेल जीव विज्ञान कार्यों वाला एक सत्यापन योग्य बेंचमार्क है जो यह मूल्यांकन करता है कि क्या एआई एजेंट निर्धारित विधियों के बिना कच्चे डेटा से स्वायत्त रूप से वैज्ञानिक निष्कर्ष निकाल सकते हैं, जिससे यह पता चलता है कि वर्तमान शीर्ष मॉडल केवल 25.4% सफलता दर प्राप्त करते हैं।

Ian Diks, Zhen Yang, Arjun Banerjee, Tim Proctor, Kenny Workman2026-06-26
🤖 AI

EvoOptiGraph: Weakness-Driven Coevolution via Graph-Based Structural Generation for Optimization Modeling

EvoOptiGraph एक नवीन ढांचा है जो मॉडल की कमजोरियों द्वारा संचालित एक ग्राफ-आधारित संरचनात्मक पीढ़ी के माध्यम से डेटा और लार्ज लैंग्वेज मॉडल्स को सह-विकसित करके अनुकूलन मॉडलिंग को स्वचालित करता है, जो सटीकता और सामान्यीकरण में मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

Qingcan Kang, Mingyang Liu, Xiaojin Fu, Shixiong Kai, Tao Zhong, Mingxuan Yuan2026-06-26
🤖 AI

A Multi-Level Validation and Traceability Framework for AI-Generated Telescope Scheduling Decisions

यह शोध पत्र एक बहु-स्तरीय सत्यापन और ट्रैसेबिलिटी फ्रेमवर्क प्रस्तावित करता है जो डेटा संदर्भों को व्यवस्थित रूप से सत्यापित करके, तार्किक निरंतरता को लागू करके, और त्रुटि स्थानीयकरण एवं सुधार को सक्षम करने के लिए तर्क चरणों को संरचित करके, एआई-जनित टेलीस्कोप शेड्यूलिंग निर्णयों की विश्वसनीयता और निष्पादन क्षमता को बढ़ाता है।

Hengchu Xiao, Chuanjun Wang2026-06-26
🤖 AI

Content-Based Smart E-Mail Dispatcher Using Large Language Models

यह शोध पत्र एक कंटेंट-आधारित स्मार्ट ईमेल डिस्पैचर का प्रस्ताव करता है जो ईमेल की सामग्री का स्वचालित रूप से विश्लेषण करने और उन्हें उपयुक्त छात्र व्हाट्सएप समूहों में रूट करने के लिए लार्ज लैंग्वेज मॉडल्स (LLMs) का लाभ उठाता है, जिससे बिना किसी लेबल किए गए डेटासेट की आवश्यकता के मैन्युअल प्रसंस्करण त्रुटियों को समाप्त किया जा सके और संगठनात्मक उत्पादकता को बढ़ाया जा सके।

K. Paramesha, K R Sriram, Sujan Shetty, Shamanth Kishore, R. Tejaswini2026-06-26
🤖 AI

HiLSVA: Design and Evaluation of a Human-in-the-Loop Agentic System for Scientific Visualization

यह शोध पत्र HiLSVA प्रस्तुत करता है, जो वैज्ञानिक विज़ुअलाइज़ेशन के लिए एक मानव-इन-द-लूप एजेंटिक प्रणाली है जो मिश्रित-पहल (mixed-initiative) वर्कफ़्लो के माध्यम से मानव निरीक्षण और सहयोगात्मक नियंत्रण को प्राथमिकता देता है, और उपयोगकर्ता अध्ययनों के माध्यम से यह प्रदर्शित करता है कि ऐसा दृष्टिकोण पूर्णतः स्वायत्त प्रणालियों की तुलना में कार्य पूर्णता, पारदर्शिता और उपयोगकर्ता नियंत्रण को बढ़ाता है।

Kuangshi Ai, Patrick Phuoc Do, Chaoli Wang2026-06-26
🤖 AI

Agents That Know Too Much: A Data-Centric Survey of Privacy in LLM Agents

यह सर्वेक्षण एलएलएम (LLM) एजेंटों द्वारा इंटरैक्ट किए जाने वाले विभिन्न डेटा स्रोतों को वर्गीकृत करके, बिखरे हुए अनुसंधान डोमेन में जुड़ी कमजोरियों का विश्लेषण करके, और शासन तंत्र एवं बेंचमार्क में महत्वपूर्ण अंतराल की पहचान करके, एलएलएम एजेंटों में गोपनीयता जोखिमों को समझने के लिए एक व्यापक, डेटा-केंद्रित ढांचा प्रदान करता है।

Nada Lahjouji, Ashwin Gerard Colaco2026-06-26
🤖 AI

Autoformalization of Agent Instructions into Policy-as-Code

यह शोध पत्र एक LLM-आधारित ऑटोफॉर्मलाइजेशन पाइपलाइन प्रस्तुत करता है जो प्राकृतिक भाषा एजेंट निर्देशों और नीतियों को औपचारिक रूप से सत्यापित सिडर पॉलिसी लैंग्वेज (Cedar Policy Language) कोड में अनुवादित करता है, जो संभाव्य गार्डरेल्स (probabilistic guardrails) और हस्तलिखित प्रतीकात्मक प्रवर्तन (hand-coded symbolic enforcement) दोनों से बेहतर स्केलेबल और कठोर सुरक्षा गारंटी प्रदान करता है।

Adam Mondl, Matthew Maisel, John H. Brock2026-06-26
🤖 AI

LAMP: Lane-Aligned Motion Primitives for Feasible Trajectory Prediction

यह शोध पत्र LAMP को प्रस्तुत करता है, जो एक टोपोलॉजी-जागरूक मोशन फोरकास्टिंग फ्रेमवर्क है जो व्यवहार संबंधी विविधता और भविष्यवाणी सटीकता बनाए रखते हुए लेन टोपोलॉजी का कड़ाई से पालन करने वाले मल्टीमॉडल प्रक्षेपवक्र (ट्रैजेक्टरीज) उत्पन्न करने के लिए VQ-VAE-सीखे गए मोशन प्रिमिटिव्स और एक फिजिबिलिटी-जागरूक सेलेक्टर का उपयोग करता है।

Sangjin Han, Hoseong Jung, Jeongtae Her, Changhyun Choi, H. Jin Kim2026-06-26
🤖 AI

SKILL-DISCO: Distilling and Compiling Agent Traces into Reusable Procedural Skills

यह शोध पत्र SkillDisCo को प्रस्तुत करता है, जो FSM-परिभाषित परिदृश्यों में सफल एजेंट ट्रेसेस को पुन: प्रयोज्य, पैरामीटराइज्ड कंट्रोल-फ्लो सबग्राफ्स में आसवित (distill) करके निष्पादन योग्य प्रक्रियात्मक कौशल (procedural skills) बनाने का एक ढांचा है, जिससे ALFWorld और WebArena जैसे बेंचमार्क में सफलता दर में सुधार होता है और रीजनिंग लागत कम होती है।

Zhongxin Guo, Danrui Qi, Hanwen Gu, Peng Cheng, Yongqiang Xiong2026-06-26
🤖 AI

NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research

यह शोध पत्र NebulaExp को प्रस्तुत करता है, जो 8B-स्केल के LLMs के लिए एक पूर्णतः पारदर्शी और पुनरुत्पादक (reproducible) पोस्ट-ट्रेनिंग पाइपलाइन है, जो डेटा क्यूरेशन और प्रशिक्षण रणनीतियों पर पूर्ण-स्तरीय एब्लेशन अध्ययनों का उपयोग करके अनुकूलित SFT, GRPO सुदृढीकरण शिक्षण (reinforcement learning), और शिक्षक-आधारित डिस्टिलेशन के माध्यम से सामान्य निर्देश-अनुपालन और विशिष्ट तर्क क्षमताओं दोनों को महत्वपूर्ण रूप से बढ़ाता है।

Qiaobo Hao, Yangqian Wu, Shunyi Wang, Zhongjian Zhang, Ziqun Li, Yayin He, Muqing Li, Chen Zhong2026-06-26