💻 computer science

BraveGuard: From Open-World Threats to Safer Computer-Use Agents

BraveGuard एक स्व-विकसित रक्षा ढांचा (self-evolving defense framework) है जो गार्ड मॉडल्स के प्रशिक्षण के लिए यथार्थवादी एजेंट प्रक्षेपवक्र (agent trajectories) उत्पन्न करने हेतु ओपन-वर्ल्ड खतरों का खनन करता है, जो स्थिर, बेंचमार्क-संचालित दृष्टिकोणों की तुलना में कंप्यूटर-उपयोग एजेंटों के लिए सुरक्षा पहचान में महत्वपूर्ण सुधार करता है।

Yunhao Feng, Yifan Ding, Xiaohu Du, Ming Wen, Xinhao Deng, Yanming Guo, Yuxiang Xie, Baihui Zheng, Yingshui Tan, Yige Li (…)2026-06-02
💻 computer science

Thinking Economically: A Hierarchical Framework for Adaptive-Complexity Reasoning in LLMs

यह शोध पत्र 'Hierarchical Adaptive Budgeter' (HAB) को प्रस्तुत करता है, जो एक ऐसा प्रशिक्षण ढांचा है जो "आर्थिक रूप से सोचने" (Thinking Economically) के सिद्धांत को लागू करता है, ताकि इंटर-प्रॉब्लम (inter-problem) और इंट्रा-स्टेप (intra-step) दोनों स्तरों पर कम्प्यूटेशनल संसाधनों को गतिशील रूप से आवंटित करके मानक 'चेन-ऑफ-थॉट' (Chain-of-Thought) तर्क की तुलना में एक बेहतर सटीकता-दक्षता संतुलन प्राप्त किया जा सके।

Yubo Gao, Haotian Wu, Hong Chen, Junquan Huang, Yibo Yan, Jungang Li, Zihao Dongfang, Sicheng Tao, Puay Siew Tan, Jie Zh (…)2026-06-02
💬 NLP

CA-BED: Conversation-Aware Bayesian Experimental Design

यह शोध पत्र CA-BED का प्रस्ताव करता है, जो एक वार्ता-जागरूक (conversation-aware) बेयसियन प्रयोगात्मक डिज़ाइन ढांचा है जो संवादात्मक परिदृश्यों में लार्ज लैंग्वेज मॉडल्स के लिए प्रश्न चयन को अनुकूलित करता है, और न्यूनतम अतिरिक्त संवादात्मक चरणों के साथ सफलता दर में 21.8% का सुधार प्राप्त करता है।

Daniel Arnould, Rashad Aziz, Zixuan Kang, Tanav Changal, Kevin Zhu, Sunishchal Dev, Gabriel Grand, Shreyas Sunil Kulkarn (…)2026-06-02
💬 NLP

Low-Resource Safety Failures Are Action Failures, Not Representation Failures

यह शोध पत्र प्रदर्शित करता है कि कम-संसाधन वाली सुरक्षा विफलताएं हानिकारक प्रतिनिधित्व की कमी के बजाय निर्णय अंशांकन (डिसीजन कैलिब्रेशन) में मिसअलाइनमेंट से उत्पन्न होती हैं, और केवल कुछ लक्षित-भाषा उदाहरणों का उपयोग करके मौजूदा उच्च-संसाधन सुरक्षा गेटों को पुन: अंशांकित करने के माध्यम से इसे ठीक करने की एक विधि प्रस्तावित करता है।

Rashad Aziz, Ikhlasul Akmal Hanif, Fajri Koto2026-06-02✓ Author reviewed
🤖 AI

The Shape of Wisdom: Decision Trajectories in Language Models

यह शोध पत्र तीन भाषा मॉडलों के माध्यम से 9,000 निर्णय प्रक्षेप पथों (decision trajectories) का विश्लेषण करता है ताकि यह प्रकट किया जा सके कि शुद्धता (correctness) और स्थिरता (stability) अलग-अलग गुण हैं, जो यह प्रदर्शित करता है कि अटेंशन मैकेनिज्म मुख्य रूप से स्थिर सही उत्तरों को संचालित करते हैं जबकि विशिष्ट टेक्स्ट स्पैन निर्णय मार्जिन को महत्वपूर्ण रूप से प्रभावित करते हैं।

Shailesh Rana2026-06-02
💬 NLP

Implicit Geographic Inference in LLM Medical Triage: Language-Driven Disparities in Emergency Recommendations

यह अध्ययन प्रकट करता है कि बड़े भाषा मॉडल चिकित्सा ट्राइएज (medical triage) में महत्वपूर्ण भाषा-संचालित असमानताएं प्रदर्शित करते हैं, जो लक्षण की गंभीरता के आकलन में अंतर के बजाय केवल इनपुट भाषा के कारण निहित भौगोलिक अनुमानों के आधार पर, समान न्यूरोलॉजिकल लक्षणों के लिए आपातकालीन कक्ष जाने की सिफारिश करने की दरों में भारी अंतर रखते हैं।

Qi Han Wong2026-06-02
💻 computer science

TECCI: Tricky Edits of Collected and Curated Images

यह शोधपत्र TECCI को प्रस्तुत करता है, जो 7,550 क्यूरेटेड इमेज-एडिटिंग पेयर्स से बना एक चुनौतीपूर्ण नया बेंचमार्क है, जिसे विशेष रूप से जटिल स्थानिक और रचनात्मक कार्यों के लिए निर्देश पालन (instruction following), संपादन की न्यूनतमता (edit minimality) और दृश्य गुणवत्ता (visual quality) में वर्तमान टेक्स्ट-गाइडेड इमेज एडिटिंग मॉडलों की सीमाओं का व्यवस्थित रूप से मूल्यांकन करने और उन्हें उजागर करने के लिए डिज़ाइन किया गया है।

Aishwarya Agrawal, Roy Hirsch, Yasumasa Onoe, Sherry Ben, Jason Baldridge2026-06-02
💻 computer science

Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs

यह शोध पत्र APEIRIA को प्रस्तुत करता है, जो एक न्यूरो-सिम्बॉलिक 3D मल्टी-मोडल LLM है जो तीन-चरणीय पाठ्यक्रम के माध्यम से व्याख्या योग्य सिम्बॉलिक रीजनिंग पैटर्न को एक लचीले एंड-टू-एंड मॉडल में संकुचित (distill) करता है, जो पारदर्शी, मॉड्यूलर रीजनिंग और ओपन-वोकेबुलरी स्थानिक समझ के बीच के अंतर को प्रभावी ढंग से पाटता है।

Wentao Mo, Yang Liu2026-06-02
💬 NLP

Connecting the Dots: Benchmarking Reflective Memory in Long-Horizon Dialogue

यह शोध पत्र RefMem-Bench प्रस्तुत करता है, जो लंबी अवधि के संवादों में रिफ्लेक्टिव मेमोरी (reflective memory) का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, और REMIND फ्रेमवर्क का प्रस्ताव देता है ताकि मॉडल्स की प्रोग्रेसिव मीनिंग कंस्ट्रक्शन (progressive meaning construction) के माध्यम से खंडित संकेतों को उच्च-स्तरीय व्याख्याओं में संश्लेषित करने की क्षमता को बढ़ाया जा सके।

Jingjie Lin, Bingbing Wang, Zihan Wang, Zhengda Jin, Weiming Qiao, Jing Li, Ruifeng Xu2026-06-02
💬 NLP

Efficient RAG with Intent-Aware Retrieval and Semantics-Preserving Chunking

यह शोध पत्र InSemRAG प्रस्तुत करता है, जो एक रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो एक इंटेंशन-अवेयर रिट्राइवर और सेमैंटिक्स-प्रिजर्विंग चंकिंग को एक इटरेटिव मैकेनिज्म के भीतर संयोजित करके मल्टी-हॉप और एविडेंस-सेंसिटिव कार्यों पर प्रदर्शन को बढ़ाता है, जबकि कंप्यूटेशनल लेटेंसी को महत्वपूर्ण रूप से कम करने के लिए स्मॉल लैंग्वेज मॉडल्स का लाभ उठाता है।

Fachrina Dewi Puspitasari, Chaoning Zhang, Jiaquan Zhang, Zhicheng Wang, Hafiz Shakeel Ahmad Awan, Rizwan Qureshi, Jewon (…)2026-06-02