💬 NLP

Every Act Has Its Price: Compressed Moral Composition in Frontier LLMs

यह शोध पत्र "मोरल ट्रॉली एरिना" (Moral Trolley Arena) प्रस्तुत करता है, जो एक दो-चरणीय बेंचमार्क है जो यह प्रकट करता है कि अत्याधुनिक एलएलएम (LLMs) नैतिक संकेतों को उनके निर्णयों में एक सुसंगत रूप से संकुचित, गैर-योगात्मक तंत्र के माध्यम से संयोजित करते हैं न कि सरल योग के माध्यम से, जो यह सुझाव देता है कि नैतिक मूल्यांकनों को अलग-थलग कार्यों की रैंकिंग के साथ-साथ इन संयोजन नियमों पर भी ध्यान केंद्रित करना चाहिए।

Weijia Zhang, Ruiqi Chen, Yunze Xiao, Weihao Xuan2026-06-11
🤖 machine learning

ProHiFlo: Hierarchical Flow Matching with Functional Guidance for De Novo Protein Generation

ProHiFlo एक पदानुक्रमित (hierarchical) फ्लो मैचिंग फ्रेमवर्क है जो मौजूदा तरीकों जैसे कि RFDiffusion की तुलना में उच्च दक्षता और सफलता दर के साथ अत्याधुनिक (state-of-the-art) 'de novo' प्रोटीन डिज़ाइन प्राप्त करने के लिए मोटे-से-सूक्ष्म (coarse-to-fine) पीढ़ी, प्रीट्रेन्ड प्रेडिक्टर्स के माध्यम से कार्यात्मक मार्गदर्शन (functional guidance), और अनुकूलन योग्य SE(3)-इक्विवेरिएंट आर्किटेक्चर को संयोजित करता है।

Chuanzhen Wang, Meade Cleti, Pete Jano2026-06-11
💬 NLP

Energy-Efficient On-Device RAG on a Mobile NPU: System Design and Benchmark on Snapdragon X Elite

यह शोध पत्र स्नैपड्रैगन X एलीट के क्वालकॉम हेक्सागन एनपीयू (Qualcomm Hexagon NPU) पर पूरी तरह से चलने वाले पहले एंड-टू-एंड ऑन-डिवाइस रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) पाइपलाइन को प्रस्तुत करता है, जो पारंपरिक बैकएंड के समान उत्तर गुणवत्ता बनाए रखते हुए सीपीयू (CPU) और जीपीयू (GPU) बेसलाइन की तुलना में थ्रूपुट, लेटेंसी और ऊर्जा दक्षता में महत्वपूर्ण सुधार प्रदर्शित करता है।

Zhiyuan Cheng, Longying Lai2026-06-11
🤖 machine learning

Quantifying Subliminal Behavioral Transfer Ratios in Language Model Distillation

यह अध्ययन भाषा मॉडल डिस्टिलेशन (language model distillation) में अवचेतन शिक्षण (subliminal learning) की सुदृढ़ किंतु मॉडल-आश्रित घटना को परिमाणित करता है, जो यह प्रकट करता है कि अवांछनीय व्यवहार केवल सौहार्दपूर्ण डेटा पर प्रशिक्षित होने के बावजूद भी शिक्षक से छात्र मॉडलों में स्थानांतरित हो सकते हैं, जिसमें Llama-2 एक तीव्र स्थानांतरण सीमा प्रदर्शित करता है और Qwen2.5 निरंतर, उच्च-स्तरीय स्थानांतरण दर्शाता है।

Uwe Konig, Hamza Kazmi, Ruizhe Li, Maheep Chaudhary2026-06-11
⚡ electrical engineering

Massive Open-Vocabulary Keyword Spotting

यह शोधपत्र एक मेमोरी-कुशल, ओपन-वोकैबुलरी कीवर्ड स्पॉटिंग सिस्टम का प्रस्ताव करता है जो बिना किसी मॉडल फाइन-ट्यूनिंग के, देखे गए और अनदेखे भाषाओं में उच्च एंटिटी रिकॉल बनाए रखते हुए, काफी कम फुटप्रिंट के साथ विशाल शब्दावलियों को संसाधित करने में सक्षम बनाता है।

Leonor Barreiros, Raul Monteiro, Afonso Mendes, Gonçalo M. Correia2026-06-11
💬 NLP

Schützen: Evaluating LLM Safety in Bulgarian and German Contexts

यह शोध पत्र "Schützen" को प्रस्तुत करता है, जो एक जर्मन-बल्गेरियाई सुरक्षा डेटासेट है जिसे गैर-अंग्रेजी मूल्यांकन संसाधनों की कमी को दूर करने के लिए डिज़ाइन किया गया है, जो बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल) के सुरक्षा व्यवहारों में महत्वपूर्ण क्रॉस-लैंग्वेज अंतरों को प्रकट करता है और क्षेत्र-विशिष्ट मूल्यांकनों की आवश्यकता पर बल देता है।

Kiril Georgiev, Yuxia Wang, Dimitar Iliyanov Dimitrov, Preslav Nakov, Ivan Koychev2026-06-11
🤖 AI

Can AI Agents Synthesize Scientific Conclusions?

यह शोध पत्र SciConBench और एक क्लीन-रूम मूल्यांकन हारनेस (clean-room evaluation harness) प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि वर्तमान एआई एजेंट डेटा लीकेज के कारण अनियंत्रित सेटिंग्स में प्रदर्शन को काफी अधिक बढ़ा-चढ़ाकर दिखाने के बावजूद, सटीक वैज्ञानिक निष्कर्षों को विश्वसनीय रूप से संश्लेषित करने में संघर्ष करते हैं।

Hayoung Jung, Pedro Viana Diniz, José Reinaldo Corrêa Roveda, Abner Fernandes da Silva, Haeun Jung, Enoch Tsai, Aleksand (…)2026-06-11
💬 NLP

When More Documents Hurt RAG: Mitigating Vector Search Dilution with Domain-Scoped, Model-Agnostic Retrieval

यह शोध पत्र रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) में "वेक्टर सर्च डाइल्यूशन" (vector search dilution) की समस्या को संबोधित करता है, जहाँ बड़े और विषम दस्तावेज़ संग्रहों तक विस्तार करने से सटीकता कम हो जाती है, और इसके लिए MASDR-RAG का प्रस्ताव देता है, जो एक डोमेन-स्कोपड (domain-scoped), मॉडल-एग्नोस्टिक (model-agnostic) रिट्रीवल दृष्टिकोण है जो संगठनात्मक मेटाडेटा का लाभ उठाकर सटीकता में उल्लेखनीय सुधार करता है और अत्यधिक जटिल मल्टी-एजेंट ऑर्केस्ट्रेशन के दोषों से बचाता है।

Nabaraj Subedi, Ahmed Abdelaty, Shivanand Venkanna Sheshappanavar2026-06-11
💬 NLP

A PubMed-Scale Dataset of Structured Biomedical Abstracts

यह शोध पत्र स्ट्रक्चर्ड पबमेड (Structured PubMed) का परिचय देता है, जो 23.2 मिलियन से अधिक बायोमेडिकल एब्स्ट्रैक्ट्स का एक व्यापक डेटासेट है जो बड़े पैमाने पर टेक्स्ट माइनिंग और सूचना निष्कर्षण को सुगम बनाने के लिए लेखक-संरचित रिकॉर्ड्स को स्वचालित रूप से लेबल किए गए अनस्ट्रक्चर्ड एब्स्ट्रैक्ट्स के साथ जोड़ता है।

Chia-Hsuan Chang, Haerin Song, Brian Ondov, Hua Xu2026-06-11
💬 NLP

When Probing Accuracy Saturates, Fragility Resolves: A Complementary Metric for LLM Pre-Training Analysis

यह शोध पत्र "फ्रैजिलिटी" (fragility) को पेश करता है, जो एक पूरक मीट्रिक है जो उस एक्टिवेशन-नॉइज़ स्तर को मापता है जिस पर लीनियर प्रोब सटीकता ढह जाती है, ताकि एलएलएम (LLM) प्री-ट्रेनिंग में विकसित होते प्रतिनिधि संरचनाओं और नैतिक एन्कोडिंग ग्रेडिएंट्स को प्रकट किया जा सके जो मानक प्रोब सटीकता संतृप्त होने के बाद अदृश्य हो जाते हैं।

Orion Reblitz-Richardson2026-06-11