💬 NLP

Mechanic: Sorrifier-Driven Formal Decomposition Workflow for Automated Theorem Proving

यह शोध पत्र Mechanic को प्रस्तुत करता है, जो एक नवीन एजेंट सिस्टम है जो एक औपचारिक प्रमाण (formal proof) के भीतर विफल उप-लक्ष्यों (subgoals) को अलग करने और उन्हें स्वतंत्र रूप से हल करने के लिए Lean के "sorry" प्लेसहोल्डर का उपयोग करता है, जिससे पूर्ण पुनरुत्पादन (full regeneration) की अक्षमताओं और पुनरावृत्ति सुधारों (iterative repairs) से जुड़े संदर्भ क्षरण (context degradation) से बचते हुए चुनौतीपूर्ण गणितीय बेंचमार्क पर स्वचालित प्रमेय प्रमाणन (automated theorem proving) में महत्वपूर्ण सुधार किया जा सके।

Ruichen Qiu, Yichuan Cao, Junqi Liu, Dakai Guo, Xiao-Shan Gao, Lihong Zhi, Ruyong Feng2026-03-26
💬 NLP

Multi-Agent Reasoning with Consistency Verification Improves Uncertainty Calibration in Medical MCQA

यह शोध पत्र एक मल्टी-एजेंट फ्रेमवर्क प्रस्तुत करता है जो डोमेन-विशिष्ट विशेषज्ञों को दो-चरणीय निरंतरता सत्यापन (two-phase consistency verification) और S-स्कोर भारित संलयन (S-score weighted fusion) के साथ जोड़ता है, जो चिकित्सा बहुविकल्पीय प्रश्नोत्तर में अनिश्चितता अंशांकन (uncertainty calibration) और विभेदन में महत्वपूर्ण सुधार करता है, जिससे सुरक्षित नैदानिक AI परिनियोजन के लिए एक व्यावहारिक आत्मविश्वास संकेत मिलता है।

John Ray B. Martinez2026-03-26
💬 NLP

Analysing the Safety Pitfalls of Steering Vectors

यह शोध पत्र व्यवस्थित रूप से प्रदर्शित करता है कि एक्टिवेशन स्टीयरिंग वेक्टर्स, विशेष रूप से कंट्रास्टिव एक्टिवेशन एडिशन से प्राप्त वेक्टर्स, लेटेंट रिफ्यूज़ल डायरेक्शंस (अव्यक्त इनकार दिशाओं) के साथ ओवरलैप होकर, एक भाषा मॉडल की जेलब्रेक हमलों के प्रति संवेदनशीलता को नाटकीय रूप से बदल सकते हैं, जिससे नियंत्रण क्षमता और सुरक्षा के बीच एक महत्वपूर्ण समझौता प्रकट होता है।

Yuxiao Li, Alina Fastowski, Efstratios Zaradoukas, Bardh Prenkaj, Gjergji Kasneci2026-03-26
💬 NLP

Comparing Developer and LLM Biases in Code Evaluation

यह शोध पत्र TRACE को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो तीन मोडैलिटीज़ में कोड मूल्यांकन के दौरान LLM जजों और मानव डेवलपर्स के बीच महत्वपूर्ण मिसअलाइनमेंट (असमानता) को प्रकट करता है, यह दर्शाते हुए कि सबसे अच्छे मॉडल भी अधिकांश मौजूदा कोड गुणवत्ता आयामों पर मनुष्यों से 12-23% पीछे रह जाते हैं और लंबी व्याख्याओं को प्राथमिकता देने जैसे व्यवस्थित पूर्वाग्रह प्रदर्शित करते हैं।

Aditya Mittal, Ryan Shar, Zichu Wu, Shyam Agarwal, Tongshuang Wu, Chris Donahue, Ameet Talwalkar, Wayne Chi, Valerie Che (…)2026-03-26
💬 NLP

Table-LLM-Specialist: Language Model Specialists for Tables using Iterative Generator-Validator Fine-tuning

यह शोधपत्र Table-LLM-Specialist को प्रस्तुत करता है, जो एक स्व-प्रशिक्षित फाइन-ट्यूनिंग प्रतिमान (paradigm) है जो विविध टेबल कार्यों के लिए उच्च-प्रदर्शन वाले और लागत प्रभावी मॉडल बनाने के लिए जनरेटिव-क्लासिफिकेशन द्वैत (generative-classification duality) का उपयोग एक पुनरावृत्ति जनरेटर-वैलिडेटर प्रक्रिया के माध्यम से करता है, जिसमें मैन्युअल मानवीय लेबलिंग की आवश्यकता नहीं होती है।

Junjie Xing, Yeye He, Mengyu Zhou, Haoyu Dong, Shi Han, Dongmei Zhang, Surajit Chaudhuri2026-03-25
💬 NLP

An Experimental Study on Data Augmentation Techniques for Named Entity Recognition on Low-Resource Domains

यह अध्ययन चार निम्न-संसाधन डोमेन में Bi-LSTM+CRF और BERT मॉडलों पर मेंशन रिप्लेसमेंट (Mention Replacement) और कॉन्टेक्स्टुअल वर्ड रिप्लेसमेंट (Contextual Word Replacement) डेटा ऑग्मेंटेशन तकनीकों की प्रभावशीलता का मूल्यांकन करता है, जो यह प्रदर्शित करता है कि हालांकि ऑग्मेंटेशन छोटे डेटासेट को महत्वपूर्ण रूप से लाभान्वित करता है, फिर भी संवर्धित उदाहरणों की कोई सार्वभौमिक रूप से इष्टतम मात्रा नहीं है, जिसके लिए प्रोजेक्ट-विशिष्ट फाइन-ट्यूनिंग आवश्यक है।

Arthur Elwing Torres, Edleno Silva de Moura, Altigran Soares da Silva, Mario A. Nascimento, Filipe Mesquita2026-03-25
💬 NLP

Extracting and Following Paths for Robust Relational Reasoning with Large Language Models

यह शोधपत्र पाथ-ऑफ-थॉट्स (PoT) प्रस्तुत करता है, जो एक नवीन ढांचा है जो कार्यों को ग्राफ निष्कर्षण (graph extraction), पथ पहचान (path identification) और तर्क (reasoning) चरणों में विभाजित करके बड़े भाषा मॉडलों की संबंधपरक तर्क क्षमताओं को बढ़ाता है, जिससे बिना फाइन-ट्यूनिंग के अत्याधुनिक बेसलाइनों की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है और निष्कर्षण त्रुटियों के विरुद्ध लचीलापन बना रहता है।

Ge Zhang, Mohammad Ali Alomrani, Hongjian Gu, Jiaming Zhou, Yaochen Hu, Bin Wang, Qun Liu, Mark Coates, Yingxue Zhang, J (…)2026-03-25
💬 NLP

EmbBERT: Attention Under 2 MB Memory

यह शोध पत्र EmbBERT को प्रस्तुत करता है, जो एक अत्यंत कुशल नन्हा (tiny) भाषा मॉडल है जो बहुत बड़े मॉडलों के समान अत्याधुनिक सटीकता प्राप्त करता है और साथ ही 2 MB के सख्त मेमोरी बजट के भीतर कार्य करता है, जो इसे अल्ट्रा-कन्स्ट्रेंड (अत्यंत सीमित संसाधन वाले) एज डिवाइसेस पर तैनाती के लिए उपयुक्त बनाता है।

Riccardo Bravin, Massimo Pavan, Hazem Hesham Yousef Shalby, Fabrizio Pittorino, Manuel Roveri2026-03-25
💬 NLP

Collaborative Evaluation of Deepfake Text with Deliberation-Enhancing Dialogue Systems

यह अध्ययन प्रदर्शित करता है कि जबकि विचार-विमर्श बढ़ाने वाला चैटबॉट DeepFakeDeLiBot अपने आप में समग्र पहचान सटीकता को महत्वपूर्ण रूप से नहीं बढ़ाता है, यह समूह की गतिशीलता और आम सहमति बनाने में प्रभावी रूप से सुधार करता है, जिससे सहयोगात्मक मानवीय प्रयासों के साथ मिलकर बेहतर डीपफेक टेक्स्ट डिटेक्शन परिणाम प्राप्त होते हैं।

Jooyoung Lee, Xiaochen Zhu, Georgi Karadzhov, Tom Stafford, Andreas Vlachos, Dongwon Lee2026-03-25
🧬 biology

GeneMamba: An Efficient and Effective Foundation Model on Single Cell Data

GeneMamba सिंगल-सेल ट्रांसक्रिप्टोमिक्स के लिए एक स्केलेबल और कुशल फाउंडेशन मॉडल है जो ट्रांसफार्मर-आधारित विधियों की कम्प्यूटेशनल सीमाओं को दूर करने के लिए एक द्विदिशीय (bidirectional) मंबा आर्किटेक्चर और जैविक रूप से सूचित उद्देश्यों का लाभ उठाता है, जबकि बैच इंटीग्रेशन और सेल टाइप एनोटेशन जैसे कार्यों में बेहतर प्रदर्शन प्रदर्शित करता है।

Cong Qi, Hanzhang Fang, Siqi Jiang, Xun Song, Tianxing Hu, Wei Zhi2026-03-25