💬 NLP

A Semi-Automated Annotation Workflow for Paediatric Histopathology Reports Using Small Language Models

यह अध्ययन प्रदर्शित करता है कि एक अर्ध-स्वचालित वर्कफ़्लो, जिसमें छोटे भाषा मॉडल, विशेष रूप से क्लिनिशियन-निर्देशित एंटिटी गाइडलाइन्स और फ्यू-शॉट उदाहरणों के साथ संवर्धित गेम्मा 2 2बी (Gemma 2 2B) मॉडल का उपयोग किया गया है, गोपनीयता संबंधी चिंताओं को दूर करते हुए और क्लिनिशियन के कार्यभार को कम करते हुए, सीपीयू-ओनली (CPU-only) इंफ्रास्ट्रक्चर पर अनस्ट्रक्चर्ड पीडियाट्रिक रीनल बायोप्सी रिपोर्ट से स्ट्रक्चर्ड जानकारी को कुशलतापूर्वक और सटीक रूप से निकाल सकता है।

Avish Vijayaraghavan, Jaskaran Singh Kawatra, Sebin Sabu, Jonny Sheldon, Will Poulett, Alex Eze, Daniel Key, John Booth (…)2026-04-07
💬 NLP

Position: Logical Soundness is not a Reliable Criterion for Neurosymbolic Fact-Checking with LLMs

यह शोध पत्र यह तर्क देता है कि एलएलएम (LLM) के साथ न्यूरोसिंबोलिक तथ्य-जांच (fact-checking) के लिए प्राथमिक मानदंड के रूप में औपचारिक तार्किक सुदृढ़ता (formal logical soundness) पर निर्भर करना मौलिक रूप से त्रुटिपूर्ण है क्योंकि यह मानवीय व्यावहारिक अनुमानों (human pragmatic inferences) को ध्यान में रखने में विफल रहता है, और इसके बजाय भ्रामक निष्कर्षों के विरुद्ध औपचारिक आउटपुट को मान्य करने के लिए एलएलएम की मानव-समान तर्क प्रवृत्तियों का लाभ उठाने का समर्थन करता है।

Jason Chan, Robert Gaizauskas, Zhixue Zhao2026-04-07
💬 NLP

Which English Do LLMs Prefer? Triangulating Structural Bias Towards American English in Foundation Models

यह शोध पत्र प्रीट्रेनिंग कॉर्पोरा (pretraining corpora), टोकनाइज़र और जनरेटिव आउटपुट के बहु-चरणीय विश्लेषण के माध्यम से यह जांच करता है और प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स ब्रिटिश अंग्रेजी की तुलना में अमेरिकी अंग्रेजी के पक्ष में एक व्यवस्थित संरचनात्मक पूर्वाग्रह प्रदर्शित करते हैं, जिससे वैश्विक एआई परिनियोजन में भाषाई समरूपीकरण और ज्ञानमीमांसीय अन्याय (epistemic injustice) को सुदृढ़ता मिलती है।

Mir Tafseer Nayeem, Davood Rafiei2026-04-07
💬 NLP

DARE: Diffusion Large Language Models Alignment and Reinforcement Executor

DARE एक ओपन-सोर्स फ्रेमवर्क है जो डिफ्यूजन लार्ज लैंग्वेज मॉडल्स (dLLMs) के लिए पोस्ट-ट्रेनिंग और इवैल्यूएशन पाइपलाइन्स को एकीकृत करने के लिए सुपरवाइज्ड फाइन-ट्यूनिंग, प्रेफरेंस ऑप्टिमाइज़ेशन और रीइन्फोर्समेंट लर्निंग को जोड़कर पारिस्थितिकी तंत्र के विखंडन को संबोधित करता है और विविध मॉडल परिवारों में पुनरुत्पादनीय, निष्पक्ष तुलना सक्षम करता है।

Jingyi Yang, Yuxian Jiang, Xuhao Hu, Shuang Cheng, Biqing Qi, Jing Shao2026-04-07
🤖 AI

Combee: Scaling Prompt Learning for Self-Improving Language Model Agents

यह शोध पत्र Combee का प्रस्ताव करता है, जो एक नवीन फ्रेमवर्क है जो समानांतर स्कैन (parallel scans), एक संवर्धित शफल तंत्र (augmented shuffle mechanism) और एक गतिशील बैच आकार नियंत्रक (dynamic batch size controller) का उपयोग करके स्व-सुधारित भाषा मॉडल एजेंटों के लिए समानांतर प्रॉम्प्ट लर्निंग को स्केल करता है, जिससे कई बेंचमार्क में सटीकता को बनाए रखते हुए या उसमें सुधार करते हुए 17 गुना तक की गति वृद्धि प्राप्त होती है।

Hanchen Li, Runyuan He, Qizheng Zhang, Changxiu Ji, Qiuyang Mang, Xiaokun Chen, Lakshya A Agrawal, Wei-Liang Liao, Eric (…)2026-04-07
🧬 biology

Entropy, Disagreement, and the Limits of Foundation Models in Genomics

यह शोध पत्र तर्क देता है कि जीनोमिक अनुक्रमों की उच्च एंट्रॉपी (entropy) अर्थपूर्ण निरूपण (representations) सीखने की फाउंडेशन मॉडल्स की क्षमता को मौलिक रूप से सीमित करती है, जिससे अस्थिर भविष्यवाणियां और इंटर-टोकन संबंधों को पकड़ने में विफलता होती है, जो यह सुझाव देता है कि वर्तमान स्व-पर्यवेक्षित (self-supervised) प्रशिक्षण पद्धतियां जीनोमिक डेटा के लिए अनुपयुक्त हो सकती हैं।

Maxime Rochkoulets, Lovro Vrček, Mile Šikić2026-04-07
💬 NLP

Adaptive Cost-Efficient Evaluation for Reliable Patent Claim Validation

यह शोध पत्र ACE को प्रस्तुत करता है, जो एक हाइब्रिड फ्रेमवर्क है जो स्टेट-ऑफ-द-आर्ट पेटेंट क्लेम वैलिडेशन सटीकता (94.95% F1) प्राप्त करने के लिए प्रेडिक्टिव एंट्रॉपी-आधारित रूटिंग को 'चेन ऑफ पेटेंट थॉट' प्रोटोकॉल के साथ जोड़ता है, जबकि नए ACE-40k बेंचमार्क द्वारा समर्थित, स्टैंडअलोन LLMs की तुलना में परिचालन लागत को 78% तक कम करता है।

Yongmin Yoo, Qiongkai Xu, Longbing Cao2026-04-07
💬 NLP

High-Stakes Personalization: Rethinking LLM Customization for Individual Investor Decision-Making

यह शोध पत्र तर्क देता है कि व्यक्तिगत निवेशक निर्णय लेने की प्रक्रिया, व्यवहार संबंधी जटिलता, थीसिस ड्रिफ्ट (thesis drift), स्टाइल-सिग्नल तनाव और ग्राउंड ट्रुथ के अभाव के कारण वर्तमान एलएलएम (LLM) वैयक्तिकरण प्रतिमानों की महत्वपूर्ण सीमाओं को उजागर करती है, जो लेखकों को उनके तैनात एआई-संवर्धित पोर्टफोलियो प्रबंधन प्रणाली के आधार पर उच्च-दांव वाले, समयानुवर्ती निर्णय डोमेन के लिए नए वास्तुशिल्प प्रत्युत्तरों और अनुसंधान दिशाओं का प्रस्ताव करने के लिए प्रेरित करती है।

Yash Ganpat Sawant2026-04-07
💬 NLP

How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings

यह शोध पत्र यथार्थवादी सेटिंग्स में LLM एजेंट कौशल का पहला व्यापक बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि कौशलों से होने वाले प्रदर्शन लाभ नाजुक हैं और महत्वपूर्ण रूप से घट जाते हैं जब एजेंटों को बड़े संग्रहों से स्वायत्त रूप से पुनर्प्राप्त (retrieve) करना पड़ता है, हालांकि क्वेरी-विशिष्ट परिशोधन रणनीतियाँ इस खोए हुए प्रदर्शन को काफी हद तक पुनः प्राप्त कर सकती हैं।

Yujian Liu, Jiabao Ji, Li An, Tommi Jaakkola, Yang Zhang, Shiyu Chang2026-04-07
💬 NLP

Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction

यह शोध पत्र MINT प्रस्तुत करता है, जो एक मल्टी-टर्न मेडिकल डायग्नोसिस बेंचमार्क है जो यह प्रकट करता है कि कैसे लार्ज लैंग्वेज मॉडल्स अक्सर अपनी अंतर्निहित आत्म-सुधार क्षमताओं के बावजूद समयपूर्व निष्कर्षों पर पहुँच जाते हैं, और यह प्रदर्शित करता है कि नैदानिक प्रश्नों और साक्ष्य प्रस्तुति को रणनीतिक रूप से विलंबित करने से नैदानिक सटीकता में महत्वपूर्ण सुधार हो सकता है।

Jinrui Fang, Runhan Chen, Xu Yang, Jian Yu, Jiawei Xu, Ashwin Vinod, Wenqi Shi, Tianlong Chen, Heng Ji, ChengXiang Zhai (…)2026-04-07