🤖 AI

Prompts to Proxies: Emulating Human Preferences via a Compact LLM Ensemble

यह शोध पत्र *प्रॉम्प्ट्स टू प्रॉक्सीज़* (P2P\texttt{P2P}) का परिचय देता है, जो एक लागत प्रभावी, दो-चरणीय ढांचा है जो फाइन-ट्यूनिंग या संवेदनशील जनसांख्यिकीय जानकारी की आवश्यकता के बिना, लक्षित जनसंख्या डेटा से मेल खाने के लिए एलएलएम (LLM) एजेंटों के एक विविध पूल का निर्माण करके और उन्हें एल1-नियमित प्रतिगमन (L1-regularized regression) के माध्यम से एकत्रित करके सामाजिक विज्ञान अनुसंधान में मानवीय प्राथमिकताओं का अनुकरण करता है।

Bingchen Wang, Zi-Yu Khoo, Jingtan Wang2026-01-30
🤖 AI

When Ads Become Profiles: Uncovering the Invisible Risk of Web Advertising at Scale with LLMs

यह शोध पत्र यह प्रदर्शित करता है कि 'ऑफ-द-शेल्फ' मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स, केवल फेसबुक विज्ञापन इंप्रेशन से, राजनीतिक संबद्धता और रोजगार स्थिति जैसे संवेदनशील उपयोगकर्ता गुणों को कुशलतापूर्वक और सटीकता से रिवर्स-इंजीनियर कर सकते हैं, जो एक महत्वपूर्ण प्रणालीगत भेद्यता को उजागर करता है जहाँ विज्ञापन स्ट्रीम उच्च-सटीक डिजिटल पदचिह्न के रूप में कार्य करती हैं जो वर्तमान प्लेटफॉर्म सुरक्षा उपायों को दरकिनार कर देती हैं।

Baiyu Chen, Benjamin Tag, Hao Xue, Daniel Angus, Flora Salim2026-01-30
🤖 AI

Unheard in the Digital Age: Rethinking AI Bias and Speech Diversity

यह लेख तर्क देता है कि एआई (AI) स्पीच रिकग्निशन सिस्टम में निहित संरचनात्मक पूर्वाग्रह असामान्य भाषण पैटर्न वाले व्यक्तियों को हाशिए पर धकेलते हैं, जिससे स्पीच विविधता को केवल एक सुलभता के मुद्दे के रूप में देखने के बजाय समावेशी डिजाइन, एंटी-बायस ट्रेनिंग और नीतिगत सुधार के माध्यम से इसे इक्विटी (समता) के एक मौलिक मामले के रूप में पहचानने की आवश्यकता है।

Onyedikachi Hope Amaechi-Okorie, Branislav Radeljic2026-01-30
🤖 AI

FrontierScience: Evaluating AI's Ability to Perform Expert-Level Scientific Tasks

यह शोधपत्र FrontierScience को प्रस्तुत करता है, जो एक नया बेंचमार्क है जिसे दो ट्रैकों के माध्यम से अत्याधुनिक भाषा मॉडलों (फ्रंटियर लैंग्वेज मॉडल्स) के विशेषज्ञ-स्तरीय वैज्ञानिक तर्क का मूल्यांकन करने के लिए डिज़ाइन किया गया है—ओलंपियाड की समस्याएं जो पदक विजेताओं और कोचों द्वारा बनाई गई हैं, और ओपन-एंडेड पीएचडी-स्तर के अनुसंधान कार्य जिन्हें वैज्ञानिकों द्वारा सत्यापित किया गया है—जो केवल अंतिम उत्तरों के बजाय समस्या-समाधान की प्रक्रिया का आकलन करने के लिए एक सूक्ष्म रूब्रिक-आधारित ढांचे का उपयोग करता है।

Miles Wang, Robi Lin, Kat Hu, Joy Jiao, Neil Chowdhury, Ethan Chang, Tejal Patwardhan2026-01-30
💻 computer science

Small models, big threats: Characterizing safety challenges from low-compute AI models

यह शोध पत्र तर्क देता है कि मॉडल संपीड़न (model compression) और एजेंटिक वर्कफ़्लो में तीव्र प्रगति ने कम-कंप्यूट वाले एआई सिस्टम को उपभोक्ता हार्डवेयर पर भी फ्रंटियर-स्तर की क्षमताएं हासिल करने में सक्षम बना दिया है, जिससे वर्तमान शासन ढांचों में तत्काल सुरक्षा अंतराल उत्पन्न हो गए हैं जो मुख्य रूप से उच्च-कंप्यूट मॉडलों पर ध्यान केंद्रित करते हैं।

Prateek Puri2026-01-30
💻 computer science

Turning Language Model Training from Black Box into a Sandbox

यह शोध पत्र यह प्रदर्शित करता है कि ब्राउज़र-आधारित टूल, जो छात्रों को सीधे उनके उपकरणों पर छोटे ट्रांसफॉर्मर मॉडल को प्रशिक्षित करने की अनुमति देता है, उनकी तर्क प्रक्रिया को मानवीकरण संबंधी गलत धारणाओं से डेटा-संचालित अंतर्दृष्टि की ओर स्थानांतरित करके भाषा मॉडलों की उनकी वैचारिक समझ में महत्वपूर्ण सुधार करता है।

Nicolas Pope, Matti Tedre2026-01-30
🤖 AI

Investigating Associational Biases in Inter-Model Communication of Large Generative Models

यह शोध पत्र इस बात की जांच करता है कि आयु और लिंग के संबंध में सहभागीय पूर्वाग्रह (associational biases), इमेज जनरेशन और विवरण से जुड़ी इंटर-मॉडल संचार पाइपलाइनों के माध्यम से कैसे प्रसारित और प्रवर्धित होते हैं, जो व्यवस्थित जनसांख्यिकीय विचलन (demographic drifts) और स्पूरियस विजुअल क्यूज़ (spurious visual cues) पर निर्भरता को प्रकट करते हैं, जिसके लिए मानव-केंद्रित एआई प्रणालियों हेतु लक्षित शमन रणनीतियों की आवश्यकता है।

Fethiye Irmak Dogan, Yuval Weiss, Kajal Patel, Jiaee Cheong, Hatice Gunes2026-01-30
🤖 machine learning

A Roadmap for Greater Public Use of Privacy-Sensitive Government Data: Workshop Report

NSF, NIST और OSTP द्वारा प्रायोजित, यह कार्यशाला रिपोर्ट सरकारी डेटा के सार्वजनिक विमोचन और व्यक्तिगत गोपनीयता की सुरक्षा के बीच संतुलन बनाने में वर्तमान चुनौतियों और तकनीकी अवसरों—जैसे कि औपचारिक गोपनीयता तकनीकें, सिंथेटिक डेटा और क्रिप्टोग्राफिक दृष्टिकोण—को रेखांकित करती है।

Chris Clifton, Bradley Malin, Anna Oganian, Ramesh Raskar, Vivek Sharma2026-01-29
🤖 AI

Tracing Mathematical Proficiency Through Problem-Solving Processes

यह शोध पत्र StatusKT का प्रस्ताव करता है, जो एक नवीन नॉलेज ट्रेसिंग फ्रेमवर्क है जो छात्रों की समस्या-समाधान प्रक्रियाओं से व्याख्यात्मक गणितीय दक्षता संकेतकों को निकालने के लिए एक तीन-चरणीय LLM पाइपलाइन का लाभ उठाता है, जिससे नए पेश किए गए KT-PSP-25 डेटासेट पर पारंपरिक तरीकों की तुलना में भविष्यवाणी की सटीकता और व्याख्यात्मकता में सुधार होता है।

Jungyang Park, Suho Kang, Jaewoo Park, Jaehong Kim, Jaewoo Shin, Seonjoon Park, Youngjae Yu2026-01-29
💬 NLP

PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice

यह शोधपत्र PLawBench प्रस्तुत करता है, जो बड़े भाषा मॉडलों (large language models) की सूक्ष्म-स्तरीय तर्क क्षमताओं का मूल्यांकन करने के लिए 850 वास्तविक दुनिया के कानूनी परिदृश्यों और विशेषज्ञ-निर्मित रूब्रिक्स (rubrics) से युक्त एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल अभी भी व्यावहारिक कानूनी कार्यों की जटिलता के साथ संघर्ष कर रहे हैं।

Yuzhen Shi, Huanghai Liu, Yiran Hu, Gaojie Song, Xinran Xu, Yubo Ma, Tianyi Tang, Li Zhang, Qingjing Chen, Di Feng, Wenb (…)2026-01-29