💬 NLP

A Single Rewrite Suffices: Empirical Lessons from Production Skill Description Optimization

यह शोधपत्र प्रदर्शित करता है कि केवल कुछ फॉल्स-पॉजिटिव और फॉल्स-नेगेटिव मामलों के मार्गदर्शन में, कौशल विवरणों (skill descriptions) का एक एकल LLM रीराइट, मैनुअल इंजीनियरिंग के समान रूटिंग सटीकता प्राप्त कर सकता है, जबकि प्रयास को नाटकीय रूप से कम करता है, हालांकि यह वास्तव में ओवरलैपिंग कौशल स्कोप के कारण होने वाले टकरावों को हल नहीं कर सकता है।

Yangqiaoyu Zhou, Mohammad Alqudah, Kwei-Herng Lai, Aaron Halfaker, Yingqi Xiong, Yaar Harari2026-07-01
🤖 machine learning

Revocable Learned State via Process Sidecars

यह शोध पत्र "प्रोसेस साइडकार्स" (process sidecars) का परिचय देता है, जो एक दो-गुणांक (two-coefficient) संपादन विधि है जो भाषा मॉडलों से सीखी गई स्मृतियों को सटीक रूप से वापस लेने के लिए भविष्य के सुरक्षा प्रशिक्षण के प्रक्षेपवक्र (trajectory) का लाभ उठाती है, जिससे उन प्रथम-क्रम त्रुटियों (first-order errors) पर विजय प्राप्त होती है जो मूल स्मृति दिशा के विरूपण होने पर साधारण कार्य अंकगणित (naive task arithmetic) में निहित होती हैं।

John Sweeney2026-07-01
💬 NLP

Using AI Agents to Automate Black-Box Audits of Personalization Algorithms at Scale

यह शोध पत्र निश्चित व्यक्तित्व वाले जनरेटिव एआई एजेंटों का उपयोग करके पर्सनलाइजेशन एल्गोरिदम के ब्लैक-बॉक्स ऑडिटिंग के लिए एक नवीन ढांचे को प्रस्तुत करता है ताकि यह सक्षम बनाया जा सके कि कैसे उपयोगकर्ता के गुण सामग्री वितरण को प्रभावित करते हैं, और एक्स (X) पर एक बड़े पैमाने के अध्ययन के माध्यम से यह प्रदर्शित करता है कि प्लेटफॉर्म का एल्गोरिदम ध्रुवीकरण करने वाली सामग्री को बढ़ाता है और उपयोगकर्ता की विचारधारा के आधार पर जनसांख्यिकीय संकेतों के प्रति अलग-अलग प्रतिक्रिया देता है।

Alessandro Morosini, Sarah H. Cen, Andrew Ilyas, Hedi Driss, Aleksander Mądry, Chara Podimata2026-07-01
💬 NLP

When Calibration Rankings Reverse: Accuracy-Controlled Evaluation for Fair Comparison of LLMs

यह शोध पत्र एक्यूरेसी-कंट्रोल्ड इवैल्यूएशन (ACE) फ्रेमवर्क का परिचय देता है ताकि यह प्रदर्शित किया जा सके कि पारंपरिक वैश्विक अंशांकन मेट्रिक्स (ग्लोबल कैलिब्रेशन मेट्रिक्स) सटीकता के अंतरों से प्रभावित होते हैं, जो अक्सर बार-बार रैंकिंग उलटने का कारण बनते हैं, और यह तर्क देता है कि लार्ज लैंग्वेज मॉडल्स के निष्पक्ष क्रॉस-मॉडल तुलना के लिए सटीकता-जागरूक मूल्यांकन विधियों की आवश्यकता है।

Zhichao Yang, Caiqi Zhang, Ruihan Yang, Chengzu Li, Nigel Collier, Deqing Yang2026-07-01
💬 NLP

Test-Time Verification for Text-to-SQL via Outcome Reward Models

यह शोध पत्र GradeSQL प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो Text-to-SQL विश्वसनीयता को बढ़ाने के लिए सीखे गए सिमेंटिक स्कोरर्स के रूप में Outcome Reward Models (ORMs) का लाभ उठाता है, यह प्रदर्शित करते हुए कि ORM-आधारित सत्यापन BIRD और Spider बेंचमार्क पर पारंपरिक ह्यूरिस्टिक विधियों जैसे कि execution-based Best-of-N और Majority Voting की तुलना में काफी बेहतर प्रदर्शन करता है।

Mattia Tritto, Giuseppe Farano, Dario Di Palma, Gaetano Rossiello, Fedelucio Narducci, Dharmashankar Subramanian, Tommas (…)2026-07-01
💬 NLP

Multilingual Polarization Detection Using Transformer-Based Models with Class Weighting and Threshold Tuning

यह शोध पत्र SemEval-2026 टास्क 9 के लिए अंग्रेजी और स्वाहिली में बहुभाषी ध्रुवीकरण, प्रकारों और अभिव्यक्तियों का पता लगाने में प्रतिस्पर्धी प्रदर्शन प्राप्त करने के लिए क्लास वेटिंग और थ्रेशोल्ड ट्यूनिंग के साथ RoBERTa और AfroXLMR मॉडलों का उपयोग करते हुए एक ट्रांसफार्मर-आधारित दृष्टिकोण प्रस्तुत करता है।

Aaron Bundi Anampiu2026-07-01
💬 NLP

Training Therapeutic Judges and Multi-Agent Systems for Human-Aligned Mental Health Support

यह शोध पत्र TheraAlign को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो एक विशिष्ट मूल्यांकनकर्ता (TheraJudge) को क्रियात्मक, बहु-आयामी प्रतिक्रिया प्रदान करने के लिए प्रशिक्षित करके मानसिक स्वास्थ्य सहायता को बढ़ाता है, जो एक बहु-एजेंट परिशोधन प्रणाली (TheraAgent) को चिकित्सीय प्रतिक्रियाओं की सुरक्षा, प्रासंगिकता और सहानुभूति में महत्वपूर्ण सुधार करने के लिए प्रेरित करता है।

Mizanur Rahman, Abeer Badawi, Elahe Rahimi, Laleh Seyyed-Kalantari, Frank Rudzicz, Enamul Hoque, Elham Dolatabadi2026-07-01
💬 NLP

Beyond Clean Text: Evaluating Encoder and Decoder Robustness for Bangla Event Detection in Noisy Text

यह शोध पत्र शोर वाले डेटा (noisy data) के साथ एक व्यापक बांग्ला इवेंट डिटेक्शन बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि जहाँ एनकोडर-ओनली मॉडल स्वच्छ टेक्स्ट पर उत्कृष्ट प्रदर्शन करते हैं, वहीं डिकोडर-ओनली LLMs वास्तविक दुनिया के शोर के प्रति बेहतर मजबूती प्रदान करते हैं, एक ऐसा अंतर जिसे संयुक्त प्रशिक्षण और मॉडल स्केलिंग के माध्यम से कम किया जा सकता है।

Tanvir Ahmed Sijan, S. M Golam Rifat, Nayeemul Islam, Md. Musfique Anwar2026-07-01
💬 NLP

From Propositional to Perceptual Asymmetry: Extending Frictive Policy Optimization to Asymmetric Partial Information Dialogue

यह शोध पत्र संवाद में संवेदी विषमता (perceptual asymmetry) को संबोधित करने के लिए फ्रिक्टिव पॉलिसी ऑप्टिमाइज़ेशन (Frictive Policy Optimization) का विस्तार करता है, यह प्रदर्शित करते हुए कि घर्षण (friction) ग्राउंडिंग के लिए एक महत्वपूर्ण ज्ञान संबंधी संकेत (epistemic signal) के रूप में कार्य करता है, जो यह प्रकट करता है कि सफल संचार सभी संदर्भों तक सर्वज्ञ पहुंच के बजाय एक सूचित एकल परिप्रेक्ष्य पर अधिक निर्भर करता है, और इन गतिकी को बेहतर ढंग से पकड़ने के लिए विशिष्ट एनोटेशन परिशोधनों का प्रस्ताव करता है।

Yifan Zhu, Kyeongmin Rim, James Pustejovsky2026-07-01
📈 economics

Measuring Judgment Quality in Natural-Language Explanations: Evidence from Forecasting Tournaments

यह शोधपत्र एक्सप्लेनेशन क्वालिटी मार्कर्स (EQMs) को प्रस्तुत करता है, जो प्राकृतिक-भाषा स्पष्टीकरणों में साठ तर्क पैटर्न को स्कोर करने की एक स्केलेबल, LLM-आधारित विधि है, जो प्रभावी रूप से पूर्वानुमान सटीकता का अनुमान लगाती है और पारंपरिक टेक्स्ट-एनालिसिस तकनीकों से बेहतर प्रदर्शन करती है।

Christopher W. Karvetski, Sheldon S. Huang, Simas Kučinskas, Nadja Flechner, Jingyu Hu, Philip Tetlock, Ezra Karger2026-07-01