💻 computer science

Value-Aware Numerical Representations for Transformer Language Models

यह शोध पत्र एक मूल्य-जागरूक संख्यात्मक प्रतिनिधित्व प्रस्तुत करता है जो मानक टोकन इनपुट को एक मूल्य-सशर्त प्रीफ़िक्स टोकन के साथ संवर्धित करता है ताकि संख्यात्मक परिमाण को स्पष्ट रूप से एनकोड किया जा सके, जिससे अंकगणितीय और संख्यात्मक तर्क कार्यों में ट्रांसफॉर्मर भाषा मॉडलों की सुदृढ़ता में महत्वपूर्ण सुधार होता है।

Andreea Dutulescu, Stefan Ruseti, Mihai Dascalu2026-01-15
💬 NLP

What Are They Filtering Out? An Experimental Benchmark of Filtering Strategies for Harm Reduction in Pretraining Datasets

यह शोध पत्र एक बेंचमार्क अध्ययन प्रस्तुत करता है जो यह प्रकट करता है कि हालांकि डेटा फ़िल्टरिंग रणनीतियाँ लार्ज लैंग्वेज मॉडल्स के प्रीट्रेनिंग डेटासेट में हानिकारक सामग्री को प्रभावी ढंग से कम करती हैं, वे अनजाने में कमजोर समूहों के अल्प-प्रतिनिधित्व को बढ़ा देती हैं, जिससे भेदभाव और अधिक बढ़ जाता है।

Marco Antonio Stranisci, Christian Hardmeier2025-02-17
💬 NLP

Rethinking the Evaluating Framework for Natural Language Understanding in AI Systems: Language Acquisition as a Core for Future Metrics

यह शोध पत्र एआई मूल्यांकन में नकल-आधारित ट्यूरिंग टेस्ट से एक नए ढांचे की ओर एक प्रतिमान परिवर्तन (पैराडाइम शिफ्ट) का प्रस्ताव करता है जो कुशल भाषा अधिग्रहण और समझ पर केंद्रित है, यह तर्क देते हुए कि एक मूर्त (एम्बोडीड), संवादात्मक वातावरण में न्यूनतम डेटा से भाषा सीखने की मशीन की क्षमता का आकलन करना वास्तविक बुद्धिमत्ता का एक अधिक सुदृढ़ और टिकाऊ माप प्रदान करता है।

Patricio Vera, Pedro Moya, Lisa Barraza2023-10-05
💬 NLP

Cardiovascular Disease Risk Prediction via Social Media

यह अध्ययन प्रदर्शित करता है कि एक कस्टम CVD कीवर्ड डिक्शनरी, VADER सेंटीमेंट एनालिसिस और मशीन लर्निंग मॉडल (विशेष रूप से SVM और CNN-LSTM) का उपयोग करके ट्विटर डेटा का विश्लेषण करना, पारंपरिक जनसांख्यिकीय-आधारित दृष्टिकोणों (CDC डेटा से) की तुलना में राज्य स्तर पर हृदय रोग (कार्डियोवैस्कुलर डिजीज) के जोखिम की प्रभावी ढंग से भविष्यवाणी करता है।

Al Zadid Sultan Bin Habib, Md Asif Bin Syed, Md Tanvirul Islam, Donald A. Adjeroh2023-09-28