💬 NLP

PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

PixelRAG एक नवीन रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क पेश करता है जो पूरी तरह से पिक्सेल स्पेस में संचालित होता है, जो पार्स किए गए टेक्स्ट के बजाय रॉ वेबसाइट स्क्रीनशॉट्स को रिट्रीव और प्रोसेस करता है, जिससे लेआउट लॉस समाप्त हो जाता है और पारंपरिक टेक्स्ट-आधारित RAG सिस्टम की तुलना में विविध बेंचमार्क पर बेहतर प्रदर्शन और दक्षता प्राप्त होती है।

Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min2026-06-30
🤖 machine learning

Agentic Safety is an Epistemic Property, Not a Behavioral One

यह शोध पत्र तर्क देता है कि एआई सुरक्षा को केवल वर्तमान प्रदर्शन के व्यवहारिक गुण के रूप में नहीं, बल्कि "शिक्षण क्षमता" (teachability) के एक ज्ञानमीमांसीय गुण के रूप में पुनर्गठित किया जाना चाहिए—जो भविष्य के सुधारात्मक उत्तोलन (corrective leverage) को बनाए रखने की क्षमता है—ताकि यह सुनिश्चित किया जा सके कि उन्नत, स्व-सुधार करने वाली प्रणालियाँ समय के साथ सुधारात्मक बनी रहें।

Charles L. Wang, Keir Dorchen, Peter Jin2026-06-30
🤖 machine learning

DBpedia-Enriched Company Representation for B2B Lead Recommendation

यह अध्ययन प्रदर्शित करता है कि सीखे गए कंपनी एम्बेडिंग को DBpedia से संरचित सिमेंटिक ज्ञान के साथ समृद्ध करना, उपयोगकर्ता इंटरैक्शन की भविष्यवाणी करने में B2B लीड अनुशंसा प्रणालियों के प्रदर्शन में महत्वपूर्ण सुधार करता है।

Yuyan Qian, Claude Montacie, Milan Stankovic, Victoria Eyharabide2026-06-30
🤖 machine learning

Zero-Label Driving Scenario Complexity Detection via Joint Embedding Predictive Architecture

यह शोध पत्र प्रदर्शित करता है कि बिना लेबल वाले ड्राइविंग डेटा पर प्रशिक्षित एक स्व-पर्यवेक्षित जॉइंट एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर (JEPA), टेम्पोरल प्रेडिक्शन एरर को ज़ीरो-लेबल कॉम्प्लेक्सिटी स्कोर के रूप में उपयोग करके जटिल और सुरक्षा-महत्वपूर्ण परिदृश्यों की प्रभावी ढंग से पहचान कर सकता है, जो बिना किसी मानवीय एनोटेशन के विसंगति का पता लगाने (anomaly detection) में महत्वपूर्ण प्रदर्शन प्राप्त करता है।

Santosh Jaiswal2026-06-30
🤖 machine learning

RADIANT-PET: Reasoning-Augmented PET/CT Lesion Segmentation with Large Language Models and Reinforcement Learning

RADIANT-PET एक नवीन ढांचा है जो संरचित पाठ्य विवरणों और नैदानिक रिपोर्टों का उपयोग करके उम्मीदवारों का न्याय करने के लिए एक सुदृढीकरण शिक्षण-अनुकूलित बड़े भाषा मॉडल के साथ एक अनुमति देने वाले वोक्सेल-स्तरीय मॉडल को जोड़कर PET/CT घाव विभाजन (लेसन सेगमेंटेशन) को बढ़ाता है, जिससे गलत सकारात्मकता (फॉल्स पॉजिटिव) में काफी कमी आती है और भविष्यवाणियों को नैदानिक व्याख्या के साथ संरेखित किया जाता है।

Jiasheng Wang, Tanun Jitwatcharakomol, Piyawadee Jongpradubgiat, Simeng Zhu2026-06-30
🤖 machine learning

GPU-Accelerated Inverse Structural Anastylosis from Block Collapse Dynamics

यह शोध पत्र जेन्गा इनवर्स प्रेडिक्टर (JIP-2) प्रस्तुत करता है, जो एक GPU-त्वरित डीप लर्निंग फ्रेमवर्क है जो मलबे की छवियों से ब्लॉक हटाने के अनुक्रम और स्थिरता मेट्रिक्स का अनुमान लगाकर ढहे हुए वास्तुशिल्प स्मारकों के मूल विन्यासों को स्वचालित रूप से पुनर्गठित करने के लिए रिजिड-बॉडी भौतिकी सिमुलेशन और एक ड्यूल-स्ट्रीम ResNet-18 आर्किटेक्चर का लाभ उठाता है।

L. A. Muñoz2026-06-30
🤖 machine learning

RadarTwin: Scene-Specific mmWave Radar Simulation and Learning for Mobile Indoor Perception

RadarTwin एक ऐसा फ्रेमवर्क है जो न्यूनतम या बिना वास्तविक दुनिया के रडार डेटा के, प्रभावी मोबाइल इनडोर परसेप्शन ट्रेनिंग को सक्षम करने के लिए, डिप्लॉयमेंट-विशिष्ट mmWave रडार सिमुलेशन उत्पन्न करने हेतु 3D पुनर्निर्माण (reconstructions), विजन-लैंग्वेज मॉडल्स और भौतिकी-आधारित रे ट्रेसिंग का लाभ उठाता है।

Emily Bejerano, Federico Tondolo, Devang Gupta, Aaron Mano Cherian, Taeyoo Kim, Ayaan Qayyum, Xiaofan Yu, Xiaofan Jiang2026-06-30
🧬 biology

Meta-learning as a principle for human-like visual representations

यह शोध पत्र प्रस्तावित करता है कि मानव-समान दृश्य प्रतिनिधित्व निश्चित उद्देश्यों के बजाय मेटा-लर्निंग दबावों से उत्पन्न होते हैं, यह प्रदर्शित करते हुए कि विविध, अर्थपूर्ण कार्यों पर मॉडलों को प्रशिक्षित करना मानव समानता निर्णयों, नियम सीखने और उच्च-स्तरीय दृश्य वल्कुट (विजुअल कॉर्टेक्स) में तंत्रिका गतिविधि की भविष्यवाणी करने की उनकी क्षमता में महत्वपूर्ण सुधार करता है।

Can Demircan, Marcel Binz, Alireza Modirshanechi, Eric Schulz2026-06-30
🤖 machine learning

Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs

यह शोध पत्र ViPSy का प्रस्ताव करता है, जो एक दो-चरणीय ढांचा (two-stage framework) है जो विजुअली ग्राउंडेड और पॉलिसी-अलाइन्ड प्रेफरेंस डेटा को सिंथेसाइज करता है ताकि विजन-लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को महत्वपूर्ण रूप से कम किया जा सके, जिससे मतिभ्रम बेंचमार्क पर नया स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त होता है और साथ ही सामान्य दृश्य क्षमताओं में वृद्धि होती है।

Yunhun Nam, Jongheon Jeong2026-06-30
🤖 machine learning

Can AI Draw Science? A Benchmark for Evaluating Scientific Figure Generation by Text-to-Image and Multimodal Models

यह शोधपत्र SciDraw-Bench प्रस्तुत करता है, जो एक विशिष्ट बेंचमार्क और चार-आयामी मूल्यांकन प्रोटोकॉल है जिसे टेक्स्ट-टू-इमेज और मल्टीमॉडल मॉडल्स की वैज्ञानिक रूप से सटीक चित्र उत्पन्न करने की क्षमता का आकलन करने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि एक डोमेन-विशिष्ट सिस्टम अनुशासन संबंधी परंपराओं और अर्थ संबंधी शुद्धता का पालन करने में सामान्य-उद्देश्य वाले मॉडल्स की तुलना में काफी बेहतर प्रदर्शन करता है।

Davie Chen2026-06-30