💻 computer science

Predicting Performance of Symbolic and Prompt Programs with Examples

यह शोध पत्र RAP का प्रस्ताव करता है, जो एक प्रदर्शन भविष्यवाणी ढांचा (performance prediction framework) है जो एक अनुमानित पूर्व ज्ञान (approximate prior) के निर्माण के लिए पुनर्प्राप्त समान कार्यों और प्रॉम्प्ट प्रोग्रामों का लाभ उठाता है, जो LLM प्रॉम्प्टिंग की अविश्वसनीयता को संबोधित करते हुए इसके विसरित प्रदर्शन वितरण (diffuse performance distribution) को प्रतीकात्मक प्रोग्रामों (symbolic programs) की "सब-या-कुछ-नहीं" (all-or-nothing) प्रकृति से प्रभावी ढंग से अलग करता है।

Chengqi Zheng, Keya Hu, Shuzhi Liu, Tao Wu, Kevin Ellis, Yewen Pu2026-05-22
💻 computer science

Harnesses for Inference-Time Alignment over Execution Trajectories

यह शोध पत्र एलएलएम (LLM) एजेंटों के लिए हार्नेस इंजीनियरिंग का विश्लेषण करने हेतु एक इन्फरेंस-टाइम ट्रेजेक्टरी अलाइनमेंट फ्रेमवर्क प्रस्तुत करता है, जो यह प्रकट करता है कि इष्टतम प्रदर्शन के लिए अक्सर ओवर-डिकम्पोजिशन और मतिभ्रम (hallucination) जैसे विफलता मोडों से बचने के लिए कार्य अपघटन (task decomposition) और निर्देशित निष्पादन के बीच संतुलन बनाकर आंशिक, न कि पूर्णतः संरचित वर्कफ़्लो की आवश्यकता होती है।

Boyuan Wang, Bochao Li, Minghan Wang, Yuxin Tao, Fang Kong2026-05-22
🧬 biology

Protein Thoughts: Interpretable Reasoning with Tree of Thoughts and Embedding-Space Flow Matching for Protein-Protein Interaction Discovery

यह शोधपत्र **प्रोटीन थॉट्स (Protein Thoughts)** को पेश करता है, जो प्रोटीन-प्रोटीन इंटरेक्शन की खोज के लिए एक व्याख्यात्मक ढांचा है जो बाइंडिंग साक्ष्य को चार जैविक संकेतों में विघटित करने वाले एक पारदर्शी वैल्यू फंक्शन को हाइपोथेसिस-गाइडेड ट्री-ऑफ-थॉट्स सर्च और एम्बेडिंग-स्पेस फ्लो मैचिंग के साथ जोड़ता है ताकि अपनी रैंकिंग के लिए यांत्रिक औचित्य प्रदान करते हुए अत्याधुनिक भविष्यवाणी सटीकता प्राप्त की जा सके।

Kingsley Yeon, Xuefeng Liu, Promit Ghosal2026-05-22
💻 computer science

A Reproducible Log-Driven AutoML Framework for Interpretable Pipeline Optimization in Healthcare Risk Prediction

यह शोध पत्र yvsoucom-iterkit को प्रस्तुत करता है, जो एक नियतात्मक (deterministic) और लॉग-संचालित (log-driven) AutoML फ्रेमवर्क है जो स्वास्थ्य देखभाल जोखिम भविष्यवाणी पाइपलाइनों को ट्रेस करने योग्य संस्थाओं के रूप में कूटबद्ध करके उन्हें अनुकूलित करता है, जिससे यह पता चलता है कि प्रदर्शन डेटा ऑग्मेंटेशन और असंतुलन हैंडलिंग जैसे उच्च-प्रभाव वाले घटकों के एक छोटे समूह द्वारा नियंत्रित होता है, जबकि विविध कॉन्फ़िगरेशनों में स्थिर और पुनरुत्पादक परिणाम प्राप्त करता है।

Rui Huang, Lican Huang2026-05-22
💻 computer science

RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts

यह शोधपत्र RefusalBench को प्रस्तुत करता है, जो एक मैचड-ट्रिपल (matched-triple) बेंचमार्क है जो यह प्रकट करता है कि सख्त इनकार दरें (strict refusal rates) जैविक अनुसंधान प्रॉम्प्ट्स पर फ्रंटियर LLMs को मॉडल वेट्स के बजाय प्रदाता-विशिष्ट एक्सेस-पाथ नीतियों के कारण गलत रैंक करती हैं, जबकि यह प्रदर्शित करता है कि बाइनरी मेट्रिक्स सूक्ष्म आंशिक-अनुपालन व्यवहारों को पकड़ने में विफल रहते हैं और टियर-भेदभाव प्रदर्शन विभिन्न मॉडलों के बीच महत्वपूर्ण रूप से भिन्न होता है।

Lukas Weidener, Marko Brkić, Mihailo Jovanović, Emre Ulgac, Aakaash Meduri2026-05-22
📊 statistics

Scalable On-Policy Reinforcement Learning via Adaptive Batch Scaling

यह शोध पत्र एडेप्टिव बैच स्केलिंग (ABS) का प्रस्ताव देकर इस पारंपरिक धारणा को चुनौती देता है कि बड़े-बैच प्रशिक्षण और सुदृढीकरण शिक्षण (Reinforcement Learning) एक साथ संगत नहीं हैं, जो नीति स्थिरता के आधार पर बैच आकार को गतिशील रूप से समायोजित करता है ताकि बेहतर प्रदर्शन के लिए बड़े नेटवर्क और बड़े बैचों को सफलतापूर्वक संयोजित किया जा सके।

Jongchan Park2026-05-22
💻 computer science

When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning

यह शोध पत्र पोजीशन-वेटेड ऑन-पॉलिक सेल्फ-डिस्टिलेशन (PW-OPSD) प्रस्तुत करता है, जो यह पहचानकर कि टीचर-टोकन विश्वसनीयता एक प्रक्षेपवक्र-संरचित पैटर्न का अनुसरण करती है जिसे एंट्रॉपी के बजाय टोकन स्थिति द्वारा बेहतर ढंग से अनुमानित किया जा सकता है, अतिरिक्त टीचर गणना के बिना लक्षित डिस्टिलेशन के माध्यम से रीजनिंग मॉडल के प्रदर्शन में सुधार करता है।

Xiaogeng Liu, Xinyan Wang, Yingzi Ma, Yechao Zhang, Chaowei Xiao2026-05-22
💻 computer science

The Shape of Testimony: A Scalable Framework for Oral History Archive Comparison

यह अध्ययन 1,600 से अधिक होलोकॉस्ट उत्तरजीवी साक्ष्यों का विश्लेषण करने के लिए एक स्केलेबल कम्प्यूटेशनल ढांचे का उपयोग करता है, जो USC शोआ फाउंडेशन और येल फोर्टुनॉफ अभिलेखागार के बीच सामान्य संरचनात्मक अंतरों की पुष्टि करते हुए महत्वपूर्ण कथात्मक ओवरलैप को प्रकट करता है जो सरल "संरचित बनाम मुक्त-रूप" द्वि-विभाजन को चुनौती देते हैं।

Itamar Trainin, Renana Keydar, Amit Pinchevski2026-05-22
💻 computer science

Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

यह शोध पत्र फ्लैट-पैक बेंच (Flat-Pack Bench) का परिचय देता है, जो फर्नीचर असेंबली कार्यों के माध्यम से लार्ज विजन-लैंग्वेज मॉडल्स की सूक्ष्म स्थानिक-कालिक तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल टेम्पोरल ऑर्डरिंग (क्रमबद्धता), स्टेट लोकलाइजेशन (अवस्था स्थानीयकरण), पार्ट मेटिंग (पुर्जों के मिलान) और ट्रैकिंग में काफी संघर्ष करते हैं।

Aditya Chetan, Eric Cai, Peeyush Kushwaha, Bharath Raj Nagoor Kani, Utkarsh Mall, Qianqian Wang, Noah Snavely, Bharath H (…)2026-05-22
💻 computer science

Faster Completion, Less Learning: Generative AI Reduced Study Time on Math Problems and the Knowledge They Build

एक दशक के ALEKS डेटा का उपयोग करने वाला यह बड़े पैमाने पर किया गया अध्ययन यह प्रकट करता है कि जनरेटिव एआई ने संवेदनशील गणितीय समस्याओं पर छात्रों के अध्ययन के समय को काफी कम कर दिया है और साथ ही उनके दीर्घकालिक ज्ञान प्रतिधारण (नॉलेज रिटेंशन) को भी खराब कर दिया है, एक ऐसी घटना जिसे लेखक "संज्ञानात्मक आत्मसमर्पण" (कॉग्निटिव सरेंडर) के रूप में पहचानते हैं।

Sina Rismanchian, Hasan Uzun, Jeffrey Matayoshi, Eric Cosyn, Eyad Kurd-Misto2026-05-22