💬 NLP

GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory

यह शोध पत्र GT-HarmBench प्रस्तुत करता है, जो गेम थ्योरी संरचनाओं पर आधारित 1,535 उच्च-जोखिम वाले मल्टी-एजेंट परिदृश्यों का एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि अत्याधुनिक एआई मॉडल अक्सर सामाजिक रूप से लाभकारी परिणामों को चुनने में विफल रहते हैं और यह प्रदर्शित करता है कि गेम-थ्योरेटिक हस्तक्षेप इन जटिल वातावरणों में संरेखण (alignment) में महत्वपूर्ण सुधार कर सकते हैं।

Pepijn Cobben, Xuanqiang Angelo Huang, Thao Amelia Pham, Isabel Dahlgren, Terry Jingchen Zhang, Zhijing Jin2026-05-25
💻 computer science

How to Steer Your Multi-Agent System: Human-LLM Collaborative Planning

यह शोध पत्र AMBIPOM प्रस्तुत करता है, जो एक प्रोटोटाइप सिस्टम है जो सिमेंटिक/स्ट्रक्चरल मोड, ग्लोबल/टारगेटेड स्कोप, और हाई/लो-लेवल एडिट्स के माध्यम से प्रोसेस-लेवल सुपरविजन के लिए एक डिज़ाइन स्पेस को औपचारिक रूप देकर पारदर्शी और नियंत्रणीय मानव-LLM सहयोगात्मक योजना को सक्षम बनाता है, जिसे हाइब्रिड वर्कफ़्लो और ट्रेड-ऑफ़्स को प्रकट करने के लिए उपयोगकर्ता अध्ययनों और बेंचमार्क के माध्यम से मान्य किया गया है।

Zeyu He, Hannah Kim, Dan Zhang, Estevam Hruschka2026-05-25
💻 computer science

SVR-MAD: A Bayesian-Inspired Framework for Posterior-Guided Multi-Agent Debate

SVR-MAD एक बेयसियन-प्रेरित मल्टी-एजेंट डिबेट फ्रेमवर्क है जो सटीकता बनाए रखते हुए स्केलेबिलिटी में सुधार करता है और टोकन लागत को 61% तक कम करता है, जो संचार ग्राफ (कम्युनिकेशन ग्राफ) को गतिशील रूप से निर्मित करने के लिए डिबेट परिणामों को पोस्टीरियर साक्ष्य (पोस्टीरियर एविडेंस) के रूप में उपयोग करके पूर्व-आधारित प्रूनिंग विधियों की सीमाओं को दूर करता है।

Weifan Jiang, Rana Shahout, Minghao Li, Zhenting Qi, Yilun Du, Michael Mitzenmacher, Minlan Yu2026-05-25
🤖 AI

GENSTRAT: Toward a Science of Strategic Reasoning in Large Language Models

यह शोध पत्र GENSTRAT प्रस्तुत करता है, जो बड़े भाषा मॉडलों (large language models) की रणनीतिक तर्क क्षमता का मूल्यांकन करने के लिए प्रक्रियात्मक रूप से उत्पन्न रणनीतिक वातावरण और एक बहु-अक्षीय क्षमता प्रोफ़ाइल का उपयोग करने वाला एक ढांचा है, जो यह प्रकट करता है कि समान समग्र प्रदर्शन वाले मॉडल विशिष्ट तैनाती-प्रासंगिक परिदृश्यों में विशिष्ट शक्तियों और अप्रत्याशित व्यवहारिक अस्थिरता को प्रदर्शित कर सकते हैं।

Vartan Shadarevian, Kia Ghods, Alex Kenich, Anany Kotawala2026-05-25
💻 computer science

Self-Refining Topology Optimization via an LLM-Based Multi-Agent Framework

यह शोध पत्र TopOptAgents को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो टोपोलॉजी ऑप्टिमाइज़ेशन में डिज़ाइन और निर्णय लेने की दोनों प्रक्रियाओं को स्वचालित करने के लिए LLMs और इटरेटिव सेल्फ-रिफाइनमेंट का लाभ उठाता है, जिससे उन जटिल समस्याओं पर विश्वसनीय अभिसरण (convergence) सक्षम होता है जहाँ एकल मॉडल आमतौर पर विफल हो जाते हैं।

Hyunjee Park, Hayoung Chung2026-05-25
💻 computer science

Arrow-Type Impossibility for Genuinely Modal Judgments

यह शोध पत्र यह प्रदर्शित करता है कि निर्णय एकत्रीकरण (judgment aggregation) में एयरो-प्रकार के असंभवता परिणाम तब भी पुन: प्रकट होते हैं जब उन्हें वास्तविक रूप से मोडल निर्णयों तक सीमित कर दिया जाता है, जो यह सिद्ध करता है कि विशिष्ट मोडल सिमेंटिक संरचनाएं अकेले ही बिना किसी छद्म तथ्यात्मक प्रस्तावों पर निर्भर रहे, तानाशाही के लिए आवश्यक तार्किक अंतर्संबंध उत्पन्न कर सकती हैं।

Yutaka Nagai, Hirotaka Ono2026-05-25
🤖 AI

ARMS: Automatic Reward Shaping for Sparse-Reward Multi-Agent Reinforcement Learning

यह शोध पत्र ARMS का प्रस्ताव करता है, जो मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) के लिए एक स्व-पर्यवेक्षित ढांचा है जो प्रक्षेपवक्र रैंकिंग (trajectory ranking) के माध्यम से विरल पुरस्कारों (sparse rewards) से स्वतः ही सघन पुरस्कार संकेतों (dense reward signals) को उत्पन्न करता है, और साथ ही सशर्त सर्वोत्तम-प्रतिक्रिया तर्क (conditional best-response reasoning) के माध्यम से नैश इक्विलिब्रियम (Nash equilibria) के संरक्षण की सैद्धांतिक गारंटी देता है, जिससे विरल-पुरस्कार वाले वातावरण में नमूनाकरण दक्षता (sampling efficiency) और स्थिरता में सुधार होता है।

Elie Abboud, Oren Gal2026-05-25
💻 computer science

Safety, Liveness, and Fairness in Quantitative Argumentation Dialogues

यह शोध पत्र गतिशील अपडेट वाले भारित ग्राफ़ (weighted graphs) वाले मात्रात्मक तर्क संवादों (quantitative argumentation dialogues) के लिए सुरक्षा (safety), जीवंतता (liveness) और निष्पक्षता (fairness) के गुणों को प्रस्तुत और औपचारिक रूप से विश्लेषित करता है, तथा यह परिभाषित करता है कि ये सामयिक धारणाएँ तर्क की शक्ति की दहलीज (argument strength thresholds) और ग्राफ़ अनुक्रमों में उनके वितरण से किस प्रकार संबंधित हैं।

Arunavo Ganguly, Julian Alfredo Mendez, Timotheus Kampik2026-05-25
🤖 AI

PhotoFlow: Agentic 3D Virtual Photography Missions

यह शोधपत्र PhotoFlow प्रस्तुत करता है, जो एक डायरेक्टर-रिव्यूअर-रिफ्लेक्टर आर्किटेक्चर वाला एक एजेंटिक फ्रेमवर्क है, और VPhotoBench, एक नया बेंचमार्क, ताकि जटिल स्थानिक तर्क (spatial reasoning) को सौंदर्यपूर्ण निर्णय (aesthetic judgment) के साथ प्रभावी ढंग से जोड़कर मौजूदा विधियों से बेहतर प्रदर्शन करते हुए किसी भी 3D दृश्य में भाषा-आधारित वर्चुअल फोटोग्राफी को सक्षम बनाया जा सके।

Jiarui Guo, Haojia Wei, Yiming Zhang, Yifei Liu, Yuning Gong, Hongjie Zhang, Xue Yang, Zhihang Zhong2026-05-25