cs.AI articles | Gist.Science

ConLID: Supervised Contrastive Learning for Low-Resource Language Identification

Le papier propose ConLID, une méthode d'apprentissage contrastif supervisé qui améliore la reconnaissance des langues peu dotées sur des données hors domaine en apprenant des représentations invariantes au domaine, tout en préservant les performances des langues riches.

Negar Foroutan, Jakhongir Saydaliev, Ye Eun Kim, Antoine BosselutWed, 11 Ma🤖 cs.AI

OPENXRD: A Comprehensive Benchmark Framework for LLM/MLLM XRD Question Answering

Le papier présente OPENXRD, un cadre de référence complet évaluant la capacité des modèles de langage à assimiler des connaissances contextuelles pour répondre à des questions en cristallographie, révélant que les modèles de taille moyenne bénéficient le plus de documents experts de haute qualité plutôt que de simples quantités de texte.

Ali Vosoughi, Ayoub Shahnazari, Yufeng Xi, Zeliang Zhang, Griffin Hess, Chenliang Xu, Niaz AbdolrahimWed, 11 Ma🤖 cs.AI

On the mechanical creation of mathematical concepts

Ce papier propose un modèle de résolution de problèmes mathématiques comme une boucle de mise à jour des croyances, distinguant les concepts implicites des concepts explicites dont la création mécanique, absente des systèmes d'IA actuels, est présentée comme l'étape caractéristique de la découverte mathématique.

Asvin GWed, 11 Ma🤖 cs.AI

Latent Policy Steering with Embodiment-Agnostic Pretrained World Models

Cet article présente la Latent Policy Steering (LPS), une méthode qui améliore les politiques robotiques en faible quantité de données en pré-entraînant un modèle du monde avec des flux optiques pour exploiter des données hétérogènes, puis en affinant ce modèle sur des démonstrations cibles pour sélectionner les meilleures actions et surpasser significativement les approches par imitation comportementale.

Yiqi Wang, Mrinal Verghese, Jeff SchneiderWed, 11 Ma🤖 cs.AI

MMGraphRAG: Bridging Vision and Language with Interpretable Multimodal Knowledge Graphs

Le papier présente MMGraphRAG, une méthode innovante qui intègre des graphes de scènes visuels à des graphes de connaissances textuels via une approche de fusion croisée et l'algorithme SpecLink pour surmonter les hallucinations des LLMs et améliorer le raisonnement multimodal.

Xueyao Wan, Hang YuWed, 11 Ma🤖 cs.AI

Debiasing International Attitudes: LLM Agents for Simulating US-China Perception Changes

Cette étude propose un cadre d'agents LLM intégrant des mécanismes de débiaisage, notamment un agent « avocat du diable », pour simuler l'évolution des perceptions américaines envers la Chine de 2005 à 2025 et démontrer que l'analyse critique intermédiaire est plus efficace que le simple déframing des nouvelles pour atténuer les biais et aligner les opinions artificielles sur les tendances cognitives humaines.

Nicholas Sukiennik, Yichuan Xu, Yuqing Kan, Jinghua Piao, Yuwei Yan, Chen Gao, Yong LiWed, 11 Ma🤖 cs.AI

Personalized Feature Translation for Expression Recognition: An Efficient Source-Free Domain Adaptation Method

L'article propose SFDA-PFT, une méthode d'adaptation de domaine sans source légère qui utilise une translation de caractéristiques personnalisée dans l'espace latent pour améliorer la reconnaissance des expressions faciales à partir de données cibles neutres uniquement, sans nécessiter de données sources ni de synthèse d'images.

Masoumeh Sharafi, Soufiane Belharbi, Muhammad Osama Zeeshan, Houssem Ben Salem, Ali Etemad, Alessandro Lameiras Koerich, Marco Pedersoli, Simon Bacon, Eric GrangerWed, 11 Ma🤖 cs.AI

EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering

Ce papier présente EgoCross, un nouveau benchmark conçu pour évaluer la capacité de généralisation des modèles de langage multimodaux au-delà des activités quotidiennes en les confrontant à des domaines complexes et variés tels que la chirurgie, l'industrie, les sports extrêmes et la vision animale.

Yanjun Li, Yuqian Fu, Tianwen Qian, Qi'ao Xu, Silong Dai, Danda Pani Paudel, Luc Van Gool, Xiaoling WangWed, 11 Ma🤖 cs.AI

Singing Syllabi with Virtual Avatars: Enhancing Student Engagement Through AI-Generated Music and Digital Embodiment

Cet article propose une approche novatrice utilisant des avatars virtuels et de la musique générée par l'IA pour transformer les syllabus textuels en présentations audiovisuelles chantées, afin d'améliorer l'engagement, la mémorisation et la compréhension des étudiants.

Xinxing WuWed, 11 Ma🤖 cs.AI

TaoSR1: The Thinking Model for E-commerce Relevance Search

Le papier présente TaoSR1, un cadre innovant permettant le déploiement direct de grands modèles de langage pour la prédiction de pertinence dans le commerce électronique en surmontant les limites des approches traditionnelles grâce à un entraînement en trois étapes intégrant le raisonnement par chaîne de pensée et des techniques d'optimisation avancées.

Chenhe Dong, Shaowei Yao, Pengkun Jiao, Jianhui Yang, Yiming Jin, Zerui Huang, Xiaojiang Zhou, Dan Ou, Haihong Tang, Bo ZhengWed, 11 Ma🤖 cs.AI

Computational Multi-Agents Society Experiments: Social Modeling Framework Based on Generative Agents

Ce papier présente CMASE, un cadre d'expérimentation pour les sociétés multi-agents computationnelles qui intègre des agents génératifs et des méthodes ethnographiques virtuelles pour permettre aux chercheurs de s'immerger dans des environnements sociaux simulés afin d'étudier, d'interpréter et d'intervenir sur des phénomènes sociaux complexes avec une rigueur causale et une précision empirique.

Hanzhong Zhang, Muhua Huang, Jindong WangWed, 11 Ma🤖 cs.AI

VistaWise: Building Cost-Effective Agent with Cross-Modal Knowledge Graph for Minecraft

Le papier présente VistaWise, un cadre d'agent rentable pour Minecraft qui intègre un graphe de connaissances multimodal et un modèle de détection d'objets finetuné pour atteindre des performances de pointe avec seulement quelques centaines d'échantillons d'entraînement au lieu de millions.

Honghao Fu, Junlong Ren, Qi Chai, Deheng Ye, Yujun Cai, Hao WangWed, 11 Ma🤖 cs.AI

Reasoning Efficiently Through Adaptive Chain-of-Thought Compression: A Self-Optimizing Framework

Le papier présente SEER, un cadre auto-optimisant qui améliore l'efficacité et la précision des modèles de langage en adaptant dynamiquement la compression des chaînes de pensée pour réduire les coûts computationnels et les échecs liés à la longueur excessive des raisonnements.

Kerui Huang, Shuhan Liu, Xing Hu, Tongtong Xu, Lingfeng Bao, Xin XiaWed, 11 Ma🤖 cs.AI

VSSFlow: Unifying Video-conditioned Sound and Speech Generation via Joint Learning

Ce papier présente VSSFlow, un cadre unifié basé sur l'appariement de flux et un mécanisme d'agrégation de conditions désengagé qui résout simultanément et avec une performance supérieure les tâches de génération de sons et de parole à partir de vidéos, démontrant ainsi le potentiel des modèles génératifs unifiés.

Xin Cheng, Yuyue Wang, Xihua Wang, Yihan Wu, Kaisi Guan, Yijing Chen, Peng Zhang, Xiaojiang Liu, Meng Cao, Ruihua SongWed, 11 Ma🤖 cs.AI

VoiceBridge: General Speech Restoration with One-step Latent Bridge Models

Ce papier présente VoiceBridge, un modèle de pont latent en une seule étape capable de restaurer efficacement la parole large bande de haute qualité à partir de diverses distorsions grâce à un auto-encodeur variationnel préservant l'énergie, un prior neuronal conjoint et un entraînement unifié transformant le modèle en générateur sans distillation.

Chi Zhang, Kaiwen Zheng, Zehua Chen, Jun ZhuWed, 11 Ma🤖 cs.AI

v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound

Ce papier présente v-HUB, une nouvelle référence pour l'évaluation de la compréhension de l'humour vidéo par les modèles de langage multimodaux, démontrant que l'intégration de l'audio améliore significativement leurs performances face à des défis visuels complexes.

Zhengpeng Shi, Yanpeng Zhao, Jianqun Zhou, Yuxuan Wang, Qinrong Cui, Wei Bi, Songchun Zhu, Bo Zhao, Zilong ZhengWed, 11 Ma🤖 cs.AI

Latent Speech-Text Transformer

Le papier présente le Latent Speech-Text Transformer (LST), une architecture qui améliore l'efficacité computationnelle et les performances des modèles multimodaux en regroupant les tokens de parole en patches latents pour aligner leur granularité avec celle du texte, permettant ainsi des gains significatifs de précision à la fois pour la parole et le texte.

Yen-Ju Lu, Yashesh Gaur, Wei Zhou, Benjamin Muller, Jesus Villalba, Najim Dehak, Luke Zettlemoyer, Gargi Ghosh, Mike Lewis, Srinivasan Iyer, Duc LeWed, 11 Ma🤖 cs.AI

AlphaApollo: A System for Deep Agentic Reasoning

Le papier présente AlphaApollo, un système de raisonnement agentic qui surmonte les limites des modèles de fondation en matière de résolution de problèmes complexes et d'évolution fiable grâce à une orchestration combinant raisonnement multi-tours, apprentissage par renforcement et évolution itérative avec vérification assistée par outils.

Zhanke Zhou, Chentao Cao, Xiao Feng, Xuan Li, Zongze Li, Xiangyu Lu, Jiangchao Yao, Weikai Huang, Tian Cheng, Jianghangfan Zhang, Tangyu Jiang, Linrui Xu, Yiming Zheng, Brando Miranda, Tongliang Liu, Sanmi Koyejo, Masashi Sugiyama, Bo HanWed, 11 Ma🤖 cs.AI

NavSpace: How Navigation Agents Follow Spatial Intelligence Instructions

Ce papier présente NavSpace, une nouvelle norme d'évaluation conçue pour mesurer les capacités de perception et de raisonnement spatial des agents de navigation, ainsi que SNav, un modèle innovant qui surpasse les solutions existantes sur ce benchmark et lors de tests réels.

Haolin Yang, Yuxing Long, Zhuoyuan Yu, Zihan Yang, Minghan Wang, Jiapeng Xu, Yihan Wang, Ziyan Yu, Wenzhe Cai, Lei Kang, Hao DongWed, 11 Ma🤖 cs.AI

RECODE: Reasoning Through Code Generation for Visual Question Answering

Le papier présente RECODE, un cadre agentique qui améliore le raisonnement visuel des modèles multimodaux en transformant l'analyse d'images structurées en une tâche de génération et de vérification itérative de code exécutable, surpassant ainsi les méthodes traditionnelles sur plusieurs benchmarks.

Junhong Shen, Mu Cai, Bo Hu, Ameet Talwalkar, David A Ross, Cordelia Schmid, Alireza FathiWed, 11 Ma🤖 cs.AI

← Précédent Suivant →