cs articles | Gist.Science

GS-2M: Material-aware Gaussian Splatting for High-fidelity Mesh Reconstruction

L'article présente GS-2M, un cadre d'optimisation matériellement conscient basé sur le 3D Gaussian Splatting qui permet une reconstruction de maillages haute fidélité, y compris sur des surfaces réfléchissantes, en évitant l'utilisation de composants neuronaux complexes grâce à une nouvelle stratégie de supervision de la rugosité.

Dinh Minh Nguyen, Malte Avenhaus, Thomas Lindemeier2026-03-10💻 cs

Towards Strategic Persuasion with Language Models

Cet article propose un cadre théorique fondé sur la persuasion bayésienne pour évaluer et entraîner des modèles de langage via l'apprentissage par renforcement, démontrant ainsi leur capacité à générer des gains persuasifs significatifs et à adopter des stratégies sophistiquées.

Zirui Cheng, Jiaxuan You2026-03-10💻 cs

SAC-Loco: Safe and Adjustable Compliant Quadrupedal Locomotion

Les auteurs proposent un cadre de locomotion quadrupède sûr et adaptable, baptisé SAC-Loco, qui intègre une politique d'apprentissage par renforcement pour un comportement compliant ajustable sans capteurs de force et un critique de sécurité appris pour coordonner la locomotion fluide et la récupération rapide face aux perturbations externes.

Aoqian Zhang, Zixuan Zhuang, Chunzheng Wang, Shuzhi Sam Ge, Fan Shi, Cheng Xiang2026-03-10💻 cs

Efficient Domain-Adaptive Multi-Task Dense Prediction with Vision Foundation Models

Ce papier présente FAMDA, un cadre d'adaptation de domaine non supervisé qui exploite les modèles de fondation visuels comme enseignants dans une approche d'auto-entraînement pour générer des étiquettes pseudo de haute qualité, permettant ainsi d'entraîner un réseau étudiant unique, léger et performant pour la prédiction dense multi-tâches dans des environnements robotiques contraints.

Beomseok Kang, Niluthpol Chowdhury Mithun, Mikhail Sizintsev, Han-Pang Chiu, Supun Samarasekera2026-03-10💻 cs

QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification

Le papier propose QuantSparse, un cadre unifié combinant quantification et sparsification de l'attention pour compresser efficacement les transformateurs de diffusion vidéo tout en préservant la qualité de génération grâce à des techniques innovantes de distillation et de reparamétrisation.

Weilun Feng, Chuanguang Yang, Haotong Qin, Mingqiang Wu, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Yulun Zhang, Michele Magno, Yongjun Xu2026-03-10💻 cs

Unified Multi-Modal Interactive & Reactive 3D Motion Generation via Rectified Flow

Le papier présente DualFlow, un cadre unifié et efficace basé sur le flux rectifié et l'augmentation par récupération (RAG) pour générer des mouvements 3D réalistes et synchronisés entre deux personnes, conditionnés par divers modalités telles que le texte, la musique et des séquences de mouvement antérieures.

Prerit Gupta, Shourya Verma, Ananth Grama, Aniket Bera2026-03-10💻 cs

ELHPlan: Efficient Long-Horizon Task Planning for Multi-Agent Collaboration

L'article présente ELHPlan, un cadre novateur de planification à long horizon pour la collaboration multi-agents qui utilise des chaînes d'actions liées à des intentions pour équilibrer adaptabilité et efficacité, permettant d'atteindre des taux de réussite comparables aux méthodes de l'état de l'art tout en réduisant la consommation de tokens de 60 à 70 %.

Shaobin Ling, Yun Wang, Chenyou Fan, Tin Lun Lam, Junjie Hu2026-03-10💻 cs

PHASE-Net: Physics-Grounded Harmonic Attention System for Efficient Remote Photoplethysmography Measurement

Le papier présente PHASE-Net, un modèle d'apprentissage profond léger et théoriquement fondé sur les équations de Navier-Stokes pour la mesure non invasive du pouls par rPPG, qui surpasse les méthodes existantes en robustesse et en efficacité grâce à une architecture combinant un échangeur axial à coût nul, un filtre spatial adaptatif et un TCN à portes.

Bo Zhao, Dan Guo, Junzhe Cao, Yong Xu, Bochao Zou, Tao Tan, Yue Sun, Zitong Yu2026-03-10💻 cs

LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology

Ce travail présente LMOD+, une nouvelle base de données et un benchmark multimodaux à grande échelle en ophtalmologie, enrichis par rapport à LMOD, qui intègrent des annotations multi-granulaires pour évaluer les performances et les limites des grands modèles de langage multimodaux dans le diagnostic, le stadification et la détection des biais liés aux maladies oculaires menaçant la vision.

Zhenyue Qin, Yang Liu, Yu Yin, Jinyu Ding, Haoran Zhang, Anran Li, Dylan Campbell, Xuansheng Wu, Ke Zou, Tiarnan D. L. Keenan, Emily Y. Chew, Zhiyong Lu, Yih Chung Tham, Ninghao Liu, Xiuzhen Zhang, Qingyu Chen2026-03-10💻 cs

Demystifying Codensity Monads via Duality

Ce papier propose une approche catégorique unifiée fondée sur la dualité pour simplifier considérablement les preuves des présentations des monades de codensité, en démontrant que la plupart des résultats connus découlent de ce cadre simple et en établissant de nouvelles présentations pour des monades comme celles des filtres et de l'espérance.

Fabian Lenke, Nico Wittrock, Stefan Milius, Henning Urbat2026-03-10💻 cs

Radio-based Multi-Robot Odometry and Relative Localization

Cet article propose un système de localisation relative multi-robots (UGV-UAV) robuste et peu coûteux, combinant des données UWB et radar dans un cadre d'optimisation de graphes de pose, dont le code et les données expérimentales sont publics pour faciliter la reproduction et le benchmarking.

Andrés Martínez-Silva, David Alejo, Luis Merino, Fernando Caballero2026-03-10💻 cs

XPPG-PCA: Reference-free automatic speech severity evaluation with principal components

Ce papier présente XPPG-PCA, une méthode non supervisée et sans référence pour évaluer automatiquement la sévérité des troubles de la parole, qui surpasse ou égale les approches existantes en offrant une solution robuste et généralisable pour un usage clinique.

Bence Mark Halpern, Thomas B. Tienkamp, Teja Rebernik + 5 more2026-03-10💻 cs

Beyond Collision Cones: Dynamic Obstacle Avoidance for Nonholonomic Robots via Dynamic Parabolic Control Barrier Functions

Cet article propose une fonction barrière de contrôle parabolique dynamique (DPCBF) qui, en adaptant sa frontière de sécurité à la distance et à la vitesse relative, surmonte les limitations de conservatisme des méthodes basées sur les cônes de collision pour permettre une navigation sûre et efficace de robots non holonomes dans des environnements dynamiques très encombrés.

Hun Kuk Park, Taekyung Kim, Dimitra Panagou2026-03-10💻 cs

Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!

Le papier présente REVEL, une nouvelle tâche de manipulation vidéo interactive en flux continu permettant de modifier n'importe quel élément à tout moment, et propose DragStream, une méthode sans entraînement qui corrige la dérive latente et les interférences contextuelles pour assurer une génération vidéo fluide et cohérente.

Junbao Zhou, Yuan Zhou, Kesen Zhao, Qingshan Xu, Beier Zhu, Richang Hong, Hanwang Zhang2026-03-10💻 cs

Enhancing Speaker Verification with w2v-BERT 2.0 and Knowledge Distillation guided Structured Pruning

Cet article présente une approche de vérification locuteur de pointe utilisant le modèle w2v-BERT 2.0 avec des adaptateurs de couches et LoRA, qui atteint des performances record tout en réduisant sa taille de 80 % grâce à un élagage structuré guidé par la distillation de connaissances avec une dégradation minimale des performances.

Ze Li, Ming Cheng, Ming Li2026-03-10💻 cs

PAD-TRO: Projection-Augmented Diffusion for Direct Trajectory Optimization

Ce papier présente PAD-TRO, une nouvelle méthode d'optimisation de trajectoire par diffusion qui génère directement des séquences d'états et intègre un mécanisme de projection sans gradient pour garantir la faisabilité dynamique, surpassant ainsi les approches existantes en termes de taux de réussite et d'absence d'erreurs dynamiques dans des scénarios de navigation complexes.

Jushan Chen, Santiago Paternain2026-03-10💻 cs

Membership Inference Attacks on Tokenizers of Large Language Models

Cette étude présente la première analyse des fuites de données par inférence de membres via les tokeniseurs de grands modèles de langage, démontrant leur vulnérabilité et proposant une défense adaptative pour atténuer ce risque de confidentialité négligé.

Meng Tong, Yuntao Du, Kejiang Chen, Weiming Zhang, Ninghui Li2026-03-10💻 cs

Vision-Guided Targeted Grasping and Vibration for Robotic Pollination in Controlled Environments

Cet article présente et valide un cadre robotique guidé par la vision qui intègre la reconstruction 3D, la planification de préhension ciblée et la modélisation vibratoire pour réaliser une pollinisation automatisée précise et sûre dans des environnements agricoles contrôlés.

Jaehwan Jeong, Tuan-Anh Vu, Radha Lahoti, Jiawen Wang, Vivek Alumootil, Sangpil Kim, M. Khalid Jawed2026-03-10💻 cs

Differentiable Variable Fonts

Cet article propose une méthode de « polices de caractères variables différentiables » qui formalise mathématiquement le lien entre les paramètres de police et les graphiques vectoriels pour permettre l'optimisation par gradient et ainsi automatiser la conception et l'animation typographiques tout en préservant la lisibilité et l'esthétique.

Kinjal Parikh, Danny M. Kaufman, David I. W. Levin, Alec Jacobson2026-03-10💻 cs

EB-MBD: Emerging-Barrier Model-Based Diffusion for Safe Trajectory Optimization in Highly Constrained Environments

Cet article propose EB-MBD, une méthode de diffusion basée sur un modèle qui intègre des fonctions barrières émergentes pour optimiser efficacement et sûrement des trajectoires dans des environnements fortement contraints, évitant ainsi la dégradation des performances et les coûts computationnels élevés des méthodes de projection traditionnelles.

Raghav Mishra, Ian R. Manchester2026-03-10💻 cs

← Précédent Suivant →