cs.AI artículos | Gist.Science

Automating Detection and Root-Cause Analysis of Flaky Tests in Quantum Software

Este artículo presenta una pipeline automatizada que utiliza modelos de lenguaje grande (LLMs) para detectar y analizar las causas raíz de las pruebas inestables en software cuántico, logrando identificar 25 casos nuevos y alcanzar un alto rendimiento en la clasificación de estos errores.

Janakan Sivaloganathan, Ainaz Jamshidi, Andriy Miranskyy, Lei ZhangWed, 11 Ma🤖 cs.AI

PlayWorld: Learning Robot World Models from Autonomous Play

El artículo presenta PlayWorld, un sistema escalable y autónomo que entrena simuladores de video de alta fidelidad mediante el juego independiente de robots no supervisado, logrando predicciones físicamente consistentes de interacciones complejas y mejorando significativamente el rendimiento de las políticas de aprendizaje por refuerzo en el mundo real en comparación con los datos recopilados por humanos.

Tenny Yin, Zhiting Mei, Zhonghe Zheng, Miyu Yamane, David Wang, Jade Sceats, Samuel M. Bateman, Lihan Zha, Apurva Badithela, Ola Shorinwa, Anirudha MajumdarWed, 11 Ma🤖 cs.AI

WS-Net: Weak-Signal Representation Learning and Gated Abundance Reconstruction for Hyperspectral Unmixing via State-Space and Weak Signal Attention Fusion

El artículo presenta WS-Net, un marco de desmezcla hiperespectral basado en aprendizaje profundo que combina modelado de espacio de estados y atención a señales débiles para mejorar significativamente la estimación de abundancia de endmemberes de baja intensidad en condiciones de ruido y señales dominantes.

Zekun Long, Ali Zia, Guanyiman Fu, Vivien Rolland, Jun ZhouWed, 11 Ma🤖 cs.AI

Time, Identity and Consciousness in Language Model Agents

Este artículo presenta un kit de herramientas conservador para evaluar la identidad en agentes de modelos de lenguaje, utilizando la Teoría de la Pila para distinguir entre la coherencia verbal y la organización estructural real mediante el cálculo de puntuaciones de persistencia derivadas de trazas instrumentadas.

Elija Perrier, Michael Timothy BennettWed, 11 Ma🤖 cs.AI

EPOCH: An Agentic Protocol for Multi-Round System Optimization

El artículo presenta EPOCH, un protocolo de ingeniería que estandariza la optimización autónoma de sistemas mediante un enfoque de dos fases y etapas restringidas por roles para garantizar la estabilidad, reproducibilidad y trazabilidad en entornos heterogéneos.

Zhanlin Liu, Yitao Li, Munirathnam SrikanthWed, 11 Ma🤖 cs.AI

From Days to Minutes: An Autonomous AI Agent Achieves Reliable Clinical Triage in Remote Patient Monitoring

El artículo presenta a Sentinel, un agente de IA autónomo que supera a los clínicos individuales en la sensibilidad para detectar emergencias y priorizar alertas en la monitorización remota de pacientes, ofreciendo una solución escalable y de bajo costo que resuelve el problema de la sobrecarga de datos que limitó los ensayos clínicos anteriores.

Sim2Act: Robust Simulation-to-Decision Learning via Adversarial Calibration and Group-Relative Perturbation

El artículo presenta Sim2Act, un marco robusto de aprendizaje de simulación a decisión que mejora la fiabilidad de las políticas en entornos críticos mediante un mecanismo de calibración adversarial y una estrategia de perturbación relativa a grupos para mitigar los errores de simulación sin sacrificar acciones de alto riesgo y recompensa.

Hongyu Cao, Jinghan Zhang, Kunpeng Liu, Dongjie Wang, Feng Xia, Haifeng Chen, Xiaohua Hu, Yanjie FuWed, 11 Ma🤖 cs.AI

A Text-Native Interface for Generative Video Authoring

Este trabajo presenta Doki, una interfaz nativa de texto para la creación de videos generativos que permite a los usuarios definir activos, estructurar escenas y editar contenido mediante escritura libre, facilitando así la narración visual sin necesidad de herramientas especializadas.

Xingyu Bruce Liu, Mira Dontcheva, Dingzeyu LiWed, 11 Ma🤖 cs.AI

GST-VLA: Structured Gaussian Spatial Tokens for 3D Depth-Aware Vision-Language-Action Models

El artículo presenta GST-VLA, un modelo de visión-lenguaje-acción que mejora la percepción geométrica y el razonamiento espacial mediante un tokenizador de Gaussiana 3D y un proceso de pensamiento encadenado consciente de la profundidad, logrando un rendimiento superior en tareas de manipulación robótica.

Md Selim Sarowar, Omer Tariq, Sungho KimWed, 11 Ma🤖 cs.AI

Not All News Is Equal: Topic- and Event-Conditional Sentiment from Finetuned LLMs for Aluminum Price Forecasting

Este estudio demuestra que integrar puntuaciones de sentimiento derivadas de noticias en inglés y chino mediante un modelo LLM Qwen3 finetuneado mejora significativamente la precisión de las predicciones de precios del aluminio y la utilidad económica en mercados volátiles en comparación con los modelos tradicionales que solo utilizan datos tabulares.

Alvaro Paredes Amorin, Andre Python, Christoph WeisserWed, 11 Ma🤖 cs.AI

Latent World Models for Automated Driving: A Unified Taxonomy, Evaluation Framework, and Open Challenges

Este artículo propone un marco unificado y una taxonomía para los modelos de mundo latentes en la conducción automatizada que organizan las representaciones latentes y los mecanismos internos, estableciendo directrices de evaluación y desafíos de investigación para lograr sistemas más robustos, generalizables y eficientes.

Rongxiang Zeng, Yongqi DongWed, 11 Ma🤖 cs.AI

Composed Vision-Language Retrieval for Skin Cancer Case Search via Joint Alignment of Global and Local Representations

Este artículo presenta un marco basado en transformadores para la recuperación de casos de cáncer de piel mediante consultas compuestas de imagen y texto, que logra mejoras sobre el estado del arte al alinear jerárquicamente representaciones globales y locales mediante un mecanismo de atención espacial y un ponderamiento convexo informado clínicamente.

Yuheng Wang, Yuji Lin, Dongrun Zhu, Jiayue Cai, Sunil Kalia, Harvey Lui, Chunqi Chang, Z. Jane Wang, Tim K. LeeWed, 11 Ma🤖 cs.AI

VIVID-Med: LLM-Supervised Structured Pretraining for Deployable Medical ViTs

El artículo presenta VIVID-Med, un marco innovador que utiliza un modelo de lenguaje grande (LLM) congelado como maestro semántico estructurado para preentrenar transformadores de visión (ViT) médicos, logrando un rendimiento superior en diversas tareas de análisis de imágenes médicas con una fracción de los datos necesarios y eliminando la necesidad de depender del LLM en la fase de despliegue.

Xiyao Wang, Xiaoyu Tan, Yang Dai, Yuxuan Fu, Shuo Li, Xihe QiuWed, 11 Ma🤖 cs.AI

PM-Nav: Priori-Map Guided Embodied Navigation in Functional Buildings

El artículo presenta PM-Nav, un marco de navegación guiado por mapas previos que transforma entornos en mapas semánticos y utiliza un razonamiento jerárquico para superar los desafíos de navegación en edificios funcionales, logrando mejoras significativas en comparación con métodos existentes tanto en simulación como en el mundo real.

Jiang Gao, Xiangyu Dong, Haozhou Li, Haoran Zhao, Yaoming Zhou, Xiaoguang MaWed, 11 Ma🤖 cs.AI

DexHiL: A Human-in-the-Loop Framework for Vision-Language-Action Model Post-Training in Dexterous Manipulation

El artículo presenta DexHiL, un marco innovador de aprendizaje con intervención humana que integra el control del brazo y la mano para el post-entrenamiento de modelos Visión-Lenguaje-Acción, logrando una mejora significativa del 25% en las tasas de éxito de manipulación diestra en comparación con métodos de ajuste fino tradicionales.

Yifan Han, Zhongxi Chen, Yuxuan Zhao, Congsheng Xu, Yanming Shao, Yichuan Peng, Yao Mu, Wenzhao LianWed, 11 Ma🤖 cs.AI

QUSR: Quality-Aware and Uncertainty-Guided Image Super-Resolution Diffusion Model

El modelo QUSR aborda la super-resolución de imágenes en escenarios reales mediante la integración de un prior de calidad basado en modelos de lenguaje multimodal y una generación de ruido guiada por la incertidumbre que adapta la perturbación para preservar detalles y minimizar artefactos.

Junjie Yin, Jiaju Li, Hanfa XingWed, 11 Ma🤖 cs.AI

Chaotic Dynamics in Multi-LLM Deliberation

El estudio demuestra que los sistemas de deliberación multi-LLM exhiben inestabilidad caótica y sensibilidad a las condiciones iniciales incluso en configuraciones deterministas, identificando la diferenciación de roles y la heterogeneidad de modelos como causas principales de divergencia y subrayando la necesidad de auditorías de estabilidad en el diseño de estos sistemas.

Hajime Shimao, Warut Khern-am-nuai, Sung Joo KimWed, 11 Ma🤖 cs.AI

Causally Sufficient and Necessary Feature Expansion for Class-Incremental Learning

Este artículo propone un método de regularización basado en la Probabilidad de Necesidad y Suficiencia (PNS) para el aprendizaje incremental de clases, que utiliza un generador contrafactual dual para eliminar correlaciones espurias intra e inter-tarea y así mitigar la colisión de características y el olvido catastrófico.

Zhen Zhang, Jielei Chu, Tianrui LiWed, 11 Ma🤖 cs.AI

Deep Tabular Research via Continual Experience-Driven Execution

Este artículo presenta un marco de agente novedoso para la Investigación Tabular Profunda (DTR) que aborda el razonamiento complejo en tablas no estructuradas mediante un proceso de toma de decisiones en bucle cerrado, el cual utiliza un grafo meta jerárquico, una política de selección consciente de expectativas y una memoria siamesa de ejecución continua para separar la planificación estratégica de la ejecución de bajo nivel.

Junnan Dong, Chuang Zhou, Zheng Yuan, Yifei Yu, Siyu An, Di Yin, Xing Sun, Feiyue HuangWed, 11 Ma🤖 cs.AI

DataFactory: Collaborative Multi-Agent Framework for Advanced Table Question Answering

El artículo presenta DataFactory, un marco colaborativo de múltiples agentes que supera las limitaciones de los modelos de lenguaje actuales en la respuesta a preguntas sobre tablas mediante la orquestación de equipos especializados, la transformación automática de datos a grafos de conocimiento y estrategias de ingeniería de contexto, logrando mejoras significativas en precisión y robustez en diversos conjuntos de datos.

Tong Wang, Chi Jin, Yongkang Chen, Huan Deng, Xiaohui Kuang, Gang ZhaoWed, 11 Ma🤖 cs.AI

← Anterior Siguiente →