cs.AI artículos | Gist.Science

OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning

El artículo presenta OfficeQA Pro, un nuevo benchmark que evalúa la capacidad de razonamiento fundamentado de agentes de IA sobre un corpus masivo y heterogéneo de documentos del Tesoro de EE. UU., revelando que incluso los modelos de vanguardia actuales tienen un rendimiento muy limitado en esta tarea y que la representación estructurada de documentos puede mejorar significativamente sus resultados.

Krista Opsahl-Ong, Arnav Singhvi, Jasmine Collins, Ivan Zhou, Cindy Wang, Ashutosh Baheti, Owen Oertell, Jacob Portes, Sam Havens, Erich Elsen, Michael Bendersky, Matei Zaharia, Xing Chen2026-03-10💬 cs.CL

A New Lower Bound for the Random Offerer Mechanism in Bilateral Trade using AI-Guided Evolutionary Search

Este trabajo emplea el marco de búsqueda evolutiva guiada por IA AlphaEvolve para identificar un nuevo caso límite que establece un límite inferior de 2.0749 en la relación entre el beneficio social óptimo y el obtenido por el mecanismo del oferente aleatorio, superando así las cotas anteriores de 2.02.

Yang Cai, Vineet Gupta, Zun Li, Aranyak Mehta2026-03-10🤖 cs.LG

Benchmarking Language Modeling for Lossless Compression of Full-Fidelity Audio

El artículo presenta Trilobyte, un esquema de tokenización a nivel de byte que hace viable la compresión sin pérdidas de audio de 24 bits mediante modelos de lenguaje autoregresivos, demostrando que, aunque superan a FLAC en audio de 8 y 16 bits, sus ventajas de compresión se vuelven más modestas a medida que aumenta la profundidad de bits.

Phillip Long, Zachary Novack, Chris Donahue2026-03-10🤖 cs.LG

Split Federated Learning Architectures for High-Accuracy and Low-Delay Model Training

Este trabajo propone un algoritmo heurístico de optimización conjunta para arquitecturas de Aprendizaje Federado Dividido Jerárquico que, al considerar explícitamente las capas de particionamiento y la asignación de clientes, logra mejorar la precisión del modelo en un 3% y reducir la latencia y la sobrecarga de comunicación en un 20% y 50% respectivamente en comparación con los métodos actuales.

Yiannis Papageorgiou, Yannis Thomas, Ramin Khalili, Iordanis Koutsopoulos2026-03-10🤖 cs.LG

Agentic Critical Training

El artículo presenta la Entrenamiento Crítico Agente (ACT), un paradigma de aprendizaje por refuerzo que supera las limitaciones del aprendizaje por imitación al entrenar a los agentes para que desarrollen un razonamiento autónomo sobre la calidad de sus acciones mediante la comparación de alternativas, logrando así mejoras significativas en el rendimiento y la generalización en diversas tareas de agentes.

Weize Liu, Minghui Liu, Sy-Tuyen Ho, Souradip Chakraborty, Xiyao Wang, Furong Huang2026-03-10🤖 cs.LG

A Cognitive Explainer for Fetal ultrasound images classifier Based on Medical Concepts

Este trabajo propone un marco interpretable basado en conceptos médicos clave y una red neuronal convolutiva de grafos (GCN) para explicar las decisiones de clasificación de imágenes de ultrasonido fetal desde la perspectiva de la cognición clínica, abordando así la falta de transparencia de los modelos de aprendizaje profundo tradicionales.

Yingni Wanga, Yunxiao Liua, Licong Dongc, Xuzhou Wua, Huabin Zhangb, Qiongyu Yed, Desheng Sunc, Xiaobo Zhoue, Kehong Yuan2026-03-09🤖 cs.AI

Mean-based incomplete pairwise comparisons method with the reference values

Este artículo propone dos métodos cuantitativos basados en valores de referencia para calcular vectores de peso a partir de matrices incompletas de comparaciones por pares, demostrando la optimalidad y existencia de soluciones para sus variantes geométrica y aritmética.

Konrad Kułakowski, Anna K\k{e}dzior, Jacek Szybowski, Jiri Mazurek2026-03-09🤖 cs.AI

The Generative AI Paradox on Evaluation: What It Can Solve, It May Not Evaluate

Este estudio demuestra que los modelos de lenguaje grandes, aunque expertos en tareas de generación, presentan un rendimiento significativamente inferior y a veces poco fiable en tareas de evaluación, revelando una paradoja que cuestiona la confianza en su capacidad para juzgar sus propias respuestas.

Juhyun Oh, Eunsu Kim, Inha Cha, Alice Oh2026-03-09💻 cs

RAG-Driver: Generalisable Driving Explanations with Retrieval-Augmented In-Context Learning in Multi-Modal Large Language Model

El artículo presenta RAG-Driver, un modelo de lenguaje grande multimodal mejorado con recuperación aumentada y aprendizaje en contexto que logra explicaciones de conducción generalizables y de vanguardia sin necesidad de reentrenamiento, abordando así los desafíos de escasez de datos y adaptación a nuevos entornos.

Jianhao Yuan, Shuyang Sun, Daniel Omeiza, Bo Zhao, Paul Newman, Lars Kunze, Matthew Gadd2026-03-09🤖 cs.AI

Estimation of Energy-dissipation Lower-bounds for Neuromorphic Learning-in-memory

Este artículo deriva estimaciones teóricas del límite inferior de energía por solución para optimizadores neuromórficos de aprendizaje en memoria, basadas en la termodinámica fuera del equilibrio y aplicables a cargas de trabajo de IA a gran escala.

Zihao Chen, Faiek Ahsan, Johannes Leugering, Gert Cauwenberghs, Shantanu Chakrabartty2026-03-09🤖 cs.AI

Make VLM Recognize Visual Hallucination on Cartoon Character Image with Pose Information

Este artículo propone un sistema de detección de alucinaciones visuales en imágenes de personajes de dibujos animados que utiliza modelos de lenguaje-visión con aprendizaje en contexto y guías de pose, logrando mejoras significativas en la precisión respecto a los métodos basados únicamente en imágenes RGB.

Bumsoo Kim, Wonseop Shin, Kyuchul Lee, Yonghoon Jung, Sanghyun Seo2026-03-09🤖 cs.AI

Algorithmic Collusion by Large Language Models

El estudio demuestra que los agentes de fijación de precios basados en modelos de lenguaje grande (LLM) alcanzan autónomamente precios y beneficios supracompetitivos en entornos de oligopolio, donde variaciones mínimas en las instrucciones (prompts) influyen significativamente en estos resultados y plantean desafíos únicos para la futura regulación.

Sara Fish, Yannai A. Gonczarowski, Ran I. Shorrer2026-03-09🤖 cs.AI

Computational lexical analysis of Flamenco genres

Este trabajo presenta un análisis computacional de más de 2000 letras de flamenco mediante procesamiento de lenguaje natural y aprendizaje automático para clasificar los géneros (*palos*), identificar sus campos semánticos característicos y revelar sus relaciones históricas y evolutivas a través de un análisis de redes.

Pablo Rosillo-Rodes, Maxi San Miguel, David Sanchez2026-03-09💬 cs.CL

Combining X-Vectors and Bayesian Batch Active Learning: Two-Stage Active Learning Pipeline for Speech Recognition

Este artículo presenta una novedosa pipeline de aprendizaje activo en dos etapas para el reconocimiento automático del habla que combina la selección de muestras diversas mediante agrupamiento de x-vectores y la identificación de muestras informativas con un método bayesiano adaptado, logrando así un entrenamiento de modelos más eficiente con menos datos etiquetados.

Ognjen Kundacina, Vladimir Vincan, Dragisa Miskovic2026-03-09⚡ eess

My part is bigger than yours -- assessment within a group of peers

Este artículo presenta modelos simples para agregar las opiniones de expertos sobre la distribución de contribuciones en proyectos colaborativos, asignando un mayor peso a las valoraciones de quienes tienen una contribución más significativa con el fin de alcanzar un consenso entre pares.

Konrad Kułakowski, Jacek Szybowski2026-03-09🤖 cs.AI

Predictive Coding Networks and Inference Learning: Tutorial and Survey

Este trabajo ofrece una revisión exhaustiva y una especificación formal de las redes de codificación predictiva, situándolas como un marco versátil y biológicamente plausible dentro de la inteligencia artificial moderna que supera las limitaciones de la retropropagación tradicional.

Björn van Zwol, Ro Jefferson, Egon L. van den Broek2026-03-09🤖 cs.AI

Transforming Agency. On the mode of existence of Large Language Models

El artículo concluye que los Modelos de Lenguaje Grande (LLM) carecen de agencia autónoma al no cumplir con las condiciones de individualidad, normatividad y asimetría interaccional, por lo que deben caracterizarse como interlocutores o autómatas lingüísticos que, a través de una "encarnación" textual y computacional, transforman la agencia humana generando formas híbridas de agencia intencional en lugar de meras herramientas extendidas.

Xabier E. Barandiaran, Lola S. Almendros2026-03-09🤖 cs.AI

FALCON: Future-Aware Learning with Contextual Object-Centric Pretraining for UAV Action Recognition

El artículo presenta FALCON, un enfoque de preentrenamiento auto-supervisado unificado para el reconocimiento de acciones en videos de UAV que aborda el desequilibrio espacial mediante la integración de enmascaramiento consciente de objetos y reconstrucción futura dual, logrando mejoras significativas en precisión y velocidad de inferencia en comparación con métodos supervisados.

Ruiqi Xian, Xiyang Wu, Tianrui Guan, Xijun Wang, Boqing Gong, Dinesh Manocha2026-03-09🤖 cs.AI

UniHR: Hierarchical Representation Learning for Unified Knowledge Graph Link Prediction

El artículo presenta UniHR, un marco de aprendizaje de representaciones jerárquicas unificadas que integra datos hiperrelacionales, temporales y anidados en representaciones basadas en tripletes mediante módulos de representación de datos y aprendizaje estructural jerárquico, demostrando su eficacia en la predicción de enlaces a través de diversos tipos de grafos de conocimiento.

Zhiqiang Liu, Yin Hua, Mingyang Chen + 4 more2026-03-09💬 cs.CL

SpecFuse: Ensembling Large Language Models via Next-Segment Prediction

El artículo presenta SpecFuse, un marco de ensamblaje de modelos de lenguaje grande (LLM) libre de entrenamiento que mejora el rendimiento mediante la predicción de segmentos siguientes para la colaboración semántica y un mecanismo de retroalimentación en línea que ajusta dinámicamente los pesos de votación de cada modelo según su desempeño.

Bo Lv, Nayu Liu, Chen Tang, Xin Liu, Yue Yu, Ping Luo2026-03-09🤖 cs.AI

← Anterior Siguiente →