cs.AI artigos | Gist.Science

Logos: An evolvable reasoning engine for rational molecular design

O artigo apresenta o Logos, um modelo de raciocínio molecular compacto que integra raciocínio lógico multietapa com consistência química estrita, alcançando alta precisão e validade em tarefas de design molecular enquanto oferece transparência interpretável superior a modelos de linguagem maiores.

Haibin Wen, Zhe Zhao, Fanfu Wang, Tianyi Xu, Hao Zhang, Chao Yang, Ye WeiWed, 11 Ma🤖 cs.AI

DendroNN: Dendrocentric Neural Networks for Energy-Efficient Classification of Event-Based Data

O artigo apresenta o DendroNN, uma rede neural centrada em dendritos que utiliza um mecanismo de detecção de sequências de pulsos e uma fase de reconfiguração sem gradientes para classificar dados baseados em eventos com alta eficiência energética, superando hardware neuromórfico atual em até quatro vezes na mesma tarefa de classificação de áudio.

Jann Krausse, Zhe Su, Kyrus Mama, Maryada, Klaus Knobloch, Giacomo Indiveri, Jürgen BeckerWed, 11 Ma🤖 cs.AI

DenoiseSplat: Feed-Forward Gaussian Splatting for Noisy 3D Scene Reconstruction

O artigo apresenta o DenoiseSplat, um método feed-forward de Gaussian Splatting que supera os limites de ruído em reconstrução 3D, utilizando um benchmark de grande escala e treinamento supervisionado apenas por renderizações 2D limpas para gerar cenas robustas a partir de imagens multiview ruidosas.

Fuzhen Jiang, Zhuoran Li, Yinlin ZhangWed, 11 Ma🤖 cs.AI

Rescaling Confidence: What Scale Design Reveals About LLM Metacognition

Este artigo demonstra que o design da escala de confiança verbalizada em LLMs não é neutro, revelando que escalas de 0 a 20 melhoram a eficiência metacognitiva em comparação com o padrão de 0 a 100, enquanto a preferência por números redondos e a compressão de limites degradam a qualidade da incerteza expressa.

Yuyang DaiWed, 11 Ma🤖 cs.AI

Curveball Steering: The Right Direction To Steer Isn't Always Linear

O artigo propõe o "Curveball steering", um método de direcionamento não linear baseado em kernel PCA que supera as abordagens lineares tradicionais ao respeitar a geometria intrínseca e distorcida dos espaços de ativação de modelos de linguagem grandes.

Shivam Raval, Hae Jin Song, Linlin Wu, Abir Harrasse, Jeff Phillips, Amirali AbdullahWed, 11 Ma🤖 cs.AI

CLoE: Expert Consistency Learning for Missing Modality Segmentation

O artigo apresenta o CLoE, um framework de aprendizado de consistência que utiliza objetivos de consistência global e regional entre especialistas para melhorar a segmentação de imagens médicas multimodais na presença de modalidades faltantes, garantindo robustez e precisão em estruturas críticas.

Xinyu Tong, Meihua Zhou, Bowu Fan, Haitao LiWed, 11 Ma🤖 cs.AI

SpaceSense-Bench: A Large-Scale Multi-Modal Benchmark for Spacecraft Perception and Pose Estimation

O artigo apresenta o SpaceSense-Bench, um benchmark de grande escala e multimodal gerado em simulação de alta fidelidade que oferece dados sincronizados de RGB, profundidade e LiDAR com anotações densas para superar as limitações de dados reais e impulsionar a pesquisa em percepção e estimativa de pose de espaçonaves.

Aodi Wu, Jianhong Zuo, Zeyuan Zhao, Xubo Luo, Ruisuo Wang, Xue WanWed, 11 Ma🤖 cs.AI

Reading the Mood Behind Words: Integrating Prosody-Derived Emotional Context into Socially Responsive VR Agents

O artigo propõe e valida um pipeline de interação para agentes conversacionais em realidade virtual que integra o reconhecimento de emoções vocais ao contexto do diálogo, demonstrando através de um estudo com 30 participantes que essa abordagem melhora significativamente a naturalidade, o engajamento e a preferência dos usuários em comparação com sistemas baseados apenas em texto.

SangYeop Jeong, Yeongseo Na, Seung Gyu Jeong, Jin-Woo Jeong, Seong-Eun KimWed, 11 Ma🤖 cs.AI

TimberAgent: Gram-Guided Retrieval for Executable Music Effect Control

O artigo apresenta o TimberAgent, um sistema de controle de efeitos de áudio baseado em recuperação orientada por gramas (TRR) que utiliza matrizes de Gram de ativações do Wav2Vec2 para mapear com precisão a intenção semântica do usuário para configurações editáveis de plugins, superando métodos existentes em benchmarks de efeitos de guitarra e validado por estudos perceptivos.

Shihao He, Yihan Xia, Fang Liu, Taotao Wang, Shengli ZhangWed, 11 Ma🤖 cs.AI

Beyond Scaling: Assessing Strategic Reasoning and Rapid Decision-Making Capability of LLMs in Zero-sum Environments

Este artigo apresenta o benchmark STAR, um novo framework de avaliação multiagente que demonstra que a inteligência estratégica de Grandes Modelos de Linguagem em ambientes competitivos e dinâmicos depende não apenas da profundidade do raciocínio, mas também da capacidade de traduzir planos em ações rápidas, revelando uma lacuna significativa entre modelos de raciocínio profundo e modelos otimizados para velocidade em cenários de tempo real.

Yang Li, Xing Chen, Yutao Liu, Gege Qi, Yanxian BI, Zizhe Wang, Yunjian Zhang, Yao ZhuWed, 11 Ma🤖 cs.AI

TaSR-RAG: Taxonomy-guided Structured Reasoning for Retrieval-Augmented Generation

O artigo apresenta o TaSR-RAG, um framework de raciocínio estruturado guiado por taxonomia que melhora a precisão e a atribuição de evidências em sistemas de Geração Aumentada por Recuperação (RAG) ao decompor consultas complexas em sub-consultas de triplos relacionais e realizar seleção de evidências passo a passo sem a necessidade de construção de grafos dispendiosa.

Jiashuo Sun, Yixuan Xie, Jimeng Shi, Shaowen Wang, Jiawei HanWed, 11 Ma🤖 cs.AI

Robust Regularized Policy Iteration under Transition Uncertainty

O artigo apresenta a Robust Regularized Policy Iteration (RRPI), um novo método de aprendizado por reforço offline que formula a otimização da política como um problema robusto sob incerteza de transição, substituindo um objetivo bilevel intratável por um surrogate regularizado por KL para garantir convergência e desempenho superior em benchmarks como o D4RL.

Hongqiang Lin, Zhenghui Fu, Weihao Tang, Pengfei Wang, Yiding Sun, Qixian Huang, Dongxu ZhangWed, 11 Ma🤖 cs.AI

TA-GGAD: Testing-time Adaptive Graph Model for Generalist Graph Anomaly Detection

O artigo TA-GGAD propõe um modelo de grafos adaptativo que supera o problema de "Desassortatividade de Anomalias" para alcançar detecção generalista de anomalias em múltiplos domínios com uma única fase de treinamento, atingindo desempenho state-of-the-art em diversos grafos reais.

Xiong Zhang, Hong Peng, Changlong Fu, Xin Jin, Yun Yang, Cheng XieWed, 11 Ma🤖 cs.AI

Democratising Clinical AI through Dataset Condensation for Classical Clinical Models

Este artigo propõe um framework de otimização de ordem zero com privacidade diferencial que estende a condensação de dados para modelos clínicos não diferenciáveis, permitindo a criação de conjuntos de dados sintéticos compactos que preservam a utilidade preditiva e garantem a segurança das informações dos pacientes para compartilhamento democrático.

Anshul Thakur, Soheila Molaei, Pafue Christy Nganjimi, Joshua Fieggen, Andrew A. S. Soltan, Danielle Belgrave, Lei Clifton, David A. CliftonWed, 11 Ma🤖 cs.AI

M3GCLR: Multi-View Mini-Max Infinite Skeleton-Data Game Contrastive Learning For Skeleton-Based Action Recognition

O artigo propõe o M3GCLR, um framework de aprendizado contrastivo baseado em teoria dos jogos que utiliza um modelo de jogo infinito de dados esqueléticos e otimização mini-max para superar limitações existentes na reconhecimento de ações baseado em esqueleto, alcançando desempenho superior a métodos atuais em conjuntos de dados padrão.

Yanshan Li, Ke Ma, Miaomiao Wei, Linhui DaiWed, 11 Ma🤖 cs.AI

MIL-PF: Multiple Instance Learning on Precomputed Features for Mammography Classification

O artigo propõe o MIL-PF, um framework escalável que combina codificadores de modelos fundamentais congelados com uma cabeça de Aprendizado de Múltiplas Instâncias leve para classificação de mamografias, alcançando desempenho de ponta com redução significativa na complexidade de treinamento ao lidar com imagens de alta resolução e anotações limitadas.

Nikola Jovišic, Milica Škipina, Nicola Dall'Asen, Dubravko CulibrkWed, 11 Ma🤖 cs.AI

SPAARS: Safer RL Policy Alignment through Abstract Exploration and Refined Exploitation of Action Space

O artigo apresenta o SPAARS, um framework de aprendizado por reforço offline-to-online que utiliza uma exploração curricular segura no espaço latente para superar as limitações de desempenho dos métodos baseados em CVAE, transferindo o controle para o espaço de ações bruto e alcançando maior eficiência de amostragem e retornos superiores em tarefas de robótica.

Swaminathan S K, Aritra HazraWed, 11 Ma🤖 cs.AI

Physics-Informed Neural Engine Sound Modeling with Differentiable Pulse-Train Synthesis

O artigo apresenta o modelo Pulse-Train-Resonator (PTR), uma arquitetura de síntese diferenciável baseada em física que gera sons de motor simulando diretamente pulsos de pressão e ressonâncias acústicas, superando modelos de base harmônica com maior precisão e parâmetros interpretáveis.

Robin Doerfler, Lonce WyseWed, 11 Ma🤖 cs.AI

ICDAR 2025 Competition on End-to-End Document Image Machine Translation Towards Complex Layouts

Este relatório apresenta o desafio ICDAR 2025 sobre Tradução de Imagem de Documento de Ponta a Ponta, que envolveu 69 equipes na tradução de textos em documentos com layouts complexos através de duas trilhas (com e sem OCR), demonstrando que abordagens com grandes modelos estabelecem um novo paradigma promissor para essa tarefa.

Yaping Zhang, Yupu Liang, Zhiyang Zhang, Zhiyuan Chen, Lu Xiang, Yang Zhao, Yu Zhou, Chengqing ZongWed, 11 Ma🤖 cs.AI

Reviving ConvNeXt for Efficient Convolutional Diffusion Models

O artigo apresenta o FCDM, um modelo de difusão totalmente convolucional baseado no ConvNeXt que, ao utilizar apenas 50% dos FLOPs do DiT-XL/2, alcança desempenho competitivo com significativamente menos etapas de treinamento e maior eficiência, demonstrando que arquiteturas convolucionais modernas são uma alternativa viável e eficiente para a geração de imagens.

Taesung Kwon, Lorenzo Bianchi, Lennart Wittke, Felix Watine, Fabio Carrara, Jong Chul Ye, Romann Weber, Vinicius AzevedoWed, 11 Ma🤖 cs.AI

← Anterior Próximo →