cs.AI 편의 논문 | Gist.Science

AI Act Evaluation Benchmark: An Open, Transparent, and Reproducible Evaluation Dataset for NLP and RAG Systems

이 논문은 EU AI 법규 준수를 위한 NLP 및 RAG 시스템 평가를 위해, 도메인 지식과 대규모 언어 모델을 결합하여 위험 분류, 조항 검색, 의무 생성, 질문 답변 작업을 포함한 개방적이고 투명하며 재현 가능한 평가 데이터셋을 구축하고 그 유효성을 입증한 연구입니다.

Athanasios Davvetas, Michael Papademas, Xenia Ziouvelou, Vangelis Karkaletsis2026-03-11🤖 cs.AI

A Guideline-Aware AI Agent for Zero-Shot Target Volume Auto-Delineation

이 논문은 임상 가이드라인을 텍스트로 변환하여 재학습 없이 3 차원 표적 부위를 자동 윤곽화하는 새로운 AI 에이전트 'OncoAgent'를 제안하며, 위암 사례에서 전감시 학습 기반 모델과 유사한 성능과 더 높은 임상적 선호도를 입증했습니다.

Yoon Jo Kim, Wonyoung Cho, Jongmin Lee, Han Joo Chae, Hyunki Park, Sang Hoon Seo, Noh Jae Myung, Kyungmi Yang, Dongryul Oh, Jin Sung Kim2026-03-11🤖 cs.AI

Variational Routing: A Scalable Bayesian Framework for Calibrated Mixture-of-Experts Transformers

이 논문은 베이지안 추론을 MoE 라우팅 단계에만 국한하여 계산 비용을 거의 증가시키지 않으면서도 대규모 베이스 모델의 불확실성 정량화와 안정성을 획기적으로 개선하는 '변분 혼합 전문가 라우팅 (VMoER)' 프레임워크를 제안합니다.

Albus Yizhuo Li, Matthew Wicker2026-03-11🤖 cs.AI

Declarative Scenario-based Testing with RoadLogic

이 논문은 자율주행차의 시나리오 기반 테스트를 위해 선언적 OpenSCENARIO 명세를 실행 가능한 시뮬레이션으로 자동 변환하는 오픈소스 도구 'RoadLogic'을 제안하고, 이를 통해 명세 준수성과 다양한 행동 변형을 효율적으로 검증할 수 있음을 입증합니다.

Ezio Bartocci, Alessio Gambi, Felix Gigler, Cristinel Mateis, Dejan Ničkovic2026-03-11🤖 cs.AI

An Empirical Study and Theoretical Explanation on Task-Level Model-Merging Collapse

이 논문은 모델 병합 시 발생하는 '병합 붕괴' 현상을 규명하고, 기존 연구와 달리 파라미터 공간의 충돌보다 작업 간 표현의 비호환성이 주요 원인임을 실증적으로 입증하며, 정보이론을 통해 이를 설명하는 이론적 틀을 제시합니다.

Yuan Cao, Dezhi Ran, Yuzhe Guo, Mengzhou Wu, Simin Chen, Linyi Li, Wei Yang, Tao Xie2026-03-11🤖 cs.AI

EvoDriveVLA: Evolving Autonomous Driving Vision-Language-Action Model via Collaborative Perception-Planning Distillation

이 논문은 자율주행 비전 - 언어 - 행동 모델의 지각 저하 및 장기 계획 불안정성 문제를 해결하기 위해, 자기 앵커 기반의 시각적 증류와 오라클 가이드 궤적 최적화를 결합한 협업 증류 프레임워크인 EvoDriveVLA 를 제안하여 오픈루프 및 클로즈드루프 평가에서 최첨단 성능을 달성함을 보여줍니다.

Jiajun Cao, Xiaoan Zhang, Xiaobao Wei, Liyuqiu Huang, Wang Zijian, Hanzhen Zhang, Zhengyu Jia, Wei Mao, Hao Wang, Xianming Liu, Shuchang Zhou Liu, Yang Wang, Shanghang Zhang2026-03-11🤖 cs.AI

Telogenesis: Goal Is All U Need

이 논문은 외부 목표 없이도 무지, 놀라움, 경시라는 세 가지 인식적 격차에서 내생적으로 주의를 생성하는 '텔로제네시스' 메커니즘을 제안하여, 고정된 전략보다 우수한 적응적 우선순위를 형성하고 환경의 잠재적 구조를 무감독으로 복원할 수 있음을 입증했습니다.

Zhuoran Deng, Yizhi Zhang, Ziyi Zhang, Wan Shen2026-03-11🤖 cs.AI

GenePlan: Evolving Better Generalized PDDL Plans using Large Language Models

이 논문은 대규모 언어 모델 (LLM) 을 활용한 진화 알고리즘을 통해 PDDL 로 기술된 고전적 계획 작업에 대해 다양한 문제 인스턴스에서 최적의 해결책을 생성하는 일반화된 계획자 'GenePlan'을 제안하며, 기존 최첨단 계획자와 유사한 성능을 보이고 다른 LLM 기반 방법론보다 월등히 우수한 결과를 입증했습니다.

Andrew Murray, Danial Dervovic, Alberto Pozanco, Michael Cashmore2026-03-11🤖 cs.AI

Vibe-Creation: The Epistemology of Human-AI Emergent Cognition

이 논문은 인간과 생성형 AI 의 상호작용이 단순한 도구 사용이나 협력을 넘어 '제 3 의 존재'라는 새로운 인지 - 인식론적 형식을 창출하며, 이를 '분위기 창조 (vibe-creation)'와 '비대칭적 창발' 개념으로 설명하고 교육 및 지적 역량 재정의에 대한 함의를 제시합니다.

Ilya Levin2026-03-11🤖 cs.AI

Temporal-Conditioned Normalizing Flows for Multivariate Time Series Anomaly Detection

이 논문은 이전 관측치에 기반한 조건부 정규화 흐름 (tcNF) 을 제안하여 시계열 데이터의 복잡한 시간적 의존성과 불확실성을 정밀하게 모델링함으로써 기존 방법보다 우수한 정확도와 강건성을 갖춘 다변량 시계열 이상 탐지 프레임워크를 제시합니다.

David Baumgartner, Helge Langseth, Kenth Engø-Monsen, Heri Ramampiaro2026-03-11🤖 cs.AI

Evolving Prompt Adaptation for Vision-Language Models

이 논문은 사전 학습된 비전 - 언어 모델의 지식을 유지하면서 소량의 데이터로 안정적으로 적응할 수 있도록 프롬프트의 진화 경로를 제어하는 새로운 프레임워크인 EvoPrompt 를 제안합니다.

Enming Zhang, Jiayang Li, Yanru Wu, Zhenyu Liu, Yang Li2026-03-11🤖 cs.AI

Efficiently Aligning Draft Models via Parameter- and Data-Efficient Adaptation

이 논문은 타겟 모델의 미세 조정으로 인한 성능 저하를 해결하기 위해 공유 및 비공유 구성 요소를 분리하고, 미세 조정된 타겟 모델을 활용한 데이터 재생성 및 고가치 데이터 선별을 통해 파라미터와 데이터 효율성을 극대화하는 '효율적인 초안 적응 (EDA)' 프레임워크를 제안합니다.

Luxi Lin, Zhihang Lin, Zhanpeng Zeng, Yuhao Chen, Qingyu Zhang, Jixiang Luo, Xuelong Li, Rongrong Ji2026-03-11🤖 cs.AI

Enhancing Debunking Effectiveness through LLM-based Personality Adaptation

이 논문은 빅 5 성격 특성에 기반한 프롬프트를 통해 대형 언어 모델 (LLM) 이 가짜 뉴스에 대한 맞춤형 debunking 메시지를 생성하고, 또 다른 LLM 을 자동 평가자로 활용해 일반적 메시지보다 설득력이 높음을 입증하는 동시에 윤리적 문제도 제기합니다.

Pietro Dell'Oglio, Alessandro Bondielli, Francesco Marcelloni, Lucia C. Passaro2026-03-11🤖 cs.AI

Compiler-First State Space Duality and Portable $O(1)$ Autoregressive Caching for Inference

이 논문은 Mamba-2 의 상태 공간 이중성 알고리즘을 XLA 의 퓨전 및 타일링 최적화에 매핑하여 커스텀 커널 없이 CPU, NVIDIA GPU, Google Cloud TPU 등 다양한 하드웨어에서 $O(1)$ 자동회귀 캐싱을 지원하는 포터블 컴파일러 기반 구현을 제시합니다.

Cosmo Santoni2026-03-11🤖 cs.AI

Routing without Forgetting

이 논문은 온라인 연속 학습 환경에서 반복적인 최적화 없이 단일 단계의 연관성 기반 검색을 통해 동적 프롬프트를 생성함으로써 기존 프롬프트 기반 방법보다 뛰어난 성능을 보이는 '잊지 않는 라우팅 (Routing without Forgetting)'이라는 새로운 트랜스포머 아키텍처를 제안합니다.

Alessio Masano, Giovanni Bellitto, Dipam Goswani, Joost Van de Weijer, Concetto Spampinato2026-03-11🤖 cs.AI

A Variational Latent Equilibrium for Learning in Cortex

이 논문은 에너지 보존과 극값 작용 원리를 기반으로 시간 연속 신경망의 역전파 (BPTT) 를 생물학적으로 타당한 국소적 방식으로 근사하는 새로운 변분 잠재 평형 프레임워크를 제시하여 뇌의 시공간 학습 메커니즘과 물리적 회로 구현을 위한 청사진을 제공합니다.

Simon Brandt, Paul Haider, Walter Senn, Federico Benitez, Mihai A. Petrovici2026-03-11🤖 cs.AI

Context Engineering: From Prompts to Corporate Multi-Agent Architecture

이 논문은 프롬프트 엔지니어링의 한계를 넘어 기업용 다중 에이전트 시스템의 성숙도를 위한 새로운 패러다임으로 '컨텍스트 엔지니어링'을 제안하고, 이를 의도 엔지니어링과 명세 엔지니어링과 함께 에이전트 엔지니어링의 피라미드 성숙도 모델로 정립합니다.

Vera V. Vishnyakova2026-03-11🤖 cs.AI

Grounding Synthetic Data Generation With Vision and Language Models

이 논문은 원격 탐사 분야에서 생성 모델, 시맨틱 분할, 이미지 캡셔닝을 결합하여 해석 가능한 합성 데이터 증강 및 평가를 가능하게 하는 'ARAS400k'라는 대규모 데이터셋과 프레임워크를 제안하며, 이를 통해 합성 데이터와 실데이터를 함께 학습한 모델이 기존 실데이터 기반 모델보다 우수한 성능을 보임을 입증했습니다.

Ümit Mert Ça\u{g}lar, Alptekin Temizel2026-03-11🤖 cs.AI

PRECEPT: Planning Resilience via Experience, Context Engineering & Probing Trajectories A Unified Framework for Test-Time Adaptation with Compositional Rule Learning and Pareto-Guided Prompt Evolution

이 논문은 LLM 에이전트의 지식 검색 저하, 규칙 조합 실패, 그리고 노후화된 지식 탐지 부재 문제를 해결하기 위해, 결정론적 규칙 검색, 충돌 인식 메모리, 그리고 파레토 기반 프롬프트 진화를 통합한 테스트 시간 적응 프레임워크인 PRECEPT 를 제안하고, 이를 통해 기존 방법 대비 우수한 성능과 강건성을 입증합니다.

Arash Shahmansoori2026-03-11🤖 cs.AI

MM-tau-p $^2$ : Persona-Adaptive Prompting for Robust Multi-Modal Agent Evaluation in Dual-Control Settings

이 논문은 GPT-5 와 같은 최첨단 LLM 을 포함한 멀티모달 에이전트의 강건성을 평가하기 위해 사용자 페르소나 적응과 이중 제어 환경을 고려한 12 개의 새로운 지표를 제시하는 'MM-tau-p $^2$ ' 벤치마크를 제안합니다.

Anupam Purwar, Aditya Choudhary2026-03-11🤖 cs.AI

← 이전 다음 →

cs.AI