OrthoAI: A Neurosymbolic Framework for Evidence-Grounded Biomechanical Reasoning in Clear Aligner Orthodontics

Het artikel introduceert OrthoAI, een neurosymbolisch raamwerk dat door middel van segmentatie met schaarse supervisie, kennisgebaseerde constraint-inferentie en een multicriteria-evaluatiemodel de brug slaat tussen 3D-geometrische waarneming en klinisch biomechanisch redeneren voor de automatische ondersteuning van beslissingen bij orthodontie met transparante aligners.

Edouard Lansiaux, Margaux Leman, Mehdi AmmiWed, 11 Ma🤖 cs.AI

DOCFORGE-BENCH: A Comprehensive 0-shot Benchmark for Document Forgery Detection and Analysis

Dit paper introduceert DOCFORGE-BENCH, het eerste zero-shot benchmark voor documentvervalsing, en onthult dat bestaande methoden door een gebrek aan kalibratie en een extreem onevenwichtige verdeling van vervalsde pixels in plaats van door representatiefalen onbetrouwbaar zijn voor praktische toepassing.

Zengqi Zhao, Weidi Xia, En Wei, Yan Zhang, Jane Mo, Tiannan Zhang, Yuanqin Dai, Zexi Chen, Yiran Tao, Simiao RenWed, 11 Ma💻 cs

Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation

Pri4R is een effectieve methode die Vision-Language-Action-modellen een impliciet begrip van werelddynamiek bijbrengt door tijdens het trainen gebruik te maken van bevoorrechte 4D-informatie via een lichtgewicht punt-track-head, wat leidt tot aanzienlijk betere prestaties in complexe manipulatietaken zonder extra rekenlast tijdens het gebruik.

Jisoo Kim, Jungbin Cho, Sanghyeok Chu, Ananya Bal, Jinhyung Kim, Gunhee Lee, Sihaeng Lee, Seung Hwan Kim, Bohyung Han, Hyunmin Lee, Laszlo A. Jeni, Seungryong KimWed, 11 Ma🤖 cs.AI

Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM

Het paper introduceert Granulon, een nieuw multimodaal groot taalmodel dat DINOv3 combineert met een adaptieve multi-granulariteitsarchitectuur om zowel pixel- als grootschalige semantische redenering te verenigen, wat resulteert in een aanzienlijke verbetering van de nauwkeurigheid en een vermindering van hallucinaties.

Junyuan Mao, Qiankun Li, Linghao Meng, Zhicheng He, Xinliang Zhou, Kun Wang, Yang Liu, Yueming JinWed, 11 Ma💻 cs

VisionCreator-R1: A Reflection-Enhanced Native Visual-Generation Agentic Model

Het paper introduceert VisionCreator-R1, een native agent voor visuele creatie met een expliciet reflectiemechanisme en een RPCO-trainingsmethode die, ondanks een asymmetrie in beloningstoewijzing tussen planning en reflectie, betere prestaties behaalt dan Gemini2.5Pro op zowel eendaagse als meerdaagse visuele taken.

Jinxiang Lai, Wenzhe Zhao, Zexin Lu, Hualei Zhang, Qinyu Yang, Rongwei Quan, Zhimin Li, Shuai Shao, Song Guo, Qinglin LuWed, 11 Ma💻 cs

Vision-Language Models Encode Clinical Guidelines for Concept-Based Medical Reasoning

Het paper introduceert MedCBR, een nieuw raamwerk dat conceptbottleneck-modellen combineert met visueel-taalmogelijkheden en klinische richtlijnen om interpreteerbare, op redenering gebaseerde medische diagnoses te genereren die de expertlogica nabootsen.

Mohamed Harmanani, Bining Long, Zhuoxin Guo, Paul F. R. Wilson, Amirhossein Sabour, Minh Nguyen Nhat To, Gabor Fichtinger, Purang Abolmaesumi, Parvin MousaviWed, 11 Ma🤖 cs.LG