cs.CV Arbeiten | Gist.Science

ArtLLM: Generating Articulated Assets via 3D LLM

Der Artikel stellt ArtLLM vor, ein neuartiges Framework, das mithilfe eines 3D-multimodalen Large Language Models direkt aus vollständigen 3D-Meshes hochqualitative, artikulierte Assets mit variabler Teil- und Gelenkstruktur generiert und dabei bestehende Methoden in Bezug auf Genauigkeit und Generalisierungsfähigkeit deutlich übertrifft.

Penghao Wang, Siyuan Xie, Hongyu Yan + 4 more2026-03-03💻 cs

TC-SSA: Token Compression via Semantic Slot Aggregation for Gigapixel Pathology Reasoning

Die Arbeit stellt TC-SSA vor, einen lernbaren Token-Kompressionsansatz mittels semantischer Slot-Aggregation, der die rechenintensive Verarbeitung gigapixelgroßer Pathologiebilder effizient löst, indem diagnostisch relevante Informationen in einer stark reduzierten Token-Anzahl zusammengefasst werden, ohne dabei die diagnostische Genauigkeit zu beeinträchtigen.

Zhuo Chen, Shawn Young, Lijian Xu2026-03-03🤖 cs.AI

ConVibNet: Needle Detection during Continuous Insertion via Frequency-Inspired Features

Die Studie stellt ConVibNet vor, ein Echtzeit-Framework zur robusten Erkennung von Nadeln in Ultraschallbildern während der kontinuierlichen Insertion, das durch die Nutzung zeitlicher Abhängigkeiten und eines neuartigen Verlusts die Genauigkeit der Nadelpositionierung im Vergleich zu bestehenden Methoden signifikant verbessert.

Jiamei Guo, Zhehao Duan, Maria Neiiendam + 3 more2026-03-03💻 cs

D-REX: Differentiable Real-to-Sim-to-Real Engine for Learning Dexterous Grasping

Die Arbeit stellt D-REX vor, eine differentiable Engine, die auf Gaussian Splatting basiert, um durch visuelle Beobachtungen und Robotersignale die Masse von Objekten zu identifizieren und gleichzeitig realistische digitale Zwillinge sowie lernfähige Greifpolitiken zu erstellen, wodurch die Lücke zwischen Simulation und Realität effektiv geschlossen wird.

Haozhe Lou, Mingtong Zhang, Haoran Geng + 9 more2026-03-03💻 cs

GRAD-Former: Gated Robust Attention-based Differential Transformer for Change Detection

Die Arbeit stellt GRAD-Former vor, ein neuartiges, effizientes Framework für die Veränderungserkennung in Fernerkundungsbildern, das durch einen adaptiven Encoder mit gating-basierten Mechanismen und differenzieller Aufmerksamkeit eine überlegene Genauigkeit bei gleichzeitig geringerem Parameterbedarf als bestehende State-of-the-Art-Modelle erreicht.

Durgesh Ameta, Ujjwal Mishra, Praful Hambarde + 1 more2026-03-03🤖 cs.AI

BeautyGRPO: Aesthetic Alignment for Face Retouching via Dynamic Path Guidance and Fine-Grained Preference Modeling

Das Paper stellt BeautyGRPO vor, ein Reinforcement-Learning-Framework, das mithilfe eines feinabgestimmten Präferenzmodells und einer dynamischen Pfadführung (DPG) Gesichtsretusche so optimiert, dass es subtile Makel entfernt und gleichzeitig die Gesichtsidentität bewahrt, um menschliche ästhetische Vorlieben besser zu erfüllen als bestehende Methoden.

Jiachen Yang, Xianhui Lin, Yi Dong + 4 more2026-03-03💻 cs

FREE-Edit: Using Editing-aware Injection in Rectified Flow Models for Zero-shot Image-Driven Video Editing

Das Paper stellt FREE-Edit vor, ein zero-shot Framework für bildgesteuertes Video-Editing auf Basis von Rectified-Flow-Modellen, das eine neuartige editierungsaware Injektionsmethode (REE) nutzt, um die Injektionsintensität pro Token basierend auf optischem Fluss zu modulieren und so hochwertige Ergebnisse ohne Nachtraining zu erzielen.

Maomao Li, Yunfei Liu, Yu Li2026-03-03💻 cs

TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization

Die Arbeit stellt TripleSumm vor, ein adaptives Modell zur dreifachen Modalfusion für die Videozusammenfassung, das gemeinsam mit dem neuen umfassenden Multimodal-Datensatz MoSu den State-of-the-Art in diesem Bereich erreicht.

Sumin Kim, Hyemin Jeong, Mingu Kang + 3 more2026-03-03🤖 cs.LG

VP-Hype: A Hybrid Mamba-Transformer Framework with Visual-Textual Prompting for Hyperspectral Image Classification

Die Arbeit stellt VP-Hype vor, einen hybriden Mamba-Transformer-Ansatz mit visuell-textuellen Prompts, der durch die Kombination linearer Zustandsraummodelle und relationaler Modellierung eine hocheffiziente und datensparsame Klassifizierung von hyperspektralen Bildern ermöglicht.

Abdellah Zakaria Sellam, Fadi Abdeladhim Zidi, Salah Eddine Bekhouche + 4 more2026-03-03💻 cs

RnG: A Unified Transformer for Complete 3D Modeling from Partial Observations

Die Arbeit stellt RnG vor, einen einheitlichen Feed-Forward-Transformer, der durch einen rekonstruktionsgesteuerten kausalen Aufmerksamkeitsmechanismus und einen impliziten 3D-KV-Cache sowohl sichtbare Geometrie präzise rekonstruiert als auch plausible, unsichtbare Strukturen generiert, um vollständige 3D-Modelle aus partiellen 2D-Beobachtungen in Echtzeit zu erstellen.

Mochu Xiang, Zhelun Shen, Xuesong Li + 7 more2026-03-03💻 cs

VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning

Die Arbeit stellt VisNec vor, ein Rahmenwerk zur Messung der visuellen Notwendigkeit in multimodalen Instruktionsdaten, das durch die Auswahl von nur 15 % der LLaVA-665K-Datenmenge eine Leistung erzielt, die der des gesamten Datensatzes entspricht oder ihn sogar übertrifft.

Mingkang Dong, Hongyi Cai, Jie Li + 4 more2026-03-03🤖 cs.AI

CoSMo3D: Open-World Promptable 3D Semantic Part Segmentation through LLM-Guided Canonical Spatial Modeling

CoSMo3D überwindet die Fragilität bestehender 3D-Segmentierungsmethoden, indem es durch LLM-gestützte Datenausrichtung und eine duale Architektur einen latenten kanonischen Referenzrahmen erlernt, der es ermöglicht, Objektparteien unabhängig von der Eingabepose funktional und stabil zu interpretieren.

Li Jin, Weikai Chen, Yujie Wang + 7 more2026-03-03💻 cs

Monocular 3D Object Position Estimation with VLMs for Human-Robot Interaction

Diese Arbeit stellt eine Methode vor, bei der ein vortrainiertes Vision-Language-Modell durch Feinabstimmung und einen benutzerdefinierten Regressionskopf in der Lage ist, basierend auf monokularen Bildern und Sprachbefehlen präzise 3D-Positionen von Objekten für die Mensch-Roboter-Interaktion zu schätzen.

Ari Wahl, Dorian Gawlinski, David Przewozny + 3 more2026-03-03🤖 cs.LG

Towards Policy-Adaptive Image Guardrail: Benchmark and Method

Diese Arbeit stellt mit SafeEditBench ein neues Benchmark-Tool zur Bewertung der politikübergreifenden Generalisierung von Bild-Sicherheitsmodellen vor und schlägt die RLVR-basierte Methode SafeGuard-VL vor, um Vision-Language-Modelle robust an sich wandelnde Sicherheitsrichtlinien anzupassen.

Caiyong Piao, Zhiyuan Yan, Haoming Xu + 4 more2026-03-03💻 cs

AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models

Die Arbeit „AgilePruner" führt eine empirische Studie durch, die die Stärken und Schwächen von auf Aufmerksamkeit und Diversität basierenden Methoden zur visuellen Token-Pruning in großen visuell-sprachlichen Modellen analysiert und darauf aufbauend einen adaptiven Pruning-Mechanismus vorschlägt, der durch bildspezifische Anpassungen sowohl die Leistung als auch die Halluzinationsrate verbessert.

Changwoo Baek, Jouwon Song, Sohyeon Kim + 1 more2026-03-03🤖 cs.LG

The MAMA-MIA Challenge: Advancing Generalizability and Fairness in Breast MRI Tumor Segmentation and Treatment Response Prediction

Die MAMA-MIA-Challenge adressiert die mangelnde Generalisierbarkeit und Fairness bestehender KI-Modelle für die Brust-MRT durch einen großen, multizentrischen Benchmark, der die Segmentierung von Tumoren und die Vorhersage des Therapieansprechens über Kontinente hinweg unter Einbeziehung von Untergruppen-Gerechtigkeitsmetriken evaluiert.

Lidia Garrucho, Smriti Joshi, Kaisar Kushibar + 43 more2026-03-03🤖 cs.AI

Cross-Modal Guidance for Fast Diffusion-Based Computed Tomography

Diese Arbeit stellt eine Methode vor, die es ermöglicht, die Rekonstruktionsqualität bei spärlichen Neutronen-CT-Daten durch die Einbeziehung von X-ray-CT-Daten als zusätzliche Modalität zu verbessern, ohne dabei das zugrunde liegende Diffusionsmodell neu trainieren zu müssen.

Timofey Efimov, Singanallur Venkatakrishnan, Maliha Hossain + 2 more2026-03-03💻 cs

Certifiable Estimation with Factor Graphs

Diese Arbeit stellt einen einheitlichen Rahmen vor, der die Vorteile modularer Faktorgraphen mit zertifizierbaren, global optimalen Schätzverfahren verbindet, indem sie zeigt, dass die Struktur von Faktorgraphen unter Shor-Relaxation und Burer-Monteiro-Faktorisierung erhalten bleibt und so die Implementierung zertifizierbarer Schätzung mit etablierten Robotik-Bibliotheken ermöglicht.

Zhexin Xu, Nikolas R. Sanderson, Hanna Jiamei Zhang + 1 more2026-03-03💻 cs

FoSS: Modeling Long Range Dependencies and Multimodal Uncertainty in Trajectory Prediction via Fourier State Space Integration

Die Arbeit stellt FoSS vor, ein neuartiges Dual-Branch-Framework, das Frequenzbereichsanalyse mit linearen State-Space-Modellen kombiniert, um bei autonomen Fahrzeugen sowohl langfristige Abhängigkeiten als auch multimodale Unsicherheiten in der Trajektorienvorhersage mit höherer Genauigkeit und deutlich reduzierter Rechenkomplexität zu modellieren.

Yizhou Huang, Gengze Jiang, Yihua Cheng + 1 more2026-03-03💻 cs

Multi-Level Bidirectional Decoder Interaction for Uncertainty-Aware Breast Ultrasound Analysis

Die vorgestellte Arbeit schlägt einen unsicherheitsbewussten Multi-Task-Lernrahmen für die Brustultraschallanalyse vor, der durch bidirektionale Interaktion auf mehreren Decoderebenen und adaptive Gewichtung die Aufgabeninterferenz reduziert und gleichzeitig die Segmentierung sowie Klassifizierung verbessert.

Abdullah Al Shafi, Md Kawsar Mahmud Khan Zunayed, Safin Ahmmed + 2 more2026-03-03🤖 cs.AI

← Zurück Weiter →