cs.CV Arbeiten | Gist.Science

Diffusion-Based sRGB Real Noise Generation via Prompt-Driven Noise Representation Learning

Die Arbeit stellt ein neues Framework namens Prompt-Driven Noise Generation (PNG) vor, das mithilfe von Prompt-Features realistische sRGB-Rauschbilder ohne Abhängigkeit von Kamerametadaten synthetisiert und so die Generalisierbarkeit von Rauschgenerierung und nachfolgendem Entrauschen in realen Szenarien erheblich verbessert.

Jaekyun Ko, Dongjin Kim, Soomin Lee + 2 more2026-03-06💻 cs

Interpretable Pre-Release Baseball Pitch Type Anticipation from Broadcast 3D Kinematics

Diese Studie demonstriert, dass allein durch die Analyse von 3D-Kinematikdaten aus Fernsehbildern eine Vorhersagegenauigkeit von 80,4 % für acht verschiedene Baseball-Würfe erreicht werden kann, wobei die Oberkörpermechanik den größten Beitrag leistet und grip-basierte Varianten wie Four-Seam und Two-Seam Fastballs kinematisch nicht unterscheidbar sind.

Jerrin Bright, Michelle Lu, John Zelek2026-03-06🤖 cs.AI

Structure Observation Driven Image-Text Contrastive Learning for Computed Tomography Report Generation

Diese Arbeit stellt ein neuartiges zweistufiges Framework für die automatische Generierung von CT-Berichten vor, das durch strukturorientierte Bild-Text-Kontrastierung und dynamische Negativ-Queues präzise semantische Korrespondenzen zwischen anatomischen Strukturen und Befundtexten erlernt, um so den aktuellen Stand der Technik in klinischer Effizienz zu übertreffen.

Hong Liu, Dong Wei, Qiong Peng + 4 more2026-03-06💻 cs

DeformTrace: A Deformable State Space Model with Relay Tokens for Temporal Forgery Localization

Die Arbeit stellt DeformTrace vor, ein hybrides State-Space-Modell mit deformierbaren Dynamiken und Relais-Token-Mechanismen, das durch präzise zeitliche Fokussierung und verbesserte Langstreckenmodellierung den State-of-the-Art in der Lokalisierung von Medienmanipulationen erreicht.

Xiaodong Zhu, Suting Wang, Yuanming Zheng + 5 more2026-03-06🤖 cs.AI

Federated Modality-specific Encoders and Partially Personalized Fusion Decoder for Multimodal Brain Tumor Segmentation

Der vorgestellte FedMEPD-Rahmenwerk adressiert die Herausforderungen der intermodalen Heterogenität und der Personalisierung im föderierten Lernen für die multimodale Hirntumorsegmentierung durch den Einsatz von modality-spezifischen Encodern, teilweise personalisierten Fusion-Decodern und einem Mechanismus zur Kompensation fehlender Modalitäten mittels Cross-Attention.

Hong Liu, Dong Wei, Qian Dai + 3 more2026-03-06💻 cs

FedAFD: Multimodal Federated Learning via Adversarial Fusion and Distillation

Das Paper stellt FedAFD vor, ein einheitliches Framework für multimodales Federated Learning, das durch eine bi-level adversarielle Ausrichtungsstrategie, einen granularitätsbewussten Fusionsmodul und eine similarity-gesteuerte Ensemble-Destillation die Herausforderungen heterogener Datenmodalitäten, Aufgabenunterschiede und Modellheterogenität adressiert, um sowohl auf Client- als auch auf Serverseite eine überlegene Leistung und Privatsphäre zu gewährleisten.

Min Tan, Junchao Ma, Yinfu Feng + 6 more2026-03-06🤖 cs.AI

Locality-Attending Vision Transformer

Die Arbeit stellt einen einfachen Add-on-Ansatz namens Locality-Attending Vision Transformer (LocAtViT) vor, der durch die Modulation der Selbstattention mit einem lernbaren Gauß-Kernel und die Verfeinerung der Patch-Repräsentationen die Segmentierungsleistung von Vision-Transformern erheblich verbessert, ohne dabei deren Klassifikationsfähigkeiten zu beeinträchtigen oder das Trainingsregime zu ändern.

Sina Hajimiri, Farzad Beizaee, Fereshteh Shakeri + 3 more2026-03-06💻 cs

FC-VFI: Faithful and Consistent Video Frame Interpolation for High-FPS Slow Motion Video Generation

Der Paper stellt FC-VFI vor, ein neues Verfahren zur Video-Framinterpolation, das durch latente zeitliche Modellierung und semantische Strukturierung hochauflösende, treue und konsistente Slow-Motion-Videos mit bis zu 240 Bildern pro Sekunde erzeugt und dabei die Schwächen bestehender Diffusionsmodelle bei der Detailwiedergabe überwindet.

Ganggui Ding, Hao Chen, Xiaogang Xu2026-03-06💻 cs

AdaIAT: Adaptively Increasing Attention to Generated Text to Alleviate Hallucinations in LVLM

Die Arbeit stellt AdaIAT vor, eine adaptive Methode, die durch gezielte Verstärkung der Aufmerksamkeit auf generierten Text Halluzinationen in Large Vision-Language-Modellen signifikant reduziert, ohne dabei die sprachliche Kohärenz oder Vorhersagefähigkeit zu beeinträchtigen.

Li'an Zhong, Ziqiang He, Jibin Zheng + 3 more2026-03-06💻 cs

Beyond the Patch: Exploring Vulnerabilities of Visuomotor Policies via Viewpoint-Consistent 3D Adversarial Object

Diese Arbeit schlägt eine Methode zur Optimierung viewpoint-konsistenter adversarialer Texturen für 3D-Objekte vor, die durch differentiable Rendering, Expectation over Transformation und eine Coarse-to-Fine-Strategie die Anfälligkeit visuomotorischer Robotikrichtlinien gegenüber Perspektivverzerrungen und dynamischen Kamerabewegungen aufdeckt.

Chanmi Lee, Minsung Yoon, Woojae Kim + 2 more2026-03-06💻 cs

Person Detection and Tracking from an Overhead Crane LiDAR

Diese Arbeit stellt einen maßgeschneiderten Overhead-LiDAR-Datensatz für die Personenerkennung und -verfolgung in industriellen Innenräumen vor, adaptiert bestehende 3D-Detektoren für diese spezielle Perspektive und validiert deren Echtzeitfähigkeit durch eine umfassende Evaluierung, um die Lücke zwischen herkömmlichen Fahrzeugsensordaten und Überkopf-Szenarien zu schließen.

Nilusha Jayawickrama, Henrik Toikka, Risto Ojala2026-03-06🤖 cs.LG

Adaptive Prototype-based Interpretable Grading of Prostate Cancer

Die Autoren stellen ein neuartiges, prototypenbasiertes und schwach überwachtes Framework vor, das durch die Nachahmung des pathologischen Vergleichs von Gewebeproben mit klinisch validierten Beispielen eine interpretierbare und vertrauenswürdige Automatisierung der Prostatakrebs-Grading aus histopathologischen Bildern ermöglicht.

Riddhasree Bhattacharyya, Pallabi Dutta, Sushmita Mitra2026-03-06💻 cs

TimeWarp: Evaluating Web Agents by Revisiting the Past

Die Arbeit stellt TimeWarp vor, einen Benchmark zur Evaluierung der Robustheit von Web-Agenten gegenüber sich wandelnden Web-Designs, und schlägt mit TimeTraj einen effizienten Algorithmus vor, der durch Plan-Distillation über mehrere UI-Versionen hinweg die Leistungsfähigkeit dieser Agenten signifikant steigert.

Md Farhan Ishmam, Kenneth Marino2026-03-06🤖 cs.AI

Location-Aware Pretraining for Medical Difference Visual Question Answering

Die Studie stellt einen neuartigen Vorschulungsansatz vor, der durch lokationsbewusste Aufgaben wie automatische Referenzausdrücke und verankerte Bildunterschriften die Fähigkeit von Vision-Encodern verbessert, subtile visuelle Unterschiede in medizinischen Bildern zu erkennen, und damit den State-of-the-Art bei der differenziellen visuellen Fragebeantwortung für Röntgenbilder der Brust erreicht.

Denis Musinguzi, Caren Han, Prasenjit Mitra2026-03-06🤖 cs.AI

VisionPangu: A Compact and Fine-Grained Multimodal Assistant with 1.7B Parameters

Das Paper stellt VisionPangu vor, einen kompakten 1,7-Milliarden-Parameter Multimodal-Assistenten, der durch die Kombination eines InternVL-basierten Vision-Encoders mit dem OpenPangu-Sprachmodell und feinkörniger menschlicher Supervision aus dem DOCCI-Datensatz detaillierte Bildbeschreibungen erzeugt, ohne auf massive Skalierung angewiesen zu sein.

Jiaxin Fan, Wenpo Song2026-03-06💬 cs.CL

Revisiting an Old Perspective Projection for Monocular 3D Morphable Models Regression

Die Autoren stellen ein neues Kameramodell für die Regression monokularer 3D-Morphable-Modelle vor, das durch die Einführung eines Schrumpfungsparameters eine stabile Pseudo-Perspektive ermöglicht und somit die bisherige Beschränkung auf orthografische Projektionen bei Nahaufnahmen, etwa von Head-Mounted-Cameras, überwindet.

Toby Chong, Ryota Nakajima2026-03-06💻 cs

BiEvLight: Bi-level Learning of Task-Aware Event Refinement for Low-Light Image Enhancement

Die Arbeit stellt BiEvLight vor, ein hierarchisches Framework zur Low-Light-Bildverbesserung, das durch eine bi-level-Optimierung die task-spezifische Rauschunterdrückung von Event-Kameradaten mit der Bildverbesserung koppelt, um die durch Rauschüberlagerung verursachten Leistungsengpässe zu überwinden und den State-of-the-Art signifikant zu übertreffen.

Zishu Yao, Xiang-Xiang Su, Shengning Zhou + 3 more2026-03-06💻 cs

3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding

Die Arbeit stellt 3D-RFT vor, ein bahnbrechendes Framework, das Reinforcement Fine-Tuning mit verifizierbaren Belohnungsfunktionen auf videobasierte 3D-Szenenverständnis-Aufgaben anwendet und dabei durch direkte Optimierung anhand von Evaluierungsmetriken selbst größere Modelle übertreffen kann.

Xiongkun Linghu, Jiangyong Huang, Baoxiong Jia + 1 more2026-03-06🤖 cs.AI

Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding

Das Paper stellt VideoHV-Agent vor, ein Multi-Agenten-Framework für das Verständnis langer Videos, das durch einen strukturierten Hypothesen-Verifikationsprozess, bei dem ein „Denker" Antworten in testbare Hypothesen umwandelt und ein „Prüfer" diese mit detaillierten Videoinhalten verifiziert, die Genauigkeit, Interpretierbarkeit und Recheneffizienz im Vergleich zu bestehenden Methoden verbessert.

Zheng Wang, Haoran Chen, Haoxuan Qin + 3 more2026-03-06💻 cs

A Simple Baseline for Unifying Understanding, Generation, and Editing via Vanilla Next-token Prediction

Das Paper stellt Wallaroo vor, ein einfaches autoregressives Modell, das durch Next-token-Vorhersage und eine vierstufige Trainingsstrategie multimodales Verständnis, Bildgenerierung und -bearbeitung sowie mehrsprachige Unterstützung vereint und dabei auf verschiedenen Benchmarks wettbewerbsfähige Ergebnisse erzielt.

Jie Zhu, Hanghang Ma, Jia Wang + 6 more2026-03-06💻 cs

← Zurück Weiter →