cs Arbeiten | Gist.Science

Cumulative Consensus Score: Label-Free and Model-Agnostic Evaluation of Object Detectors in Deployment

Die Arbeit stellt den Cumulative Consensus Score (CCS) vor, eine modellunabhängige und annotierungsfreie Metrik, die durch Messung der räumlichen Konsistenz von Bounding-Box-Vorhersagen über Testzeit-Augmentierungen hinweg die Zuverlässigkeit von Objektdetektoren im Einsatz überwacht und dabei eine hohe Übereinstimmung mit etablierten Qualitätsmaßen aufweist.

Avinaash Manoharan, Xiangyu Yin, Domenik Helm, Chih-Hong Cheng2026-03-10💻 cs

WHU-STree: A Multi-modal Benchmark Dataset for Street Tree Inventory

Die Studie stellt WHU-STree vor, ein umfassendes, multimodales Benchmark-Datenset mit synchronisierten Punktwolken und hochauflösenden Bildern aus zwei Städten, das über 21.000 annotierte Straßenbäume umfasst und als Grundlage für die Automatisierung der Bestandsaufnahme sowie die Erforschung von Multi-Modalitäts- und Domänenanpassungsmethoden dient.

Ruifei Ding, Zhe Chen, Wen Fan + 5 more2026-03-10💻 cs

Agile in the Face of Delay: Asynchronous End-to-End Learning for Real-World Aerial Navigation

Die Autoren stellen ein asynchrones Reinforcement-Learning-Framework vor, das durch die Entkopplung von Wahrnehmung und Steuerung sowie die Verwendung eines temporalen Kodierungsmoduls hochfrequente, agile autonome Navigation von Luftfahrzeugen in komplexen Umgebungen trotz verzögerter Sensorik ermöglicht und erfolgreich in der realen Welt demonstriert wurde.

Yude Li, Zhexuan Zhou, Huizhe Li, Youmin Gong, Jie Mei2026-03-10💻 cs

GeoAware-VLA: Implicit Geometry Aware Vision-Language-Action Model

GeoAware-VLA ist ein Ansatz, der durch die Integration vorgefertigter geometrischer Merkmale in die visuelle Verarbeitung die Generalisierungsfähigkeit von Vision-Language-Action-Modellen auf neue Kameraperspektiven erheblich verbessert, ohne dabei die Leistung im Trainingsbereich zu beeinträchtigen.

Ali Abouzeid, Malak Mansour, Qinbo Sun, Zezhou Sun, Dezhen Song2026-03-10💻 cs

OIPP: Object-Adaptive Impact Point Predictor for Catching Diverse In-Flight Objects

In dieser Studie wird der OIPP (Object-Adaptive Impact Point Predictor) vorgestellt, ein System für einen Vierbeiner-Roboter, das mithilfe eines neu erstellten Datensatzes mit 8.000 Flugbahnen und eines objektspezifischen Encoders den Landepunkt verschiedener fliegender Objekte präzise vorhersagt, um das Auffangen unter komplexen aerodynamischen Bedingungen zu ermöglichen.

Ngoc Huy Nguyen, Kazuki Shibata, Takamitsu Matsubara2026-03-10💻 cs

LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control

Die Arbeit stellt das erste öffentliche Korpus LibriTTS-VI vor und schlägt neue Methoden vor, um durch Entkopplung von Sprecheridentität und Stimmimpressions-Steuerung oder eine referenzfreie Technik die präzise numerische Kontrolle von Stimmimpressionsmerkmalen in der Text-zu-Sprache-Synthese zu verbessern.

Junki Ohmura, Yuki Ito, Emiru Tsunoo, Toshiyuki Sekiya, Toshiyuki Kumakura2026-03-10💻 cs

Compose by Focus: Scene Graph-based Atomic Skills

Die Arbeit stellt einen Framework vor, der szenengraphbasierte Repräsentationen mit diffusionsbasiertem Imitationslernen und einem VLM-Planer kombiniert, um die Robustheit und kompositionelle Generalisierung von Robotern bei langfristigen Manipulationsaufgaben zu verbessern.

Han Qi, Changhe Chen, Heng Yang2026-03-10💻 cs

DroFiT: A Lightweight Band-fused Frequency Attention Toward Real-time UAV Speech Enhancement

Die Arbeit stellt DroFiT vor, ein leichtgewichtiges, single-mikrofonbasiertes Sprachverbesserungsnetzwerk auf Transformer-Basis, das durch eine frequenzfokussierte Aufmerksamkeitsmechanik und hybride Encoder-Decoder-Architektur eine Echtzeit-Entfernung von Drohnengeräuschen auf ressourcenbeschränkten UAV-Plattformen ermöglicht.

Jeongmin Lee, Chanhong Jeon, Hyungjoo Seo, Taewook Kang2026-03-10💻 cs

Event-Based Visual Teach-and-Repeat via Fast Fourier-Domain Cross-Correlation

Die Autoren stellen ein neuartiges, ereignisbasiertes Visual-Teach-and-Repeat-System vor, das durch Frequenzbereich-Kreuzkorrelation eine Latenz von nur 2,88 ms erreicht und damit autonome Roboternavigation über 3000 Meter bei Tag und Nacht mit einer Spurabweichung unter 15 cm ermöglicht.

Gokul B. Nair, Alejandro Fontan, Michael Milford, Tobias Fischer2026-03-10💻 cs

Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

Die Studie zeigt, dass aktuelle Video-LLM-Benchmarks das Hören vernachlässigen, und demonstriert, dass die Integration von Sprach- und Audio-Encodern die Leistung bei sprachbasierten Aufgaben signifikant verbessert, während visuell zentrierte Benchmarks kaum beeinflusst werden.

Geewook Kim, Minjoon Seo2026-03-10💻 cs

Efficient Construction of Implicit Surface Models From a Single Image for Motion Generation

Der Artikel stellt FINS vor, ein leichtgewichtiges Framework, das mithilfe eines vortrainierten Fundamentmodells und eines Multi-Resolution-Hash-Grids aus einem einzigen Bild hochpräzise implizite Oberflächen und SDF-Felder in nur wenigen Sekunden rekonstruiert und damit bestehende Methoden in Geschwindigkeit und Genauigkeit übertrifft.

Wei-Teng Chu, Tianyi Zhang, Matthew Johnson-Roberson, Weiming Zhi2026-03-10💻 cs

RetoVLA: Reusing Register Tokens for Spatial Reasoning in Vision-Language-Action Models

Die Arbeit stellt RetoVLA vor, eine Architektur, die durch die Wiederverwendung von Register-Tokens als globale räumliche Kontextquelle die räumliche Reasoning-Fähigkeit von ressourcenschonenden Vision-Language-Action-Modellen ohne Parametererhöhung signifikant verbessert und so die Erfolgsrate robotischer Manipulationsaufgaben steigert.

Jiyeon Koo, Taewan Cho, Hyunjoon Kang, Eunseom Pyo, Tae Gyun Oh, Taeryang Kim, Andrew Jaeyong Choi2026-03-10💻 cs

Quantized Visual Geometry Grounded Transformer

Das Paper stellt QuantVGGT vor, ein bahnbrechendes Post-Training-Quantisierungsframework für Visual Geometry Grounded Transformers, das durch eine dual geglättete Feinquantisierung und rauschgefiltertes, vielfältiges Sampling die Herausforderungen schwerer Verteilungen und instabiler Kalibrierung bei Milliarden-modellen löst und dabei eine 3,7-fache Speicherreduktion bei über 98 % der ursprünglichen Genauigkeit ermöglicht.

Weilun Feng, Haotong Qin, Mingqiang Wu, Chuanguang Yang, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Yulun Zhang, Michele Magno, Yongjun Xu2026-03-10💻 cs

Autonomous UAV-Quadruped Docking in Complex Terrains via Active Posture Alignment and Constraint-Aware Control

Diese Arbeit stellt ein autonomes Docking-System für UAVs und Vierbeiner in GPS-freien Umgebungen vor, das durch eine tiefenverstärkungslernbasierte Torso-Stabilisierung des Vierbeiners und eine dreistufige UAV-Steuerung mit beschränkungsorientierter Regelung komplexe Geländestrukturen wie Treppen und steile Hänge erfolgreich bewältigt.

Haozhe Xu, Cheng Cheng, Hongrui Sang, Zhipeng Wang, Qiyong He, Xiuxian Li, Bin He2026-03-10💻 cs

Motion-Aware Transformer for Multi-Object Tracking

Die Arbeit stellt den Motion-Aware Transformer (MATR) vor, ein End-to-End-Modell für das Multi-Object-Tracking, das durch die explizite Vorhersage von Objektbewegungen zur Aktualisierung von Track-Queries Kollisionen reduziert und damit auf mehreren Benchmark-Datensätzen neue State-of-the-Art-Ergebnisse erzielt.

Xu Yang, Gady Agam2026-03-10💻 cs

GS-2M: Material-aware Gaussian Splatting for High-fidelity Mesh Reconstruction

Die Arbeit stellt GS-2M vor, einen materialbewussten Optimierungsrahmen auf Basis von 3D-Gaussian-Splatting, der durch eine neuartige Rauheitsüberwachung und das gemeinsame Optimieren von geometrischen Attributen hochfidele, dreieckige Mesh-Rekonstruktionen selbst bei stark reflektierenden Oberflächen ermöglicht, ohne dabei auf komplexe neuronale Komponenten angewiesen zu sein.

Dinh Minh Nguyen, Malte Avenhaus, Thomas Lindemeier2026-03-10💻 cs

Towards Strategic Persuasion with Language Models

Diese Arbeit stellt einen theoretisch fundierten Rahmen auf Basis der Bayes'schen Persuasionstheorie vor, der es ermöglicht, die persuasiven Fähigkeiten von Sprachmodellen zu evaluieren und durch Reinforcement Learning zu trainieren, wobei sich zeigt, dass sowohl große als auch kleine Modelle signifikante Gewinne und strategisch fundierte Überzeugungsansätze erzielen können.

Zirui Cheng, Jiaxuan You2026-03-10💻 cs

SAC-Loco: Safe and Adjustable Compliant Quadrupedal Locomotion

Die Arbeit stellt SAC-Loco vor, ein Sicherheits-bewusstes Framework für quadrupede Roboter, das durch die Integration eines einstellbaren, kraftkomplianten Reinforcement-Learning-Policies und eines Sicherheitskritikers sowohl weiche Anpassung an externe Kräfte als auch robuste Stabilität und schnelle Erholung bei Störungen ermöglicht.

Aoqian Zhang, Zixuan Zhuang, Chunzheng Wang, Shuzhi Sam Ge, Fan Shi, Cheng Xiang2026-03-10💻 cs

Efficient Domain-Adaptive Multi-Task Dense Prediction with Vision Foundation Models

Die Arbeit stellt FAMDA vor, einen effizienten Framework für die unsupervised Domain Adaptation bei Multi-Task-Dichtvorhersage, der Vision Foundation Models als Lehrer nutzt, um robuste und ressourcenschonende Schülermodelle für robotische Anwendungen zu trainieren.

Beomseok Kang, Niluthpol Chowdhury Mithun, Mikhail Sizintsev, Han-Pang Chiu, Supun Samarasekera2026-03-10💻 cs

QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification

Das Paper stellt QuantSparse vor, ein einheitliches Framework, das Modellquantisierung und Aufmerksamkeitsverdünnung durch Multi-Scale Salient Attention Distillation und Second-Order Sparse Attention Reparameterization kombiniert, um Video-Diffusionstransformer bei gleichzeitiger drastischer Reduktion von Speicherbedarf und Inferenzzeit ohne signifikante Qualitätsverluste zu komprimieren.

Weilun Feng, Chuanguang Yang, Haotong Qin, Mingqiang Wu, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Yulun Zhang, Michele Magno, Yongjun Xu2026-03-10💻 cs

← Zurück Weiter →