Geometric and Learning-Based Perception for Mobile Vision by Integrating Memory and Temporal Fusion

DSpace Repositorium (Manakin basiert)

Zur Kurzanzeige

dc.contributor.advisor Zell, Andreas (Prof. Dr. rer. nat. )
dc.contributor.author Quan, Yitong
dc.date.accessioned 2026-09-01T13:54:29Z
dc.date.available 2026-09-01T13:54:29Z
dc.date.issued 2026-09-01
dc.identifier.uri http://hdl.handle.net/10900/182900
dc.identifier.uri http://nbn-resolving.org/urn:nbn:de:bsz:21-dspace-1829004 de_DE
dc.identifier.uri http://nbn-resolving.org/urn:nbn:de:bsz:21-dspace-1829004 de_DE
dc.identifier.uri http://dx.doi.org/10.15496/publikation-124214
dc.description.abstract Robust perception is a critical prerequisite of autonomous robotics, enabling platforms such as unmanned ground vehicles (UGVs), aerial vehicles (UAVs), and surface vehicles (USVs) to interpret, navigate, and interact with complex environments. Traditional perception pipelines often depend on multi-sensor setups, including LiDAR, radar, or multi-camera rigs, which, while effective, introduce substantial costs, complexity, and calibration requirements. In contrast, single-sensor solutions based on monocular or omnidirectional cameras offer cost-efficiency, compactness, and ease of deployment. This dissertation investigates how geometric reasoning and learning-based methods can be combined to achieve robust object detection, localization, and distance estimation, focusing on three complementary research directions: spatial memory, learning-based methods, and lightweight temporal fusion. First, we introduce a memory-map framework for object detection and localization, using a single 360° camera, demonstrating that spatial confidence accumulation over time improves robustness to partial occlusions and inconsistent detections. Second, we extend this concept to UAV platforms, integrating onboard metadata such as GPS, IMU, and altitude into geo-referenced confidence maps. This metadata-driven approach enhances temporal consistency in aerial video object detection and provides interpretable localization across dynamic flight paths. Third, we propose learning-based formulations for object distance estimation. On USVs, we show that extending an object detector with a regression branch enables approximate distance prediction directly from monocular imagery, offering a cost-efficient alternative to conventional range sensors. Then we broaden this concept to omnidirectional 360° images, where the method generalizes across diverse datasets and challenging conditions, outperforming geometric and alternative learning baselines without explicit calibration. Finally, we present a lightweight multi-frame integration strategy for YOLO-based video object detection. By stacking consecutive frames and supervising only the final frame, the approach leverages temporal context with minimal computational overhead, significantly improving robustness against motion blur, occlusions, and appearance changes, while preserving near single-frame throughput. Overall, this dissertation demonstrates that single-sensor vision systems, when enhanced with spatial memory, metadata-driven reasoning, learning-based distance regression, and lightweight temporal fusion, can deliver robust, efficient, and generalizable perception across ground, aerial, and maritime platforms. en
dc.description.abstract Robuste Wahrnehmung ist eine entscheidende Voraussetzung für autonome Robotik und ermöglicht es Plattformen wie unbemannten Bodenfahrzeugen (UGVs), Luftfahrzeugen (UAVs) und Oberflächenfahrzeugen (USVs), komplexe Umgebungen zu interpretieren, zu navigieren und mit ihnen zu interagieren. Herkömmliche Wahrnehmungspipelines basieren häufig auf Multisensor-Setups, darunter LiDAR, Radar oder Mehrkamera-Rigs, die zwar effektiv sind, aber erhebliche Kosten, Komplexität und Kalibrierungsanforderungen mit sich bringen. Im Gegensatz dazu bieten Einzelsensorlösungen auf Basis monokularer oder omnidirektionaler Kameras Kosteneffizienz, Kompaktheit und einfache Implementierung. Diese Dissertation untersucht, wie geometrisches Denken und lernbasierte Methoden kombiniert werden können, um eine robuste Objekterkennung, -lokalisierung und -entfernungsschätzung zu erreichen. Der Fokus liegt dabei auf drei komplementären Forschungsrichtungen: räumliches Gedächtnis, lernbasierte Methoden und leichtgewichtige zeitliche Fusion. Zunächst stellen wir ein Memory-Map-Framework für die Objekterkennung und -lokalisierung mit einer einzelnen 360°-Kamera vor und zeigen, dass die Akkumulation räumlicher Konfidenz im Laufe der Zeit die Robustheit gegenüber partiellen Verdeckungen und inkonsistenten Erkennungen verbessert. Zweitens erweitern wir dieses Konzept auf UAV-Plattformen und integrieren Onboard-Metadaten wie GPS, IMU und Flughöhe in georeferenzierte Konfidenzkarten. Dieser metadatenbasierte Ansatz verbessert die zeitliche Konsistenz bei der Objekterkennung per Luftbildvideo und ermöglicht eine interpretierbare Lokalisierung über dynamische Flugrouten hinweg. Drittens schlagen wir lernbasierte Formulierungen zur Objektentfernungsschätzung vor. An USVs zeigen wir, dass die Erweiterung eines Objektdetektors um einen Regressionszweig eine ungefähre Entfernungsvorhersage direkt aus monokularen Bildern ermöglicht und damit eine kostengünstige Alternative zu herkömmlichen Entfernungssensoren darstellt. Anschließend erweitern wir dieses Konzept auf omnidirektionale 360°-Bilder, wobei die Methode über verschiedene Datensätze und anspruchsvolle Bedingungen hinweg generalisierbar ist und geometrische und alternative lernbasierte Baselines ohne explizite Kalibrierung übertrifft. Abschließend präsentieren wir eine leichtgewichtige Multi-Frame-Integrationsstrategie für die YOLO-basierte Videoobjekterkennung. Durch das Stapeln aufeinanderfolgender Frames und die Überwachung nur des letzten Frames nutzt der Ansatz den zeitlichen Kontext mit minimalem Rechenaufwand. Dies verbessert die Robustheit gegenüber Bewegungsunschärfe, Okklusionen und Erscheinungsänderungen deutlich, während der Durchsatz nahezu dem einer Einzelbildverarbeitung entspricht. Insgesamt zeigt diese Dissertation, dass Einzelsensor-Bildverarbeitungssysteme, wenn sie mit räumlichem Gedächtnis, metadatengesteuerter Argumentation, lernbasierter Distanzregression und leichter zeitlicher Fusion erweitert werden, eine robuste, effiziente und verallgemeinerbare Wahrnehmung über Boden-, Luft- und Seeplattformen hinweg liefern können. de_DE
dc.language.iso de de_DE
dc.language.iso en de_DE
dc.publisher Universität Tübingen de_DE
dc.rights ubt-podno de_DE
dc.rights http://tobias-lib.uni-tuebingen.de/doku/lic_ohne_pod.php?la=de de_DE
dc.rights http://tobias-lib.uni-tuebingen.de/doku/lic_ohne_pod.php?la=en en
dc.subject.classification Maschinelles Sehen , Objekterkennung , Maschinelles Lernen , Robotik , Bildverarbeitung de_DE
dc.subject.ddc 004 de_DE
dc.subject.ddc 600 de_DE
dc.subject.other Mobile robotics en
dc.subject.other single-sensor vision en
dc.subject.other monocular vision en
dc.subject.other omnidirectional vision en
dc.subject.other object localization en
dc.subject.other object distance estimation en
dc.subject.other spatial memory en
dc.subject.other temporal fusion en
dc.subject.other video object detection en
dc.subject.other räumliches Gedächtnis de_DE
dc.subject.other zeitliche Fusion de_DE
dc.subject.other Videoobjekterkennung de_DE
dc.subject.other omnidirektionale Bildverarbeitung de_DE
dc.subject.other Mobile Robotik de_DE
dc.subject.other Objektentfernungsschätzung de_DE
dc.subject.other Objektlokalisierung de_DE
dc.subject.other monokulare Bildverarbeitung de_DE
dc.title Geometric and Learning-Based Perception for Mobile Vision by Integrating Memory and Temporal Fusion en
dc.type PhDThesis de_DE
dcterms.dateAccepted 2026-08-07
utue.publikation.fachbereich Informatik de_DE
utue.publikation.fakultaet 7 Mathematisch-Naturwissenschaftliche Fakultät de_DE
utue.publikation.noppn yes de_DE

Dateien:

Das Dokument erscheint in:

Zur Kurzanzeige