- Verhalten eines Starrflüglers (Bank-2-Turn).
nach vorne gerichteter Primärsensor mit rechteckigem Sichtfeld (FoR).
(nur Peilung, nur Entfernung oder Peilung + Entfernung)
- eine Antenne pro Seite mit kegelförmiger Charakteristik (auf die y-Achse ausgerichtet).
- die Antennen dienen als Kommunikationsgeräte und zur gegenseitigen Ortung.
Reinforcement Learning on Airborne Multi-Agent-System
Sensor-Effektor-Formationen zur Aufgabenoptimierung
Überblick über die Mission

- verschiedene Missionsphasen stellen unterschiedliche Anforderungen an die Formation
- jede Phase ist eine (gewichtete) Kombination aus einzelnen Zielen (z. B. kooperative Zielverfolgung, kooperative Navigation, kooperative Steuerung, Verweildauer am Ziel, Radarsignatur, Hindernisvermeidung usw.).
UAV-Modell (Agent)

Problemstellung
Ein Netzwerk aus Agenten (Knoten) bildet einen Graphen G mit n Agenten und Kanten E für jede gültige Sichtverbindung (Line-of-Sight, LoS):

Das Netzwerk bildet ein Multi-Agenten-System, wobei jeder Agent als ein steuerungsaffines nichtlineares System modelliert ist:

Definition des Steuereingangs auf der Grundlage eines Konsenses

Der Vektor rij beschreibt den räumlichen Versatz zwischen den Agenten i und j.
Dieser Vektor muss für den gesamten Schwarm so bestimmt werden, dass die Zielfunktion (d. h. die Belohnung) maximiert wird:

Beispiel für die Motivation

→ Zwei Akteure verfolgen ein Ziel, stehen jedoch in keiner direkten Verbindung zueinander. Ein dritter Akteur fungiert als Vermittler, verfolgt jedoch kein Ziel.
Geometrische Eigenschaften
Singuläre Optimierungen

Kooperative Ortung:
- Symmetrie zentriert auf das Ziel. (hier: Pyramide)
- durch den Sensor-FoR geprägte Lösungsvielfalt

Kooperative Navigation:
- Symmetrie um den geometrischen Mittelpunkt (Schwerpunkt) der Formation.
- alle Winkel und Abstände sind ausgeglichen. (hier: Tetraeder)

Kooperative Anleitung:
- Symmetrie um die Antennenachse.
- Lösungsraum, geprägt durch die Antennencharakteristik und mögliche Maskierung. (hier: Linie, keine Maskierung)
Kombinierte Optimierung

Optimierung
Mehrziel- / Mehrbeschränkungs-Problem.
statisch oder dynamisch (abhängig von der Anwendung).
Lösungsansätze:
- Multi-Agent-Reinforcement-Learning (MARL).
- auf Konsens-Passivität basierend.
THI Ansprechpartner
Prof. Dr. techn. Gerhard Elsbacher
Tel.: +49 841 9348-4412
Raum: K309
E-Mail: Gerhard.Elsbacher@thi.de
Dr. techn. Babak Salamat
Tel.: +49 841 9348-1116
Raum: G001
E-Mail: Babak.Salamat@thi.de















