1. Audio-Visual Tracking
Unter Audio-Visual Tracking versteht man die kombinierte Auswertung akustischer und visueller Informationen, um Personen beziehungsweise Sprecher innerhalb eines Raumes zu lokalisieren und anschließend eine Kamera oder einen Bildausschnitt automatisch auf die relevante Person auszurichten.
Ein rein kamerabasiertes System kann beispielsweise Personen und Gesichter erkennen, weiß jedoch nicht zwangsläufig zuverlässig, welche der sichtbaren Personen gerade spricht. Ein rein audiobasiertes System kann dagegen die Richtung einer Schallquelle bestimmen, verfügt jedoch nicht automatisch über die visuelle Information, welche Person sich an dieser Position befindet.
Die Kombination beider Informationsquellen erhöht deshalb die Robustheit eines automatisierten Konferenzsystems:
Audiosignal → Sprecherposition → visuelle Verifikation → Kamera-/Preset-Auswahl → Videoausgabe
Die MT100 übernimmt innerhalb eines entsprechenden AISpeech-Systems die Verarbeitung beziehungsweise Verknüpfung dieser Informationen und die daraus resultierende Bildsteuerung.
2. Direction of Arrival (DOA)
Eine wesentliche Grundlage des Systems ist die Direction-of-Arrival-Technologie, kurz DOA. Ein Mikrofonarray besteht aus mehreren räumlich voneinander angeordneten Mikrofonkapseln. Trifft eine Schallwelle auf das Array, erreicht sie die einzelnen Mikrofone zu geringfügig unterschiedlichen Zeitpunkten. Diese Laufzeitunterschiede können mathematisch ausgewertet werden.
Vereinfacht gilt:
Δt = Δs / c
Dabei bezeichnet:
- Δt die Laufzeitdifferenz,
- Δs den Wegunterschied der Schallwelle und
- c die Schallgeschwindigkeit.
Aus den Laufzeit- beziehungsweise Phasendifferenzen zwischen mehreren Mikrofonen lässt sich die Richtung bestimmen, aus der das Sprachsignal eintrifft.
AISpeech setzt diese Technik bei seinen kompatiblen Deckenmikrofonen ein. Die daraus gewonnenen Richtungsinformationen können anschließend der MT100 für die Audio-Video-Verknüpfung zur Verfügung gestellt werden. AISpeech nennt die präzise DOA-Fähigkeit seiner Deckenmikrofone ausdrücklich als Bestandteil der MT100-Systemarchitektur.
3. Mikrofonarray und Beamforming
Eng mit der DOA-Bestimmung verbunden ist das Beamforming. Dabei werden die Signale mehrerer Mikrofone so kombiniert, dass Schall aus einer bestimmten Richtung bevorzugt aufgenommen wird, während Signale aus anderen Richtungen reduziert werden können.
Die Verzögerungen der einzelnen Mikrofonsignale werden dazu mathematisch angepasst und anschließend kombiniert. Vereinfacht kann ein Delay-and-Sum-Beamformer als
y(t) = Σ xᵢ(t − τᵢ)
beschrieben werden.
Hierbei sind:
- xᵢ(t) die Signale der einzelnen Mikrofone,
- τᵢ die richtungsabhängigen Zeitverzögerungen und
- y(t) das resultierende Ausgangssignal.
Beamforming und DOA erfüllen dabei unterschiedliche, aber miteinander verknüpfte Aufgaben: DOA dient primär der Bestimmung der Schallrichtung, während Beamforming der räumlich gerichteten Aufnahme beziehungsweise Signaloptimierung dient.
4. Sprecherlokalisierung
Aus der ermittelten Schallrichtung kann ein Konferenzsystem eine räumliche Sprecherposition ableiten. Bei einem einzelnen Mikrofonarray steht zunächst hauptsächlich eine Richtungsinformation zur Verfügung. Durch bekannte Raumgeometrien, definierte Zonen, zusätzliche Sensorinformationen oder mehrere Mikrofone lassen sich daraus weitergehende räumliche Zuordnungen erzeugen.
Für ein Kamera-Tracking-System muss die ermittelte Position anschließend einer geeigneten Kamera beziehungsweise einem Kamera-Preset zugeordnet werden.
Beispiel:
Sprecher erkannt → DOA 65° → definierte Raumzone 4 → Kamera 2 → Preset 7
Die Kamera muss dadurch nicht kontinuierlich nach einer Person suchen. Ein intelligentes Steuerungssystem kann anhand der Audio- und Bildinformationen entscheiden, welche Kamera beziehungsweise welche vorbereitete Kameraposition für die Situation geeignet ist.
5. KI-basierte visuelle Erkennung
Die MT100 verwendet laut AISpeech Bildverarbeitungsalgorithmen einschließlich AI Facial Recognition beziehungsweise KI-basierter Gesichtserkennung.
Die visuelle Analyse ergänzt die akustische Positionsbestimmung. Dabei können erkannte Personen beziehungsweise Gesichter mit den aus der Audioanalyse gewonnenen Positionsinformationen verknüpft werden.
Das Grundprinzip lässt sich als Sensorfusion beschreiben:
Audioinformationen + Bildinformationen → wahrscheinlich relevante Person → Kamerasteuerung
Die Kombination mehrerer Informationsquellen reduziert typische Probleme eines einzelnen Sensors. Hintergrundgeräusche können beispielsweise eine rein akustische Lokalisierung erschweren, während mehrere gleichzeitig sichtbare Personen eine ausschließlich visuelle Auswahl erschweren können.
6. PTZ-Kameratechnik
Für professionelle Tracking-Anwendungen werden häufig PTZ-Kameras eingesetzt.
PTZ steht für:
also: horizontales Schwenken, vertikales Neigen, optisches beziehungsweise digitales Zoomen.
Eine PTZ-Kamera kann damit unterschiedliche Bereiche eines Raumes abdecken. Häufig werden vorab definierte Kamerapositionen – sogenannte Presets – gespeichert.
Wird beispielsweise erkannt, dass eine Person an einer bestimmten Sitzposition spricht, kann die Steuerung das zugehörige Preset aufrufen. Das ist in vielen Situationen schneller und reproduzierbarer als eine vollständig kontinuierliche Kamerafahrt.
7. Multi-Camera Tracking
In großen Räumen reicht eine einzelne Kamera häufig nicht aus. Mehrere Kameras können unterschiedliche Perspektiven oder Raumzonen erfassen. AISpeech gibt für die MT100 die Verbindung mit bis zu sechs Kameras an.
Die Steuerung muss dann nicht nur bestimmen, wohin eine Kamera bewegt werden soll, sondern zusätzlich entscheiden, welche Kamera für die aktuelle Situation verwendet werden soll.
Eine typische Logik kann beispielsweise folgendermaßen aussehen:
Audioerkennung → Sprecherposition → passende Raumzone → geeignete Kamera → Kamerapreset → Umschaltung des Programmbildes
Dadurch kann ein größerer Sitzungssaal mit mehreren Kameraperspektiven automatisiert abgebildet werden.
8. Intelligente Videoumschaltung
Eine automatische Kameraumschaltung muss neben der reinen Sprecherposition auch zeitliche Faktoren berücksichtigen.
Würde bei jeder kurzen Äußerung unmittelbar zwischen Kameras gewechselt, entstünde ein unruhiges Bild. Professionelle Tracking-Systeme verwenden daher typischerweise Entscheidungslogiken, Haltezeiten und andere Regeln, um unnötige Umschaltungen zu vermeiden.
Das Ziel besteht darin, eine Bildregie zu erzeugen, die für Remote-Teilnehmer möglichst natürlich wirkt.
AISpeech beschreibt für die MT100 einen eingebauten intelligenten Algorithmus zur Bildsteuerung beziehungsweise zur Echtzeitanpassung der Videoausgabe.
9. Bedeutung für hybride Meetings
Bei einem klassischen Videokonferenzsystem mit einer statischen Weitwinkelkamera bleiben alle Personen permanent im Gesamtbild sichtbar. In großen Räumen werden einzelne Sprecher dadurch auf der Gegenseite vergleichsweise klein dargestellt.
Ein Audio-Visual-Tracking-System kann dagegen den aktiven Sprecher automatisch hervorheben.
Dies verbessert insbesondere:
- die visuelle Zuordnung von Sprache und Person,
- die Darstellung einzelner Teilnehmer,
- die Verständlichkeit von Diskussionen mit wechselnden Sprechern,
- die Wahrnehmung nonverbaler Kommunikation,
- die Einbindung von Remote-Teilnehmern,
- die Bedienbarkeit des Konferenzsystems.
Der entscheidende technische Nutzen besteht somit weniger in einer einzelnen Kamera- oder Audiofunktion als in der automatischen Verknüpfung von Raum-Audio, Sprecherposition, Bildanalyse und Kamerasteuerung.