Sprechererkennung
Beim Prüfen einer Meeting-Transkription in Copera ist jedes gesprochene Segment mit der sprechenden Person gelabelt. Das basiert auf einer Kombination aus Echtzeit-Active-Speaker-Tracking während des Meetings und KI-basierter Diarisierung in der Nachverarbeitung.
So funktioniert es
Die Sprechererkennung läuft in zwei Stufen:
1. Echtzeit-Tracking während des Meetings
Läuft das Meeting und ist die Transkription aktiv, verfolgt das Frontend mit der Active-Speaker-Erkennung von Copera, wer gerade spricht. Diese Daten — eine Timeline, wer wann gesprochen hat — werden an das Backend gesendet und neben der Audio-Aufzeichnung gespeichert.
2. Nachverarbeitung mit KI-Diarisierung
Nach dem Stopp der Transkriptionsaufzeichnung wird das Audio an den Speech-to-Text-Dienst gesendet, der eine eigene Sprecher-Diarisierung durchführt — das Audio in Segmente teilen und jedes Segment mit einem generischen Sprecher-Label (Speaker A, Speaker B usw.) versehen.
Anschließend führt das System einen Matching-Algorithmus aus, der die Echtzeit-Active-Speaker-Daten aus Schritt 1 mit der Diarisierungsausgabe aus Schritt 2 vergleicht. Über Zeitüberlappungen mappt es die generischen Labels automatisch auf echte Teilnehmernamen.
Sprecher im Transkript ansehen
Öffnen Sie ein Transkript im Session-Viewer, zeigt das Speakers-Panel links alle erkannten Sprecherinnen und Sprecher. Jede Person ist durch Avatar (falls mit Workspace-Mitglied gematcht) dargestellt und erhält eine eigene Farbe. Äußerungen im Transkript sind farblich abgestimmt, damit Sie in einem langen Transkript leicht sehen, wer was gesagt hat.
Klicken Sie im Speakers-Panel auf eine sprechende Person, um das Transkript zu filtern und nur deren Äußerungen zu zeigen. Erneuter Klick hebt den Filter auf und zeigt alle Äußerungen.
Sprecher-Zuweisungen korrigieren
Manchmal ist das automatische Matching nicht perfekt — besonders in Meetings mit vielen Personen, die schnell nacheinander sprechen. Sie können jedes Sprecher-Label manuell neu zuweisen:
- Klicken Sie im Speakers-Panel auf den Avatar neben einem Sprecher-Label.
- Ein Dropdown zeigt alle Meeting-Teilnehmenden.
- Wählen Sie die richtige Person — alle Äußerungen dieser Sprecher-Zuordnung werden sofort aktualisiert.
- Sie können auch eine benutzerdefinierte sprechende Person (nach Name und E-Mail) für externe Teilnehmende hinzufügen, die keine Workspace-Mitglieder waren.
Öffnen Sie ein Sprecher-Auswahl-Dropdown, filtert das Transkript automatisch auf diese Person und spielt die erste Äußerung ab, damit Sie die Stimme hören und die Zuweisung bestätigen können.
Tipps für bessere Genauigkeit
- Crosstalk vermeiden — sprechen mehrere Personen gleichzeitig, fällt dem System die Unterscheidung schwerer.
- Individuelle Mikrofone nutzen — teilen Teilnehmende ein Mikrofon (z. B. im Konferenzraum), kann das System sie als eine sprechende Person gruppieren.
- Längere Aufzeichnungen helfen — je mehr Audio das System hat, desto genauer erkennt es unterschiedliche Stimmmuster.