Sprachtechnologie1. Okt 2026 · 4 Min. Lesezeit

AvaritCall · Redaktion

Zwei Kanäle und Diarisierung: Gesprächssprecher trennen

Zwei Audiokanäle bedeuten nicht automatisch eine korrekte Sprechertrennung. Prüfen Sie Kanalquellen, Diarisierung, überlappende Sprache und den STT-Eingabevertrag gemeinsam.

Zwei Kanäle und Diarisierung: Gesprächssprecher trennen

Werden beide Gesprächsseiten tatsächlich in getrennten Audiokanälen aufgezeichnet, erleichtert kanalweise Erkennung die Zuordnung ihrer Herkunft. In einem gemischten Kanal schätzt Diarisierung die Sprecherwechsel anhand des Audios. Die Bezeichnung Stereo belegt diese Trennung allein nicht. Prüfen Sie zuerst Aufnahmequelle und Kanalzuordnung, anschließend die Sprecheretiketten im Transkript.

1. Kanaltrennung und Diarisierung unterscheiden

Google Clouds Dokumentation zur Mehrkanalerkennung verbindet Ergebnisse mit Kanaletiketten. [1] Die Diarisierungsdokumentation beschreibt dagegen das Erkennen und Kennzeichnen von Sprecherwechseln. [2] Die Informationsgrundlagen sind verschieden: Das eine folgt vorhandenen Kanalgrenzen, das andere schätzt die Sprechertrennung. Hören Sie die tatsächliche Aufnahme an, bevor Sie das Verfahren auswählen.

Erste Prüfung verschiedener Aufnahmestrukturen
StrukturVorhandene InformationErforderliche Prüfung
Getrennte Gesprächsseiten, zwei KanäleAufnahmequelle jedes KanalsGetragene Gesprächsseite und Übersprechen
Ein gemischter KanalStimmen in einem gemeinsamen SignalSprecheretiketten und überlappende Sprache
StereodateiAudioanordnung mit zwei KanälenGetrennte Sprecher oder doppeltes Audio
Mehrere Personen auf einer SeiteKanal ohne eindeutige PersonenzuordnungKanal und Sprecher getrennt verfolgen

Zwei Kanäle einer Stereodatei belegen keine zwei verschiedenen Personen. Dieselbe Monoaufnahme könnte kopiert worden sein. Auch eine Gesprächsseite ist keine Personenidentität: Nach einer Weiterleitung kann dort ein anderer Mitarbeiter sprechen. Beschreiben Sie im Bericht die Bedeutung jedes technischen Etiketts. Klare Definitionen verringern das Risiko, spätere Aussagen der falschen Person zuzuordnen.

2. Eingabe- und Ausgabevertrag festlegen

Der Eingabevertrag sollte Codec, tatsächliche Abtastrate, Kanalzahl und Anordnung der Abtastwerte beschreiben. Zwei Kanäle in einer Datei und zwei unabhängige Streams sind unterschiedliche Verpackungen. Prüfen Sie die erwartete Anordnung der Erkennungsschnittstelle. Einen Kanal hinter den anderen anzuhängen stellt keine korrekte zeitliche Ausrichtung her.

Überlegen Sie getrennte Ausgabefelder für Kanaletikett, Sprecheretikett und Gesprächsrolle. Ein einziges Speaker-Feld kann diese Bedeutungen verschleiern. In einem Testbeispiel steht Kanal eins für den Anrufer und Kanal zwei für die Gegenstelle; dokumentieren Sie diese Beispielzuordnung. Prüfen Sie ihre Reihenfolge in neuen Sitzungen und Änderungen bei Weiterleitungen. Verwenden Sie ein geschätztes Sprecheretikett nicht als bestätigten Personennamen. Bleibt die Rolle unklar, sollte diese Unsicherheit im Ergebnis sichtbar bleiben.

3. Überlappung und Kanalvermischung testen

Sprechen zwei Personen gleichzeitig, können getrennte Quellkanäle beide Stimmen auf der Zeitachse erhalten. Echo oder Übersprechen kann eine Stimme dennoch auch in den anderen Kanal bringen. Die korrekte Kanalzahl allein reicht dann nicht. Hören Sie jeden Kanal einzeln und anschließend beide gemeinsam an, um Wiederholungen und Zeitverschiebungen zu prüfen.

Bereits gemischtes Audio in eine Datei mit zwei Kanälen zu schreiben gewinnt die ursprüngliche Quelltrennung nicht zurück. Sind Quellen vor der Mischung verfügbar, beginnen Sie den Vergleich dort. Nehmen Sie kurze gegenseitige Bestätigungen, längere Überlappungen und stille Abschnitte einer Seite in den Testsatz auf. Bewerten Sie Wortgenauigkeit und Sprecherzuordnung getrennt: Ein korrekt erkannter Satz kann dem falschen Sprecher zugeordnet sein. Die Lesbarkeit des gesamten Transkripts allein kann diesen Fehler verdecken und ihn in eine spätere Zusammenfassung übertragen.

4. Ein weitergeleitetes Supportgespräch verfolgen

In einem beispielhaften Supportgespräch spricht der Anrufer zunächst mit dem Empfang und anschließend mit einem Supportmitarbeiter. Trotz zweier Kanäle enthält die Gegenseite im zeitlichen Verlauf zwei Personen. Markieren Sie Begrüßung, Weiterleitung und Erklärung des neuen Mitarbeiters auf derselben Zeitachse. Unterscheiden Sie eine stabile Kanalzuordnung vom Personenwechsel.

Erscheint während der Wartezeit erneut die Stimme des früheren Mitarbeiters, prüfen Sie Wiederholung in der Aufnahme und tatsächliche Äußerung getrennt. Kontrollieren Sie bei Diarisierung das Etikett des neuen Mitarbeiters und die Konsistenz des Anruferetiketts durch Anhören. Prüfen Sie in einem Zusammenfassungsversuch auch die richtige Gesprächsseite jedes Satzes. Damit lässt sich ein Strukturfehler finden, bevor daraus eine falsche Zuständigkeit oder eine falsche Sprecherzusammenfassung entsteht.

5. Checkliste für Aufnahme und Bewertung

  • Dokumentieren Sie Quelle, Kanalnummer und Zuordnung zur Gesprächsrolle für jeden Kanal.
  • Vergleichen Sie Kanalzahl, Abtastrate und Anordnung der Abtastwerte mit dem tatsächlich gesendeten Audio.
  • Hören Sie Kanäle getrennt an und markieren Sie doppelte Daten, Echo, Übersprechen und Zeitverschiebungen.
  • Verwenden Sie für alle Kandidaten dieselben Beispiele mit Überlappung, langer Stille und Weiterleitung.
  • Führen Sie getrennte Ergebnisse für Wortgenauigkeit, Sprecherzuordnung und korrekte Rollenzuordnung.
  • Nutzen Sie für die Prüfung nur benötigte Aufnahmeabschnitte und identitätsunabhängige Etiketten. Kanaltrennung anonymisiert ein Gespräch mit personenbezogenen Informationen nicht automatisch.

6. Häufige Fragen

Ist Diarisierung bei zwei Kanälen überflüssig? Trennen zwei Kanäle zwei feste Sprecher sauber, kann die Kanalinformation genügen. Mehrere Personen auf einer Seite oder eine Konferenz können zusätzliche Sprechertrennung erfordern. Entscheiden Sie anhand der Aufnahme.

Bezeichnet Speaker 1 immer dieselbe Person? Prüfen Sie den Geltungsbereich im Ausgabevertrag der Erkennung. Eine Nummer innerhalb eines Ergebnisses belegt nicht dieselbe reale Person in einem anderen Gespräch.

Löst die Umwandlung von Mono zu Stereo das Problem? Eine neue Kanalanordnung trennt zuvor gemischte Quellen nicht automatisch. Prüfen Sie zuerst vorhandene Quellen und tatsächliche Trennung. Eine geänderte Dateibezeichnung allein belegt keinen Erfolg.

Quellen
  1. [1]Transcribe audio with multiple channels — Google Cloud, 2026-09-30 (abgerufen: 2026-10-01)
  2. [2]Detect different speakers in an audio recording — Google Cloud, 2026-09-30 (abgerufen: 2026-10-01)
Passende Lösungen

Erleben Sie es bei Ihren eigenen Anrufen.

In 5 Minuten eingerichtet. 5 $ Startguthaben bei der Registrierung, nutzungsbasierte Abrechnung — ohne Vertragsbindung.

Weiterlesen