AvaritCall · Redaktion
G.711, G.722 und Opus: den richtigen Audiocodec wählen
Vergleichen Sie G.711, G.722 und Opus anhand von Kompatibilität, Medienpfad und STT-Eingang. So treffen Sie Entscheidungen, ohne Abtastrate und RTP-Takt miteinander zu verwechseln.
Kurzantwort: Prüfen Sie zuerst, welcher Codec über alle Gesprächsabschnitte tatsächlich verwendet werden kann. Bewerten Sie danach eine größere Audiobandbreite oder die Anpassung an Netzbedingungen. G.711 kommt bei der Untersuchung der Telefonkompatibilität infrage, G.722 bei einem breitbandigen Telefonpfad und Opus bei einem anpassbaren Medienkonzept. Der Name allein entscheidet nichts.
Die Kandidaten verstehen
PCMA bezeichnet G.711 mit A-law, PCMU mit μ-law. Im RTP-Profil haben beide 8 kHz und 8 Bit je Abtastwert; die codierte Nutzlast beträgt damit 64 kbit/s. [1] G.722 codiert ein Audioband von 7 kHz innerhalb von 64 kbit/s. [2] Opus unterstützt unterschiedliche Audiobandbreiten und Bitraten. [3] Diese Fakten sind ein Ausgangspunkt. Untersuchen Sie Anbieter, Telefonanlage, Browser, Aufzeichnung und Spracherkennung gemeinsam, bevor Sie eine Implementierung festlegen.
Abtastrate und RTP-Takt getrennt behandeln
G.722 tastet Audio mit 16 kHz ab, verwendet aus Kompatibilitätsgründen jedoch einen RTP-Takt von 8 kHz. [1] Opus verwendet in jedem Modus einen RTP-Takt von 48 kHz. [4] Übernehmen Sie den SDP-Takt deshalb nicht unmittelbar als Abtastrate des decodierten PCM. Halten Sie Codec, Zeitstempeltakt und Decoder-Ausgabeformat im Medienadapter getrennt. Eine gemeinsame Variable namens „rate“ verschleiert bei der Fehlersuche, welche Zeitbasis sich tatsächlich geändert hat.
Nach der Aufgabe vergleichen
| Kandidat | Erste Untersuchung | Benötigter Nachweis |
|---|---|---|
| G.711 / PCMA / PCMU | Gemeinsame Codierung an der Telefongrenze | Tatsächlich ausgehandelter Codec je Abschnitt |
| G.722 | Erhalt des breitbandigen Pfads | Medienübersicht zwischen Telefon und Anlage |
| Opus | Medieneinstellungen für Netzbedingungen | Endpunktparameter und Gesprächsbeispiele |
Diese Tabelle ist keine Qualitätsrangliste. Beim Empfang zählen neben verständlicher Sprache auch die richtige Weiterleitung, Ton nach dem Halten und eine verarbeitbare Aufzeichnung. Dokumentieren Sie, warum ein Kandidat ausscheidet: fehlt ein gemeinsamer Codec am Gegenüber, verlangt eine Brücke ein anderes Format oder wurden die gewünschten Einstellungen noch nicht überprüft? Eine konkrete Begründung ermöglicht späteren Teammitgliedern eine erneute Bewertung, ohne die ursprünglichen Annahmen erraten zu müssen.
Den vollständigen Medienpfad untersuchen
Bei einer beispielhaften Supportleitung können Kundentelefon, Netzbetreiber, Unternehmensanlage und Anwendung unterschiedliche Grenzen setzen. Kennzeichnen Sie an jeder Grenze eingehende Codierung, ausgehende Codierung und Umwandlungsstelle. Prüfen Sie vor einer Änderung der Präferenzliste das tatsächlich ausgehandelte Format. Eine angebotene Option ist noch keine angenommene Option. Wiederholen Sie die Prüfung beim Weiterleiten und nach dem Halten. Beschreiben Sie den Ersatzpfad so, dass das Betriebsteam ihn verwenden kann, wenn der bevorzugte Weg nicht aufgebaut wird.
Wenn eine Umwandlung erforderlich ist, empfehlen wir eine ausdrücklich benannte Grenze. Vervielfachen Sie separate Transformationen für Aufzeichnung, Mithören und STT nicht ohne nachvollziehbaren Grund. Die dokumentierte Anforderung jedes Zweigs erhält die Entscheidungsgrundlage, sobald ein weiterer Anbieter eingebunden wird, und erleichtert spätere Änderungen.
Praxisbeispiel: ein Anruf am Empfang
Ein fiktives Hotel untersucht G.722 für seine IP-Telefone und betrachtet den externen Telefonabschnitt gesondert. Der Adapter erfasst G722/8000-Signalisierung und decodierte PCM-Ausgabe mit 16 kHz in verschiedenen Feldern. [1] Anschließend prüft das Team Begrüßung, gesprochene Zimmernummer, Weiterleitung und Gesprächsende anhand desselben Ablaufs. Ziel ist ein sichtbares Audioformat an jeder Station; ein pauschaler Sieger unter den Codecs wird dadurch nicht bestimmt.
Falls beim Anhören Verzerrungen auffallen, vergleichen Sie neben der endgültigen Aufzeichnung auch Proben vor und nach der betreffenden Umwandlung. Eine veränderte Codec-Reihenfolge kann die Ursache verdecken, solange die erste fehlerhafte Grenze unbekannt bleibt. Verwenden Sie gleichbleibende Testformulierungen, damit Prüfer dieselbe Sprache beurteilen.
STT mit einem eigenen Eingabevertrag anbinden
Ein Dienst zur Spracherkennung muss den für das Telefongespräch ausgehandelten Codec nicht unverändert akzeptieren. Der Adapter sollte Audio mit passender Codierung, Kanalanordnung und tatsächlicher Abtastrate bereitstellen. Ermitteln Sie vor jeder nötigen Umwandlung, was die Eingangsdaten genau darstellen. Trennen Sie die Codec-Präferenz von der Auswahl des Erkennungsmodells; sonst lässt sich eine veränderte Transkription weder dem Medienpfad noch dem Modell eindeutig zuordnen. Beschreiben Sie die Umwandlung neben ihrer Konfiguration.
Checkliste für die Inbetriebnahme
- Angebotene und ausgewählte Codecs für jeden Gesprächsabschnitt getrennt erfassen.
- Decoder-Ausgabe, RTP-Takt und Kanalanordnung unabhängig prüfen.
- Umwandlungsgrenzen für Aufzeichnung und STT in der Medienübersicht markieren.
- Begrüßung, Stille, gleichzeitiges Sprechen, Weiterleitung und Wiederverbindung anhören.
- Entscheidungsgrund, Ersatzpfad und Anlass für eine erneute Prüfung dokumentieren.
Häufige Fragen
Welcher Codec ist der beste? Ohne gemeinsamen Medienpfad und konkrete Aufgabe gibt es keine allgemeingültige Antwort. Externe Anrufe und interne Gespräche desselben Unternehmens können unterschiedliche Entscheidungen rechtfertigen. Definieren Sie zunächst akzeptable Gesprächsbedingungen und bewerten Sie die Kandidaten anschließend daran.
Stellt eine höhere Abtastratenangabe verlorene Details wieder her? Nein. Eine erneute Abtastung allein gewinnt zuvor entfernte Frequenzinformationen nicht zurück. Unterscheiden Sie die Grenzen des Quellsignals vom Ausgabeformat; eine geänderte Dateiangabe liefert keine neuen Sprachinformationen. [5]
Sollte STT nach einem Codec-Wechsel erneut geprüft werden? Ja. Prüfen Sie den Eingabevertrag und die tatsächlich erzeugte Audiodarstellung erneut. Ein erfolgreich aufgebautes Gespräch beweist noch nicht, dass alle nachfolgenden Verarbeitungsschritte korrekt beschriebenes Audio erhalten.
- [1]RFC 3551: RTP Profile for Audio and Video Conferences with Minimal Control — IETF / RFC Editor, 2003-07 (abgerufen: 2026-10-01)
- [2]ITU-T G.722 (09/2012): 7 kHz audio-coding within 64 kbit/s — ITU-T, 2012-09-13 (abgerufen: 2026-10-01)
- [3]RFC 6716: Definition of the Opus Audio Codec — IETF / RFC Editor, 2012-09 (abgerufen: 2026-10-01)
- [4]RFC 7587: RTP Payload Format for the Opus Speech and Audio Codec — IETF / RFC Editor, 2015-06 (abgerufen: 2026-10-01)
- [5]Best practices: Cloud Speech-to-Text — Google Cloud, 2026-09-30 (abgerufen: 2026-10-01)
