AvaritCall · Editör ekibi
Telefon sesinde STT doğruluğu: WER ve kritik alan testi
Telefon görüşmelerinde STT doğruluğunu yalnız genel WER ile değerlendirmeyin. Temsili Türkçe çağrılar, codec uyumu ve isim, numara, tarih ölçümleriyle tekrarlanabilir bir test kurun.
Telefon konuşmasını metne çeviren bir STT sistemini, gerçek çağrı yolundan geçen temsil edici Türkçe seslerle test edin. WER genel kelime hatasını gösterir; sipariş numarası, kişi adı ve randevu tarihi için ayrıca doğruluk ölçün. Temiz mikrofon kaydındaki iyi sonuç, telefon kanalındaki başarıyı kanıtlamaz. Karar vermek için aynı kayıtları, aynı referansları ve aynı değerlendirme kurallarını kullanmak gerekir.
1. Türkçe telefon konuşmasını temsil eden bir veri seti kurun
Veri setinin çekirdeğini gerçek iş akışına benzeyen çağrılar oluşturmalıdır. Destek hattında ürün adları, sorun anlatımı, adres ve sipariş numarası; resepsiyonda isim, tarih, saat ve düzeltmeler bulunmalıdır. Yavaş ve hızlı konuşma, bölgesel söyleyişler, farklı cihazlar, arka plan konuşması ve kesintili cümleleri ayrı dilimler halinde etiketleyin. Türkçe içinde kullanılan yabancı marka adlarını da unutmayın.
Kolay kayıtlar tüm havuza hakim olursa genel ortalama zor çağrıları gizler. Önce beklenen çağrı dağılımını yazın, ardından her önemli dilim için yeterli örnek toplayın. Kısa komutlarla uzun açıklamaları ayrı değerlendirin. Kontrollü okuma kayıtları belirli sesleri ve sayıları sınamak için yararlıdır; doğal telefon diyaloglarını da mutlaka kullanın. Geliştirme ve son değerlendirme havuzlarını konuşmacı ve çağrı oturumu temelinde ayırın. Son değerlendirme kayıtlarını sürekli ayar yapmak için kullanmayın.
2. WER’i ortak referansla hesaplayın
WER = (S + D + I) / N. S, değiştirilen; D, silinen; I, eklenen kelime sayısıdır; N referanstaki kelime sayısıdır. Yüzde için sonuç 100 ile çarpılır. [1] NIST’in SCTK/sclite aracı referans ve sistem metnini hizalayarak kelime hatalarını sayabilir. [2]
Sentetik hesap örneği: N=100, S=5, D=3 ve I=2 olduğunda WER %10’dur. Gerçek değerlendirmede insan tarafından hazırlanmış, kontrol edilmiş referans metin kullanın. Noktalama, büyük harf, kısaltma ve sayı yazımı kurallarını ölçümden önce sabitleyin. Türkçedeki I, ı, İ ve i dönüşümlerini dikkatsizce uygulamak sonucu bozabilir. Ham çıktıyı ve normalize edilmiş çıktıyı birlikte saklayın; kuralları sonuca bakarak değiştirmeyin. Toplam WER için tüm kayıtların hata sayılarını ve referans kelimelerini toplayın; çağrı yüzdelerinin basit ortalamasını kullanmayın.
3. İş açısından kritik alanları ayrı ölçün
Bir dolgu kelimesiyle telefon numarasındaki yanlış rakam, WER’de benzer ağırlık taşıyabilir; süreç üzerindeki etkileri çok farklıdır. Aşağıdaki alan ölçümleri bu farkı görünür kılmak için önerilen değerlendirme tasarımıdır. Her metrikle birlikte doğru örnek sayısını ve toplam örnek sayısını gösterin. Yalnız bir yüzde yayınlamak, az örnekli bir dilimde gereğinden fazla güven yaratır.
| Alan | Önerilen ölçüm | Değerlendirme kuralı |
|---|---|---|
| İsim ve varlık | Doğru alan / etiketli alan | Önceden tanımlanan eşdeğer yazımları kullanın |
| Telefon veya sipariş numarası | Tam doğru dizi / etiketli dizi | Rakam sırasını ve baştaki sıfırları koruyun |
| Tarih ve saat | Doğru yorum / etiketli ifade | Çağrı tarihi ve saat bağlamını sabitleyin |
| Kritik yanlış onay | Yanlış bilgiyle onaylanan görev sayısı | Hata türünü çağrı bazında inceleyin |
Sayıları kelimeye veya rakama çeviren normalizasyon, metin eşleştirmesini kolaylaştırabilir. Ancak yanlış bir numarayı doğruymuş gibi dönüştürmemelidir. Tarih için de aynı dikkat gerekir: yarın ifadesini değerlendirmek, çağrının hangi gün gerçekleştiğini bilmeyi gerektirir.
4. Codec ve örnekleme zincirini gerçek çağrıyla eşleştirin
Test sesinin codec’i, örnekleme hızı ve STT’ye ulaştığı nokta canlı akışla eşleşmelidir. Bir masaüstü mikrofon kaydını yalnız dosya uzantısını değiştirerek telefon kaydına çevirmiş olmazsınız. Dar bant bir kaydı 8 kHz’den 16 kHz’e yeniden örneklemek de kaybolmuş frekansları geri getirmez; yeni örnekler mevcut sinyalden hesaplanır. Torchaudio belgesi bunu bant sınırlı interpolasyonla açıklar. [3]
Örnek bir randevu testinde kullanıcı Kadıköy’de yarın iki buçuk der, sonra saat üç olsun diye düzeltir. Hem ara transkripti hem son transkripti kaydedin; son tarihin ve saatin doğru alanlara geçip geçmediğini inceleyin. Aynı çağrıyı ağ bozulması olmadan ve kontrollü bozulmayla karşılaştırın. Yanlışlık sesi çözmede mi, konuşma bölütlemede mi, son düzeltmeyi işlemekte mi ortaya çıktı, bunu ayırın. Dosya testi sonrasında canlı çağrı doğrulaması yapın.
5. Tekrarlanabilir test için kontrol listesi
- Kayıt kimliği, çağrı senaryosu, konuşmacı grubu, codec, örnekleme hızı ve kanal koşullarını veri setine ekleyin.
- Referansları ikinci bir dinleyiciyle kontrol edin; anlaşılmayan bölümler için ölçümden önce ortak bir işaretleme kuralı belirleyin.
- Aynı test havuzunu her adayla çalıştırın. Model sürümünü, dil ayarını, sözlükleri ve tüm ön işleme adımlarını kaydedin.
- Toplam WER yanında senaryo dilimlerini, kritik alanları ve hata örneklerini raporlayın. Akışın geçici ve son çıktısını karıştırmayın.
- Kabul sınırlarını görev riskine göre önceden belirleyin; sonrasında yeni gerçek çağrı örnekleriyle sonucu doğrulayın.
6. Sık sorulan sorular
En düşük WER her zaman en iyi seçenek midir? Hayır. Genel metni iyi tanıyan bir sistem, sizin sık kullanılan isimlerinizi veya numaralarınızı kaçırabilir. Kararınızı temsili görevlerdeki alan doğruluğu ve çağrı deneyimiyle tamamlayın.
Küçük bir test havuzu yeterli midir? İlk hataları bulmak için yararlıdır. Yaygın ve zor dilimlerin her biri için yeterli örnek bulunmadan genelleme yapmayın. Örnek sayısını sonuçla birlikte görünür tutun.
Yeni STT sürümünü nasıl karşılaştırmalıyım? Kilitli değerlendirme havuzunu aynı kurallarla yeniden çalıştırın. Kazanım ve kayıpları çağrı bazında dinleyin; yalnız genel ortalamaya bakmak kritik bir alanın gerilemesini gizleyebilir.
- [1]KWS15 Keyword Search Evaluation Plan, section 6: Speech-to-Text Evaluation — National Institute of Standards and Technology (NIST), 2015-02-03 (erişim: 2026-10-01)
- [2]NIST SCTK: sclite scoring documentation — National Institute of Standards and Technology (NIST) (erişim: 2026-10-01)
- [3]Audio Resampling tutorial — PyTorch / Torchaudio (erişim: 2026-10-01)
