# Kurumsal Türkçe ses teknolojisi nasıl değerlendirilir? STT ve TTS rehberi

- Source: https://www.cbot.ai/tr/kurumsal-turkce-ses-teknolojisi-nasil-degerlendirilir/

Kurumsal Türkçe ses teknolojisi, kurumun kendi çağrı kayıtları ve terminolojisiyle test edilerek değerlendirilir. Ses tanımada hata oranı, kritik bilgilerin doğruluğu ve gecikme; seslendirmede doğallık ve rakam, tutar, tarih okunuşu ölçülür, kurulum ve veri kontrolü ayrıca incelenir.
Kurumsal Türkçe ses teknolojisini değerlendirmenin güvenilir yolu, teknolojiyi kendi çağrı kayıtlarınızla ve kendi terminolojinizle sınamaktır. Ses tanıma (STT) için hata oranını, gecikmeyi ve özel terimlerdeki başarıyı; seslendirme (TTS) için doğallığı ve rakam, tutar, tarih gibi ifadelerin okunuşunu ölçersiniz. Bunlara kurum içine kurulabilirlik, veri kontrolü ve özelleştirme imkânı eklenir. Genel demolar ve vitrin kayıtları bu soruların hiçbirine cevap vermez.

## Türkçe ses teknolojisi neden ayrı bir değerlendirme ister?

Türkçe sondan eklemeli bir dildir. Bir kök, eklerle onlarca farklı kelime biçimine dönüşür. "Hesap", "hesabımdaki", "hesaplarımızdan" gibi biçimlerin hepsini doğru tanımak, kelimeyi bir sözlükte aramaktan çok daha fazlasını gerektirir. Ek ilişkileri ve cümle kalıpları da anlamı belirler.

Kurum terminolojisi ikinci zorluktur. Ürün adları, kampanya isimleri, mevzuat terimleri ve kısaltmalar genel amaçlı bir modelin eğitim verisinde çoğu zaman yer almaz. Model bu kelimeleri tanımadığında onlara benzeyen genel bir kelime yazar ve görüşmenin anlamı kayar.

Üçüncü zorluk, sesin geldiği kanaldır. Telefon hattı sesi genellikle 8 kHz örnekleme hızında, dar bir frekans bandında taşınır. Buna arka plan gürültüsü, mobil hat kesintileri, farklı aksanlar ve günlük konuşma alışkanlıkları eklenir. Stüdyo kaydında başarılı görünen bir model, çağrı merkezi sesinde aynı sonucu vermeyebilir.

## Ses tanıma (STT) nasıl değerlendirilir?

Değerlendirmenin temeli, kurumun kendi verisidir. Gerçek çağrılardan seçilen, farklı müşteri profillerini, hatları ve konuları temsil eden bir test kümesi hazırlanır. Kayıtların elle yazılmış doğru metinleri referans olarak kullanılır.

Bu kümede şu ölçütler incelenir:

- **Kelime hata oranı (WER):** Model çıktısının referans metinden ne kadar saptığını gösterir. Yanlış tanınan, atlanan ve fazladan eklenen kelimeler sayılır ve referanstaki kelime sayısına oranlanır. Türkçede eklerden kaynaklanan küçük farklar bu oranı etkiler, bu nedenle kendi başına yeterli bir gösterge değildir.
- **Varlık doğruluğu:** Müşteri numarası, tutar, tarih, ürün adı ve kişi adı gibi işlem için kritik bilgilerin doğru yakalanıp yakalanmadığı ayrıca ölçülür. Genel hata oranı iyi görünse de yanlış tanınan bir rakam işlemi bozar.
- **Terminoloji başarısı:** Kurumun ürün, kampanya ve mevzuat terimlerinden oluşan bir liste hazırlanır ve bu terimlerin tanınma durumu ayrı izlenir.
- **Koşullara göre kırılım:** Sonuçlar gürültülü ve sessiz ortam, sabit ve mobil hat, farklı aksanlar ve konuşma hızları için ayrı ayrı raporlanır. Ortalama, zayıf noktaları gizleyebilir.
- **Gecikme:** Akışlı tanımanın metni ne kadar hızlı ürettiği ölçülür. Telefonda müşteri sessizliği hemen fark eder, bu yüzden gecikme deneyimin doğrudan parçasıdır.

## Seslendirme (TTS) nasıl değerlendirilir?

Seslendirmede iki soru öne çıkar: ses kulağa doğal geliyor mu ve doğru okuyor mu?

Doğallık için dinleyici testleri yapılır. Farklı kişiler, kurumun gerçek cümlelerinden üretilen kayıtları tonlama, vurgu, duraklama ve akıcılık açısından puanlar. Uzun cümlelerde ve soru cümlelerinde tonlamanın nasıl değiştiği özellikle dinlenir.

Telaffuz doğruluğu için kurumun gerçekten seslendireceği metinlerden bir kontrol listesi hazırlanır:

- Tutarlar ve para birimleri, ondalıklı değerler
- Tarihler, saatler ve vade bilgileri
- Telefon numarası, poliçe numarası ve IBAN gibi uzun rakam dizileri
- Kısaltmalar ve harf harf okunması gereken ifadeler
- Marka, ürün ve yabancı kökenli adlar

Bu listede hatalı okunan ifadelerin bir telaffuz sözlüğü ya da SSML gibi bir işaretleme diliyle düzeltilip düzeltilemediği de sınanır. Ayrıca ses üretiminin gecikmesi ve görüşme boyunca tutarlılığı ölçülür.

## Kurulum, veri ve özelleştirme

Ses kayıtları ve transkriptler kişisel veri içerir. Bu nedenle teknolojinin nerede çalışacağı, değerlendirmenin teknik ölçütler kadar önemli bir parçasıdır. Ses tanıma ve seslendirmenin kurum içinde çalışıp çalışamayacağı, verinin onaylı ortamın dışına çıkıp çıkmadığı ve dış bir servise zorunlu bağımlılık bulunup bulunmadığı netleştirilir.

Özelleştirme de sorulması gereken bir konudur. Alan sözlüğü eklenebiliyor mu, model kurumun terminolojisine uyarlanabiliyor mu, markaya özel bir ses geliştirilebiliyor mu? Mevcut telefon ve çağrı merkezi altyapısıyla entegrasyon da değerlendirmeye dahil edilir. Son olarak, canlıya alındıktan sonra transkriptlerin ve hata nedenlerinin izlenip izlenemediği kontrol edilir, çünkü ses teknolojisi zaman içinde gerçek trafikle iyileşir.

## Değerlendirme adımları

1. Hedef çağrı akışlarını ve kritik bilgileri belirleyin.
2. Kendi kayıtlarınızdan temsil gücü yüksek bir test kümesi ve referans metinler hazırlayın.
3. Kurum terminolojisi ve okunuş kontrol listesini çıkarın.
4. Ses tanıma ve seslendirmeyi aynı koşullarda, koşul bazında kırılımlı olarak ölçün.
5. Kurulum modelini, veri akışını ve özelleştirme imkânlarını güvenlik ekibinizle birlikte inceleyin.
6. Sınırlı kapsamlı bir pilotla sonuçları gerçek trafikte doğrulayın.

## CBOT bu konuda ne sunar?

CBOT, konuşma tanıma ve seslendirme teknolojilerini CBOT Speech çatısı altında kendisi geliştirir. Bu teknolojiler Türkçenin dil yapısı, telaffuzu ve alana özel terimleri için derinlemesine optimize edilir. Akışlı konuşma tanıma; çağrı merkezi ve mobil ses kalitesi, ortam gürültüsü, günlük konuşma kalıpları ve sektör terimleri dikkate alınarak tasarlanır. Ayrıntılar [Voice AI sayfasında](/tr/cbot-speechi-taniyin/).

Seslendirme tarafında CBOT'un nöral ses teknolojisi telaffuzu, hızı, tonu ve duraklamaları kontrol edilebilen yanıtlar üretir. Özel ses profilleri, markaya özel ses geliştirme, SSML desteği ve telaffuz sözlükleri sunulur. Alan sözlüğü, marka ve ürün adları ile uzmanlık terimleri; özel sözlükler, model uyarlaması ve telaffuz ayarlarıyla desteklenir. CBOT, metin ve konuşma modellerini onaylı terminoloji, iş senaryoları ve iletişim standartlarıyla uyarlar. Bu yaklaşım [CBOT LLM sayfasında](/tr/cbot-llm-cbot/) anlatılır.

Kurulum tarafında konuşma tanıma, seslendirme, desteklenen model çıkarımı, RAG, çalışma zamanı, analitik ve entegrasyonlar dahil tüm ses yığını kurumun kendi ortamında çalışabilir. Tamamen on-premise mimaride ses kayıtları ve görüşmeler onaylı kurumsal ortamda kalır. Seçenekler [Kurulum Seçenekleri](/tr/konuslandirma-secenekleri/) sayfasında yer alır. CBOT mevcut IVR, SIP ve MRCP altyapısına entegre olur.

Halkbank'ta CBOT'un otomatik ses tanıma (ASR) ve metni sese dönüştürme (TTS) teknolojileri bankanın IVR sistemine entegre edilir ve çağrı merkezinde kullanılır. Ayrıntılar [Halkbank başarı hikâyesinde](/tr/case-study/client-story-halkbank/). Canlıdaki performans ise çağrı transkriptleri, aktarma ve başarısızlık nedenleriyle [analitik ve gözlemlenebilirlik](/tr/analitik-gozlemlenebilirlik/) araçlarında izlenir.

Ses teknolojisiyle ilgili diğer sık sorulan sorular [SSS sayfasında](/tr/sss/) toplanır.

## Sonuç

Türkçe ses teknolojisini seçerken belirleyici olan, kendi verinizde ölçtüğünüz sonuçlardır. Test kümenizi, terminoloji listenizi ve okunuş kontrol listenizi hazırladığınızda karşılaştırma nesnel bir zemine oturur. Kendi kayıtlarınızla bir değerlendirme planlamak için [CBOT ekibiyle görüşün](/tr/contact-us/).

## FAQ

### Kelime hata oranı (WER) nedir?

Kelime hata oranı, ses tanıma çıktısının elle yazılmış referans metinden ne kadar saptığını gösteren bir ölçüttür. Yanlış tanınan, atlanan ve fazladan eklenen kelimelerin referanstaki kelime sayısına oranıyla hesaplanır. Türkçede ek farkları bu oranı etkilediği için kritik bilgilerin doğruluğuyla birlikte okunur.

### Ses tanıma testi için kaç saatlik kayıt gerekir?

Sabit bir süre yerine temsil gücüne bakılır. Test kümesi farklı müşteri profillerini, sabit ve mobil hatları, gürültülü ortamları ve kurumun başlıca çağrı konularını kapsamalıdır. Her koşul için ayrı sonuç alabilecek kadar örnek bulunması yeterlidir.

### Yazılı içerikte iyi çalışan bir dil modeli sesli kanalda da yeterli olur mu?

Her zaman olmaz. Sesli kanalda model, ses tanımanın ürettiği metinle çalışır ve tanıma hataları anlamayı doğrudan etkiler. Ayrıca yanıtların hızlı üretilmesi ve seslendirmeye uygun biçimde kurulması gerekir.

### Konuşmadan konuşmaya mimari nedir?

Konuşmadan konuşmaya mimari, sesli girdiyi, yapay zekânın akıl yürütmesini ve sesli yanıtı ayrı adımlara bölmeden bütünleşik bir akışta işler. Ara dönüşümler azaldığı için gecikme düşer ve görüşme daha akıcı ilerler. CBOT bu mimariyi destekler.

### Ses teknolojisi canlıya alındıktan sonra nasıl iyileştirilir?

Canlı trafikteki transkriptler, aktarma ve başarısızlık nedenleri düzenli incelenir. Sık yanlış tanınan terimler alan sözlüğüne, hatalı okunan ifadeler telaffuz sözlüğüne eklenir. Gerekirse model, onaylı üretim geri bildirimiyle yeniden uyarlanır.
