Türkçe transkripsiyon projesine başlıyorsanız iki şeyi baştan bilin. Birincisi: whisper-1 ve GPT-4o transkripsiyon modelleri 26 Ağustos 2026'da deprecate edildi ve 26 Şubat 2027'de API'den kaldırılıyor. OpenAI'ın önerdiği model artık gpt-transcribe.
İkincisi: "Whisper Türkçe'de ne kadar iyi?" sorusunun tek bir cevabı yok; OpenAI'ın kendi makalesindeki ölçümlerde large-v2 için Fleurs'te %8,4, Common Voice 9'da %14,5 kelime hata oranı (WER) rapor edilmiş. Benchmark seçimi sonucu neredeyse ikiye katlıyor. Bu yazı, hangi modeli neye göre seçeceğinizi ve API ile yerel kurulum arasındaki gerçek maliyet eşiğini veriyor.
Önce takvim: hangi modeli seçerseniz seçin, tarihe bakın
| Model | Durum | Fiyat (USD/dk) |
|---|---|---|
gpt-transcribe | OpenAI'ın önerdiği kayıtlı konuşma modeli | 0,0045 |
gpt-live-transcribe | Gerçek zamanlı akış | 0,017 |
whisper-1 | 26.02.2027'de kaldırılıyor; kelime/segment zaman damgası için hâlâ tek yol | 0,006 |
gpt-4o-transcribe | 26.02.2027'de kaldırılıyor | 0,006 |
gpt-4o-mini-transcribe | 26.02.2027'de kaldırılıyor | 0,003 |
Buradaki tuzak şu: altyazı üretmek için kelime düzeyinde zaman damgası gerekiyor ve dokümantasyon bunun için hâlâ whisper-1 kullanmanızı söylüyor. Yani altyazı ürünü kuran bir ekip, kaldırılma tarihi belli bir modele bağımlı başlıyor. Bunu bilerek girin ve soyutlama katmanınızı modeli değiştirilebilir kılacak şekilde yazın.
API tarafında bilmeniz gereken dört sınır
- Dosya boyutu 25 MB. Bu bir öneri değil, sert sınır (bkz. OpenAI, Speech to text).
- Desteklenen formatlar:
mp3,mp4,mpeg,mpga,m4a,wav,webm. - Dil parametresi model ailesine göre değişti.
gpt-transcribeçoğullanguagesalıyor (ISO 639-1, seçili ISO 639-3 vezh-cn/zh-tw/zh-hk); eski modeller tekillanguagekullanıyor. - Zaman damgası için
whisper-1+response_format: "verbose_json"+timestamp_granularities: ["word"]üçlüsü gerekiyor (bkz. OpenAI, Speech to text).
25 MB sınırı pratikte her uzun kayıt projesinin ilk problemi. Bir saatlik toplantı kaydı MP3 olarak bu sınırı rahatlıkla aşıyor. Çözüm sesi parçalamak, ama rastgele parçalamak cümle ortasında kesip doğruluğu düşürüyor. Doğru yaklaşım sessizlik üzerinden bölmek:
# ffmpeg ile sessizliği tespit et (-35 dB altı, en az 0.6 saniye)
ffmpeg -i toplanti.m4a -af silencedetect=noise=-35dB:d=0.6 -f null - 2> sessizlik.txt
# Tespit edilen noktalardan, her parça ~20 dakikayı geçmeyecek şekilde kes
ffmpeg -i toplanti.m4a -ss 00:00:00 -to 00:19:47 -c copy parca_01.m4a
Parçaları birleştirirken her parçanın başlangıç ofsetini saklayın; zaman damgalarını bu ofsetle toplamadan birleştirilmiş altyazı üretemezsiniz.
Sesi transkripsiyona göndermeden önce 16 kHz mono'ya düşürün. Modeller zaten bu örnekleme hızında çalışıyor; 48 kHz stereo göndermek dosyayı üç katına çıkarıp 25 MB sınırına erken çarpmanıza yol açıyor ve doğruluğa katkısı yok.
Türkçe doğruluk: tek bir rakam vermek yanıltıcı
OpenAI'ın Whisper makalesi (arXiv:2212.04356) dil bazlı WER tabloları içeriyor. Türkçe satırları:
| Model | Fleurs WER | Common Voice 9 WER |
|---|---|---|
| tiny | %42,5 | %53,6 |
| base | %27,5 | %38,6 |
| small | %15,9 | %23,7 |
| medium | %10,4 | %17,7 |
| large | %9,4 | %16,6 |
| large-v2 | %8,4 | %14,5 |
Bu tablodan çıkan iki karar var. Birincisi, small'dan medium'a geçiş Türkçe'de WER'i üçte bir oranında düşürüyor; medium'dan large'a geçişin kazancı çok daha küçük. Yerel kurulumda donanım bütçeniz sınırlıysa duracağınız yer medium.
İkincisi, aynı modelin iki benchmark'taki farkı (%8,4 ve %14,5) size şunu söylüyor: ses kalitesi ve konuşma tarzı, model seçiminden daha belirleyici. Stüdyo kalitesinde okunan metinle telefon hattından gelen doğal konuşma arasındaki fark, iki model kuşağı arasındaki farktan büyük. Kendi ses örneklerinizle ölçmeden söz vermeyin.
Not: makale large-v2'ye kadar gidiyor; large-v3 için yayımlanmış bir Türkçe rakam yok, repodaki dil kırılımı grafiği sayısal etiket içermiyor (bkz. Radford ve ark., arXiv:2212.04356, Tablo 11 ve 13).
Yerel kurulum: donanım tablosu ve gerçek eşik
Açık kaynak Whisper deposundaki model boyutları:
| Model | Parametre | VRAM | Göreli hız |
|---|---|---|---|
| tiny | 39 M | ~1 GB | ~10x |
| base | 74 M | ~1 GB | ~7x |
| small | 244 M | ~2 GB | ~4x |
| medium | 769 M | ~5 GB | ~2x |
| large | 1550 M | ~10 GB | 1x |
| turbo | 809 M | ~6 GB | ~8x |
turbo, large'ın yarısından az parametreyle sekiz kat hız veriyor; ama çeviri için eğitilmemiş. Türkçe sesi Türkçe metne çeviriyorsanız sorun yok; Türkçe sesi İngilizce metne çevirmek istiyorsanız kullanamazsınız (bkz. openai/whisper deposu).
Maliyet eşiği hesabı basit. API tarafında gpt-transcribe dakikası 0,0045 USD; yani 10.000 saatlik bir arşiv yaklaşık 2.700 USD. Buna karşılık large çalıştıracak bir GPU'nun aylık kirası bu rakamın önemli bir bölümünü tek ayda yiyor.
Yerel kurulumu maliyet için değil, veri için tercih edin. Ses kaydı yurt dışına çıkamıyorsa (sağlık, çağrı merkezi kayıtları, hukuki görüşmeler) yerel kurulum zorunlu; salt maliyet gerekçesiyle seçildiğinde genellikle daha pahalıya geliyor.
Bu şurada kırılıyor: özel isimler, kod-değiştirme ve gürültü
Türkçe transkripsiyonda üç tekrar eden hata sınıfı var ve ikisinin çözümü model değiştirmek değil:
- Özel isimler ve alan terimleri. İlaç adları, hastane adları, ürün kodları sistematik olarak yanlış yazılıyor. Çözüm son işlem (post-processing): bir terim sözlüğü kurup çıktı üzerinde bulanık eşleme yapın. Modeli değiştirmek bunu düzeltmiyor.
- Kod-değiştirme. Türkçe konuşmanın içine giren İngilizce teknik terimler ("deployment yaptık", "release'i çektik") modelin dil tahminini bozuyor. Dil parametresini açıkça Türkçe olarak sabitleyin; otomatik tespite bırakmayın.
- Örtüşen konuşma. İki kişi aynı anda konuştuğunda modeller birini düşürüyor. Konuşmacı ayrıştırma (diarization) gerektiren toplantı senaryolarında bunu bir kabul kriteri olarak yazın; "toplantı özeti" vaat eden bir ürün burada kırılıyor.
Dördüncü ve en sinsi olanı: sessizlikte üretilen metin. Uzun sessizlik bloklarında modeller bazen var olmayan cümleler üretiyor. Gerçek konuşma içermeyen parçaları transkripsiyona hiç göndermemek, bu artefaktı büyük ölçüde ortadan kaldırıyor; yukarıdaki silencedetect adımı bu işi de görüyor.
KVKK tarafı: ses kaydı biyometrik veri mi?
Kısa cevap: kimlik doğrulama amacıyla ses izi çıkarıyorsanız evet, düz transkripsiyon yapıyorsanız hayır. Ama ses kaydının içeriği çoğu zaman özel nitelikli veri barındırıyor — çağrı merkezinde sağlık şikâyeti, hukuk bürosunda ceza mahkûmiyeti bilgisi. 6698 sayılı Kanun'un 6. maddesi 7499 sayılı Kanun ile değişti ve özel nitelikli veriler için işleme şartları yeniden düzenlendi.
Üç somut önlem: sesi transkripsiyondan sonra saklama süresi dolunca silin, metin çıktısında kimlik bilgilerini maskeleyecek bir adım koyun, ve dış servise gönderim yapıyorsanız yurt dışına aktarım rejimini çözün. Sağlık verisi özelindeki kontrol listesi KVKK özel nitelikli sağlık verisi yazısında; veriyi kendi sunucunuzda işlemek istiyorsanız kurumsal yerel LLM kurulumu rehberi aynı mantığı model tarafı için anlatıyor.
Sırada ne var
Kendi ses örneklerinizden 30 dakikalık temsili bir küme ayırın, elle doğru transkripsiyonunu çıkarın ve aday modelleri bunun üzerinde ölçün. Bu yarım günlük iş, model seçimi tartışmasını bitiriyor ve müşteriye verdiğiniz doğruluk sözünü ölçülebilir hâle getiriyor. Ardından soyutlama katmanınızı yazın: 26 Şubat 2027'de model değiştirmek zorunda kalacaksınız.
Ses ve LLM entegrasyonlarına yaklaşımımızı yapay zeka entegrasyonları sayfasında, kapsam çıkarmak için proje fiyat hesaplama aracında bulabilirsiniz.
Teknik ayrıntılar 25 Eylül 2026 tarihinde doğrulanmıştır: OpenAI speech-to-text kılavuzu (25 MB sınırı, format listesi, model önerisi), OpenAI deprecations sayfası (26.08.2026 / 26.02.2027 tarihleri), OpenAI fiyat sayfası, github.com/openai/whisper deposu (model boyutları ve VRAM tablosu) ve Whisper makalesi arXiv:2212.04356 Tablo 11 ve 13 (Türkçe WER). Fiyatlar ve model adları hızla değişiyor. KVKK atfı hukuki görüş yerine geçmez.