Google, ses tanıma ve konuşmayı metne dönüştürme (Speech-to-Text / STT) teknolojilerinde bugüne kadarki en gelişmiş ve hassas yapay zeka modeli olan Gemini 3.5 Transcribe‘ı resmi olarak tanıttı. Arka plan gürültüsü, sektörel terminoloji ve günlük konuşma dilindeki duraksamalar gibi geleneksel modellerin tıkandığı alanları çözmeyi hedefleyen model, ham ses sinyallerini doğrudan kusursuz, düzenli ve yapılandırılmış metne dönüştürüyor.
Geleneksel STT Modellerinin Ötesinde: Akıllı Transkripsiyon
Konvansiyonel konuşma tanıma sistemleri, konuşmacının ağzından çıkan her sesi harfiyen yazıya dökmeye çalışırken bağlamı, konuşma bozukluklarını ve anlık düzeltmeleri yakalamakta zorlanır. Gemini 3.5 Transcribe ise ham sesi işlerken konuşmacının gerçek niyetini anlayan çok modlu bir zeka katmanı sunuyor.
Model; konuşma sırasındaki tereddütleri, “ııı”, “şey”, “ee” gibi gereksiz dolgu sözcüklerini (filler words) otomatik olarak ayıklıyor ve noktalama işaretleriyle birlikte okunabilirliği yüksek bir metin çıktısı üretiyor.
Gemini 3.5 Transcribe’ın Temel Yetenekleri

1. Akıllı Metin Dönüştürme (Smart Transcription)
- Kendini Düzeltme Algılama: Konuşmacının anlık fikir değişikliklerini (örneğin; “Toplantıyı Salı günü yapalım—hayır, Çarşamba olsun”) kavrayarak nihai metne yalnızca hedeflenen kararı aktarır.
- Dolgu Sözcük Temizliği: Konuşma akışını bozan gereksiz sesleri filtreler.
- Otomatik Formatlama: Paragrafları, cümle sonlarını, listeleri ve noktalama işaretlerini bağlama göre otomatik olarak yerleştirir.
2. İşlev Çağırma (Function Calling) Desteği
Gemini 3.5 Transcribe, yalnızca sesi yazıya dökmekle kalmıyor; sesli komutları algılayarak arka plandaki diğer Gemini modellerini tetikleyebiliyor. Örneğin bir sesli komutla doğrudan görsel üretimi veya dosya analizi başlatılabiliyor.
3. Düşük Kelime Hata Oranı (WER) ve Hassasiyet
Artificial Analysis tarafından gerçekleştirilen bağımsız test sonuçlarına göre model:
- Canlı Akışta (Streaming):%4,0 Kelime Hata Oranı (WER)
- Kayıtlı Dosyalarda (Non-Streaming):%2,6 Kelime Hata Oranı (WER)
Gürültülü gerçek dünya koşullarında, telefon hatlarında veya arka plan seslerinin yoğun olduğu ortamlarda sipariş numaraları, posta kodları ve alfanumerik kimlik dizilerini eksiksiz tanır.
4. Özel Terminoloji ve Jargon Desteği (Custom Vocabulary)
Tıp, hukuk, mühendislik gibi alanlara özgü teknik terimler, şirket içi kısaltmalar ve özel marka adları önceden sisteme tanımlanarak transkripsiyon doğruluğu en üst düzeye çıkarılabiliyor.
5. 85’ten Fazla Dil ve Bölgesel Aksan Desteği
Model, 85’in üzerinde dilde otomatik dil algılama ve döküm yeteneğine sahip. Canlı konuşma esnasında gerçekleşen anlık dil geçişlerini ve bölgesel şive farklılıklarını sorunsuz bir şekilde takip eder.
6. Çoklu Konuşmacı Ayrımı (Speaker Diarization)
Kayıtlı ses dosyalarında 3 farklı konuşmacıya kadar sesleri kelime düzeyinde zaman damgalarıyla etiketler (3’ten fazla konuşmacı desteği deneysel olarak sunulmaktadır).
Performans Karşılaştırması: Chirp 3’e Kıyasla %70 Daha Hızlı

Google’ın bir önceki nesil ses işleme modeli Chirp 3 ile kıyaslandığında Gemini 3.5 Transcribe; işlem süresi, doğruluk ve gecikme parametrelerinde önemli sıçramalar gösteriyor:
- Nihai Metne Ulaşma Süresi: Chirp 3’e kıyasla %70 oranında hızlanma sağlandı.
- FLEURS Kıyaslama Testi: Çok dilli değerlendirmelerde akış modunda %5,50 WER, kayıtlı dosya modunda ise %5,04 WER performansı kaydedildi.
Geliştiriciler İçin Çift API Mimarisi
Gemini 3.5 Transcribe, geliştiricilerin ihtiyaçlarına göre iki ayrı uç nokta (endpoint) üzerinden kullanıma sunuldu:
| API Yapısı | Model Kodu | Kullanım Alanı & Özellikler |
| Real-time Streaming | gemini-3.5-transcribe-live | Live API: Saniye altı (sub-second) gecikmeyle çalışan interaktif sesli yapay zeka asistanları, anlık altyazı sistemleri ve iki yönlü ses akışları. |
| Pre-recorded Audio | gemini-3.5-transcribe | Interactions API: Toplantı kayıtları, müşteri hizmetleri çağrı kayıtları, arşiv transkripsiyonu ve konuşmacı etiketli analizler. |
Google Ekosistemine Entegrasyon
Gemini 3.5 Transcribe yalnızca bir API olarak kalmayıp doğrudan Google ürünlerinin kalbine yerleştiriliyor:
- Android (Gboard & Rambler): Kullanıcıların sesli düşüncelerini doğrudan düzenli paragraflara döker; konuşarak yazım tarzını veya hataları anında düzeltme olanağı tanır.
- Google Antigravity & AI Studio: Geliştiricilerin doğrudan sesle kodlama (vibe coding) yapabilmesi için ekran içeriğini, aktif dokümanları ve sohbet geçmişini referans alarak dosya isimlerini ve teknik komutları hatasız yazıya çevirir.
- macOS Gemini Uygulaması: Ekranda açık olan belgelerle konuşma bağlamını eşleştirir; sesli komutla metin özetleme veya imlecin bulunduğu yerde görsel üretme gibi çok adımlı görevleri yönetir.
- Google Chrome (Yakında): Tarayıcı üzerindeki herhangi bir metin giriş kutusunda sesle doğrudan metin oluşturma ve düzenleme desteği sunulacak.
Erken Aşama Ekosistem ve İş Ortakları
Gemini Live API entegrasyonu; Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel ve Vision Agents gibi önde gelen ses ve gerçek zamanlı medya altyapı sağlayıcıları tarafından destekleniyor.
Ayrıca Vivo, IntelliTek Health ve Lingopal gibi şirketler, ilk testlerde modelin çok dilli doğruluğunu, düşük gecikme süresini ve sağlık/teknoloji terminolojisindeki başarısını doğrulayan geri bildirimlerde bulundu.
Erişim ve Kullanılabilirlik Durumu
- Geliştiriciler İçin: Google AI Studio ve Google Antigravity üzerinden Gemini API genel önizlemesinde (Public Preview) erişilebilir.
- Kurumsal Müşteriler İçin: Gemini Enterprise Agent Platform üzerinden kullanıma açıldı; yakında Gemini Enterprise for Customer Experience paketine eklenecek.
- Kullanıcılar İçin: macOS Gemini uygulamasında (İngilizce), Android Rambler özelliğinde (belirli bölgelerde) ve yakında masaüstü Chrome tarayıcısında aktif olacak.
Yorumlar (0)