Google, Akıllı Ses Dönüşüm Modeli Gemini 3.5 Transcribe’ı Duyurdu: İşte Tüm Detaylar

Google, Akıllı Ses Dönüşüm Modeli Gemini 3.5 Transcribe’ı Duyurdu: İşte Tüm Detaylar

Google, ses tanıma ve konuşmayı metne dönüştürme (Speech-to-Text / STT) teknolojilerinde bugüne kadarki en gelişmiş ve hassas yapay zeka modeli olan Gemini 3.5 Transcribe‘ı resmi olarak tanıttı. Arka plan gürültüsü, sektörel terminoloji ve günlük konuşma dilindeki duraksamalar gibi geleneksel modellerin tıkandığı alanları çözmeyi hedefleyen model, ham ses sinyallerini doğrudan kusursuz, düzenli ve yapılandırılmış metne dönüştürüyor.

Geleneksel STT Modellerinin Ötesinde: Akıllı Transkripsiyon

Konvansiyonel konuşma tanıma sistemleri, konuşmacının ağzından çıkan her sesi harfiyen yazıya dökmeye çalışırken bağlamı, konuşma bozukluklarını ve anlık düzeltmeleri yakalamakta zorlanır. Gemini 3.5 Transcribe ise ham sesi işlerken konuşmacının gerçek niyetini anlayan çok modlu bir zeka katmanı sunuyor.

Model; konuşma sırasındaki tereddütleri, “ııı”, “şey”, “ee” gibi gereksiz dolgu sözcüklerini (filler words) otomatik olarak ayıklıyor ve noktalama işaretleriyle birlikte okunabilirliği yüksek bir metin çıktısı üretiyor.

Gemini 3.5 Transcribe’ın Temel Yetenekleri

google akilli ses donusum modeli gemini 3 5 transcribei duyurdu iste tum detaylar

1. Akıllı Metin Dönüştürme (Smart Transcription)

  • Kendini Düzeltme Algılama: Konuşmacının anlık fikir değişikliklerini (örneğin; “Toplantıyı Salı günü yapalım—hayır, Çarşamba olsun”) kavrayarak nihai metne yalnızca hedeflenen kararı aktarır.
  • Dolgu Sözcük Temizliği: Konuşma akışını bozan gereksiz sesleri filtreler.
  • Otomatik Formatlama: Paragrafları, cümle sonlarını, listeleri ve noktalama işaretlerini bağlama göre otomatik olarak yerleştirir.

2. İşlev Çağırma (Function Calling) Desteği

Gemini 3.5 Transcribe, yalnızca sesi yazıya dökmekle kalmıyor; sesli komutları algılayarak arka plandaki diğer Gemini modellerini tetikleyebiliyor. Örneğin bir sesli komutla doğrudan görsel üretimi veya dosya analizi başlatılabiliyor.

3. Düşük Kelime Hata Oranı (WER) ve Hassasiyet

Artificial Analysis tarafından gerçekleştirilen bağımsız test sonuçlarına göre model:

  • Canlı Akışta (Streaming):%4,0 Kelime Hata Oranı (WER)
  • Kayıtlı Dosyalarda (Non-Streaming):%2,6 Kelime Hata Oranı (WER)

Gürültülü gerçek dünya koşullarında, telefon hatlarında veya arka plan seslerinin yoğun olduğu ortamlarda sipariş numaraları, posta kodları ve alfanumerik kimlik dizilerini eksiksiz tanır.

4. Özel Terminoloji ve Jargon Desteği (Custom Vocabulary)

Tıp, hukuk, mühendislik gibi alanlara özgü teknik terimler, şirket içi kısaltmalar ve özel marka adları önceden sisteme tanımlanarak transkripsiyon doğruluğu en üst düzeye çıkarılabiliyor.

5. 85’ten Fazla Dil ve Bölgesel Aksan Desteği

Model, 85’in üzerinde dilde otomatik dil algılama ve döküm yeteneğine sahip. Canlı konuşma esnasında gerçekleşen anlık dil geçişlerini ve bölgesel şive farklılıklarını sorunsuz bir şekilde takip eder.

6. Çoklu Konuşmacı Ayrımı (Speaker Diarization)

Kayıtlı ses dosyalarında 3 farklı konuşmacıya kadar sesleri kelime düzeyinde zaman damgalarıyla etiketler (3’ten fazla konuşmacı desteği deneysel olarak sunulmaktadır).

Performans Karşılaştırması: Chirp 3’e Kıyasla %70 Daha Hızlı

google akilli ses donusum modeli gemini 3 5 transcribei duyurdu iste tum detaylar 1

Google’ın bir önceki nesil ses işleme modeli Chirp 3 ile kıyaslandığında Gemini 3.5 Transcribe; işlem süresi, doğruluk ve gecikme parametrelerinde önemli sıçramalar gösteriyor:

  • Nihai Metne Ulaşma Süresi: Chirp 3’e kıyasla %70 oranında hızlanma sağlandı.
  • FLEURS Kıyaslama Testi: Çok dilli değerlendirmelerde akış modunda %5,50 WER, kayıtlı dosya modunda ise %5,04 WER performansı kaydedildi.

Geliştiriciler İçin Çift API Mimarisi

Gemini 3.5 Transcribe, geliştiricilerin ihtiyaçlarına göre iki ayrı uç nokta (endpoint) üzerinden kullanıma sunuldu:

API YapısıModel KoduKullanım Alanı & Özellikler
Real-time Streaminggemini-3.5-transcribe-liveLive API: Saniye altı (sub-second) gecikmeyle çalışan interaktif sesli yapay zeka asistanları, anlık altyazı sistemleri ve iki yönlü ses akışları.
Pre-recorded Audiogemini-3.5-transcribeInteractions API: Toplantı kayıtları, müşteri hizmetleri çağrı kayıtları, arşiv transkripsiyonu ve konuşmacı etiketli analizler.

Google Ekosistemine Entegrasyon

Gemini 3.5 Transcribe yalnızca bir API olarak kalmayıp doğrudan Google ürünlerinin kalbine yerleştiriliyor:

  • Android (Gboard & Rambler): Kullanıcıların sesli düşüncelerini doğrudan düzenli paragraflara döker; konuşarak yazım tarzını veya hataları anında düzeltme olanağı tanır.
  • Google Antigravity & AI Studio: Geliştiricilerin doğrudan sesle kodlama (vibe coding) yapabilmesi için ekran içeriğini, aktif dokümanları ve sohbet geçmişini referans alarak dosya isimlerini ve teknik komutları hatasız yazıya çevirir.
  • macOS Gemini Uygulaması: Ekranda açık olan belgelerle konuşma bağlamını eşleştirir; sesli komutla metin özetleme veya imlecin bulunduğu yerde görsel üretme gibi çok adımlı görevleri yönetir.
  • Google Chrome (Yakında): Tarayıcı üzerindeki herhangi bir metin giriş kutusunda sesle doğrudan metin oluşturma ve düzenleme desteği sunulacak.

Erken Aşama Ekosistem ve İş Ortakları

Gemini Live API entegrasyonu; Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel ve Vision Agents gibi önde gelen ses ve gerçek zamanlı medya altyapı sağlayıcıları tarafından destekleniyor.

Ayrıca Vivo, IntelliTek Health ve Lingopal gibi şirketler, ilk testlerde modelin çok dilli doğruluğunu, düşük gecikme süresini ve sağlık/teknoloji terminolojisindeki başarısını doğrulayan geri bildirimlerde bulundu.

Erişim ve Kullanılabilirlik Durumu

  • Geliştiriciler İçin: Google AI Studio ve Google Antigravity üzerinden Gemini API genel önizlemesinde (Public Preview) erişilebilir.
  • Kurumsal Müşteriler İçin: Gemini Enterprise Agent Platform üzerinden kullanıma açıldı; yakında Gemini Enterprise for Customer Experience paketine eklenecek.
  • Kullanıcılar İçin: macOS Gemini uygulamasında (İngilizce), Android Rambler özelliğinde (belirli bölgelerde) ve yakında masaüstü Chrome tarayıcısında aktif olacak.

Oğuzhan ÜNVER

YZ Hocası kurucu editörü. Yapay zeka araçlarının iş dünyasına entegrasyonu ve üretkenlik üzerine içerikler üretiyor. Prompt mühendisliği konusunda eğitimler veriyor.

⚡ HAFTANIN PROMPTU

Bir nesnenin yapısını, kullanım amacını ve temel özelliklerini üç farklı görsel anlatımla tanıtmak için kullanılır.

Yüklediğim nesnenin fotoğrafını kullanarak üç bölümlü tek bir görsel oluştur. Sol bölümde nesneyi “exploded view” tarzında göster. Ana parçalarını düzenli aralıklarla ayır ve birbirleriyle ilişkilerini koru. Orta bölümde nesnenin adını ve kullanım amacını, dokulu bir kâğıt üzerine doğal ve okunaklı el yazısıyla yaz. Sağ bölümde nesnenin üç temel özelliğini, farklı pastel renklerdeki yapışkan notlara yerleştir. Her notta kısa bir ifade bulunsun. Nesnenin rengini ve tasarımını referans fotoğrafla uyumlu tut. İç yapısı görünmüyorsa oluşturduğun parçaların temsili olduğunu küçük bir notla belirt. Açık renkli sade bir arka plan, yumuşak ışık ve dengeli bir yerleşim kullan. Tüm yazılar Türkçe olsun. Görseli 16:9 yatay formatta hazırla.

Yorumlar (0)

Bir Yorum Bırakın