Scaled Dot-Product Attention
Scaled Dot-Product Attention (Ölçeklendirilmiş Noktasal Çarpım Dikkati), Transformer mimarisinde Query (Q) ile Key (K) arasındaki benzerliği noktasal çarpımla hesaplayan, sonucu ölçeklendiren ve bu ağırlıkları Value (V) bilgileri üzerinde kullanan temel attention yöntemidir. Transformer’daki Self-Attention ve Multi-Head Attention’ın matematiksel temelinde bu işlem bulunur.
Nasıl çalışır?
Temel formül şöyledir:
Burada:
- Q (Query): Modelin aradığı bilgiyi temsil eder.
- K (Key): Hangi bilgilerin mevcut olduğunu temsil eder.
- V (Value): Aktarılacak asıl bilgiyi taşır.
- dkd_k: Key ve Query vektörlerinin boyutudur.
- dk\sqrt{d_k}: Ölçeklendirme faktörüdür.
- Softmax: Skorları normalize edilmiş attention ağırlıklarına dönüştürür.
Süreç basitleştirilirse:
Q × Kᵀ → Benzerlik Skorları → √dₖ ile Ölçeklendirme → Softmax → Attention Ağırlıkları → V ile Birleştirme
Neden “Dot-Product”?
Model, Query ile Key arasındaki uyumu noktasal çarpım (dot product) kullanarak hesaplar:
Değer yükseldikçe ilgili Query ve Key arasındaki uyumun daha güçlü olduğu kabul edilir. Ardından softmax sayesinde bu skorlar attention ağırlıklarına dönüştürülür.
Neden “Scaled”?
Asıl kritik nokta burasıdır. Query ve Key vektörlerinin boyutu büyüdükçe noktasal çarpımların büyüklüğü de artabilir. Çok büyük değerler softmax fonksiyonunu doygun bölgelere taşıyarak gradyanların aşırı küçülmesine ve eğitimin zorlaşmasına yol açabilir.
Bu nedenle skorlar:
değerine bölünür. Örneğin:
ise:
olduğundan attention skorları softmax uygulanmadan önce 8’e bölünür.
Self-Attention ile ilişkisi
Scaled Dot-Product Attention ile Self-Attention aynı kavram değildir.
- Self-Attention, Q, K ve V’nin aynı girdi dizisinden türetilmesini ifade eder.
- Scaled Dot-Product Attention ise bu Q, K ve V kullanılarak attention skorlarının nasıl hesaplandığını ifade eder.
Dolayısıyla:
- Self-Attention = Attention’ın nerede uygulandığı
- Scaled Dot-Product Attention = Attention’ın nasıl hesaplandığı
Multi-Head Attention ile ilişkisi
Multi-Head Attention içerisinde birden fazla Scaled Dot-Product Attention işlemi paralel olarak gerçekleştirilebilir:
Q, K, V
↓
Head 1 → Scaled Dot-Product Attention
Head 2 → Scaled Dot-Product Attention
Head 3 → Scaled Dot-Product Attention
↓
Concat
↓
Linear Projection
Kısaca: Scaled Dot-Product Attention, Query ile Key arasındaki noktasal çarpımı hesaplayan, bu skorları dk\sqrt{d_k} ile ölçeklendiren, softmax ile attention ağırlıklarına dönüştüren ve ardından Value bilgilerini bu ağırlıklara göre birleştiren Transformer’ın temel attention hesaplama yöntemidir.
📚 Kaynakça ve Bu Maddeye Atıf
APA Formatı: YZ Hocası. (2026). Scaled Dot-Product Attention. YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/scaled-dot-product-attention/
BibTeX: @misc{yzhocasi_2530, title={Scaled Dot-Product Attention}, url={https://yzhocasi.com/scaled-dot-product-attention/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}