Anasayfa / Yapay Zeka Ansiklopedisi / Attention Weight
📖 Açık Ansiklopedi Maddesi Son Değişiklik: 31 Ağustos 2026, 20:59

Attention Weight

ℹ️
Ansiklopedi Dokümantasyonu: Bu madde, yapay zeka literatüründeki teknik standartlara ve akademik yayınlara dayalı olarak YZ Hocası kurulları tarafından incelenmiştir.

Attention Weight (Dikkat Ağırlığı), Attention mekanizmasında hesaplanan attention skorlarının genellikle softmax fonksiyonuyla normalize edilmesi sonucunda elde edilen ve her Value’nun çıktıya ne ölçüde katkıda bulunacağını belirleyen ağırlıktır. Başka bir ifadeyle Attention Score, iki temsil arasındaki uyumu ölçerken; Attention Weight bu uyumun nihai dikkat dağılımındaki payını gösterir.

Nasıl hesaplanır?

Önce Query ve Key arasındaki skor hesaplanır:Score=QKTScore=QK^T

Scaled Dot-Product Attention’da skor ölçeklendirilir:Scaled Score=QKTdkScaled\ Score=\frac{QK^T}{\sqrt{d_k}}

Ardından softmax uygulanır:Attention Weights=softmax(QKTdk)Attention\ Weights= softmax\left(\frac{QK^T}{\sqrt{d_k}}\right)

Bu işlem sonucunda her Query için Key’lere karşı bir ağırlık dağılımı elde edilir.

Basit örnek

Şu cümleyi düşünelim: “Ayşe kitabı okudu çünkü onu merak ediyordu.”

“onu” tokenı için ölçeklendirilmiş attention skorlarının şöyle olduğunu varsayalım:

KeyAttention ScoreAttention Weight
Ayşe0.80.05
kitabı3.70.76
okudu1.40.10
çünkü0.30.03
diğerleri0.06

Bu değerler yalnızca açıklama amaçlıdır. Burada “kitabı” için 0.76 attention weight oluşması, ilgili attention head’de bu Value temsilinin çıktıya daha güçlü katkıda bulunacağı anlamına gelir.

Attention Score ile farkı

En önemli ayrım şöyledir:

  • Attention Score → Query ile Key arasındaki uyum değeri
  • Attention Weight → Skorların normalize edilmesinden sonra Value’lara uygulanacak ağırlık

Dolayısıyla:

Q × Kᵀ

Attention Score

Scaling

Softmax

Attention Weight

Value’ların ağırlıklandırılması

Attention Output

Value ile ilişkisi

Attention Weight’ler, Value vektörlerinin ağırlıklı toplamını oluşturmak için kullanılır:Output=iαiViOutput=\sum_i \alpha_iV_i

Buradaki:

  • ViV_i = ilgili Value vektörü
  • αi\alpha_i = ilgili Attention Weight

Örneğin bir Value’nun ağırlığı 0.70, diğerinin 0.05 ise ilk Value attention çıktısına çok daha fazla katkıda bulunur.

Softmax neden kullanılır?

Softmax, attention skorlarını karşılaştırılabilir bir dağılıma dönüştürür. Standart attention’da maskelenmemiş konumların ağırlıkları:iαi=1\sum_i \alpha_i=1

olacak şekilde normalize edilir.

Bu nedenle model yalnızca “hangi token önemli?” sorusuna değil, aynı zamanda “diğerlerine kıyasla ne kadar önemli?” sorusuna da sayısal bir dağılımla karşılık verir.

Q–K–V yapısındaki yeri

Şimdi bütün kavramları tek zincirde görebiliriz:

  • Query → Neyi arıyorum?
  • Key → Aradığım şeyle ne kadar eşleşiyor?
  • Attention Score → Eşleşme skoru nedir?
  • Attention Weight → Bu bilgiye ne kadar ağırlık vermeliyim?
  • Value → Hangi bilgiyi çıktıya taşımalıyım?

Kısaca: Attention Weight, Query–Key ilişkilerinden hesaplanan attention skorlarının normalize edilmesiyle elde edilen ve ilgili Value bilgisinin attention çıktısına ne ölçüde katkıda bulunacağını belirleyen ağırlıktır.

📚 Kaynakça ve Bu Maddeye Atıf

APA Formatı: YZ Hocası. (2026). Attention Weight. YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/attention-weight/

BibTeX: @misc{yzhocasi_2541, title={Attention Weight}, url={https://yzhocasi.com/attention-weight/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}