Attention Mechanism
Attention Mechanism (Dikkat Mekanizması), bir yapay zekâ modelinin girdideki bütün öğelere eşit önem vermek yerine, mevcut işlem açısından daha önemli olan öğelere daha fazla ağırlık vermesini sağlayan mekanizmadır. Transformer mimarisinin en temel bileşenlerinden biridir.
Örneğin: “Elif telefonu masaya bıraktı çünkü onu artık kullanmıyordu.”
Model “onu” kelimesini işlerken önceki kelimelerin tamamını değerlendirebilir; ancak bazı kelimelere diğerlerinden daha yüksek attention ağırlığı verebilir. Böylece kelimeler arasındaki bağlamsal ilişkiler modellenir.
Nasıl çalışır?
Transformer tabanlı attention mekanizmasında her token için üç temel temsil oluşturulur:
- Query (Q): Ne arıyorum?
- Key (K): Bende hangi bilgi var?
- Value (V): Aktaracağım bilgi nedir?
Temel hesaplama şöyledir:
Query ve Key arasındaki benzerlik, hangi tokenların daha fazla dikkate alınacağını belirler. Softmax bu değerleri ağırlıklara dönüştürür; ardından Value temsilleri bu ağırlıklara göre birleştirilir. Basitleştirirsek:
Tokenlar → Q, K, V → İlişki Skorları → Attention Ağırlıkları → Bağlamsal Temsil
Self-Attention nedir?
Bir dizinin kendi içindeki öğelerin birbirleriyle ilişkisini değerlendirmesine Self-Attention denir. Örneğin: “Profesör öğrencilere yapay zekâyı anlattı.”
“anlattı” işlenirken model “profesör”, “öğrencilere” ve “yapay zekâyı” gibi öğeler arasındaki ilişkileri birlikte değerlendirebilir.
Multi-Head Attention
Transformer’larda genellikle tek attention işlemi yerine birden fazla attention başlığı paralel olarak kullanılır. Buna Multi-Head Attention adı verilir. Farklı başlıklar farklı ilişki örüntülerini öğrenebilir:
Dilbilgisel ilişkiler + Anlamsal ilişkiler + Uzak bağlam + Referans ilişkileri → Daha zengin temsil
Ancak her attention başlığının insanlar tarafından kolayca yorumlanabilen tek bir göreve karşılık geldiğini düşünmek doğru değildir.
Attention neden önemlidir?
Attention mekanizması özellikle uzun bağlamlarda öğeler arasındaki ilişkilerin modellenmesini kolaylaştırır. Transformer’ların RNN ve LSTM gibi önceki sıralı mimarilere kıyasla eğitimde daha fazla paralelleştirilebilmesinin de temel nedenlerinden biridir. Bununla birlikte klasik self-attention’ın önemli bir dezavantajı vardır: dizi uzadıkça hesaplama ve bellek maliyeti hızla artabilir. Bu nedenle uzun bağlamlı modellerde sparse attention, sliding-window attention ve çeşitli verimli attention yaklaşımları kullanılabilir.
Attention ve Transformer aynı şey değildir
Bu iki kavram sık karıştırılır:
Attention Mechanism → Bir hesaplama mekanizmasıdır.
Transformer → Attention’ı temel bileşenlerinden biri olarak kullanan sinir ağı mimarisidir.
Dolayısıyla kavramsal ilişkiyi şöyle gösterebiliriz:
Attention → Self-Attention → Multi-Head Attention → Transformer → Modern LLM’ler
Kısaca: Attention Mechanism, modelin “Bu girdiyi işlerken hangi bilgiler diğerlerinden daha önemli?” sorusunu matematiksel ağırlıklandırma yoluyla çözmesini sağlayan temel yapay zekâ mekanizmalarından biridir.
📚 Kaynakça ve Bu Maddeye Atıf
APA Formatı: YZ Hocası. (2026). Attention Mechanism. YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/attention-mechanism/
BibTeX: @misc{yzhocasi_2521, title={Attention Mechanism}, url={https://yzhocasi.com/attention-mechanism/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}