Self-Attention
Self-Attention (Kendi Kendine Dikkat), bir yapay zekâ modelinin aynı girdi içerisindeki her bir öğenin diğer tüm öğelerle olan ilişkisini değerlendirmesini sağlayan bir dikkat mekanizmasıdır. Transformer mimarisinin temel bileşeni olan Self-Attention, özellikle doğal dil işleme (Natural Language Processing, NLP) alanında uzun metinlerde bağlamın doğru anlaşılmasını mümkün kılmıştır. Bu mekanizma sayesinde model, bir cümledeki her kelimenin diğer tüm kelimelerle olan önemini hesaplayarak anlam ilişkilerini daha etkili biçimde öğrenebilir.
Klasik sıralı sinir ağlarında (RNN ve LSTM) kelimeler tek tek işlendiğinden uzun cümlelerde önceki bilgilerin unutulması veya zayıflaması söz konusu olabilmektedir. Self-Attention ise tüm kelimeleri aynı anda değerlendirerek her kelimenin diğerleriyle olan ilişkisini paralel biçimde hesaplar. Böylece hem işlem hızı artar hem de uzun mesafeli bağımlılıklar daha başarılı şekilde modellenebilir.
Örneğin, “Mehmet kitabı Ahmet’e verdi çünkü o sınava hazırlanıyordu.” cümlesinde “o” zamirinin Mehmet’i mi yoksa Ahmet’i mi ifade ettiğini anlamak için model yalnızca önceki kelimeye değil, cümlenin tamamına dikkat eder. Self-Attention mekanizması her kelimeyi diğer tüm kelimelerle karşılaştırarak bağlamı değerlendirir ve doğru anlamı belirlemeye çalışır.
Self-Attention üç temel bileşen üzerinden çalışır:
- Query (Sorgu): İncelenen kelimenin aradığı bilgiyi temsil eder.
- Key (Anahtar): Diğer kelimelerin özelliklerini temsil eder.
- Value (Değer): İlgili kelimelerin taşıdığı gerçek bilgiyi içerir.
Model önce her kelime için Query, Key ve Value vektörlerini oluşturur. Daha sonra Query ile tüm Key vektörleri arasındaki benzerlik hesaplanır. Bu benzerlikler Softmax fonksiyonu kullanılarak dikkat ağırlıklarına dönüştürülür. Son aşamada bu ağırlıklar Value vektörleriyle çarpılarak her kelime için bağlama duyarlı yeni bir temsil elde edilir.
Transformer modellerinde Self-Attention genellikle Multi-Head Attention (Çok Başlı Dikkat) yapısıyla birlikte kullanılır. Bu yaklaşım, modelin aynı anda farklı ilişki türlerini (anlamsal, sözdizimsel veya bağlamsal) öğrenmesini sağlayarak performansı artırır.
Avantajları
- Uzun mesafeli kelime ilişkilerini etkili biçimde öğrenir.
- Tüm girdiyi aynı anda değerlendirdiği için paralel işlem yapabilir.
- Bağlam bilgisini güçlü şekilde temsil eder.
- Makine çevirisi, metin özetleme ve metin üretiminde yüksek başarı sağlar.
- Büyük dil modellerinin temel çalışma mekanizmasını oluşturur.
Dezavantajları
- Girdi uzunluğu arttıkça hesaplama maliyeti karesel (O(n²)) olarak artar.
- Büyük bellek kapasitesi gerektirir.
- Çok uzun dizilerde işlem süresi ve donanım ihtiyacı yükselir.
Özet
Self-Attention, Transformer mimarisinin en kritik bileşenlerinden biridir. Her kelimenin diğer tüm kelimelerle olan ilişkisini eş zamanlı olarak değerlendirerek bağlamı güçlü biçimde öğrenir. Bu mekanizma sayesinde ChatGPT, Gemini, Claude ve Llama gibi büyük dil modelleri uzun metinleri anlayabilir, tutarlı yanıtlar üretebilir ve karmaşık dil ilişkilerini başarıyla modelleyebilir.
İlgili Kavramlar: Attention, Transformer, Query, Key, Value, Multi-Head Attention, Positional Encoding
Kaynakça
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is all you need. Advances in Neural Information Processing Systems, 30, 5998–6008.
Bahdanau, D., Cho, K., & Bengio, Y. (2015). Neural machine translation by jointly learning to align and translate. Proceedings of the 3rd International Conference on Learning Representations (ICLR 2015).
Goodfellow, I., Bengio, Y., & Courville, A. (2016). Deep Learning. MIT Press.
Jurafsky, D., & Martin, J. H. (2025). Speech and Language Processing (3rd ed., draft). Pearson.
📚 Kaynakça ve Bu Maddeye Atıf
APA Formatı: YZ Hocası. (2026). Self-Attention. YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/self-attention/
BibTeX: @misc{yzhocasi_837, title={Self-Attention}, url={https://yzhocasi.com/self-attention/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}