Anasayfa / Yapay Zeka Ansiklopedisi / Self-Attention
📖 Açık Ansiklopedi Maddesi Son Değişiklik: 12 Eylül 2026, 15:09

Self-Attention

ℹ️
Ansiklopedi Dokümantasyonu: Bu madde, yapay zeka literatüründeki teknik standartlara ve akademik yayınlara dayalı olarak YZ Hocası kurulları tarafından incelenmiştir.

Self-Attention (Öz-Dikkat), bir dizideki her öğenin aynı dizideki diğer öğelerle olan ilişkisini değerlendirerek kendi bağlamsal temsilini oluşturmasını sağlayan attention mekanizmasıdır. Transformer mimarisinin temel bileşenlerinden biridir. Örneğin:

“Doktor hastaya ilacı verdi çünkü onun tedaviye ihtiyacı vardı.”

Model “onun” kelimesini işlerken cümledeki diğer kelimelerle ilişkisini değerlendirir. Böylece bir kelimenin anlamı yalnızca kendisinden değil, içinde bulunduğu bağlamdan hareketle temsil edilir.

Nasıl çalışır?

Her token için üç farklı vektör oluşturulur:

  • Query (Q): Bu token hangi bilgiyi arıyor?
  • Key (K): Bu token hangi bilgiyi temsil ediyor?
  • Value (V): Bu tokendan hangi bilgi aktarılacak?

Ardından Query ve Key vektörleri karşılaştırılarak tokenlar arasındaki ilişki skorları hesaplanır:Attention(Q,K,V)=softmax(QKTdk)VAttention(Q,K,V)=softmax\left(\frac{QK^T}{\sqrt{d_k}}\right)V

Basitleştirilmiş süreç:

Tokenlar → Q, K, V → Benzerlik Skorları → Attention Ağırlıkları → Value’ların Ağırlıklı Birleşimi → Bağlamsal Temsil

Neden “Self” deniyor?

Çünkü Q, K ve V aynı girdi dizisinden üretilir. Örneğin:

“Yapay zekâ akademik araştırmayı hızlandırabilir.”

“araştırmayı” tokenı; “yapay”, “zekâ”, “akademik” ve “hızlandırabilir” dahil aynı dizideki diğer tokenlarla ilişkilendirilir. Bu yönüyle Cross-Attention’dan ayrılır. Cross-Attention’da Query bir kaynaktan, Key ve Value ise başka bir kaynaktan gelebilir.

Self-Attention ve Multi-Head Attention

Tek bir self-attention işlemi yerine birden fazla attention işlemi paralel yürütülebilir. Buna Multi-Head Self-Attention denir. Her başlık farklı ilişki örüntülerini öğrenme kapasitesine sahiptir:

Token ilişkileri → Birden fazla Attention Head → Birleştirme → Daha zengin bağlamsal temsil

Ancak belirli bir attention head’in mutlaka yalnızca “özne”, “nesne” veya “anlam” gibi tek bir insan tarafından yorumlanabilir görevi öğrendiğini söylemek doğru değildir.

Self-Attention neden önemlidir?

Self-Attention sayesinde Transformer modelleri, dizinin farklı bölümleri arasındaki yakın ve uzak ilişkileri doğrudan modelleyebilir. Bu özellik; metin üretimi, çeviri, özetleme, soru yanıtlama ve çok modlu yapay zekâ sistemlerinde oldukça önemlidir. Kavramların ilişkisi şöyle düşünülebilir:

Attention Mechanism

Self-Attention

Multi-Head Self-Attention

Transformer

Modern LLM’ler

Kısaca: Self-Attention, bir tokenın anlamını oluştururken “Aynı girdideki diğer hangi tokenlara ve ne ölçüde dikkat etmeliyim?” sorusunu matematiksel olarak çözmeye çalışan mekanizmadır.

Self-Attention (Kendi Kendine Dikkat), bir yapay zekâ modelinin aynı girdi içerisindeki her bir öğenin diğer tüm öğelerle olan ilişkisini değerlendirmesini sağlayan bir dikkat mekanizmasıdır. Transformer mimarisinin temel bileşeni olan Self-Attention, özellikle doğal dil işleme (Natural Language Processing, NLP) alanında uzun metinlerde bağlamın doğru anlaşılmasını mümkün kılmıştır. Bu mekanizma sayesinde model, bir cümledeki her kelimenin diğer tüm kelimelerle olan önemini hesaplayarak anlam ilişkilerini daha etkili biçimde öğrenebilir.

Klasik sıralı sinir ağlarında (RNN ve LSTM) kelimeler tek tek işlendiğinden uzun cümlelerde önceki bilgilerin unutulması veya zayıflaması söz konusu olabilmektedir. Self-Attention ise tüm kelimeleri aynı anda değerlendirerek her kelimenin diğerleriyle olan ilişkisini paralel biçimde hesaplar. Böylece hem işlem hızı artar hem de uzun mesafeli bağımlılıklar daha başarılı şekilde modellenebilir.

Örneğin, “Mehmet kitabı Ahmet’e verdi çünkü o sınava hazırlanıyordu.” cümlesinde “o” zamirinin Mehmet’i mi yoksa Ahmet’i mi ifade ettiğini anlamak için model yalnızca önceki kelimeye değil, cümlenin tamamına dikkat eder. Self-Attention mekanizması her kelimeyi diğer tüm kelimelerle karşılaştırarak bağlamı değerlendirir ve doğru anlamı belirlemeye çalışır.

Self-Attention üç temel bileşen üzerinden çalışır:

  • Query (Sorgu): İncelenen kelimenin aradığı bilgiyi temsil eder.
  • Key (Anahtar): Diğer kelimelerin özelliklerini temsil eder.
  • Value (Değer): İlgili kelimelerin taşıdığı gerçek bilgiyi içerir.

Model önce her kelime için Query, Key ve Value vektörlerini oluşturur. Daha sonra Query ile tüm Key vektörleri arasındaki benzerlik hesaplanır. Bu benzerlikler Softmax fonksiyonu kullanılarak dikkat ağırlıklarına dönüştürülür. Son aşamada bu ağırlıklar Value vektörleriyle çarpılarak her kelime için bağlama duyarlı yeni bir temsil elde edilir.

Transformer modellerinde Self-Attention genellikle Multi-Head Attention (Çok Başlı Dikkat) yapısıyla birlikte kullanılır. Bu yaklaşım, modelin aynı anda farklı ilişki türlerini (anlamsal, sözdizimsel veya bağlamsal) öğrenmesini sağlayarak performansı artırır.

Avantajları

  • Uzun mesafeli kelime ilişkilerini etkili biçimde öğrenir.
  • Tüm girdiyi aynı anda değerlendirdiği için paralel işlem yapabilir.
  • Bağlam bilgisini güçlü şekilde temsil eder.
  • Makine çevirisi, metin özetleme ve metin üretiminde yüksek başarı sağlar.
  • Büyük dil modellerinin temel çalışma mekanizmasını oluşturur.

Dezavantajları

  • Girdi uzunluğu arttıkça hesaplama maliyeti karesel (O(n²)) olarak artar.
  • Büyük bellek kapasitesi gerektirir.
  • Çok uzun dizilerde işlem süresi ve donanım ihtiyacı yükselir.

Özet

Self-Attention, Transformer mimarisinin en kritik bileşenlerinden biridir. Her kelimenin diğer tüm kelimelerle olan ilişkisini eş zamanlı olarak değerlendirerek bağlamı güçlü biçimde öğrenir. Bu mekanizma sayesinde ChatGPT, Gemini, Claude ve Llama gibi büyük dil modelleri uzun metinleri anlayabilir, tutarlı yanıtlar üretebilir ve karmaşık dil ilişkilerini başarıyla modelleyebilir.

İlgili Kavramlar: Attention, Transformer, Query, Key, Value, Multi-Head Attention, Positional Encoding

Kaynakça

Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is all you need. Advances in Neural Information Processing Systems, 30, 5998–6008.

Bahdanau, D., Cho, K., & Bengio, Y. (2015). Neural machine translation by jointly learning to align and translate. Proceedings of the 3rd International Conference on Learning Representations (ICLR 2015).

Goodfellow, I., Bengio, Y., & Courville, A. (2016). Deep Learning. MIT Press.

Jurafsky, D., & Martin, J. H. (2025). Speech and Language Processing (3rd ed., draft). Pearson.

📚 Kaynakça ve Bu Maddeye Atıf

APA Formatı: YZ Hocası. (2026). Self-Attention. YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/self-attention-2/

BibTeX: @misc{yzhocasi_2524, title={Self-Attention}, url={https://yzhocasi.com/self-attention-2/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}