Cross-Attention
Cross-Attention (Çapraz Dikkat), bir veri dizisinin başka bir veri kaynağındaki öğelere dikkat ederek bilgi almasını sağlayan attention mekanizmasıdır. Self-Attention’dan temel farkı, dikkat işleminin aynı temsil kümesi içinde değil, iki farklı temsil veya veri kaynağı arasında gerçekleşmesidir. Örneğin bir görüntü hakkında şu soru sorulsun:
Görüntü: Bir masanın üzerinde kırmızı bir kitap var.
Soru: “Kitabın rengi nedir?”
Model, sorudaki “kitabın rengi” ifadesini görüntünün ilgili bölgeleriyle ilişkilendirebilir. Burada metin ve görüntü arasında kurulan dikkat ilişkisi Cross-Attention’ın tipik kullanım örneklerinden biridir.
Nasıl çalışır?
Cross-Attention’da temel olarak yine üç yapı vardır:
- Query (Q): Birinci kaynaktan gelir.
- Key (K): İkinci kaynaktan gelir.
- Value (V): İkinci kaynaktan gelir.
Matematiksel yapı yine attention formuna dayanır:
Temel fark, Q ile K ve V’nin aynı kaynaktan gelmemesidir. Örneğin:
Metin → Query
Görüntü → Key + Value
Model böylece metindeki ifadeleri görüntüdeki ilgili görsel bilgilerle eşleştirebilir.
Self-Attention ile farkı
| Özellik | Self-Attention | Cross-Attention |
|---|---|---|
| Query | Aynı kaynaktan | Birinci kaynaktan |
| Key | Aynı kaynaktan | İkinci kaynaktan |
| Value | Aynı kaynaktan | İkinci kaynaktan |
| Temel amaç | Girdi içindeki ilişkileri öğrenmek | Farklı temsiller arasında bilgi aktarmak |
Kısaca:
Self-Attention: “Bu metindeki diğer kelimelerle ilişkim nedir?”
Cross-Attention: “Başka bir temsil veya veri kaynağındaki hangi bilgi benim için önemlidir?”
Nerelerde kullanılır?
Cross-Attention özellikle encoder–decoder modellerinde ve bazı multimodal yapay zekâ mimarilerinde önemlidir. Örneğin makine çevirisinde encoder kaynak cümleyi temsil eder. Decoder hedef dilde yeni kelimeler üretirken Cross-Attention aracılığıyla encoder’ın oluşturduğu temsillerden yararlanabilir. Benzer şekilde bazı görüntü-metin sistemlerinde:
Görüntü özellikleri + Metinsel sorgu → Cross-Attention → Birleşik bilgi → Çıktı
şeklinde bir etkileşim kurulabilir. Ancak tüm modern multimodal modellerin mutlaka klasik Cross-Attention mimarisini kullandığını söylemek doğru değildir; farklı modalite birleştirme yöntemleri de bulunmaktadır.
Kavramsal ilişki
Bu kavramları şöyle ayırabiliriz:
Attention Mechanism
↓
Self-Attention: Aynı temsil içindeki ilişkiler
Cross-Attention: Farklı temsiller arasındaki ilişkiler
↓
Transformer tabanlı sistemler
↓
LLM / VLM / Multimodal AI
Kısaca: Cross-Attention, bir yapay zekâ modelinin “Başka bir bilgi kaynağındaki hangi öğeler, şu anda işlediğim bilgi açısından önemlidir?” sorusunu öğrenilmiş dikkat ağırlıklarıyla yanıtlamasını sağlayan mekanizmadır.
📚 Kaynakça ve Bu Maddeye Atıf
APA Formatı: YZ Hocası. (2026). Cross-Attention. YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/cross-attention/
BibTeX: @misc{yzhocasi_2526, title={Cross-Attention}, url={https://yzhocasi.com/cross-attention/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}