ALiBi
ALiBi (Attention with Linear Biases), Transformer modellerinde tokenların konumsal bilgisini ayrı bir positional embedding eklemek yerine attention skorlarına tokenlar arasındaki mesafeye bağlı doğrusal bir bias ekleyerek temsil eden konumsal yöntemdir. ALiBi’nin temel fikri oldukça basittir: Tokenlar birbirinden uzaklaştıkça attention skoruna mesafeye bağlı bir ceza uygula. Bu nedenle RoPE’den farklı olarak Q ve K vektörlerini döndürmez.
Nasıl çalışır?
Standart attention skorunu hatırlayalım:
ALiBi bu skora konumsal bir bias ekler:
Causal attention bağlamında bu bias basitleştirilmiş biçimde:
olarak düşünülebilir. Burada:
- i: Query tokenının pozisyonu
- j: Key tokenının pozisyonu
- |i-j|: Tokenlar arasındaki mesafe
- m: Attention head’e özgü eğim (slope)
Mesafe büyüdükçe negatif bias büyür. Örneğin kavramsal olarak:
- Mesafe 1 → küçük ceza
- Mesafe 5 → daha büyük ceza
- Mesafe 50 → çok daha büyük ceza
Dolayısıyla yakın tokenlara yönelik attention, diğer her şey eşit olduğunda, daha avantajlı hâle gelir.
Neden farklı slope’lar kullanılır?
Multi-Head Attention’daki her attention head aynı mesafe duyarlılığına sahip olmak zorunda değildir. ALiBi’de farklı head’lere farklı slope (eğim) değerleri atanır. Örneğin kavramsal olarak:
- Head 1 → Yakın bağlama güçlü odaklanma
- Head 2 → Orta mesafeye daha toleranslı
- Head 3 → Uzak tokenlara daha toleranslı
Bu açıklama sezgiseldir; attention head’lerinin gerçekten belirli insan-yorumlanabilir görevlerde uzmanlaştığını varsaymak doğru değildir.
ALiBi’nin önemli özelliği
ALiBi’de klasik anlamda:
yapılması gerekmez. Bunun yerine konum bilgisi:
Q ve K → Attention Score → Mesafe Bias’ı ekle → Softmax
aşamasında devreye girer. Yani konumsal bilgi doğrudan attention skorlarını değiştirir.
Basit örnek
Bir tokenın geçmişteki üç tokena attention uyguladığını düşünelim:
| Token Mesafesi | Ham Attention Skoru | ALiBi Bias | Yeni Skor |
|---|---|---|---|
| 1 | 4.0 | -0.1 | 3.9 |
| 5 | 4.0 | -0.5 | 3.5 |
| 20 | 4.0 | -2.0 | 2.0 |
Ham attention skorları aynı olsa bile mesafe arttıkça uzak tokenların skoru azalır. Ancak bu, modelin uzak tokenlara attention veremeyeceği anlamına gelmez. İçerik ilişkisi yeterince güçlü olduğunda Q–K uyumluluğu mesafe cezasını aşabilir.
RoPE ile farkı
| RoPE | ALiBi |
|---|---|
| Q ve K vektörlerini döndürür | Attention skoruna bias ekler |
| Rotasyon tabanlıdır | Doğrusal mesafe tabanlıdır |
| Konumu Q–K etkileşimine kodlar | Konumu attention skoruna doğrudan ekler |
| Sinüs/kosinüs temelli rotasyon kullanır | Head’e özgü doğrusal slope kullanır |
| Modern LLM’lerde yaygın | Daha farklı model ailelerinde kullanılan alternatif yöntem |
En temel fark:
- RoPE → Q/K’yi değiştirir.
- ALiBi → Attention skorunu değiştirir.
Learned Positional Embedding ile farkı
Learned Positional Embedding’de her pozisyon için öğrenilebilir bir temsil bulunabilir:
ALiBi’de böyle bir pozisyon embedding tablosu gerekmez. Konumsal ilişki doğrudan:
gibi mesafe tabanlı attention bias’ı üzerinden sağlanır.
Uzun bağlam açısından önemi
ALiBi’nin ortaya çıkışındaki önemli amaçlardan biri length extrapolation, yani modelin eğitim sırasında gördüğünden daha uzun dizilerde çalışabilme yeteneğini geliştirmektir. Örneğin model daha kısa diziler üzerinde eğitilmiş olsa bile ALiBi’nin mesafe tabanlı matematiksel yapısı daha uzun pozisyonlara uygulanabilir. Ancak bu, modelin sınırsız uzunluktaki bağlamı aynı kalitede anlayacağı anlamına gelmez. Uzun bağlam performansı mimari, eğitim verisi, attention yapısı ve diğer faktörlere de bağlıdır.
Üç yöntemi birlikte düşünelim
Learned Positional Embedding
↓
Konum token temsiline eklenir.
RoPE
↓
Konum Q–K geometrisine kodlanır.
ALiBi
↓
Konum attention skoruna eklenir.
Transformer içindeki yeri
ALiBi kullanan causal bir Transformer’ı basitleştirirsek:
Token Embedding
↓
Q, K, V oluşturma
↓
Q × Kᵀ
↓
Scaled Attention Scores
↓
ALiBi Linear Bias
↓
Causal Mask
↓
Softmax
↓
Attention Weights
↓
V ile ağırlıklı birleşim
↓
Attention Output
Mask ve bias’ın uygulanma ayrıntıları implementasyona göre birlikte ele alınabilir; temel fikir ALiBi bias’ının softmax’tan önce attention logits/skorlarına eklenmesidir.
Kısaca
ALiBi (Attention with Linear Biases), tokenların konumunu ayrı embeddinglerle temsil etmek yerine, tokenlar arasındaki mesafeye bağlı doğrusal bias değerlerini attention skorlarına ekleyen konumsal yöntemdir. En kısa karşılaştırmayla:
- Learned Position → Konumu embedding olarak ekle.
- RoPE → Q ve K’yi konuma göre döndür.
- ALiBi → Attention skoruna mesafe bias’ı ekle.
📚 Kaynakça ve Bu Maddeye Atıf
APA Formatı: YZ Hocası. (2026). ALiBi. YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/alibi/
BibTeX: @misc{yzhocasi_2560, title={ALiBi}, url={https://yzhocasi.com/alibi/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}