📖 Açık Ansiklopedi Maddesi Son Değişiklik: 31 Ağustos 2026, 21:25

ALiBi

ℹ️
Ansiklopedi Dokümantasyonu: Bu madde, yapay zeka literatüründeki teknik standartlara ve akademik yayınlara dayalı olarak YZ Hocası kurulları tarafından incelenmiştir.

ALiBi (Attention with Linear Biases), Transformer modellerinde tokenların konumsal bilgisini ayrı bir positional embedding eklemek yerine attention skorlarına tokenlar arasındaki mesafeye bağlı doğrusal bir bias ekleyerek temsil eden konumsal yöntemdir. ALiBi’nin temel fikri oldukça basittir: Tokenlar birbirinden uzaklaştıkça attention skoruna mesafeye bağlı bir ceza uygula. Bu nedenle RoPE’den farklı olarak Q ve K vektörlerini döndürmez.

Nasıl çalışır?

Standart attention skorunu hatırlayalım:Score(i,j)=QiKjTdkScore(i,j)=\frac{Q_iK_j^T}{\sqrt{d_k}}

ALiBi bu skora konumsal bir bias ekler:Score(i,j)=QiKjTdk+Bias(i,j)Score(i,j)=\frac{Q_iK_j^T}{\sqrt{d_k}}+Bias(i,j)

Causal attention bağlamında bu bias basitleştirilmiş biçimde:Bias(i,j)=mijBias(i,j)=-m|i-j|

olarak düşünülebilir. Burada:

  • i: Query tokenının pozisyonu
  • j: Key tokenının pozisyonu
  • |i-j|: Tokenlar arasındaki mesafe
  • m: Attention head’e özgü eğim (slope)

Mesafe büyüdükçe negatif bias büyür. Örneğin kavramsal olarak:

  • Mesafe 1 → küçük ceza
  • Mesafe 5 → daha büyük ceza
  • Mesafe 50 → çok daha büyük ceza

Dolayısıyla yakın tokenlara yönelik attention, diğer her şey eşit olduğunda, daha avantajlı hâle gelir.

Neden farklı slope’lar kullanılır?

Multi-Head Attention’daki her attention head aynı mesafe duyarlılığına sahip olmak zorunda değildir. ALiBi’de farklı head’lere farklı slope (eğim) değerleri atanır. Örneğin kavramsal olarak:

  • Head 1 → Yakın bağlama güçlü odaklanma
  • Head 2 → Orta mesafeye daha toleranslı
  • Head 3 → Uzak tokenlara daha toleranslı

Bu açıklama sezgiseldir; attention head’lerinin gerçekten belirli insan-yorumlanabilir görevlerde uzmanlaştığını varsaymak doğru değildir.

ALiBi’nin önemli özelliği

ALiBi’de klasik anlamda:TokenEmbedding+PositionEmbeddingTokenEmbedding + PositionEmbedding

yapılması gerekmez. Bunun yerine konum bilgisi:

Q ve K → Attention Score → Mesafe Bias’ı ekle → Softmax

aşamasında devreye girer. Yani konumsal bilgi doğrudan attention skorlarını değiştirir.

Basit örnek

Bir tokenın geçmişteki üç tokena attention uyguladığını düşünelim:

Token MesafesiHam Attention SkoruALiBi BiasYeni Skor
14.0-0.13.9
54.0-0.53.5
204.0-2.02.0

Ham attention skorları aynı olsa bile mesafe arttıkça uzak tokenların skoru azalır. Ancak bu, modelin uzak tokenlara attention veremeyeceği anlamına gelmez. İçerik ilişkisi yeterince güçlü olduğunda Q–K uyumluluğu mesafe cezasını aşabilir.

RoPE ile farkı

RoPEALiBi
Q ve K vektörlerini döndürürAttention skoruna bias ekler
Rotasyon tabanlıdırDoğrusal mesafe tabanlıdır
Konumu Q–K etkileşimine kodlarKonumu attention skoruna doğrudan ekler
Sinüs/kosinüs temelli rotasyon kullanırHead’e özgü doğrusal slope kullanır
Modern LLM’lerde yaygınDaha farklı model ailelerinde kullanılan alternatif yöntem

En temel fark:

  • RoPE → Q/K’yi değiştirir.
  • ALiBi → Attention skorunu değiştirir.

Learned Positional Embedding ile farkı

Learned Positional Embedding’de her pozisyon için öğrenilebilir bir temsil bulunabilir:P1,P2,P3,...,PnP_1,P_2,P_3,…,P_n

ALiBi’de böyle bir pozisyon embedding tablosu gerekmez. Konumsal ilişki doğrudan:

mij-m|i-j|

gibi mesafe tabanlı attention bias’ı üzerinden sağlanır.

Uzun bağlam açısından önemi

ALiBi’nin ortaya çıkışındaki önemli amaçlardan biri length extrapolation, yani modelin eğitim sırasında gördüğünden daha uzun dizilerde çalışabilme yeteneğini geliştirmektir. Örneğin model daha kısa diziler üzerinde eğitilmiş olsa bile ALiBi’nin mesafe tabanlı matematiksel yapısı daha uzun pozisyonlara uygulanabilir. Ancak bu, modelin sınırsız uzunluktaki bağlamı aynı kalitede anlayacağı anlamına gelmez. Uzun bağlam performansı mimari, eğitim verisi, attention yapısı ve diğer faktörlere de bağlıdır.

Üç yöntemi birlikte düşünelim

Learned Positional EmbeddingToken+O¨g˘renilmis\c Pozisyon Vekto¨ru¨Token + Öğrenilmiş\ Pozisyon\ Vektörü

Konum token temsiline eklenir.

RoPEQ,KRotationQ,K \rightarrow Rotation

Konum Q–K geometrisine kodlanır.

ALiBiAttentionScore+LinearDistanceBiasAttentionScore + LinearDistanceBias

Konum attention skoruna eklenir.

Transformer içindeki yeri

ALiBi kullanan causal bir Transformer’ı basitleştirirsek:

Token Embedding

Q, K, V oluşturma

Q × Kᵀ

Scaled Attention Scores

ALiBi Linear Bias

Causal Mask

Softmax

Attention Weights

V ile ağırlıklı birleşim

Attention Output

Mask ve bias’ın uygulanma ayrıntıları implementasyona göre birlikte ele alınabilir; temel fikir ALiBi bias’ının softmax’tan önce attention logits/skorlarına eklenmesidir.

Kısaca

ALiBi (Attention with Linear Biases), tokenların konumunu ayrı embeddinglerle temsil etmek yerine, tokenlar arasındaki mesafeye bağlı doğrusal bias değerlerini attention skorlarına ekleyen konumsal yöntemdir. En kısa karşılaştırmayla:

  • Learned Position → Konumu embedding olarak ekle.
  • RoPE → Q ve K’yi konuma göre döndür.
  • ALiBi → Attention skoruna mesafe bias’ı ekle.

📚 Kaynakça ve Bu Maddeye Atıf

APA Formatı: YZ Hocası. (2026). ALiBi. YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/alibi/

BibTeX: @misc{yzhocasi_2560, title={ALiBi}, url={https://yzhocasi.com/alibi/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}