Rotary Positional Embedding (RoPE)
Rotary Positional Embedding (RoPE – Döner Konumsal Gömme), Transformer modellerinde tokenların konum bilgisini Query (Q) ve Key (K) vektörlerine konuma bağlı döndürme (rotation) işlemleri uygulayarak attention mekanizmasına dahil eden konumsal temsil yöntemidir. RoPE’nin önemli özelliği, konum bilgisini klasik positional embedding gibi token embeddingine doğrudan eklemek yerine attention hesabının içine entegre etmesidir.
Temel mantığı nedir?
Klasik positional embedding yaklaşımında kabaca:
kullanılır. RoPE’de ise token temsiline ayrı bir konum vektörü eklemek yerine, Q ve K vektörleri tokenın pozisyonuna göre döndürülür:
Burada:
- QmQ_m: m konumundaki Query
- KnK_n: n konumundaki Key
- Rm,RnR_m, R_n: konuma bağlı rotasyon dönüşümleri
- Qm′,Kn′Q’_m, K’_n: konum bilgisi eklenmiş Query ve Key
Ardından attention hesabında bu dönüştürülmüş vektörler kullanılır.
Neden “Rotary” deniyor?
RoPE, vektör bileşenlerini ikili gruplar hâlinde ele alarak bunlara farklı açılarda geometrik rotasyon uygular. Basitleştirilmiş iki boyutlu bir rotasyon:
şeklinde gösterilebilir. Tokenın konumu değiştikçe rotasyon açısı da değişir. Örneğin kavramsal olarak:
- Token 1 → küçük rotasyon
- Token 2 → farklı rotasyon
- Token 3 → daha farklı rotasyon
Böylece Q ve K vektörleri yalnızca içerik bilgisini değil, konumsal bilgiyi de taşır.
RoPE’nin asıl avantajı: Göreli konum
RoPE’nin önemli özelliklerinden biri, attention skorlarının tokenlar arasındaki göreli konum farkını doğal biçimde yansıtabilmesidir. İki token:
- m konumunda
- n konumunda
bulunuyorsa, Q ve K arasındaki etkileşim m−nm-n konum farkına bağlı bir yapı kazanır. Bu nedenle model yalnızca: “Bu token 20. pozisyonda.” bilgisini değil, tokenların birbirlerine göre konumlarını da attention hesabında kullanabilir. Örneğin:
“yapay” → pozisyon 20
“zekâ” → pozisyon 21
arasındaki ilişki ile başka bir yerde:
“yapay” → pozisyon 100
“zekâ” → pozisyon 101
arasındaki konumsal ilişki benzer bir göreli yapı taşır.
Q ve K neden döndürülüyor?
Attention skorunu hatırlayalım:
RoPE’de Q ve K önce pozisyona göre dönüştürülür:
ardından:
hesaplanır. Böylece konum bilgisi doğrudan attention skorlarının oluşumuna katılır. Value (V) vektörlerine standart RoPE uygulamasında aynı rotasyonun uygulanması gerekmez.
Learned Positional Embedding ile farkı
| Learned Positional Embedding | RoPE |
|---|---|
| Pozisyon vektörleri öğrenilir | Rotasyon tabanlı konum dönüşümü kullanılır |
| Genellikle token temsiline eklenir | Q ve K’ye uygulanır |
| Mutlak pozisyon ağırlıklıdır | Göreli konum ilişkilerini doğal biçimde kodlar |
| Ek öğrenilebilir pozisyon tablosu vardır | Standart RoPE’de böyle bir tablo gerekmez |
| Eğitim uzunluğunun dışına çıkmak zor olabilir | Uzun bağlam için daha elverişli özelliklere sahiptir |
Ancak RoPE’nin de eğitimde görülenden çok daha uzun dizilere kusursuz biçimde genelleştiği düşünülmemelidir. Uzun context window’ları için RoPE scaling, interpolation ve benzeri ek teknikler kullanılabilir.
Modern LLM’lerde neden önemli?
RoPE, modern LLM mimarilerinde oldukça yaygınlaşmıştır. Llama ailesi bunun bilinen örneklerinden biridir. Uzun bağlamlı modellerin geliştirilmesiyle birlikte RoPE’nin farklı ölçekleme ve genişletme yöntemleri de önemli bir araştırma alanına dönüşmüştür. RoPE’nin tercih edilmesinin temel nedenleri arasında:
- relative position bilgisini attention’a doğal biçimde taşıması,
- öğrenilebilir mutlak pozisyon tablosu gerektirmemesi,
- Transformer attention yapısıyla uyumlu olması,
- uzun bağlamlı mimarilere uyarlanabilmesi
yer alır.
Transformer’daki yeri
RoPE kullanan bir Transformer’ı basitleştirirsek:
Tokenization
↓
Token Embedding
↓
Q, K, V oluşturma
↓
Q + RoPE
K + RoPE
↓
Q′ ve K′
↓
Attention Scores
↓
Attention Weights
↓
Attention Output
↓
FFN
Buradaki “+ RoPE” matematiksel toplama anlamında değil, rotasyon dönüşümünün uygulanması anlamındadır.
Kısa karşılaştırma
- Sinusoidal Positional Encoding: Konum → Sinüs/Kosinüs → Token temsiline ekleme
- Learned Positional Embedding: Konum → Öğrenilmiş vektör → Token temsiline ekleme
- RoPE: Konum → Rotasyon açısı → Q ve K’yi döndürme → Attention
Kısaca: Rotary Positional Embedding, token konumlarını ayrı bir embedding olarak eklemek yerine Query ve Key vektörlerini pozisyona bağlı açılarla döndürerek konum bilgisini attention hesabına yerleştiren yöntemdir. En kısa formuyla:
RoPE = Konum Bilgisi + Q/K Rotasyonu → Konuma Duyarlı Attention
📚 Kaynakça ve Bu Maddeye Atıf
APA Formatı: YZ Hocası. (2026). Rotary Positional Embedding (RoPE). YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/rotary-positional-embedding-rope/
BibTeX: @misc{yzhocasi_2558, title={Rotary Positional Embedding (RoPE)}, url={https://yzhocasi.com/rotary-positional-embedding-rope/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}