Anasayfa / Yapay Zeka Ansiklopedisi / Rotary Positional Embedding (RoPE)
📖 Açık Ansiklopedi Maddesi Son Değişiklik: 31 Ağustos 2026, 21:21

Rotary Positional Embedding (RoPE)

ℹ️
Ansiklopedi Dokümantasyonu: Bu madde, yapay zeka literatüründeki teknik standartlara ve akademik yayınlara dayalı olarak YZ Hocası kurulları tarafından incelenmiştir.

Rotary Positional Embedding (RoPE – Döner Konumsal Gömme), Transformer modellerinde tokenların konum bilgisini Query (Q) ve Key (K) vektörlerine konuma bağlı döndürme (rotation) işlemleri uygulayarak attention mekanizmasına dahil eden konumsal temsil yöntemidir. RoPE’nin önemli özelliği, konum bilgisini klasik positional embedding gibi token embeddingine doğrudan eklemek yerine attention hesabının içine entegre etmesidir.

Temel mantığı nedir?

Klasik positional embedding yaklaşımında kabaca:Input=TokenEmbedding+PositionEmbeddingInput = TokenEmbedding + PositionEmbedding

kullanılır. RoPE’de ise token temsiline ayrı bir konum vektörü eklemek yerine, Q ve K vektörleri tokenın pozisyonuna göre döndürülür:Qm=RmQmQ’_m=R_mQ_mKn=RnKnK’_n=R_nK_n

Burada:

  • QmQ_m: m konumundaki Query
  • KnK_n: n konumundaki Key
  • Rm,RnR_m, R_n: konuma bağlı rotasyon dönüşümleri
  • Qm′,Kn′Q’_m, K’_n: konum bilgisi eklenmiş Query ve Key

Ardından attention hesabında bu dönüştürülmüş vektörler kullanılır.

Neden “Rotary” deniyor?

RoPE, vektör bileşenlerini ikili gruplar hâlinde ele alarak bunlara farklı açılarda geometrik rotasyon uygular. Basitleştirilmiş iki boyutlu bir rotasyon:R(θ)=[cosθsinθsinθcosθ]R(\theta)= \begin{bmatrix} \cos\theta & -\sin\theta\\ \sin\theta & \cos\theta \end{bmatrix}

şeklinde gösterilebilir. Tokenın konumu değiştikçe rotasyon açısı da değişir. Örneğin kavramsal olarak:

  • Token 1 → küçük rotasyon
  • Token 2 → farklı rotasyon
  • Token 3 → daha farklı rotasyon

Böylece Q ve K vektörleri yalnızca içerik bilgisini değil, konumsal bilgiyi de taşır.

RoPE’nin asıl avantajı: Göreli konum

RoPE’nin önemli özelliklerinden biri, attention skorlarının tokenlar arasındaki göreli konum farkını doğal biçimde yansıtabilmesidir. İki token:

  • m konumunda
  • n konumunda

bulunuyorsa, Q ve K arasındaki etkileşim m−nm-n konum farkına bağlı bir yapı kazanır. Bu nedenle model yalnızca: “Bu token 20. pozisyonda.” bilgisini değil, tokenların birbirlerine göre konumlarını da attention hesabında kullanabilir. Örneğin:

“yapay” → pozisyon 20
“zekâ” → pozisyon 21

arasındaki ilişki ile başka bir yerde:

“yapay” → pozisyon 100
“zekâ” → pozisyon 101

arasındaki konumsal ilişki benzer bir göreli yapı taşır.

Q ve K neden döndürülüyor?

Attention skorunu hatırlayalım:Score(Q,K)=QKTdkScore(Q,K)=\frac{QK^T}{\sqrt{d_k}}

RoPE’de Q ve K önce pozisyona göre dönüştürülür:Q=RoPE(Q,pos)Q’=RoPE(Q,pos)K=RoPE(K,pos)K’=RoPE(K,pos)

ardından:Score=QKTdkScore=\frac{Q’K’^T}{\sqrt{d_k}}

hesaplanır. Böylece konum bilgisi doğrudan attention skorlarının oluşumuna katılır. Value (V) vektörlerine standart RoPE uygulamasında aynı rotasyonun uygulanması gerekmez.

Learned Positional Embedding ile farkı

Learned Positional EmbeddingRoPE
Pozisyon vektörleri öğrenilirRotasyon tabanlı konum dönüşümü kullanılır
Genellikle token temsiline eklenirQ ve K’ye uygulanır
Mutlak pozisyon ağırlıklıdırGöreli konum ilişkilerini doğal biçimde kodlar
Ek öğrenilebilir pozisyon tablosu vardırStandart RoPE’de böyle bir tablo gerekmez
Eğitim uzunluğunun dışına çıkmak zor olabilirUzun bağlam için daha elverişli özelliklere sahiptir

Ancak RoPE’nin de eğitimde görülenden çok daha uzun dizilere kusursuz biçimde genelleştiği düşünülmemelidir. Uzun context window’ları için RoPE scaling, interpolation ve benzeri ek teknikler kullanılabilir.

Modern LLM’lerde neden önemli?

RoPE, modern LLM mimarilerinde oldukça yaygınlaşmıştır. Llama ailesi bunun bilinen örneklerinden biridir. Uzun bağlamlı modellerin geliştirilmesiyle birlikte RoPE’nin farklı ölçekleme ve genişletme yöntemleri de önemli bir araştırma alanına dönüşmüştür. RoPE’nin tercih edilmesinin temel nedenleri arasında:

  • relative position bilgisini attention’a doğal biçimde taşıması,
  • öğrenilebilir mutlak pozisyon tablosu gerektirmemesi,
  • Transformer attention yapısıyla uyumlu olması,
  • uzun bağlamlı mimarilere uyarlanabilmesi

yer alır.

Transformer’daki yeri

RoPE kullanan bir Transformer’ı basitleştirirsek:

Tokenization

Token Embedding

Q, K, V oluşturma

Q + RoPE
K + RoPE

Q′ ve K′

Attention Scores

Attention Weights

Attention Output

FFN

Buradaki “+ RoPE” matematiksel toplama anlamında değil, rotasyon dönüşümünün uygulanması anlamındadır.

Kısa karşılaştırma

  • Sinusoidal Positional Encoding: Konum → Sinüs/Kosinüs → Token temsiline ekleme
  • Learned Positional Embedding: Konum → Öğrenilmiş vektör → Token temsiline ekleme
  • RoPE: Konum → Rotasyon açısı → Q ve K’yi döndürme → Attention

Kısaca: Rotary Positional Embedding, token konumlarını ayrı bir embedding olarak eklemek yerine Query ve Key vektörlerini pozisyona bağlı açılarla döndürerek konum bilgisini attention hesabına yerleştiren yöntemdir. En kısa formuyla:

RoPE = Konum Bilgisi + Q/K Rotasyonu → Konuma Duyarlı Attention

📚 Kaynakça ve Bu Maddeye Atıf

APA Formatı: YZ Hocası. (2026). Rotary Positional Embedding (RoPE). YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/rotary-positional-embedding-rope/

BibTeX: @misc{yzhocasi_2558, title={Rotary Positional Embedding (RoPE)}, url={https://yzhocasi.com/rotary-positional-embedding-rope/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}