Transformer Mimarisi
Transformer Mimarisi (Transformer Architecture), metin gibi sıralı verilerdeki öğeler arasındaki ilişkileri attention (dikkat) mekanizması aracılığıyla modelleyen bir derin öğrenme mimarisidir. 2017 yılında Vaswani ve arkadaşlarının “Attention Is All You Need” çalışmasıyla tanıtılmış ve günümüzde büyük dil modellerinin temel teknolojilerinden biri hâline gelmiştir.
Temel süreç: Girdi → Tokenization → Embedding → Positional Information → Self-Attention → Transformer Katmanları → Çıktı
Temel bileşenleri
| Bileşen | Açıklama |
|---|---|
| Tokenization | Metni modelin işleyebileceği tokenlara ayırır. |
| Embedding | Tokenları sayısal vektörlere dönüştürür. |
| Positional Encoding | Tokenların dizideki konum bilgisini modele aktarır. |
| Self-Attention | Tokenların birbirleriyle ilişkisini hesaplar. |
| Multi-Head Attention | Farklı ilişki türlerini paralel biçimde öğrenir. |
| Feed-Forward Network | Attention sonrasında bilgiyi dönüştürür ve işler. |
| Residual Connections | Katmanlar arasında bilgi akışını destekler. |
| Normalization | Eğitim ve hesaplama sürecinin kararlılığına yardımcı olur. |
Self-Attention nasıl çalışır?
Transformer’ın en önemli özelliği Self-Attention mekanizmasıdır. Model bir kelimeyi işlerken cümledeki diğer tokenların o kelime açısından ne kadar önemli olduğunu hesaplar.
Örneğin: “Ayşe bilgisayarını masaya bıraktı çünkü onu artık kullanmayacaktı.”
Model, “onu” ifadesinin hangi önceki unsurla ilişkili olduğunu belirleyebilmek için cümlenin diğer bölümleriyle olan ilişkileri değerlendirir. Böylece yalnızca kelimeleri tek tek değil, bağlam içerisindeki ilişkilerini öğrenmeye çalışır.
Encoder ve Decoder yapısı
Orijinal Transformer mimarisi iki temel bölümden oluşur:
Encoder: Girdiyi analiz ederek bağlamsal bir temsil oluşturur.
Decoder: Bu temsilden yararlanarak çıktıyı üretir.
Ancak bütün dil modelleri bu iki bölümü birlikte kullanmaz. Örneğin bazı modeller encoder-only, bazıları decoder-only, bazıları ise encoder–decoder mimarisine dayanır.
RNN ve LSTM’den farkı
RNN ve LSTM gibi önceki mimariler dizileri büyük ölçüde sıralı olarak işlerken Transformer, attention mekanizması sayesinde tokenlar arasındaki ilişkileri daha paralel biçimde hesaplayabilir. Bu özellik, büyük veri kümeleri ve büyük modeller üzerinde ölçeklenmesini kolaylaştırmıştır.
LLM’lerle ilişkisi
GPT ve benzeri modern büyük dil modellerinin temelinde Transformer mimarisinin çeşitli biçimleri bulunur. Ancak:
Transformer ≠ LLM
Transformer bir sinir ağı mimarisidir; LLM ise genellikle Transformer tabanlı mimarinin çok büyük miktarda metin/veri üzerinde eğitilmesiyle oluşturulan büyük dil modelidir.
Kısaca: Transformer mimarisi, tokenlar arasındaki bağlamsal ilişkileri attention mekanizmasıyla öğrenen ve modern üretken yapay zekâ ile büyük dil modellerinin gelişiminde temel rol oynayan derin öğrenme mimarisidir.
📚 Kaynakça ve Bu Maddeye Atıf
APA Formatı: YZ Hocası. (2026). Transformer Mimarisi. YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/transformer-mimarisi/
BibTeX: @misc{yzhocasi_2127, title={Transformer Mimarisi}, url={https://yzhocasi.com/transformer-mimarisi/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}