Feed Forward Network (FFN)
Feed Forward Network (FFN – İleri Beslemeli Sinir Ağı), Transformer mimarisinde attention katmanından elde edilen temsilleri token bazında doğrusal olmayan dönüşümlerden geçirerek işleyen sinir ağı bileşenidir. Attention mekanizması tokenlar arasındaki ilişkileri kurarken, FFN her tokenın oluşan temsilini daha ileri düzeyde dönüştürür.
Transformer’da ne işe yarar?
Bir Transformer bloğunu basitleştirirsek:
Girdi → Multi-Head Attention → FFN → Sonraki Transformer Bloğu
Attention mekanizması kabaca: “Hangi tokenlardan bilgi almalıyım?” sorusuyla ilgilenirken
FFN: “Toplanan bu bilgiyi nasıl dönüştürmeliyim?” işlevini üstlenir.
FFN nasıl çalışır?
Klasik Transformer’daki FFN genellikle iki doğrusal dönüşüm ve aralarındaki doğrusal olmayan aktivasyon fonksiyonundan oluşur:
Burada:
- x: Attention sonrasında gelen token temsili
- W1W_1: İlk ağırlık matrisi
- b1b_1: İlk bias
- σ\sigma: Aktivasyon fonksiyonu
- W2W_2: İkinci ağırlık matrisi
- b2b_2: İkinci bias
Süreç: Token Temsili → Linear Projection → Aktivasyon → Linear Projection → Yeni Token Temsili
Genişletme ve daraltma
FFN’nin dikkat çekici özelliklerinden biri, token temsilini çoğunlukla önce daha yüksek boyutlu bir ara uzaya genişletmesi, ardından tekrar model boyutuna düşürmesidir. Örneğin kavramsal olarak:
768 boyut → 3072 boyut → 768 boyut veya daha büyük bir modelde: 4096 → 11008 → 4096 gibi yapılar görülebilir. Ancak bu oranlar sabit değildir; model mimarisine göre değişir. Bu geniş ara katman, modelin daha karmaşık doğrusal olmayan dönüşümler öğrenmesine imkân verir.
Attention ile temel farkı
| Attention | FFN |
|---|---|
| Tokenlar arasındaki ilişkileri işler | Her tokenın temsilini dönüştürür |
| Diğer tokenlardan bilgi toplar | Toplanan bilgiyi işler |
| Q, K ve V kullanır | Ağırlık matrisleri ve aktivasyon kullanır |
| Tokenlar arasında etkileşim vardır | Standart FFN aynı fonksiyonu her tokena ayrı ayrı uygular |
Bu nedenle Transformer’da iki mekanizma birbirini tamamlar:
- Attention → Bilgiyi bağlamdan toplar
- FFN → Toplanan bilgiyi dönüştürür
Aktivasyon fonksiyonları
İlk Transformer çalışmasında ReLU kullanılmıştır. Modern modellerde ise farklı aktivasyon ve FFN tasarımları görülebilir:
GELU, SiLU/Swish, GLU, SwiGLU gibi.
Özellikle bazı modern LLM’lerde klasik iki katmanlı FFN yerine gated FFN yapıları kullanılmaktadır.
FFN ve Mixture of Experts
FFN kavramı, Mixture of Experts (MoE) modellerini anlamak açısından da önemlidir. Standart Transformer’da her token genellikle aynı FFN üzerinden geçerken, MoE mimarilerinde birden fazla uzman FFN bulunabilir ve bir router belirli tokenları seçilmiş uzmanlara yönlendirebilir. Basitleştirilmiş olarak:
- Standart Transformer: Token → FFN
- MoE Transformer: Token → Router → Seçilmiş Expert FFN → Çıktı
Bu yaklaşım model kapasitesinin büyütülmesinde önemli yöntemlerden biridir.
Kısaca: Feed Forward Network, Transformer’da attention tarafından oluşturulan bağlamsal token temsillerini her konum için ayrı fakat paylaşılan ağırlıklarla, doğrusal olmayan biçimde dönüştüren temel sinir ağı bileşenidir.
En basit ayrımla:
Attention = Bilgiyi bağlamdan seç ve birleştir.
FFN = Elde edilen bilgiyi işle ve dönüştür.
📚 Kaynakça ve Bu Maddeye Atıf
APA Formatı: YZ Hocası. (2026). Feed Forward Network (FFN). YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/feed-forward-network-ffn/
BibTeX: @misc{yzhocasi_2545, title={Feed Forward Network (FFN)}, url={https://yzhocasi.com/feed-forward-network-ffn/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}