Anasayfa / Yapay Zeka Ansiklopedisi / Feed Forward Network (FFN)
📖 Açık Ansiklopedi Maddesi Son Değişiklik: 31 Ağustos 2026, 21:04

Feed Forward Network (FFN)

ℹ️
Ansiklopedi Dokümantasyonu: Bu madde, yapay zeka literatüründeki teknik standartlara ve akademik yayınlara dayalı olarak YZ Hocası kurulları tarafından incelenmiştir.

Feed Forward Network (FFN – İleri Beslemeli Sinir Ağı), Transformer mimarisinde attention katmanından elde edilen temsilleri token bazında doğrusal olmayan dönüşümlerden geçirerek işleyen sinir ağı bileşenidir. Attention mekanizması tokenlar arasındaki ilişkileri kurarken, FFN her tokenın oluşan temsilini daha ileri düzeyde dönüştürür.

Transformer’da ne işe yarar?

Bir Transformer bloğunu basitleştirirsek:

Girdi → Multi-Head Attention → FFN → Sonraki Transformer Bloğu

Attention mekanizması kabaca: “Hangi tokenlardan bilgi almalıyım?” sorusuyla ilgilenirken

FFN: “Toplanan bu bilgiyi nasıl dönüştürmeliyim?” işlevini üstlenir.

FFN nasıl çalışır?

Klasik Transformer’daki FFN genellikle iki doğrusal dönüşüm ve aralarındaki doğrusal olmayan aktivasyon fonksiyonundan oluşur:FFN(x)=W2σ(W1x+b1)+b2FFN(x)=W_2\,\sigma(W_1x+b_1)+b_2

Burada:

  • x: Attention sonrasında gelen token temsili
  • W1W_1: İlk ağırlık matrisi
  • b1b_1: İlk bias
  • σ\sigma: Aktivasyon fonksiyonu
  • W2W_2: İkinci ağırlık matrisi
  • b2b_2: İkinci bias

Süreç: Token Temsili → Linear Projection → Aktivasyon → Linear Projection → Yeni Token Temsili

Genişletme ve daraltma

FFN’nin dikkat çekici özelliklerinden biri, token temsilini çoğunlukla önce daha yüksek boyutlu bir ara uzaya genişletmesi, ardından tekrar model boyutuna düşürmesidir. Örneğin kavramsal olarak:

768 boyut → 3072 boyut → 768 boyut veya daha büyük bir modelde: 4096 → 11008 → 4096 gibi yapılar görülebilir. Ancak bu oranlar sabit değildir; model mimarisine göre değişir. Bu geniş ara katman, modelin daha karmaşık doğrusal olmayan dönüşümler öğrenmesine imkân verir.

Attention ile temel farkı

AttentionFFN
Tokenlar arasındaki ilişkileri işlerHer tokenın temsilini dönüştürür
Diğer tokenlardan bilgi toplarToplanan bilgiyi işler
Q, K ve V kullanırAğırlık matrisleri ve aktivasyon kullanır
Tokenlar arasında etkileşim vardırStandart FFN aynı fonksiyonu her tokena ayrı ayrı uygular

Bu nedenle Transformer’da iki mekanizma birbirini tamamlar:

  • Attention → Bilgiyi bağlamdan toplar
  • FFN → Toplanan bilgiyi dönüştürür

Aktivasyon fonksiyonları

İlk Transformer çalışmasında ReLU kullanılmıştır. Modern modellerde ise farklı aktivasyon ve FFN tasarımları görülebilir:

GELU, SiLU/Swish, GLU, SwiGLU gibi.

Özellikle bazı modern LLM’lerde klasik iki katmanlı FFN yerine gated FFN yapıları kullanılmaktadır.

FFN ve Mixture of Experts

FFN kavramı, Mixture of Experts (MoE) modellerini anlamak açısından da önemlidir. Standart Transformer’da her token genellikle aynı FFN üzerinden geçerken, MoE mimarilerinde birden fazla uzman FFN bulunabilir ve bir router belirli tokenları seçilmiş uzmanlara yönlendirebilir. Basitleştirilmiş olarak:

  • Standart Transformer: Token → FFN
  • MoE Transformer: Token → Router → Seçilmiş Expert FFN → Çıktı

Bu yaklaşım model kapasitesinin büyütülmesinde önemli yöntemlerden biridir.

Kısaca: Feed Forward Network, Transformer’da attention tarafından oluşturulan bağlamsal token temsillerini her konum için ayrı fakat paylaşılan ağırlıklarla, doğrusal olmayan biçimde dönüştüren temel sinir ağı bileşenidir.

En basit ayrımla:

Attention = Bilgiyi bağlamdan seç ve birleştir.
FFN = Elde edilen bilgiyi işle ve dönüştür.

📚 Kaynakça ve Bu Maddeye Atıf

APA Formatı: YZ Hocası. (2026). Feed Forward Network (FFN). YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/feed-forward-network-ffn/

BibTeX: @misc{yzhocasi_2545, title={Feed Forward Network (FFN)}, url={https://yzhocasi.com/feed-forward-network-ffn/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}