Anasayfa / Yapay Zeka Ansiklopedisi / Subword Tokenization
📖 Açık Ansiklopedi Maddesi Son Değişiklik: 12 Eylül 2026, 15:27

Subword Tokenization

ℹ️
Ansiklopedi Dokümantasyonu: Bu madde, yapay zeka literatüründeki teknik standartlara ve akademik yayınlara dayalı olarak YZ Hocası kurulları tarafından incelenmiştir.

Subword Tokenization (Alt Sözcük Düzeyinde Belirteçlere Ayırma), metni tam kelimeler ve kelimelerden daha küçük parçalar kullanarak tokenlara ayıran bir yaklaşımdır. Sık kullanılan kelimeler tek token olarak korunabilirken daha nadir kelimeler birkaç parçayla temsil edilebilir. Böylece kelime düzeyinde ve karakter düzeyinde tokenlaştırma arasında bir denge kurulur. İngilizce subword terimi, “alt” anlamındaki sub öneki ile “sözcük” anlamındaki word kelimesinden oluşur. Tokenization ise “belirteçlere ayırma” anlamına gelir. Türkçede “alt sözcük tokenlaştırma” veya “sözcük altı birimlere ayırma” karşılıkları kullanılabilir. Buradaki alt sözcük, mutlaka bağımsız anlam taşıyan bir dil birimi değildir.

Yaklaşım nasıl çalışır? Tokenlaştırıcının eğitimi sırasında metinlerdeki örüntülerden yararlanılarak bir token dağarcığı oluşturulur. Yeni metinler, bu dağarcık ve seçilen algoritmanın kuralları doğrultusunda parçalanır. Örneğin “kitaplarımızdan” kelimesi, varsayımsal olarak “kitap + lar + ımız + dan” biçiminde temsil edilebilir. Ancak gerçek parçalanma kullanılan sisteme bağlıdır; kök ve ek sınırlarıyla örtüşmek zorunda değildir. Bu yaklaşımın temel katkısı, her farklı kelime biçimi için ayrı bir dağarcık girdisi gerektirmemesidir. Eğitim verisinde bütün hâliyle görülmeyen bir kelime, bilinen parçaların birleşimiyle işlenebilir. Özellikle çok sayıda çekimli ve türemiş kelime barındıran dillerde bu özellik önem taşır. Sennrich, Haddow ve Birch’in 2016 tarihli araştırması, alt sözcük birimlerinin sinirsel makine çevirisinde nadir kelimelerin işlenmesine katkısını göstermiştir.

BPE, WordPiece ve Unigram, alt sözcük tokenlaştırmanın farklı yöntemleridir. Bu yöntemler, dağarcığı oluşturma ve uygun parçalanmayı seçme biçimleri bakımından ayrılır. SentencePiece ise BPE ve Unigram gibi yöntemleri uygulayabilen bir yazılım kütüphanesidir. Dolayısıyla alt sözcük tokenlaştırma, tek bir algoritmanın adı değil, bir yöntem ailesini tanımlayan üst kavramdır. Bir kelimenin parçalara ayrılabilmesi, modelin o kelimenin anlamını doğru kavradığını garanti etmez. Örneğin yeni bir teknik terimin tokenlarla temsil edilmesi, modelin bu terime ilişkin güvenilir bilgiye sahip olduğunu göstermez. Tokenlaştırma, metni modele uygun birimlere dönüştürür; anlamlandırma ise modelin öğrendiği ilişkilerle bağlantılıdır.

📚 Kaynakça ve Bu Maddeye Atıf

APA Formatı: YZ Hocası. (2026). Subword Tokenization. YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/subword-tokenization/

BibTeX: @misc{yzhocasi_2894, title={Subword Tokenization}, url={https://yzhocasi.com/subword-tokenization/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}