Anasayfa / Yapay Zeka Ansiklopedisi / Unigram Tokenizer
📖 Açık Ansiklopedi Maddesi Son Değişiklik: 12 Eylül 2026, 16:00

Unigram Tokenizer

ℹ️
Ansiklopedi Dokümantasyonu: Bu madde, yapay zeka literatüründeki teknik standartlara ve akademik yayınlara dayalı olarak YZ Hocası kurulları tarafından incelenmiştir.

Unigram Tokenizer (Unigram Tabanlı Belirteçleyici), metni tokenlara ayırırken olasılıklardan yararlanan bir tokenlaştırma yöntemidir. Aynı metnin farklı biçimlerde parçalanabileceğini dikkate alır ve bu seçenekleri tokenlara atanan olasılıklar üzerinden değerlendirir. Alt sözcük tabanlı tokenlaştırmada kullanılan bu yaklaşım, SentencePiece kütüphanesi aracılığıyla uygulanabilir. Terimdeki uni, “bir” veya “tek” anlamını taşır. Unigram, dil modelleme bağlamında tek bir birimin olasılığına dayanan yaklaşımı ifade eder. Tokenizer ise Türkçede “belirteçleyici” veya “tokenlara ayırıcı” olarak karşılanabilir. Buradaki “tek” ifadesi, metnin tek tokena dönüştürüldüğü anlamına gelmez. Tokenlaştırma modelinde her tokenın olasılığının, önceki tokenlardan bağımsız kabul edildiğini belirtir.

Unigram Tokenizer nasıl çalışır? Eğitim, çok sayıda aday parçayı içeren geniş bir token dağarcığıyla başlar. Algoritma, bazı parçaların çıkarılmasının eğitim verisini temsil etme başarısını ne ölçüde azaltacağını değerlendirir. Çıkarılması en az kayba yol açan adaylar aşamalı olarak elenir. Böylece hedeflenen büyüklükte bir dağarcık elde edilir. Bu yönüyle Unigram, küçük birimleri birleştirerek dağarcığını büyüten klasik BPE’den ayrılır. Örneğin, uygun parçaların dağarcıkta bulunduğunu varsayarsak “kitaplar” kelimesi “kitap + lar”, “ki + tap + lar” veya başka biçimlerde ayrılabilir. Unigram, her seçeneğin olasılığını, içerdiği tokenların olasılıklarını çarparak hesaplar. Standart kullanımda en yüksek olasılığa sahip parçalanma seçilir. Bu seçim, mutlaka en uzun parçayı veya en az sayıda tokenı kullanmak anlamına gelmez.

Yöntemin önemli özelliklerinden biri, gerektiğinde alternatif parçalanmaların olasılıklı olarak örneklenebilmesidir. Böylece bir dil modeli, eğitim sırasında aynı metnin farklı token dizileriyle karşılaşabilir. Taku Kudo’nun 2018 tarihli çalışmasında açıklanan subword regularization, yani “alt sözcük düzenlileştirmesi”, bu çeşitlilikten yararlanarak modelin farklı girdilere karşı dayanıklılığını geliştirmeyi amaçlar. Unigram’daki bağımsızlık varsayımı, tokenlaştırma aşamasına aittir. Bu tokenları kullanan büyük dil modelinin bağlamı göz ardı ettiği anlamına gelmez. Ayrıca seçilen parçalar, dil bilgisindeki kök, ek veya hece sınırlarıyla her zaman örtüşmez.

📚 Kaynakça ve Bu Maddeye Atıf

APA Formatı: YZ Hocası. (2026). Unigram Tokenizer. YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/unigram-tokenizer/

BibTeX: @misc{yzhocasi_2888, title={Unigram Tokenizer}, url={https://yzhocasi.com/unigram-tokenizer/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}