SentencePiece
SentencePiece, doğal dil işleme ve büyük dil modellerinde metinleri tokenlara ayırmak ve bu tokenları yeniden metne dönüştürmek için kullanılan açık kaynaklı bir yazılım kütüphanesidir. Taku Kudo ve John Richardson tarafından 2018 yılında yayımlanan çalışmada tanıtılmıştır. Temel özelliği, tokenlaştırma modelinin önceden kelimelere ayrılmamış ham cümleler üzerinden eğitilebilmesidir. Kudo ve Richardson, 2018
İngilizce adı, “cümle” anlamındaki sentence ile “parça” anlamındaki piece sözcüklerinin birleşiminden oluşur. Türkçeye sözcük düzeyinde “cümle parçası” olarak çevrilebilir. Ancak bir yazılımın özel adı olduğu için teknik metinlerde genellikle SentencePiece biçiminde kullanılır. Adındaki “cümle” ifadesi, her tokenın bir cümle veya anlamlı bir söz öbeği olduğu anlamına gelmez.
SentencePiece’in geliştirilmesindeki temel amaçlardan biri, dile özgü ön işleme gereksinimini azaltmaktır. Bazı tokenlaştırma araçları, metnin önce kelimelere ayrılmasını bekler. SentencePiece ise bu ön koşula ihtiyaç duymadan alt sözcük birimlerini öğrenebilir. Bu özellik, kelime sınırlarının düzenli olarak boşluklarla gösterilmediği Japonca ve Çince gibi dillerin işlenmesinde de yararlıdır. Kudo ve Richardson, 2018
SentencePiece ile BPE arasındaki ilişki özellikle önemlidir. BPE bir tokenlaştırma algoritmasıdır; SentencePiece ise BPE ve Unigram gibi farklı yaklaşımları uygulayabilen bir araçtır. Dolayısıyla “SentencePiece kullanılıyor” ifadesi, tek başına hangi algoritmanın seçildiğini açıklamaz. Eğitim sırasında kullanılacak yaklaşım ve token dağarcığının büyüklüğü gibi özellikler belirlenir.
SentencePiece’in dikkat çekici özelliklerinden biri de boşlukları tokenlaştırma sürecinde açıkça temsil etmesidir. Bunun için genellikle “▁” sembolü kullanılır. Örneğin “Bugün hava güzel” ifadesi, varsayımsal olarak “▁Bugün”, “▁hava” ve “▁güzel” parçalarıyla gösterilebilir. Gerçek parçalanma, eğitilmiş tokenlaştırıcıya bağlıdır; kelimeler daha küçük birimlere de ayrılabilir. Sembol, parçaların yeniden metne dönüştürülmesinde boşlukların yerini belirlemeye yardımcı olur. Normalleştirme ayarları ise özgün metindeki bazı biçimsel ayrıntıları değiştirebilir. SentencePiece resmî deposu
SentencePiece’in görevi metni anlamak veya sorulara yanıt vermek değildir. Dil modelinin kullanacağı metin birimlerini ve bunların sayısal kimliklerini üretir. Bu nedenle, dil modelinin kendisiyle tokenlaştırma aracını birbirinden ayırmak gerekir.
📚 Kaynakça ve Bu Maddeye Atıf
APA Formatı: YZ Hocası. (2026). SentencePiece. YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/sentencepiece/
BibTeX: @misc{yzhocasi_2884, title={SentencePiece}, url={https://yzhocasi.com/sentencepiece/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}