Character Tokenization
Character Tokenization (Karakter Düzeyinde Belirteçlere Ayırma), metni tek tek karakterlere ayırarak her karakteri bir token olarak temsil eden yöntemdir. Harfler, rakamlar, noktalama işaretleri ve uygulamanın kurallarına bağlı olarak boşluklar ayrı birimler hâlinde işlenir. Kelime veya alt sözcük tabanlı yöntemlerden farklı olarak temel temsil birimi karakterdir. İngilizce character sözcüğü, bu bağlamda “karakter” veya “yazı işareti” anlamına gelir. Tokenization ise “belirteçlere ayırma” işlemidir. Terim Türkçede “karakter tabanlı tokenlaştırma” olarak da kullanılabilir. Buradaki karakter kavramı yalnızca harfleri kapsamaz; metni oluşturan diğer yazılı sembolleri de içerir.
Yöntem nasıl çalışır? Örneğin “Kalem!” ifadesi, basit bir karakter tokenlaştırıcısında “K”, “a”, “l”, “e”, “m”, “!” biçiminde altı tokena ayrılır. Her birim, dağarcıktaki sayısal kimliğiyle modele aktarılır. Aynı harf farklı kelimelerde geçtiğinde yeniden kullanılabildiği için her kelimeye ayrı bir token tanımlamak gerekmez. Bu yaklaşımın önemli avantajı, kelime tabanlı yöntemlere kıyasla daha küçük bir dağarcıkla çalışabilmesidir. Modelin eğitim sırasında bütün hâliyle karşılaşmadığı bir kelime, içerdiği karakterler dağarcıkta bulunuyorsa temsil edilebilir. Ancak dağarcığın kapsamadığı karakterler için ayrıca bir çözüm gerekir.
Temel sınırlılığı ise token dizilerinin uzamasıdır. Alt sözcük yöntemiyle birkaç token kullanılarak temsil edilebilen uzun bir kelime, karakter düzeyinde çok daha fazla token gerektirebilir. Bu durum, kullanılan model mimarisine bağlı olarak hesaplama yükünü artırabilir. Modelin kelime yapısını ve anlam ilişkilerini daha küçük birimlerden öğrenmesi gerekir.
Karakter ile bayt aynı şey değildir. Bir karakter, kullanılan kodlamaya göre birden fazla baytla temsil edilebilir. Ayrıca ekranda tek bir karakter gibi görünen işaret, birden fazla Unicode kod noktasından oluşabilir. Örneğin “é”, tek bir kod noktasıyla veya “e” harfine eklenen bir birleştirme işaretiyle yazılabilir. Dolayısıyla token sayısını belirlerken kullanılan karakter tanımı ve normalleştirme işlemleri önemlidir. “Görünen her işaret kesinlikle bir tokendır” genellemesi her uygulama için geçerli değildir.
📚 Kaynakça ve Bu Maddeye Atıf
APA Formatı: YZ Hocası. (2026). Character Tokenization. YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/character-tokenization/
BibTeX: @misc{yzhocasi_2890, title={Character Tokenization}, url={https://yzhocasi.com/character-tokenization/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}