Anasayfa / Yapay Zeka Ansiklopedisi / Vocabulary (Söz Varlığı / Token Dağarcığı)
📖 Açık Ansiklopedi Maddesi Son Değişiklik: 12 Eylül 2026, 15:15

Vocabulary (Söz Varlığı / Token Dağarcığı)

ℹ️
Ansiklopedi Dokümantasyonu: Bu madde, yapay zeka literatüründeki teknik standartlara ve akademik yayınlara dayalı olarak YZ Hocası kurulları tarafından incelenmiştir.

Vocabulary , doğal dil işleme ve büyük dil modelleri bağlamında, bir tokenlaştırma sisteminin tanıdığı tokenların bütününü ifade eder. İnsan dilinde bireyin bildiği veya bir dilde bulunan kelimeleri anlatan bu kavram, yapay zekâda daha teknik bir anlam taşır. Modelin vocabulary’si yalnızca tam kelimelerden oluşmaz; kelime parçaları, noktalama işaretleri, karakterler ve özel amaçlı tokenlar da içerebilir. İngilizce vocabulary sözcüğü, köken bakımından Latince “ad” veya “sözcük” anlamındaki vocabulum kelimesine dayanır. Türkçede genel kullanımda “kelime hazinesi”, “sözcük dağarcığı” veya “söz varlığı” olarak karşılanır. Yapay zekâ bağlamında ise içerdiği birimlerin her zaman kelime olmaması nedeniyle “token dağarcığı” karşılığı kavramı daha açık biçimde anlatır.

Bir metin dil modeline gönderildiğinde, tokenlaştırıcı metni kendi dağarcığında bulunan birimlere ayırır. Her tokenın bu dağarcıkta belirli bir sayısal kimliği vardır. Bu kimlikler, modelin işleyeceği sayısal temsillere ulaşmak için kullanılır. Model yanıt üretirken de çıkış dağarcığındaki tokenlar arasından seçim yaparak metni adım adım oluşturur. Örneğin “kitap” sözcüğü dağarcıkta bağımsız bir token olarak bulunabilir. “Kitapçılarımızdan” gibi daha uzun bir sözcük ise birkaç tokenla temsil edilebilir. Böylece model, her kelimenin bütün hâlinin dağarcıkta bulunmasına gerek kalmadan çok çeşitli metinleri işleyebilir. Ancak parçalanmanın biçimi, kullanılan tokenlaştırıcıya bağlıdır; dil bilgisindeki kök ve ek ayrımıyla birebir örtüşmek zorunda değildir.

Vocabulary size (token dağarcığı büyüklüğü), sistemde kaç farklı token bulunduğunu belirtir. Daha büyük bir dağarcık, bazı metinlerin daha az tokenla temsil edilmesini sağlayabilir. Bununla birlikte, modelin token temsilleri ve çıktı hesaplamaları için gereken kaynakları da artırabilir. Dolayısıyla büyük bir dağarcık, tek başına daha başarılı veya daha bilgili bir model anlamına gelmez.

Vocabulary ile modelin bilgisi de birbirinden ayrılmalıdır. Bir kavramın adının tek token olarak bulunmaması, modelin o kavramı açıklayamayacağı anlamına gelmez. Benzer şekilde, bir kelimenin dağarcıkta bulunması da modelin anlamını doğru bildiğini garanti etmez. Yaygın dil modellerinde konuşmaya yeni kelimeler eklemek, token dağarcığını kendiliğinden genişletmez; yeni ifadeler mevcut tokenlarla temsil edilir.

📚 Kaynakça ve Bu Maddeye Atıf

APA Formatı: YZ Hocası. (2026). Vocabulary (Söz Varlığı / Token Dağarcığı). YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/vocabulary-soz-varligi-token-dagarcigi/

BibTeX: @misc{yzhocasi_2876, title={Vocabulary (Söz Varlığı / Token Dağarcığı)}, url={https://yzhocasi.com/vocabulary-soz-varligi-token-dagarcigi/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}