Token, büyük dil modellerinin (LLM) metinleri işlerken kullandığı en küçük anlamlı veri birimidir. Yapay zekâ sistemleri metinleri insanlar gibi kelime kelime değil; kelime, kelime parçası, noktalama işareti veya özel karakterlerden oluşan token’lara ayırarak analiz eder. Bu nedenle bir kelime tek bir token olabileceği gibi, uzun veya karmaşık bir kelime birden fazla token’a bölünebilir.
Örneğin “Merhaba dünya!” ifadesi model tarafından “Merhaba”, “dünya” ve “!” şeklinde birkaç token olarak işlenebilir. Büyük dil modelleri, bu token dizilerini analiz ederek bir sonraki en olası token’ı tahmin eder ve böylece anlamlı cümleler oluşturur.
Token kavramı, yapay zekâ modellerinin performansını doğrudan etkileyen temel unsurlardan biridir. Bir modelin bağlam penceresi (context window) ne kadar büyükse, aynı anda o kadar fazla token işleyebilir. Bu sayede uzun belgeler, kitaplar veya kapsamlı sohbetler daha tutarlı şekilde analiz edilebilir.
Birçok yapay zekâ hizmetinde kullanım ücretleri ve kota sınırları da token sayısına göre belirlenir. Bu nedenle uzun metinler veya ayrıntılı istemler daha fazla token tüketir. Yapay zekâ teknolojilerini verimli kullanmak isteyen kullanıcılar için token kavramını anlamak; maliyetleri yönetmek, model sınırlarını bilmek ve daha etkili istemler hazırlamak açısından büyük önem taşır.
Yorumlar (0)