Token nədir? AI niyə "token"la sayır
Token nədir, AI aləmində nəyi ölçür? Sadə izah, kontekst pəncərəsi anlayışı, limit-qiymətə təsiri və uzun sənədlərlə iş qaydaları bir yazıda.

AI alətlərinin sənədlərində, qiymət cədvəllərində, xəta mesajlarında hey eyni söz: token. "Kontekst pəncərəsi 200 min token", "qiymət milyon tokenə görə", "token limiti aşıldı". Bəs token nədir? AI dünyasının bu ölçü vahidini anlamaq texniki maraq deyil, praktik ehtiyacdır: limitlər, qiymətlər və "niyə yarıda kəsildi" suallarının hamısı bu anlayışa bağlıdır.
Bu yazı tokeni sadə dildə izah edir: nədir, niyə hərflə-sözlə deyil onunla sayılır, kontekst pəncərəsi nə deməkdir və gündəlik istifadəyə hansı qaydalar çıxır.
Token: modelin "loxması"
Model mətni bizim kimi hərf-hərf və ya söz-söz oxumur; öz parçalarına bölür və bu parçalar token adlanır. Token bəzən tam sözdür ("kitab"), bəzən söz hissəsi ("avtomatlaş" + "dırma"), bəzən durğu işarəsi. Niyə belə? Texniki kompromis: hərf-hərf oxumaq çox uzun ardıcıllıqlar yaradır, söz-söz oxumaq isə milyonlarla nadir sözü ayrıca saxlamağı tələb edir; parça yanaşması ikisinin ortasıdır: məhdud lüğətlə istənilən mətni yığa bilirsən. Kobud nisbətlər (dilə görə dəyişir): ingiliscə 1 token ≈ 4 hərf / 0.75 söz; Azərbaycan dili kimi az təmsil olunan dillərdə isə eyni mətn adətən daha çox token yeyir (sözlər daha xırda parçalanır); yəni eyni limitə bizim dildə bir az az mətn sığır. LLM yazısındakı "növbəti sözü təxmin" təsviri dəqiqləşir: model əslində növbəti tokeni təxmin edir.
Kontekst pəncərəsi: modelin iş masası
Ən vacib praktik anlayış: kontekst pəncərəsi modelin bir anda "görə bildiyi" token həcmidir; sizin mesajlarınız + yüklədiyiniz sənədlər + modelin öz cavabları hamısı bu pəncərəyə sığmalıdır. Pəncərə dolanda nə olur? Köhnə hissələr görünməz olur; uzun söhbətin əvvəlindəki detalları modelin "unutması"nın səbəbi budur: yaddaşı pozulmayıb, pəncərədən çıxıb. Müasir modellərdə pəncərələr böyükdür (yüz minlərlə token: yüzlərlə səhifə), amma sonsuz deyil və bir nüans da var: pəncərənin ortasındakı məlumat kənarlarındakından zəif "xatırlana" bilir. Praktik qaydalar: uzun söhbətlərdə vacib konteksti arabir təzələyin, böyük sənədlə işdə sualı sənədin yanına konkret qoyun və nəhəng arxivlərlə iş üçün RAG yanaşmasına baxın: hamısını pəncərəyə tökmək əvəzinə lazım olanı tapıb vermək.
Qiymət və limit: tokenin pul tərəfi
| Görünüş | Token əlaqəsi |
|---|---|
| API qiymətləri | Milyon token başına; giriş (sizin mətn) və çıxış (cavab) ayrı tariflə |
| Abunə limitləri | "Mesaj sayı" limitlərinin arxasında əslində token büdcəsi dayanır |
| Uzun sənəd yükləmə | 100 səhifəlik PDF minlərlə token = limitin böyük dilimi |
| Cavab uzunluğu kəsilməsi | Çıxış token limiti; "davam et" deməklə növbəti hissə alınır |
Biznes istifadəçisi üçün nəticələr: API layihələrində xərc proqnozu token hesabı ilə aparılır (tipik sorğu × aylıq say × tarif), abunə istifadəçisi üçünsə qayda sadədir: lazımsız uzun kontekst daşımayın; hər sorğuya bütün tarixçəni yapışdırmaq həm keyfiyyəti, həm limiti yeyir.
Gündəlik istifadə qaydaları
- Konteksti seçici verin: sənədin hamısı yox, aid hissəsi; yaxşı promptun yarısı düzgün kontekst seçimidir.
- Uzun işi hissələyin: 50 səhifəlik hesabatı bölmə-bölmə emal etmək həm keyfiyyət, həm limit dostudur.
- Söhbəti təzələyin: mövzu dəyişəndə yeni söhbət açmaq köhnə yükü atır; "hər şey bir çatda" vərdişi pəncərəni zibilləyir.
- Xülasə körpüsü qurun: uzun söhbətin davamı lazımdırsa, modeldən xülasə istəyib yeni söhbətə aparın; peşəkarların standart fəndidir.
Token haqqında tez-tez verilən suallar
Mətnimin neçə token olduğunu necə bilim?
Kobud hesab: söz sayı × 1.3-2 (dildən asılı). Dəqiq hesab üçün provayderlərin tokenizer alətləri var (OpenAI-ın tokenizer səhifəsi kimi). Gündəlik istifadədə dəqiqlik lazım deyil; miqyas hissi yetər: səhifə ≈ 500-800 token.
Azərbaycan dilində işləmək niyə "bahalı"dır?
Tokenizasiya az təmsil olunan dillərdə xırda parçalayır: eyni məzmun ingiliscədən çox token tutur. Praktik təsiri kiçikdir (limitlər böyükdür), amma API-miqyaslı layihələrdə hesaba qatılmalıdır. Yaxşı xəbər: yeni modellərdə çoxdilli tokenizasiya yaxşılaşır.
Kontekst pəncərəsi böyük olan model həmişə yaxşıdır?
Yox: pəncərə tutumdur, keyfiyyət deyil. Böyük pəncərəyə tökülən pis strukturlu material yaxşı cavab vermir; kiçik pəncərəli modelə düzgün seçilmiş kontekst çox vaxt üstün nəticə verir. Pəncərə böyüklüyü uzun sənəd ssenarilərində həlledicidir, gündəlik işdə yox.
Şəkil və səs də tokenlə sayılır?
Bəli: multimodal modellərdə şəkil parçalara bölünüb token ekvivalentinə çevrilir (yüksək ölçülü şəkil = çox token), səs də oxşar məntiqlə. "Şəkil yüklədim, limit doldu" təəccübünün izahı budur.
Peşəkar dəstək
AI istifadəsini biznesinizdə səmərəli qurmaq istəyirsiniz?
Diaqnostika, prioritet və tətbiq arxitekturası üçün AI Transformation Consulting xidmətinə baxın.
Mənbələr və növbəti oxu
Mənbəni harada yoxlamaq lazımdır
Tokenizasiya alətləri:
- OpenAI Tokenizer: mətninizi token-token görün
Mövzunun davamı
AI savadı xəttinin qonşu yazıları:
- LLM: təməl anlayış
- RAG: böyük arxivlərlə iş
- Kontekst və prompt
- AI xərc hesabı
- Bu mövzudakı digər yazılar
Yekun bir bənzətmə ilə: token modelin loxması, kontekst pəncərəsi süfrəsidir. Süfrəyə nə qoyduğunuzu seçəndə (aid material, təmiz kontekst) model də yaxşı "yeyir"; qalan hər şey bu sadə qaydanın törəmələridir.
Mən Anar Rustamli — böyümənin, texnologiyanın və insan düşüncəsinin kəsişməsində işləyən strateq, sahibkar və AI tətbiqi lideriyəm. 2016-cı ildən işim bizneslərə sürətlə dəyişən rəqəmsal mühitdə inkişaf etməyə kömək etmək üzərində qurulub. Böyümə sistemləri, AI-əsaslı iş axınları və nəticəni məqsədlə uzlaşdıran strateji çərçivələr dizayn edirəm. İnanıram ki, əsl böyümə strategiya, data və insan fəhmi birlikdə işləyəndə baş verir — missiyam bizneslərə AI-ı elə tətbiq etməkdə kömək etməkdir ki, həm nəticələri, həm kimlikləri güclənsin.

