Tokenizarea este procesul prin care un text este descompus în unități mai mici, numite „tokenuri” — cuvinte, subcuvinte, caractere sau chiar semne de punctuație — pentru a putea fi procesat matematic de un model de inteligență artificială. Este, de regulă, primul pas în orice pipeline de procesare a limbajului natural (NLP).
Există mai multe strategii de tokenizare: la nivel de cuvânt (fiecare cuvânt devine un token, dar vocabularul devine foarte mare), la nivel de caracter (vocabular mic, dar secvențe foarte lungi) și, cea mai folosită astăzi în modelele mari de limbaj, tokenizarea la nivel de subcuvânt (precum Byte-Pair Encoding sau WordPiece), care descompune cuvintele rare în bucăți mai mici și frecvente, oferind un echilibru optim între dimensiunea vocabularului și lungimea secvenței.
De exemplu, cuvântul „neconstituțional” ar putea fi împărțit în tokenuri precum „ne”, „constitu” și „țional”, permițând modelului să recunoască prefixe și sufixe comune chiar și pentru cuvinte pe care nu le-a văzut niciodată în formă întreagă în timpul antrenamentului.
Numărul de tokenuri dintr-un text determină direct costul de calcul și viteza de procesare a unui model — de aceea furnizorii de modele de limbaj (precum OpenAI sau Anthropic) tarifează accesul la API în funcție de numărul de tokenuri procesați, nu de numărul de cuvinte sau caractere. Înțelegerea tokenizării este esențială pentru oricine optimizează costuri sau lungimea prompturilor în aplicații bazate pe AI generativă.
