Tokenizace je proces rozdělení textu na menší jednotky (tokeny), se kterými dál pracuje jazykový model. Tokenem může být celé slovo, jeho část, jeden znak nebo i mezera – záleží na konkrétním modelu. V češtině jeden token průměrně odpovídá zhruba 2–3 znakům. Tokeny mají přímý dopad na cenu i kontextové limity AI služeb – účtuje se za počet vstupních i výstupních tokenů.