Também disponível em: English (US)
Contador de tokens
Quantos tokens tem o seu texto? Cole abaixo e receba na hora uma estimativa de tokens, palavras, caracteres e custo aproximado. Importante: o número exato depende do tokenizador de cada modelo, por isso mostramos uma faixa, e não um valor cravado.
Regras de bolso
| Referência | Equivale a mais ou menos |
|---|---|
| 1 token | cerca de 4 caracteres em inglês |
| 1 token | cerca de 0,75 palavra |
| 100 tokens | cerca de 75 palavras |
| 1.000 tokens | aproximadamente meia página de texto corrido |
Como esta estimativa é feita
Um token é o pedaço de texto que o modelo realmente lê: pode ser uma palavra inteira, um pedaço de palavra ou um sinal de pontuação. A ferramenta combina duas aproximações clássicas da documentação da OpenAI: uma pelo número de caracteres (cerca de 4 caracteres por token em inglês) e outra pelo número de palavras (cerca de 100 tokens para cada 75 palavras). A partir das duas ela calcula uma faixa, e não um número único.
Por que mostramos uma faixa, e não um número exato
Não existe um número certo universal. Cada modelo usa o seu próprio tokenizador: o BPE da família GPT quebra o texto de um jeito, o SentencePiece do Llama de outro, e por isso o mesmo parágrafo pode dar contagens diferentes conforme o modelo. Português, código de programação, emojis e palavras raras costumam gastar mais tokens do que texto simples em inglês, então a contagem real pode ficar acima do topo da faixa em casos assim. Trate o resultado como uma estimativa honesta para planejar custo e caber na janela de contexto, e não como a contagem oficial de um modelo específico.
O custo também é aproximado. Ele multiplica a estimativa central de tokens pelo preço por milhão que você digitar, então serve para uma ordem de grandeza. O preço real varia por modelo e ainda separa tokens de entrada dos de saída, que costumam ter valores diferentes.
Última atualização: · Metodologia e fontes