Dataqia🎲 sortear

Também disponível em: English (US)

Contador de tokens

Quantos tokens tem o seu texto? Cole abaixo e receba na hora uma estimativa de tokens, palavras, caracteres e custo aproximado. Importante: o número exato depende do tokenizador de cada modelo, por isso mostramos uma faixa, e não um valor cravado.

Regras de bolso

ReferênciaEquivale a mais ou menos
1 tokencerca de 4 caracteres em inglês
1 tokencerca de 0,75 palavra
100 tokenscerca de 75 palavras
1.000 tokensaproximadamente meia página de texto corrido

Como esta estimativa é feita

Um token é o pedaço de texto que o modelo realmente lê: pode ser uma palavra inteira, um pedaço de palavra ou um sinal de pontuação. A ferramenta combina duas aproximações clássicas da documentação da OpenAI: uma pelo número de caracteres (cerca de 4 caracteres por token em inglês) e outra pelo número de palavras (cerca de 100 tokens para cada 75 palavras). A partir das duas ela calcula uma faixa, e não um número único.

Por que mostramos uma faixa, e não um número exato

Não existe um número certo universal. Cada modelo usa o seu próprio tokenizador: o BPE da família GPT quebra o texto de um jeito, o SentencePiece do Llama de outro, e por isso o mesmo parágrafo pode dar contagens diferentes conforme o modelo. Português, código de programação, emojis e palavras raras costumam gastar mais tokens do que texto simples em inglês, então a contagem real pode ficar acima do topo da faixa em casos assim. Trate o resultado como uma estimativa honesta para planejar custo e caber na janela de contexto, e não como a contagem oficial de um modelo específico.

O custo também é aproximado. Ele multiplica a estimativa central de tokens pelo preço por milhão que você digitar, então serve para uma ordem de grandeza. O preço real varia por modelo e ainda separa tokens de entrada dos de saída, que costumam ter valores diferentes.

Última atualização: · Metodologia e fontes