Token: a unidade que decide quanto sua IA custa
Quase toda decisão prática sobre IA — custo, velocidade, limite de contexto — se resolve na mesma unidade: o token. Se você já se perguntou por que uma resposta demorou, por que a conta veio mais alta que o esperado, ou por que um documento "não coube" no modelo, a resposta quase sempre passa por aqui.
O que é um token
Não é uma palavra nem uma letra. É um pedaço de texto que o modelo trata como unidade atômica — normalmente entre 3 e 4 caracteres em português, mas o tamanho varia conforme o padrão de escrita. "Programação" pode virar dois ou três tokens; uma palavra curta e comum como "de" costuma virar um único token inteiro.
O critério por trás disso não é linguístico, é estatístico: o processo que divide texto em tokens foi construído observando quais sequências de caracteres aparecem com mais frequência em grandes volumes de texto, e trata as mais comuns como um único bloco. Palavras raras, números longos, símbolos de código e acentuação tendem a se fragmentar em mais pedaços que palavras comuns em inglês — o que tem uma consequência prática direta: o mesmo conteúdo escrito em português, ou contendo muito código e números, tende a consumir mais tokens do que o equivalente em inglês corrido. Isso não é capricho do modelo, é reflexo de como a tokenização foi treinada.
Por que isso importa em três lugares
Custo. Você paga por token de entrada (o que você manda) e por token de saída (o que o modelo gera), quase sempre com preços diferentes — e saída costuma ser sensivelmente mais cara que entrada. Isso inverte uma intuição comum: um prompt gigante que gera uma resposta curta pode ser mais barato que um prompt curto que gera um relatório longo. A pergunta certa não é "quanto eu escrevi", é "quanto o modelo vai ter que gerar de volta".
Latência. Modelos de linguagem geram texto token a token, em sequência — cada pedaço novo depende do que já foi gerado antes. Isso significa que uma resposta longa demora mais por construção, não porque o servidor está sobrecarregado ou lento naquele momento. Pedir um resumo de duas linhas e pedir um relatório de dez páginas têm latências fundamentalmente diferentes, mesmo em condições idênticas de infraestrutura.
Contexto. A janela de contexto — quanto o modelo consegue "ver" de uma vez, incluindo tudo que você mandou mais o que ele já gerou na conversa — é medida em tokens, não em palavras ou em megabytes de arquivo. Colar um arquivo de código extenso numa conversa não é "anexar um documento": é ocupar uma fatia real e às vezes enorme da capacidade de atenção do modelo, com efeitos no que ele consegue processar depois.
Um exemplo prático de como isso se acumula
Imagine uma sessão de trabalho em que você cola um arquivo grande no início, faz várias perguntas ao longo da conversa, e cada resposta do modelo também entra na contagem — porque numa conversa contínua, o histórico inteiro costuma ser reenviado como contexto a cada nova mensagem. O prompt inicial pequeno vira, na prática, uma bola de neve: cada rodada carrega tudo que veio antes.
É por isso que sessões longas de conversa com IA tendem a ficar mais lentas e mais caras conforme avançam, mesmo que cada pergunta individual pareça pequena — o "peso" real de cada mensagem inclui o histórico acumulado, não só o texto novo que você acabou de digitar.
O que fazer com isso
Duas mudanças de hábito afetam o custo real muito mais do que qualquer micro-otimização de escolha de palavra no prompt:
- Peça a saída no tamanho que você vai efetivamente usar. Uma instrução como "responda em até 5 bullets" ou "só a conclusão, sem explicar o raciocínio" corta exatamente a parte mais cara da conta — a geração de saída. Pedir um raciocínio longo e detalhado quando você só vai ler a conclusão final é pagar para gerar (e para esperar) um texto que será descartado.
- Não mande o que não é necessário pra responder a pergunta. Anexar um arquivo inteiro, ou o repositório inteiro, para uma pergunta que só depende de uma função específica é o erro mais comum — e o mais caro, porque infla tanto o custo de entrada quanto o tempo até a primeira resposta. Filtrar antes de mandar (recortar só o trecho relevante) costuma valer mais que qualquer ajuste fino de prompt.
- Em conversas longas, considere recomeçar. Se uma sessão de trabalho já acumulou muito histórico e você está mudando de assunto dentro dela, começar uma conversa nova custuma custar menos e responder mais rápido do que continuar arrastando um histórico que não é mais relevante pra pergunta atual.
O ponto prático
Se a conta de IA está alta, olhe primeiro a razão entre tokens de saída gerados e tokens que você de fato aproveitou. Na maioria dos casos o desperdício não está na escolha do modelo — está em pedir texto que ninguém vai ler até o fim, ou em carregar contexto que não tinha relação com a pergunta feita. Token não é um detalhe técnico de bastidor: é a régua que explica, ao mesmo tempo, quanto custa, quanto demora e quanto cabe.