Como um modelo "pensa": tokens, contexto e temperatura
2 min de leitura
"Por dentro", um LLM não trabalha com palavras - ele trabalha com tokens. Um token é um pedaço de texto que pode ser uma palavra inteira, uma sílaba, uma letra ou um símbolo de pontuação. "Olá, tudo bem?" em português pode virar 4 a 6 tokens, dependendo do modelo. Inglês é mais eficiente (1 token ≈ 4 caracteres em média); português, por ter palavras mais longas e acentos, usa mais tokens pro mesmo conteúdo.
Por que isso importa pra você? Três coisas práticas:
- Custo. A maioria dos providers cobra por token, não por palavra. Um prompt em PT-BR costuma custar ~1,5× o equivalente em inglês.
- Janela de contexto. O modelo tem um limite de quanto "lembrança" consegue usar de uma vez - a context window. Claude Sonnet 4 é 200k tokens, GPT-4o é 128k, Gemini 1.5 Pro chega a 1M. Se o seu prompt + histórico + documentos passar desse limite, ele trunca (corta do começo) ou recusa.
- Qualidade por token. Quanto mais tokens você gasta, mais "espaço" o modelo tem pra se perder. Prompts longos não são melhores - são mais caros e por vezes piores.
A geração funciona assim, simplificado:
Repare: o modelo não pensa a resposta inteira e depois escreve. Ele gera um token de cada vez, e cada novo token é influenciado por todos os anteriores - incluindo o seu prompt, o que ele já escreveu, e a temperatura.
Temperatura é o "botão de criatividade":
- Baixa (0.0–0.3) - respostas mais determinísticas, conservadoras, repetitivas. Boa pra código, fatos, extração de dados.
- Média (0.5–0.8) - equilíbrio entre coerência e variação. Padrão pra conversa e escrita.
- Alta (1.0–1.5) - respostas mais "criativas" e imprevisíveis. Boa pra brainstorming, ruim pra tarefas factuais.
// Quiz
Você precisa gerar 50 nomes de produto a partir de uma descrição. Que temperatura é provavelmente a melhor escolha?
- Token é a unidade de trabalho do modelo - texto vira tokens, tokens viram texto. Custo e contexto são medidos em tokens.
- Context window é a "memória" total do modelo num único request. Se passar, o começo é esquecido.
- Temperatura controla quanto o modelo arrisca. 0 = conservador; alto = criativo (e por vezes incoerente).
- Português gasta mais tokens que inglês pro mesmo conteúdo. Não é defeito - é como a tokenização foi treinada.
Dica: antes de gastar dinheiro num prompt grande, cole-o no tokenizer da OpenAI e descubra exatamente quantos tokens ele custa. É o "fuel gauge" da IA.
No próximo nó, vamos usar tudo isso na prática: a anatomia de um prompt bem-feito - o esqueleto que você vai reusar pelo resto da trilha.