O que é um LLM: tokens, contexto e o próximo token
Como um large language model realmente funciona por dentro — e os limites que isso impõe.
6 min de leitura
Escolha como aprender
— combine como quiserDica: o vídeo é um resumo visual rápido — o áudio e o texto trazem a aula completa.
Um LLM não sabe nada — ele prevê. A cada passo, o modelo olha para tudo que veio antes e aposta no próximo pedaço de texto mais provável. Entender isso muda completamente como você projeta sistemas com IA: os limites, os custos e as falhas deixam de ser surpresa e passam a ser consequência direta de como o modelo funciona.
A ideia central: prever o próximo token
Um Large Language Model é, na essência, uma função matemática muito grande treinada para responder a uma pergunta simples: dado tudo que veio antes, qual é o próximo token mais provável?
Essa função foi ajustada em trilhões de tokens de texto — livros, código, páginas web, artigos científicos. Durante o treino (vimos isso na lição anterior), o modelo ajustou bilhões de parâmetros para ficar cada vez melhor nessa previsão. O resultado é uma rede que capturou padrões de linguagem em escala industrial.
Na inferência, o processo é sequencial e autoregressive: o modelo gera um token, adiciona esse token ao contexto, e então gera o próximo — repetindo até encontrar um sinal de parada ou atingir o limite de tokens. Não existe 'pensar antes de responder'. O modelo não planeja a frase inteira e depois a escreve. Ele constrói a resposta token a token, da esquerda para a direita.
Isso tem uma implicação direta: o modelo não pode 'voltar atrás' e corrigir algo que disse no início da resposta. O que foi gerado, foi. Por isso técnicas como chain-of-thought funcionam — forçar o modelo a raciocinar em voz alta antes de dar a resposta final melhora a qualidade, porque o raciocínio intermediário vira contexto para os próximos tokens.
Fluxo: do prompt ao token gerado
O pipeline completo de uma chamada a um LLM — da entrada em texto até o token de saída, repetido a cada passo da geração.
- Prompt · texto bruto
- Tokenizer · BPE / WordPiece
- Token IDs · [1042, 318, 257, ...]
- Embeddings · vetor por token
- Attention Layers · relaciona todos os tokens
- Logits · probabilidade p/ cada token
- Temperatura · (0 = deterministico)
- Próximo token · escolhido
- Adiciona token · ao contexto
- Token de parada? · Sim → resposta final
Tokens e janela de contexto: a unidade de tudo
Token não é palavra. É um pedaço de texto — geralmente uma sub-palavra. A palavra arquitetura pode virar dois tokens: arq + uitetura. Um emoji pode ser três tokens. Código tende a ter mais tokens por caractere que prosa em inglês. Em português, espere gastar mais tokens que no equivalente em inglês para o mesmo conteúdo.
Por que isso importa? Porque tudo no LLM é medido em tokens: o custo da API (você paga por token de entrada e saída), a velocidade de geração (tokens por segundo), e o limite da janela de contexto.
A janela de contexto é a quantidade máxima de tokens que o modelo consegue 'enxergar' de uma vez — prompt + histórico + resposta em construção, tudo junto. Modelos modernos têm janelas de 128k, 200k ou mais tokens. Parece muito, mas enchê-la tem custo: latência aumenta, custo aumenta, e a qualidade de atenção do modelo em contextos muito longos pode degradar (o fenômeno lost in the middle — o modelo tende a prestar mais atenção no início e no fim do contexto).
Para arquitetura, a regra prática é: não jogue tudo no contexto só porque cabe. Selecione o que é relevante. Isso é exatamente o que o RAG faz (lição 06) — em vez de colocar mil documentos no contexto, você recupera os três mais relevantes. Contexto enxuto é mais barato, mais rápido e frequentemente mais preciso.
O que você precisa fixar sobre tokens e contexto
Ordene o fluxo de uma resposta de LLM
Coloque as etapas na ordem em que acontecem.
- 1O token é anexado e o processo repete até terminar
- 2Os tokens entram na janela de contexto do modelo
- 3O modelo prevê o próximo token mais provável
- 4O texto do prompt é quebrado em tokens
Por que LLMs alucinam — e o que isso significa para você
Alucinação não é bug. É característica do mecanismo.
O modelo foi treinado para gerar texto plausível, não texto verdadeiro. Ele não tem acesso a um banco de fatos verificáveis. Quando você pergunta 'qual é o CNPJ da empresa X?', o modelo não consulta nenhuma fonte — ele gera a sequência de tokens que, estatisticamente, mais provavelmente seguiria essa pergunta no texto em que foi treinado. Se o CNPJ correto não estava bem representado no treino, o modelo vai inventar um que parece certo.
O problema é que o modelo não sabe que não sabe. A distribuição de probabilidade sobre tokens não carrega um bit de 'tenho certeza / não tenho certeza'. O modelo gera com a mesma fluência um fato correto e um fato fabricado.
Para arquitetura, isso tem três consequências diretas:
- Nunca use um LLM como fonte primária de fatos. Se o dado precisa ser correto (nome, número, data, norma), ele precisa vir de uma fonte verificada — e você injeta no contexto via RAG ou tool calling.
- Avalie saídas, não apenas gere. Sistemas em produção precisam de evals (lição 09) e guardrails (lição 10) para detectar quando o modelo saiu dos trilhos.
- Temperatura controla aleatoriedade. Temperatura zero faz o modelo escolher sempre o token mais provável — mais determinístico, menos criativo. Temperatura alta distribui a probabilidade entre mais opções — mais variação, mais risco de desvio. Para tarefas factuais, temperatura baixa. Para geração criativa, temperatura mais alta.
Entender alucinação como propriedade estrutural — não como falha ocasional — é o que separa quem projeta sistemas de IA robustos de quem fica surpreso quando o modelo inventa.
Na prática, quando começo a desenhar um sistema com LLM, as primeiras perguntas que faço são: qual é o tamanho médio do contexto que vou enviar? Quantos tokens de saída espero? Isso me dá o custo e a latência esperados antes de escrever uma linha de código. Depois: quais partes da resposta precisam ser factuais e verificáveis? Essas partes nunca ficam na cabeça do modelo — elas vêm de fontes externas injetadas no contexto. O modelo é o motor de linguagem, não o banco de dados. Quando você internaliza essa separação, a arquitetura fica muito mais clara.
Termos de LLM
Toque num cartão para virar.
Perguntas frequentes
Modelos maiores alucinam menos?
Geralmente sim — modelos maiores têm melhor calibração e mais conhecimento factual absorvido no treino. Mas alucinação não desaparece. Mesmo os melhores modelos inventam fatos em domínios pouco representados no treino ou quando forçados a responder algo que não sabem. O tamanho reduz, não elimina.
Posso usar o LLM para raciocínio matemático complexo?
Com cuidado. LLMs melhoraram muito em matemática, especialmente com chain-of-thought e modelos de raciocínio como o-series da OpenAI ou Claude 3.7. Mas para cálculos críticos, o padrão correto é usar tool calling (lição 07) para chamar uma calculadora ou código real — não confiar só na geração de tokens.
Temperatura 0 garante respostas idênticas sempre?
Quase. Temperatura zero é determinística no sentido de sempre escolher o token de maior probabilidade, mas implementações de inferência distribuída podem introduzir variações mínimas por questões de arredondamento de ponto flutuante. Para fins práticos, temperatura 0 é reproduzível o suficiente para testes e evals.
O que acontece quando o contexto excede a janela?
A API retorna erro ou trunca silenciosamente, dependendo da implementação. Você precisa gerenciar isso ativamente: sumarizar histórico antigo, usar janelas deslizantes ou selecionar apenas o contexto relevante. Isso é parte do design de memória de agentes — veremos em detalhe na lição 12.