O que é a janela de contexto
É o máximo de tokens que o modelo enxerga numa requisição: instruções, histórico, documentos e a própria resposta. Os modelos Claude Opus 5.5, Sonnet 5.5 e Fable 5.1 têm 1 milhão de tokens; o Haiku 4.5 tem 200 mil. O GPT-5.6 aceita 1,05 milhão, com até 922 mil de entrada.
Contexto grande custa caro
Encher 1 milhão de tokens de entrada no Claude Opus 5.5 custa US$ 4 por requisição. Se o mesmo documento vai em toda chamada, use cache de prompt. No GPT-5.6, acima de 272 mil tokens de entrada a requisição inteira passa a custar 2× na entrada e 1,5× na saída.
Saída máxima
A saída tem limite próprio, bem menor que o contexto: 128 mil tokens nos modelos Claude 5.x e no GPT-5.6, e 64 mil no Haiku 4.5.