Por que a conversa fica mais cara a cada mensagem
A API não guarda a conversa. A cada mensagem do cliente o seu sistema reenvia o prompt do sistema, todo o histórico e a mensagem nova. Numa conversa de n mensagens, a entrada total cresce de forma quadrática:
Com 6 mensagens, um prompt de 3.000 tokens é lido 6 vezes: 18 mil tokens só de instruções. Por isso o cache do prompt do sistema costuma ser a economia mais fácil.
Como baixar o custo
- Use cache no prompt do sistema e na base de conhecimento.
- Resuma o histórico quando a conversa passa de 10 a 15 mensagens.
- Comece com um modelo barato (Haiku 4.5, GPT-5.6 Luna) e escale para um maior só nas perguntas difíceis.