Por qué la conversación cuesta más con cada mensaje
La API no guarda la conversación. En cada mensaje del cliente su sistema reenvía el prompt del sistema, todo el historial y el mensaje nuevo. En una conversación de n mensajes, la entrada total crece de forma cuadrática:
Con 6 mensajes, un prompt de 3,000 tokens se lee 6 veces: 18 mil tokens solo de instrucciones. Por eso la caché del prompt del sistema suele ser el ahorro más fácil.
Cómo bajar el costo
- Use caché en el prompt del sistema y en la base de conocimiento.
- Resuma el historial cuando la conversación pase de 10 a 15 mensajes.
- Empiece con un modelo barato (Haiku 4.5, GPT-5.6 Luna) y escale a uno mayor solo en las preguntas difíciles.