Una solicitud de OpenAI cancelada cuesta la respuesta completa
Si cancelas una solicitud de OpenAI a mitad de camino, pagarás por la respuesta completa. No pagarás solo por la parte que leíste. La misma cancelación en un modelo de Anthropic o Google detiene el cargo en el punto donde te detuviste. Esto aplica cuando llamamos directamente a Anthropic o Google. Si fijas una solicitud a Bedrock o Vertex, la leeremos hasta el final, como hacemos con OpenAI. La cancelación sigue terminando tu conexión de inmediato, por lo que nada continúa transmitiéndose a tu aplicación. La generación en OpenAI es lo que continúa, y tú pagas por ello. OpenAI no nos proporciona una forma de detener una respuesta de streaming ni informa el uso de una que se detuvo prematuramente, por lo que no tenemos nada preciso para facturarte en su lugar. Estamos trabajando en una alternativa, y esta página se actualizará cuando esté disponible. Tus registros muestran una solicitud detenida como Canceled. Sus recuentos de tokens son los que el provider informó antes de que la detuvieras. Mientras tanto, dos cosas pueden ayudar. Establecemax_output_tokens para que una solicitud cancelada no pueda exceder una longitud que consideres aceptable. Usa modelos de Anthropic o Google cuando la capacidad de detener la generación sea más importante que la elección del modelo.