Une requête OpenAI annulée coûte la réponse complète
Si vous annulez une requête OpenAI en cours de route, vous payez pour la réponse complète. Vous ne payez pas seulement pour la partie que vous avez lue. Une annulation similaire sur un modèle Anthropic ou Google arrête la facturation au moment où vous l’avez interrompue. Cela s’applique lorsque nous appelons Anthropic ou Google directement. Si vous épinglez une requête à Bedrock ou Vertex, nous la lisons jusqu’à la fin, comme nous le faisons pour OpenAI. L’annulation met fin immédiatement à votre connexion, de sorte que rien ne continue à être diffusé en continu vers votre application. C’est la génération chez OpenAI qui se poursuit, et vous la payez. OpenAI ne nous offre aucun moyen d’arrêter une réponse en streaming et ne signale aucune utilisation pour une réponse arrêtée prématurément, nous n’avons donc aucune donnée précise à vous facturer à la place. Nous travaillons sur une alternative, et cette page sera mise à jour dès qu’elle sera disponible. Vos journaux affichent une requête arrêtée comme “Canceled”. Le nombre de tokens correspond à celui que le fournisseur a signalé avant votre arrêt. Deux choses peuvent vous aider en attendant. Définissezmax_output_tokens afin qu’une requête annulée ne puisse pas dépasser une longueur que vous acceptez. Utilisez les modèles Anthropic ou Google lorsque l’arrêt est plus important que le choix du modèle.