रद्द किए गए OpenAI अनुरोध की पूरी लागत चुकानी पड़ती है
किसी OpenAI अनुरोध को बीच में रद्द करने पर भी आपको पूरे उत्तर का भुगतान करना पड़ता है। आपको केवल उस हिस्से का भुगतान नहीं करना पड़ता जो आपने पढ़ा था। Anthropic या Google मॉडल पर ऐसा ही रद्द करने पर शुल्क वहीं रुक जाता है जहाँ आपने रोका था। यह तब लागू होता है जब हम Anthropic या Google को स्वयं कॉल करते हैं। Bedrock या Vertex पर किसी अनुरोध को पिन करने पर हम उसे अंत तक पढ़ते हैं, जैसा कि हम OpenAI के लिए करते हैं। रद्द करने से आपका कनेक्शन तुरंत समाप्त हो जाता है, इसलिए आपके एप्लिकेशन पर कुछ भी streaming नहीं होता रहता है। OpenAI पर जनरेशन जारी रहती है, और आपको इसके लिए भुगतान करना पड़ता है। OpenAI हमें streaming प्रतिक्रिया को रोकने का कोई तरीका नहीं देता है और जल्दी रोके गए अनुरोध के लिए कोई उपयोग रिपोर्ट नहीं करता है, इसलिए हमारे पास आपको बिल करने के लिए कोई सटीक जानकारी नहीं है। हम एक विकल्प पर काम कर रहे हैं, और जब यह लागू होगा तो यह पृष्ठ बदल जाएगा। आपके logs में एक रुके हुए अनुरोध को Canceled के रूप में दिखाया जाता है। इसके token की संख्या वही होती है जो provider ने आपके रोकने से पहले रिपोर्ट की थी। इस बीच दो चीजें मदद करती हैं।max_output_tokens सेट करें ताकि एक रद्द किया गया अनुरोध आपकी स्वीकार्य लंबाई से आगे न बढ़ सके। Anthropic या Google मॉडल का उपयोग करें जहाँ मॉडल के चुनाव से ज़्यादा रोकना मायने रखता है।