> ## Documentation Index
> Fetch the complete documentation index at: https://docs.flexinference.com/llms.txt
> Use this file to discover all available pages before exploring further.

# ज्ञात सीमाएँ

> ऐसी चीज़ें जो आपकी अपेक्षा के अनुरूप काम नहीं करतीं, और हम उनके बारे में क्या कर रहे हैं।

यह पृष्ठ उन व्यवहारों को सूचीबद्ध करता है जो आपको आश्चर्यचकित कर सकते हैं। हम चाहते हैं कि आप इसे यहाँ पढ़ें बजाय इसके कि आप इसे किसी इनवॉइस से जानें।

## रद्द किए गए OpenAI अनुरोध की पूरी लागत चुकानी पड़ती है

किसी OpenAI अनुरोध को बीच में रद्द करने पर भी आपको पूरे उत्तर का भुगतान करना पड़ता है। आपको केवल उस हिस्से का भुगतान नहीं करना पड़ता जो आपने पढ़ा था। Anthropic या Google मॉडल पर ऐसा ही रद्द करने पर शुल्क वहीं रुक जाता है जहाँ आपने रोका था।

यह तब लागू होता है जब हम Anthropic या Google को स्वयं कॉल करते हैं। Bedrock या Vertex पर किसी अनुरोध को पिन करने पर हम उसे अंत तक पढ़ते हैं, जैसा कि हम OpenAI के लिए करते हैं।

रद्द करने से आपका कनेक्शन तुरंत समाप्त हो जाता है, इसलिए आपके एप्लिकेशन पर कुछ भी streaming नहीं होता रहता है। OpenAI पर जनरेशन जारी रहती है, और आपको इसके लिए भुगतान करना पड़ता है। OpenAI हमें streaming प्रतिक्रिया को रोकने का कोई तरीका नहीं देता है और जल्दी रोके गए अनुरोध के लिए कोई उपयोग रिपोर्ट नहीं करता है, इसलिए हमारे पास आपको बिल करने के लिए कोई सटीक जानकारी नहीं है। हम एक विकल्प पर काम कर रहे हैं, और जब यह लागू होगा तो यह पृष्ठ बदल जाएगा।

आपके logs में एक रुके हुए अनुरोध को Canceled के रूप में दिखाया जाता है। इसके token की संख्या वही होती है जो provider ने आपके रोकने से पहले रिपोर्ट की थी।

इस बीच दो चीजें मदद करती हैं। `max_output_tokens` सेट करें ताकि एक रद्द किया गया अनुरोध आपकी स्वीकार्य लंबाई से आगे न बढ़ सके। Anthropic या Google मॉडल का उपयोग करें जहाँ मॉडल के चुनाव से ज़्यादा रोकना मायने रखता है।

## बीच में विफल होने वाली stream भी सफलता के साथ शुरू होती है

उत्तर आना शुरू होने के बाद भी एक अनुरोध विफल हो सकता है। status line पहले ही कह चुकी होती है कि अनुरोध सफल रहा, और HTTP इसे वापस लेने का कोई तरीका नहीं देता है।

इसके बजाय विफलता stream के अंदर आती है। यह एक error event के रूप में आती है, न कि सामान्य समाप्ति के रूप में।

जब आप stream करते हैं तो status code के बजाय terminal event पढ़ें। हम इस तरह विफल हुए अनुरोध को आपके logs और dashboard में failed के रूप में चिह्नित करते हैं। इसलिए जो आप वहाँ देखते हैं वह सटीक होता है।
