Skip to main content
नीचे दिया गया प्रत्येक क्लिप एक वर्कलोड को हमारे माध्यम से रूट करता है। प्रत्येक अनुरोध एक ही मॉडल पर दो बार फायर होता है। एक कॉल start_within के साथ एक flex विंडो खोलता है। दूसरा default भेजता है। वीडियो flex उत्तर चलाता है। हम प्रति दस लाख token की लागत और पहले token तक के समय पर दोनों रनों की तुलना करते हैं। जब दो रन अलग-अलग token लौटा सकते हैं तो ये निष्पक्ष माप होते हैं। हम सस्ते परिणाम का वादा करते हैं, न कि तेज़ वाले का। आपके द्वारा निर्धारित विंडो के भीतर हम या तो सस्ता टियर प्राप्त करते हैं या मानक पर चले जाते हैं। इसलिए एक रन एक टियर पर बिल होता है और आपकी समय-सीमा से आगे कभी इंतजार नहीं करता। अपना पहला अनुरोध क्विकस्टार्ट के साथ भेजें। डेडलाइन राउटिंग विंडो और मानक पर जाने को कवर करता है।

इंटीग्रेशन डेमो

नीचे दिया गया प्रत्येक टूल एक स्टॉक ओपन-सोर्स एजेंट है, जिसे हमारे माध्यम से रूट करने के लिए बदला गया है। प्रत्येक अब एक skill के रूप में शिप होता है। अपने कोडिंग एजेंट में skill जोड़ें और अपने स्वयं के चेकआउट में इंटीग्रेशन के लिए पूछें। skill प्रोवाइडर एंट्री, flex डेडलाइन और /flex सेशन कमांड को कॉन्फ़िग के माध्यम से कवर करता है।

OpenScience

OpenScience Claude Science का एक ओपन-सोर्स विकल्प है। यह रन इसे अधिक कुशल ट्रक राउटिंग पर शोध पत्र खोजने के लिए कहता है। यह GPT-5.6 Terra पर कम थिंकिंग और पांच-सेकंड की flex विंडो के साथ चलता है। क्लिप 4 मिनट 1 सेकंड तक चलती है। Flex दरों ने पूरे कार्य को कवर किया, इसलिए इसकी लागत आधी थी। पहला token 9.3 प्रतिशत बाद में वापस आया, और कार्य लगभग तीस सेकंड पीछे समाप्त हुआ। हमारे OpenScience skill को अपने कोडिंग एजेंट में जोड़ें, फिर इसे अपने OpenScience चेकआउट को FlexInference पर इंगित करने के लिए कहें। Claude Code के लिए यह एक कमांड है:
Install the OpenScience skill
FlexInference डेमो ट्रांसक्रिप्ट: OpenScienceनमस्ते एवरीवन, मेरा नाम आदि है। मैं FlexInference का संस्थापक हूँ, और यहाँ हमारे पास OpenScience है, जो Claude Science का एक ओपन-सोर्स विकल्प है। इसे FlexInference के माध्यम से अपने सभी अनुरोधों को रूट करने के लिए बदल दिया गया है, और आप अपने OpenScience को भी ऐसा ही कर सकते हैं: हमने इस डेमो के ठीक नीचे एक प्रॉम्प्ट जोड़ा है जिसे आप किसी भी एजेंटिक कोडिंग टूल में कॉपी और पेस्ट कर सकते हैं जिसका आप उपयोग करते हैं, और यह आपके OpenScience को FlexInference का उपयोग करने के लिए भी अपग्रेड कर देगा। इस डेमो के लिए हम GPT 5.6 Terra का उपयोग कर रहे हैं। मैं थिंकिंग को कम पर सेट करूँगा, एक flex रेस सेट करूँगा ताकि यह सस्ती inference की खोज करे, और इसे सस्ती inference खोजने के लिए पाँच सेकंड दूँगा, अन्यथा एक डिफ़ॉल्ट अनुरोध पर अपग्रेड कर दूँगा। हम प्रति दस लाख token की लागत और पहले token तक के समय को देखेंगे, क्योंकि पृष्ठभूमि में जब भी मैं कोई प्रश्न पूछता हूँ तो हम दो समानांतर अनुरोध स्पिन करते हैं। यह सिर्फ तुलना करने के लिए है, और चूंकि परिणाम गैर-निर्धारित हो सकते हैं, हम वास्तव में इस बात की परवाह करते हैं कि पहला token कब वापस आया और प्रति दस लाख token पर प्रत्येक पक्ष की लागत कितनी है। मैं यह कहना चाहूँगा कि FlexInference सभी Claude मॉडल, सभी Gemini मॉडल और सभी GPT मॉडल का समर्थन करता है जो आप यहाँ देखते हैं।अब हम इससे पूछते हैं: मैं लॉजिस्टिक्स में काम करता हूँ और मेरे पास तीन ट्रक हैं। मैं चाहता हूँ कि मेरी राउटिंग अधिक कुशल हो, तेज़ी से और सस्ते में डिलीवरी हो। मुझे प्रासंगिक शोध पत्र खोजें।जब यह चल रहा है, तो पृष्ठभूमि में तुलना करने के लिए दो समानांतर प्रक्रियाएँ चल रही हैं। हम जो गारंटी देते हैं वह यह है कि आपके द्वारा निर्धारित समय के भीतर, हम आपको सस्ती inference ढूँढेंगे या एक सामान्य डिफ़ॉल्ट अनुरोध पर आगे बढ़ेंगे; इस मामले में हम हमेशा डिफ़ॉल्ट अनुरोध पूछने की तुलना कर रहे हैं। हम कभी-कभी देखते हैं कि हम किसी तरह तेज़ हैं, और स्पष्ट रूप से सस्ते हैं, लेकिन हम तेज़ हिस्से की गारंटी नहीं देते हैं। हम सस्ते हिस्से की गारंटी देते हैं। आप स्पष्ट रूप से हमारे माध्यम से डिफ़ॉल्ट अनुरोध कर सकते हैं और अपनी इच्छित गति प्राप्त कर सकते हैं, साथ ही प्राथमिकता वाले अनुरोध भी।आप विज्ञान-शैली की परिकल्पना और दोहराव वाली प्रक्रिया कार्य के लिए SLA क्यों चाहेंगे? शोध में काम करने के बाद, अक्सर ऐसे मामले होते हैं जहाँ आपके पास दस परिकल्पनाएँ और API क्रेडिट, देव समय, या समय-सीमा से पहले का सीमित समय होता है। तो आप केवल शीर्ष तीन का प्रयास करते हैं और नीचे के सात को छोड़ देते हैं। अंततः शीर्ष तीन आपके इच्छित परिणाम देने में विफल रहते हैं, आप बाकी को देखना शुरू करते हैं, आप उस सूची में आठवें पर पहुँचते हैं, और आप सोचते हैं, काश मैंने इसे पहले आज़माया होता - उस पल में इसका कोई मतलब नहीं था। इस तरह, जिन परिकल्पनाओं पर आप विचार कर रहे हैं जो निवेश पर अच्छा रिटर्न नहीं लगती हैं, वे पृष्ठभूमि में सस्ते में चल सकती हैं। भले ही इसमें थोड़ा अधिक समय लगे, यह ठीक है, क्योंकि आप वैसे भी इसे प्राथमिकता नहीं देने वाले थे - लेकिन अब आपको परिणाम जल्द मिलेंगे। और जब आप शोध कर रहे होते हैं, या कोई भी ओपन-एंडेड कार्य जहाँ आप पुनरावृति करते हैं और परीक्षण और त्रुटि करते हैं, तो आपको बहुत से लोगों के इनपुट मिल रहे होते हैं और आप उन्हें परिणाम भी देना चाहते हैं, लेकिन आप समय या API क्रेडिट समर्पित नहीं कर सकते। आप उनके सभी अनुरोधों और परिकल्पनाओं को विभिन्न OpenScience सत्रों पर धकेल सकते हैं, सुनिश्चित कर सकते हैं कि यह पर्याप्त समय में बाहर आता है, और उन्हें बहुत सस्ते में परिणाम मिलेंगे जबकि आप प्राथमिकता देना जारी रखेंगे। आपके अधिक प्राथमिकता वाले अनुरोध आप डिफ़ॉल्ट या प्राथमिकता वाले अनुरोधों के माध्यम से करते रह सकते हैं।जैसा कि आप देख सकते हैं, यह पूरा हो गया, और हम अपने कार्य को केवल तीस अतिरिक्त सेकंड में पूरा करने में सक्षम थे - आधी कीमत पर। इस मामले में, पचास प्रतिशत लागत में कमी के लिए दस प्रतिशत या उससे कम विलंबता छोड़ना समझ में आता है। मुझे उम्मीद है कि आपको यह पसंद आया होगा और आप इसे अपने OpenScience के संस्करण में लागू करेंगे। धन्यवाद।

OpenCode

OpenCode एक ओपन-सोर्स कोडिंग एजेंट है। यह रन इसे एक HTML पेज बनाने के लिए कहता है जिसके विज़ुअलाइज़ेशन डेरिवेटिव्स को समझाते हैं। यह GPT-5.4 पर कम थिंकिंग और पांच-सेकंड की flex विंडो के साथ चलता है। क्लिप 3 मिनट 34 सेकंड तक चलती है। Flex दरों ने लागत को आधा कर दिया। पहला token डिफ़ॉल्ट रन को 37.5 प्रतिशत से हरा दिया, जो होता है लेकिन हम इसका वादा कभी नहीं करते। हमारे OpenCode skill को अपने कोडिंग एजेंट में जोड़ें, फिर इसे अपने OpenCode चेकआउट को FlexInference पर इंगित करने के लिए कहें। /flex प्लगइन जो यह कॉन्फ़िगर करता है, प्रत्येक अनुरोध पर start_within सेट करता है क्योंकि यह अनुरोध हुक का मालिक है। बिना हुक वाले टूल को किसी प्लगइन की आवश्यकता नहीं होती है। इसके बजाय डेडलाइन key पर रखें। Claude Code के लिए इंस्टॉल एक कमांड है:
Install the OpenCode skill
FlexInference डेमो ट्रांसक्रिप्ट: OpenCodeनमस्ते, मेरा नाम आदि है। मैं FlexInference का संस्थापक हूँ, और यहाँ हमारे पास OpenCode है, और इसे FlexInference के माध्यम से मॉडल अनुरोधों को रूट करने के लिए बदल दिया गया है। आप इसे स्वयं भी बदल सकते हैं: इस डेमो के नीचे एक प्रॉम्प्ट है जिसे आप किसी भी एजेंटिक कोडिंग टूल में कॉपी और पेस्ट कर सकते हैं, इसे अपने OpenCode पर इंगित कर सकते हैं, और कह सकते हैं “मैं FlexInference का उपयोग करना चाहता हूँ,” और यह ऐसा कर देगा कि आपके पास वही टूल हो जो हमारे पास यहाँ है। यह पहले से ही GPT 5.4 पर सेट है; हम इसे कम थिंकिंग पर सेट करेंगे, flex ऑन, पांच-सेकंड SLA, और मैं डेमो शुरू करूँगा और समझाऊँगा कि चीजें कैसे चल रही हैं। तो हम कहेंगे: मुझे डेरिवेटिव्स को समझने में मुश्किल हो रही है। मुझे गतिशील विज़ुअलाइज़ेशन वाला एक साधारण HTML पेज चाहिए जो मुझे इसे समझाए।OpenCode इसे बनाएगा, और दाहिनी ओर एक तुलना चल रही होगी: flex रेस दर, जो प्रति दस लाख token की लागत है, फिर डिफ़ॉल्ट दर, और फिर flex रेस पहले token तक का समय और डिफ़ॉल्ट पहले token तक का समय। फ्रंट एंड पर, जो आप इस TUI के माध्यम से देख रहे हैं वह सिर्फ वही है जो flex प्रतिक्रिया दे रहा है। बैक एंड पर, हम दो समानांतर अनुरोध भेज रहे हैं, इसलिए यह वास्तव में एक सेब-से-सेब की तुलना है, और आप पहले token तक के समय और प्रति दस लाख token की लागत की तुलना भी देख सकते हैं।FlexInference के पीछे का बिंदु यह है कि हम आपको एक flex रेस तक पहुँच प्रदान करते हैं जो आपके द्वारा निर्धारित समय के भीतर सस्ती inference की खोज करती है, और हमने इसे पांच सेकंड पर सेट किया है; यदि वह पूरा नहीं होता है, तो हम इसे ऊपर बढ़ाते हैं। हम हर दूसरे प्रकार के अनुरोध भी कर सकते हैं। स्लैश मॉडल में आप देख सकते हैं कि हम सभी प्रमुख मॉडलों का समर्थन करते हैं। जो हमें अलग करता है वह flex रेस है। गैर-विलंबता-संवेदनशील कार्यों के कई मामले हैं जहाँ यह बहुत अच्छा है। कल्पना कीजिए कि आपको रात 8 बजे एक पेज मिलता है। यह एक sev 4 है और सबसे बड़ी बात नहीं है। आप सोचते हैं कि अगर इसे लागू किया जा सके तो अच्छा होगा, लेकिन अगर इसमें दस मिनट अधिक लगते हैं तो आप ठीक हैं। उन मामलों में, यह बहुत अच्छा है। या ऐसे मामले जहाँ आपके पास पृष्ठभूमि परियोजनाएँ हैं जिनमें आपकी रुचि है, लेकिन आप अपने सभी API क्रेडिट एक साथ खर्च नहीं करना चाहते हैं: आप कई कार्यों को कतारबद्ध कर सकते हैं, वे धीरे-धीरे बाहर निकलते हैं, और आप बहुत कम खर्च करते हैं।अब इसने पहले ही यह डेरिवेटिव्स HTML पेज बना दिया है, जिसे हम खोल सकते हैं, लेकिन मुझे तुलना में दिलचस्पी है। GPT 5.4 पर पहले token तक का समय वास्तव में तेज़ था, जो समय-समय पर होता है। हम गारंटी नहीं देते कि यह डिफ़ॉल्ट से तेज़ होगा, लेकिन ऐसा होता है, और हमारे मामले में यह बहुत अच्छा है। दूसरा, यह सस्ता है: यहाँ पचास प्रतिशत लागत में कमी। OpenCode के भीतर FlexInference स्थापित करने का मतलब है कि आप या आपके डेवलपर्स विभिन्न परियोजनाओं और विचारों को आज़माने में बहुत अधिक समय बिता सकते हैं, इस बात की चिंता किए बिना कि आपके क्रेडिट गलत क्षेत्र में उपयोग हो रहे हैं, क्योंकि अब आपके पास पचास प्रतिशत लागत में कमी है। उम्मीद है कि आप इसका आनंद लेंगे और इसका उपयोग भी करेंगे। धन्यवाद।

OpenWork

OpenWork अपनी राउटिंग के लिए एक OpenCode साइडकार चलाता है। यह रन इसे Netflix की कीमत और साप्ताहिक परिवर्तन देखने के लिए कहता है, फिर इस कदम को समझाता है। यह GPT-5.4 पर कम थिंकिंग और पांच-सेकंड की flex विंडो के साथ चलता है। क्लिप 2 मिनट 57 सेकंड तक चलती है। Flex दरों ने लागत को 48.5 प्रतिशत कम कर दिया। पहला token आठ सौवें सेकंड बाद वापस आया। हमारे OpenWork skill को अपने कोडिंग एजेंट में जोड़ें, फिर इसे अपने OpenWork चेकआउट को FlexInference पर इंगित करने के लिए कहें। Claude Code के लिए यह एक कमांड है:
Install the OpenWork skill
FlexInference डेमो ट्रांसक्रिप्ट: OpenWorkनमस्ते एवरीवन, मेरा नाम आदि है। मैं FlexInference का संस्थापक हूँ, और यहाँ हमारे पास OpenWork है, और इसे बदल दिया गया है ताकि यह अपने राउटर के लिए पृष्ठभूमि में FlexInference का उपयोग करे। नीचे एक प्रॉम्प्ट है जिसे आप किसी भी CLI या एजेंटिक कोडिंग टूल में पेस्ट कर सकते हैं जिसका आप उपयोग करते हैं, और इसे आपके OpenWork को FlexInference का उपयोग करना शुरू कर देना चाहिए। आइए डेमो शुरू करें और मैं समझाऊँगा कि यह कैसे काम करता है। ये सभी मॉडल FlexInference के माध्यम से समर्थित हैं, लेकिन मान लीजिए कि मुझे एक ऐसा कार्य चाहिए जिसके लिए एक स्मार्ट मॉडल की आवश्यकता है: GPT 5.4। मैं इसे कम थिंकिंग पर flex ऑन के साथ सेट करूँगा और इसे पांच-सेकंड का SLA दूँगा ताकि इसके भीतर सस्ती inference मिल सके, अन्यथा एक डिफ़ॉल्ट अनुरोध पर आगे बढ़ें। तो आइए कहते हैं: मैं चाहता हूँ कि आप ब्राउज़र टूल का उपयोग करके Netflix की वर्तमान कीमत और साप्ताहिक परिवर्तन भी खोजें, और मुझे बताएँ कि यह क्यों बढ़ रहा है या गिर रहा है।जब यह हो रहा है, मैं उन मामलों को समझाऊँगा जहाँ यह वास्तव में सहायक है। हाँ, आप डिफ़ॉल्ट अनुरोधों, प्राथमिकता वाले अनुरोधों, ऑटो अनुरोधों के लिए FlexInference का उपयोग कर सकते हैं, लेकिन जो हमें अलग बनाता है वह flex रेस है, जो आपके द्वारा निर्धारित SLA को देखते हुए है। उन मामलों के बारे में सोचें जहाँ आपके पास सुबह एक दैनिक ब्रीफ होता है: सुबह 8 बजे मुझे एक स्टॉक मार्केट ब्रीफ चाहिए। क्या इससे वास्तव में फर्क पड़ता है कि इसने एक मिनट के भीतर ब्रीफ बनाया या एक मिनट और दस सेकंड में? मेरी राय में, वास्तव में नहीं। यदि आप उस दस-सेकंड या पांच-सेकंड के SLA को छोड़ने को तैयार हैं, तो वे मामले अविश्वसनीय हैं, क्योंकि आप मुफ्त में पचास प्रतिशत बचाएंगे, बस यहाँ और वहाँ कुछ सेकंड देकर।वास्तव में, हमारे मामले में, फ्रंट एंड केवल flex प्रतिक्रिया दिखाता है, लेकिन बैक एंड पर, इस डेमो में प्रत्येक अनुरोध के लिए, हम दो समानांतर अनुरोध भेजते हैं - एक डिफ़ॉल्ट और एक पांच-सेकंड के SLA के साथ - और प्रति दस लाख token की लागत और पहले token तक के समय पर उनकी तुलना करते हैं। ये वास्तव में अच्छे तुलनात्मक मेट्रिक्स हैं, क्योंकि दो अनुरोधों के बीच प्रतिक्रियाएँ भिन्न हो सकती हैं, लेकिन प्रति दस लाख token की लागत निष्पक्ष है, और पहले token तक का समय भी निष्पक्ष है।हम यहाँ जो देख रहे हैं वह यह है कि आपने पचास प्रतिशत बचाया, और आपने वास्तव में केवल .08 अतिरिक्त सेकंड खर्च किए एक प्रतिक्रिया प्राप्त करने में। आप कल्पना कर सकते हैं कि 365 दिनों और आपके पृष्ठभूमि में चल रही सभी अतुल्यकालिक प्रक्रियाओं में, जो विलंबता-संवेदनशील नहीं हैं, यह वास्तव में सहायक है। और फिर आप अन्य उपयोग के मामलों के बारे में सोच सकते हैं जो आपको मिलने वाली पचास प्रतिशत लागत बचत के कारण सहायक होने लगते हैं। तो यह FlexInference का उपयोग करने के महान तरीकों में से एक है। हमें उम्मीद है कि आपको यह पसंद आएगा, और नीचे दिए गए प्रॉम्प्ट को कॉपी करना सुनिश्चित करें और इसे अपने OpenWork पर उपयोग करें। धन्यवाद।

अधिक डेमो

ये तीन क्लिप इंटीग्रेशन skill से पहले के हैं, इसलिए कोई टूल नहीं है जिसे वायर किया जा सके। प्रत्येक एक अलग कार्य पर समान दो-अनुरोध परीक्षण चलाता है।

Gemini इमेज वर्गीकरण

दो Gemini 2.5 Flash रन पचास रंगीन छवियों के एक सेट को सॉर्ट करते हैं। एक दस-सेकंड की flex विंडो खोलता है। दूसरा default भेजता है। क्लिप 1 मिनट 46 सेकंड तक चलती है। Flex दरों ने लागत को 38.9 प्रतिशत कम कर दिया। पहला token 20.2 प्रतिशत बाद में वापस आया।
FlexInference डेमो ट्रांसक्रिप्ट: Gemini इमेज वर्गीकरणनमस्ते एवरीवन, मेरा नाम आदि है। मैं FlexInference का संस्थापक हूँ, और यहाँ हमारे पास एक इमेज वर्गीकरण डेमो है। मैं इसे शुरू करूँगा और फिर समझाऊँगा कि क्या हो रहा है।हमारे पास दो समानांतर प्रक्रियाएँ हैं, दोनों Gemini 2.5 Flash चला रही हैं, जो विभिन्न रंगों की पचास छवियों के एक डेटासेट को वर्गीकृत करेंगी, यह पहचानते हुए कि प्रत्येक का रंग क्या है। हम यह तुलना करने की कोशिश नहीं कर रहे हैं कि कौन सा पक्ष बेहतर वर्गीकृत करता है; दोनों तरफ एक ही मॉडल है, और दोनों FlexInference के SDK और राउटर का उपयोग करते हैं। बाईं ओर को start_within पैरामीटर के माध्यम से सस्ती inference खोजने के लिए दस-सेकंड का SLA दिया गया है। दाहिनी ओर भी FlexInference SDK और राउटर का उपयोग कर रहा है, लेकिन इसका start_within पैरामीटर डिफ़ॉल्ट पर सेट है, जो तत्काल प्रतिक्रिया मांगता है। हम यह दिखाने की कोशिश कर रहे हैं कि आपके द्वारा निर्धारित एक छोटे विलंबता बजट को देखते हुए, इस मामले में दस सेकंड, आप नाटकीय रूप से कम लागत प्राप्त कर सकते हैं, लगभग पचास प्रतिशत। मैं इसे तब तक तेज़ी से आगे बढ़ाऊँगा जब तक यह डेटासेट वर्गीकृत और पूरा नहीं हो जाता, और फिर हम ट्रेड-ऑफ देख सकते हैं।अब जब हम वापस आ गए हैं, तो हम देख सकते हैं कि पचास में से पचास छवियों को वर्गीकृत किया गया है। कुल लागत लगभग आधी थी: 0.0183बनाम0.0183 बनाम 0.0304। प्रति दस लाख token की लागत, इनपुट और आउटपुट एक साथ, 0.58बनाम0.58 बनाम 0.95 है, जो भी लगभग आधा है। कुल विलंबता लगभग सत्ताईस सेकंड, लगभग पंद्रह प्रतिशत थी। अनिवार्य रूप से, एक छोटे विलंबता बजट को देखते हुए, आप नाटकीय रूप से कम लागत प्राप्त करने में सक्षम थे। धन्यवाद।

OpenAI डीप रिसर्च

दो शोध एजेंट सार्वजनिक CPU कंपनियों पर एक रिपोर्ट का मसौदा तैयार करते हैं। एक दस-सेकंड की flex विंडो खोलता है, और दूसरा default भेजता है। क्लिप 2 मिनट 35 सेकंड तक चलती है। Flex दरों ने GPT-5 Mini पर लागत को 44.8 प्रतिशत कम कर दिया। पहला token 30.1 प्रतिशत पहले वापस आया।
FlexInference डेमो ट्रांसक्रिप्ट: OpenAI डीप रिसर्चनमस्ते एवरीवन, मेरा नाम आदि है। मैं FlexInference का संस्थापक हूँ, और यहाँ डीप रिसर्च के लिए एक डेमो है। मैं डेमो शुरू करूँगा जैसे ही मैं समझाऊँगा कि यह कैसे काम करता है। हमारे पास दो एजेंट समानांतर प्रक्रियाओं के रूप में चल रहे हैं, दोनों FlexInference SDK और राउटर का उपयोग कर रहे हैं, जो मॉडल प्रशिक्षण और inference में बढ़त वाली सार्वजनिक CPU कंपनियों को खोजने की कोशिश करेंगे। विषय स्वयं उतना प्रासंगिक नहीं है: प्रत्येक एजेंट कुछ प्रश्न बनाता है, कुछ वेब खोज करता है, और एक रिपोर्ट बनाता है। हम वास्तव में यह देख रहे हैं कि बाईं ओर के एजेंट को सस्ती inference खोजने के लिए दस-सेकंड का SLA दिया गया है, और यदि वह उस समय के भीतर ऐसा नहीं कर पाता है, तो यह एक डिफ़ॉल्ट अनुरोध पर आगे बढ़ता है और फिर भी अनुरोध को पूरा करता है। दाहिनी ओर का start_within पैरामीटर दस सेकंड के बजाय डिफ़ॉल्ट पर सेट है, जो तत्काल प्रतिक्रिया मांगता है। हम यह देखने की कोशिश कर रहे हैं कि बाईं ओर, दस सेकंड तक के एक छोटे विलंबता बजट को देखते हुए, नाटकीय रूप से कम लागत है, लगभग पचास प्रतिशत कम। यह FlexInference को बहुत कम विलंबता आवश्यकताओं वाले कार्यों के लिए कहीं अधिक सस्ता और कहीं अधिक किफायती बनाता है। मैं अब इसे अंत तक तेज़ी से आगे बढ़ाऊँगा ताकि हम ट्रेड-ऑफ की तुलना कर सकें।अब हम वापस आ गए हैं। दोनों रिपोर्टें बन चुकी हैं; एजेंटों ने वेब खोज की और कुछ तृतीयक योजना बनाई। बाईं ओर, Flex, न केवल सस्ता था बल्कि तेज़ी से भी पूरा हुआ, जो कभी-कभी होता है। हम गारंटी नहीं देते कि विलंबता कम होगी; हम गारंटी देते हैं कि आपके द्वारा निर्धारित SLA के भीतर, हम या तो आपको सस्ती inference ढूँढेंगे या एक डिफ़ॉल्ट अनुरोध पर आगे बढ़ेंगे। यहाँ बाईं ओर लगभग साठ सेकंड तेज़ी से समाप्त हुआ, और GPT-5 Mini पर प्रति दस लाख token की लागत लगभग छब्बीस सेंट कम थी, लगभग आधी लागत। हम प्रति दस लाख token की लागत का उपयोग करते हैं क्योंकि दोनों पक्षों ने अलग-अलग संख्या में token और उद्धरणों का उपयोग किया, इसलिए यह एक अधिक सटीक तुलना है। कुल लागत में लगभग $0.0265 का अंतर आया। धन्यवाद।

OpenAI ब्राउज़र एजेंट

दो GPT-5 ब्राउज़र एजेंट एक ई-कॉमर्स क्लोन पर एक टी-शर्ट खरीदते हैं। एक दस-सेकंड की flex विंडो खोलता है, और दूसरा default भेजता है। क्लिप 1 मिनट 59 सेकंड तक चलती है। Flex दरों ने लागत को 51.5 प्रतिशत कम कर दिया। पहला token 9.7 प्रतिशत बाद में वापस आया।
FlexInference डेमो ट्रांसक्रिप्ट: OpenAI ब्राउज़र एजेंटनमस्ते एवरीवन, मेरा नाम आदि है। मैं FlexInference का संस्थापक हूँ, और यहाँ एक ब्राउज़र एजेंट डेमो है। मैं इस डेमो को शुरू करूँगा जैसे ही मैं समझाऊँगा कि यह कैसे काम करता है। बैक एंड पर हमारे पास एक ई-कॉमर्स क्लोन है, और हमारे एजेंट M साइज़, काले रंग की एक मेडुसा टी-शर्ट खरीदने का कार्य पूरा करने की कोशिश करेंगे। बाईं ओर हमारे पास GPT-5 है जिसे FlexInference के SDK और राउटर के माध्यम से रूट किया जा रहा है, जिसे सस्ती inference खोजने के लिए दस सेकंड दिए गए हैं; यदि यह ऐसा करता है, तो यह अनुरोध को उस तरह से पूरा करता है, और अन्यथा यह एक डिफ़ॉल्ट अनुरोध पर आगे बढ़ता है। दाहिनी ओर हमारे पास GPT-5 भी है जो FlexInference SDK और राउटर का उपयोग कर रहा है, लेकिन start_within पैरामीटर डिफ़ॉल्ट पर सेट है, इसलिए इसके अनुरोध तुरंत पूरे होते हैं। लक्ष्य यह दिखाना है कि बाईं ओर आप उसी कार्य को पूरा कर सकते हैं, एक छोटा विलंबता बजट छोड़कर, नाटकीय रूप से कम कुल लागत और प्रति दस लाख token की लागत के लिए। हम कुल लागत और प्रति दस लाख token की लागत को देखते हैं क्योंकि स्टेप काउंट भिन्न हो सकते हैं, क्योंकि यह कार्य गैर-निर्धारित है। ये दो समानांतर प्रक्रियाएँ हैं, और इनपुट प्रॉम्प्ट कैशिंग बंद है। अब मैं इसे अंत तक तेज़ी से आगे बढ़ाऊँगा ताकि हम लागत और विलंबता की तुलना कर सकें और ट्रेड-ऑफ देख सकें।इस पर वापस आते हुए, हम देखते हैं कि लगभग पंद्रह अतिरिक्त सेकंड, लगभग दस प्रतिशत अधिक विलंबता छोड़कर, हम कुल लागत को लगभग आधा करने में सक्षम थे, और प्रति दस लाख token की लागत को थोड़ा अधिक। स्टेप काउंट में अंतर है, लेकिन सामान्य तौर पर FlexInference से आपको यही मिलता है: विलंबता में थोड़ी वृद्धि के लिए नाटकीय रूप से कम लागत। धन्यवाद।