> ## Documentation Index
> Fetch the complete documentation index at: https://docs.flexinference.com/llms.txt
> Use this file to discover all available pages before exploring further.

# डेमो

> छह रिकॉर्ड किए गए रन, उनके पीछे के नंबर, और आपके अपने सेटअप के लिए आवश्यक कौशल।

नीचे दिया गया प्रत्येक क्लिप एक वर्कलोड को हमारे माध्यम से रूट करता है। प्रत्येक अनुरोध एक ही मॉडल पर दो बार फायर होता है। एक कॉल `start_within` के साथ एक flex विंडो खोलता है। दूसरा `default` भेजता है। वीडियो flex उत्तर चलाता है।

हम प्रति दस लाख token की लागत और पहले token तक के समय पर दोनों रनों की तुलना करते हैं। जब दो रन अलग-अलग token लौटा सकते हैं तो ये निष्पक्ष माप होते हैं।

हम सस्ते परिणाम का वादा करते हैं, न कि तेज़ वाले का। आपके द्वारा निर्धारित विंडो के भीतर हम या तो सस्ता टियर प्राप्त करते हैं या मानक पर चले जाते हैं। इसलिए एक रन एक टियर पर बिल होता है और आपकी समय-सीमा से आगे कभी इंतजार नहीं करता।

| रन                          | मॉडल             | लागत   | पहले token तक का समय |
| --------------------------- | ---------------- | ------ | -------------------- |
| OpenScience                 | GPT-5.6 Terra    | -50.0% | +9.3%                |
| OpenCode                    | GPT-5.4          | -50.0% | -37.5%               |
| OpenWork                    | GPT-5.4          | -48.5% | +6.9%                |
| Gemini image classification | Gemini 2.5 Flash | -38.9% | +20.2%               |
| OpenAI deep research        | GPT-5 Mini       | -44.8% | -30.1%               |
| OpenAI browser agent        | GPT-5            | -51.5% | +9.7%                |

अपना पहला अनुरोध [क्विकस्टार्ट](/hi/quickstart) के साथ भेजें। [डेडलाइन राउटिंग](/hi/deadline-routing) विंडो और मानक पर जाने को कवर करता है।

## इंटीग्रेशन डेमो

नीचे दिया गया प्रत्येक टूल एक स्टॉक ओपन-सोर्स एजेंट है, जिसे हमारे माध्यम से रूट करने के लिए बदला गया है। प्रत्येक अब एक skill के रूप में शिप होता है। अपने कोडिंग एजेंट में skill जोड़ें और अपने स्वयं के चेकआउट में इंटीग्रेशन के लिए पूछें। skill प्रोवाइडर एंट्री, flex डेडलाइन और `/flex` सेशन कमांड को कॉन्फ़िग के माध्यम से कवर करता है।

### OpenScience

OpenScience Claude Science का एक ओपन-सोर्स विकल्प है। यह रन इसे अधिक कुशल ट्रक राउटिंग पर शोध पत्र खोजने के लिए कहता है। यह GPT-5.6 Terra पर कम थिंकिंग और पांच-सेकंड की flex विंडो के साथ चलता है।

<video controls preload="none" width="100%" poster="https://ktjzuvntnnx7dynr.public.blob.vercel-storage.com/demos/openscience-poster.jpg" src="https://ktjzuvntnnx7dynr.public.blob.vercel-storage.com/demos/openscience-demo.mp4">
  Your browser does not support the video tag.
</video>

क्लिप 4 मिनट 1 सेकंड तक चलती है। Flex दरों ने पूरे कार्य को कवर किया, इसलिए इसकी लागत आधी थी। पहला token 9.3 प्रतिशत बाद में वापस आया, और कार्य लगभग तीस सेकंड पीछे समाप्त हुआ।

हमारे [OpenScience skill](https://flexinference.com/skills/openscience.skill.md) को अपने कोडिंग एजेंट में जोड़ें, फिर इसे अपने OpenScience चेकआउट को FlexInference पर इंगित करने के लिए कहें। Claude Code के लिए यह एक कमांड है:

```bash Install the OpenScience skill theme={null}
mkdir -p ~/.claude/skills/openscience-flexinference && curl -fsSL https://flexinference.com/skills/openscience.skill.md -o ~/.claude/skills/openscience-flexinference/SKILL.md
```

<Accordion title="ट्रांसक्रिप्ट">
  FlexInference डेमो ट्रांसक्रिप्ट: OpenScience

  नमस्ते एवरीवन, मेरा नाम आदि है। मैं FlexInference का संस्थापक हूँ, और यहाँ हमारे पास OpenScience है, जो Claude Science का एक ओपन-सोर्स विकल्प है। इसे FlexInference के माध्यम से अपने सभी अनुरोधों को रूट करने के लिए बदल दिया गया है, और आप अपने OpenScience को भी ऐसा ही कर सकते हैं: हमने इस डेमो के ठीक नीचे एक प्रॉम्प्ट जोड़ा है जिसे आप किसी भी एजेंटिक कोडिंग टूल में कॉपी और पेस्ट कर सकते हैं जिसका आप उपयोग करते हैं, और यह आपके OpenScience को FlexInference का उपयोग करने के लिए भी अपग्रेड कर देगा। इस डेमो के लिए हम GPT 5.6 Terra का उपयोग कर रहे हैं। मैं थिंकिंग को कम पर सेट करूँगा, एक flex रेस सेट करूँगा ताकि यह सस्ती inference की खोज करे, और इसे सस्ती inference खोजने के लिए पाँच सेकंड दूँगा, अन्यथा एक डिफ़ॉल्ट अनुरोध पर अपग्रेड कर दूँगा। हम प्रति दस लाख token की लागत और पहले token तक के समय को देखेंगे, क्योंकि पृष्ठभूमि में जब भी मैं कोई प्रश्न पूछता हूँ तो हम दो समानांतर अनुरोध स्पिन करते हैं। यह सिर्फ तुलना करने के लिए है, और चूंकि परिणाम गैर-निर्धारित हो सकते हैं, हम वास्तव में इस बात की परवाह करते हैं कि पहला token कब वापस आया और प्रति दस लाख token पर प्रत्येक पक्ष की लागत कितनी है। मैं यह कहना चाहूँगा कि FlexInference सभी Claude मॉडल, सभी Gemini मॉडल और सभी GPT मॉडल का समर्थन करता है जो आप यहाँ देखते हैं।

  अब हम इससे पूछते हैं: मैं लॉजिस्टिक्स में काम करता हूँ और मेरे पास तीन ट्रक हैं। मैं चाहता हूँ कि मेरी राउटिंग अधिक कुशल हो, तेज़ी से और सस्ते में डिलीवरी हो। मुझे प्रासंगिक शोध पत्र खोजें।

  जब यह चल रहा है, तो पृष्ठभूमि में तुलना करने के लिए दो समानांतर प्रक्रियाएँ चल रही हैं। हम जो गारंटी देते हैं वह यह है कि आपके द्वारा निर्धारित समय के भीतर, हम आपको सस्ती inference ढूँढेंगे या एक सामान्य डिफ़ॉल्ट अनुरोध पर आगे बढ़ेंगे; इस मामले में हम हमेशा डिफ़ॉल्ट अनुरोध पूछने की तुलना कर रहे हैं। हम कभी-कभी देखते हैं कि हम किसी तरह तेज़ हैं, और स्पष्ट रूप से सस्ते हैं, लेकिन हम तेज़ हिस्से की गारंटी नहीं देते हैं। हम सस्ते हिस्से की गारंटी देते हैं। आप स्पष्ट रूप से हमारे माध्यम से डिफ़ॉल्ट अनुरोध कर सकते हैं और अपनी इच्छित गति प्राप्त कर सकते हैं, साथ ही प्राथमिकता वाले अनुरोध भी।

  आप विज्ञान-शैली की परिकल्पना और दोहराव वाली प्रक्रिया कार्य के लिए SLA क्यों चाहेंगे? शोध में काम करने के बाद, अक्सर ऐसे मामले होते हैं जहाँ आपके पास दस परिकल्पनाएँ और API क्रेडिट, देव समय, या समय-सीमा से पहले का सीमित समय होता है। तो आप केवल शीर्ष तीन का प्रयास करते हैं और नीचे के सात को छोड़ देते हैं। अंततः शीर्ष तीन आपके इच्छित परिणाम देने में विफल रहते हैं, आप बाकी को देखना शुरू करते हैं, आप उस सूची में आठवें पर पहुँचते हैं, और आप सोचते हैं, काश मैंने इसे पहले आज़माया होता - उस पल में इसका कोई मतलब नहीं था। इस तरह, जिन परिकल्पनाओं पर आप विचार कर रहे हैं जो निवेश पर अच्छा रिटर्न नहीं लगती हैं, वे पृष्ठभूमि में सस्ते में चल सकती हैं। भले ही इसमें थोड़ा अधिक समय लगे, यह ठीक है, क्योंकि आप वैसे भी इसे प्राथमिकता नहीं देने वाले थे - लेकिन अब आपको परिणाम जल्द मिलेंगे। और जब आप शोध कर रहे होते हैं, या कोई भी ओपन-एंडेड कार्य जहाँ आप पुनरावृति करते हैं और परीक्षण और त्रुटि करते हैं, तो आपको बहुत से लोगों के इनपुट मिल रहे होते हैं और आप उन्हें परिणाम भी देना चाहते हैं, लेकिन आप समय या API क्रेडिट समर्पित नहीं कर सकते। आप उनके सभी अनुरोधों और परिकल्पनाओं को विभिन्न OpenScience सत्रों पर धकेल सकते हैं, सुनिश्चित कर सकते हैं कि यह पर्याप्त समय में बाहर आता है, और उन्हें बहुत सस्ते में परिणाम मिलेंगे जबकि आप प्राथमिकता देना जारी रखेंगे। आपके अधिक प्राथमिकता वाले अनुरोध आप डिफ़ॉल्ट या प्राथमिकता वाले अनुरोधों के माध्यम से करते रह सकते हैं।

  जैसा कि आप देख सकते हैं, यह पूरा हो गया, और हम अपने कार्य को केवल तीस अतिरिक्त सेकंड में पूरा करने में सक्षम थे - आधी कीमत पर। इस मामले में, पचास प्रतिशत लागत में कमी के लिए दस प्रतिशत या उससे कम विलंबता छोड़ना समझ में आता है। मुझे उम्मीद है कि आपको यह पसंद आया होगा और आप इसे अपने OpenScience के संस्करण में लागू करेंगे। धन्यवाद।
</Accordion>

### OpenCode

OpenCode एक ओपन-सोर्स कोडिंग एजेंट है। यह रन इसे एक HTML पेज बनाने के लिए कहता है जिसके विज़ुअलाइज़ेशन डेरिवेटिव्स को समझाते हैं। यह GPT-5.4 पर कम थिंकिंग और पांच-सेकंड की flex विंडो के साथ चलता है।

<video controls preload="none" width="100%" poster="https://ktjzuvntnnx7dynr.public.blob.vercel-storage.com/demos/opencode-poster.jpg" src="https://ktjzuvntnnx7dynr.public.blob.vercel-storage.com/demos/opencode-demo.mp4">
  Your browser does not support the video tag.
</video>

क्लिप 3 मिनट 34 सेकंड तक चलती है। Flex दरों ने लागत को आधा कर दिया। पहला token डिफ़ॉल्ट रन को 37.5 प्रतिशत से हरा दिया, जो होता है लेकिन हम इसका वादा कभी नहीं करते।

हमारे [OpenCode skill](https://flexinference.com/skills/opencode.skill.md) को अपने कोडिंग एजेंट में जोड़ें, फिर इसे अपने OpenCode चेकआउट को FlexInference पर इंगित करने के लिए कहें। `/flex` प्लगइन जो यह कॉन्फ़िगर करता है, प्रत्येक अनुरोध पर `start_within` सेट करता है क्योंकि यह अनुरोध हुक का मालिक है। बिना हुक वाले टूल को किसी प्लगइन की आवश्यकता नहीं होती है। इसके बजाय डेडलाइन [key पर](/hi/deadline-routing) रखें। Claude Code के लिए इंस्टॉल एक कमांड है:

```bash Install the OpenCode skill theme={null}
mkdir -p ~/.claude/skills/opencode-flexinference && curl -fsSL https://flexinference.com/skills/opencode.skill.md -o ~/.claude/skills/opencode-flexinference/SKILL.md
```

<Accordion title="ट्रांसक्रिप्ट">
  FlexInference डेमो ट्रांसक्रिप्ट: OpenCode

  नमस्ते, मेरा नाम आदि है। मैं FlexInference का संस्थापक हूँ, और यहाँ हमारे पास OpenCode है, और इसे FlexInference के माध्यम से मॉडल अनुरोधों को रूट करने के लिए बदल दिया गया है। आप इसे स्वयं भी बदल सकते हैं: इस डेमो के नीचे एक प्रॉम्प्ट है जिसे आप किसी भी एजेंटिक कोडिंग टूल में कॉपी और पेस्ट कर सकते हैं, इसे अपने OpenCode पर इंगित कर सकते हैं, और कह सकते हैं "मैं FlexInference का उपयोग करना चाहता हूँ," और यह ऐसा कर देगा कि आपके पास वही टूल हो जो हमारे पास यहाँ है। यह पहले से ही GPT 5.4 पर सेट है; हम इसे कम थिंकिंग पर सेट करेंगे, flex ऑन, पांच-सेकंड SLA, और मैं डेमो शुरू करूँगा और समझाऊँगा कि चीजें कैसे चल रही हैं। तो हम कहेंगे: मुझे डेरिवेटिव्स को समझने में मुश्किल हो रही है। मुझे गतिशील विज़ुअलाइज़ेशन वाला एक साधारण HTML पेज चाहिए जो मुझे इसे समझाए।

  OpenCode इसे बनाएगा, और दाहिनी ओर एक तुलना चल रही होगी: flex रेस दर, जो प्रति दस लाख token की लागत है, फिर डिफ़ॉल्ट दर, और फिर flex रेस पहले token तक का समय और डिफ़ॉल्ट पहले token तक का समय। फ्रंट एंड पर, जो आप इस TUI के माध्यम से देख रहे हैं वह सिर्फ वही है जो flex प्रतिक्रिया दे रहा है। बैक एंड पर, हम दो समानांतर अनुरोध भेज रहे हैं, इसलिए यह वास्तव में एक सेब-से-सेब की तुलना है, और आप पहले token तक के समय और प्रति दस लाख token की लागत की तुलना भी देख सकते हैं।

  FlexInference के पीछे का बिंदु यह है कि हम आपको एक flex रेस तक पहुँच प्रदान करते हैं जो आपके द्वारा निर्धारित समय के भीतर सस्ती inference की खोज करती है, और हमने इसे पांच सेकंड पर सेट किया है; यदि वह पूरा नहीं होता है, तो हम इसे ऊपर बढ़ाते हैं। हम हर दूसरे प्रकार के अनुरोध भी कर सकते हैं। स्लैश मॉडल में आप देख सकते हैं कि हम सभी प्रमुख मॉडलों का समर्थन करते हैं। जो हमें अलग करता है वह flex रेस है। गैर-विलंबता-संवेदनशील कार्यों के कई मामले हैं जहाँ यह बहुत अच्छा है। कल्पना कीजिए कि आपको रात 8 बजे एक पेज मिलता है। यह एक sev 4 है और सबसे बड़ी बात नहीं है। आप सोचते हैं कि अगर इसे लागू किया जा सके तो अच्छा होगा, लेकिन अगर इसमें दस मिनट अधिक लगते हैं तो आप ठीक हैं। उन मामलों में, यह बहुत अच्छा है। या ऐसे मामले जहाँ आपके पास पृष्ठभूमि परियोजनाएँ हैं जिनमें आपकी रुचि है, लेकिन आप अपने सभी API क्रेडिट एक साथ खर्च नहीं करना चाहते हैं: आप कई कार्यों को कतारबद्ध कर सकते हैं, वे धीरे-धीरे बाहर निकलते हैं, और आप बहुत कम खर्च करते हैं।

  अब इसने पहले ही यह डेरिवेटिव्स HTML पेज बना दिया है, जिसे हम खोल सकते हैं, लेकिन मुझे तुलना में दिलचस्पी है। GPT 5.4 पर पहले token तक का समय वास्तव में तेज़ था, जो समय-समय पर होता है। हम गारंटी नहीं देते कि यह डिफ़ॉल्ट से तेज़ होगा, लेकिन ऐसा होता है, और हमारे मामले में यह बहुत अच्छा है। दूसरा, यह सस्ता है: यहाँ पचास प्रतिशत लागत में कमी। OpenCode के भीतर FlexInference स्थापित करने का मतलब है कि आप या आपके डेवलपर्स विभिन्न परियोजनाओं और विचारों को आज़माने में बहुत अधिक समय बिता सकते हैं, इस बात की चिंता किए बिना कि आपके क्रेडिट गलत क्षेत्र में उपयोग हो रहे हैं, क्योंकि अब आपके पास पचास प्रतिशत लागत में कमी है। उम्मीद है कि आप इसका आनंद लेंगे और इसका उपयोग भी करेंगे। धन्यवाद।
</Accordion>

### OpenWork

OpenWork अपनी राउटिंग के लिए एक OpenCode साइडकार चलाता है। यह रन इसे Netflix की कीमत और साप्ताहिक परिवर्तन देखने के लिए कहता है, फिर इस कदम को समझाता है। यह GPT-5.4 पर कम थिंकिंग और पांच-सेकंड की flex विंडो के साथ चलता है।

<video controls preload="none" width="100%" poster="https://ktjzuvntnnx7dynr.public.blob.vercel-storage.com/demos/openwork-poster.jpg" src="https://ktjzuvntnnx7dynr.public.blob.vercel-storage.com/demos/openwork-demo.mp4">
  Your browser does not support the video tag.
</video>

क्लिप 2 मिनट 57 सेकंड तक चलती है। Flex दरों ने लागत को 48.5 प्रतिशत कम कर दिया। पहला token आठ सौवें सेकंड बाद वापस आया।

हमारे [OpenWork skill](https://flexinference.com/skills/openwork.skill.md) को अपने कोडिंग एजेंट में जोड़ें, फिर इसे अपने OpenWork चेकआउट को FlexInference पर इंगित करने के लिए कहें। Claude Code के लिए यह एक कमांड है:

```bash Install the OpenWork skill theme={null}
mkdir -p ~/.claude/skills/openwork-flexinference && curl -fsSL https://flexinference.com/skills/openwork.skill.md -o ~/.claude/skills/openwork-flexinference/SKILL.md
```

<Accordion title="ट्रांसक्रिप्ट">
  FlexInference डेमो ट्रांसक्रिप्ट: OpenWork

  नमस्ते एवरीवन, मेरा नाम आदि है। मैं FlexInference का संस्थापक हूँ, और यहाँ हमारे पास OpenWork है, और इसे बदल दिया गया है ताकि यह अपने राउटर के लिए पृष्ठभूमि में FlexInference का उपयोग करे। नीचे एक प्रॉम्प्ट है जिसे आप किसी भी CLI या एजेंटिक कोडिंग टूल में पेस्ट कर सकते हैं जिसका आप उपयोग करते हैं, और इसे आपके OpenWork को FlexInference का उपयोग करना शुरू कर देना चाहिए। आइए डेमो शुरू करें और मैं समझाऊँगा कि यह कैसे काम करता है। ये सभी मॉडल FlexInference के माध्यम से समर्थित हैं, लेकिन मान लीजिए कि मुझे एक ऐसा कार्य चाहिए जिसके लिए एक स्मार्ट मॉडल की आवश्यकता है: GPT 5.4। मैं इसे कम थिंकिंग पर flex ऑन के साथ सेट करूँगा और इसे पांच-सेकंड का SLA दूँगा ताकि इसके भीतर सस्ती inference मिल सके, अन्यथा एक डिफ़ॉल्ट अनुरोध पर आगे बढ़ें। तो आइए कहते हैं: मैं चाहता हूँ कि आप ब्राउज़र टूल का उपयोग करके Netflix की वर्तमान कीमत और साप्ताहिक परिवर्तन भी खोजें, और मुझे बताएँ कि यह क्यों बढ़ रहा है या गिर रहा है।

  जब यह हो रहा है, मैं उन मामलों को समझाऊँगा जहाँ यह वास्तव में सहायक है। हाँ, आप डिफ़ॉल्ट अनुरोधों, प्राथमिकता वाले अनुरोधों, ऑटो अनुरोधों के लिए FlexInference का उपयोग कर सकते हैं, लेकिन जो हमें अलग बनाता है वह flex रेस है, जो आपके द्वारा निर्धारित SLA को देखते हुए है। उन मामलों के बारे में सोचें जहाँ आपके पास सुबह एक दैनिक ब्रीफ होता है: सुबह 8 बजे मुझे एक स्टॉक मार्केट ब्रीफ चाहिए। क्या इससे वास्तव में फर्क पड़ता है कि इसने एक मिनट के भीतर ब्रीफ बनाया या एक मिनट और दस सेकंड में? मेरी राय में, वास्तव में नहीं। यदि आप उस दस-सेकंड या पांच-सेकंड के SLA को छोड़ने को तैयार हैं, तो वे मामले अविश्वसनीय हैं, क्योंकि आप मुफ्त में पचास प्रतिशत बचाएंगे, बस यहाँ और वहाँ कुछ सेकंड देकर।

  वास्तव में, हमारे मामले में, फ्रंट एंड केवल flex प्रतिक्रिया दिखाता है, लेकिन बैक एंड पर, इस डेमो में प्रत्येक अनुरोध के लिए, हम दो समानांतर अनुरोध भेजते हैं - एक डिफ़ॉल्ट और एक पांच-सेकंड के SLA के साथ - और प्रति दस लाख token की लागत और पहले token तक के समय पर उनकी तुलना करते हैं। ये वास्तव में अच्छे तुलनात्मक मेट्रिक्स हैं, क्योंकि दो अनुरोधों के बीच प्रतिक्रियाएँ भिन्न हो सकती हैं, लेकिन प्रति दस लाख token की लागत निष्पक्ष है, और पहले token तक का समय भी निष्पक्ष है।

  हम यहाँ जो देख रहे हैं वह यह है कि आपने पचास प्रतिशत बचाया, और आपने वास्तव में केवल .08 अतिरिक्त सेकंड खर्च किए एक प्रतिक्रिया प्राप्त करने में। आप कल्पना कर सकते हैं कि 365 दिनों और आपके पृष्ठभूमि में चल रही सभी अतुल्यकालिक प्रक्रियाओं में, जो विलंबता-संवेदनशील नहीं हैं, यह वास्तव में सहायक है। और फिर आप अन्य उपयोग के मामलों के बारे में सोच सकते हैं जो आपको मिलने वाली पचास प्रतिशत लागत बचत के कारण सहायक होने लगते हैं। तो यह FlexInference का उपयोग करने के महान तरीकों में से एक है। हमें उम्मीद है कि आपको यह पसंद आएगा, और नीचे दिए गए प्रॉम्प्ट को कॉपी करना सुनिश्चित करें और इसे अपने OpenWork पर उपयोग करें। धन्यवाद।
</Accordion>

## अधिक डेमो

ये तीन क्लिप इंटीग्रेशन skill से पहले के हैं, इसलिए कोई टूल नहीं है जिसे वायर किया जा सके। प्रत्येक एक अलग कार्य पर समान दो-अनुरोध परीक्षण चलाता है।

### Gemini इमेज वर्गीकरण

दो Gemini 2.5 Flash रन पचास रंगीन छवियों के एक सेट को सॉर्ट करते हैं। एक दस-सेकंड की flex विंडो खोलता है। दूसरा `default` भेजता है।

<video controls preload="none" width="100%" poster="https://ktjzuvntnnx7dynr.public.blob.vercel-storage.com/demos/gemini-image-classification-poster-lRrPhO0NaP9pLaO24y8nemtJ94pJyN.jpg" src="https://ktjzuvntnnx7dynr.public.blob.vercel-storage.com/demos/gemini-image-classification-demo.mp4">
  Your browser does not support the video tag.
</video>

क्लिप 1 मिनट 46 सेकंड तक चलती है। Flex दरों ने लागत को 38.9 प्रतिशत कम कर दिया। पहला token 20.2 प्रतिशत बाद में वापस आया।

<Accordion title="ट्रांसक्रिप्ट">
  FlexInference डेमो ट्रांसक्रिप्ट: Gemini इमेज वर्गीकरण

  नमस्ते एवरीवन, मेरा नाम आदि है। मैं FlexInference का संस्थापक हूँ, और यहाँ हमारे पास एक इमेज वर्गीकरण डेमो है। मैं इसे शुरू करूँगा और फिर समझाऊँगा कि क्या हो रहा है।

  हमारे पास दो समानांतर प्रक्रियाएँ हैं, दोनों Gemini 2.5 Flash चला रही हैं, जो विभिन्न रंगों की पचास छवियों के एक डेटासेट को वर्गीकृत करेंगी, यह पहचानते हुए कि प्रत्येक का रंग क्या है। हम यह तुलना करने की कोशिश नहीं कर रहे हैं कि कौन सा पक्ष बेहतर वर्गीकृत करता है; दोनों तरफ एक ही मॉडल है, और दोनों FlexInference के SDK और राउटर का उपयोग करते हैं। बाईं ओर को `start_within` पैरामीटर के माध्यम से सस्ती inference खोजने के लिए दस-सेकंड का SLA दिया गया है। दाहिनी ओर भी FlexInference SDK और राउटर का उपयोग कर रहा है, लेकिन इसका `start_within` पैरामीटर डिफ़ॉल्ट पर सेट है, जो तत्काल प्रतिक्रिया मांगता है। हम यह दिखाने की कोशिश कर रहे हैं कि आपके द्वारा निर्धारित एक छोटे विलंबता बजट को देखते हुए, इस मामले में दस सेकंड, आप नाटकीय रूप से कम लागत प्राप्त कर सकते हैं, लगभग पचास प्रतिशत। मैं इसे तब तक तेज़ी से आगे बढ़ाऊँगा जब तक यह डेटासेट वर्गीकृत और पूरा नहीं हो जाता, और फिर हम ट्रेड-ऑफ देख सकते हैं।

  अब जब हम वापस आ गए हैं, तो हम देख सकते हैं कि पचास में से पचास छवियों को वर्गीकृत किया गया है। कुल लागत लगभग आधी थी: $0.0183 बनाम $0.0304। प्रति दस लाख token की लागत, इनपुट और आउटपुट एक साथ, $0.58 बनाम $0.95 है, जो भी लगभग आधा है। कुल विलंबता लगभग सत्ताईस सेकंड, लगभग पंद्रह प्रतिशत थी। अनिवार्य रूप से, एक छोटे विलंबता बजट को देखते हुए, आप नाटकीय रूप से कम लागत प्राप्त करने में सक्षम थे। धन्यवाद।
</Accordion>

### OpenAI डीप रिसर्च

दो शोध एजेंट सार्वजनिक CPU कंपनियों पर एक रिपोर्ट का मसौदा तैयार करते हैं। एक दस-सेकंड की flex विंडो खोलता है, और दूसरा `default` भेजता है।

<video controls preload="none" width="100%" poster="https://ktjzuvntnnx7dynr.public.blob.vercel-storage.com/demos/openai-deep-research-poster-uzwgVG3cekRN5UxzE8W6TYn4lahyeC.jpg" src="https://ktjzuvntnnx7dynr.public.blob.vercel-storage.com/demos/openai-deep-research-demo.mp4">
  Your browser does not support the video tag.
</video>

क्लिप 2 मिनट 35 सेकंड तक चलती है। Flex दरों ने GPT-5 Mini पर लागत को 44.8 प्रतिशत कम कर दिया। पहला token 30.1 प्रतिशत पहले वापस आया।

<Accordion title="ट्रांसक्रिप्ट">
  FlexInference डेमो ट्रांसक्रिप्ट: OpenAI डीप रिसर्च

  नमस्ते एवरीवन, मेरा नाम आदि है। मैं FlexInference का संस्थापक हूँ, और यहाँ डीप रिसर्च के लिए एक डेमो है। मैं डेमो शुरू करूँगा जैसे ही मैं समझाऊँगा कि यह कैसे काम करता है। हमारे पास दो एजेंट समानांतर प्रक्रियाओं के रूप में चल रहे हैं, दोनों FlexInference SDK और राउटर का उपयोग कर रहे हैं, जो मॉडल प्रशिक्षण और inference में बढ़त वाली सार्वजनिक CPU कंपनियों को खोजने की कोशिश करेंगे। विषय स्वयं उतना प्रासंगिक नहीं है: प्रत्येक एजेंट कुछ प्रश्न बनाता है, कुछ वेब खोज करता है, और एक रिपोर्ट बनाता है। हम वास्तव में यह देख रहे हैं कि बाईं ओर के एजेंट को सस्ती inference खोजने के लिए दस-सेकंड का SLA दिया गया है, और यदि वह उस समय के भीतर ऐसा नहीं कर पाता है, तो यह एक डिफ़ॉल्ट अनुरोध पर आगे बढ़ता है और फिर भी अनुरोध को पूरा करता है। दाहिनी ओर का `start_within` पैरामीटर दस सेकंड के बजाय डिफ़ॉल्ट पर सेट है, जो तत्काल प्रतिक्रिया मांगता है। हम यह देखने की कोशिश कर रहे हैं कि बाईं ओर, दस सेकंड तक के एक छोटे विलंबता बजट को देखते हुए, नाटकीय रूप से कम लागत है, लगभग पचास प्रतिशत कम। यह FlexInference को बहुत कम विलंबता आवश्यकताओं वाले कार्यों के लिए कहीं अधिक सस्ता और कहीं अधिक किफायती बनाता है। मैं अब इसे अंत तक तेज़ी से आगे बढ़ाऊँगा ताकि हम ट्रेड-ऑफ की तुलना कर सकें।

  अब हम वापस आ गए हैं। दोनों रिपोर्टें बन चुकी हैं; एजेंटों ने वेब खोज की और कुछ तृतीयक योजना बनाई। बाईं ओर, Flex, न केवल सस्ता था बल्कि तेज़ी से भी पूरा हुआ, जो कभी-कभी होता है। हम गारंटी नहीं देते कि विलंबता कम होगी; हम गारंटी देते हैं कि आपके द्वारा निर्धारित SLA के भीतर, हम या तो आपको सस्ती inference ढूँढेंगे या एक डिफ़ॉल्ट अनुरोध पर आगे बढ़ेंगे। यहाँ बाईं ओर लगभग साठ सेकंड तेज़ी से समाप्त हुआ, और GPT-5 Mini पर प्रति दस लाख token की लागत लगभग छब्बीस सेंट कम थी, लगभग आधी लागत। हम प्रति दस लाख token की लागत का उपयोग करते हैं क्योंकि दोनों पक्षों ने अलग-अलग संख्या में token और उद्धरणों का उपयोग किया, इसलिए यह एक अधिक सटीक तुलना है। कुल लागत में लगभग \$0.0265 का अंतर आया। धन्यवाद।
</Accordion>

### OpenAI ब्राउज़र एजेंट

दो GPT-5 ब्राउज़र एजेंट एक ई-कॉमर्स क्लोन पर एक टी-शर्ट खरीदते हैं। एक दस-सेकंड की flex विंडो खोलता है, और दूसरा `default` भेजता है।

<video controls preload="none" width="100%" poster="https://ktjzuvntnnx7dynr.public.blob.vercel-storage.com/demos/openai-browser-agent-poster-Hvm2QVmo0BuZu5oUrEvQJB69Lc9Co9.jpg" src="https://ktjzuvntnnx7dynr.public.blob.vercel-storage.com/demos/openai-browser-agent-demo-VQVLkwLei70DwQIre9qAty5pks2ZmA.mp4">
  Your browser does not support the video tag.
</video>

क्लिप 1 मिनट 59 सेकंड तक चलती है। Flex दरों ने लागत को 51.5 प्रतिशत कम कर दिया। पहला token 9.7 प्रतिशत बाद में वापस आया।

<Accordion title="ट्रांसक्रिप्ट">
  FlexInference डेमो ट्रांसक्रिप्ट: OpenAI ब्राउज़र एजेंट

  नमस्ते एवरीवन, मेरा नाम आदि है। मैं FlexInference का संस्थापक हूँ, और यहाँ एक ब्राउज़र एजेंट डेमो है। मैं इस डेमो को शुरू करूँगा जैसे ही मैं समझाऊँगा कि यह कैसे काम करता है। बैक एंड पर हमारे पास एक ई-कॉमर्स क्लोन है, और हमारे एजेंट M साइज़, काले रंग की एक मेडुसा टी-शर्ट खरीदने का कार्य पूरा करने की कोशिश करेंगे। बाईं ओर हमारे पास GPT-5 है जिसे FlexInference के SDK और राउटर के माध्यम से रूट किया जा रहा है, जिसे सस्ती inference खोजने के लिए दस सेकंड दिए गए हैं; यदि यह ऐसा करता है, तो यह अनुरोध को उस तरह से पूरा करता है, और अन्यथा यह एक डिफ़ॉल्ट अनुरोध पर आगे बढ़ता है। दाहिनी ओर हमारे पास GPT-5 भी है जो FlexInference SDK और राउटर का उपयोग कर रहा है, लेकिन `start_within` पैरामीटर डिफ़ॉल्ट पर सेट है, इसलिए इसके अनुरोध तुरंत पूरे होते हैं। लक्ष्य यह दिखाना है कि बाईं ओर आप उसी कार्य को पूरा कर सकते हैं, एक छोटा विलंबता बजट छोड़कर, नाटकीय रूप से कम कुल लागत और प्रति दस लाख token की लागत के लिए। हम कुल लागत और प्रति दस लाख token की लागत को देखते हैं क्योंकि स्टेप काउंट भिन्न हो सकते हैं, क्योंकि यह कार्य गैर-निर्धारित है। ये दो समानांतर प्रक्रियाएँ हैं, और इनपुट प्रॉम्प्ट कैशिंग बंद है। अब मैं इसे अंत तक तेज़ी से आगे बढ़ाऊँगा ताकि हम लागत और विलंबता की तुलना कर सकें और ट्रेड-ऑफ देख सकें।

  इस पर वापस आते हुए, हम देखते हैं कि लगभग पंद्रह अतिरिक्त सेकंड, लगभग दस प्रतिशत अधिक विलंबता छोड़कर, हम कुल लागत को लगभग आधा करने में सक्षम थे, और प्रति दस लाख token की लागत को थोड़ा अधिक। स्टेप काउंट में अंतर है, लेकिन सामान्य तौर पर FlexInference से आपको यही मिलता है: विलंबता में थोड़ी वृद्धि के लिए नाटकीय रूप से कम लागत। धन्यवाद।
</Accordion>
