Skip to main content
Jeder Clip unten leitet eine Arbeitslast durch uns. Jede Anfrage wird zweimal auf demselben Modell ausgeführt. Ein Aufruf öffnet ein flex-Fenster mit start_within. Der andere sendet default. Das Video zeigt die flex-Antwort. Wir vergleichen die beiden Läufe hinsichtlich der Kosten pro einer Million Tokens und der Zeit bis zum ersten Token. Dies sind die fairen Messgrößen, wenn zwei Läufe unterschiedliche Tokens zurückgeben können. Wir versprechen das günstigere Ergebnis, nicht das schnellere. Innerhalb des von Ihnen festgelegten Fensters erhalten wir entweder den günstigen Tarif oder wechseln zum Standardtarif. Ein Lauf wird also zu einem Tarif abgerechnet und wartet nie über Ihre Frist hinaus. Senden Sie Ihre erste Anfrage mit dem Quickstart. Deadline routing deckt das Fenster und den Wechsel zum Standard ab.

Integrations-Demos

Jedes der unten aufgeführten Tools ist ein handelsüblicher Open-Source-Agent, der so geändert wurde, dass er über uns routet. Jedes wird jetzt als Skill ausgeliefert. Fügen Sie den Skill Ihrem Coding-Agenten hinzu und fragen Sie nach der Integration in Ihrem eigenen Checkout. Der Skill deckt den Provider-Eintrag, die flex-Frist und den /flex-Sitzungsbefehl ab, alles über die Konfiguration.

OpenScience

OpenScience ist eine Open-Source-Alternative zu Claude Science. Dieser Lauf fordert es auf, Forschungsarbeiten zu effizienterer LKW-Routenplanung zu finden. Es läuft auf GPT-5.6 Terra mit geringer Denkintensität und einem fünfsekündigen flex-Fenster. Der Clip läuft 4 Minuten und 1 Sekunde. flex-Tarife deckten die gesamte Aufgabe ab, sodass sie nur die Hälfte kostete. Der erste Token kam 9,3 Prozent später zurück, und die Aufgabe war etwa dreißig Sekunden später beendet. Fügen Sie unseren OpenScience skill Ihrem Coding-Agenten hinzu und bitten Sie ihn dann, Ihr OpenScience-Checkout auf FlexInference zu verweisen. Für Claude Code ist das ein Befehl:
Install the OpenScience skill
FlexInference Demo-Transkript: OpenScienceHallo zusammen, mein Name ist Adi. Ich bin der Gründer von FlexInference, und hier haben wir OpenScience, eine Open-Source-Alternative zu Claude Science. Es wurde geändert, um alle seine Anfragen über FlexInference zu routen, und Sie können Ihr OpenScience dasselbe tun lassen: Wir haben einen Prompt direkt unter dieser Demo hinzugefügt, den Sie kopieren und in jedes agentenbasierte Codierungstool einfügen können, das Sie verwenden, und es wird Ihr OpenScience so aufrüsten, dass es auch FlexInference verwendet. Für diese Demo verwenden wir GPT 5.6 Terra. Ich werde die Denkintensität auf niedrig einstellen, einen flex-Wettlauf einstellen, damit es nach günstigerer Inferenz sucht, und ihm fünf Sekunden Zeit geben, um günstigere Inferenz zu finden, andernfalls auf eine Standardanfrage upgraden. Wir werden uns die Kosten pro einer Million Tokens und die Zeit bis zum ersten Token ansehen, denn im Hintergrund starten wir jedes Mal, wenn ich eine Frage stelle, zwei parallele Anfragen. Das dient nur zum Vergleich, und da die Ergebnisse nicht deterministisch sein könnten, ist uns wirklich wichtig, wann der erste Token zurückkam und wie viel jede Seite pro einer Million Tokens kostet. Ich möchte sagen, dass FlexInference alle Claude-Modelle, alle Gemini-Modelle und alle GPT-Modelle unterstützt, die Sie hier sehen.Fragen wir es nun: Ich arbeite in der Logistik und besitze drei Lastwagen. Ich möchte meine Routenplanung effizienter gestalten, um schneller und günstiger zu liefern. Finden Sie mir relevante Forschungsarbeiten.Während dies läuft, haben wir zwei parallele Prozesse im Hintergrund laufen, um Vergleiche anzustellen. Was wir garantieren, ist, dass wir innerhalb der von Ihnen festgelegten Zeit günstigere Inferenz finden oder auf eine normale Standardanfrage eskalieren; in diesem Fall vergleichen wir mit dem ständigen Stellen von Standardanfragen. Wir sehen manchmal, dass wir irgendwie schneller und offensichtlich günstiger sind, aber wir garantieren nicht den schnelleren Teil. Wir garantieren den günstigeren Teil. Sie können natürlich Standardanfragen über uns stellen und die gewünschte Geschwindigkeit erhalten, zusammen mit Prioritätsanfragen.Warum sollten Sie ein SLA für eine wissenschaftliche Hypothese und eine sich wiederholende Prozessaufgabe wünschen? Nachdem ich in der Forschung gearbeitet habe, gibt es oft Fälle, in denen man zehn Hypothesen und eine begrenzte Menge an API-Credits, Entwicklungszeit oder einfach Zeit bis zu einer Frist hat. Man probiert also nur die Top drei aus und legt die unteren sieben beiseite. Irgendwann liefern die Top drei nicht die gewünschten Ergebnisse, man beginnt, die restlichen durchzugehen, man kommt zur achten auf dieser Liste und denkt, ich wünschte, ich hätte das früher versucht – es ergab in diesem Moment einfach keinen Sinn. Auf diese Weise können die Hypothesen, die Sie in Betracht ziehen und die keine gute Rendite zu versprechen scheinen, im Hintergrund günstiger laufen. Selbst wenn es etwas länger dauert, ist das in Ordnung, denn Sie hätten es sowieso nicht priorisiert – aber jetzt erhalten Sie die Ergebnisse früher. Und wenn Sie forschen oder eine offene Aufgabe erledigen, bei der Sie iterieren und ausprobieren, erhalten Sie viele Inputs von verschiedenen Personen und möchten ihnen auch Ergebnisse liefern, können aber keine Zeit oder API-Credits dafür aufwenden. Sie können all ihre Anfragen und Hypothesen auf verschiedene OpenScience-Sitzungen verschieben, sicherstellen, dass sie rechtzeitig herauskommen, und sie erhalten ihre Ergebnisse viel günstiger, während Sie weiterhin Prioritäten setzen. Ihre stärker priorisierten Anfragen können Sie weiterhin über Standard- oder Prioritätsanfragen erledigen.Wie Sie sehen können, wurde es abgeschlossen, und wir konnten unsere Aufgabe mit nur dreißig zusätzlichen Sekunden erledigen – zum halben Preis. Es ist sinnvoll, in diesem Fall zehn Prozent oder weniger Latenz für eine fünfzigprozentige Kostenreduzierung in Kauf zu nehmen. Ich hoffe, es hat Ihnen gefallen und Sie werden es in Ihrer eigenen Version von OpenScience implementieren. Vielen Dank.

OpenCode

OpenCode ist ein Open-Source-Coding-Agent. Dieser Lauf fordert ihn auf, eine HTML-Seite zu erstellen, deren Visualisierungen Ableitungen erklären. Er läuft auf GPT-5.4 mit geringer Denkintensität und einem fünfsekündigen flex-Fenster. Der Clip läuft 3 Minuten und 34 Sekunden. flex-Tarife halbierten die Kosten. Der erste Token übertraf den Standardlauf um 37,5 Prozent, was vorkommt, aber wir versprechen es nie. Fügen Sie unseren OpenCode skill Ihrem Coding-Agenten hinzu und bitten Sie ihn dann, Ihr OpenCode-Checkout auf FlexInference zu verweisen. Das /flex-Plugin, das es konfiguriert, setzt start_within bei jeder Anfrage, da es den Request-Hook besitzt. Ein Tool ohne Hook benötigt kein Plugin. Setzen Sie die Frist stattdessen auf den Schlüssel. Für Claude Code ist die Installation ein Befehl:
Install the OpenCode skill
FlexInference Demo-Transkript: OpenCodeHallo, mein Name ist Adi. Ich bin der Gründer von FlexInference, und hier haben wir OpenCode, und es wurde geändert, um Modell-Anfragen über FlexInference zu routen. Sie können es tatsächlich selbst ändern: Es gibt einen Prompt unter dieser Demo, den Sie kopieren und in jedes agentenbasierte Codierungstool einfügen können, es auf Ihr OpenCode richten und sagen “Ich möchte FlexInference verwenden”, und es wird so eingerichtet, dass Sie dasselbe Tool haben, das wir hier haben. Es ist bereits auf GPT 5.4 eingestellt; wir werden es auf geringe Denkintensität, flex an, fünf Sekunden SLA einstellen, und ich werde die Demo starten und erklären, wie die Dinge laufen. Also werden wir sagen: Ich habe Schwierigkeiten, Ableitungen zu verstehen. Ich hätte gerne eine einfache HTML-Seite mit dynamischen Visualisierungen, die es mir erklärt.OpenCode wird dies erstellen, und auf der rechten Seite wird ein Vergleich laufen: die flex-Wettkampfrate, das sind die Kosten pro einer Million Tokens, dann die Standardrate, und dann die flex-Wettkampfzeit bis zum ersten Token und die Standardzeit bis zum ersten Token. Auf der Benutzeroberfläche, was Sie durch dieses TUI sehen, ist nur das, was flex antwortet. Im Backend senden wir zwei parallele Anfragen, dies ist also wirklich ein direkter Vergleich, und Sie können auch den Vergleich der Zeit bis zum ersten Token und der Kosten pro einer Million Tokens sehen.Der Sinn hinter FlexInference ist, dass wir Ihnen Zugang zu einem flex-Wettkampf geben, der innerhalb der von Ihnen festgelegten Zeit nach günstigerer Inferenz sucht, und wir haben ihn auf fünf Sekunden eingestellt; wenn das nicht erfüllt wird, eskalieren wir ihn. Wir können auch jede andere Art von Anfrage bearbeiten. In Slash-Modellen können Sie sehen, dass wir alle wichtigen Modelle unterstützen. Was uns auszeichnet, ist der flex-Wettkampf. Es gibt viele Fälle bei nicht latenzsensitiven Aufgaben, wo er großartig ist. Stellen Sie sich vor, Sie erhalten um 20 Uhr eine Seite. Es ist ein Sev 4 und keine große Sache. Sie denken, es wäre schön, wenn es implementiert werden könnte, aber es ist in Ordnung, wenn es zehn Minuten länger dauert. In diesen Fällen ist es großartig. Oder Fälle, in denen Sie Hintergrundprojekte haben, die Sie interessieren, aber Sie nicht alle Ihre API-Credits auf einmal ausgeben möchten: Sie können eine Reihe von Aufgaben in die Warteschlange stellen, sie werden langsam abgearbeitet, und Sie geben viel weniger aus.Jetzt hat es diese Ableitungs-HTML-Seite bereits erstellt, die wir öffnen können, aber was mich interessiert, ist der Vergleich. Die Zeit bis zum ersten Token war bei GPT 5.4 tatsächlich schneller, was von Zeit zu Zeit vorkommt. Wir garantieren nicht, dass es schneller als der Standard sein wird, aber es passiert, und es ist in unserem Fall großartig. Zweitens ist es günstiger: eine fünfzigprozentige Kostenreduzierung hier. Die Einrichtung von FlexInference innerhalb von OpenCode selbst bedeutet, dass Sie oder Ihre Entwickler viel mehr Zeit damit verbringen können, verschiedene Projekte und Ideen auszuprobieren, ohne sich Sorgen machen zu müssen, ob Ihre Credits im falschen Bereich verbraucht werden, denn jetzt haben Sie eine fünfzigprozentige Kostenreduzierung. Hoffentlich gefällt Ihnen das und Sie werden es auch nutzen. Vielen Dank.

OpenWork

OpenWork steuert einen OpenCode-Sidecar für sein Routing. Dieser Lauf fordert es auf, den Preis und die wöchentliche Veränderung von Netflix nachzuschlagen und dann die Bewegung zu erklären. Es läuft auf GPT-5.4 mit geringer Denkintensität und einem fünfsekündigen flex-Fenster. Der Clip läuft 2 Minuten und 57 Sekunden. flex-Tarife senkten die Kosten um 48,5 Prozent. Der erste Token kam acht Hundertstelsekunden später zurück. Fügen Sie unseren OpenWork skill Ihrem Coding-Agenten hinzu und bitten Sie ihn dann, Ihr OpenWork-Checkout auf FlexInference zu verweisen. Für Claude Code ist das ein Befehl:
Install the OpenWork skill
FlexInference Demo-Transkript: OpenWorkHallo zusammen, mein Name ist Adi. Ich bin der Gründer von FlexInference, und hier haben wir OpenWork, und es wurde geändert, sodass es FlexInference im Hintergrund für seinen Router verwendet. Es gibt einen Prompt unten, den Sie in jedes CLI- oder agentenbasierte Codierungstool einfügen können, das Sie verwenden, und es sollte Ihr OpenWork so ändern, dass es auch FlexInference verwendet. Beginnen wir die Demo und ich erkläre, wie es funktioniert. Alle diese Modelle werden über FlexInference unterstützt, aber nehmen wir an, ich möchte eine Aufgabe, die ein intelligentes Modell benötigt: GPT 5.4. Ich werde es auf geringe Denkintensität mit flex an und gebe ihm ein fünfsekündiges SLA, um günstigere Inferenz zu finden, andernfalls eskaliert es zu einer Standardanfrage. Also sagen wir: Ich möchte, dass Sie das Browser-Tool verwenden, um den aktuellen Preis für Netflix und die wöchentliche Veränderung zu finden, und mir sagen, warum es steigt oder fällt.Während dies geschieht, erkläre ich die Fälle, in denen dies wirklich hilfreich ist. Ja, Sie können FlexInference für Standardanfragen, Prioritätsanfragen, Auto-Anfragen verwenden, aber was uns unterscheidet, ist der flex-Wettlauf, gegeben ein von Ihnen festgelegtes SLA. Denken Sie an Fälle, in denen Sie morgens einen täglichen Bericht haben: Um 8 Uhr möchte ich einen Börsenbericht. Spielt es wirklich eine Rolle, ob der Bericht innerhalb einer Minute im Vergleich zu einer Minute und zehn Sekunden erstellt wurde? Meiner Meinung nach nicht wirklich. Wenn Sie bereit sind, dieses zehnsekündige oder fünfsekündige SLA aufzugeben, sind diese Fälle unglaublich, denn Sie sparen fünfzig Prozent kostenlos, nur indem Sie hier und da ein paar Sekunden opfern.Tatsächlich zeigt das Frontend in unserem Fall nur die flex-Antwort, aber im Backend senden wir für jede Anfrage in dieser Demo zwei parallele Anfragen – eine Standardanfrage und eine mit dem fünfsekündigen SLA – und vergleichen sie hinsichtlich der Kosten pro einer Million Tokens und der Zeit bis zum ersten Token. Dies sind wirklich gute Vergleichsmetriken, da die Antworten zwischen den beiden Anfragen unterschiedlich sein könnten, aber die Kosten pro einer Million Tokens sind fair, und die Zeit bis zum ersten Token ist ebenfalls fair.Was wir hier sehen, ist, dass Sie fünfzig Prozent gespart haben, und alles, was Sie wirklich getan haben, war, 0,08 zusätzliche Sekunden für eine Antwort zu benötigen. Sie können sich vorstellen, dass dies über 365 Tage und all die asynchronen Prozesse, die Sie möglicherweise im Hintergrund laufen haben und die nicht latenzsensitiv sind, aggregiert wirklich hilfreich ist. Und dann können Sie an die anderen Anwendungsfälle denken, die aufgrund der fünfzigprozentigen Kosteneinsparungen, die Sie erhalten, hilfreich werden. Das ist also eine der großartigen Möglichkeiten, wie Sie FlexInference nutzen können. Wir hoffen, es gefällt Ihnen, und kopieren Sie unbedingt den Prompt unten und verwenden Sie ihn für Ihr eigenes OpenWork. Vielen Dank.

Weitere Demos

Diese drei Clips sind älter als die Integrations-Skills, daher gibt es kein Tool zum Verbinden. Jeder führt denselben Zwei-Anfragen-Test für eine andere Aufgabe aus.

Gemini Bildklassifizierung

Zwei Gemini 2.5 Flash-Läufe sortieren einen Satz von fünfzig Farbbildern. Einer öffnet ein zehnsekündiges flex-Fenster. Der andere sendet default. Der Clip läuft 1 Minute und 46 Sekunden. flex-Tarife senkten die Kosten um 38,9 Prozent. Der erste Token kam 20,2 Prozent später zurück.
FlexInference Demo-Transkript: Gemini BildklassifizierungHallo zusammen, mein Name ist Adi. Ich bin der Gründer von FlexInference, und hier haben wir eine Bildklassifizierungs-Demo. Ich werde diese starten und dann erklären, was vor sich geht.Wir haben zwei parallele Prozesse, die beide Gemini 2.5 Flash ausführen und einen Datensatz von fünfzig Bildern verschiedener Farben klassifizieren werden, um zu identifizieren, welche Farbe jedes einzelne hat. Wir versuchen nicht zu vergleichen, welche Seite besser klassifiziert; es ist dasselbe Modell auf beiden Seiten, und beide verwenden das SDK und den Router von FlexInference. Die linke Seite hat ein zehnsekündiges SLA erhalten, um über den Parameter start_within günstigere Inferenz zu finden. Die rechte Seite verwendet ebenfalls das FlexInference SDK und den Router, aber ihr start_within-Parameter ist auf default eingestellt, was eine sofortige Antwort anfordert. Was wir zeigen wollen, ist, dass Sie bei einem kleinen Latenzbudget, das Sie selbst festlegen können, in diesem Fall zehn Sekunden, dramatisch niedrigere Kosten erhalten können, etwa fünfzig Prozent. Ich werde vorspulen, bis dieser Datensatz klassifiziert und abgeschlossen ist, und dann können wir uns die Kompromisse ansehen.Jetzt sind wir zurück, und wir können sehen, dass fünfzig von fünfzig Bildern klassifiziert wurden. Die Gesamtkosten betrugen etwa die Hälfte: 0,0183 imVergleichzu0,0304im Vergleich zu 0,0304. Die Kosten pro einer Million Tokens, Input und Output zusammen, betragen 0,58 gegenu¨ber0,95gegenüber 0,95, was ebenfalls etwa die Hälfte ist. Die insgesamt aufgegebene Latenz betrug etwa siebenundzwanzig Sekunden, ungefähr fünfzehn Prozent. Im Wesentlichen konnten Sie bei einem kleinen Latenzbudget dramatisch niedrigere Kosten erzielen. Vielen Dank.

OpenAI Deep Research

Zwei Forschungsagenten entwerfen einen Bericht über öffentliche CPU-Unternehmen. Einer öffnet ein zehnsekündiges flex-Fenster, und der andere sendet default. Der Clip läuft 2 Minuten und 35 Sekunden. flex-Tarife senkten die Kosten um 44,8 Prozent bei GPT-5 Mini. Der erste Token kam 30,1 Prozent früher zurück.
FlexInference Demo-Transkript: OpenAI Deep ResearchHallo zusammen, mein Name ist Adi. Ich bin der Gründer von FlexInference, und hier ist eine Demo für Deep Research. Ich werde die Demo starten, während ich erkläre, wie sie funktioniert. Wir haben zwei Agenten, die als parallele Prozesse laufen, beide verwenden das FlexInference SDK und den Router, die versuchen werden, öffentliche CPU-Unternehmen mit einem Vorteil im Modelltraining und der Inferenz zu finden. Das Thema selbst ist nicht so relevant: Jeder Agent erstellt einige Fragen, führt einige Websuchen durch und erstellt einen Bericht. Was wir wirklich betrachten, ist, dass der linke Agent ein zehnsekündiges SLA erhalten hat, um günstigere Inferenz zu finden, und wenn er dies innerhalb dieser Zeit nicht kann, eskaliert er zu einer Standardanfrage und erfüllt die Anfrage trotzdem. Der start_within-Parameter der rechten Seite ist auf default anstatt auf zehn Sekunden eingestellt, was eine sofortige Antwort anfordert. Was wir versuchen zu sehen, ist, dass die linke Seite, bei einem kleinen Latenzbudget von bis zu zehn Sekunden, dramatisch niedrigere Kosten hat, etwa fünfzig Prozent niedriger. Das macht FlexInference viel günstiger und erschwinglicher für Aufgaben ohne sehr geringe Latenzanforderungen. Ich werde jetzt bis zum Ende vorspulen, damit wir die Kompromisse vergleichen können.Jetzt sind wir zurück. Beide Berichte wurden erstellt; die Agenten führten Websuchen und eine tertiäre Planung durch. Die linke Seite, Flex, war nicht nur günstiger, sondern auch schneller fertig, was manchmal vorkommt. Wir garantieren nicht, dass die Latenz geringer sein wird; wir garantieren, dass wir innerhalb des von Ihnen festgelegten SLA entweder günstigere Inferenz finden oder auf eine Standardanfrage eskalieren. Hier war die linke Seite etwa sechzig Sekunden schneller fertig und die Kosten pro einer Million Tokens waren bei GPT-5 Mini etwa sechsundzwanzig Cent niedriger, fast die Hälfte der Kosten. Wir verwenden die Kosten pro einer Million Tokens, weil die beiden Seiten eine unterschiedliche Anzahl von Tokens und Zitaten verwendeten, daher ist dies ein genauerer Vergleich. Die Gesamtkosten beliefen sich auf eine Differenz von etwa 0,0265 $. Vielen Dank.

OpenAI Browser-Agent

Zwei GPT-5 Browser-Agenten kaufen ein T-Shirt in einem E-Commerce-Klon. Einer öffnet ein zehnsekündiges flex-Fenster, und der andere sendet default. Der Clip läuft 1 Minute und 59 Sekunden. flex-Tarife senkten die Kosten um 51,5 Prozent. Der erste Token kam 9,7 Prozent später zurück.
FlexInference Demo-Transkript: OpenAI Browser-AgentHallo zusammen, mein Name ist Adi. Ich bin der Gründer von FlexInference, und hier haben wir eine Browser-Agent-Demo. Ich werde diese Demo starten, während ich erkläre, wie sie funktioniert. Im Backend haben wir einen E-Commerce-Klon, und unsere Agenten werden versuchen, die Aufgabe zu erfüllen, ein Medusa-T-Shirt in Größe M, Farbe Schwarz, zu kaufen. Auf der linken Seite haben wir GPT-5, das über das SDK und den Router von FlexInference geleitet wird und zehn Sekunden Zeit erhält, um günstigere Inferenz zu finden; wenn es dies tut, erfüllt es die Anfrage auf diese Weise, andernfalls eskaliert es zu einer Standardanfrage. Auf der rechten Seite haben wir ebenfalls GPT-5, das das FlexInference SDK und den Router verwendet, aber der start_within-Parameter ist auf default eingestellt, sodass seine Anfragen sofort erfüllt werden. Das Ziel ist zu zeigen, dass Sie auf der linken Seite dieselbe Aufgabe erledigen können, indem Sie ein kleines Latenzbudget opfern, für dramatisch niedrigere Gesamtkosten und Kosten pro einer Million Tokens. Wir betrachten die Gesamtkosten und die Kosten pro einer Million Tokens, da die Schrittzahlen variieren können, da diese Aufgabe nicht deterministisch ist. Dies sind zwei parallele Prozesse, und das Input-Prompt-Caching ist deaktiviert. Jetzt werde ich bis zum Ende vorspulen, damit wir Kosten und Latenz vergleichen und die Kompromisse sehen können.Wenn wir darauf zurückkommen, stellen wir fest, dass wir durch das Opfern von etwa fünfzehn zusätzlichen Sekunden, also etwa zehn Prozent mehr Latenz, die Gesamtkosten um etwa die Hälfte und die Kosten pro einer Million Tokens um etwas mehr senken konnten. Es gibt einen Unterschied in der Schrittzahl, aber im Allgemeinen ist dies das, was Sie von FlexInference sehen: dramatisch niedrigere Kosten für einen leichten Anstieg der Latenz. Vielen Dank.