Skip to main content
Chaque clip ci-dessous achemine une charge de travail via notre système. Chaque requête est déclenchée deux fois sur le même modèle. Un appel ouvre une fenêtre flex avec start_within. L’autre envoie default. La vidéo affiche la réponse flex. Nous comparons les deux exécutions sur le coût par million de tokens et sur le temps jusqu’au premier token. Ce sont les mesures équitables lorsque deux exécutions peuvent renvoyer des tokens différents. Nous promettons le résultat le moins cher, pas le plus rapide. Dans la fenêtre que vous définissez, nous obtenons soit le niveau tarifaire économique, soit nous passons au niveau standard. Ainsi, une exécution est facturée à un niveau et n’attend jamais au-delà de votre délai. Envoyez votre première requête avec le guide de démarrage rapide. Le routage avec délai couvre la fenêtre et le passage au niveau standard.

Démos d’intégration

Chaque outil ci-dessous est un agent open-source standard, modifié pour acheminer ses requêtes via notre système. Chacun est désormais livré sous forme de skill. Ajoutez le skill à votre agent de codage et demandez l’intégration dans votre propre environnement. Le skill couvre l’entrée du fournisseur, le délai flex et la commande de session /flex, le tout via la configuration.

OpenScience

OpenScience est une alternative open-source à Claude Science. Cette exécution lui demande de trouver des articles de recherche sur l’optimisation du routage des camions. Elle s’exécute sur GPT-5.6 Terra avec une faible réflexion et une fenêtre flex de cinq secondes. Le clip dure 4 minutes et 1 seconde. Les tarifs flex ont couvert l’ensemble de la tâche, ce qui a réduit le coût de moitié. Le premier token est revenu 9,3 % plus tard, et la tâche s’est terminée environ trente secondes après. Ajoutez notre skill OpenScience à votre agent de codage, puis demandez-lui de diriger votre environnement OpenScience vers FlexInference. Pour Claude Code, c’est une seule commande :
Install the OpenScience skill
Transcription de la démo FlexInference : OpenScienceBonjour à tous, je m’appelle Adi. Je suis le fondateur de FlexInference, et voici OpenScience, une alternative open-source à Claude Science. Il a été modifié pour acheminer toutes ses requêtes via FlexInference, et vous pouvez faire en sorte que votre OpenScience fasse de même : nous avons ajouté une invite juste en dessous de cette démo que vous pouvez copier-coller dans n’importe quel outil de codage agentique que vous utilisez, et cela mettra à jour votre OpenScience pour qu’il utilise également FlexInference. Pour cette démo, nous utilisons GPT 5.6 Terra. Je vais régler la réflexion sur faible, activer une course flex pour qu’il recherche une inférence moins chère, et lui donner cinq secondes pour trouver une inférence moins chère, sinon passer à une requête par défaut. Nous allons examiner le coût par million de tokens et le temps jusqu’au premier token, car en arrière-plan, nous lançons deux requêtes parallèles chaque fois que je pose une question. C’est juste pour que nous puissions comparer, et comme les résultats pourraient être non déterministes, ce qui nous intéresse vraiment, c’est quand le premier token est revenu et combien chaque côté coûte par million de tokens. Je tiens à dire que FlexInference prend en charge tous les modèles Claude, tous les modèles Gemini et tous les modèles GPT que vous voyez ici.Maintenant, demandons-lui : Je travaille dans la logistique et je possède trois camions. Je veux que mon routage soit plus efficace, pour livrer plus rapidement et à moindre coût. Trouvez-moi des articles de recherche pertinents.Pendant ce temps, nous avons deux processus parallèles en cours d’exécution en arrière-plan pour comparer. Ce que nous garantissons, c’est que dans le temps que vous avez défini, nous vous trouverons une inférence moins chère ou nous passerons à une requête par défaut normale ; dans ce cas, nous comparons avec le fait de toujours demander des requêtes par défaut. Nous constatons parfois que nous sommes en quelque sorte plus rapides, et évidemment moins chers, mais nous ne garantissons pas la partie plus rapide. Nous garantissons la partie moins chère. Vous pouvez évidemment faire des requêtes par défaut via nous et obtenir la vitesse que vous souhaitez, ainsi que des requêtes prioritaires.Pourquoi voudriez-vous un SLA pour une tâche de type hypothèse scientifique et de processus répétitif ? Ayant travaillé dans la recherche, il y a souvent des cas où vous avez dix hypothèses et une quantité limitée de crédits API, de temps de développement ou simplement de temps avant une échéance. Vous n’essayez donc que les trois premières et mettez de côté les sept dernières. Finalement, les trois premières ne donnent pas les résultats souhaités, vous commencez à parcourir le reste, vous arrivez à la huitième de cette liste, et vous vous dites, j’aurais aimé essayer cela plus tôt - cela n’avait tout simplement pas de sens à ce moment-là. De cette façon, les hypothèses que vous envisagez et qui ne semblent pas être un bon retour sur investissement peuvent s’exécuter à moindre coût en arrière-plan. Même si cela prend un peu plus de temps, ce n’est pas grave, car vous n’alliez de toute façon pas les prioriser - mais maintenant vous obtiendrez les résultats plus tôt. Et lorsque vous faites de la recherche, ou toute tâche ouverte où vous itérez et faites des essais et erreurs, vous obtenez les contributions de plusieurs personnes et vous voulez également leur donner des résultats, mais vous ne pouvez pas consacrer de temps ou de crédits API. Vous pouvez pousser toutes leurs requêtes et hypothèses sur différentes sessions OpenScience, vous assurer que cela sortira à temps, et ils obtiendront leurs résultats beaucoup moins chers pendant que vous continuez à prioriser. Vos requêtes plus prioritaires, vous pouvez continuer à les faire via des requêtes par défaut ou prioritaires.Comme vous pouvez le voir, c’est terminé, et nous avons pu accomplir notre tâche avec seulement trente secondes supplémentaires - à cinquante pour cent du prix. Il est logique de sacrifier dix pour cent ou moins de latence, dans ce cas, pour une réduction de cinquante pour cent des coûts. J’espère que vous avez aimé et que vous l’implémenterez dans votre propre version d’OpenScience. Merci.

OpenCode

OpenCode est un agent de codage open-source. Cette exécution lui demande de construire une page HTML dont les visualisations expliquent les dérivées. Elle s’exécute sur GPT-5.4 avec une faible réflexion et une fenêtre flex de cinq secondes. Le clip dure 3 minutes et 34 secondes. Les tarifs flex ont réduit le coût de moitié. Le premier token a battu l’exécution par défaut de 37,5 %, ce qui arrive mais nous ne le promettons jamais. Ajoutez notre skill OpenCode à votre agent de codage, puis demandez-lui de diriger votre environnement OpenCode vers FlexInference. Le plugin /flex qu’il configure définit start_within sur chaque requête car il possède le hook de requête. Un outil sans hook n’a pas besoin de plugin. Placez plutôt le délai sur la clé. Pour Claude Code, l’installation se fait en une seule commande :
Install the OpenCode skill
Transcription de la démo FlexInference : OpenCodeBonjour, je m’appelle Adi. Je suis le fondateur de FlexInference, et voici OpenCode, qui a été modifié pour acheminer les requêtes de modèle via FlexInference. Vous pouvez en fait le modifier vous-même : il y a une invite sous cette démo que vous pouvez copier-coller dans n’importe quel outil de codage agentique, le pointer vers votre OpenCode, et dire “Je veux commencer à utiliser FlexInference”, et cela fera en sorte que vous puissiez avoir le même outil que nous avons ici. Il est déjà réglé sur GPT 5.4 ; nous le réglerons sur une réflexion faible, flex activé, SLA de cinq secondes, et je vais commencer la démo et expliquer comment les choses se passent. Nous allons donc dire : J’ai du mal à comprendre les dérivées. J’aimerais une page HTML simple avec des visualisations dynamiques qui me l’expliquent.OpenCode va créer cela, et sur le côté droit, une comparaison sera en cours : le taux de course flex, qui est le coût par million de tokens, puis le taux par défaut, et ensuite le temps de course flex jusqu’au premier token et le temps par défaut jusqu’au premier token. Sur le front-end, ce que vous voyez via cette TUI est juste ce que flex répond. En arrière-plan, nous envoyons deux requêtes parallèles, c’est donc vraiment une comparaison équitable, et vous pouvez également voir la comparaison du temps jusqu’au premier token et du coût par million de tokens.L’objectif de FlexInference est de vous donner accès à une course flex qui recherche une inférence moins chère dans le temps que vous avez défini, et nous l’avons réglé sur cinq secondes ; si cela n’est pas rempli, nous l’escaladons. Nous pouvons également effectuer tous les autres types de requêtes. Dans les modèles slash, vous pouvez voir que nous prenons en charge tous les principaux modèles. Ce qui nous distingue, c’est la course flex. Il y a beaucoup de cas avec des tâches non sensibles à la latence où c’est excellent. Imaginez que vous recevez une page à 20h. C’est un sev 4 et ce n’est pas la plus grande affaire. Vous pensez que ce serait bien si cela pouvait être implémenté, mais vous n’êtes pas gêné si cela prend dix minutes de plus. Dans ces cas, c’est excellent. Ou des cas où vous avez des projets en arrière-plan qui vous intéressent, mais vous ne voulez pas dépenser tous vos crédits API en une seule fois : vous pouvez mettre en file d’attente un tas de tâches, elles s’exécutent lentement, et vous dépensez beaucoup moins.Maintenant, cette page HTML de dérivées a déjà été créée, que nous pouvons ouvrir, mais ce qui m’intéresse, c’est la comparaison. Le temps jusqu’au premier token a en fait été plus rapide sur GPT 5.4, ce qui arrive de temps en temps. Nous ne garantissons pas qu’il sera plus rapide que par défaut, mais cela arrive, et c’est excellent dans notre cas. Deuxièmement, c’est moins cher : une réduction de cinquante pour cent des coûts ici. La configuration de FlexInference au sein d’OpenCode signifie que vous ou vos développeurs pouvez passer beaucoup plus de temps à essayer différents projets et idées sans vous soucier de savoir si vos crédits sont utilisés dans le mauvais domaine, car vous bénéficiez maintenant d’une réduction de cinquante pour cent des coûts. J’espère que vous apprécierez cela et que vous finirez par l’utiliser également. Merci.

OpenWork

OpenWork utilise un sidecar OpenCode pour son routage. Cette exécution lui demande de rechercher le prix de Netflix et sa variation hebdomadaire, puis d’expliquer le mouvement. Elle s’exécute sur GPT-5.4 avec une faible réflexion et une fenêtre flex de cinq secondes. Le clip dure 2 minutes et 57 secondes. Les tarifs flex ont réduit le coût de 48,5 %. Le premier token est revenu huit centièmes de seconde plus tard. Ajoutez notre skill OpenWork à votre agent de codage, puis demandez-lui de diriger votre environnement OpenWork vers FlexInference. Pour Claude Code, c’est une seule commande :
Install the OpenWork skill
Transcription de la démo FlexInference : OpenWorkBonjour à tous, je m’appelle Adi. Je suis le fondateur de FlexInference, et voici OpenWork, qui a été modifié pour utiliser FlexInference en arrière-plan pour son routeur. Il y a une invite ci-dessous que vous pouvez coller dans n’importe quel outil de codage CLI ou agentique que vous utilisez, et cela devrait modifier votre OpenWork pour qu’il commence également à utiliser FlexInference. Commençons la démo et je vous expliquerai comment cela fonctionne. Tous ces modèles sont pris en charge par FlexInference, mais disons que je veux une tâche qui nécessite un modèle intelligent : GPT 5.4. Je le réglerai sur une réflexion faible avec flex activé et lui donnerai un SLA de cinq secondes pour trouver une inférence moins chère, sinon il passera à une requête par défaut. Disons donc : Je veux que vous utilisiez l’outil de navigation pour trouver le prix actuel de Netflix et la variation hebdomadaire, et que vous me disiez pourquoi il augmente ou diminue.Pendant ce temps, je vais expliquer les cas où cela est vraiment utile. Oui, vous pouvez utiliser FlexInference pour les requêtes par défaut, les requêtes prioritaires, les requêtes automatiques, mais ce qui nous différencie, c’est la course flex, étant donné un SLA que vous définissez. Pensez aux cas où vous avez un briefing quotidien le matin : à 8h, je veux un briefing sur le marché boursier. Est-ce que cela importe vraiment s’il a créé le briefing en une minute par rapport à une minute et dix secondes ? À mon avis, pas vraiment. Si vous êtes prêt à renoncer à ce SLA de dix ou cinq secondes, ces cas sont incroyables, car vous allez économiser cinquante pour cent gratuitement, juste en donnant quelques secondes ici et là.En fait, dans notre cas, le front-end n’affiche que la réponse flex, mais en arrière-plan, pour chaque requête de cette démo, nous envoyons deux requêtes parallèles - une par défaut et une avec le SLA de cinq secondes - et nous les comparons sur le coût par million de tokens et le temps jusqu’au premier token. Ce sont de très bonnes métriques de comparaison, car les réponses entre les deux requêtes pourraient être différentes, mais le coût par million de tokens est juste, et le temps jusqu’au premier token est également juste.Ce que nous voyons ici, c’est que vous avez économisé cinquante pour cent, et tout ce que vous avez vraiment fait, c’est passer 0,08 seconde supplémentaire à obtenir une réponse. Vous pouvez imaginer que, agrégé sur 365 jours et tous les processus asynchrones que vous pourriez avoir en arrière-plan et qui ne sont pas sensibles à la latence, c’est vraiment utile. Et puis vous pouvez penser aux autres cas d’utilisation qui commencent à être utiles grâce aux cinquante pour cent d’économies que vous réalisez. C’est donc l’une des excellentes façons d’utiliser FlexInference. Nous espérons que vous l’aimerez, et n’oubliez pas de copier l’invite ci-dessous et de l’utiliser sur votre propre OpenWork. Merci.

Plus de démos

Ces trois clips sont antérieurs aux skills d’intégration, il n’y a donc aucun outil à connecter. Chacun exécute le même test à deux requêtes sur une tâche différente.

Classification d’images Gemini

Deux exécutions Gemini 2.5 Flash trient un ensemble de cinquante images couleur. L’une ouvre une fenêtre flex de dix secondes. L’autre envoie default. Le clip dure 1 minute et 46 secondes. Les tarifs flex ont réduit le coût de 38,9 %. Le premier token est revenu 20,2 % plus tard.
Transcription de la démo FlexInference : Classification d’images GeminiBonjour à tous, je m’appelle Adi. Je suis le fondateur de FlexInference, et voici une démo de classification d’images. Je vais la lancer et ensuite expliquer ce qui se passe.Nous avons deux processus parallèles, tous deux exécutant Gemini 2.5 Flash, qui vont classer un ensemble de cinquante images de différentes couleurs, en identifiant la couleur de chacune. Nous n’essayons pas de comparer quel côté classifie le mieux ; c’est le même modèle des deux côtés, et les deux utilisent le SDK et le routeur de FlexInference. Le côté gauche a reçu un SLA de dix secondes pour trouver une inférence moins chère via le paramètre start_within. Le côté droit utilise également le SDK et le routeur de FlexInference, mais son paramètre start_within est défini sur default, ce qui demande une réponse instantanée. Ce que nous essayons de montrer, c’est que, étant donné un petit budget de latence que vous pouvez définir, dans ce cas dix secondes, vous pouvez obtenir des coûts considérablement plus bas, environ cinquante pour cent. Je vais avancer rapidement jusqu’à ce que cet ensemble de données ait été classifié et terminé, puis nous pourrons examiner les compromis.Maintenant que nous sommes de retour, nous pouvons voir que cinquante images sur cinquante ont été classifiées. Les coûts totaux étaient environ de moitié : 0,0183 contre0,0304contre 0,0304. Le coût par million de tokens, entrée et sortie confondues, est de 0,58 contre0,95contre 0,95, ce qui est également environ la moitié. La latence totale sacrifiée était d’environ vingt-sept secondes, soit environ quinze pour cent. Essentiellement, étant donné un petit budget de latence, vous avez pu obtenir des coûts considérablement plus bas. Merci.

Recherche approfondie OpenAI

Deux agents de recherche rédigent un rapport sur les entreprises publiques de CPU. L’un ouvre une fenêtre flex de dix secondes, et l’autre envoie default. Le clip dure 2 minutes et 35 secondes. Les tarifs flex ont réduit le coût de 44,8 % sur GPT-5 Mini. Le premier token est revenu 30,1 % plus tôt.
Transcription de la démo FlexInference : Recherche approfondie OpenAIBonjour à tous, je m’appelle Adi. Je suis le fondateur de FlexInference, et voici une démo pour la recherche approfondie. Je vais lancer la démo pendant que j’explique comment cela fonctionne. Nous avons deux agents fonctionnant en processus parallèles, tous deux utilisant le SDK et le routeur de FlexInference, qui vont essayer de trouver des entreprises publiques de CPU ayant un avantage dans l’entraînement et l’inférence de modèles. Le sujet lui-même n’est pas très pertinent : chaque agent crée des questions, effectue des recherches web et rédige un rapport. Ce que nous examinons vraiment, c’est que l’agent de gauche a reçu un SLA de dix secondes pour trouver une inférence moins chère, et s’il ne peut pas le faire dans ce délai, il passe à une requête par défaut et exécute quand même la requête. Le paramètre start_within du côté droit est défini sur default au lieu de dix secondes, ce qui demande une réponse instantanée. Ce que nous essayons de montrer, c’est que le côté gauche, étant donné un petit budget de latence allant jusqu’à dix secondes, a des coûts considérablement plus bas, environ cinquante pour cent de moins. Cela rend FlexInference beaucoup moins cher et beaucoup plus abordable pour les tâches sans exigences de latence très faibles. Je vais maintenant avancer rapidement jusqu’à la fin pour que nous puissions comparer les compromis.Nous sommes de retour. Les deux rapports ont été rédigés ; les agents ont effectué des recherches web et une planification tertiaire. Le côté gauche, Flex, était non seulement moins cher mais a également terminé plus rapidement, ce qui arrive parfois. Nous ne garantissons pas que la latence sera plus faible ; nous garantissons que, dans le cadre du SLA que vous avez défini, nous vous trouverons une inférence moins chère ou nous passerons à une requête par défaut. Ici, le côté gauche a terminé environ soixante secondes plus rapidement, et le coût par million de tokens était environ vingt-six cents de moins sur GPT-5 Mini, soit près de la moitié du coût. Nous utilisons le coût par million de tokens car les deux côtés ont utilisé un nombre différent de tokens et de citations, c’est donc une comparaison plus précise. Le coût total s’est élevé à une différence d’environ 0,0265 $. Merci.

Agent de navigation OpenAI

Deux agents de navigation GPT-5 achètent un T-shirt sur un clone de site e-commerce. L’un ouvre une fenêtre flex de dix secondes, et l’autre envoie default. Le clip dure 1 minute et 59 secondes. Les tarifs flex ont réduit le coût de 51,5 %. Le premier token est revenu 9,7 % plus tard.
Transcription de la démo FlexInference : Agent de navigation OpenAIBonjour à tous, je m’appelle Adi. Je suis le fondateur de FlexInference, et voici une démo d’agent de navigation. Je vais lancer cette démo pendant que j’explique comment cela fonctionne. En arrière-plan, nous avons un clone de site e-commerce, et nos agents vont essayer d’accomplir la tâche d’acheter un T-shirt Méduse de taille M, couleur noire. Sur le côté gauche, nous avons GPT-5 acheminé via le SDK et le routeur de FlexInference, avec dix secondes pour trouver une inférence moins chère ; si c’est le cas, il exécute la requête de cette manière, sinon il passe à une requête par défaut. Sur le côté droit, nous avons également GPT-5 utilisant le SDK et le routeur de FlexInference, mais le paramètre start_within est défini sur default, de sorte que ses requêtes sont exécutées instantanément. L’objectif est de montrer que sur le côté gauche, vous pouvez accomplir la même tâche, en sacrifiant un petit budget de latence, pour un coût total et un coût par million de tokens considérablement inférieurs. Nous examinons le coût total et le coût par million de tokens car le nombre d’étapes peut varier, cette tâche étant non déterministe. Ce sont deux processus parallèles, et la mise en cache des invites d’entrée est désactivée. Je vais maintenant avancer rapidement jusqu’à la fin pour que nous puissions comparer les coûts et la latence et voir les compromis.En revenant à cela, ce que nous remarquons, c’est qu’en sacrifiant environ quinze secondes supplémentaires, soit environ dix pour cent de latence en plus, nous avons pu réduire les coûts totaux d’environ la moitié, et le coût par million de tokens d’un peu plus. Il y a une différence dans le nombre d’étapes, mais de manière générale, c’est ce que vous obtenez de FlexInference : des coûts considérablement réduits pour une légère augmentation de la latence. Merci.