start_within. A outra envia default. O vídeo mostra a resposta flex.
Comparamos as duas execuções em custo por um milhão de tokens e em tempo para o primeiro token. Essas são as medidas justas quando duas execuções podem retornar tokens diferentes.
Prometemos o resultado mais barato, não o mais rápido. Dentro da janela que você define, obtemos o nível mais barato ou subimos para o padrão. Assim, uma execução é cobrada em um nível e nunca espera além do seu prazo.
Envie sua primeira requisição com o quickstart. O deadline routing cobre a janela e a mudança para o padrão.
Demonstrações de integração
Cada ferramenta abaixo é um agente open-source padrão, modificado para rotear através de nós. Cada um agora é enviado como uma skill. Adicione a skill ao seu agente de codificação e peça a integração em seu próprio checkout. A skill cobre a entrada do provedor, o prazo flex e o comando de sessão/flex, tudo através de configuração.
OpenScience
OpenScience é uma alternativa open-source ao Claude Science. Esta execução pede para encontrar artigos de pesquisa sobre roteamento de caminhões mais eficiente. Ela roda em GPT-5.6 Terra com baixo “thinking” e uma janela flex de cinco segundos. O clipe dura 4 minutos e 1 segundo. As taxas flex cobriram toda a tarefa, então custou a metade. O primeiro token retornou 9,3% mais tarde, e a tarefa terminou cerca de trinta segundos depois. Adicione nossa skill OpenScience ao seu agente de codificação e, em seguida, peça para ele apontar seu checkout OpenScience para FlexInference. Para Claude Code, é um comando:Install the OpenScience skill
Transcrição
Transcrição
Transcrição da demonstração FlexInference: OpenScienceOlá a todos, meu nome é Adi. Sou o fundador da FlexInference, e aqui temos o OpenScience, uma alternativa open-source ao Claude Science. Ele foi modificado para rotear todas as suas requisições através da FlexInference, e você pode fazer com que seu OpenScience faça o mesmo: adicionamos um prompt logo abaixo desta demonstração que você pode copiar e colar em qualquer ferramenta de codificação agentic que você use, e ele atualizará seu OpenScience para também usar a FlexInference. Para esta demonstração, estamos usando o GPT 5.6 Terra. Vou definir o “thinking” como baixo, definir uma “flex race” para que ele procure por inferência mais barata, e dar a ele cinco segundos para encontrar inferência mais barata, caso contrário, ele fará um upgrade para uma requisição default. Vamos analisar o custo por um milhão de tokens e o tempo para o primeiro token, porque em segundo plano, disparamos duas requisições paralelas toda vez que faço uma pergunta. Isso é apenas para que possamos comparar, e como os resultados podem ser não-determinísticos, o que realmente nos importa é quando o primeiro token retornou e quanto cada lado custa por um milhão de tokens. Gostaria de dizer que a FlexInference suporta todos os modelos Claude, todos os modelos Gemini e todos os modelos GPT que você vê aqui.Agora vamos perguntar: Eu trabalho em logística e possuo três caminhões. Quero que meu roteamento seja mais eficiente, para entregar mais rápido e mais barato. Encontre-me artigos de pesquisa relevantes.Enquanto isso acontece, temos dois processos paralelos rodando em segundo plano para comparar. O que garantimos é que, dentro do tempo que você definir, encontraremos inferência mais barata ou escalaremos para uma requisição default normal; neste caso, estamos comparando com sempre pedir requisições default. Às vezes, vemos que somos de alguma forma mais rápidos, e obviamente mais baratos, mas não garantimos a parte mais rápida. Garantimos a parte mais barata. Você pode obviamente fazer requisições default através de nós e obter a velocidade que deseja, juntamente com requisições prioritárias.Por que você gostaria de um SLA para uma tarefa de hipótese e processo repetitivo no estilo científico? Tendo trabalhado em pesquisa, muitas vezes há casos em que você tem dez hipóteses e uma quantidade limitada de créditos de API, tempo de desenvolvimento ou apenas tempo antes de um prazo. Então você tenta apenas as três primeiras e deixa as sete últimas de lado. Eventualmente, as três primeiras falham em entregar os resultados que você deseja, você começa a passar pelo resto, chega à oitava da lista e pensa: “Eu gostaria de ter tentado isso antes - simplesmente não fazia sentido naquele momento”. Dessa forma, as hipóteses que você está considerando e que não parecem um bom retorno sobre o investimento podem ser executadas de forma mais barata em segundo plano. Mesmo que demore um pouco mais, tudo bem, porque você não ia priorizá-las de qualquer maneira - mas agora você obterá os resultados mais cedo. E quando você está fazendo pesquisa, ou qualquer tarefa aberta onde você itera e faz tentativa e erro, você está recebendo as contribuições de várias pessoas e quer dar-lhes resultados também, mas não pode dedicar tempo ou créditos de API. Você pode empurrar todas as suas requisições e hipóteses para diferentes sessões OpenScience, garantir que saiam em tempo suficiente, e eles obterão seus resultados muito mais baratos enquanto você continua a priorizar. Suas requisições mais priorizadas você pode continuar fazendo através de requisições default ou prioritárias.Como você pode ver, ele foi concluído, e conseguimos completar nossa tarefa com apenas trinta segundos extras - pela metade do preço. Faz sentido abrir mão de dez por cento ou menos de latência, neste caso, para uma redução de cinquenta por cento no custo. Espero que tenham gostado e o implementem em sua própria versão do OpenScience. Obrigado.
OpenCode
OpenCode é um agente de codificação open-source. Esta execução pede para construir uma página HTML cujas visualizações expliquem derivadas. Ele roda em GPT-5.4 com baixo “thinking” e uma janela flex de cinco segundos. O clipe dura 3 minutos e 34 segundos. As taxas flex reduziram o custo pela metade. O primeiro token superou a execução default em 37,5%, o que acontece, mas nunca prometemos. Adicione nossa skill OpenCode ao seu agente de codificação e, em seguida, peça para ele apontar seu checkout OpenCode para FlexInference. O plugin/flex que ele configura define start_within em cada requisição porque ele possui o hook de requisição. Uma ferramenta sem hook não precisa de plugin. Em vez disso, coloque o prazo na chave. Para Claude Code, a instalação é um comando:
Install the OpenCode skill
Transcrição
Transcrição
Transcrição da demonstração FlexInference: OpenCodeOlá, meu nome é Adi. Sou o fundador da FlexInference, e aqui temos o OpenCode, que foi modificado para rotear requisições de modelo através da FlexInference. Você pode realmente modificá-lo você mesmo: há um prompt abaixo desta demonstração que você pode copiar e colar em qualquer ferramenta de codificação agentic, apontá-lo para o seu OpenCode e dizer “Quero começar a usar a FlexInference”, e ele fará com que você tenha a mesma ferramenta que temos aqui. Já está configurado para GPT 5.4; vamos configurá-lo para “low thinking”, “flex on”, SLA de cinco segundos, e vou iniciar a demonstração e explicar como as coisas estão indo. Então, vamos dizer: Estou tendo dificuldade em entender derivadas. Gostaria de uma página HTML simples com visualizações dinâmicas que me expliquem.OpenCode vai criar isso, e no lado direito uma comparação estará sendo executada: a taxa de “flex race”, que é o custo por um milhão de tokens, depois a taxa default, e então o tempo para o primeiro token da “flex race” e o tempo para o primeiro token default. No front-end, o que você está vendo através desta TUI é apenas o que o flex está respondendo. No back-end, estamos enviando duas requisições paralelas, então esta é realmente uma comparação “apples-to-apples”, e você pode ver a comparação de tempo para o primeiro token e custo por um milhão de tokens também.O objetivo da FlexInference é que nós lhe damos acesso a uma “flex race” que busca inferência mais barata dentro do tempo que você define, e nós a definimos para cinco segundos; se isso não for cumprido, nós a escalamos. Podemos fazer todos os outros tipos de requisições também. Em slash models, você pode ver que suportamos todos os principais modelos. O que nos diferencia é a “flex race”. Há muitos casos com tarefas não sensíveis à latência onde ela é ótima. Imagine que você recebe uma página às 20h. É um sev 4 e não é o maior problema. Você acha que seria bom se pudesse ser implementado, mas não se importa se demorar dez minutos a mais. Nesses casos, é ótimo. Ou casos em que você tem projetos de fundo nos quais está interessado, mas não quer gastar todos os seus créditos de API de uma vez: você pode enfileirar um monte de tarefas, elas são processadas lentamente, e você gasta muito menos.Agora ele já criou esta página HTML de derivadas, que podemos abrir, mas o que me interessa é a comparação. O tempo para o primeiro token foi realmente mais rápido no GPT 5.4, o que acontece de vez em quando. Não garantimos que será mais rápido que o default, mas acontece, e é ótimo no nosso caso. Segundo, é mais barato: uma redução de cinquenta por cento no custo aqui. Configurar a FlexInference dentro do próprio OpenCode significa que você ou seus desenvolvedores podem gastar muito mais tempo experimentando diferentes projetos e ideias sem se preocupar se seus créditos estão sendo usados na área errada, porque agora você tem uma redução de cinquenta por cento no custo. Espero que você goste e acabe usando também. Obrigado.
OpenWork
OpenWork usa um sidecar OpenCode para seu roteamento. Esta execução pede para procurar o preço da Netflix e a variação semanal, e então explicar o movimento. Ele roda em GPT-5.4 com baixo “thinking” e uma janela flex de cinco segundos. O clipe dura 2 minutos e 57 segundos. As taxas flex reduziram o custo em 48,5%. O primeiro token retornou oito centésimos de segundo depois. Adicione nossa skill OpenWork ao seu agente de codificação e, em seguida, peça para ele apontar seu checkout OpenWork para FlexInference. Para Claude Code, é um comando:Install the OpenWork skill
Transcrição
Transcrição
Transcrição da demonstração FlexInference: OpenWorkOlá a todos, meu nome é Adi. Sou o fundador da FlexInference, e aqui temos o OpenWork, que foi modificado para usar a FlexInference em segundo plano para seu roteador. Há um prompt abaixo que você pode colar em qualquer CLI ou ferramenta de codificação agentic que você use, e ele deve mudar seu OpenWork para começar a usar a FlexInference também. Vamos iniciar a demonstração e explicarei como funciona. Todos esses modelos são suportados através da FlexInference, mas digamos que eu queira uma tarefa que precise de um modelo inteligente: GPT 5.4. Vou configurá-lo para “low thinking” com “flex on” e dar a ele um SLA de cinco segundos para encontrar inferência mais barata dentro desse tempo, caso contrário, ele escalará para uma requisição default. Então, digamos: Quero que você use a ferramenta de navegador para encontrar o preço atual da Netflix e a variação semanal também, e me diga por que está subindo ou caindo.Enquanto isso acontece, explicarei os casos em que isso é realmente útil. Sim, você pode usar a FlexInference para requisições default, requisições prioritárias, requisições automáticas, mas o que nos diferencia é a “flex race”, dado um SLA que você define. Pense em casos em que você tem um briefing diário pela manhã: às 8h, quero um briefing do mercado de ações. Realmente importa se ele criou o briefing em um minuto em comparação com um minuto e dez segundos? Na minha opinião, não realmente. Se você estiver disposto a abrir mão desse SLA de dez ou cinco segundos, esses casos são incríveis, porque você economizará cinquenta por cento de graça, apenas dando alguns segundos aqui e ali.Na verdade, em nosso caso, o front-end mostra apenas a resposta flex, mas no back-end, para cada requisição nesta demonstração, enviamos duas requisições paralelas - uma default e outra com o SLA de cinco segundos - e as comparamos em custo por um milhão de tokens e tempo para o primeiro token. Essas são métricas de comparação realmente boas, porque as respostas entre as duas requisições podem ser diferentes, mas o custo por um milhão de tokens é justo, e o tempo para o primeiro token também é justo.O que estamos vendo aqui é que você economizou cinquenta por cento, e tudo o que você realmente fez foi gastar 0,08 segundos extras para obter uma resposta. Você pode imaginar que, agregado ao longo de 365 dias e todos os processos assíncronos que você pode ter rodando em segundo plano que não são sensíveis à latência, é realmente útil. E então você pode pensar nos outros casos de uso que começam a ser úteis por causa da economia de cinquenta por cento que você obtém. Então, essa é uma das ótimas maneiras de usar a FlexInference. Esperamos que você goste e não deixe de copiar o prompt abaixo e usá-lo em seu próprio OpenWork. Obrigado.
Mais demonstrações
Estes três clipes são anteriores às skills de integração, então não há ferramenta para conectar. Cada um executa o mesmo teste de duas requisições em uma tarefa diferente.Classificação de imagens Gemini
Duas execuções do Gemini 2.5 Flash classificam um conjunto de cinquenta imagens coloridas. Uma abre uma janela flex de dez segundos. A outra enviadefault.
O clipe dura 1 minuto e 46 segundos. As taxas flex reduziram o custo em 38,9%. O primeiro token retornou 20,2% mais tarde.
Transcrição
Transcrição
Transcrição da demonstração FlexInference: Classificação de imagens GeminiOlá a todos, meu nome é Adi. Sou o fundador da FlexInference, e aqui temos uma demonstração de classificação de imagens. Vou iniciar isso e depois explicar o que está acontecendo.Temos dois processos paralelos, ambos executando Gemini 2.5 Flash, que vão classificar um conjunto de cinquenta imagens de cores diferentes, identificando qual cor cada uma é. Não estamos tentando comparar qual lado classifica melhor; é o mesmo modelo em ambos os lados, e ambos usam o SDK e o roteador da FlexInference. O lado esquerdo recebeu um SLA de dez segundos para encontrar inferência mais barata através do parâmetro start_within. O lado direito também está usando o SDK e o roteador da FlexInference, mas seu parâmetro start_within está definido como default, o que solicita uma resposta instantânea. O que estamos tentando mostrar é que, dado um pequeno orçamento de latência que você pode definir, neste caso dez segundos, você pode obter custos dramaticamente mais baixos, aproximadamente cinquenta por cento. Vou avançar rapidamente para quando este conjunto de dados tiver sido classificado e concluído, e então poderemos analisar as compensações.Agora que voltamos, podemos ver que cinquenta das cinquenta imagens foram classificadas. Os custos totais foram cerca da metade: US 0,0304. O custo por um milhão de tokens, entrada e saída juntos, é de US 0,95, o que também é aproximadamente a metade. A latência total cedida foi de cerca de vinte e sete segundos, aproximadamente quinze por cento. Essencialmente, dado um pequeno orçamento de latência, você conseguiu obter custos dramaticamente mais baixos. Obrigado.
Pesquisa aprofundada OpenAI
Dois agentes de pesquisa elaboram um relatório sobre empresas públicas de CPU. Um abre uma janela flex de dez segundos, e o outro enviadefault.
O clipe dura 2 minutos e 35 segundos. As taxas flex reduziram o custo em 44,8% no GPT-5 Mini. O primeiro token retornou 30,1% mais cedo.
Transcrição
Transcrição
Transcrição da demonstração FlexInference: Pesquisa aprofundada OpenAIOlá a todos, meu nome é Adi. Sou o fundador da FlexInference, e aqui está uma demonstração de pesquisa aprofundada. Vou iniciar a demonstração enquanto explico como funciona. Temos dois agentes rodando como processos paralelos, ambos usando o SDK e o roteador da FlexInference, que tentarão encontrar empresas públicas de CPU com uma vantagem em treinamento e inferência de modelos. O tópico em si não é tão relevante: cada agente cria algumas perguntas, faz algumas pesquisas na web e cria um relatório. O que realmente estamos analisando é que o agente do lado esquerdo recebeu um SLA de dez segundos para encontrar inferência mais barata, e se não conseguir dentro desse tempo, ele escala para uma requisição default e ainda cumpre a requisição. O parâmetro start_within do lado direito está definido como default em vez de dez segundos, o que solicita uma resposta instantânea. O que estamos tentando ver é que o lado esquerdo, dado um pequeno orçamento de latência de até dez segundos, tem custos dramaticamente mais baixos, cerca de cinquenta por cento mais baixos. Isso torna a FlexInference muito mais barata e acessível para tarefas sem requisitos de latência muito baixos. Agora vou avançar rapidamente para o final para que possamos comparar as compensações.Agora estamos de volta. Ambos os relatórios foram feitos; os agentes fizeram pesquisas na web e algum planejamento terciário. O lado esquerdo, Flex, não só foi mais barato, mas também concluiu mais rápido, o que às vezes acontece. Não garantimos que a latência será menor; garantimos que, dentro do SLA que você definir, encontraremos inferência mais barata ou escalaremos para uma requisição default. Aqui, o lado esquerdo terminou cerca de sessenta segundos mais rápido, e o custo por um milhão de tokens foi cerca de vinte e seis centavos menor no GPT-5 Mini, quase metade do custo. Usamos o custo por um milhão de tokens porque os dois lados usaram um número diferente de tokens e citações, então é uma comparação mais precisa. O custo total resultou em uma diferença de cerca de US$ 0,0265. Obrigado.
Agente de navegador OpenAI
Dois agentes de navegador GPT-5 compram uma camiseta em um clone de e-commerce. Um abre uma janela flex de dez segundos, e o outro enviadefault.
O clipe dura 1 minuto e 59 segundos. As taxas flex reduziram o custo em 51,5%. O primeiro token retornou 9,7% mais tarde.
Transcrição
Transcrição
Transcrição da demonstração FlexInference: Agente de navegador OpenAIOlá a todos, meu nome é Adi. Sou o fundador da FlexInference, e aqui temos uma demonstração de agente de navegador. Vou iniciar esta demonstração enquanto explico como funciona. No back-end, temos um clone de e-commerce, e nossos agentes tentarão realizar a tarefa de comprar uma camiseta Medusa tamanho M, cor preta. No lado esquerdo, temos o GPT-5 sendo roteado através do SDK e roteador da FlexInference, com dez segundos para encontrar inferência mais barata; se conseguir, ele cumpre a requisição dessa forma, e caso contrário, ele escala para uma requisição default. No lado direito, também temos o GPT-5 usando o SDK e roteador da FlexInference, mas o parâmetro start_within está definido como default, então suas requisições são cumpridas instantaneamente. O objetivo é mostrar que no lado esquerdo você pode realizar a mesma tarefa, cedendo um pequeno orçamento de latência, por um custo total e custo por um milhão de tokens dramaticamente mais baixos. Analisamos o custo total e o custo por um milhão de tokens porque a contagem de passos pode variar, já que esta tarefa é não-determinística. Estes são dois processos paralelos, e o cache de prompt de entrada está desativado. Agora vou avançar rapidamente para o final para que possamos comparar custos e latência e ver as compensações.Voltando a isso, o que notamos é que, ao ceder cerca de quinze segundos extras, aproximadamente dez por cento a mais de latência, conseguimos reduzir os custos totais em cerca de metade, e o custo por um milhão de tokens em um pouco mais. Há uma diferença na contagem de passos, mas, de modo geral, é isso que você vê da FlexInference: custos dramaticamente mais baixos para um ligeiro aumento na latência. Obrigado.