Skip to main content
Cada clip a continuación enruta una carga de trabajo a través de nosotros. Cada solicitud se dispara dos veces en el mismo modelo. Una llamada abre una ventana flex con start_within. La otra envía default. El video reproduce la respuesta flex. Comparamos las dos ejecuciones en costo por un millón de tokens y en tiempo hasta el primer token. Esas son las medidas justas cuando dos ejecuciones pueden devolver tokens diferentes. Prometemos el resultado más económico, no el más rápido. Dentro de la ventana que usted establece, obtenemos el nivel económico o pasamos al estándar. Así, una ejecución se factura a un nivel y nunca espera más allá de su plazo. Envíe su primera solicitud con el inicio rápido. El enrutamiento por plazo cubre la ventana y el paso al estándar.

Demostraciones de integración

Cada herramienta a continuación es un agente de código abierto estándar, modificado para enrutar a través de nosotros. Cada una ahora se envía como una habilidad. Agregue la habilidad a su agente de codificación y solicite la integración en su propio checkout. La habilidad cubre la entrada del proveedor, el plazo flex y el comando de sesión /flex, todo a través de la configuración.

OpenScience

OpenScience es una alternativa de código abierto a Claude Science. Esta ejecución le pide que encuentre trabajos de investigación sobre el enrutamiento de camiones más eficiente. Se ejecuta en GPT-5.6 Terra con bajo nivel de “pensamiento” y una ventana flex de cinco segundos. El clip dura 4 minutos y 1 segundo. Las tarifas flex cubrieron toda la tarea, por lo que costó la mitad. El primer token regresó un 9.3 por ciento más tarde, y la tarea terminó unos treinta segundos después. Agregue nuestra habilidad OpenScience a su agente de codificación, luego pídale que apunte su checkout de OpenScience a FlexInference. Para Claude Code, es un solo comando:
Install the OpenScience skill
Transcripción de la demostración de FlexInference: OpenScienceHola a todos, mi nombre es Adi. Soy el fundador de FlexInference, y aquí tenemos OpenScience, una alternativa de código abierto a Claude Science. Se ha modificado para enrutar todas sus solicitudes a través de FlexInference, y usted puede hacer que su OpenScience haga lo mismo: hemos agregado un prompt justo debajo de esta demostración que puede copiar y pegar en cualquier herramienta de codificación agéntica que utilice, y actualizará su OpenScience para que también use FlexInference. Para esta demostración estamos usando GPT 5.6 Terra. Estableceré el “pensamiento” en bajo, estableceré una “carrera flex” para que busque inferencia más barata, y le daré cinco segundos para encontrar inferencia más barata, de lo contrario, se actualizará a una solicitud predeterminada. Vamos a analizar el costo por un millón de tokens y el tiempo hasta el primer token, porque en segundo plano iniciamos dos solicitudes paralelas cada vez que hago una pregunta. Esto es solo para que podamos comparar, y dado que los resultados podrían no ser determinísticos, lo que realmente nos importa es cuándo regresó el primer token y cuánto cuesta cada lado por un millón de tokens. Me gustaría decir que FlexInference es compatible con todos los modelos Claude, todos los modelos Gemini y todos los modelos GPT que ve aquí.Ahora preguntémosle: Trabajo en logística y tengo tres camiones. Quiero que mi enrutamiento sea más eficiente, para entregar más rápido y más barato. Encuéntrame trabajos de investigación relevantes.Mientras esto sucede, tenemos dos procesos paralelos ejecutándose en segundo plano para comparar. Lo que sí garantizamos es que, dentro del tiempo que usted establezca, le encontraremos una inferencia más barata o escalaremos a una solicitud predeterminada normal; en este caso, estamos comparando con siempre solicitar peticiones predeterminadas. A veces vemos que somos de alguna manera más rápidos, y obviamente más baratos, pero no garantizamos la parte más rápida. Sí garantizamos la parte más barata. Obviamente, puede hacer solicitudes predeterminadas a través de nosotros y obtener la velocidad que desee, junto con solicitudes prioritarias.¿Por qué querría un SLA para una hipótesis de estilo científico y una tarea de proceso repetitivo? Habiendo trabajado en investigación, a menudo hay casos en los que tiene diez hipótesis y una cantidad limitada de créditos de API, tiempo de desarrollo o simplemente tiempo antes de una fecha límite. Así que solo prueba las tres primeras y deja de lado las siete últimas. Eventualmente, las tres primeras no logran los resultados que desea, comienza a revisar el resto, llega a la octava de esa lista y piensa: Ojalá lo hubiera intentado antes, simplemente no tenía sentido en ese momento. De esta manera, las hipótesis que está considerando y que no parecen un buen retorno de la inversión pueden ejecutarse más baratas en segundo plano. Incluso si tarda un poco más, está bien, porque de todos modos no iba a priorizarlo, pero ahora obtendrá los resultados antes. Y cuando está investigando, o cualquier tarea abierta en la que itera y prueba y error, está obteniendo las aportaciones de muchas personas y también quiere darles resultados, pero no puede dedicar tiempo o créditos de API. Puede enviar todas sus solicitudes e hipótesis a diferentes sesiones de OpenScience, asegurarse de que salgan a tiempo, y obtendrán sus resultados mucho más baratos mientras usted continúa priorizando. Sus solicitudes más priorizadas puede seguir haciéndolas a través de solicitudes predeterminadas o prioritarias.Como pueden ver, se completó, y pudimos completar nuestra tarea con solo treinta segundos adicionales, a la mitad del precio. Tiene sentido ceder un diez por ciento o menos de latencia, en este caso, por una reducción del cincuenta por ciento en el costo. Espero que les haya gustado y lo implementen en su propia versión de OpenScience. Gracias.

OpenCode

OpenCode es un agente de codificación de código abierto. Esta ejecución le pide que construya una página HTML cuyas visualizaciones expliquen las derivadas. Se ejecuta en GPT-5.4 con bajo nivel de “pensamiento” y una ventana flex de cinco segundos. El clip dura 3 minutos y 34 segundos. Las tarifas flex redujeron el costo a la mitad. El primer token superó la ejecución predeterminada en un 37.5 por ciento, lo cual sucede pero nunca lo prometemos. Agregue nuestra habilidad OpenCode a su agente de codificación, luego pídale que apunte su checkout de OpenCode a FlexInference. El plugin /flex que configura establece start_within en cada solicitud porque posee el hook de solicitud. Una herramienta sin hook no necesita plugin. En su lugar, ponga el plazo en la clave. Para Claude Code, la instalación es un solo comando:
Install the OpenCode skill
Transcripción de la demostración de FlexInference: OpenCodeHola, mi nombre es Adi. Soy el fundador de FlexInference, y aquí tenemos OpenCode, y se ha modificado para enrutar las solicitudes del modelo a través de FlexInference. De hecho, puede cambiarlo usted mismo: hay un prompt debajo de esta demostración que puede copiar y pegar en cualquier herramienta de codificación agéntica, apuntarla a su OpenCode y decir “Quiero empezar a usar FlexInference”, y hará que pueda tener la misma herramienta que tenemos aquí. Ya está configurado en GPT 5.4; lo configuraremos en “pensamiento” bajo, flex activado, SLA de cinco segundos, y comenzaré la demostración y explicaré cómo van las cosas. Así que diremos: Me cuesta entender las derivadas. Me gustaría una página HTML simple con visualizaciones dinámicas que me las expliquen.OpenCode va a crear esto, y en el lado derecho se ejecutará una comparación: la tasa de “carrera flex”, que es el costo por un millón de tokens, luego la tasa predeterminada, y luego el tiempo hasta el primer token de la “carrera flex” y el tiempo hasta el primer token predeterminado. En el front-end, lo que está viendo a través de esta TUI es solo lo que flex está respondiendo. En el back-end, estamos enviando dos solicitudes paralelas, por lo que esta es realmente una comparación de igual a igual, y también puede ver la comparación del tiempo hasta el primer token y el costo por un millón de tokens.El objetivo de FlexInference es que le damos acceso a una “carrera flex” que busca una inferencia más barata dentro del tiempo que usted establece, y lo establecemos en cinco segundos; si eso no se cumple, lo escalamos. También podemos hacer cualquier otro tipo de solicitud. En slash models puede ver que admitimos todos los modelos principales. Lo que nos diferencia es la “carrera flex”. Hay muchos casos con tareas no sensibles a la latencia donde es genial. Imagine que recibe una página a las 8 PM. Es un sev 4 y no es el mayor problema. Piensa que sería bueno si pudiera implementarse, pero no le importa si tarda diez minutos más. Esos casos, es genial. O casos en los que tiene proyectos en segundo plano que le interesan, pero no quiere gastar todos sus créditos de API a la vez: puede poner en cola un montón de tareas, se van ejecutando lentamente y gasta mucho menos.Ahora ya ha creado esta página HTML de derivadas, que podemos abrir, pero lo que me interesa es la comparación. El tiempo hasta el primer token fue en realidad más rápido en GPT 5.4, lo que ocurre de vez en cuando. No garantizamos que sea más rápido que el predeterminado, pero sucede, y es genial en nuestro caso. Segundo, es más barato: una reducción del cincuenta por ciento en el costo aquí. Configurar FlexInference dentro del propio OpenCode significa que usted o sus desarrolladores pueden dedicar mucho más tiempo a probar diferentes proyectos e ideas sin preocuparse de si sus créditos se están utilizando en el área equivocada, porque ahora tiene una reducción del cincuenta por ciento en el costo. Espero que lo disfruten y terminen usándolo también. Gracias.

OpenWork

OpenWork utiliza un sidecar de OpenCode para su enrutamiento. Esta ejecución le pide que busque el precio de Netflix y el cambio semanal, luego que explique el movimiento. Se ejecuta en GPT-5.4 con bajo nivel de “pensamiento” y una ventana flex de cinco segundos. El clip dura 2 minutos y 57 segundos. Las tarifas flex redujeron el costo un 48.5 por ciento. El primer token regresó ocho centésimas de segundo después. Agregue nuestra habilidad OpenWork a su agente de codificación, luego pídale que apunte su checkout de OpenWork a FlexInference. Para Claude Code, es un solo comando:
Install the OpenWork skill
Transcripción de la demostración de FlexInference: OpenWorkHola a todos, mi nombre es Adi. Soy el fundador de FlexInference, y aquí tenemos OpenWork, y se ha modificado para que utilice FlexInference en segundo plano para su enrutador. Hay un prompt a continuación que puede pegar en cualquier CLI o herramienta de codificación agéntica que utilice, y debería cambiar su OpenWork para que también comience a usar FlexInference. Comencemos la demostración y explicaré cómo funciona. Todos estos modelos son compatibles a través de FlexInference, pero digamos que quiero una tarea que necesite un modelo inteligente: GPT 5.4. Lo configuraré en “pensamiento” bajo con flex activado y le daré un SLA de cinco segundos para encontrar una inferencia más barata, de lo contrario, escalará a una solicitud predeterminada. Así que digamos: Quiero que uses la herramienta del navegador para encontrar el precio actual de Netflix y también el cambio semanal, y que me digas por qué está subiendo o bajando.Mientras esto sucede, explicaré los casos en los que esto es realmente útil. Sí, puede usar FlexInference para solicitudes predeterminadas, solicitudes prioritarias, solicitudes automáticas, pero lo que nos hace diferentes es la “carrera flex”, dado un SLA que usted establece. Piense en los casos en los que tiene un informe diario por la mañana: a las 8 AM quiero un informe del mercado de valores. ¿Realmente importa si creó el informe en un minuto en comparación con un minuto y diez segundos? En mi opinión, no realmente. Si está dispuesto a ceder ese SLA de diez o cinco segundos, esos casos son increíbles, porque va a ahorrar un cincuenta por ciento gratis, solo dando unos segundos aquí y allá.De hecho, en nuestro caso, el front-end muestra solo la respuesta flex, pero en el back-end, para cada solicitud en esta demostración, enviamos dos solicitudes paralelas, una predeterminada y otra con el SLA de cinco segundos, y las comparamos en costo por un millón de tokens y tiempo hasta el primer token. Estas son métricas de comparación realmente buenas, porque las respuestas entre las dos solicitudes podrían ser diferentes, pero el costo por un millón de tokens es justo, y el tiempo hasta el primer token también es justo.Lo que estamos viendo aquí es que ahorró un cincuenta por ciento, y todo lo que realmente hizo fue gastar 0.08 segundos adicionales para obtener una respuesta. Puede imaginar que, agregado a lo largo de 365 días y todos los procesos asíncronos que pueda tener ejecutándose en segundo plano que no son sensibles a la latencia, es realmente útil. Y luego puede pensar en los otros casos de uso que comienzan a ser útiles debido al cincuenta por ciento de ahorro de costos que obtiene. Así que esa es una de las excelentes maneras en que puede usar FlexInference. Esperamos que le guste, y asegúrese de copiar el prompt a continuación y usarlo en su propio OpenWork. Gracias.

Más demostraciones

Estos tres clips son anteriores a las habilidades de integración, por lo que no hay ninguna herramienta que conectar. Cada uno ejecuta la misma prueba de dos solicitudes en una tarea diferente.

Clasificación de imágenes de Gemini

Dos ejecuciones de Gemini 2.5 Flash clasifican un conjunto de cincuenta imágenes a color. Una abre una ventana flex de diez segundos. La otra envía default. El clip dura 1 minuto y 46 segundos. Las tarifas flex redujeron el costo un 38.9 por ciento. El primer token regresó un 20.2 por ciento más tarde.
Transcripción de la demostración de FlexInference: Clasificación de imágenes de GeminiHola a todos, mi nombre es Adi. Soy el fundador de FlexInference, y aquí tenemos una demostración de clasificación de imágenes. Voy a iniciar esto y luego explicaré lo que está sucediendo.Tenemos dos procesos paralelos, ambos ejecutando Gemini 2.5 Flash, que van a clasificar un conjunto de cincuenta imágenes de diferentes colores, identificando qué color es cada una. No estamos tratando de comparar qué lado clasifica mejor; es el mismo modelo en ambos lados, y ambos usan el SDK y el enrutador de FlexInference. Al lado izquierdo se le ha dado un SLA de diez segundos para encontrar una inferencia más barata a través del parámetro start_within. El lado derecho también está usando el SDK y el enrutador de FlexInference, pero su parámetro start_within está configurado como default, lo que solicita una respuesta instantánea. Lo que estamos tratando de mostrar es que, dado un pequeño presupuesto de latencia que usted puede establecer, en este caso diez segundos, puede obtener costos dramáticamente más bajos, aproximadamente un cincuenta por ciento. Voy a avanzar rápidamente hasta que este conjunto de datos haya sido clasificado y completado, y luego podremos analizar las compensaciones.Ahora que hemos vuelto, podemos ver que cincuenta de cincuenta imágenes han sido clasificadas. Los costos totales fueron aproximadamente la mitad: 0.0183encomparacioˊncon0.0183 en comparación con 0.0304. El costo por un millón de tokens, entrada y salida juntas, es de 0.58frentea0.58 frente a 0.95, lo que también es aproximadamente la mitad. La latencia total cedida fue de unos veintisiete segundos, aproximadamente un quince por ciento. Esencialmente, dado un pequeño presupuesto de latencia, pudo obtener costos dramáticamente más bajos. Gracias.

Investigación profunda de OpenAI

Dos agentes de investigación redactan un informe sobre empresas públicas de CPU. Uno abre una ventana flex de diez segundos y el otro envía default. El clip dura 2 minutos y 35 segundos. Las tarifas flex redujeron el costo un 44.8 por ciento en GPT-5 Mini. El primer token regresó un 30.1 por ciento antes.
Transcripción de la demostración de FlexInference: Investigación profunda de OpenAIHola a todos, mi nombre es Adi. Soy el fundador de FlexInference, y aquí hay una demostración de investigación profunda. Voy a iniciar la demostración mientras explico cómo funciona. Tenemos dos agentes ejecutándose como procesos paralelos, ambos utilizando el SDK y el enrutador de FlexInference, que intentarán encontrar empresas públicas de CPU con una ventaja en el entrenamiento e inferencia de modelos. El tema en sí no es tan relevante: cada agente crea algunas preguntas, realiza algunas búsquedas web y crea un informe. Lo que realmente estamos viendo es que al agente de la izquierda se le ha dado un SLA de diez segundos para encontrar una inferencia más barata, y si no puede dentro de ese tiempo, escala a una solicitud predeterminada y aún así cumple la solicitud. El parámetro start_within del lado derecho está configurado como default en lugar de diez segundos, lo que solicita una respuesta instantánea. Lo que estamos tratando de ver es que el lado izquierdo, dado un pequeño presupuesto de latencia de hasta diez segundos, tiene costos dramáticamente más bajos, aproximadamente un cincuenta por ciento menos. Eso hace que FlexInference sea mucho más barato y asequible para tareas sin requisitos de latencia muy bajos. Ahora voy a avanzar rápidamente hasta el final para que podamos comparar las compensaciones.Ahora estamos de vuelta. Ambos informes han sido elaborados; los agentes realizaron búsquedas web y alguna planificación terciaria. El lado izquierdo, Flex, no solo fue más barato sino que también se completó más rápido, lo que a veces sucede. No garantizamos que la latencia sea menor; garantizamos que dentro del SLA que usted establezca, le encontraremos una inferencia más barata o escalaremos a una solicitud predeterminada. Aquí, el lado izquierdo terminó unos sesenta segundos más rápido, y el costo por un millón de tokens fue aproximadamente veintiséis centavos más bajo en GPT-5 Mini, casi la mitad del costo. Usamos el costo por un millón de tokens porque los dos lados usaron un número diferente de tokens y citas, por lo que es una comparación más precisa. El costo total resultó en una diferencia de aproximadamente $0.0265. Gracias.

Agente de navegador de OpenAI

Dos agentes de navegador GPT-5 compran una camiseta en un clon de comercio electrónico. Uno abre una ventana flex de diez segundos y el otro envía default. El clip dura 1 minuto y 59 segundos. Las tarifas flex redujeron el costo un 51.5 por ciento. El primer token regresó un 9.7 por ciento más tarde.
Transcripción de la demostración de FlexInference: Agente de navegador de OpenAIHola a todos, mi nombre es Adi. Soy el fundador de FlexInference, y aquí tenemos una demostración de agente de navegador. Voy a iniciar esta demostración mientras explico cómo funciona. En el back-end tenemos un clon de comercio electrónico, y nuestros agentes intentarán lograr la tarea de comprar una camiseta Medusa en talla M, color negro. En el lado izquierdo tenemos GPT-5 siendo enrutado a través del SDK y el enrutador de FlexInference, con diez segundos para encontrar una inferencia más barata; si lo hace, cumple la solicitud de esa manera, y de lo contrario escala a una solicitud predeterminada. En el lado derecho también tenemos GPT-5 usando el SDK y el enrutador de FlexInference, pero el parámetro start_within está configurado como default, por lo que sus solicitudes se cumplen instantáneamente. El objetivo es mostrar que en el lado izquierdo puede realizar la misma tarea, cediendo un pequeño presupuesto de latencia, por un costo total y un costo por un millón de tokens dramáticamente más bajos. Analizamos el costo total y el costo por un millón de tokens porque el número de pasos puede variar, ya que esta tarea no es determinística. Estos son dos procesos paralelos, y el almacenamiento en caché del prompt de entrada está desactivado. Ahora voy a avanzar rápidamente hasta el final para que podamos comparar costos y latencia y ver las compensaciones.Volviendo a esto, lo que notamos es que al ceder unos quince segundos adicionales, aproximadamente un diez por ciento más de latencia, pudimos reducir los costos totales aproximadamente a la mitad, y el costo por un millón de tokens un poco más. Hay una diferencia en el número de pasos, pero en general esto es lo que se ve con FlexInference: costos dramáticamente más bajos por un ligero aumento en la latencia. Gracias.