- Go to https://www.flexinference.com/
- Sign Up
- You should now be in https://www.flexinference.com/dashboard
- Either place your own key in place for a provider or switch it to managed here
- Create a FlexInference Normal API key here
- Copy and Paste any of the following
Flex Race Request (Gemini / GPT)
TypeScript
- Chat Completions
- Responses
- Messages
- generateContent
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.flexinference.com/v1",
apiKey: "flex_live_...",
});
const resp = await client.chat.completions.create({
model: "gpt-5-nano",
messages: [{ role: "user", content: "Write a haiku about cheap GPUs." }],
start_within: "00h-00m-30s",
} as any);
console.log(resp.choices[0].message.content);
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.flexinference.com/v1",
apiKey: "flex_live_...",
});
const resp = await client.responses.create({
model: "gpt-5-nano",
input: "Write a haiku about cheap GPUs.",
start_within: "00h-00m-30s",
} as any);
console.log(resp.output_text);
import Anthropic from "@anthropic-ai/sdk";
const client = new Anthropic({
baseURL: "https://api.flexinference.com",
authToken: "flex_live_...",
});
const resp = await client.messages.create({
model: "gemini-3.5-flash",
max_tokens: 1024,
messages: [{ role: "user", content: "Write a haiku about cheap GPUs." }],
start_within: "00h-00m-30s",
} as any);
console.log(resp.content[0].text);
import { GoogleGenAI } from "@google/genai";
const ai = new GoogleGenAI({
apiKey: "flex_live_...",
httpOptions: { baseUrl: "https://api.flexinference.com" },
});
const resp = await ai.models.generateContent({
model: "gemini-3.5-flash",
contents: "Write a haiku about cheap GPUs.",
config: {
httpOptions: { headers: { "x-start-within": "00h-00m-30s" } },
},
});
console.log(resp.text);
Python
- Chat Completions
- Responses
- Messages
- generateContent
from openai import OpenAI
from openai.types.chat import ChatCompletion, ChatCompletionMessageParam
client = OpenAI(
base_url="https://api.flexinference.com/v1",
api_key="flex_live_...",
)
messages: list[ChatCompletionMessageParam] = [
{"role": "user", "content": "Write a haiku about cheap GPUs."}
]
resp: ChatCompletion = client.chat.completions.create(
model="gpt-5-nano",
messages=messages,
extra_body={"start_within": "00h-00m-30s"},
)
print(resp.choices[0].message.content)
from openai import OpenAI
from openai.types.responses import Response
client = OpenAI(
base_url="https://api.flexinference.com/v1",
api_key="flex_live_...",
)
resp: Response = client.responses.create(
model="gpt-5-nano",
input="Write a haiku about cheap GPUs.",
extra_body={"start_within": "00h-00m-30s"},
)
print(resp.output_text)
import anthropic
from anthropic.types import Message, MessageParam, TextBlock
client = anthropic.Anthropic(
base_url="https://api.flexinference.com",
auth_token="flex_live_...",
)
messages: list[MessageParam] = [
{"role": "user", "content": "Write a haiku about cheap GPUs."}
]
resp: Message = client.messages.create(
model="gemini-3.5-flash",
max_tokens=1024,
messages=messages,
extra_body={"start_within": "00h-00m-30s"},
)
block = resp.content[0]
if isinstance(block, TextBlock):
print(block.text)
from google import genai
from google.genai import types
client = genai.Client(
api_key="flex_live_...",
http_options=types.HttpOptions(base_url="https://api.flexinference.com"),
)
resp: types.GenerateContentResponse = client.models.generate_content(
model="gemini-3.5-flash",
contents="Write a haiku about cheap GPUs.",
config=types.GenerateContentConfig(
http_options=types.HttpOptions(headers={"x-start-within": "00h-00m-30s"}),
),
)
print(resp.text)
Flex Race Request (Anthropic)
These need Managed Keys for Anthropic. On your own Anthropic key they return400 flex_unsupported_for_anthropic.
TypeScript
- Chat Completions
- Responses
- Messages
- generateContent
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.flexinference.com/v1",
apiKey: "flex_live_...",
});
const resp = await client.chat.completions.create({
model: "claude-opus-4-8",
messages: [{ role: "user", content: "Write a haiku about cheap GPUs." }],
start_within: "00h-03m-00s",
} as any);
console.log(resp.choices[0].message.content);
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.flexinference.com/v1",
apiKey: "flex_live_...",
});
const resp = await client.responses.create({
model: "claude-opus-4-8",
input: "Write a haiku about cheap GPUs.",
start_within: "00h-03m-00s",
} as any);
console.log(resp.output_text);
import Anthropic from "@anthropic-ai/sdk";
const client = new Anthropic({
baseURL: "https://api.flexinference.com",
authToken: "flex_live_...",
});
const resp = await client.messages.create({
model: "claude-opus-4-8",
max_tokens: 1024,
messages: [{ role: "user", content: "Write a haiku about cheap GPUs." }],
start_within: "00h-03m-00s",
} as any);
console.log(resp.content[0].text);
import { GoogleGenAI } from "@google/genai";
const ai = new GoogleGenAI({
apiKey: "flex_live_...",
httpOptions: { baseUrl: "https://api.flexinference.com" },
});
const resp = await ai.models.generateContent({
model: "claude-opus-4-8",
contents: "Write a haiku about cheap GPUs.",
config: {
httpOptions: { headers: { "x-start-within": "00h-03m-00s" } },
},
});
console.log(resp.text);
Python
- Chat Completions
- Responses
- Messages
- generateContent
from openai import OpenAI
from openai.types.chat import ChatCompletion, ChatCompletionMessageParam
client = OpenAI(
base_url="https://api.flexinference.com/v1",
api_key="flex_live_...",
)
messages: list[ChatCompletionMessageParam] = [
{"role": "user", "content": "Write a haiku about cheap GPUs."}
]
resp: ChatCompletion = client.chat.completions.create(
model="claude-opus-4-8",
messages=messages,
extra_body={"start_within": "00h-03m-00s"},
)
print(resp.choices[0].message.content)
from openai import OpenAI
from openai.types.responses import Response
client = OpenAI(
base_url="https://api.flexinference.com/v1",
api_key="flex_live_...",
)
resp: Response = client.responses.create(
model="claude-opus-4-8",
input="Write a haiku about cheap GPUs.",
extra_body={"start_within": "00h-03m-00s"},
)
print(resp.output_text)
import anthropic
from anthropic.types import Message, MessageParam, TextBlock
client = anthropic.Anthropic(
base_url="https://api.flexinference.com",
auth_token="flex_live_...",
)
messages: list[MessageParam] = [
{"role": "user", "content": "Write a haiku about cheap GPUs."}
]
resp: Message = client.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
messages=messages,
extra_body={"start_within": "00h-03m-00s"},
)
block = resp.content[0]
if isinstance(block, TextBlock):
print(block.text)
from google import genai
from google.genai import types
client = genai.Client(
api_key="flex_live_...",
http_options=types.HttpOptions(base_url="https://api.flexinference.com"),
)
resp: types.GenerateContentResponse = client.models.generate_content(
model="claude-opus-4-8",
contents="Write a haiku about cheap GPUs.",
config=types.GenerateContentConfig(
http_options=types.HttpOptions(headers={"x-start-within": "00h-03m-00s"}),
),
)
print(resp.text)
Default Request
TypeScript
- Chat Completions
- Responses
- Messages
- generateContent
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.flexinference.com/v1",
apiKey: "flex_live_...",
});
const resp = await client.chat.completions.create({
model: "gpt-5-nano",
messages: [{ role: "user", content: "Write a haiku about cheap GPUs." }],
start_within: "default",
} as any);
console.log(resp.choices[0].message.content);
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.flexinference.com/v1",
apiKey: "flex_live_...",
});
const resp = await client.responses.create({
model: "gpt-5-nano",
input: "Write a haiku about cheap GPUs.",
start_within: "default",
} as any);
console.log(resp.output_text);
import Anthropic from "@anthropic-ai/sdk";
const client = new Anthropic({
baseURL: "https://api.flexinference.com",
authToken: "flex_live_...",
});
const resp = await client.messages.create({
model: "claude-opus-4-8",
max_tokens: 1024,
messages: [{ role: "user", content: "Write a haiku about cheap GPUs." }],
start_within: "default",
} as any);
console.log(resp.content[0].text);
import { GoogleGenAI } from "@google/genai";
const ai = new GoogleGenAI({
apiKey: "flex_live_...",
httpOptions: { baseUrl: "https://api.flexinference.com" },
});
const resp = await ai.models.generateContent({
model: "gemini-3.5-flash",
contents: "Write a haiku about cheap GPUs.",
config: {
httpOptions: { headers: { "x-start-within": "default" } },
},
});
console.log(resp.text);
Python
- Chat Completions
- Responses
- Messages
- generateContent
from openai import OpenAI
from openai.types.chat import ChatCompletion, ChatCompletionMessageParam
client = OpenAI(
base_url="https://api.flexinference.com/v1",
api_key="flex_live_...",
)
messages: list[ChatCompletionMessageParam] = [
{"role": "user", "content": "Write a haiku about cheap GPUs."}
]
resp: ChatCompletion = client.chat.completions.create(
model="gpt-5-nano",
messages=messages,
extra_body={"start_within": "default"},
)
print(resp.choices[0].message.content)
from openai import OpenAI
from openai.types.responses import Response
client = OpenAI(
base_url="https://api.flexinference.com/v1",
api_key="flex_live_...",
)
resp: Response = client.responses.create(
model="gpt-5-nano",
input="Write a haiku about cheap GPUs.",
extra_body={"start_within": "default"},
)
print(resp.output_text)
import anthropic
from anthropic.types import Message, MessageParam, TextBlock
client = anthropic.Anthropic(
base_url="https://api.flexinference.com",
auth_token="flex_live_...",
)
messages: list[MessageParam] = [
{"role": "user", "content": "Write a haiku about cheap GPUs."}
]
resp: Message = client.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
messages=messages,
extra_body={"start_within": "default"},
)
block = resp.content[0]
if isinstance(block, TextBlock):
print(block.text)
from google import genai
from google.genai import types
client = genai.Client(
api_key="flex_live_...",
http_options=types.HttpOptions(base_url="https://api.flexinference.com"),
)
resp: types.GenerateContentResponse = client.models.generate_content(
model="gemini-3.5-flash",
contents="Write a haiku about cheap GPUs.",
config=types.GenerateContentConfig(
http_options=types.HttpOptions(headers={"x-start-within": "default"}),
),
)
print(resp.text)