Open models forproduction agents
One OpenAI-compatible endpoint for reasoning, coding, multimodal, and low-latency workloads.20+ models serverless today. 90+ more as dedicated endpoints.
Showing 117 models
DeepSeek V3.2
Context
160K
Params
685B MoE (37B active)
Min H100s
16
GLM 5
Context
195K
Params
744B MoE (40B active)
Min H100s
12
Kimi K2.5
Context
256K
Params
1T MoE (32B active)
Min H100s
16
GLM 4.7 Flash
Context
198K
Params
~106B MoE (lite)
Min H100s
2
DeepSeek R1
Context
160K
Params
685B MoE (37B active)
Min H100s
16
Qwen3-Embedding-8B
Context
40K
Params
8B
Min H100s
1
Qwen3-VL 30B A3B Instruct
Context
256K
Params
30B MoE (3B active)
Min H100s
1
Qwen3-30B-A3B-Instruct-2507
Context
256K
Params
30B MoE (3B active)
Min H100s
1
Qwen3 Coder Next
Context
256K
Params
80B MoE (3B active)
Min H100s
1
Qwen3-Embedding-4B
Context
40K
Params
4B
Min H100s
1
Ling 2.6 Flash
Context
128K
Params
~103B MoE (~6B active)
Min H100s
2
Qwen2.5 Coder 32B Instruct
Context
128K
Params
32B
Min H100s
1
Nomic Embed Text v1.5
Context
8K
Params
137M
Min H100s
1
DeepSeek R1 Distill Qwen 32B
Context
32K
Params
32B
Min H100s
1
DeepSeek R1 Distill Qwen 1.5B
Context
32K
Params
1.5B
Min H100s
1
Phi 4 Multi Modal Instruct
Context
128K
Params
14B
Min H100s
1
Gemma 3n E4B Instruct
Context
32K
Params
~5B (selective)
Min H100s
1
MiMo V2.5
Context
1.0M
Params
311B MoE (8/256 experts active)
Min H100s
8
Qwen3-Next 80B A3B Instruct
Context
256K
Params
80B MoE (3B active)
Min H100s
2
Qwen3 235B A22B 2507
Context
256K
Params
235B MoE (22B active)
Min H100s
4
Laguna M.1
Context
256K
Params
~230B MoE (est)
Min H100s
8
BERT Base Uncased
Context
512
Params
110M
Min H100s
1
Qwen3-VL 235B A22B Instruct
Context
256K
Params
235B MoE (22B active)
Min H100s
4
Hy3-preview
Context
256K
Params
295B MoE (21B active)
Min H100s
8
MiniMax M2.5
Context
192K
Params
~456B MoE (45B active)
Min H100s
8
DeepSeek V4 Pro
Context
1.0M
Params
1.6T MoE (49B active)
Min H100s
16
GLM 4.7
Context
198K
Params
~355B MoE (32B active)
Min H100s
8
Qwen3.5 397B A17B
Context
256K
Params
397B MoE (17B active)
Min H100s
8
Llama 4 Maverick
Context
1.0M
Params
400B MoE (17B active)
Min H100s
8
Nex-N2-Pro
Context
256K
Params
397B MoE (17B active)
Min H100s
8
Kimi 2.6
Context
256K
Params
1T MoE (32B active)
Min H100s
16
Qwen3 Coder 480B A35B
Context
256K
Params
480B MoE (35B active)
Min H100s
8
Nemotron 3 Ultra 550B A55B
Context
256K
Params
550B MoE (55B active)
Min H100s
16
Kimi K2.7-Code
Context
256K
Params
1T MoE (32B active)
Min H100s
16
DeepSeek V3 0324
Context
160K
Params
685B MoE (37B active)
Min H100s
16
Llama 4 Scout 17B 16E
Context
9.5M
Params
109B MoE (17B active, 16 experts)
Min H100s
8
MiMo V2 Flash
Context
256K
Params
~30B MoE (5B active est)
Min H100s
1
DeepSeek R1 0528
Context
160K
Params
685B MoE (37B active)
Min H100s
16
Trinity Large Thinking
Context
256K
Params
~70B (est)
Min H100s
2
Hunyuan A13B Instruct
Context
128K
Params
80B MoE (13B active)
Min H100s
2
DeepSeek V3
Context
32K
Params
685B MoE (37B active)
Min H100s
16
Mistral 7B Instruct v0.2
Context
128K
Params
7B
Min H100s
1
Voxtral Mini 4B Realtime
Context
128K
Params
4B (3.4B LM + 0.97B audio enc)
Min H100s
1
NVIDIA Nemotron 3 Nano 30B A3B FP8
Context
256K
Params
30B MoE (3B active)
Min H100s
1
Kimi K2 Thinking
Context
128K
Params
1T MoE (32B active)
Min H100s
16
Distil-Whisper Large V3
Params
756M
Min H100s
1
Kimi K2 Instruct
Context
128K
Params
1T MoE (32B active)
Min H100s
16
Qwen-AgentWorld-35B-A3B
Context
256K
Params
35B MoE (3B active)
Min H100s
1
Nemotron 3.5 ASR Streaming 0.6B
Params
600M
Min H100s
1
Serverless pricing is the live Token Factory rate card, per million tokens unless otherwise noted, same rates as the Token Factory catalog. Dedicated endpoints are billed per GPU-hour. See pricing or compare options in serverless vs dedicated.
Don't see a model you're interested in?