Skip to main content

Core models

USDper 1M tokens
ModelWindowInputCachedOutput
Kimi K3
moonshotai/Kimi-K3
Default (ASAP)3.000.3015.00
GLM-5.3
zai-org/GLM-5.3
Default (ASAP)1.400.264.40
Balanced0.500.122.50
Flex0.400.081.80
DeepSeek V4 Flash 0731
deepseek-ai/DeepSeek-V4-Flash-0731
Default (ASAP)0.090.020.18
Kimi-K2.6
moonshotai/Kimi-K2.6
Default (ASAP)1.000.204.00
Balanced0.450.203.00
Flex0.350.102.00
DeepSeek V4 Pro 0813
deepseek-ai/DeepSeek-V4-Pro-0813
Default (ASAP)1.320.0443.96
Flex0.660.0221.98
gpt-oss-120b
openai/gpt-oss-120b
Default (ASAP)0.060.030.40
Gemma 4 31B IT
google/gemma-4-31B-it
Default (ASAP)0.400.200.60
Balanced0.120.080.60
Flex0.060.020.30
Gemma 4 12B IT
google/gemma-4-12B-it
Default (ASAP)0.300.152.00
Balanced0.100.072.00
Flex0.050.021.00
Gemma 4 31B IT (NVFP4)
nvidia/Gemma-4-31B-IT-NVFP4
Default (ASAP)0.140.070.40
Balanced0.070.050.40

Flex-only models

Models served with the flex completion window exclusively.
USDper 1M tokens
ModelWindowInputCachedOutput
Qwen3.6 35B A3B
Qwen/Qwen3.6-35B-A3B
Flex0.050.0150.40
Nemotron 3 Super 120B A12B BF16
nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16
Flex0.250.150.75

Notes

  • See Completion Windows for how to use balanced and flex for lower token prices.
    • Not all core models support all windows yet. We regularly bring up new models and expand completion window support for existing ones based on demand. If you have a need that’s not represented above, get in touch.
  • Prompt caching is implicit, based on prefix matching. Optionally, you may use prompt_cache_key as a routing hint to help maximize cache hit rates.
  • See Models for capabilities and other details on supported models.
  • To see what these rates add up to on a full agent workload, use the agent cost calculator.