Self-serve with prepaid credits from USD 5, billed by usage. Rate limits increase with lifetime spend.
Prepaid credits, minimum purchase USD 5, credits currently have no expiration date
Rate limits by Build Tier 1 to 5, based on lifetime spend (USD 5 to 1,000)
Serverless inference through an OpenAI-compatible API for text, image, video, audio, transcription, embeddings and rerank
Qwen3.8 Flash: USD 0.09 input and USD 0.28 output per 1M tokens
gpt-oss-120B: USD 0.15 input and USD 0.60 output per 1M tokens
MiniMax M3: USD 0.30 input, USD 0.06 cached input and USD 1.20 output per 1M tokens
DeepSeek V4 Pro 0813: USD 1.32 input and USD 3.96 output per 1M tokens
Kimi K3: USD 3.00 input and USD 15.00 output per 1M tokens
Image generation from USD 0.0017 per megapixel, video generation from USD 0.115 per video, transcription from USD 0.0015 per audio minute
Dedicated inference on demand: NVIDIA HGX H100 USD 5.49, HGX B200 USD 8.99 per GPU hour
GPU clusters on demand: HGX H100 USD 3.99, H200 USD 5.99, B200 USD 8.19, B300 USD 9.99 per GPU hour
GPU clusters preemptible from USD 1.99, reserved for 7 to 180 days from USD 3.19 per GPU hour (H100)
Fine-tuning from USD 0.34 per 1M training tokens, minimum charge per job from USD 4
Code sandbox: USD 0.0446 per vCPU hour, USD 0.0149 per GiB RAM hour
Managed storage: USD 0.16 per GiB per month