All AI models · LLM benchmarks · Methodology

Meta

Llama 4 Maverick 17B 128E Instruct

Open multimodal Llama model for strong reasoning and fast responses

Model facts

Context window
524K tokens
Maximum output
4K tokens
Cheapest paid input
$0.15 per 1M tokens
Cheapest paid output
$0.6 per 1M tokens
Open weights
yes
Providers
3

Capabilities and modalities

tool calling, structured output, attachments, temperature control, open weights, text, image.

Observed price history

  • 2026-08-24: $0.15 input / $0.6 output per 1M tokens

API providers

  • Nvidia — model id meta/llama-4-maverick-17b-128e-instruct; free input / free output per 1M tokens; provider documentation
  • IO.NET — model id meta-llama/Llama-4-Maverick-17B-128E-Instruct-FP8; $0.15 input / $0.6 output per 1M tokens; provider documentation
  • Vertex — model id meta/llama-4-maverick-17b-128e-instruct-maas; $0.35 input / $1.15 output per 1M tokens; provider documentation