All AI models · LLM benchmarks · Methodology

Vision Medium

Balanced multimodal model pairing a 1M-token context window with deeper reasoning for analysis, content creation, and tool use across text, image, audio, video, and PDF inputs.

Model facts

Context window
1M tokens
Maximum output
66K tokens
Cheapest paid input
$4.21 per 1M tokens
Cheapest paid output
$12.63 per 1M tokens
Open weights
no
Providers
1

Capabilities and modalities

reasoning, tool calling, structured output, attachments, temperature control, text, image, audio, video, pdf.

Observed price history

  • 2026-09-15: $4.21 input / $12.63 output per 1M tokens

API providers