Vision Large
Most capable Vision model for complex reasoning, detailed media analysis, and structured output over a 1M-token context window.
Model facts
- Context window
- 1M tokens
- Maximum output
- 66K tokens
- Cheapest paid input
- $7.37 per 1M tokens
- Cheapest paid output
- $22.11 per 1M tokens
- Open weights
- no
- Providers
- 1
Capabilities and modalities
reasoning, tool calling, structured output, attachments, temperature control, text, image, audio, video, pdf.
Observed price history
- 2026-09-15: $7.37 input / $22.11 output per 1M tokens
API providers
- Vispark — model id vispark/vision-large; $7.37 input / $22.11 output per 1M tokens; provider documentation