All AI models · LLM benchmarks · Methodology

Alibaba

Qwen2.5 72B

Qwen instruction model for multilingual chat, reasoning, and tool use

Model facts

Context window
131K tokens
Maximum output
8K tokens
Cheapest paid input
$0.11 per 1M tokens
Cheapest paid output
$0.38 per 1M tokens
Open weights
yes
Providers
7

Capabilities and modalities

tool calling, structured output, temperature control, open weights, text.

Local hardware estimate

At 4K context: Q4_K_M 45.5 GiB, Q8_0 79.3 GiB, F16 142.8 GiB working memory.

Parameters
72.7 billion
Architecture
qwen2
Model license
other

Planning estimate adapted from the MIT-licensed whichllm estimator using metadata from Hugging Face; not a vendor minimum requirement.

Artificial Analysis benchmarks

Compare this model on the full LLM benchmark leaderboard.

ConfigurationAAICodingMathOutput tokens/s
default9.4not measured14.0not measured

Observed price history

  • 2026-08-24: $0.11 input / $0.38 output per 1M tokens

API providers

  • Abacus — model id Qwen/Qwen2.5-72B-Instruct; $0.11 input / $0.38 output per 1M tokens; provider documentation
  • Kilo Gateway — model id qwen/qwen-2.5-72b-instruct; $0.36 input / $0.4 output per 1M tokens; provider documentation
  • OpenRouter — model id qwen/qwen-2.5-72b-instruct; $0.36 input / $0.4 output per 1M tokens; provider documentation
  • NanoGPT — model id qwen/qwen-2.5-72b-instruct; $0.357 input / $0.408 output per 1M tokens; provider documentation
  • NovitaAI — model id qwen/qwen-2.5-72b-instruct; $0.38 input / $0.4 output per 1M tokens; provider documentation
  • Alibaba (China) — model id qwen2-5-72b-instruct; $0.574 input / $1.72 output per 1M tokens; provider documentation
  • Alibaba — model id qwen2-5-72b-instruct; $1.4 input / $5.6 output per 1M tokens; provider documentation