AI Model Speed Rankings
Models ranked by measured output throughput (tokens per second) and average latency.
- OpenAI o3-mini — Throughput: 3022.0 tps, Latency: 2562.33s
- ByteDance Doubao-Seedream-4.5 — Throughput: 1072.4 tps, Latency: 13428.00s
- ByteDance Seedance 2.5 — Throughput: 1014.2 tps, Latency: 362962.00s
- DeepSeek DeepSeek-V3.2 — Throughput: 1000.0 tps, Latency: 778.00s
- ByteDance Doubao-Seedream-5.0-lite — Throughput: 761.3 tps, Latency: 18915.00s
- ByteDance Seedance 2.0 — Throughput: 528.0 tps, Latency: 206241.50s
- ByteDance Seedance 2.0 Fast — Throughput: 442.9 tps, Latency: 91652.00s
- ByteDance Doubao-Seedream-5.0-pro — Throughput: 270.8 tps, Latency: 38104.50s
- OpenAI GPT-5 — Throughput: 213.8 tps, Latency: 27200.11s
- OpenAI chatgpt-image-latest — Throughput: 202.1 tps, Latency: 21885.00s
- Google Gemini 3 Flash Preview — Throughput: 189.2 tps, Latency: 9455.33s
- DeepSeek DeepSeek V4.1 Flash — Throughput: 187.0 tps, Latency: 869.65s
- OpenAI gpt-5-nano — Throughput: 179.1 tps, Latency: 3527.47s
- Google Gemini 3.6 Flash — Throughput: 173.7 tps, Latency: 11228.61s
- xAI Grok 4.20 Multi-Agent — Throughput: 162.8 tps, Latency: 0.00s
- OpenAI GPT-5.4 Mini — Throughput: 155.6 tps, Latency: 1736.31s
- OpenAI dall-e-3 — Throughput: 153.2 tps, Latency: 27251.00s
- Google Gemini 3.1 Flash-Lite — Throughput: 136.5 tps, Latency: 4920.10s
- OpenAI GPT Image 1.5 — Throughput: 133.1 tps, Latency: 41563.25s
- Z.ai GLM 5.3 — Throughput: 117.6 tps, Latency: 1262.53s
- OpenAI GPT-5.2 — Throughput: 117.0 tps, Latency: 12428.00s
- ByteDance Seedance 2.0 Mini — Throughput: 114.6 tps, Latency: 434151.00s
- OpenAI GPT Image 2.5 Dev — Throughput: 114.5 tps, Latency: 40638.46s
- OpenAI GPT-5.5 — Throughput: 113.8 tps, Latency: 11331.89s
- OpenAI GPT Image 2 Develop — Throughput: 113.7 tps, Latency: 30286.81s
- OpenAI gpt-4.1-nano — Throughput: 110.6 tps, Latency: 1807.00s
- OpenAI gpt-4-gizmo-* — Throughput: 109.2 tps, Latency: 3638.84s
- Google Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image 🍌) — Throughput: 108.3 tps, Latency: 13744.76s
- Google Gemini 3.8 Flash — Throughput: 103.7 tps, Latency: 11266.61s
- xAI grok-4-1-fast-reasoning — Throughput: 103.5 tps, Latency: 0.00s
- Alibaba qwen3-30b-a3b-thinking-2507 — Throughput: 100.9 tps, Latency: 0.00s
- xAI grok-4-0709 — Throughput: 100.6 tps, Latency: 1248.61s
- xAI Grok 4.3 — Throughput: 100.5 tps, Latency: 772.80s
- Google Gemini 3.5 Flash — Throughput: 99.3 tps, Latency: 10972.21s
- DeepSeek DeepSeek-V4-Flash 0731 — Throughput: 98.6 tps, Latency: 3690.00s
- OpenAI GPT Image 1.0 — Throughput: 97.0 tps, Latency: 42366.00s
- xAI grok-4-fast-reasoning — Throughput: 92.6 tps, Latency: 0.00s
- OpenAI GPT-5.6 Luna — Throughput: 91.7 tps, Latency: 3857.90s
- Alibaba qwen3-30b-a3b — Throughput: 91.0 tps, Latency: 0.00s
- Google Gemini 3 Pro Preview — Throughput: 90.4 tps, Latency: 2999.00s
- Alibaba qwen3-next-80b-a3b-thinking — Throughput: 89.5 tps, Latency: 0.00s
- Anthropic Claude Claude Fable 5.1 — Throughput: 88.8 tps, Latency: 23747.00s
- DeepSeek DeepSeek-V4-Flash — Throughput: 88.7 tps, Latency: 3374.00s
- xAI grok-3 — Throughput: 86.3 tps, Latency: 0.00s
- Google Gemini 3.1 Pro Preview — Throughput: 83.6 tps, Latency: 27967.30s
- Google Nano Banana (Gemini 2.5 Flash Image 🍌) — Throughput: 80.4 tps, Latency: 0.00s
- xAI grok-3-mini — Throughput: 79.5 tps, Latency: 0.00s
- Alibaba qwen3-vl-plus — Throughput: 77.2 tps, Latency: 523.00s
- xAI Grok Build 0.1 — Throughput: 77.2 tps, Latency: 0.00s
- OpenAI GPT-5.1 — Throughput: 76.7 tps, Latency: 8162.17s
- Google gemini-2.5-flash — Throughput: 75.6 tps, Latency: 1660.00s
- Google Gemini 3.7 Flash — Throughput: 73.5 tps, Latency: 6119.34s
- OpenAI gpt-image-1-mini — Throughput: 73.0 tps, Latency: 13457.00s
- Google Gemini 3.1 Flash-Lite Preview — Throughput: 72.0 tps, Latency: 10895.22s
- Z.ai GLM 4.7 — Throughput: 71.3 tps, Latency: 347.00s
- Z.ai GLM 5.2 — Throughput: 70.3 tps, Latency: 3716.25s
- OpenAI GPT-5.4 Nano — Throughput: 68.0 tps, Latency: 2267.33s
- Alibaba qwen3-235b-a22b-thinking-2507 — Throughput: 64.0 tps, Latency: 0.00s
- Google Nano Banana 2 (Gemini 3.1 Flash Image 🍌) — Throughput: 63.6 tps, Latency: 17552.79s
- xAI Grok 4.5 — Throughput: 61.8 tps, Latency: 3664.98s
- Alibaba qwen3-8b — Throughput: 60.4 tps, Latency: 0.00s
- OpenAI GPT-5.6 Terra — Throughput: 60.0 tps, Latency: 6124.40s
- Anthropic Claude Claude Sonnet 5 — Throughput: 60.0 tps, Latency: 5644.32s
- OpenAI o4-mini — Throughput: 59.0 tps, Latency: 0.00s
- OpenAI GPT-5.6 Sol — Throughput: 58.8 tps, Latency: 6181.23s
- Z.ai GLM 5 — Throughput: 58.8 tps, Latency: 1590.00s
- Z.ai GLM 5.1 — Throughput: 58.5 tps, Latency: 1187.00s
- OpenAI gpt-4o-2024-08-06 — Throughput: 58.1 tps, Latency: 0.00s
- Google gemini-2.5-pro — Throughput: 57.7 tps, Latency: 20350.50s
- xAI grok-4-1-fast-non-reasoning — Throughput: 55.6 tps, Latency: 0.00s
- MiniMax minimax-m2 — Throughput: 55.3 tps, Latency: 0.00s
- xAI Grok 4.20 — Throughput: 53.1 tps, Latency: 4127.00s
- DeepSeek deepseek-v3.1 — Throughput: 53.0 tps, Latency: 22527.00s
- Moonshot kimi-k2-thinking-turbo — Throughput: 52.7 tps, Latency: 872.00s
- xAI Grok 4.6 — Throughput: 50.6 tps, Latency: 4100.63s
- Google Gemini 3.1 Pro Preview Customtools — Throughput: 49.9 tps, Latency: 8804.00s
- OpenAI gpt-3.5-turbo — Throughput: 49.2 tps, Latency: 594.50s
- OpenAI GPT Image 2.5 Flare — Throughput: 48.1 tps, Latency: 20662.73s
- Alibaba qwen3-235b-a22b — Throughput: 48.0 tps, Latency: 0.00s
- OpenAI gpt-3.5-turbo-0125 — Throughput: 47.5 tps, Latency: 8568.29s
- Anthropic Claude Claude Opus 5 — Throughput: 45.9 tps, Latency: 4430.54s
- OpenAI gpt-5-mini — Throughput: 44.7 tps, Latency: 12960.85s
- OpenAI GPT-6 Astra — Throughput: 41.6 tps, Latency: 7821.20s
- Moonshot kimi-k2-0711-preview — Throughput: 41.3 tps, Latency: 1261.00s
- Moonshot Kimi K2.5 — Throughput: 41.1 tps, Latency: 1008.00s
- OpenAI gpt-3.5-turbo-16k — Throughput: 40.7 tps, Latency: 0.00s
- ByteDance Doubao-Seed-2.1-pro — Throughput: 40.6 tps, Latency: 0.00s
- Anthropic Claude Claude Fable 5 — Throughput: 40.0 tps, Latency: 2969.60s
- Alibaba Qwen3.6 Plus — Throughput: 39.5 tps, Latency: 0.00s
- OpenAI GPT-5.4 — Throughput: 39.2 tps, Latency: 12563.77s
- DeepSeek deepseek-v3 — Throughput: 38.0 tps, Latency: 5613.12s
- Moonshot kimi-k2-thinking — Throughput: 36.7 tps, Latency: 1080.00s
- Alibaba Qwen3.5 Plus 2026-02-15 — Throughput: 36.6 tps, Latency: 0.00s
- Z.ai GLM 5.3 Flash — Throughput: 35.6 tps, Latency: 4537.25s
- Alibaba qwen3-32b — Throughput: 35.5 tps, Latency: 0.00s
- Anthropic Claude Claude Opus 4.8 — Throughput: 35.4 tps, Latency: 3987.24s
- Alibaba qwen3-max — Throughput: 34.5 tps, Latency: 0.00s
- Anthropic Claude Claude Sonnet 4.6 — Throughput: 33.4 tps, Latency: 2927.84s
- DeepSeek DeepSeek-V4-Pro-0813 — Throughput: 33.2 tps, Latency: 1735.24s
- ByteDance Doubao-Seed-2.0-pro — Throughput: 32.6 tps, Latency: 0.00s