AI Model Speed Rankings

Models ranked by measured output throughput (tokens per second) and average latency.

  1. OpenAI o3-mini — Throughput: 3022.0 tps, Latency: 2562.33s
  2. ByteDance Doubao-Seedream-4.5 — Throughput: 1072.4 tps, Latency: 13428.00s
  3. ByteDance Seedance 2.5 — Throughput: 1014.2 tps, Latency: 362962.00s
  4. DeepSeek DeepSeek-V3.2 — Throughput: 1000.0 tps, Latency: 778.00s
  5. ByteDance Doubao-Seedream-5.0-lite — Throughput: 761.3 tps, Latency: 18915.00s
  6. ByteDance Seedance 2.0 — Throughput: 528.0 tps, Latency: 206241.50s
  7. ByteDance Seedance 2.0 Fast — Throughput: 442.9 tps, Latency: 91652.00s
  8. ByteDance Doubao-Seedream-5.0-pro — Throughput: 270.8 tps, Latency: 38104.50s
  9. OpenAI GPT-5 — Throughput: 213.8 tps, Latency: 27200.11s
  10. OpenAI chatgpt-image-latest — Throughput: 202.1 tps, Latency: 21885.00s
  11. Google Gemini 3 Flash Preview — Throughput: 189.2 tps, Latency: 9455.33s
  12. DeepSeek DeepSeek V4.1 Flash — Throughput: 187.0 tps, Latency: 869.65s
  13. OpenAI gpt-5-nano — Throughput: 179.1 tps, Latency: 3527.47s
  14. Google Gemini 3.6 Flash — Throughput: 173.7 tps, Latency: 11228.61s
  15. xAI Grok 4.20 Multi-Agent — Throughput: 162.8 tps, Latency: 0.00s
  16. OpenAI GPT-5.4 Mini — Throughput: 155.6 tps, Latency: 1736.31s
  17. OpenAI dall-e-3 — Throughput: 153.2 tps, Latency: 27251.00s
  18. Google Gemini 3.1 Flash-Lite — Throughput: 136.5 tps, Latency: 4920.10s
  19. OpenAI GPT Image 1.5 — Throughput: 133.1 tps, Latency: 41563.25s
  20. Z.ai GLM 5.3 — Throughput: 117.6 tps, Latency: 1262.53s
  21. OpenAI GPT-5.2 — Throughput: 117.0 tps, Latency: 12428.00s
  22. ByteDance Seedance 2.0 Mini — Throughput: 114.6 tps, Latency: 434151.00s
  23. OpenAI GPT Image 2.5 Dev — Throughput: 114.5 tps, Latency: 40638.46s
  24. OpenAI GPT-5.5 — Throughput: 113.8 tps, Latency: 11331.89s
  25. OpenAI GPT Image 2 Develop — Throughput: 113.7 tps, Latency: 30286.81s
  26. OpenAI gpt-4.1-nano — Throughput: 110.6 tps, Latency: 1807.00s
  27. OpenAI gpt-4-gizmo-* — Throughput: 109.2 tps, Latency: 3638.84s
  28. Google Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image 🍌) — Throughput: 108.3 tps, Latency: 13744.76s
  29. Google Gemini 3.8 Flash — Throughput: 103.7 tps, Latency: 11266.61s
  30. xAI grok-4-1-fast-reasoning — Throughput: 103.5 tps, Latency: 0.00s
  31. Alibaba qwen3-30b-a3b-thinking-2507 — Throughput: 100.9 tps, Latency: 0.00s
  32. xAI grok-4-0709 — Throughput: 100.6 tps, Latency: 1248.61s
  33. xAI Grok 4.3 — Throughput: 100.5 tps, Latency: 772.80s
  34. Google Gemini 3.5 Flash — Throughput: 99.3 tps, Latency: 10972.21s
  35. DeepSeek DeepSeek-V4-Flash 0731 — Throughput: 98.6 tps, Latency: 3690.00s
  36. OpenAI GPT Image 1.0 — Throughput: 97.0 tps, Latency: 42366.00s
  37. xAI grok-4-fast-reasoning — Throughput: 92.6 tps, Latency: 0.00s
  38. OpenAI GPT-5.6 Luna — Throughput: 91.7 tps, Latency: 3857.90s
  39. Alibaba qwen3-30b-a3b — Throughput: 91.0 tps, Latency: 0.00s
  40. Google Gemini 3 Pro Preview — Throughput: 90.4 tps, Latency: 2999.00s
  41. Alibaba qwen3-next-80b-a3b-thinking — Throughput: 89.5 tps, Latency: 0.00s
  42. Anthropic Claude Claude Fable 5.1 — Throughput: 88.8 tps, Latency: 23747.00s
  43. DeepSeek DeepSeek-V4-Flash — Throughput: 88.7 tps, Latency: 3374.00s
  44. xAI grok-3 — Throughput: 86.3 tps, Latency: 0.00s
  45. Google Gemini 3.1 Pro Preview — Throughput: 83.6 tps, Latency: 27967.30s
  46. Google Nano Banana (Gemini 2.5 Flash Image 🍌) — Throughput: 80.4 tps, Latency: 0.00s
  47. xAI grok-3-mini — Throughput: 79.5 tps, Latency: 0.00s
  48. Alibaba qwen3-vl-plus — Throughput: 77.2 tps, Latency: 523.00s
  49. xAI Grok Build 0.1 — Throughput: 77.2 tps, Latency: 0.00s
  50. OpenAI GPT-5.1 — Throughput: 76.7 tps, Latency: 8162.17s
  51. Google gemini-2.5-flash — Throughput: 75.6 tps, Latency: 1660.00s
  52. Google Gemini 3.7 Flash — Throughput: 73.5 tps, Latency: 6119.34s
  53. OpenAI gpt-image-1-mini — Throughput: 73.0 tps, Latency: 13457.00s
  54. Google Gemini 3.1 Flash-Lite Preview — Throughput: 72.0 tps, Latency: 10895.22s
  55. Z.ai GLM 4.7 — Throughput: 71.3 tps, Latency: 347.00s
  56. Z.ai GLM 5.2 — Throughput: 70.3 tps, Latency: 3716.25s
  57. OpenAI GPT-5.4 Nano — Throughput: 68.0 tps, Latency: 2267.33s
  58. Alibaba qwen3-235b-a22b-thinking-2507 — Throughput: 64.0 tps, Latency: 0.00s
  59. Google Nano Banana 2 (Gemini 3.1 Flash Image 🍌) — Throughput: 63.6 tps, Latency: 17552.79s
  60. xAI Grok 4.5 — Throughput: 61.8 tps, Latency: 3664.98s
  61. Alibaba qwen3-8b — Throughput: 60.4 tps, Latency: 0.00s
  62. OpenAI GPT-5.6 Terra — Throughput: 60.0 tps, Latency: 6124.40s
  63. Anthropic Claude Claude Sonnet 5 — Throughput: 60.0 tps, Latency: 5644.32s
  64. OpenAI o4-mini — Throughput: 59.0 tps, Latency: 0.00s
  65. OpenAI GPT-5.6 Sol — Throughput: 58.8 tps, Latency: 6181.23s
  66. Z.ai GLM 5 — Throughput: 58.8 tps, Latency: 1590.00s
  67. Z.ai GLM 5.1 — Throughput: 58.5 tps, Latency: 1187.00s
  68. OpenAI gpt-4o-2024-08-06 — Throughput: 58.1 tps, Latency: 0.00s
  69. Google gemini-2.5-pro — Throughput: 57.7 tps, Latency: 20350.50s
  70. xAI grok-4-1-fast-non-reasoning — Throughput: 55.6 tps, Latency: 0.00s
  71. MiniMax minimax-m2 — Throughput: 55.3 tps, Latency: 0.00s
  72. xAI Grok 4.20 — Throughput: 53.1 tps, Latency: 4127.00s
  73. DeepSeek deepseek-v3.1 — Throughput: 53.0 tps, Latency: 22527.00s
  74. Moonshot kimi-k2-thinking-turbo — Throughput: 52.7 tps, Latency: 872.00s
  75. xAI Grok 4.6 — Throughput: 50.6 tps, Latency: 4100.63s
  76. Google Gemini 3.1 Pro Preview Customtools — Throughput: 49.9 tps, Latency: 8804.00s
  77. OpenAI gpt-3.5-turbo — Throughput: 49.2 tps, Latency: 594.50s
  78. OpenAI GPT Image 2.5 Flare — Throughput: 48.1 tps, Latency: 20662.73s
  79. Alibaba qwen3-235b-a22b — Throughput: 48.0 tps, Latency: 0.00s
  80. OpenAI gpt-3.5-turbo-0125 — Throughput: 47.5 tps, Latency: 8568.29s
  81. Anthropic Claude Claude Opus 5 — Throughput: 45.9 tps, Latency: 4430.54s
  82. OpenAI gpt-5-mini — Throughput: 44.7 tps, Latency: 12960.85s
  83. OpenAI GPT-6 Astra — Throughput: 41.6 tps, Latency: 7821.20s
  84. Moonshot kimi-k2-0711-preview — Throughput: 41.3 tps, Latency: 1261.00s
  85. Moonshot Kimi K2.5 — Throughput: 41.1 tps, Latency: 1008.00s
  86. OpenAI gpt-3.5-turbo-16k — Throughput: 40.7 tps, Latency: 0.00s
  87. ByteDance Doubao-Seed-2.1-pro — Throughput: 40.6 tps, Latency: 0.00s
  88. Anthropic Claude Claude Fable 5 — Throughput: 40.0 tps, Latency: 2969.60s
  89. Alibaba Qwen3.6 Plus — Throughput: 39.5 tps, Latency: 0.00s
  90. OpenAI GPT-5.4 — Throughput: 39.2 tps, Latency: 12563.77s
  91. DeepSeek deepseek-v3 — Throughput: 38.0 tps, Latency: 5613.12s
  92. Moonshot kimi-k2-thinking — Throughput: 36.7 tps, Latency: 1080.00s
  93. Alibaba Qwen3.5 Plus 2026-02-15 — Throughput: 36.6 tps, Latency: 0.00s
  94. Z.ai GLM 5.3 Flash — Throughput: 35.6 tps, Latency: 4537.25s
  95. Alibaba qwen3-32b — Throughput: 35.5 tps, Latency: 0.00s
  96. Anthropic Claude Claude Opus 4.8 — Throughput: 35.4 tps, Latency: 3987.24s
  97. Alibaba qwen3-max — Throughput: 34.5 tps, Latency: 0.00s
  98. Anthropic Claude Claude Sonnet 4.6 — Throughput: 33.4 tps, Latency: 2927.84s
  99. DeepSeek DeepSeek-V4-Pro-0813 — Throughput: 33.2 tps, Latency: 1735.24s
  100. ByteDance Doubao-Seed-2.0-pro — Throughput: 32.6 tps, Latency: 0.00s