Model Performance — latency & throughput comparison.
P50/P95/P99 latency percentiles, throughput, and success rates across all gateway models. Computed from the last 14 days of traffic.
Best P95 Latency
620ms
Cerebras
Fastest Avg Latency
310ms
Cerebras
Highest Success Rate
100%
Gemini Pro
Most Used Model
445
reqs — DS Chat
Performance comparison
| Model | Requests | P50 | P95 | Avg Latency | Tokens/req | Success % |
|---|
| Cerebras · Llama 3.3 70B | 312 | 280ms | 620ms | 310ms | 4K | 99% |
| Groq · Llama 3.3 70B | 187 | 310ms | 780ms | 360ms | 4K | 98% |
| DeepSeek Chat | 445 | 1.1s | 3.2s | 1.4s | 5K | 98% |
| DeepSeek Reasoner | 64 | 4.2s | 9.8s | 5.1s | 7K | 98% |
| Claude Haiku 4.5 | 231 | 850ms | 2.1s | 980ms | 4K | 98% |
| Gemini 2.5 Flash | 98 | 520ms | 1.4s | 610ms | 3K | 99% |
| Gemini 2.5 Pro | 42 | 2.2s | 5.6s | 2.6s | 4K | 100% |
Latency percentiles — P50 / P95 / P99
Error & throughput summary
1Cerebras312 reqs2 err99% 4DS Reason64 reqs1 err98% 5Haiku 4.5231 reqs4 err98% 6Gemini Flash98 reqs1 err99% 7Gemini Pro42 reqs0 err100%