Model Performance — latency & throughput comparison.
P50/P95/P99 latency percentiles, throughput, and success rates across all gateway models. Computed from the last 7 days of traffic.
Best P95 Latency
620ms
Cerebras
Fastest Avg Latency
310ms
Cerebras
Highest Success Rate
100%
Gemini Pro
Most Used Model
445
reqs — DS Chat
Performance comparison
| Model | Requests | P50 | P95 | Avg Latency | Tokens/req | Success % |
|---|
| Cerebras · Llama 3.3 70B | 312 | 280ms | 620ms | 310ms | 4K | 99% |
| Groq · Llama 3.3 70B | 187 | 310ms | 780ms | 360ms | 4K | 98% |
| DeepSeek Chat | 445 | 1.1s | 3.2s | 1.4s | 5K | 98% |
| DeepSeek Reasoner | 64 | 4.2s | 9.8s | 5.1s | 7K | 98% |
| Claude Haiku 4.5 | 231 | 850ms | 2.1s | 980ms | 4K | 98% |
| Gemini 2.5 Flash | 98 | 520ms | 1.4s | 610ms | 3K | 99% |
| Gemini 2.5 Pro | 42 | 2.2s | 5.6s | 2.6s | 4K | 100% |
Latency percentiles — P50 / P95 / P99
Error & throughput summary
1Cerebras312 reqs2 err99% 4DS Reason64 reqs1 err98% 5Haiku 4.5231 reqs4 err98% 6Gemini Flash98 reqs1 err99% 7Gemini Pro42 reqs0 err100%