Try it — type any question below

💸 EconRouteCost Console
ws: connecting
Checking health...

Total theoretical savings

$0.0335

vs GPT-4o baseline · $0.00 actual spend

Cache savings: 44.5%Routing savings: 55.5%

Pipeline Flow

📨

Incoming Request

POST /v1/chat/completions

--
💾

Semantic Cache

Redis · cosine ≥ 0.92

17% hit
🔍

Complexity Classifier

semantic-router · 3 routes

83% routed

groq/openai/gpt-oss-20b

~150ms · simplest queries

20%

groq/llama-3.3-70b-versatile

~400ms · explanations

20%

groq/openai/gpt-oss-120b

~800ms · reasoning

60%
🖥

Ollama Fallback

qwen2.5 / llama3.2

0%

cache hit rate

16.7%

fallback rate

0.0%

classifier accuracy

88.3%

total requests

6

Model distribution

gpt-oss-20b1 (20.0%)
llama-3.3-70b-versatile1 (20.0%)
gpt-oss-120b3 (60.0%)
ollama (fallback)0 (0.0%)
Time Model TokensLatency Savings Routing
21:20:05groq/openai/gpt-oss-120b7339900ms$0.000000classifier · complex
18:47:41groq/llama-3.3-70b-versatile392751615ms$0.004149classifier · medium
12:31:37groq/openai/gpt-oss-120b7717864764ms$0.000000classifier · complex
12:30:50cache8990798ms$0.014890cache · cosine match
12:29:53groq/openai/gpt-oss-20b7710241961ms$0.014446classifier · simple
6 total requests
1 / 2