File size: 2,354 Bytes
6e8d20e
 
 
 
 
8a841b2
6e8d20e
 
8a841b2
 
 
 
 
6e8d20e
 
 
 
 
 
8a841b2
 
 
 
 
 
6e8d20e
 
 
8a841b2
6e8d20e
 
 
8a841b2
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
6e8d20e
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
# InferRoute Environment Configuration

# Execution Environment (development/production)
ENV=development

# ── Core API Keys ────────────────────────────────────────────────────────────
OPENAI_API_KEY=your-openai-api-key-here

# Google Gemini
GEMINI_API_KEY=your-gemini-api-key-here
GEMINI_MODEL=gemini-1.5-flash
MOCK_GEMINI=True

# Local Inference (vLLM) Settings
# When MOCK_VLLM=True, requests to vLLM are simulated locally without needing a GPU.
MOCK_VLLM=True
VLLM_API_URL=http://localhost:8000/v1
VLLM_API_KEY=mock-vllm-key

# Local Ollama
OLLAMA_API_URL=http://localhost:11434
OLLAMA_MODEL=llama3
MOCK_OLLAMA=True

# ── Database Connections ──────────────────────────────────────────────────────
DATABASE_URL=postgresql+asyncpg://postgres:postgres@localhost:5432/inferroute
REDIS_URL=redis://localhost:6379/0

# ── Gateway Administration ────────────────────────────────────────────────────
ADMIN_API_KEY=admin-secret
DEFAULT_RATE_LIMIT_RPM=60

# ── SLO Targets (milliseconds) ────────────────────────────────────────────────
SLO_P50_MS=500.0
SLO_P95_MS=2000.0
SLO_P99_MS=5000.0

# ── Circuit Breaker ───────────────────────────────────────────────────────────
CB_FAILURE_THRESHOLD=5
CB_RECOVERY_TIMEOUT_S=30
CB_SUCCESS_THRESHOLD=2

# ── Caching ───────────────────────────────────────────────────────────────────
CACHE_MAX_SIZE_MB=512
CACHE_PREFIX_MAX_CHARS=256
CACHE_DEDUP_ENABLED=True
CACHE_DEDUP_TIMEOUT_S=30

# ── Observability Configuration ───────────────────────────────────────────────
OTEL_EXPORTER_OTLP_ENDPOINT=http://localhost:4317