aditya0103's picture
Initial commit: schemas, extraction engine, dataset prep, 54 passing tests
44c2f50
Raw
History Blame Contribute Delete
1.5 kB
# ============================================================
# Environment variables for structured-data-extraction
# Copy this file to `.env` and fill in real values.
# NEVER commit `.env` β€” it is in .gitignore.
# ============================================================
# --- OpenAI ---
OPENAI_API_KEY=sk-your-key-here
# Default extraction model. Swap to gpt-5.4 or gpt-5.5 for benchmarking.
# gpt-5-nano recommended: 400K context, vision, structured outputs, ~50x cheaper than gpt-4o.
OPENAI_MODEL=gpt-5-nano
OPENAI_VISION_MODEL=gpt-5-nano
OPENAI_MAX_RETRIES=3
OPENAI_REQUEST_TIMEOUT=60
# Alternative models to benchmark against (used by eval harness --model flag):
# gpt-5-nano β€” fastest, cheapest, ideal for extraction
# gpt-5-mini β€” mid-tier low-latency
# gpt-5.4 β€” balanced quality/cost
# gpt-5.5 β€” flagship reasoning
# --- App ---
APP_ENV=development # development | production
LOG_LEVEL=INFO # DEBUG | INFO | WARNING | ERROR
API_HOST=0.0.0.0
API_PORT=8000
STREAMLIT_PORT=8501
# --- Cost tracking (per 1K tokens) ---
# Defaults reflect gpt-5-nano pricing. Update if you swap OPENAI_MODEL.
# gpt-5-nano: input 0.00005 / output 0.00040
# gpt-5-mini: input 0.00040 / output 0.00160 (approx)
# gpt-5.4: input 0.00250 / output 0.01500
# gpt-5.5: input 0.00500 / output 0.03000
COST_PER_1K_INPUT_TOKENS=0.00005
COST_PER_1K_OUTPUT_TOKENS=0.00040
# --- SEC EDGAR (v2) ---
SEC_USER_AGENT="ASP Research adityapatel1801@gmail.com"