feat: add real empirical benchmark harness with /run_benchmark endpoint ae7c56f MaduRox commited on 7 days ago
docs: update Swagger tab with complete PowerShell, Python, JS, and cURL 2-step REST examples 095ce37 MaduRox commited on 7 days ago
fix: configure clean chat template and hybrid RIF sliding window on T4 GPU 74aa433 MaduRox commited on 7 days ago
fix: add system prompt, top_p, and repetition_penalty to prevent small model loop ef5ecdb MaduRox commited on 7 days ago
fix: restore native Gradio 5 launcher for ZeroGPU prestart hooks 38dbeb1 MaduRox commited on 7 days ago
feat: add FastAPI server with Live Swagger UI, OpenAI endpoints, and CORS c8f0400 MaduRox commited on 7 days ago
feat: upgrade holographic resolution to 2048 bands on NVIDIA A100 1e0f5c6 MaduRox commited on 7 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU 6018bf3 MaduRox commited on 8 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU 01c6ddb MaduRox commited on 8 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU c23e3c7 MaduRox commited on 8 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU 37d0686 MaduRox commited on 8 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU b1909b4 MaduRox commited on 8 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU efb9f26 MaduRox commited on 8 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU 1a668ac MaduRox commited on 8 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU ab09287 MaduRox commited on 8 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU 21e9521 MaduRox commited on 8 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU c828501 MaduRox commited on 8 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU 2a33d72 MaduRox commited on 8 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU 7fc1739 MaduRox commited on 8 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU 2e4d3c6 MaduRox commited on 8 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU c07d3e6 MaduRox commited on 8 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU 110959e MaduRox commited on 9 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU 2f6a704 MaduRox commited on 9 days ago
feat: integrate KalpanaDynamicCache into all 24 layers of Qwen2.5 on ZeroGPU b6b8b5d MaduRox commited on 9 days ago
fix: resolve AttributeError on llm.DEFAULT_MODELS in Gradio UI startup b879636 Madusha Perera commited on 17 days ago
fix: define _RATE_WINDOWS dict to prevent server 500 error 607fdc9 Madusha Perera commited on 17 days ago
feat: GET /v1/models returns ONLY user-registered provider models e197e6c Madusha Perera commited on 17 days ago
feat: enforce registered provider keys and remove HF serverless fallbacks 562cddf Madusha Perera commited on 18 days ago
fix: add 429 rate limit formatting and boilerplate chunk filtering for story retrieval a0f0d11 Madusha Perera commited on 18 days ago
fix: correct cost comparison formula based on full uncompressed document size vs compressed RIF tokens 6a02f22 Madusha Perera commited on 18 days ago
feat: expand RIF retrieval to 1600 tokens and enable natural synthesis system prompt 1246a60 Madusha Perera commited on 18 days ago
fix: report registered provider key errors explicitly in chat response 66181bf Madusha Perera commited on 18 days ago
fix: route gemini and registered model IDs to custom provider API caller aff6204 Madusha Perera commited on 18 days ago
fix: add browser User-Agent header to HF router requests for live LLM inference 048f6f9 Madusha Perera commited on 18 days ago
fix: clear custom provider fallback on error and add /v1/providers/reset endpoint a0b26e4 Madusha Perera commited on 18 days ago
feat: add Google Gemini support and global latest_provider fallback e311056 Madusha Perera commited on 18 days ago