Fix: use_cache=True, greedy decoding, model.eval() — was producing 0-char output def6c6b verified AskAtul commited on 24 days ago
Switch base image to python:3.11-slim for fresh Docker image build b97852a verified AskAtul commited on 24 days ago
Remove load_in_8bit flag to use pure FP16 model loading ece6023 verified AskAtul commited on 24 days ago
Use pure FP16 precision (~5.8 GB VRAM) for clean loading on Nvidia T4 GPU 0a560fc verified AskAtul commited on 24 days ago
Use native float16 precision for Nvidia T4 GPU (Turing architecture) f7159a3 verified AskAtul commited on 24 days ago
Use standard instruction prompt and robust extraction to prevent 0-byte outputs d66da5e verified AskAtul commited on 24 days ago
Fix prompt truncation to max 1200 tokens and add decoding fallback a773699 verified AskAtul commited on 24 days ago
Set pad_token_id and return clean JSON error messages 7247f5e verified AskAtul commited on 24 days ago
Add detailed error reporting inside summarize endpoint 28b6623 verified AskAtul commited on 24 days ago
Pin transformers==4.45.2 and tokenizers==0.20.0 for PyPreTokenizerTypeWrapper compatibility 6b5c11b verified AskAtul commited on 24 days ago
Use official BharatGen snippet: tokenizer trust_remote_code=False & torch_dtype=bfloat16 c0f7e37 verified AskAtul commited on 24 days ago
Use PreTrainedTokenizerFast(tokenizer_file=tokenizer.json) directly ad33bb4 verified AskAtul commited on 24 days ago
Use LlamaTokenizer directly to force pure Python tokenizer loading b5701c3 verified AskAtul commited on 24 days ago
Pin exact transformers==4.38.2 and tokenizers==0.15.2 wheel pair 26f4c31 verified AskAtul commited on 24 days ago
Set use_safetensors=True for sharded model weights loading ac24bf5 verified AskAtul commited on 24 days ago
Pin transformers==4.40.2 matching model config.json transformers_version 0e0e8fb verified AskAtul commited on 24 days ago
Pin transformers==4.35.2 with sentencepiece & fast-api ed66126 verified AskAtul commited on 24 days ago
Convert app.py to FastAPI high-performance REST service 856da87 verified AskAtul commited on 24 days ago
Set sdk_version to 3.50.2 to fix Gradio 4 localhost check & jinja2 template dict error 951fd3e verified AskAtul commited on 24 days ago
Pin transformers==4.40.2 to fix PyPreTokenizerTypeWrapper enum parsing in tokenizer.json 83b342d verified AskAtul commited on 24 days ago
Use gr.Blocks with explicit api_name=summarize_legal_case and share=True 14dbd72 verified AskAtul commited on 24 days ago
Use default demo.launch() for HuggingFace Space environment 25fa9de verified AskAtul commited on 24 days ago
Add server_name=0.0.0.0 and server_port=7860 to demo.launch for HF Space docker container 610285d verified AskAtul commited on 24 days ago
Pin transformers==4.35.2 for compatibility with ParamBharatGen custom model code 1b6c002 verified AskAtul commited on 24 days ago
Set use_cache=False to completely bypass DynamicCache indexing in custom model code 53c9f15 verified AskAtul commited on 24 days ago
Add return_legacy_cache=True to fix DynamicCache tuple indexing in custom model code 29a91ff verified AskAtul commited on 24 days ago
Upload clean scratch/app.py without shell string escaping 8e3f258 verified AskAtul commited on 24 days ago