Spaces:
Running on Zero
Running on Zero
Update app.py
Browse files
app.py
CHANGED
|
@@ -110,18 +110,18 @@ def run_inference(user_prompt, max_tokens, temperature, top_k, top_p, rep_penalt
|
|
| 110 |
@spaces.GPU
|
| 111 |
def run_inference_gpu(user_prompt, max_tokens, temperature, top_k, top_p, rep_penalty, ngram_size, do_sample):
|
| 112 |
max_retries = 5
|
| 113 |
-
|
| 114 |
-
|
| 115 |
-
|
| 116 |
-
|
| 117 |
-
|
| 118 |
-
|
| 119 |
-
|
| 120 |
-
|
| 121 |
-
|
| 122 |
-
|
| 123 |
-
|
| 124 |
-
|
| 125 |
|
| 126 |
yield from run_inference_raw(user_prompt, max_tokens, temperature, top_k, top_p, rep_penalty, ngram_size, do_sample, use_cuda=True)
|
| 127 |
|
|
|
|
| 110 |
@spaces.GPU
|
| 111 |
def run_inference_gpu(user_prompt, max_tokens, temperature, top_k, top_p, rep_penalty, ngram_size, do_sample):
|
| 112 |
max_retries = 5
|
| 113 |
+
for attempt in range(max_retries):
|
| 114 |
+
try:
|
| 115 |
+
if model_manager.model is not None:
|
| 116 |
+
model_manager.model = model_manager.model.to("cuda")
|
| 117 |
+
break
|
| 118 |
+
except RuntimeError as e:
|
| 119 |
+
if "CUDA" in str(e) and attempt < max_retries - 1:
|
| 120 |
+
yield f"Waiting for Hugging Face ZeroGPU allocation (Attempt {attempt+1}/{max_retries})...", "Queueing..."
|
| 121 |
+
time.sleep(2)
|
| 122 |
+
else:
|
| 123 |
+
yield f"ZeroGPU initialization failed: {str(e)}. Try clicking Generate again.", "GPU Unavailable"
|
| 124 |
+
return
|
| 125 |
|
| 126 |
yield from run_inference_raw(user_prompt, max_tokens, temperature, top_k, top_p, rep_penalty, ngram_size, do_sample, use_cuda=True)
|
| 127 |
|