Spaces:
Sleeping
Sleeping
Mihir Mungara commited on
Commit ·
b475d7b
1
Parent(s): 6c7d1dc
graders result clampped between 0 and 1
Browse files- inference.py +6 -3
inference.py
CHANGED
|
@@ -155,6 +155,9 @@ def run_task(
|
|
| 155 |
success = False
|
| 156 |
last_error = None
|
| 157 |
|
|
|
|
|
|
|
|
|
|
| 158 |
while not done and step < MAX_STEPS:
|
| 159 |
step += 1
|
| 160 |
last_error = None
|
|
@@ -193,7 +196,7 @@ def run_task(
|
|
| 193 |
result = env.step(action)
|
| 194 |
obs = result.observation.model_dump()
|
| 195 |
done = result.done
|
| 196 |
-
reward = result.reward.total
|
| 197 |
rewards.append(reward)
|
| 198 |
|
| 199 |
# Check if operation failed
|
|
@@ -227,8 +230,8 @@ def run_task(
|
|
| 227 |
print(f"[END] success={success_str} steps={step} rewards={rewards_str}")
|
| 228 |
|
| 229 |
raw_score = rewards[-1] if rewards else 0.0001
|
| 230 |
-
final_score =
|
| 231 |
-
safe_rewards = [
|
| 232 |
return {
|
| 233 |
"task_id": task_id,
|
| 234 |
"final_score": final_score,
|
|
|
|
| 155 |
success = False
|
| 156 |
last_error = None
|
| 157 |
|
| 158 |
+
def clamp_score(value: float) -> float:
|
| 159 |
+
return max(0.0001, min(0.9999, round(value, 4)))
|
| 160 |
+
|
| 161 |
while not done and step < MAX_STEPS:
|
| 162 |
step += 1
|
| 163 |
last_error = None
|
|
|
|
| 196 |
result = env.step(action)
|
| 197 |
obs = result.observation.model_dump()
|
| 198 |
done = result.done
|
| 199 |
+
reward = clamp_score(result.reward.total)
|
| 200 |
rewards.append(reward)
|
| 201 |
|
| 202 |
# Check if operation failed
|
|
|
|
| 230 |
print(f"[END] success={success_str} steps={step} rewards={rewards_str}")
|
| 231 |
|
| 232 |
raw_score = rewards[-1] if rewards else 0.0001
|
| 233 |
+
final_score = clamp_score(raw_score)
|
| 234 |
+
safe_rewards = [clamp_score(r) for r in rewards]
|
| 235 |
return {
|
| 236 |
"task_id": task_id,
|
| 237 |
"final_score": final_score,
|