Spaces:
Sleeping
Sleeping
Upload folder using huggingface_hub
Browse files- inference.py +4 -3
inference.py
CHANGED
|
@@ -82,7 +82,7 @@ def log_end(
|
|
| 82 |
) -> None:
|
| 83 |
rewards_str = ",".join(f"{r:.2f}" for r in rewards)
|
| 84 |
print(
|
| 85 |
-
f"[END] success={str(success).lower()} steps={steps} rewards={rewards_str}",
|
| 86 |
flush=True,
|
| 87 |
)
|
| 88 |
|
|
@@ -262,7 +262,7 @@ async def run_single_task(
|
|
| 262 |
history: List[str] = []
|
| 263 |
rewards: List[float] = []
|
| 264 |
steps_taken = 0
|
| 265 |
-
score = 0.0
|
| 266 |
success = False
|
| 267 |
|
| 268 |
log_start(task=task_name, env=BENCHMARK, model=MODEL_NAME)
|
|
@@ -313,7 +313,8 @@ async def run_single_task(
|
|
| 313 |
score = (
|
| 314 |
correct_count / total_violations if total_violations > 0 else 0.0
|
| 315 |
)
|
| 316 |
-
|
|
|
|
| 317 |
success = score >= SUCCESS_SCORE_THRESHOLD
|
| 318 |
|
| 319 |
finally:
|
|
|
|
| 82 |
) -> None:
|
| 83 |
rewards_str = ",".join(f"{r:.2f}" for r in rewards)
|
| 84 |
print(
|
| 85 |
+
f"[END] success={str(success).lower()} steps={steps} score={score:.2f} rewards={rewards_str}",
|
| 86 |
flush=True,
|
| 87 |
)
|
| 88 |
|
|
|
|
| 262 |
history: List[str] = []
|
| 263 |
rewards: List[float] = []
|
| 264 |
steps_taken = 0
|
| 265 |
+
score = 0.01 # default: strictly > 0 as required by evaluator
|
| 266 |
success = False
|
| 267 |
|
| 268 |
log_start(task=task_name, env=BENCHMARK, model=MODEL_NAME)
|
|
|
|
| 313 |
score = (
|
| 314 |
correct_count / total_violations if total_violations > 0 else 0.0
|
| 315 |
)
|
| 316 |
+
# Clamp to strictly (0, 1) — evaluator rejects 0.0 and 1.0 exactly
|
| 317 |
+
score = min(max(score, 0.01), 0.99)
|
| 318 |
success = score >= SUCCESS_SCORE_THRESHOLD
|
| 319 |
|
| 320 |
finally:
|