pushpam14 commited on
Commit
709ba83
·
verified ·
1 Parent(s): c86f59b

Upload folder using huggingface_hub

Browse files
Files changed (1) hide show
  1. inference.py +4 -3
inference.py CHANGED
@@ -82,7 +82,7 @@ def log_end(
82
  ) -> None:
83
  rewards_str = ",".join(f"{r:.2f}" for r in rewards)
84
  print(
85
- f"[END] success={str(success).lower()} steps={steps} rewards={rewards_str}",
86
  flush=True,
87
  )
88
 
@@ -262,7 +262,7 @@ async def run_single_task(
262
  history: List[str] = []
263
  rewards: List[float] = []
264
  steps_taken = 0
265
- score = 0.0
266
  success = False
267
 
268
  log_start(task=task_name, env=BENCHMARK, model=MODEL_NAME)
@@ -313,7 +313,8 @@ async def run_single_task(
313
  score = (
314
  correct_count / total_violations if total_violations > 0 else 0.0
315
  )
316
- score = min(max(score, 0.0), 1.0)
 
317
  success = score >= SUCCESS_SCORE_THRESHOLD
318
 
319
  finally:
 
82
  ) -> None:
83
  rewards_str = ",".join(f"{r:.2f}" for r in rewards)
84
  print(
85
+ f"[END] success={str(success).lower()} steps={steps} score={score:.2f} rewards={rewards_str}",
86
  flush=True,
87
  )
88
 
 
262
  history: List[str] = []
263
  rewards: List[float] = []
264
  steps_taken = 0
265
+ score = 0.01 # default: strictly > 0 as required by evaluator
266
  success = False
267
 
268
  log_start(task=task_name, env=BENCHMARK, model=MODEL_NAME)
 
313
  score = (
314
  correct_count / total_violations if total_violations > 0 else 0.0
315
  )
316
+ # Clamp to strictly (0, 1) — evaluator rejects 0.0 and 1.0 exactly
317
+ score = min(max(score, 0.01), 0.99)
318
  success = score >= SUCCESS_SCORE_THRESHOLD
319
 
320
  finally: