Mihir Mungara commited on
Commit
b475d7b
·
1 Parent(s): 6c7d1dc

graders result clampped between 0 and 1

Browse files
Files changed (1) hide show
  1. inference.py +6 -3
inference.py CHANGED
@@ -155,6 +155,9 @@ def run_task(
155
  success = False
156
  last_error = None
157
 
 
 
 
158
  while not done and step < MAX_STEPS:
159
  step += 1
160
  last_error = None
@@ -193,7 +196,7 @@ def run_task(
193
  result = env.step(action)
194
  obs = result.observation.model_dump()
195
  done = result.done
196
- reward = result.reward.total
197
  rewards.append(reward)
198
 
199
  # Check if operation failed
@@ -227,8 +230,8 @@ def run_task(
227
  print(f"[END] success={success_str} steps={step} rewards={rewards_str}")
228
 
229
  raw_score = rewards[-1] if rewards else 0.0001
230
- final_score = max(0.0001, min(0.9999, round(raw_score, 4)))
231
- safe_rewards = [max(0.0001, min(0.9999, r)) for r in rewards]
232
  return {
233
  "task_id": task_id,
234
  "final_score": final_score,
 
155
  success = False
156
  last_error = None
157
 
158
+ def clamp_score(value: float) -> float:
159
+ return max(0.0001, min(0.9999, round(value, 4)))
160
+
161
  while not done and step < MAX_STEPS:
162
  step += 1
163
  last_error = None
 
196
  result = env.step(action)
197
  obs = result.observation.model_dump()
198
  done = result.done
199
+ reward = clamp_score(result.reward.total)
200
  rewards.append(reward)
201
 
202
  # Check if operation failed
 
230
  print(f"[END] success={success_str} steps={step} rewards={rewards_str}")
231
 
232
  raw_score = rewards[-1] if rewards else 0.0001
233
+ final_score = clamp_score(raw_score)
234
+ safe_rewards = [clamp_score(r) for r in rewards]
235
  return {
236
  "task_id": task_id,
237
  "final_score": final_score,