Mihir Mungara commited on
Commit
6c7d1dc
·
1 Parent(s): b95eda5

once again changed logic for clamping reward b/w 0 and 1

Browse files
Files changed (1) hide show
  1. inference.py +4 -3
inference.py CHANGED
@@ -223,16 +223,17 @@ def run_task(
223
 
224
  # [END] line - required format
225
  success_str = "true" if success else "false"
226
- rewards_str = ",".join([f"{r:.2f}" for r in rewards])
227
  print(f"[END] success={success_str} steps={step} rewards={rewards_str}")
228
 
229
  raw_score = rewards[-1] if rewards else 0.0001
230
  final_score = max(0.0001, min(0.9999, round(raw_score, 4)))
 
231
  return {
232
  "task_id": task_id,
233
  "final_score": final_score,
234
  "steps": step,
235
- "rewards": rewards,
236
  "actions": actions_taken,
237
  "success": success
238
  }
@@ -273,7 +274,7 @@ def main():
273
  output = {
274
  "model": MODEL_NAME,
275
  "tasks": all_results,
276
- "average_score": round(sum(r.get("final_score", 0.0) for r in all_results) / len(all_results), 4)
277
  }
278
  with open("baseline_results.json", "w") as f:
279
  json.dump(output, f, indent=2)
 
223
 
224
  # [END] line - required format
225
  success_str = "true" if success else "false"
226
+ rewards_str = ",".join([f"{max(0.0001, min(0.9999, r)):.4f}" for r in rewards])
227
  print(f"[END] success={success_str} steps={step} rewards={rewards_str}")
228
 
229
  raw_score = rewards[-1] if rewards else 0.0001
230
  final_score = max(0.0001, min(0.9999, round(raw_score, 4)))
231
+ safe_rewards = [max(0.0001, min(0.9999, r)) for r in rewards]
232
  return {
233
  "task_id": task_id,
234
  "final_score": final_score,
235
  "steps": step,
236
+ "rewards": safe_rewards,
237
  "actions": actions_taken,
238
  "success": success
239
  }
 
274
  output = {
275
  "model": MODEL_NAME,
276
  "tasks": all_results,
277
+ "average_score": max(0.0001, min(0.9999, round(sum(r.get("final_score", 0.0001) for r in all_results) / len(all_results), 4)))
278
  }
279
  with open("baseline_results.json", "w") as f:
280
  json.dump(output, f, indent=2)