Mihir Mungara commited on
Commit
3d8d49f
·
1 Parent(s): eddaf93

graders result clampped between 0 and 1

Browse files
Files changed (2) hide show
  1. environment.py +3 -4
  2. inference.py +5 -10
environment.py CHANGED
@@ -1,4 +1,3 @@
1
-
2
  import json
3
  import pandas as pd
4
  import numpy as np
@@ -454,7 +453,7 @@ class DataCleaningEnv:
454
  self.actions_taken = [] # Reset action history
455
 
456
  obs = self._get_observation("Environment reset. Start cleaning!")
457
- reward = Reward(total=0.0)
458
 
459
  return StepResult(
460
  observation=obs,
@@ -468,7 +467,7 @@ class DataCleaningEnv:
468
  obs = self._get_observation("Episode already done. Call reset().")
469
  return StepResult(
470
  observation=obs,
471
- reward=Reward(total=0.0),
472
  done=True,
473
  info={"warning": "Episode already done"}
474
  )
@@ -542,4 +541,4 @@ class DataCleaningEnv:
542
  "duplicate_count": int(self.current_df.duplicated().sum()),
543
  "reward_history": self.reward_history,
544
  "dtypes": {c: str(t) for c, t in self.current_df.dtypes.items()}
545
- }
 
 
1
  import json
2
  import pandas as pd
3
  import numpy as np
 
453
  self.actions_taken = [] # Reset action history
454
 
455
  obs = self._get_observation("Environment reset. Start cleaning!")
456
+ reward = Reward(total=0.0001)
457
 
458
  return StepResult(
459
  observation=obs,
 
467
  obs = self._get_observation("Episode already done. Call reset().")
468
  return StepResult(
469
  observation=obs,
470
+ reward=Reward(total=0.0001),
471
  done=True,
472
  info={"warning": "Episode already done"}
473
  )
 
541
  "duplicate_count": int(self.current_df.duplicated().sum()),
542
  "reward_history": self.reward_history,
543
  "dtypes": {c: str(t) for c, t in self.current_df.dtypes.items()}
544
+ }
inference.py CHANGED
@@ -155,9 +155,6 @@ def run_task(
155
  success = False
156
  last_error = None
157
 
158
- def clamp_score(value: float) -> float:
159
- return max(0.0001, min(0.9999, round(value, 4)))
160
-
161
  while not done and step < MAX_STEPS:
162
  step += 1
163
  last_error = None
@@ -196,7 +193,7 @@ def run_task(
196
  result = env.step(action)
197
  obs = result.observation.model_dump()
198
  done = result.done
199
- reward = clamp_score(result.reward.total)
200
  rewards.append(reward)
201
 
202
  # Check if operation failed
@@ -206,7 +203,7 @@ def run_task(
206
 
207
  except Exception as e:
208
  last_error = str(e)
209
- reward = 0.0001
210
  rewards.append(reward)
211
  done = True
212
 
@@ -228,10 +225,8 @@ def run_task(
228
  rewards_str = ",".join([f"{r:.2f}" for r in rewards])
229
  print(f"[END] success={success_str} steps={step} rewards={rewards_str}")
230
 
231
- final_score = 0.0001
232
- if rewards:
233
- final_score = max(0.0001, min(0.9999, round(rewards[-1], 4)))
234
-
235
  return {
236
  "task_id": task_id,
237
  "final_score": final_score,
@@ -284,4 +279,4 @@ def main():
284
 
285
 
286
  if __name__ == "__main__":
287
- main()
 
155
  success = False
156
  last_error = None
157
 
 
 
 
158
  while not done and step < MAX_STEPS:
159
  step += 1
160
  last_error = None
 
193
  result = env.step(action)
194
  obs = result.observation.model_dump()
195
  done = result.done
196
+ reward = result.reward.total
197
  rewards.append(reward)
198
 
199
  # Check if operation failed
 
203
 
204
  except Exception as e:
205
  last_error = str(e)
206
+ reward = 0.0
207
  rewards.append(reward)
208
  done = True
209
 
 
225
  rewards_str = ",".join([f"{r:.2f}" for r in rewards])
226
  print(f"[END] success={success_str} steps={step} rewards={rewards_str}")
227
 
228
+ raw_score = rewards[-1] if rewards else 0.0001
229
+ final_score = max(0.0001, min(0.9999, round(raw_score, 4)))
 
 
230
  return {
231
  "task_id": task_id,
232
  "final_score": final_score,
 
279
 
280
 
281
  if __name__ == "__main__":
282
+ main()