Spaces:
Sleeping
Sleeping
Mihir Mungara commited on
Commit ·
3d8d49f
1
Parent(s): eddaf93
graders result clampped between 0 and 1
Browse files- environment.py +3 -4
- inference.py +5 -10
environment.py
CHANGED
|
@@ -1,4 +1,3 @@
|
|
| 1 |
-
|
| 2 |
import json
|
| 3 |
import pandas as pd
|
| 4 |
import numpy as np
|
|
@@ -454,7 +453,7 @@ class DataCleaningEnv:
|
|
| 454 |
self.actions_taken = [] # Reset action history
|
| 455 |
|
| 456 |
obs = self._get_observation("Environment reset. Start cleaning!")
|
| 457 |
-
reward = Reward(total=0.
|
| 458 |
|
| 459 |
return StepResult(
|
| 460 |
observation=obs,
|
|
@@ -468,7 +467,7 @@ class DataCleaningEnv:
|
|
| 468 |
obs = self._get_observation("Episode already done. Call reset().")
|
| 469 |
return StepResult(
|
| 470 |
observation=obs,
|
| 471 |
-
reward=Reward(total=0.
|
| 472 |
done=True,
|
| 473 |
info={"warning": "Episode already done"}
|
| 474 |
)
|
|
@@ -542,4 +541,4 @@ class DataCleaningEnv:
|
|
| 542 |
"duplicate_count": int(self.current_df.duplicated().sum()),
|
| 543 |
"reward_history": self.reward_history,
|
| 544 |
"dtypes": {c: str(t) for c, t in self.current_df.dtypes.items()}
|
| 545 |
-
}
|
|
|
|
|
|
|
| 1 |
import json
|
| 2 |
import pandas as pd
|
| 3 |
import numpy as np
|
|
|
|
| 453 |
self.actions_taken = [] # Reset action history
|
| 454 |
|
| 455 |
obs = self._get_observation("Environment reset. Start cleaning!")
|
| 456 |
+
reward = Reward(total=0.0001)
|
| 457 |
|
| 458 |
return StepResult(
|
| 459 |
observation=obs,
|
|
|
|
| 467 |
obs = self._get_observation("Episode already done. Call reset().")
|
| 468 |
return StepResult(
|
| 469 |
observation=obs,
|
| 470 |
+
reward=Reward(total=0.0001),
|
| 471 |
done=True,
|
| 472 |
info={"warning": "Episode already done"}
|
| 473 |
)
|
|
|
|
| 541 |
"duplicate_count": int(self.current_df.duplicated().sum()),
|
| 542 |
"reward_history": self.reward_history,
|
| 543 |
"dtypes": {c: str(t) for c, t in self.current_df.dtypes.items()}
|
| 544 |
+
}
|
inference.py
CHANGED
|
@@ -155,9 +155,6 @@ def run_task(
|
|
| 155 |
success = False
|
| 156 |
last_error = None
|
| 157 |
|
| 158 |
-
def clamp_score(value: float) -> float:
|
| 159 |
-
return max(0.0001, min(0.9999, round(value, 4)))
|
| 160 |
-
|
| 161 |
while not done and step < MAX_STEPS:
|
| 162 |
step += 1
|
| 163 |
last_error = None
|
|
@@ -196,7 +193,7 @@ def run_task(
|
|
| 196 |
result = env.step(action)
|
| 197 |
obs = result.observation.model_dump()
|
| 198 |
done = result.done
|
| 199 |
-
reward =
|
| 200 |
rewards.append(reward)
|
| 201 |
|
| 202 |
# Check if operation failed
|
|
@@ -206,7 +203,7 @@ def run_task(
|
|
| 206 |
|
| 207 |
except Exception as e:
|
| 208 |
last_error = str(e)
|
| 209 |
-
reward = 0.
|
| 210 |
rewards.append(reward)
|
| 211 |
done = True
|
| 212 |
|
|
@@ -228,10 +225,8 @@ def run_task(
|
|
| 228 |
rewards_str = ",".join([f"{r:.2f}" for r in rewards])
|
| 229 |
print(f"[END] success={success_str} steps={step} rewards={rewards_str}")
|
| 230 |
|
| 231 |
-
|
| 232 |
-
|
| 233 |
-
final_score = max(0.0001, min(0.9999, round(rewards[-1], 4)))
|
| 234 |
-
|
| 235 |
return {
|
| 236 |
"task_id": task_id,
|
| 237 |
"final_score": final_score,
|
|
@@ -284,4 +279,4 @@ def main():
|
|
| 284 |
|
| 285 |
|
| 286 |
if __name__ == "__main__":
|
| 287 |
-
main()
|
|
|
|
| 155 |
success = False
|
| 156 |
last_error = None
|
| 157 |
|
|
|
|
|
|
|
|
|
|
| 158 |
while not done and step < MAX_STEPS:
|
| 159 |
step += 1
|
| 160 |
last_error = None
|
|
|
|
| 193 |
result = env.step(action)
|
| 194 |
obs = result.observation.model_dump()
|
| 195 |
done = result.done
|
| 196 |
+
reward = result.reward.total
|
| 197 |
rewards.append(reward)
|
| 198 |
|
| 199 |
# Check if operation failed
|
|
|
|
| 203 |
|
| 204 |
except Exception as e:
|
| 205 |
last_error = str(e)
|
| 206 |
+
reward = 0.0
|
| 207 |
rewards.append(reward)
|
| 208 |
done = True
|
| 209 |
|
|
|
|
| 225 |
rewards_str = ",".join([f"{r:.2f}" for r in rewards])
|
| 226 |
print(f"[END] success={success_str} steps={step} rewards={rewards_str}")
|
| 227 |
|
| 228 |
+
raw_score = rewards[-1] if rewards else 0.0001
|
| 229 |
+
final_score = max(0.0001, min(0.9999, round(raw_score, 4)))
|
|
|
|
|
|
|
| 230 |
return {
|
| 231 |
"task_id": task_id,
|
| 232 |
"final_score": final_score,
|
|
|
|
| 279 |
|
| 280 |
|
| 281 |
if __name__ == "__main__":
|
| 282 |
+
main()
|