Slight reward tweak
Browse files- inference.py +1 -1
inference.py
CHANGED
|
@@ -196,7 +196,7 @@ def run_inference() -> None:
|
|
| 196 |
|
| 197 |
obs = env.step(action)
|
| 198 |
# Apply safe floor fallback in inference just in case
|
| 199 |
-
step_reward = obs.reward if obs.reward is not None else 0.
|
| 200 |
total_reward += step_reward
|
| 201 |
steps_completed = step_num
|
| 202 |
|
|
|
|
| 196 |
|
| 197 |
obs = env.step(action)
|
| 198 |
# Apply safe floor fallback in inference just in case
|
| 199 |
+
step_reward = obs.reward if obs.reward is not None else 0.01
|
| 200 |
total_reward += step_reward
|
| 201 |
steps_completed = step_num
|
| 202 |
|