Spaces:
Sleeping
Sleeping
Commit Β·
5d880f3
1
Parent(s): 82a5b1b
Updated grader values
Browse files- inference.py +1 -1
- sql_env/env.py +5 -1
- sql_env/grader.py +1 -1
inference.py
CHANGED
|
@@ -251,7 +251,7 @@ async def run_task(task_name: str) -> None:
|
|
| 251 |
break
|
| 252 |
|
| 253 |
if rewards:
|
| 254 |
-
score = min(max(sum(rewards) / len(rewards), 0.
|
| 255 |
success = score >= SUCCESS_SCORE_THRESHOLD
|
| 256 |
|
| 257 |
except Exception as exc:
|
|
|
|
| 251 |
break
|
| 252 |
|
| 253 |
if rewards:
|
| 254 |
+
score = min(max(sum(rewards) / len(rewards), 0.01), 0.99)
|
| 255 |
success = score >= SUCCESS_SCORE_THRESHOLD
|
| 256 |
|
| 257 |
except Exception as exc:
|
sql_env/env.py
CHANGED
|
@@ -88,12 +88,16 @@ class SQLCorrectionEnv:
|
|
| 88 |
|
| 89 |
done = reward >= 0.95 or self._step_count >= self._task.max_steps
|
| 90 |
self._done = done
|
|
|
|
|
|
|
|
|
|
|
|
|
| 91 |
|
| 92 |
obs = self._make_observation()
|
| 93 |
|
| 94 |
return StepResult(
|
| 95 |
observation=obs,
|
| 96 |
-
reward=
|
| 97 |
done=done,
|
| 98 |
info={
|
| 99 |
"grader_reason": reward_model.reason,
|
|
|
|
| 88 |
|
| 89 |
done = reward >= 0.95 or self._step_count >= self._task.max_steps
|
| 90 |
self._done = done
|
| 91 |
+
|
| 92 |
+
safe_reward = float(f"{reward:.4f}")
|
| 93 |
+
safe_reward = max(0.02, min(0.98, safe_reward))
|
| 94 |
+
|
| 95 |
|
| 96 |
obs = self._make_observation()
|
| 97 |
|
| 98 |
return StepResult(
|
| 99 |
observation=obs,
|
| 100 |
+
reward=safe_reward,
|
| 101 |
done=done,
|
| 102 |
info={
|
| 103 |
"grader_reason": reward_model.reason,
|
sql_env/grader.py
CHANGED
|
@@ -101,7 +101,7 @@ def grade(action: SQLAction, task: SQLTask) -> SQLReward:
|
|
| 101 |
)
|
| 102 |
|
| 103 |
# ββ Level 0: No recognizable SQL βββββββββββββββββββββββββββββββββββββββββ
|
| 104 |
-
return SQLReward(value=_clamp(0.
|
| 105 |
|
| 106 |
|
| 107 |
def generate_feedback(action: SQLAction, task: SQLTask, reward: SQLReward) -> str:
|
|
|
|
| 101 |
)
|
| 102 |
|
| 103 |
# ββ Level 0: No recognizable SQL βββββββββββββββββββββββββββββββββββββββββ
|
| 104 |
+
return SQLReward(value=_clamp(0.02), reason="Response is not valid SQL.")
|
| 105 |
|
| 106 |
|
| 107 |
def generate_feedback(action: SQLAction, task: SQLTask, reward: SQLReward) -> str:
|