Commit History

docs: refresh README for reviewers
0679ccf
unverified

atharva-again commited on

docs: updated blog.md
166c3ff
unverified

atharva-again commited on

Add documentation for Sakha project
98d3a8f
unverified

Yash Jain commited on

feat(grpo): enhance action response parsing by removing reasoning blocks and refining regex handling
5202cdc

Bemohit commited on

feat(grpo): update max completion length and refine prompt handling for improved evaluation
ff1f7a0

Bemohit commited on

feat(grpo): adjust training parameters and disable thinking mode for consistent action calls
8f1e9fc

Bemohit commited on

feat(grpo): enhance training dynamics with new replay policies and update state steps
264ee3d

Bemohit commited on

feat(grpo): update max sequence length and refine prompt formatting in training scripts
79bced7

Bemohit commited on

refactor: remove SakhaEnvWrapper class and streamline reward function in GRPO training script
097c9e4

Bemohit commited on

refactor: simplify GRPO training script by removing CLI presets and syncing with notebook implementation
5f139c7

Bemohit commited on

feat(notebook): add Unsloth 4-bit training and base-vs-trained LLM eval
76ff25e
unverified

atharva-again commited on

feat(eval): consolidate eval_harness into eval_policies, add LLM policy support
fb58610
unverified

atharva-again commited on

refactor(eval): extract shared eval constants and policies into eval_common.py
51d5ddb
unverified

atharva-again commited on

docs(readme): fix action names, add Results section, update baseline scores
23e274e
unverified

atharva-again commited on

docs(readme): fix action names, add Results section, update baseline scores
a75ea22
unverified

atharva-again commited on

feat(plots): add plot generation script and training evidence plots
fcdb8dd
unverified

atharva-again commited on

fix(notebook): update Colab for PyPI install, full-shift training, baseline eval
e4f9096
unverified

atharva-again commited on

feat(train): add CLI args (learning-rate, batch-size) and full-shift defaults
f96fd88
unverified

atharva-again commited on

data(baseline): add reproducible baseline artifacts for easy/medium/hard
c31b407
unverified

atharva-again commited on

feat(eval): add reproducible eval harness with comprehensive metrics
fd5e667
unverified

atharva-again commited on

test(rubric): add golden parity tests for rubric migration validation
ce083e4
unverified

atharva-again commited on

data(fixtures): capture pre-migration golden reward fixtures for parity testing
827cfe7
unverified

atharva-again commited on

feat(rubric): integrate SakhaRubric into SakhaEnvironment step/reward path
1bdc498
unverified

atharva-again commited on

feat(rubric): add composable rubric scaffolding wrapping existing reward logic
237c898
unverified

atharva-again commited on

fix(deps): migrate openenv-core from git URL to PyPI >=0.2.3
45da026
unverified

atharva-again commited on

chore: pre-merge cleanup for colab-training branch
509d302
unverified

atharva-again commited on

fix: remove stray brace causing invalid JSON in notebook
34f5acb
unverified

atharva-again commited on

fix: add docstrings to ALL methods for TRL JSON schema parsing
9454716
unverified

atharva-again commited on

fix: use proper multi-line docstrings for TRL JSON schema parsing
3296933
unverified

atharva-again commited on

fix: install transformers and trl together to prevent version downgrade
0034c32
unverified

atharva-again commited on

feat: add GRPO training script with mode presets, eval split, checkpointing
fc4da82
unverified

atharva-again commited on

scripts: add GRPO training demo for Sakha env
f221784
unverified

atharva-again commited on

docs: add hackathon round2 checklist
14a6ca4
unverified

atharva-again commited on

fix(inference): default episodes to 1 for dev speed
d6f5ec6
unverified

atharva-again commited on

docs: rewrite AGENTS.md with agent quick guide
28f0f35
unverified

atharva-again commited on

fix(inference): align checklist compliance and structured run logs
284ec94
unverified

atharva-again commited on

chore: add artifacts/ to gitignore
05d6f5e
unverified

atharva-again commited on

test(inference): add prompt profile and rank_candidates tests
f38de94
unverified

atharva-again commited on

fix(eval_policies): ensure output directory exists before writing JSON
d337c5c
unverified

atharva-again commited on

docs(hackathon): add Phase 2 stdout parsing requirements
649a0c2
unverified

atharva-again commited on

feat(inference): integrate formatters, prompt profiles, and rewrite deterministic policy
2eb3fa1
unverified

atharva-again commited on

feat(formatters): add structured output formatting system
5dd1b3a
unverified

atharva-again commited on

docs: update README for new workflow
5a0891d
unverified

atharva-again commited on

feat(tests): update for new action system
8056f5b
unverified

atharva-again commited on

chore(server): update imports
d28a9e1
unverified

atharva-again commited on

feat(inference): adapt to new action system
68162aa
unverified

atharva-again commited on

feat(graders): implement new scoring logic
ba99d71
unverified

atharva-again commited on

feat(env): implement workflow-based simulation
0816fd4
unverified

atharva-again commited on

feat(models): added new action types and pending task system
3ab55b0
unverified

atharva-again commited on