Commit History

Automated MNLP evaluation report (2026-06-06) (#1)
d8a6f37

btang18 zechen-nlp commited on

checkpoint update 0603d: grpo_v8 + targeted SB DPO
96f0eb6
verified

btang18 commited on

fix use_cache=true and bos_token_id in config.json
c552a86
verified

btang18 commited on

checkpoint update 0603a
0d115be
verified

btang18 commited on

checkpoint update 0530b
bcbebb6
verified

btang18 commited on

Revert to original system instruction (undo balanced prompt — online eval dropped 84->83)
e8a1b98
verified

btang18 commited on

v6 + balanced system prompt: remove conservative bias, add conciseness, fix JBB/WJ over-refusal
6de93cb
verified

btang18 commited on

cleanup: remove hydra/sft.log
2ca89bd
verified

btang18 commited on

cleanup: remove hydra/.hydra/overrides.yaml
0db58c7
verified

btang18 commited on

cleanup: remove hydra/.hydra/hydra.yaml
a0d042b
verified

btang18 commited on

cleanup: remove hydra/.hydra/config.yaml
55aab3f
verified

btang18 commited on

cleanup: remove training_args.bin
f9c3519
verified

btang18 commited on

cleanup: remove model.safetensors.index.json
92caef6
verified

btang18 commited on

cleanup: remove model-00002-of-00002.safetensors
58318ed
verified

btang18 commited on

cleanup: remove model-00001-of-00002.safetensors
99a7127
verified

btang18 commited on

feat(safety): v6 SFT — attn-only LoRA, category-stratified data, SB 92.0% BT 61.5% JBB 53.4%
90d4cbc
verified

btang18 commited on

Upload Qwen3-1.7B base model as safety domain baseline
dc8d6c7
verified

btang18 commited on

cleanup: remove intermediate training checkpoint
c826aed
verified

btang18 commited on

cleanup: remove intermediate training checkpoint
3b7b8d3
verified

btang18 commited on

cleanup: remove intermediate training checkpoint
9a11fc6
verified

btang18 commited on

cleanup: remove intermediate training checkpoint
cccf99d
verified

btang18 commited on

cleanup: remove intermediate training checkpoint
054971d
verified

btang18 commited on

cleanup: remove intermediate training checkpoint
90ae7b6
verified

btang18 commited on

cleanup: remove intermediate training checkpoint
fbd0d0c
verified

btang18 commited on

cleanup: remove intermediate training checkpoint
a66e93b
verified

btang18 commited on

cleanup: remove intermediate training checkpoint
5c3e18d
verified

btang18 commited on

cleanup: remove intermediate training checkpoint
f2e5a28
verified

btang18 commited on

cleanup: remove intermediate training checkpoint
fce01ad
verified

btang18 commited on

aug302: few-shot conservative examples in system instruction
4458587
verified

btang18 commited on

feat: frozen-attention SFT aug302 — beats GRPO on WildJailbreak
307e94a
verified

btang18 commited on

grpo-v3 ckpt-1000
2879bfe
verified

btang18 commited on

cleanup: remove training_args.bin
8cee454
verified

btang18 commited on

cleanup: remove trainer_state.json
b94c154
verified

btang18 commited on

cleanup: remove rng_state.pth
ef77c8f
verified

btang18 commited on

cleanup: remove scheduler.pt
01ac3f0
verified

btang18 commited on

cleanup: remove optimizer.pt
f9c5cdf
verified

btang18 commited on

cleanup: remove model.safetensors.index.json
47ffd36
verified

btang18 commited on

cleanup: remove model-00002-of-00002.safetensors
7e742d9
verified

btang18 commited on

cleanup: remove model-00001-of-00002.safetensors
445e2b0
verified

btang18 commited on

grpo mixed_v2 ckpt-2500 safetybench+3.2pp beavertails+4.8pp
9cfa5ff
verified

btang18 commited on

fix: always enclose final answer in boxed
e7e2f43
verified

btang18 commited on

cleanup: remove checkpoint-7368/training_args.bin
8196369
verified

btang18 commited on

cleanup: remove checkpoint-7368/trainer_state.json
a65ed26
verified

btang18 commited on

cleanup: remove checkpoint-7368/tokenizer_config.json
38217ed
verified

btang18 commited on

cleanup: remove checkpoint-7368/tokenizer.json
4a66d4d
verified

btang18 commited on

cleanup: remove checkpoint-7368/scheduler.pt
5f16a90
verified

btang18 commited on

cleanup: remove checkpoint-7368/rng_state.pth
8cec41b
verified

btang18 commited on