geyuxu commited on
Commit
0410149
·
verified ·
1 Parent(s): 2134d2b

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ D_full_emf1_seed22/tokenizer.json filter=lfs diff=lfs merge=lfs -text
D_full_emf1_seed22/adapter_config.json ADDED
@@ -0,0 +1,43 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alora_invocation_tokens": null,
3
+ "alpha_pattern": {},
4
+ "arrow_config": null,
5
+ "auto_mapping": null,
6
+ "base_model_name_or_path": "/home/yuxu/.cache/huggingface/hub/models--Qwen--Qwen2.5-1.5B-Instruct/snapshots/989aa7980e4cf806f80c7fef2b1adb7bc71aa306",
7
+ "bias": "none",
8
+ "corda_config": null,
9
+ "ensure_weight_tying": false,
10
+ "eva_config": null,
11
+ "exclude_modules": null,
12
+ "fan_in_fan_out": false,
13
+ "inference_mode": true,
14
+ "init_lora_weights": true,
15
+ "layer_replication": null,
16
+ "layers_pattern": null,
17
+ "layers_to_transform": null,
18
+ "loftq_config": {},
19
+ "lora_alpha": 32,
20
+ "lora_bias": false,
21
+ "lora_dropout": 0.05,
22
+ "megatron_config": null,
23
+ "megatron_core": "megatron.core",
24
+ "modules_to_save": null,
25
+ "peft_type": "LORA",
26
+ "peft_version": "0.18.1",
27
+ "qalora_group_size": 16,
28
+ "r": 16,
29
+ "rank_pattern": {},
30
+ "revision": null,
31
+ "target_modules": [
32
+ "k_proj",
33
+ "o_proj",
34
+ "v_proj",
35
+ "q_proj"
36
+ ],
37
+ "target_parameters": null,
38
+ "task_type": "CAUSAL_LM",
39
+ "trainable_token_indices": null,
40
+ "use_dora": false,
41
+ "use_qalora": false,
42
+ "use_rslora": false
43
+ }
D_full_emf1_seed22/adapter_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:305528baa439ac6edb72e7e2297cb0908ab7fb1e7637b8251db36e9ba63b9067
3
+ size 17462432
D_full_emf1_seed22/chat_template.jinja ADDED
@@ -0,0 +1,54 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- if tools %}
2
+ {{- '<|im_start|>system\n' }}
3
+ {%- if messages[0]['role'] == 'system' %}
4
+ {{- messages[0]['content'] }}
5
+ {%- else %}
6
+ {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }}
7
+ {%- endif %}
8
+ {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
9
+ {%- for tool in tools %}
10
+ {{- "\n" }}
11
+ {{- tool | tojson }}
12
+ {%- endfor %}
13
+ {{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
14
+ {%- else %}
15
+ {%- if messages[0]['role'] == 'system' %}
16
+ {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }}
17
+ {%- else %}
18
+ {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }}
19
+ {%- endif %}
20
+ {%- endif %}
21
+ {%- for message in messages %}
22
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %}
23
+ {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }}
24
+ {%- elif message.role == "assistant" %}
25
+ {{- '<|im_start|>' + message.role }}
26
+ {%- if message.content %}
27
+ {{- '\n' + message.content }}
28
+ {%- endif %}
29
+ {%- for tool_call in message.tool_calls %}
30
+ {%- if tool_call.function is defined %}
31
+ {%- set tool_call = tool_call.function %}
32
+ {%- endif %}
33
+ {{- '\n<tool_call>\n{"name": "' }}
34
+ {{- tool_call.name }}
35
+ {{- '", "arguments": ' }}
36
+ {{- tool_call.arguments | tojson }}
37
+ {{- '}\n</tool_call>' }}
38
+ {%- endfor %}
39
+ {{- '<|im_end|>\n' }}
40
+ {%- elif message.role == "tool" %}
41
+ {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %}
42
+ {{- '<|im_start|>user' }}
43
+ {%- endif %}
44
+ {{- '\n<tool_response>\n' }}
45
+ {{- message.content }}
46
+ {{- '\n</tool_response>' }}
47
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
48
+ {{- '<|im_end|>\n' }}
49
+ {%- endif %}
50
+ {%- endif %}
51
+ {%- endfor %}
52
+ {%- if add_generation_prompt %}
53
+ {{- '<|im_start|>assistant\n' }}
54
+ {%- endif %}
D_full_emf1_seed22/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5
3
+ size 11422166
D_full_emf1_seed22/tokenizer_config.json ADDED
@@ -0,0 +1,29 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": null,
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|im_end|>",
7
+ "errors": "replace",
8
+ "extra_special_tokens": [
9
+ "<|im_start|>",
10
+ "<|im_end|>",
11
+ "<|object_ref_start|>",
12
+ "<|object_ref_end|>",
13
+ "<|box_start|>",
14
+ "<|box_end|>",
15
+ "<|quad_start|>",
16
+ "<|quad_end|>",
17
+ "<|vision_start|>",
18
+ "<|vision_end|>",
19
+ "<|vision_pad|>",
20
+ "<|image_pad|>",
21
+ "<|video_pad|>"
22
+ ],
23
+ "is_local": true,
24
+ "model_max_length": 131072,
25
+ "pad_token": "<|endoftext|>",
26
+ "split_special_tokens": false,
27
+ "tokenizer_class": "Qwen2Tokenizer",
28
+ "unk_token": null
29
+ }
D_full_emf1_seed22/training_summary.json ADDED
@@ -0,0 +1,2302 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model_name": "Qwen/Qwen2.5-1.5B-Instruct",
3
+ "resolved_model": "/home/yuxu/.cache/huggingface/hub/models--Qwen--Qwen2.5-1.5B-Instruct/snapshots/989aa7980e4cf806f80c7fef2b1adb7bc71aa306",
4
+ "num_train_records": 10000,
5
+ "num_validation_records_available": 0,
6
+ "training_config": {
7
+ "lora_rank": 16,
8
+ "lora_alpha": 32,
9
+ "learning_rate": 1e-05,
10
+ "num_epochs": 2,
11
+ "per_device_batch_size": 1,
12
+ "per_device_eval_batch_size": 1,
13
+ "gradient_accumulation_steps": 16,
14
+ "beta": 0.1,
15
+ "max_length": 512,
16
+ "max_prompt_length": 384,
17
+ "seed": 22,
18
+ "save_steps": 250,
19
+ "save_total_limit": 2,
20
+ "resume_from_checkpoint": null,
21
+ "precision_dtype": "torch.bfloat16",
22
+ "bf16": true,
23
+ "fp16": false,
24
+ "tokenizer_add_bos_token": false
25
+ },
26
+ "global_step": 1250,
27
+ "best_metric": null,
28
+ "best_model_checkpoint": null,
29
+ "train_metrics": {
30
+ "train_runtime": 5977.8981,
31
+ "train_samples_per_second": 3.346,
32
+ "train_steps_per_second": 0.209,
33
+ "total_flos": 1.3612284112597402e+17,
34
+ "train_loss": 0.45482119541168214
35
+ },
36
+ "log_history": [
37
+ {
38
+ "loss": 0.689018440246582,
39
+ "grad_norm": 0.10905654728412628,
40
+ "learning_rate": 9.928e-06,
41
+ "entropy": 0.8563553406624124,
42
+ "num_tokens": 134743.0,
43
+ "logits/chosen": -0.9788623969289567,
44
+ "logits/rejected": -0.963421240675876,
45
+ "mean_token_accuracy": 0.7335915770381689,
46
+ "rewards/chosen": 0.003118900115805445,
47
+ "rewards/rejected": -0.005566338380720026,
48
+ "rewards/accuracies": 0.53125,
49
+ "rewards/margins": 0.0086852383617952,
50
+ "logps/chosen": -53.44429122209549,
51
+ "logps/rejected": -58.05595805644989,
52
+ "epoch": 0.016,
53
+ "step": 10
54
+ },
55
+ {
56
+ "loss": 0.6828490734100342,
57
+ "grad_norm": 0.11294842511415482,
58
+ "learning_rate": 9.848000000000001e-06,
59
+ "entropy": 0.8075154377147555,
60
+ "num_tokens": 269598.0,
61
+ "logits/chosen": -0.9147015579312413,
62
+ "logits/rejected": -0.9080481267141745,
63
+ "mean_token_accuracy": 0.7330205589532852,
64
+ "rewards/chosen": -0.009720915841876376,
65
+ "rewards/rejected": -0.031031110812728004,
66
+ "rewards/accuracies": 0.675,
67
+ "rewards/margins": 0.02131019511289196,
68
+ "logps/chosen": -55.76358859539032,
69
+ "logps/rejected": -53.03535443544388,
70
+ "epoch": 0.032,
71
+ "step": 20
72
+ },
73
+ {
74
+ "loss": 0.6677823066711426,
75
+ "grad_norm": 0.11828389763832092,
76
+ "learning_rate": 9.768e-06,
77
+ "entropy": 0.8278283050749451,
78
+ "num_tokens": 404333.0,
79
+ "logits/chosen": -1.0811326675861692,
80
+ "logits/rejected": -0.9070872471899184,
81
+ "mean_token_accuracy": 0.7307771431282163,
82
+ "rewards/chosen": -0.03384106803678151,
83
+ "rewards/rejected": -0.08754932412921335,
84
+ "rewards/accuracies": 0.725,
85
+ "rewards/margins": 0.05370825613208581,
86
+ "logps/chosen": -50.51493817567825,
87
+ "logps/rejected": -61.200947272777555,
88
+ "epoch": 0.048,
89
+ "step": 30
90
+ },
91
+ {
92
+ "loss": 0.6462172985076904,
93
+ "grad_norm": 0.11367130279541016,
94
+ "learning_rate": 9.688000000000001e-06,
95
+ "entropy": 0.823192946088966,
96
+ "num_tokens": 538701.0,
97
+ "logits/chosen": -1.0191294171017014,
98
+ "logits/rejected": -0.9379523297738434,
99
+ "mean_token_accuracy": 0.7370131656527519,
100
+ "rewards/chosen": -0.07439912984327748,
101
+ "rewards/rejected": -0.17708719812508206,
102
+ "rewards/accuracies": 0.76875,
103
+ "rewards/margins": 0.10268806891690474,
104
+ "logps/chosen": -50.990779775381085,
105
+ "logps/rejected": -52.61567587852478,
106
+ "epoch": 0.064,
107
+ "step": 40
108
+ },
109
+ {
110
+ "loss": 0.6121170997619629,
111
+ "grad_norm": 0.12841418385505676,
112
+ "learning_rate": 9.608e-06,
113
+ "entropy": 0.8364603637135588,
114
+ "num_tokens": 673524.0,
115
+ "logits/chosen": -0.9610722555180565,
116
+ "logits/rejected": -0.8514297521784684,
117
+ "mean_token_accuracy": 0.7061145938932896,
118
+ "rewards/chosen": -0.14487820940848906,
119
+ "rewards/rejected": -0.332736360195122,
120
+ "rewards/accuracies": 0.78125,
121
+ "rewards/margins": 0.1878581509925425,
122
+ "logps/chosen": -58.89807789325714,
123
+ "logps/rejected": -60.78576712608337,
124
+ "epoch": 0.08,
125
+ "step": 50
126
+ },
127
+ {
128
+ "loss": 0.5916354179382324,
129
+ "grad_norm": 0.11347971856594086,
130
+ "learning_rate": 9.528000000000001e-06,
131
+ "entropy": 0.8045067954575643,
132
+ "num_tokens": 808013.0,
133
+ "logits/chosen": -1.0201351325489214,
134
+ "logits/rejected": -0.8894283035358745,
135
+ "mean_token_accuracy": 0.7225402432493866,
136
+ "rewards/chosen": -0.24984656272717984,
137
+ "rewards/rejected": -0.504135195492563,
138
+ "rewards/accuracies": 0.78125,
139
+ "rewards/margins": 0.25428863214328884,
140
+ "logps/chosen": -52.76062165498733,
141
+ "logps/rejected": -61.86190390586853,
142
+ "epoch": 0.096,
143
+ "step": 60
144
+ },
145
+ {
146
+ "loss": 0.576406192779541,
147
+ "grad_norm": 0.13050724565982819,
148
+ "learning_rate": 9.448e-06,
149
+ "entropy": 0.8006839740090073,
150
+ "num_tokens": 942494.0,
151
+ "logits/chosen": -1.0778371811063052,
152
+ "logits/rejected": -0.9411381606196525,
153
+ "mean_token_accuracy": 0.713543506525457,
154
+ "rewards/chosen": -0.38982224147985106,
155
+ "rewards/rejected": -0.7144045860972256,
156
+ "rewards/accuracies": 0.76875,
157
+ "rewards/margins": 0.32458234429359434,
158
+ "logps/chosen": -60.53339612483978,
159
+ "logps/rejected": -60.80531245470047,
160
+ "epoch": 0.112,
161
+ "step": 70
162
+ },
163
+ {
164
+ "loss": 0.5392527103424072,
165
+ "grad_norm": 0.10742519050836563,
166
+ "learning_rate": 9.368e-06,
167
+ "entropy": 0.8088806970277801,
168
+ "num_tokens": 1076339.0,
169
+ "logits/chosen": -1.1278537035014409,
170
+ "logits/rejected": -0.8774969710621068,
171
+ "mean_token_accuracy": 0.7182694263756275,
172
+ "rewards/chosen": -0.5486542367416405,
173
+ "rewards/rejected": -0.9956708228681237,
174
+ "rewards/accuracies": 0.76875,
175
+ "rewards/margins": 0.4470165837556124,
176
+ "logps/chosen": -52.11761736869812,
177
+ "logps/rejected": -67.0722449183464,
178
+ "epoch": 0.128,
179
+ "step": 80
180
+ },
181
+ {
182
+ "loss": 0.5608308792114258,
183
+ "grad_norm": 0.15674173831939697,
184
+ "learning_rate": 9.288e-06,
185
+ "entropy": 0.768392307573231,
186
+ "num_tokens": 1210662.0,
187
+ "logits/chosen": -1.1788602806606145,
188
+ "logits/rejected": -1.03331966826322,
189
+ "mean_token_accuracy": 0.7145220551639795,
190
+ "rewards/chosen": -0.720596243354521,
191
+ "rewards/rejected": -1.1825086012715473,
192
+ "rewards/accuracies": 0.74375,
193
+ "rewards/margins": 0.46191235817968845,
194
+ "logps/chosen": -60.48848968744278,
195
+ "logps/rejected": -64.15390303134919,
196
+ "epoch": 0.144,
197
+ "step": 90
198
+ },
199
+ {
200
+ "loss": 0.555051851272583,
201
+ "grad_norm": 0.13351617753505707,
202
+ "learning_rate": 9.208e-06,
203
+ "entropy": 0.7862678854435217,
204
+ "num_tokens": 1345120.0,
205
+ "logits/chosen": -1.168248595800457,
206
+ "logits/rejected": -1.0325365206859007,
207
+ "mean_token_accuracy": 0.708121376670897,
208
+ "rewards/chosen": -0.8649011284462176,
209
+ "rewards/rejected": -1.4063857643632218,
210
+ "rewards/accuracies": 0.6875,
211
+ "rewards/margins": 0.5414846379309892,
212
+ "logps/chosen": -61.20340501070022,
213
+ "logps/rejected": -66.58065437078476,
214
+ "epoch": 0.16,
215
+ "step": 100
216
+ },
217
+ {
218
+ "loss": 0.5074045658111572,
219
+ "grad_norm": 0.21781982481479645,
220
+ "learning_rate": 9.128e-06,
221
+ "entropy": 0.7356140260322718,
222
+ "num_tokens": 1479281.0,
223
+ "logits/chosen": -1.3261684939964402,
224
+ "logits/rejected": -1.1306528941057346,
225
+ "mean_token_accuracy": 0.7123186649754644,
226
+ "rewards/chosen": -0.9123384133912623,
227
+ "rewards/rejected": -1.6054315031506121,
228
+ "rewards/accuracies": 0.76875,
229
+ "rewards/margins": 0.6930930894799531,
230
+ "logps/chosen": -59.55553774833679,
231
+ "logps/rejected": -72.37696163654327,
232
+ "epoch": 0.176,
233
+ "step": 110
234
+ },
235
+ {
236
+ "loss": 0.5216456413269043,
237
+ "grad_norm": 0.19241169095039368,
238
+ "learning_rate": 9.048e-06,
239
+ "entropy": 0.7655054951086641,
240
+ "num_tokens": 1613851.0,
241
+ "logits/chosen": -1.3025066533169531,
242
+ "logits/rejected": -1.143896303288123,
243
+ "mean_token_accuracy": 0.7036409357562661,
244
+ "rewards/chosen": -1.0751173802796985,
245
+ "rewards/rejected": -1.776869938801974,
246
+ "rewards/accuracies": 0.75,
247
+ "rewards/margins": 0.7017525571398437,
248
+ "logps/chosen": -66.2069799900055,
249
+ "logps/rejected": -74.56398607492447,
250
+ "epoch": 0.192,
251
+ "step": 120
252
+ },
253
+ {
254
+ "loss": 0.5168225765228271,
255
+ "grad_norm": 0.08994148671627045,
256
+ "learning_rate": 8.968000000000001e-06,
257
+ "entropy": 0.7540512274950742,
258
+ "num_tokens": 1748368.0,
259
+ "logits/chosen": -1.391650497545763,
260
+ "logits/rejected": -1.1460448347696492,
261
+ "mean_token_accuracy": 0.7162771710194648,
262
+ "rewards/chosen": -1.0096850864356384,
263
+ "rewards/rejected": -1.827320344489999,
264
+ "rewards/accuracies": 0.76875,
265
+ "rewards/margins": 0.817635256703943,
266
+ "logps/chosen": -61.82568025588989,
267
+ "logps/rejected": -76.9469052195549,
268
+ "epoch": 0.208,
269
+ "step": 130
270
+ },
271
+ {
272
+ "loss": 0.46869478225708006,
273
+ "grad_norm": 0.13741639256477356,
274
+ "learning_rate": 8.888e-06,
275
+ "entropy": 0.7924248128314503,
276
+ "num_tokens": 1883496.0,
277
+ "logits/chosen": -1.3249019191600873,
278
+ "logits/rejected": -1.1026000772151963,
279
+ "mean_token_accuracy": 0.7087388038635254,
280
+ "rewards/chosen": -1.0496459440822945,
281
+ "rewards/rejected": -2.055653589125723,
282
+ "rewards/accuracies": 0.81875,
283
+ "rewards/margins": 1.0060076432302594,
284
+ "logps/chosen": -64.32736076116562,
285
+ "logps/rejected": -81.53705527782441,
286
+ "epoch": 0.224,
287
+ "step": 140
288
+ },
289
+ {
290
+ "loss": 0.49356565475463865,
291
+ "grad_norm": 0.13059070706367493,
292
+ "learning_rate": 8.808000000000001e-06,
293
+ "entropy": 0.7655621751298896,
294
+ "num_tokens": 2017285.0,
295
+ "logits/chosen": -1.5351193051368675,
296
+ "logits/rejected": -1.235119241285585,
297
+ "mean_token_accuracy": 0.7035089529119432,
298
+ "rewards/chosen": -1.090340746268339,
299
+ "rewards/rejected": -1.9519310850591864,
300
+ "rewards/accuracies": 0.75625,
301
+ "rewards/margins": 0.8615903402678668,
302
+ "logps/chosen": -58.17775413990021,
303
+ "logps/rejected": -74.25504211187362,
304
+ "epoch": 0.24,
305
+ "step": 150
306
+ },
307
+ {
308
+ "loss": 0.5369758605957031,
309
+ "grad_norm": 0.13786712288856506,
310
+ "learning_rate": 8.728e-06,
311
+ "entropy": 0.6862338791484944,
312
+ "num_tokens": 2150045.0,
313
+ "logits/chosen": -1.4912660164800315,
314
+ "logits/rejected": -1.333143902399643,
315
+ "mean_token_accuracy": 0.701057541090995,
316
+ "rewards/chosen": -1.1116661975334865,
317
+ "rewards/rejected": -1.7480126170441508,
318
+ "rewards/accuracies": 0.775,
319
+ "rewards/margins": 0.6363464183639735,
320
+ "logps/chosen": -59.09992996454239,
321
+ "logps/rejected": -60.96899574995041,
322
+ "epoch": 0.256,
323
+ "step": 160
324
+ },
325
+ {
326
+ "loss": 0.5533265113830567,
327
+ "grad_norm": 0.18535780906677246,
328
+ "learning_rate": 8.648000000000001e-06,
329
+ "entropy": 0.7963132435863371,
330
+ "num_tokens": 2284628.0,
331
+ "logits/chosen": -1.4200859032965045,
332
+ "logits/rejected": -1.1475656571055712,
333
+ "mean_token_accuracy": 0.6968366431072355,
334
+ "rewards/chosen": -1.2623908873065375,
335
+ "rewards/rejected": -1.9762427852023392,
336
+ "rewards/accuracies": 0.70625,
337
+ "rewards/margins": 0.7138518976047635,
338
+ "logps/chosen": -65.92677880525589,
339
+ "logps/rejected": -75.31166982650757,
340
+ "epoch": 0.272,
341
+ "step": 170
342
+ },
343
+ {
344
+ "loss": 0.48800249099731446,
345
+ "grad_norm": 0.17086467146873474,
346
+ "learning_rate": 8.568e-06,
347
+ "entropy": 0.7096531906281598,
348
+ "num_tokens": 2418154.0,
349
+ "logits/chosen": -1.4284564529605592,
350
+ "logits/rejected": -1.1960109995497337,
351
+ "mean_token_accuracy": 0.7045122615993022,
352
+ "rewards/chosen": -1.080190175800817,
353
+ "rewards/rejected": -1.9707384748850019,
354
+ "rewards/accuracies": 0.71875,
355
+ "rewards/margins": 0.8905482929199934,
356
+ "logps/chosen": -59.75125551223755,
357
+ "logps/rejected": -70.24758154153824,
358
+ "epoch": 0.288,
359
+ "step": 180
360
+ },
361
+ {
362
+ "loss": 0.46792116165161135,
363
+ "grad_norm": 0.16177140176296234,
364
+ "learning_rate": 8.488e-06,
365
+ "entropy": 0.7515300859929994,
366
+ "num_tokens": 2551816.0,
367
+ "logits/chosen": -1.2414827391616068,
368
+ "logits/rejected": -1.0802036758082083,
369
+ "mean_token_accuracy": 0.7072636014781892,
370
+ "rewards/chosen": -1.0667701240134193,
371
+ "rewards/rejected": -1.9473204111913218,
372
+ "rewards/accuracies": 0.8375,
373
+ "rewards/margins": 0.8805502850795165,
374
+ "logps/chosen": -65.70144573450088,
375
+ "logps/rejected": -68.4914104104042,
376
+ "epoch": 0.304,
377
+ "step": 190
378
+ },
379
+ {
380
+ "loss": 0.5006054878234864,
381
+ "grad_norm": 0.16638650000095367,
382
+ "learning_rate": 8.408e-06,
383
+ "entropy": 0.8327071964275092,
384
+ "num_tokens": 2686525.0,
385
+ "logits/chosen": -1.2503270258894088,
386
+ "logits/rejected": -0.995497852108113,
387
+ "mean_token_accuracy": 0.6908243351615966,
388
+ "rewards/chosen": -1.1853100352571346,
389
+ "rewards/rejected": -2.0631397599121555,
390
+ "rewards/accuracies": 0.76875,
391
+ "rewards/margins": 0.8778297245502472,
392
+ "logps/chosen": -65.22179394960403,
393
+ "logps/rejected": -76.10799474716187,
394
+ "epoch": 0.32,
395
+ "step": 200
396
+ },
397
+ {
398
+ "loss": 0.452646541595459,
399
+ "grad_norm": 0.26452815532684326,
400
+ "learning_rate": 8.328e-06,
401
+ "entropy": 0.8430000780150294,
402
+ "num_tokens": 2821412.0,
403
+ "logits/chosen": -1.1790006368335502,
404
+ "logits/rejected": -0.8779570491578651,
405
+ "mean_token_accuracy": 0.6723773072008044,
406
+ "rewards/chosen": -1.1888155334367183,
407
+ "rewards/rejected": -2.2633378646452913,
408
+ "rewards/accuracies": 0.7375,
409
+ "rewards/margins": 1.074522328004241,
410
+ "logps/chosen": -64.86716014146805,
411
+ "logps/rejected": -79.61585273742676,
412
+ "epoch": 0.336,
413
+ "step": 210
414
+ },
415
+ {
416
+ "loss": 0.5181353569030762,
417
+ "grad_norm": 0.11742082983255386,
418
+ "learning_rate": 8.248e-06,
419
+ "entropy": 0.8045017344535154,
420
+ "num_tokens": 2956627.0,
421
+ "logits/chosen": -1.2154215871610907,
422
+ "logits/rejected": -0.939022998277143,
423
+ "mean_token_accuracy": 0.6996388690546155,
424
+ "rewards/chosen": -1.1623295453668105,
425
+ "rewards/rejected": -2.163627782184631,
426
+ "rewards/accuracies": 0.775,
427
+ "rewards/margins": 1.00129823833704,
428
+ "logps/chosen": -62.80202409029007,
429
+ "logps/rejected": -81.0254952788353,
430
+ "epoch": 0.352,
431
+ "step": 220
432
+ },
433
+ {
434
+ "loss": 0.4743824481964111,
435
+ "grad_norm": 0.16635876893997192,
436
+ "learning_rate": 8.168e-06,
437
+ "entropy": 0.7914588764862855,
438
+ "num_tokens": 3090619.0,
439
+ "logits/chosen": -1.1884228506656345,
440
+ "logits/rejected": -0.9203135491484804,
441
+ "mean_token_accuracy": 0.6981304872781038,
442
+ "rewards/chosen": -1.0808302243589423,
443
+ "rewards/rejected": -2.0085678519913928,
444
+ "rewards/accuracies": 0.78125,
445
+ "rewards/margins": 0.9277376340702176,
446
+ "logps/chosen": -60.4386828660965,
447
+ "logps/rejected": -72.10626875162124,
448
+ "epoch": 0.368,
449
+ "step": 230
450
+ },
451
+ {
452
+ "loss": 0.48973665237426756,
453
+ "grad_norm": 0.1960846185684204,
454
+ "learning_rate": 8.088e-06,
455
+ "entropy": 0.8449207143319655,
456
+ "num_tokens": 3225094.0,
457
+ "logits/chosen": -1.1508734381084937,
458
+ "logits/rejected": -0.9685642621415461,
459
+ "mean_token_accuracy": 0.6950183667242527,
460
+ "rewards/chosen": -1.2113628653900377,
461
+ "rewards/rejected": -2.089532778749708,
462
+ "rewards/accuracies": 0.8,
463
+ "rewards/margins": 0.8781699133105576,
464
+ "logps/chosen": -68.62453348636627,
465
+ "logps/rejected": -75.98600549697876,
466
+ "epoch": 0.384,
467
+ "step": 240
468
+ },
469
+ {
470
+ "loss": 0.5802257061004639,
471
+ "grad_norm": 0.11632820218801498,
472
+ "learning_rate": 8.008e-06,
473
+ "entropy": 0.7761064321442973,
474
+ "num_tokens": 3360182.0,
475
+ "logits/chosen": -1.2831330545177115,
476
+ "logits/rejected": -1.0997321391861137,
477
+ "mean_token_accuracy": 0.6970741396769882,
478
+ "rewards/chosen": -1.1727734387372037,
479
+ "rewards/rejected": -1.8903911848203279,
480
+ "rewards/accuracies": 0.70625,
481
+ "rewards/margins": 0.7176177425310015,
482
+ "logps/chosen": -66.26374975442886,
483
+ "logps/rejected": -72.10199882984162,
484
+ "epoch": 0.4,
485
+ "step": 250
486
+ },
487
+ {
488
+ "loss": 0.43405885696411134,
489
+ "grad_norm": 0.14540572464466095,
490
+ "learning_rate": 7.928e-06,
491
+ "entropy": 0.7629542504204437,
492
+ "num_tokens": 3494544.0,
493
+ "logits/chosen": -1.3185474115706086,
494
+ "logits/rejected": -1.0363903950282343,
495
+ "mean_token_accuracy": 0.69958227686584,
496
+ "rewards/chosen": -0.9348558198704268,
497
+ "rewards/rejected": -1.9087367365602403,
498
+ "rewards/accuracies": 0.8125,
499
+ "rewards/margins": 0.9738809239119292,
500
+ "logps/chosen": -61.2034912109375,
501
+ "logps/rejected": -71.80750354528428,
502
+ "epoch": 0.416,
503
+ "step": 260
504
+ },
505
+ {
506
+ "loss": 0.44985151290893555,
507
+ "grad_norm": 0.14902211725711823,
508
+ "learning_rate": 7.848000000000002e-06,
509
+ "entropy": 0.8110592220822582,
510
+ "num_tokens": 3628021.0,
511
+ "logits/chosen": -1.2687084794247518,
512
+ "logits/rejected": -0.9412073643616663,
513
+ "mean_token_accuracy": 0.6967338371090591,
514
+ "rewards/chosen": -1.0113929210696369,
515
+ "rewards/rejected": -1.9841588545590638,
516
+ "rewards/accuracies": 0.8,
517
+ "rewards/margins": 0.9727659282274544,
518
+ "logps/chosen": -58.82498153448105,
519
+ "logps/rejected": -72.50857379436493,
520
+ "epoch": 0.432,
521
+ "step": 270
522
+ },
523
+ {
524
+ "loss": 0.47422361373901367,
525
+ "grad_norm": 0.14587490260601044,
526
+ "learning_rate": 7.768e-06,
527
+ "entropy": 0.8527051686949563,
528
+ "num_tokens": 3762769.0,
529
+ "logits/chosen": -1.2181775523388327,
530
+ "logits/rejected": -0.8992369459063199,
531
+ "mean_token_accuracy": 0.7088230043649674,
532
+ "rewards/chosen": -1.1207619122928008,
533
+ "rewards/rejected": -2.148672613617964,
534
+ "rewards/accuracies": 0.78125,
535
+ "rewards/margins": 1.0279107017442584,
536
+ "logps/chosen": -61.72244974374771,
537
+ "logps/rejected": -78.88542218208313,
538
+ "epoch": 0.448,
539
+ "step": 280
540
+ },
541
+ {
542
+ "loss": 0.5027151107788086,
543
+ "grad_norm": 0.09337582439184189,
544
+ "learning_rate": 7.688000000000002e-06,
545
+ "entropy": 0.7852856576413615,
546
+ "num_tokens": 3896554.0,
547
+ "logits/chosen": -1.3354775567844146,
548
+ "logits/rejected": -1.1184485921419505,
549
+ "mean_token_accuracy": 0.6952060368843377,
550
+ "rewards/chosen": -1.1932822762464639,
551
+ "rewards/rejected": -2.0500318385427816,
552
+ "rewards/accuracies": 0.75,
553
+ "rewards/margins": 0.8567495625931769,
554
+ "logps/chosen": -66.44852304458618,
555
+ "logps/rejected": -70.7834144949913,
556
+ "epoch": 0.464,
557
+ "step": 290
558
+ },
559
+ {
560
+ "loss": 0.44806575775146484,
561
+ "grad_norm": 0.1337847113609314,
562
+ "learning_rate": 7.608000000000001e-06,
563
+ "entropy": 0.7422546729561873,
564
+ "num_tokens": 4030330.0,
565
+ "logits/chosen": -1.4700220277909535,
566
+ "logits/rejected": -1.1814784580674191,
567
+ "mean_token_accuracy": 0.7079419396817684,
568
+ "rewards/chosen": -1.1185172388635691,
569
+ "rewards/rejected": -2.27528806256596,
570
+ "rewards/accuracies": 0.83125,
571
+ "rewards/margins": 1.1567708211019636,
572
+ "logps/chosen": -63.6253160238266,
573
+ "logps/rejected": -74.7424528837204,
574
+ "epoch": 0.48,
575
+ "step": 300
576
+ },
577
+ {
578
+ "loss": 0.45131826400756836,
579
+ "grad_norm": 0.16172009706497192,
580
+ "learning_rate": 7.528000000000001e-06,
581
+ "entropy": 0.7010916481667664,
582
+ "num_tokens": 4163071.0,
583
+ "logits/chosen": -1.5153129547936302,
584
+ "logits/rejected": -1.209580647062671,
585
+ "mean_token_accuracy": 0.720912242680788,
586
+ "rewards/chosen": -1.1323760432947894,
587
+ "rewards/rejected": -2.123044349125121,
588
+ "rewards/accuracies": 0.825,
589
+ "rewards/margins": 0.9906683029606939,
590
+ "logps/chosen": -61.3173499584198,
591
+ "logps/rejected": -70.07959650754928,
592
+ "epoch": 0.496,
593
+ "step": 310
594
+ },
595
+ {
596
+ "loss": 0.4254595756530762,
597
+ "grad_norm": 0.11975234746932983,
598
+ "learning_rate": 7.4480000000000005e-06,
599
+ "entropy": 0.7769533811253495,
600
+ "num_tokens": 4297650.0,
601
+ "logits/chosen": -1.3886568818841,
602
+ "logits/rejected": -1.13002503495388,
603
+ "mean_token_accuracy": 0.7051799762062728,
604
+ "rewards/chosen": -0.9357022894022521,
605
+ "rewards/rejected": -1.983945999154821,
606
+ "rewards/accuracies": 0.8625,
607
+ "rewards/margins": 1.048243713984266,
608
+ "logps/chosen": -68.33114951848984,
609
+ "logps/rejected": -71.30756684541703,
610
+ "epoch": 0.512,
611
+ "step": 320
612
+ },
613
+ {
614
+ "loss": 0.41445064544677734,
615
+ "grad_norm": 0.2776741087436676,
616
+ "learning_rate": 7.3680000000000004e-06,
617
+ "entropy": 0.7489449862972833,
618
+ "num_tokens": 4431577.0,
619
+ "logits/chosen": -1.6288736615844654,
620
+ "logits/rejected": -1.2485594975833538,
621
+ "mean_token_accuracy": 0.6974780206568539,
622
+ "rewards/chosen": -0.9473370073334081,
623
+ "rewards/rejected": -2.106761427427409,
624
+ "rewards/accuracies": 0.84375,
625
+ "rewards/margins": 1.1594244167208672,
626
+ "logps/chosen": -62.647765040397644,
627
+ "logps/rejected": -75.1746208190918,
628
+ "epoch": 0.528,
629
+ "step": 330
630
+ },
631
+ {
632
+ "loss": 0.4307701587677002,
633
+ "grad_norm": 0.13814318180084229,
634
+ "learning_rate": 7.288e-06,
635
+ "entropy": 0.6795995138236322,
636
+ "num_tokens": 4565362.0,
637
+ "logits/chosen": -1.7014978124379496,
638
+ "logits/rejected": -1.360194546265395,
639
+ "mean_token_accuracy": 0.7122661659494043,
640
+ "rewards/chosen": -1.1425236859824508,
641
+ "rewards/rejected": -2.3793784040724857,
642
+ "rewards/accuracies": 0.8125,
643
+ "rewards/margins": 1.236854719556868,
644
+ "logps/chosen": -61.26923282146454,
645
+ "logps/rejected": -76.55938069820404,
646
+ "epoch": 0.544,
647
+ "step": 340
648
+ },
649
+ {
650
+ "loss": 0.5171660423278809,
651
+ "grad_norm": 0.2421128898859024,
652
+ "learning_rate": 7.208e-06,
653
+ "entropy": 0.736682211542211,
654
+ "num_tokens": 4699278.0,
655
+ "logits/chosen": -1.5375196977562884,
656
+ "logits/rejected": -1.2775026091481378,
657
+ "mean_token_accuracy": 0.7100502958521246,
658
+ "rewards/chosen": -1.234824466597638,
659
+ "rewards/rejected": -2.2794134604977443,
660
+ "rewards/accuracies": 0.78125,
661
+ "rewards/margins": 1.0445889961905777,
662
+ "logps/chosen": -61.170579481124875,
663
+ "logps/rejected": -73.94075057506561,
664
+ "epoch": 0.56,
665
+ "step": 350
666
+ },
667
+ {
668
+ "loss": 0.4048302173614502,
669
+ "grad_norm": 0.13529057800769806,
670
+ "learning_rate": 7.128e-06,
671
+ "entropy": 0.7252036946330918,
672
+ "num_tokens": 4834112.0,
673
+ "logits/chosen": -1.5076449032651227,
674
+ "logits/rejected": -1.3696309019049226,
675
+ "mean_token_accuracy": 0.7079439009539783,
676
+ "rewards/chosen": -1.1786035622935742,
677
+ "rewards/rejected": -2.421615838177968,
678
+ "rewards/accuracies": 0.825,
679
+ "rewards/margins": 1.2430122738704086,
680
+ "logps/chosen": -75.25101128816604,
681
+ "logps/rejected": -73.58783400058746,
682
+ "epoch": 0.576,
683
+ "step": 360
684
+ },
685
+ {
686
+ "loss": 0.4977682113647461,
687
+ "grad_norm": 0.1781209260225296,
688
+ "learning_rate": 7.048e-06,
689
+ "entropy": 0.8224106237757951,
690
+ "num_tokens": 4968874.0,
691
+ "logits/chosen": -1.3960146295474423,
692
+ "logits/rejected": -1.1073445296913083,
693
+ "mean_token_accuracy": 0.708382755331695,
694
+ "rewards/chosen": -1.115643077727873,
695
+ "rewards/rejected": -2.070754229882732,
696
+ "rewards/accuracies": 0.74375,
697
+ "rewards/margins": 0.955111154448241,
698
+ "logps/chosen": -61.408040976524354,
699
+ "logps/rejected": -78.4707190990448,
700
+ "epoch": 0.592,
701
+ "step": 370
702
+ },
703
+ {
704
+ "loss": 0.4448493480682373,
705
+ "grad_norm": 0.1303374469280243,
706
+ "learning_rate": 6.968e-06,
707
+ "entropy": 0.7095136601157719,
708
+ "num_tokens": 5102712.0,
709
+ "logits/chosen": -1.550997072455129,
710
+ "logits/rejected": -1.2904333606869343,
711
+ "mean_token_accuracy": 0.69968516016379,
712
+ "rewards/chosen": -0.9111583859747043,
713
+ "rewards/rejected": -2.052812862768769,
714
+ "rewards/accuracies": 0.80625,
715
+ "rewards/margins": 1.141654483322054,
716
+ "logps/chosen": -59.56483067274094,
717
+ "logps/rejected": -70.73611218929291,
718
+ "epoch": 0.608,
719
+ "step": 380
720
+ },
721
+ {
722
+ "loss": 0.618243932723999,
723
+ "grad_norm": 0.23218761384487152,
724
+ "learning_rate": 6.888e-06,
725
+ "entropy": 0.7683811950089876,
726
+ "num_tokens": 5236746.0,
727
+ "logits/chosen": -1.4908055362391708,
728
+ "logits/rejected": -1.2139118427508149,
729
+ "mean_token_accuracy": 0.7114272927865386,
730
+ "rewards/chosen": -1.168174527026713,
731
+ "rewards/rejected": -1.9601395897567273,
732
+ "rewards/accuracies": 0.71875,
733
+ "rewards/margins": 0.7919650661759079,
734
+ "logps/chosen": -63.611954271793365,
735
+ "logps/rejected": -72.28059177398681,
736
+ "epoch": 0.624,
737
+ "step": 390
738
+ },
739
+ {
740
+ "loss": 0.5224360942840576,
741
+ "grad_norm": 0.16070543229579926,
742
+ "learning_rate": 6.808e-06,
743
+ "entropy": 0.8030928350694012,
744
+ "num_tokens": 5371265.0,
745
+ "logits/chosen": -1.3533366529032598,
746
+ "logits/rejected": -1.0578829997757886,
747
+ "mean_token_accuracy": 0.7191924162209034,
748
+ "rewards/chosen": -0.8509922233264661,
749
+ "rewards/rejected": -1.6920959531096742,
750
+ "rewards/accuracies": 0.7625,
751
+ "rewards/margins": 0.8411037294892594,
752
+ "logps/chosen": -61.14945147037506,
753
+ "logps/rejected": -68.67226406335831,
754
+ "epoch": 0.64,
755
+ "step": 400
756
+ },
757
+ {
758
+ "loss": 0.41513900756835936,
759
+ "grad_norm": 0.19860734045505524,
760
+ "learning_rate": 6.728e-06,
761
+ "entropy": 0.7868119461927563,
762
+ "num_tokens": 5505311.0,
763
+ "logits/chosen": -1.2997119180538206,
764
+ "logits/rejected": -1.0947122079972385,
765
+ "mean_token_accuracy": 0.7141418108716607,
766
+ "rewards/chosen": -0.5277955924670096,
767
+ "rewards/rejected": -1.6158742993546185,
768
+ "rewards/accuracies": 0.85625,
769
+ "rewards/margins": 1.0880787078291179,
770
+ "logps/chosen": -58.874490237236024,
771
+ "logps/rejected": -69.12621879577637,
772
+ "epoch": 0.656,
773
+ "step": 410
774
+ },
775
+ {
776
+ "loss": 0.4617919921875,
777
+ "grad_norm": 0.1614799201488495,
778
+ "learning_rate": 6.648e-06,
779
+ "entropy": 0.8407431220111903,
780
+ "num_tokens": 5639727.0,
781
+ "logits/chosen": -1.2453079399296676,
782
+ "logits/rejected": -0.9694453760606313,
783
+ "mean_token_accuracy": 0.6953371344134212,
784
+ "rewards/chosen": -0.6480406609189231,
785
+ "rewards/rejected": -1.6581713807128835,
786
+ "rewards/accuracies": 0.80625,
787
+ "rewards/margins": 1.0101307133561932,
788
+ "logps/chosen": -58.330216348171234,
789
+ "logps/rejected": -75.3308912873268,
790
+ "epoch": 0.672,
791
+ "step": 420
792
+ },
793
+ {
794
+ "loss": 0.44162707328796386,
795
+ "grad_norm": 0.15507620573043823,
796
+ "learning_rate": 6.568000000000001e-06,
797
+ "entropy": 0.7857385093288031,
798
+ "num_tokens": 5775347.0,
799
+ "logits/chosen": -1.4506047377437405,
800
+ "logits/rejected": -1.1385212073298612,
801
+ "mean_token_accuracy": 0.7148427126929164,
802
+ "rewards/chosen": -0.9052540952921845,
803
+ "rewards/rejected": -1.9813320814282633,
804
+ "rewards/accuracies": 0.8,
805
+ "rewards/margins": 1.0760779848322273,
806
+ "logps/chosen": -70.78476246595383,
807
+ "logps/rejected": -75.07093167304993,
808
+ "epoch": 0.688,
809
+ "step": 430
810
+ },
811
+ {
812
+ "loss": 0.45162124633789064,
813
+ "grad_norm": 0.23057712614536285,
814
+ "learning_rate": 6.488000000000001e-06,
815
+ "entropy": 0.7095841458125506,
816
+ "num_tokens": 5908570.0,
817
+ "logits/chosen": -1.522052635312034,
818
+ "logits/rejected": -1.1914354851620277,
819
+ "mean_token_accuracy": 0.7254255541600287,
820
+ "rewards/chosen": -1.0367633419460618,
821
+ "rewards/rejected": -2.0772957720793785,
822
+ "rewards/accuracies": 0.8,
823
+ "rewards/margins": 1.0405324320308864,
824
+ "logps/chosen": -56.933732664585115,
825
+ "logps/rejected": -71.38762845993043,
826
+ "epoch": 0.704,
827
+ "step": 440
828
+ },
829
+ {
830
+ "loss": 0.5143694877624512,
831
+ "grad_norm": 0.1373089849948883,
832
+ "learning_rate": 6.408000000000001e-06,
833
+ "entropy": 0.7877030725649092,
834
+ "num_tokens": 6042989.0,
835
+ "logits/chosen": -1.3941457694145336,
836
+ "logits/rejected": -1.1642616028929327,
837
+ "mean_token_accuracy": 0.7271975075826049,
838
+ "rewards/chosen": -1.1276259648264386,
839
+ "rewards/rejected": -2.2803055624710398,
840
+ "rewards/accuracies": 0.775,
841
+ "rewards/margins": 1.1526795887388288,
842
+ "logps/chosen": -62.81108283996582,
843
+ "logps/rejected": -78.13692320585251,
844
+ "epoch": 0.72,
845
+ "step": 450
846
+ },
847
+ {
848
+ "loss": 0.4237183094024658,
849
+ "grad_norm": 0.13749825954437256,
850
+ "learning_rate": 6.328000000000001e-06,
851
+ "entropy": 0.7828766799415462,
852
+ "num_tokens": 6177897.0,
853
+ "logits/chosen": -1.3374319642690895,
854
+ "logits/rejected": -1.1246487231005464,
855
+ "mean_token_accuracy": 0.7126569332554936,
856
+ "rewards/chosen": -0.9298112412194314,
857
+ "rewards/rejected": -2.1673050606746984,
858
+ "rewards/accuracies": 0.81875,
859
+ "rewards/margins": 1.2374938178574666,
860
+ "logps/chosen": -63.089643478393555,
861
+ "logps/rejected": -75.59077807664872,
862
+ "epoch": 0.736,
863
+ "step": 460
864
+ },
865
+ {
866
+ "loss": 0.4884624004364014,
867
+ "grad_norm": 0.1415245234966278,
868
+ "learning_rate": 6.248000000000001e-06,
869
+ "entropy": 0.8562492666591425,
870
+ "num_tokens": 6312714.0,
871
+ "logits/chosen": -1.126100791332234,
872
+ "logits/rejected": -0.8647624546845234,
873
+ "mean_token_accuracy": 0.6987247484736144,
874
+ "rewards/chosen": -0.808612387260655,
875
+ "rewards/rejected": -1.6612209561048075,
876
+ "rewards/accuracies": 0.80625,
877
+ "rewards/margins": 0.8526085724122823,
878
+ "logps/chosen": -67.91057009696961,
879
+ "logps/rejected": -70.94221692085266,
880
+ "epoch": 0.752,
881
+ "step": 470
882
+ },
883
+ {
884
+ "loss": 0.44064011573791506,
885
+ "grad_norm": 0.20672255754470825,
886
+ "learning_rate": 6.168000000000001e-06,
887
+ "entropy": 0.7785831509012496,
888
+ "num_tokens": 6446811.0,
889
+ "logits/chosen": -1.3451005530773972,
890
+ "logits/rejected": -1.0701528376820553,
891
+ "mean_token_accuracy": 0.7139140725135803,
892
+ "rewards/chosen": -0.8083824556204491,
893
+ "rewards/rejected": -1.8517554196994752,
894
+ "rewards/accuracies": 0.81875,
895
+ "rewards/margins": 1.0433729680255055,
896
+ "logps/chosen": -58.11244525909424,
897
+ "logps/rejected": -70.4776518702507,
898
+ "epoch": 0.768,
899
+ "step": 480
900
+ },
901
+ {
902
+ "loss": 0.4577657222747803,
903
+ "grad_norm": 0.20929287374019623,
904
+ "learning_rate": 6.088000000000001e-06,
905
+ "entropy": 0.8531491419766098,
906
+ "num_tokens": 6581587.0,
907
+ "logits/chosen": -1.2832854161235994,
908
+ "logits/rejected": -1.1052666904723358,
909
+ "mean_token_accuracy": 0.7067524623125792,
910
+ "rewards/chosen": -0.9194631451624445,
911
+ "rewards/rejected": -1.912933972803876,
912
+ "rewards/accuracies": 0.7875,
913
+ "rewards/margins": 0.9934708263725043,
914
+ "logps/chosen": -62.308107471466066,
915
+ "logps/rejected": -74.89246033430099,
916
+ "epoch": 0.784,
917
+ "step": 490
918
+ },
919
+ {
920
+ "loss": 0.4375007629394531,
921
+ "grad_norm": 0.20060019195079803,
922
+ "learning_rate": 6.008000000000001e-06,
923
+ "entropy": 0.7929941387919826,
924
+ "num_tokens": 6716289.0,
925
+ "logits/chosen": -1.3354546779997054,
926
+ "logits/rejected": -1.0329545787740195,
927
+ "mean_token_accuracy": 0.7229124492034316,
928
+ "rewards/chosen": -1.0229379917611368,
929
+ "rewards/rejected": -2.1298453632509338,
930
+ "rewards/accuracies": 0.8,
931
+ "rewards/margins": 1.1069073686376214,
932
+ "logps/chosen": -63.658102416992186,
933
+ "logps/rejected": -75.60895298719406,
934
+ "epoch": 0.8,
935
+ "step": 500
936
+ },
937
+ {
938
+ "loss": 0.44527058601379393,
939
+ "grad_norm": 0.16677559912204742,
940
+ "learning_rate": 5.928000000000001e-06,
941
+ "entropy": 0.8354968667088543,
942
+ "num_tokens": 6850716.0,
943
+ "logits/chosen": -1.4591034667577056,
944
+ "logits/rejected": -1.0641008106016938,
945
+ "mean_token_accuracy": 0.705034868977964,
946
+ "rewards/chosen": -0.8949406793020899,
947
+ "rewards/rejected": -2.185808292112779,
948
+ "rewards/accuracies": 0.81875,
949
+ "rewards/margins": 1.2908676087856292,
950
+ "logps/chosen": -58.768228101730344,
951
+ "logps/rejected": -78.82726471424102,
952
+ "epoch": 0.816,
953
+ "step": 510
954
+ },
955
+ {
956
+ "loss": 0.3973827600479126,
957
+ "grad_norm": 0.15284304320812225,
958
+ "learning_rate": 5.848000000000001e-06,
959
+ "entropy": 0.8099856940709287,
960
+ "num_tokens": 6984942.0,
961
+ "logits/chosen": -1.3746344108751551,
962
+ "logits/rejected": -0.9748087908165729,
963
+ "mean_token_accuracy": 0.7168531034141779,
964
+ "rewards/chosen": -0.8542922898486722,
965
+ "rewards/rejected": -2.102445878717117,
966
+ "rewards/accuracies": 0.85625,
967
+ "rewards/margins": 1.2481535905040801,
968
+ "logps/chosen": -63.956273436546326,
969
+ "logps/rejected": -74.7093752503395,
970
+ "epoch": 0.832,
971
+ "step": 520
972
+ },
973
+ {
974
+ "loss": 0.39521021842956544,
975
+ "grad_norm": 0.19803296029567719,
976
+ "learning_rate": 5.7680000000000005e-06,
977
+ "entropy": 0.819463662133785,
978
+ "num_tokens": 7118390.0,
979
+ "logits/chosen": -1.4278405835062675,
980
+ "logits/rejected": -1.1354102461541689,
981
+ "mean_token_accuracy": 0.7017366614192724,
982
+ "rewards/chosen": -0.8539736664190286,
983
+ "rewards/rejected": -2.189559509139508,
984
+ "rewards/accuracies": 0.81875,
985
+ "rewards/margins": 1.3355858475901186,
986
+ "logps/chosen": -59.81350688934326,
987
+ "logps/rejected": -72.4623057961464,
988
+ "epoch": 0.848,
989
+ "step": 530
990
+ },
991
+ {
992
+ "loss": 0.4910752773284912,
993
+ "grad_norm": 0.17725913226604462,
994
+ "learning_rate": 5.6880000000000004e-06,
995
+ "entropy": 0.8000208166384255,
996
+ "num_tokens": 7252607.0,
997
+ "logits/chosen": -1.4821630663306287,
998
+ "logits/rejected": -1.1388486199317076,
999
+ "mean_token_accuracy": 0.7186640851199627,
1000
+ "rewards/chosen": -1.0058101782691664,
1001
+ "rewards/rejected": -2.2602031591522973,
1002
+ "rewards/accuracies": 0.78125,
1003
+ "rewards/margins": 1.2543929865583778,
1004
+ "logps/chosen": -59.514958798885345,
1005
+ "logps/rejected": -78.18541886806489,
1006
+ "epoch": 0.864,
1007
+ "step": 540
1008
+ },
1009
+ {
1010
+ "loss": 0.4494024276733398,
1011
+ "grad_norm": 0.18910986185073853,
1012
+ "learning_rate": 5.608e-06,
1013
+ "entropy": 0.7143417345014313,
1014
+ "num_tokens": 7386208.0,
1015
+ "logits/chosen": -1.621721678971833,
1016
+ "logits/rejected": -1.4079677960636496,
1017
+ "mean_token_accuracy": 0.6997427928261459,
1018
+ "rewards/chosen": -1.0504559374399833,
1019
+ "rewards/rejected": -2.317046788427979,
1020
+ "rewards/accuracies": 0.7875,
1021
+ "rewards/margins": 1.2665908511728048,
1022
+ "logps/chosen": -59.609275901317595,
1023
+ "logps/rejected": -73.99389593601227,
1024
+ "epoch": 0.88,
1025
+ "step": 550
1026
+ },
1027
+ {
1028
+ "loss": 0.3651487588882446,
1029
+ "grad_norm": 0.14056329429149628,
1030
+ "learning_rate": 5.528e-06,
1031
+ "entropy": 0.814640334653086,
1032
+ "num_tokens": 7521519.0,
1033
+ "logits/chosen": -1.6321557376252653,
1034
+ "logits/rejected": -1.287688344637761,
1035
+ "mean_token_accuracy": 0.7133785426616669,
1036
+ "rewards/chosen": -0.9613554299203543,
1037
+ "rewards/rejected": -2.597287955011416,
1038
+ "rewards/accuracies": 0.83125,
1039
+ "rewards/margins": 1.6359325245954097,
1040
+ "logps/chosen": -64.85036475658417,
1041
+ "logps/rejected": -87.75885683298111,
1042
+ "epoch": 0.896,
1043
+ "step": 560
1044
+ },
1045
+ {
1046
+ "loss": 0.47167210578918456,
1047
+ "grad_norm": 0.15875674784183502,
1048
+ "learning_rate": 5.448e-06,
1049
+ "entropy": 0.8689434929285198,
1050
+ "num_tokens": 7656864.0,
1051
+ "logits/chosen": -1.484541877747767,
1052
+ "logits/rejected": -1.210293212753148,
1053
+ "mean_token_accuracy": 0.6996884623542428,
1054
+ "rewards/chosen": -1.097544879911584,
1055
+ "rewards/rejected": -2.3577645811019465,
1056
+ "rewards/accuracies": 0.78125,
1057
+ "rewards/margins": 1.260219706967473,
1058
+ "logps/chosen": -71.07291498184205,
1059
+ "logps/rejected": -80.84261965751648,
1060
+ "epoch": 0.912,
1061
+ "step": 570
1062
+ },
1063
+ {
1064
+ "loss": 0.4431413173675537,
1065
+ "grad_norm": 0.08832120895385742,
1066
+ "learning_rate": 5.368000000000001e-06,
1067
+ "entropy": 0.8448504954460077,
1068
+ "num_tokens": 7792899.0,
1069
+ "logits/chosen": -1.3894132053730714,
1070
+ "logits/rejected": -1.1916056589936446,
1071
+ "mean_token_accuracy": 0.6817449929192663,
1072
+ "rewards/chosen": -1.1424140176386572,
1073
+ "rewards/rejected": -2.407927218545228,
1074
+ "rewards/accuracies": 0.8375,
1075
+ "rewards/margins": 1.2655131912790238,
1076
+ "logps/chosen": -75.6745502948761,
1077
+ "logps/rejected": -80.21998720169067,
1078
+ "epoch": 0.928,
1079
+ "step": 580
1080
+ },
1081
+ {
1082
+ "loss": 0.4135700225830078,
1083
+ "grad_norm": 0.2704945206642151,
1084
+ "learning_rate": 5.288000000000001e-06,
1085
+ "entropy": 0.7824862065215712,
1086
+ "num_tokens": 7926779.0,
1087
+ "logits/chosen": -1.6528558851348272,
1088
+ "logits/rejected": -1.292456634430272,
1089
+ "mean_token_accuracy": 0.705788871459663,
1090
+ "rewards/chosen": -0.8465097412496106,
1091
+ "rewards/rejected": -2.368203252152307,
1092
+ "rewards/accuracies": 0.825,
1093
+ "rewards/margins": 1.5216935152653606,
1094
+ "logps/chosen": -60.099838173389436,
1095
+ "logps/rejected": -76.38954356908798,
1096
+ "epoch": 0.944,
1097
+ "step": 590
1098
+ },
1099
+ {
1100
+ "loss": 0.44308009147644045,
1101
+ "grad_norm": 0.24440231919288635,
1102
+ "learning_rate": 5.208000000000001e-06,
1103
+ "entropy": 0.6905676309019327,
1104
+ "num_tokens": 8060079.0,
1105
+ "logits/chosen": -1.726859618494725,
1106
+ "logits/rejected": -1.3902765776081965,
1107
+ "mean_token_accuracy": 0.7324171539396047,
1108
+ "rewards/chosen": -0.8706245078108623,
1109
+ "rewards/rejected": -2.1242041391320527,
1110
+ "rewards/accuracies": 0.84375,
1111
+ "rewards/margins": 1.253579631447792,
1112
+ "logps/chosen": -54.19212522506714,
1113
+ "logps/rejected": -68.28248654603958,
1114
+ "epoch": 0.96,
1115
+ "step": 600
1116
+ },
1117
+ {
1118
+ "loss": 0.4900795936584473,
1119
+ "grad_norm": 0.1992669254541397,
1120
+ "learning_rate": 5.128000000000001e-06,
1121
+ "entropy": 0.7946285988775343,
1122
+ "num_tokens": 8194850.0,
1123
+ "logits/chosen": -1.432810063268619,
1124
+ "logits/rejected": -1.1435234217692902,
1125
+ "mean_token_accuracy": 0.7105734800919891,
1126
+ "rewards/chosen": -0.8311952710559126,
1127
+ "rewards/rejected": -1.92433615202317,
1128
+ "rewards/accuracies": 0.80625,
1129
+ "rewards/margins": 1.0931408811360597,
1130
+ "logps/chosen": -59.344405829906464,
1131
+ "logps/rejected": -72.60044294595718,
1132
+ "epoch": 0.976,
1133
+ "step": 610
1134
+ },
1135
+ {
1136
+ "loss": 0.4234670639038086,
1137
+ "grad_norm": 0.26938584446907043,
1138
+ "learning_rate": 5.048000000000001e-06,
1139
+ "entropy": 0.846720263955649,
1140
+ "num_tokens": 8329816.0,
1141
+ "logits/chosen": -1.482459889192245,
1142
+ "logits/rejected": -1.2096144698576996,
1143
+ "mean_token_accuracy": 0.7066002277657389,
1144
+ "rewards/chosen": -0.7947340043901931,
1145
+ "rewards/rejected": -2.0874571030028166,
1146
+ "rewards/accuracies": 0.81875,
1147
+ "rewards/margins": 1.292723097000271,
1148
+ "logps/chosen": -61.47416917085648,
1149
+ "logps/rejected": -79.54253326654434,
1150
+ "epoch": 0.992,
1151
+ "step": 620
1152
+ },
1153
+ {
1154
+ "loss": 0.42821288108825684,
1155
+ "grad_norm": 0.20475246012210846,
1156
+ "learning_rate": 4.9680000000000005e-06,
1157
+ "entropy": 0.8765991456399206,
1158
+ "num_tokens": 8464146.0,
1159
+ "logits/chosen": -1.3660770117134349,
1160
+ "logits/rejected": -1.1283678471483534,
1161
+ "mean_token_accuracy": 0.6944115529768169,
1162
+ "rewards/chosen": -0.758866243439843,
1163
+ "rewards/rejected": -1.9606408149003982,
1164
+ "rewards/accuracies": 0.8,
1165
+ "rewards/margins": 1.2017745693214237,
1166
+ "logps/chosen": -59.6711128950119,
1167
+ "logps/rejected": -75.17260210514068,
1168
+ "epoch": 1.008,
1169
+ "step": 630
1170
+ },
1171
+ {
1172
+ "loss": 0.4121402740478516,
1173
+ "grad_norm": 0.19181285798549652,
1174
+ "learning_rate": 4.8880000000000005e-06,
1175
+ "entropy": 0.8112090851645917,
1176
+ "num_tokens": 8598165.0,
1177
+ "logits/chosen": -1.6396478070003788,
1178
+ "logits/rejected": -1.201064509639671,
1179
+ "mean_token_accuracy": 0.7071607926860451,
1180
+ "rewards/chosen": -0.8190987646230496,
1181
+ "rewards/rejected": -2.1065064918162535,
1182
+ "rewards/accuracies": 0.85,
1183
+ "rewards/margins": 1.2874077258165926,
1184
+ "logps/chosen": -58.56870514154434,
1185
+ "logps/rejected": -75.47631640434265,
1186
+ "epoch": 1.024,
1187
+ "step": 640
1188
+ },
1189
+ {
1190
+ "loss": 0.3832432746887207,
1191
+ "grad_norm": 0.16693222522735596,
1192
+ "learning_rate": 4.808e-06,
1193
+ "entropy": 0.8202884538564831,
1194
+ "num_tokens": 8733182.0,
1195
+ "logits/chosen": -1.4093097295310522,
1196
+ "logits/rejected": -1.0764184005015662,
1197
+ "mean_token_accuracy": 0.7213250549510122,
1198
+ "rewards/chosen": -0.8947586458227306,
1199
+ "rewards/rejected": -2.217220963910222,
1200
+ "rewards/accuracies": 0.85,
1201
+ "rewards/margins": 1.3224623166024685,
1202
+ "logps/chosen": -63.64674232006073,
1203
+ "logps/rejected": -79.54431369304658,
1204
+ "epoch": 1.04,
1205
+ "step": 650
1206
+ },
1207
+ {
1208
+ "loss": 0.467090368270874,
1209
+ "grad_norm": 0.2820304334163666,
1210
+ "learning_rate": 4.728e-06,
1211
+ "entropy": 0.8175160668091849,
1212
+ "num_tokens": 8866532.0,
1213
+ "logits/chosen": -1.4113409272988666,
1214
+ "logits/rejected": -1.0253050648283575,
1215
+ "mean_token_accuracy": 0.7056375283747911,
1216
+ "rewards/chosen": -1.1019376051408472,
1217
+ "rewards/rejected": -2.4279107422335073,
1218
+ "rewards/accuracies": 0.83125,
1219
+ "rewards/margins": 1.3259731331840157,
1220
+ "logps/chosen": -62.17448818683624,
1221
+ "logps/rejected": -77.10730903148651,
1222
+ "epoch": 1.056,
1223
+ "step": 660
1224
+ },
1225
+ {
1226
+ "loss": 0.4856276512145996,
1227
+ "grad_norm": 0.1508263647556305,
1228
+ "learning_rate": 4.648e-06,
1229
+ "entropy": 0.8777147593849804,
1230
+ "num_tokens": 9002058.0,
1231
+ "logits/chosen": -1.237333422062607,
1232
+ "logits/rejected": -0.9867713449001874,
1233
+ "mean_token_accuracy": 0.6980989784002304,
1234
+ "rewards/chosen": -1.102817886834964,
1235
+ "rewards/rejected": -2.2164312085602433,
1236
+ "rewards/accuracies": 0.7875,
1237
+ "rewards/margins": 1.113613315252587,
1238
+ "logps/chosen": -72.5415987610817,
1239
+ "logps/rejected": -79.59271297454833,
1240
+ "epoch": 1.072,
1241
+ "step": 670
1242
+ },
1243
+ {
1244
+ "loss": 0.40852723121643064,
1245
+ "grad_norm": 0.1356440633535385,
1246
+ "learning_rate": 4.568e-06,
1247
+ "entropy": 0.8335771631682292,
1248
+ "num_tokens": 9136559.0,
1249
+ "logits/chosen": -1.4357955653994279,
1250
+ "logits/rejected": -1.0632368045892524,
1251
+ "mean_token_accuracy": 0.7067163791507483,
1252
+ "rewards/chosen": -0.8871819378109649,
1253
+ "rewards/rejected": -2.2391563730299824,
1254
+ "rewards/accuracies": 0.8,
1255
+ "rewards/margins": 1.3519744293764233,
1256
+ "logps/chosen": -65.51536420583724,
1257
+ "logps/rejected": -74.92358832359314,
1258
+ "epoch": 1.088,
1259
+ "step": 680
1260
+ },
1261
+ {
1262
+ "loss": 0.42632465362548827,
1263
+ "grad_norm": 0.2446223795413971,
1264
+ "learning_rate": 4.488e-06,
1265
+ "entropy": 0.7106906755536329,
1266
+ "num_tokens": 9269437.0,
1267
+ "logits/chosen": -1.7027034766334481,
1268
+ "logits/rejected": -1.3692697426790565,
1269
+ "mean_token_accuracy": 0.7298609726130962,
1270
+ "rewards/chosen": -0.9662762339459732,
1271
+ "rewards/rejected": -2.2450467050541194,
1272
+ "rewards/accuracies": 0.825,
1273
+ "rewards/margins": 1.2787704736925662,
1274
+ "logps/chosen": -57.37728985548019,
1275
+ "logps/rejected": -68.59222289323807,
1276
+ "epoch": 1.104,
1277
+ "step": 690
1278
+ },
1279
+ {
1280
+ "loss": 0.35138611793518065,
1281
+ "grad_norm": 0.12836965918540955,
1282
+ "learning_rate": 4.408000000000001e-06,
1283
+ "entropy": 0.8666601853678003,
1284
+ "num_tokens": 9404559.0,
1285
+ "logits/chosen": -1.3400690205304637,
1286
+ "logits/rejected": -1.0684046347991027,
1287
+ "mean_token_accuracy": 0.6958472795784474,
1288
+ "rewards/chosen": -0.7967793260220788,
1289
+ "rewards/rejected": -2.3613458889187315,
1290
+ "rewards/accuracies": 0.84375,
1291
+ "rewards/margins": 1.5645665610209107,
1292
+ "logps/chosen": -66.0351133108139,
1293
+ "logps/rejected": -81.51442708969117,
1294
+ "epoch": 1.12,
1295
+ "step": 700
1296
+ },
1297
+ {
1298
+ "loss": 0.4332468032836914,
1299
+ "grad_norm": 0.20934900641441345,
1300
+ "learning_rate": 4.328000000000001e-06,
1301
+ "entropy": 0.854771285172319,
1302
+ "num_tokens": 9539800.0,
1303
+ "logits/chosen": -1.3352951022130157,
1304
+ "logits/rejected": -0.9464862926160796,
1305
+ "mean_token_accuracy": 0.6998173886910081,
1306
+ "rewards/chosen": -0.8727404756122269,
1307
+ "rewards/rejected": -2.1966246593976395,
1308
+ "rewards/accuracies": 0.85,
1309
+ "rewards/margins": 1.3238841853104533,
1310
+ "logps/chosen": -61.889275419712064,
1311
+ "logps/rejected": -78.38478618860245,
1312
+ "epoch": 1.1360000000000001,
1313
+ "step": 710
1314
+ },
1315
+ {
1316
+ "loss": 0.4375255584716797,
1317
+ "grad_norm": 0.14867250621318817,
1318
+ "learning_rate": 4.248000000000001e-06,
1319
+ "entropy": 0.7838106972893002,
1320
+ "num_tokens": 9673582.0,
1321
+ "logits/chosen": -1.6430084008837227,
1322
+ "logits/rejected": -1.178061142015777,
1323
+ "mean_token_accuracy": 0.7228047780692577,
1324
+ "rewards/chosen": -0.8893449913855875,
1325
+ "rewards/rejected": -2.1319361824076624,
1326
+ "rewards/accuracies": 0.78125,
1327
+ "rewards/margins": 1.2425911880563945,
1328
+ "logps/chosen": -53.7250174164772,
1329
+ "logps/rejected": -75.55973731279373,
1330
+ "epoch": 1.152,
1331
+ "step": 720
1332
+ },
1333
+ {
1334
+ "loss": 0.4083255767822266,
1335
+ "grad_norm": 0.15854252874851227,
1336
+ "learning_rate": 4.168000000000001e-06,
1337
+ "entropy": 0.8028846303815953,
1338
+ "num_tokens": 9807723.0,
1339
+ "logits/chosen": -1.5796788729741613,
1340
+ "logits/rejected": -1.2279314483195203,
1341
+ "mean_token_accuracy": 0.7037102231755853,
1342
+ "rewards/chosen": -0.8733749952283688,
1343
+ "rewards/rejected": -2.346686244173907,
1344
+ "rewards/accuracies": 0.79375,
1345
+ "rewards/margins": 1.47331124804914,
1346
+ "logps/chosen": -57.2558536529541,
1347
+ "logps/rejected": -78.73293989896774,
1348
+ "epoch": 1.168,
1349
+ "step": 730
1350
+ },
1351
+ {
1352
+ "loss": 0.40847029685974123,
1353
+ "grad_norm": 0.2271832525730133,
1354
+ "learning_rate": 4.0880000000000005e-06,
1355
+ "entropy": 0.7124190992151853,
1356
+ "num_tokens": 9940521.0,
1357
+ "logits/chosen": -1.7263337940860637,
1358
+ "logits/rejected": -1.2993630722529041,
1359
+ "mean_token_accuracy": 0.7212265940383077,
1360
+ "rewards/chosen": -0.749589913454838,
1361
+ "rewards/rejected": -2.0937022533995333,
1362
+ "rewards/accuracies": 0.81875,
1363
+ "rewards/margins": 1.3441123379394413,
1364
+ "logps/chosen": -54.285783529281616,
1365
+ "logps/rejected": -67.44227703809739,
1366
+ "epoch": 1.184,
1367
+ "step": 740
1368
+ },
1369
+ {
1370
+ "loss": 0.4263965129852295,
1371
+ "grad_norm": 0.16508913040161133,
1372
+ "learning_rate": 4.008e-06,
1373
+ "entropy": 0.8771127343410626,
1374
+ "num_tokens": 10075349.0,
1375
+ "logits/chosen": -1.3213851460192345,
1376
+ "logits/rejected": -1.057589043568979,
1377
+ "mean_token_accuracy": 0.6872733032330871,
1378
+ "rewards/chosen": -0.9163320093342918,
1379
+ "rewards/rejected": -2.138802810528432,
1380
+ "rewards/accuracies": 0.80625,
1381
+ "rewards/margins": 1.2224708050955087,
1382
+ "logps/chosen": -65.35894116163254,
1383
+ "logps/rejected": -74.31111829280853,
1384
+ "epoch": 1.2,
1385
+ "step": 750
1386
+ },
1387
+ {
1388
+ "loss": 0.3466779708862305,
1389
+ "grad_norm": 0.14594385027885437,
1390
+ "learning_rate": 3.928e-06,
1391
+ "entropy": 0.8973389053368009,
1392
+ "num_tokens": 10210309.0,
1393
+ "logits/chosen": -1.429195333570735,
1394
+ "logits/rejected": -1.0293746532892192,
1395
+ "mean_token_accuracy": 0.6843982387334109,
1396
+ "rewards/chosen": -0.790108532004524,
1397
+ "rewards/rejected": -2.4523484482313505,
1398
+ "rewards/accuracies": 0.88125,
1399
+ "rewards/margins": 1.6622399202547968,
1400
+ "logps/chosen": -64.03692282438278,
1401
+ "logps/rejected": -83.50145937204361,
1402
+ "epoch": 1.216,
1403
+ "step": 760
1404
+ },
1405
+ {
1406
+ "loss": 0.3902191400527954,
1407
+ "grad_norm": 0.21555303037166595,
1408
+ "learning_rate": 3.848e-06,
1409
+ "entropy": 0.8176256978302263,
1410
+ "num_tokens": 10344571.0,
1411
+ "logits/chosen": -1.571296518421704,
1412
+ "logits/rejected": -1.1463247268095662,
1413
+ "mean_token_accuracy": 0.7237087743356824,
1414
+ "rewards/chosen": -0.9857207721681334,
1415
+ "rewards/rejected": -2.467484907130711,
1416
+ "rewards/accuracies": 0.85,
1417
+ "rewards/margins": 1.4817641287110745,
1418
+ "logps/chosen": -55.41268019676208,
1419
+ "logps/rejected": -83.52744359970093,
1420
+ "epoch": 1.232,
1421
+ "step": 770
1422
+ },
1423
+ {
1424
+ "loss": 0.4406851291656494,
1425
+ "grad_norm": 0.21594573557376862,
1426
+ "learning_rate": 3.7680000000000006e-06,
1427
+ "entropy": 0.7303940998070175,
1428
+ "num_tokens": 10478286.0,
1429
+ "logits/chosen": -1.8663801540109504,
1430
+ "logits/rejected": -1.4280047600468566,
1431
+ "mean_token_accuracy": 0.7173186991363764,
1432
+ "rewards/chosen": -1.1608861902008356,
1433
+ "rewards/rejected": -2.671035580892203,
1434
+ "rewards/accuracies": 0.79375,
1435
+ "rewards/margins": 1.51014938436565,
1436
+ "logps/chosen": -60.46502422094345,
1437
+ "logps/rejected": -77.58741216659546,
1438
+ "epoch": 1.248,
1439
+ "step": 780
1440
+ },
1441
+ {
1442
+ "loss": 0.4125234127044678,
1443
+ "grad_norm": 0.2962269186973572,
1444
+ "learning_rate": 3.6880000000000005e-06,
1445
+ "entropy": 0.8331925821723416,
1446
+ "num_tokens": 10612286.0,
1447
+ "logits/chosen": -1.5659800443469807,
1448
+ "logits/rejected": -1.2150587345047403,
1449
+ "mean_token_accuracy": 0.7073991242796183,
1450
+ "rewards/chosen": -1.1026862843311391,
1451
+ "rewards/rejected": -2.5605769436224364,
1452
+ "rewards/accuracies": 0.78125,
1453
+ "rewards/margins": 1.4578906406648457,
1454
+ "logps/chosen": -62.54402623176575,
1455
+ "logps/rejected": -79.81341508626937,
1456
+ "epoch": 1.264,
1457
+ "step": 790
1458
+ },
1459
+ {
1460
+ "loss": 0.49402365684509275,
1461
+ "grad_norm": 0.155300110578537,
1462
+ "learning_rate": 3.6080000000000004e-06,
1463
+ "entropy": 0.7988151058845687,
1464
+ "num_tokens": 10747462.0,
1465
+ "logits/chosen": -1.605360317746176,
1466
+ "logits/rejected": -1.2881572925592417,
1467
+ "mean_token_accuracy": 0.7002569252625108,
1468
+ "rewards/chosen": -1.0135203968995483,
1469
+ "rewards/rejected": -2.2969876725808716,
1470
+ "rewards/accuracies": 0.79375,
1471
+ "rewards/margins": 1.2834672711789608,
1472
+ "logps/chosen": -67.37470293045044,
1473
+ "logps/rejected": -79.85493696928025,
1474
+ "epoch": 1.28,
1475
+ "step": 800
1476
+ },
1477
+ {
1478
+ "loss": 0.4200831413269043,
1479
+ "grad_norm": 0.14519786834716797,
1480
+ "learning_rate": 3.5280000000000004e-06,
1481
+ "entropy": 0.8120490956622234,
1482
+ "num_tokens": 10882594.0,
1483
+ "logits/chosen": -1.5574423493502165,
1484
+ "logits/rejected": -1.3764162162150948,
1485
+ "mean_token_accuracy": 0.702505898848176,
1486
+ "rewards/chosen": -0.979388279729028,
1487
+ "rewards/rejected": -2.461002457328141,
1488
+ "rewards/accuracies": 0.8,
1489
+ "rewards/margins": 1.4816141836112364,
1490
+ "logps/chosen": -66.68434045314788,
1491
+ "logps/rejected": -83.09649764299392,
1492
+ "epoch": 1.296,
1493
+ "step": 810
1494
+ },
1495
+ {
1496
+ "loss": 0.4704907894134521,
1497
+ "grad_norm": 0.22803907096385956,
1498
+ "learning_rate": 3.4480000000000003e-06,
1499
+ "entropy": 0.8039654018590227,
1500
+ "num_tokens": 11016931.0,
1501
+ "logits/chosen": -1.5012306281869234,
1502
+ "logits/rejected": -1.2876392053232184,
1503
+ "mean_token_accuracy": 0.7034664511680603,
1504
+ "rewards/chosen": -1.1309354332945076,
1505
+ "rewards/rejected": -2.3758349375304535,
1506
+ "rewards/accuracies": 0.76875,
1507
+ "rewards/margins": 1.2448995084967465,
1508
+ "logps/chosen": -67.47772282361984,
1509
+ "logps/rejected": -78.3834860920906,
1510
+ "epoch": 1.312,
1511
+ "step": 820
1512
+ },
1513
+ {
1514
+ "loss": 0.46920132637023926,
1515
+ "grad_norm": 0.2387949824333191,
1516
+ "learning_rate": 3.368e-06,
1517
+ "entropy": 0.732459101951099,
1518
+ "num_tokens": 11150609.0,
1519
+ "logits/chosen": -1.7111103661903264,
1520
+ "logits/rejected": -1.3267267526306643,
1521
+ "mean_token_accuracy": 0.7098248641937971,
1522
+ "rewards/chosen": -0.9866411694383714,
1523
+ "rewards/rejected": -2.3024006365798413,
1524
+ "rewards/accuracies": 0.8,
1525
+ "rewards/margins": 1.3157594701158815,
1526
+ "logps/chosen": -60.04266767501831,
1527
+ "logps/rejected": -73.96700737476348,
1528
+ "epoch": 1.328,
1529
+ "step": 830
1530
+ },
1531
+ {
1532
+ "loss": 0.3219926357269287,
1533
+ "grad_norm": 0.13847558200359344,
1534
+ "learning_rate": 3.288e-06,
1535
+ "entropy": 0.7705854054656811,
1536
+ "num_tokens": 11284845.0,
1537
+ "logits/chosen": -1.7253091998162051,
1538
+ "logits/rejected": -1.305342065365432,
1539
+ "mean_token_accuracy": 0.7240345129743219,
1540
+ "rewards/chosen": -0.9102539952356892,
1541
+ "rewards/rejected": -2.657541433814913,
1542
+ "rewards/accuracies": 0.875,
1543
+ "rewards/margins": 1.7472874362953008,
1544
+ "logps/chosen": -56.32816154956818,
1545
+ "logps/rejected": -82.49419674873351,
1546
+ "epoch": 1.3439999999999999,
1547
+ "step": 840
1548
+ },
1549
+ {
1550
+ "loss": 0.39888598918914797,
1551
+ "grad_norm": 0.22760330140590668,
1552
+ "learning_rate": 3.208e-06,
1553
+ "entropy": 0.6883504351309966,
1554
+ "num_tokens": 11418114.0,
1555
+ "logits/chosen": -1.8767877806339819,
1556
+ "logits/rejected": -1.502016394931313,
1557
+ "mean_token_accuracy": 0.7253359684720635,
1558
+ "rewards/chosen": -0.836689239833504,
1559
+ "rewards/rejected": -2.3422608138527723,
1560
+ "rewards/accuracies": 0.80625,
1561
+ "rewards/margins": 1.5055715713184328,
1562
+ "logps/chosen": -53.072984755039215,
1563
+ "logps/rejected": -72.80904539823533,
1564
+ "epoch": 1.3599999999999999,
1565
+ "step": 850
1566
+ },
1567
+ {
1568
+ "loss": 0.40503392219543455,
1569
+ "grad_norm": 0.18328320980072021,
1570
+ "learning_rate": 3.1280000000000004e-06,
1571
+ "entropy": 0.7598929285246413,
1572
+ "num_tokens": 11552146.0,
1573
+ "logits/chosen": -1.644595842548687,
1574
+ "logits/rejected": -1.378459610872036,
1575
+ "mean_token_accuracy": 0.7259372064843774,
1576
+ "rewards/chosen": -0.9007043580990285,
1577
+ "rewards/rejected": -2.372628803132102,
1578
+ "rewards/accuracies": 0.8,
1579
+ "rewards/margins": 1.4719244507141411,
1580
+ "logps/chosen": -55.648898458480836,
1581
+ "logps/rejected": -78.23955315351486,
1582
+ "epoch": 1.376,
1583
+ "step": 860
1584
+ },
1585
+ {
1586
+ "loss": 0.3458548545837402,
1587
+ "grad_norm": 0.25410881638526917,
1588
+ "learning_rate": 3.0480000000000003e-06,
1589
+ "entropy": 0.7665736552706222,
1590
+ "num_tokens": 11686051.0,
1591
+ "logits/chosen": -1.578677616557072,
1592
+ "logits/rejected": -1.3612439345571947,
1593
+ "mean_token_accuracy": 0.713687221519649,
1594
+ "rewards/chosen": -0.9132042807443213,
1595
+ "rewards/rejected": -2.5326640743296593,
1596
+ "rewards/accuracies": 0.875,
1597
+ "rewards/margins": 1.6194597949273883,
1598
+ "logps/chosen": -62.23388094902039,
1599
+ "logps/rejected": -74.41176266670227,
1600
+ "epoch": 1.392,
1601
+ "step": 870
1602
+ },
1603
+ {
1604
+ "loss": 0.45064554214477537,
1605
+ "grad_norm": 0.31622838973999023,
1606
+ "learning_rate": 2.9680000000000002e-06,
1607
+ "entropy": 0.8155602383427322,
1608
+ "num_tokens": 11820419.0,
1609
+ "logits/chosen": -1.5256738113106172,
1610
+ "logits/rejected": -1.2444007046615775,
1611
+ "mean_token_accuracy": 0.7064365288242698,
1612
+ "rewards/chosen": -0.8790285978000612,
1613
+ "rewards/rejected": -2.279954434429237,
1614
+ "rewards/accuracies": 0.81875,
1615
+ "rewards/margins": 1.400925842532888,
1616
+ "logps/chosen": -61.98214646577835,
1617
+ "logps/rejected": -77.71078071594238,
1618
+ "epoch": 1.408,
1619
+ "step": 880
1620
+ },
1621
+ {
1622
+ "loss": 0.3549015045166016,
1623
+ "grad_norm": 0.11679533123970032,
1624
+ "learning_rate": 2.888e-06,
1625
+ "entropy": 0.8460370196611621,
1626
+ "num_tokens": 11954898.0,
1627
+ "logits/chosen": -1.501683007594535,
1628
+ "logits/rejected": -1.153882464001247,
1629
+ "mean_token_accuracy": 0.7017565036192537,
1630
+ "rewards/chosen": -0.9793404275318608,
1631
+ "rewards/rejected": -2.5882866755331633,
1632
+ "rewards/accuracies": 0.89375,
1633
+ "rewards/margins": 1.6089462437666953,
1634
+ "logps/chosen": -62.671991884708405,
1635
+ "logps/rejected": -85.92449575662613,
1636
+ "epoch": 1.424,
1637
+ "step": 890
1638
+ },
1639
+ {
1640
+ "loss": 0.32079691886901857,
1641
+ "grad_norm": 0.17164677381515503,
1642
+ "learning_rate": 2.808e-06,
1643
+ "entropy": 0.7836568029015325,
1644
+ "num_tokens": 12089403.0,
1645
+ "logits/chosen": -1.5902203304330556,
1646
+ "logits/rejected": -1.348343018569439,
1647
+ "mean_token_accuracy": 0.7099103134125471,
1648
+ "rewards/chosen": -0.906367156367196,
1649
+ "rewards/rejected": -2.5413650372705887,
1650
+ "rewards/accuracies": 0.88125,
1651
+ "rewards/margins": 1.634997878689319,
1652
+ "logps/chosen": -65.62818305492401,
1653
+ "logps/rejected": -79.59799456596375,
1654
+ "epoch": 1.44,
1655
+ "step": 900
1656
+ },
1657
+ {
1658
+ "loss": 0.3879056215286255,
1659
+ "grad_norm": 0.15152597427368164,
1660
+ "learning_rate": 2.728e-06,
1661
+ "entropy": 0.7635506895370782,
1662
+ "num_tokens": 12223715.0,
1663
+ "logits/chosen": -1.808664480653039,
1664
+ "logits/rejected": -1.4436211706139415,
1665
+ "mean_token_accuracy": 0.716391022503376,
1666
+ "rewards/chosen": -1.0626204300948303,
1667
+ "rewards/rejected": -2.617245429044124,
1668
+ "rewards/accuracies": 0.8125,
1669
+ "rewards/margins": 1.5546250022249297,
1670
+ "logps/chosen": -59.04966660737991,
1671
+ "logps/rejected": -79.71140024662017,
1672
+ "epoch": 1.456,
1673
+ "step": 910
1674
+ },
1675
+ {
1676
+ "loss": 0.5003737926483154,
1677
+ "grad_norm": 0.23257283866405487,
1678
+ "learning_rate": 2.648e-06,
1679
+ "entropy": 0.7805526316573378,
1680
+ "num_tokens": 12357865.0,
1681
+ "logits/chosen": -1.7092802822631128,
1682
+ "logits/rejected": -1.3571210243590142,
1683
+ "mean_token_accuracy": 0.7101537603884935,
1684
+ "rewards/chosen": -1.1259239912003978,
1685
+ "rewards/rejected": -2.455858718138188,
1686
+ "rewards/accuracies": 0.7875,
1687
+ "rewards/margins": 1.3299347181804477,
1688
+ "logps/chosen": -62.12466698884964,
1689
+ "logps/rejected": -79.51555901765823,
1690
+ "epoch": 1.472,
1691
+ "step": 920
1692
+ },
1693
+ {
1694
+ "loss": 0.4326589107513428,
1695
+ "grad_norm": 0.22872693836688995,
1696
+ "learning_rate": 2.568e-06,
1697
+ "entropy": 0.7554121573979501,
1698
+ "num_tokens": 12492128.0,
1699
+ "logits/chosen": -1.6719579694003723,
1700
+ "logits/rejected": -1.3663122032286132,
1701
+ "mean_token_accuracy": 0.6942645735107362,
1702
+ "rewards/chosen": -1.0867409846643568,
1703
+ "rewards/rejected": -2.5454429023200644,
1704
+ "rewards/accuracies": 0.79375,
1705
+ "rewards/margins": 1.4587019056081771,
1706
+ "logps/chosen": -63.67592179775238,
1707
+ "logps/rejected": -80.17804374694825,
1708
+ "epoch": 1.488,
1709
+ "step": 930
1710
+ },
1711
+ {
1712
+ "loss": 0.4602513790130615,
1713
+ "grad_norm": 0.23694008588790894,
1714
+ "learning_rate": 2.488e-06,
1715
+ "entropy": 0.7785145582747646,
1716
+ "num_tokens": 12626077.0,
1717
+ "logits/chosen": -1.5935042309292489,
1718
+ "logits/rejected": -1.3624577984140387,
1719
+ "mean_token_accuracy": 0.6916681522503495,
1720
+ "rewards/chosen": -1.1778735827072524,
1721
+ "rewards/rejected": -2.502696030540392,
1722
+ "rewards/accuracies": 0.8125,
1723
+ "rewards/margins": 1.3248224433511495,
1724
+ "logps/chosen": -63.580693411827085,
1725
+ "logps/rejected": -74.72070835828781,
1726
+ "epoch": 1.504,
1727
+ "step": 940
1728
+ },
1729
+ {
1730
+ "loss": 0.4067554473876953,
1731
+ "grad_norm": 0.14756956696510315,
1732
+ "learning_rate": 2.408e-06,
1733
+ "entropy": 0.8026386831275886,
1734
+ "num_tokens": 12760098.0,
1735
+ "logits/chosen": -1.5458875154452285,
1736
+ "logits/rejected": -1.2564218268845326,
1737
+ "mean_token_accuracy": 0.7152364812791348,
1738
+ "rewards/chosen": -1.2055871986289275,
1739
+ "rewards/rejected": -2.6404173804068707,
1740
+ "rewards/accuracies": 0.85,
1741
+ "rewards/margins": 1.4348301694728434,
1742
+ "logps/chosen": -66.13761007785797,
1743
+ "logps/rejected": -80.10225908756256,
1744
+ "epoch": 1.52,
1745
+ "step": 950
1746
+ },
1747
+ {
1748
+ "loss": 0.42372560501098633,
1749
+ "grad_norm": 0.14788998663425446,
1750
+ "learning_rate": 2.3280000000000004e-06,
1751
+ "entropy": 0.8012942865549121,
1752
+ "num_tokens": 12894652.0,
1753
+ "logits/chosen": -1.635073784869764,
1754
+ "logits/rejected": -1.3146647893445076,
1755
+ "mean_token_accuracy": 0.7114136775955557,
1756
+ "rewards/chosen": -1.1332746736516128,
1757
+ "rewards/rejected": -2.6066967224120163,
1758
+ "rewards/accuracies": 0.775,
1759
+ "rewards/margins": 1.4734220502898097,
1760
+ "logps/chosen": -63.05048147439957,
1761
+ "logps/rejected": -82.07224049568177,
1762
+ "epoch": 1.536,
1763
+ "step": 960
1764
+ },
1765
+ {
1766
+ "loss": 0.412662935256958,
1767
+ "grad_norm": 0.14732256531715393,
1768
+ "learning_rate": 2.2480000000000003e-06,
1769
+ "entropy": 0.8334445571847027,
1770
+ "num_tokens": 13030162.0,
1771
+ "logits/chosen": -1.6011668878902328,
1772
+ "logits/rejected": -1.2587357097834815,
1773
+ "mean_token_accuracy": 0.702854485437274,
1774
+ "rewards/chosen": -1.0372710642812308,
1775
+ "rewards/rejected": -2.6535557047463953,
1776
+ "rewards/accuracies": 0.8375,
1777
+ "rewards/margins": 1.6162846368737518,
1778
+ "logps/chosen": -65.74512588381768,
1779
+ "logps/rejected": -88.88693373203277,
1780
+ "epoch": 1.552,
1781
+ "step": 970
1782
+ },
1783
+ {
1784
+ "loss": 0.3407352209091187,
1785
+ "grad_norm": 0.2886792719364166,
1786
+ "learning_rate": 2.1680000000000002e-06,
1787
+ "entropy": 0.8762669585994445,
1788
+ "num_tokens": 13165409.0,
1789
+ "logits/chosen": -1.383209431558544,
1790
+ "logits/rejected": -1.0744050889575703,
1791
+ "mean_token_accuracy": 0.6733901240862906,
1792
+ "rewards/chosen": -1.008211946907977,
1793
+ "rewards/rejected": -2.624329062405741,
1794
+ "rewards/accuracies": 0.86875,
1795
+ "rewards/margins": 1.6161171085201205,
1796
+ "logps/chosen": -69.2023845911026,
1797
+ "logps/rejected": -83.00953713655471,
1798
+ "epoch": 1.568,
1799
+ "step": 980
1800
+ },
1801
+ {
1802
+ "loss": 0.4386160850524902,
1803
+ "grad_norm": 0.2656986713409424,
1804
+ "learning_rate": 2.088e-06,
1805
+ "entropy": 0.8209956398721261,
1806
+ "num_tokens": 13299607.0,
1807
+ "logits/chosen": -1.4395911330145508,
1808
+ "logits/rejected": -1.2677628081064927,
1809
+ "mean_token_accuracy": 0.6904863499104976,
1810
+ "rewards/chosen": -1.0870793154346756,
1811
+ "rewards/rejected": -2.4575889983447268,
1812
+ "rewards/accuracies": 0.78125,
1813
+ "rewards/margins": 1.3705096821766347,
1814
+ "logps/chosen": -65.42525545358657,
1815
+ "logps/rejected": -74.03723225593566,
1816
+ "epoch": 1.584,
1817
+ "step": 990
1818
+ },
1819
+ {
1820
+ "loss": 0.35819923877716064,
1821
+ "grad_norm": 0.35382354259490967,
1822
+ "learning_rate": 2.008e-06,
1823
+ "entropy": 0.7399830836133333,
1824
+ "num_tokens": 13434502.0,
1825
+ "logits/chosen": -1.6976982361606354,
1826
+ "logits/rejected": -1.3072192337860213,
1827
+ "mean_token_accuracy": 0.7421066265553236,
1828
+ "rewards/chosen": -1.0984582830686123,
1829
+ "rewards/rejected": -2.7966011623386295,
1830
+ "rewards/accuracies": 0.875,
1831
+ "rewards/margins": 1.6981428703293204,
1832
+ "logps/chosen": -62.93297493457794,
1833
+ "logps/rejected": -82.4026222705841,
1834
+ "epoch": 1.6,
1835
+ "step": 1000
1836
+ },
1837
+ {
1838
+ "loss": 0.4160293102264404,
1839
+ "grad_norm": 0.11767679452896118,
1840
+ "learning_rate": 1.928e-06,
1841
+ "entropy": 0.7990678637885139,
1842
+ "num_tokens": 13568600.0,
1843
+ "logits/chosen": -1.5975146089430179,
1844
+ "logits/rejected": -1.2924786059115378,
1845
+ "mean_token_accuracy": 0.7110372580587864,
1846
+ "rewards/chosen": -0.9529279105423484,
1847
+ "rewards/rejected": -2.457513489993289,
1848
+ "rewards/accuracies": 0.83125,
1849
+ "rewards/margins": 1.504585579968989,
1850
+ "logps/chosen": -63.974093568325046,
1851
+ "logps/rejected": -74.71904839277268,
1852
+ "epoch": 1.616,
1853
+ "step": 1010
1854
+ },
1855
+ {
1856
+ "loss": 0.3250428199768066,
1857
+ "grad_norm": 0.12981919944286346,
1858
+ "learning_rate": 1.8480000000000001e-06,
1859
+ "entropy": 0.7811902783811092,
1860
+ "num_tokens": 13702787.0,
1861
+ "logits/chosen": -1.587494817410056,
1862
+ "logits/rejected": -1.1941186838362041,
1863
+ "mean_token_accuracy": 0.7234507920220494,
1864
+ "rewards/chosen": -0.8217556012241403,
1865
+ "rewards/rejected": -2.597050206689164,
1866
+ "rewards/accuracies": 0.86875,
1867
+ "rewards/margins": 1.7752946069464088,
1868
+ "logps/chosen": -61.340254080295566,
1869
+ "logps/rejected": -79.60141725540161,
1870
+ "epoch": 1.6320000000000001,
1871
+ "step": 1020
1872
+ },
1873
+ {
1874
+ "loss": 0.4002103805541992,
1875
+ "grad_norm": 0.2534341812133789,
1876
+ "learning_rate": 1.7680000000000003e-06,
1877
+ "entropy": 0.8721957165267668,
1878
+ "num_tokens": 13837799.0,
1879
+ "logits/chosen": -1.4787466162956828,
1880
+ "logits/rejected": -1.1347675946257396,
1881
+ "mean_token_accuracy": 0.7160949306562543,
1882
+ "rewards/chosen": -0.9889563272474333,
1883
+ "rewards/rejected": -2.5054163753055034,
1884
+ "rewards/accuracies": 0.81875,
1885
+ "rewards/margins": 1.5164600439369678,
1886
+ "logps/chosen": -69.03193366527557,
1887
+ "logps/rejected": -80.24655103683472,
1888
+ "epoch": 1.6480000000000001,
1889
+ "step": 1030
1890
+ },
1891
+ {
1892
+ "loss": 0.4034124374389648,
1893
+ "grad_norm": 0.23815952241420746,
1894
+ "learning_rate": 1.6880000000000002e-06,
1895
+ "entropy": 0.7898992500049644,
1896
+ "num_tokens": 13972529.0,
1897
+ "logits/chosen": -1.6163878058701155,
1898
+ "logits/rejected": -1.2316415786069164,
1899
+ "mean_token_accuracy": 0.7335911913774907,
1900
+ "rewards/chosen": -0.9068507085920828,
1901
+ "rewards/rejected": -2.4930222455412148,
1902
+ "rewards/accuracies": 0.84375,
1903
+ "rewards/margins": 1.5861715397797524,
1904
+ "logps/chosen": -62.6472428560257,
1905
+ "logps/rejected": -78.13663581609725,
1906
+ "epoch": 1.6640000000000001,
1907
+ "step": 1040
1908
+ },
1909
+ {
1910
+ "loss": 0.4241136074066162,
1911
+ "grad_norm": 0.1419256180524826,
1912
+ "learning_rate": 1.608e-06,
1913
+ "entropy": 0.9256169050706375,
1914
+ "num_tokens": 14107336.0,
1915
+ "logits/chosen": -1.2789081893064282,
1916
+ "logits/rejected": -1.098782251423331,
1917
+ "mean_token_accuracy": 0.696486575063318,
1918
+ "rewards/chosen": -0.8607778700679773,
1919
+ "rewards/rejected": -2.315709656581748,
1920
+ "rewards/accuracies": 0.8125,
1921
+ "rewards/margins": 1.454931782837957,
1922
+ "logps/chosen": -74.47855192422867,
1923
+ "logps/rejected": -76.75005420446396,
1924
+ "epoch": 1.6800000000000002,
1925
+ "step": 1050
1926
+ },
1927
+ {
1928
+ "loss": 0.48003559112548827,
1929
+ "grad_norm": 0.14790725708007812,
1930
+ "learning_rate": 1.528e-06,
1931
+ "entropy": 0.7936980344704352,
1932
+ "num_tokens": 14241540.0,
1933
+ "logits/chosen": -1.5867842467297604,
1934
+ "logits/rejected": -1.1837827649291766,
1935
+ "mean_token_accuracy": 0.7259030997753143,
1936
+ "rewards/chosen": -0.8804566722927121,
1937
+ "rewards/rejected": -2.2063653921242805,
1938
+ "rewards/accuracies": 0.79375,
1939
+ "rewards/margins": 1.3259087240789085,
1940
+ "logps/chosen": -58.475341248512265,
1941
+ "logps/rejected": -74.59980441331864,
1942
+ "epoch": 1.696,
1943
+ "step": 1060
1944
+ },
1945
+ {
1946
+ "loss": 0.3922820329666138,
1947
+ "grad_norm": 0.1496279537677765,
1948
+ "learning_rate": 1.4480000000000002e-06,
1949
+ "entropy": 0.8726246880483813,
1950
+ "num_tokens": 14376121.0,
1951
+ "logits/chosen": -1.4914376459842063,
1952
+ "logits/rejected": -1.1848033257275015,
1953
+ "mean_token_accuracy": 0.7143584050238132,
1954
+ "rewards/chosen": -0.9215551663655788,
1955
+ "rewards/rejected": -2.562272682785988,
1956
+ "rewards/accuracies": 0.84375,
1957
+ "rewards/margins": 1.6407175094820559,
1958
+ "logps/chosen": -67.5427442073822,
1959
+ "logps/rejected": -79.30532623529434,
1960
+ "epoch": 1.712,
1961
+ "step": 1070
1962
+ },
1963
+ {
1964
+ "loss": 0.44224209785461427,
1965
+ "grad_norm": 0.2878839075565338,
1966
+ "learning_rate": 1.368e-06,
1967
+ "entropy": 0.7888671966618859,
1968
+ "num_tokens": 14510553.0,
1969
+ "logits/chosen": -1.6546901899116329,
1970
+ "logits/rejected": -1.3682432627615229,
1971
+ "mean_token_accuracy": 0.6996359150856734,
1972
+ "rewards/chosen": -0.8950480898056412,
1973
+ "rewards/rejected": -2.3655205052462405,
1974
+ "rewards/accuracies": 0.80625,
1975
+ "rewards/margins": 1.4704724150244146,
1976
+ "logps/chosen": -63.91799589395523,
1977
+ "logps/rejected": -74.64101424217225,
1978
+ "epoch": 1.728,
1979
+ "step": 1080
1980
+ },
1981
+ {
1982
+ "loss": 0.3927299499511719,
1983
+ "grad_norm": 0.1370965987443924,
1984
+ "learning_rate": 1.288e-06,
1985
+ "entropy": 0.8091648026223993,
1986
+ "num_tokens": 14644507.0,
1987
+ "logits/chosen": -1.687283619747059,
1988
+ "logits/rejected": -1.3548523346162953,
1989
+ "mean_token_accuracy": 0.7228656150400639,
1990
+ "rewards/chosen": -0.7743405980079843,
1991
+ "rewards/rejected": -2.3230774260126053,
1992
+ "rewards/accuracies": 0.7875,
1993
+ "rewards/margins": 1.5487368311733007,
1994
+ "logps/chosen": -56.80163584947586,
1995
+ "logps/rejected": -80.1871037721634,
1996
+ "epoch": 1.744,
1997
+ "step": 1090
1998
+ },
1999
+ {
2000
+ "loss": 0.36075007915496826,
2001
+ "grad_norm": 0.12493802607059479,
2002
+ "learning_rate": 1.2080000000000001e-06,
2003
+ "entropy": 0.8516323209594703,
2004
+ "num_tokens": 14779558.0,
2005
+ "logits/chosen": -1.5479666328178479,
2006
+ "logits/rejected": -1.1764522167627494,
2007
+ "mean_token_accuracy": 0.7081021483056247,
2008
+ "rewards/chosen": -0.8559462582834385,
2009
+ "rewards/rejected": -2.430596137570683,
2010
+ "rewards/accuracies": 0.84375,
2011
+ "rewards/margins": 1.5746498768217863,
2012
+ "logps/chosen": -63.79940243959427,
2013
+ "logps/rejected": -79.56198363304138,
2014
+ "epoch": 1.76,
2015
+ "step": 1100
2016
+ },
2017
+ {
2018
+ "loss": 0.49372134208679197,
2019
+ "grad_norm": 0.24344250559806824,
2020
+ "learning_rate": 1.128e-06,
2021
+ "entropy": 0.8455155969480984,
2022
+ "num_tokens": 14914286.0,
2023
+ "logits/chosen": -1.498396463441885,
2024
+ "logits/rejected": -1.1425197974463714,
2025
+ "mean_token_accuracy": 0.7100071370601654,
2026
+ "rewards/chosen": -0.8169066427948565,
2027
+ "rewards/rejected": -2.166107503604144,
2028
+ "rewards/accuracies": 0.76875,
2029
+ "rewards/margins": 1.3492008646018803,
2030
+ "logps/chosen": -61.403113543987274,
2031
+ "logps/rejected": -75.34919095039368,
2032
+ "epoch": 1.776,
2033
+ "step": 1110
2034
+ },
2035
+ {
2036
+ "loss": 0.4005413055419922,
2037
+ "grad_norm": 0.20426344871520996,
2038
+ "learning_rate": 1.0480000000000002e-06,
2039
+ "entropy": 0.8211736791708972,
2040
+ "num_tokens": 15048840.0,
2041
+ "logits/chosen": -1.582013316231499,
2042
+ "logits/rejected": -1.3164341995727113,
2043
+ "mean_token_accuracy": 0.7223803894594312,
2044
+ "rewards/chosen": -0.6959973029966932,
2045
+ "rewards/rejected": -2.1918047105107687,
2046
+ "rewards/accuracies": 0.84375,
2047
+ "rewards/margins": 1.4958074030466377,
2048
+ "logps/chosen": -59.653766822814944,
2049
+ "logps/rejected": -75.93207306861878,
2050
+ "epoch": 1.792,
2051
+ "step": 1120
2052
+ },
2053
+ {
2054
+ "loss": 0.5007998466491699,
2055
+ "grad_norm": 0.1154891774058342,
2056
+ "learning_rate": 9.68e-07,
2057
+ "entropy": 0.8647114810533821,
2058
+ "num_tokens": 15184276.0,
2059
+ "logits/chosen": -1.356775653423806,
2060
+ "logits/rejected": -1.1500322818720279,
2061
+ "mean_token_accuracy": 0.7039438035339117,
2062
+ "rewards/chosen": -0.8606041681859097,
2063
+ "rewards/rejected": -2.0742746030678973,
2064
+ "rewards/accuracies": 0.7375,
2065
+ "rewards/margins": 1.2136704298667609,
2066
+ "logps/chosen": -64.9673285484314,
2067
+ "logps/rejected": -80.83175637722016,
2068
+ "epoch": 1.808,
2069
+ "step": 1130
2070
+ },
2071
+ {
2072
+ "loss": 0.4986130714416504,
2073
+ "grad_norm": 0.6216063499450684,
2074
+ "learning_rate": 8.880000000000001e-07,
2075
+ "entropy": 0.774267910355411,
2076
+ "num_tokens": 15317721.0,
2077
+ "logits/chosen": -1.4605975439966772,
2078
+ "logits/rejected": -1.3212052490062418,
2079
+ "mean_token_accuracy": 0.7165707518346608,
2080
+ "rewards/chosen": -0.8740379733324517,
2081
+ "rewards/rejected": -1.9363951487233861,
2082
+ "rewards/accuracies": 0.76875,
2083
+ "rewards/margins": 1.0623571707867085,
2084
+ "logps/chosen": -58.174967527389526,
2085
+ "logps/rejected": -67.10608189105987,
2086
+ "epoch": 1.8239999999999998,
2087
+ "step": 1140
2088
+ },
2089
+ {
2090
+ "loss": 0.39597718715667723,
2091
+ "grad_norm": 0.1611914187669754,
2092
+ "learning_rate": 8.08e-07,
2093
+ "entropy": 0.8271302699897205,
2094
+ "num_tokens": 15452553.0,
2095
+ "logits/chosen": -1.50679093223041,
2096
+ "logits/rejected": -1.147970850967657,
2097
+ "mean_token_accuracy": 0.7078391901217401,
2098
+ "rewards/chosen": -0.8506218325230293,
2099
+ "rewards/rejected": -2.2930383594852173,
2100
+ "rewards/accuracies": 0.8375,
2101
+ "rewards/margins": 1.4424165301956235,
2102
+ "logps/chosen": -60.48249053955078,
2103
+ "logps/rejected": -79.1380724787712,
2104
+ "epoch": 1.8399999999999999,
2105
+ "step": 1150
2106
+ },
2107
+ {
2108
+ "loss": 0.3954659700393677,
2109
+ "grad_norm": 0.19070428609848022,
2110
+ "learning_rate": 7.280000000000001e-07,
2111
+ "entropy": 0.7992117294867057,
2112
+ "num_tokens": 15586655.0,
2113
+ "logits/chosen": -1.6674989181953035,
2114
+ "logits/rejected": -1.2958623246252912,
2115
+ "mean_token_accuracy": 0.7274953337386251,
2116
+ "rewards/chosen": -0.897261195579631,
2117
+ "rewards/rejected": -2.37544046624098,
2118
+ "rewards/accuracies": 0.8,
2119
+ "rewards/margins": 1.4781792684458197,
2120
+ "logps/chosen": -55.330790144205096,
2121
+ "logps/rejected": -79.54153176546097,
2122
+ "epoch": 1.8559999999999999,
2123
+ "step": 1160
2124
+ },
2125
+ {
2126
+ "loss": 0.5150039196014404,
2127
+ "grad_norm": 0.2727234959602356,
2128
+ "learning_rate": 6.48e-07,
2129
+ "entropy": 0.7774595006601885,
2130
+ "num_tokens": 15720172.0,
2131
+ "logits/chosen": -1.673701828468026,
2132
+ "logits/rejected": -1.2861514487494707,
2133
+ "mean_token_accuracy": 0.7126229584217072,
2134
+ "rewards/chosen": -0.9092265904924716,
2135
+ "rewards/rejected": -2.033220373163931,
2136
+ "rewards/accuracies": 0.71875,
2137
+ "rewards/margins": 1.1239937825594097,
2138
+ "logps/chosen": -54.55541696548462,
2139
+ "logps/rejected": -76.10742880105973,
2140
+ "epoch": 1.8719999999999999,
2141
+ "step": 1170
2142
+ },
2143
+ {
2144
+ "loss": 0.4881202220916748,
2145
+ "grad_norm": 0.21918685734272003,
2146
+ "learning_rate": 5.680000000000001e-07,
2147
+ "entropy": 0.7866302890935912,
2148
+ "num_tokens": 15853755.0,
2149
+ "logits/chosen": -1.4762931082547661,
2150
+ "logits/rejected": -1.2942548537923684,
2151
+ "mean_token_accuracy": 0.7225816631689668,
2152
+ "rewards/chosen": -0.9264017570319993,
2153
+ "rewards/rejected": -1.9995961244334466,
2154
+ "rewards/accuracies": 0.7875,
2155
+ "rewards/margins": 1.0731943636201322,
2156
+ "logps/chosen": -60.705457758903506,
2157
+ "logps/rejected": -66.6190501689911,
2158
+ "epoch": 1.888,
2159
+ "step": 1180
2160
+ },
2161
+ {
2162
+ "loss": 0.45177521705627444,
2163
+ "grad_norm": 0.23347221314907074,
2164
+ "learning_rate": 4.88e-07,
2165
+ "entropy": 0.8309914332116023,
2166
+ "num_tokens": 15988701.0,
2167
+ "logits/chosen": -1.4661994627051458,
2168
+ "logits/rejected": -1.2287666153016743,
2169
+ "mean_token_accuracy": 0.7092148935422301,
2170
+ "rewards/chosen": -0.8807039022503886,
2171
+ "rewards/rejected": -2.185251401356072,
2172
+ "rewards/accuracies": 0.80625,
2173
+ "rewards/margins": 1.304547501122579,
2174
+ "logps/chosen": -62.431247127056125,
2175
+ "logps/rejected": -74.59568692445755,
2176
+ "epoch": 1.904,
2177
+ "step": 1190
2178
+ },
2179
+ {
2180
+ "loss": 0.44033398628234866,
2181
+ "grad_norm": 0.13558809459209442,
2182
+ "learning_rate": 4.0800000000000005e-07,
2183
+ "entropy": 0.8481319433776662,
2184
+ "num_tokens": 16123227.0,
2185
+ "logits/chosen": -1.4890639792428868,
2186
+ "logits/rejected": -1.1712801983612529,
2187
+ "mean_token_accuracy": 0.7045220224186778,
2188
+ "rewards/chosen": -0.8116515700123272,
2189
+ "rewards/rejected": -2.0684703564504163,
2190
+ "rewards/accuracies": 0.83125,
2191
+ "rewards/margins": 1.2568187874741852,
2192
+ "logps/chosen": -63.18868860006332,
2193
+ "logps/rejected": -74.17321823835373,
2194
+ "epoch": 1.92,
2195
+ "step": 1200
2196
+ },
2197
+ {
2198
+ "loss": 0.4489591598510742,
2199
+ "grad_norm": 0.2724771499633789,
2200
+ "learning_rate": 3.280000000000001e-07,
2201
+ "entropy": 0.8390395241905935,
2202
+ "num_tokens": 16257799.0,
2203
+ "logits/chosen": -1.3757150913324974,
2204
+ "logits/rejected": -1.180797201944608,
2205
+ "mean_token_accuracy": 0.6906995047815144,
2206
+ "rewards/chosen": -0.8883007764234208,
2207
+ "rewards/rejected": -2.3104404117213564,
2208
+ "rewards/accuracies": 0.8125,
2209
+ "rewards/margins": 1.422139625577256,
2210
+ "logps/chosen": -64.57728606462479,
2211
+ "logps/rejected": -76.76991089582444,
2212
+ "epoch": 1.936,
2213
+ "step": 1210
2214
+ },
2215
+ {
2216
+ "loss": 0.3736592769622803,
2217
+ "grad_norm": 0.23324978351593018,
2218
+ "learning_rate": 2.48e-07,
2219
+ "entropy": 0.7958670913358219,
2220
+ "num_tokens": 16392755.0,
2221
+ "logits/chosen": -1.5214667053964295,
2222
+ "logits/rejected": -1.1308945168158175,
2223
+ "mean_token_accuracy": 0.7339793419465422,
2224
+ "rewards/chosen": -0.8573693673475645,
2225
+ "rewards/rejected": -2.422400009748526,
2226
+ "rewards/accuracies": 0.84375,
2227
+ "rewards/margins": 1.565030633006245,
2228
+ "logps/chosen": -62.808938360214235,
2229
+ "logps/rejected": -81.37407802343368,
2230
+ "epoch": 1.952,
2231
+ "step": 1220
2232
+ },
2233
+ {
2234
+ "loss": 0.33856496810913084,
2235
+ "grad_norm": 0.2365734577178955,
2236
+ "learning_rate": 1.68e-07,
2237
+ "entropy": 0.7709657683037221,
2238
+ "num_tokens": 16526347.0,
2239
+ "logits/chosen": -1.5951650245485083,
2240
+ "logits/rejected": -1.2316822978483537,
2241
+ "mean_token_accuracy": 0.7203758641146123,
2242
+ "rewards/chosen": -0.7306884591787821,
2243
+ "rewards/rejected": -2.310912328850827,
2244
+ "rewards/accuracies": 0.8625,
2245
+ "rewards/margins": 1.5802238748408854,
2246
+ "logps/chosen": -53.69367561340332,
2247
+ "logps/rejected": -75.45296376943588,
2248
+ "epoch": 1.968,
2249
+ "step": 1230
2250
+ },
2251
+ {
2252
+ "loss": 0.47231736183166506,
2253
+ "grad_norm": 0.1407570242881775,
2254
+ "learning_rate": 8.800000000000001e-08,
2255
+ "entropy": 0.9006856581720057,
2256
+ "num_tokens": 16660816.0,
2257
+ "logits/chosen": -1.4061471100194554,
2258
+ "logits/rejected": -1.0629769642593176,
2259
+ "mean_token_accuracy": 0.697626062296331,
2260
+ "rewards/chosen": -0.7163842913665576,
2261
+ "rewards/rejected": -1.9068784552206126,
2262
+ "rewards/accuracies": 0.8,
2263
+ "rewards/margins": 1.1904941664426587,
2264
+ "logps/chosen": -60.04284707307816,
2265
+ "logps/rejected": -76.30784704685212,
2266
+ "epoch": 1.984,
2267
+ "step": 1240
2268
+ },
2269
+ {
2270
+ "loss": 0.4329345226287842,
2271
+ "grad_norm": 0.20022091269493103,
2272
+ "learning_rate": 8e-09,
2273
+ "entropy": 0.7137106273818062,
2274
+ "num_tokens": 16794078.0,
2275
+ "logits/chosen": -1.7487986939590061,
2276
+ "logits/rejected": -1.4640005781460887,
2277
+ "mean_token_accuracy": 0.7085168479010463,
2278
+ "rewards/chosen": -0.7161212222184986,
2279
+ "rewards/rejected": -2.086236947233556,
2280
+ "rewards/accuracies": 0.80625,
2281
+ "rewards/margins": 1.3701157211326063,
2282
+ "logps/chosen": -54.929140663146974,
2283
+ "logps/rejected": -69.96422597169877,
2284
+ "epoch": 2.0,
2285
+ "step": 1250
2286
+ },
2287
+ {
2288
+ "train_runtime": 5977.8981,
2289
+ "train_samples_per_second": 3.346,
2290
+ "train_steps_per_second": 0.209,
2291
+ "total_flos": 1.3612284112597402e+17,
2292
+ "train_loss": 0.45482119541168214,
2293
+ "epoch": 2.0,
2294
+ "step": 1250
2295
+ }
2296
+ ],
2297
+ "validation_monitor_size": 0,
2298
+ "validation_monitor_selection": "fixed_seed_random_without_replacement",
2299
+ "validation_monitor_seed": 22,
2300
+ "validation_monitor_indices": [],
2301
+ "early_stopping_patience": null
2302
+ }