geyuxu commited on
Commit
e4349c2
·
verified ·
1 Parent(s): 0410149

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -34,3 +34,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
  D_full_emf1_seed22/tokenizer.json filter=lfs diff=lfs merge=lfs -text
 
 
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
  D_full_emf1_seed22/tokenizer.json filter=lfs diff=lfs merge=lfs -text
37
+ D_full_emf1_seed23/tokenizer.json filter=lfs diff=lfs merge=lfs -text
D_full_emf1_seed23/adapter_config.json ADDED
@@ -0,0 +1,43 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alora_invocation_tokens": null,
3
+ "alpha_pattern": {},
4
+ "arrow_config": null,
5
+ "auto_mapping": null,
6
+ "base_model_name_or_path": "/home/yuxu/.cache/huggingface/hub/models--Qwen--Qwen2.5-1.5B-Instruct/snapshots/989aa7980e4cf806f80c7fef2b1adb7bc71aa306",
7
+ "bias": "none",
8
+ "corda_config": null,
9
+ "ensure_weight_tying": false,
10
+ "eva_config": null,
11
+ "exclude_modules": null,
12
+ "fan_in_fan_out": false,
13
+ "inference_mode": true,
14
+ "init_lora_weights": true,
15
+ "layer_replication": null,
16
+ "layers_pattern": null,
17
+ "layers_to_transform": null,
18
+ "loftq_config": {},
19
+ "lora_alpha": 32,
20
+ "lora_bias": false,
21
+ "lora_dropout": 0.05,
22
+ "megatron_config": null,
23
+ "megatron_core": "megatron.core",
24
+ "modules_to_save": null,
25
+ "peft_type": "LORA",
26
+ "peft_version": "0.18.1",
27
+ "qalora_group_size": 16,
28
+ "r": 16,
29
+ "rank_pattern": {},
30
+ "revision": null,
31
+ "target_modules": [
32
+ "k_proj",
33
+ "o_proj",
34
+ "v_proj",
35
+ "q_proj"
36
+ ],
37
+ "target_parameters": null,
38
+ "task_type": "CAUSAL_LM",
39
+ "trainable_token_indices": null,
40
+ "use_dora": false,
41
+ "use_qalora": false,
42
+ "use_rslora": false
43
+ }
D_full_emf1_seed23/adapter_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:97c635e919ed27f342872bd34b3097728e23ebc152c6db574e0f2f2ca869aad3
3
+ size 17462432
D_full_emf1_seed23/chat_template.jinja ADDED
@@ -0,0 +1,54 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- if tools %}
2
+ {{- '<|im_start|>system\n' }}
3
+ {%- if messages[0]['role'] == 'system' %}
4
+ {{- messages[0]['content'] }}
5
+ {%- else %}
6
+ {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }}
7
+ {%- endif %}
8
+ {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
9
+ {%- for tool in tools %}
10
+ {{- "\n" }}
11
+ {{- tool | tojson }}
12
+ {%- endfor %}
13
+ {{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
14
+ {%- else %}
15
+ {%- if messages[0]['role'] == 'system' %}
16
+ {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }}
17
+ {%- else %}
18
+ {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }}
19
+ {%- endif %}
20
+ {%- endif %}
21
+ {%- for message in messages %}
22
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %}
23
+ {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }}
24
+ {%- elif message.role == "assistant" %}
25
+ {{- '<|im_start|>' + message.role }}
26
+ {%- if message.content %}
27
+ {{- '\n' + message.content }}
28
+ {%- endif %}
29
+ {%- for tool_call in message.tool_calls %}
30
+ {%- if tool_call.function is defined %}
31
+ {%- set tool_call = tool_call.function %}
32
+ {%- endif %}
33
+ {{- '\n<tool_call>\n{"name": "' }}
34
+ {{- tool_call.name }}
35
+ {{- '", "arguments": ' }}
36
+ {{- tool_call.arguments | tojson }}
37
+ {{- '}\n</tool_call>' }}
38
+ {%- endfor %}
39
+ {{- '<|im_end|>\n' }}
40
+ {%- elif message.role == "tool" %}
41
+ {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %}
42
+ {{- '<|im_start|>user' }}
43
+ {%- endif %}
44
+ {{- '\n<tool_response>\n' }}
45
+ {{- message.content }}
46
+ {{- '\n</tool_response>' }}
47
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
48
+ {{- '<|im_end|>\n' }}
49
+ {%- endif %}
50
+ {%- endif %}
51
+ {%- endfor %}
52
+ {%- if add_generation_prompt %}
53
+ {{- '<|im_start|>assistant\n' }}
54
+ {%- endif %}
D_full_emf1_seed23/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5
3
+ size 11422166
D_full_emf1_seed23/tokenizer_config.json ADDED
@@ -0,0 +1,29 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": null,
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|im_end|>",
7
+ "errors": "replace",
8
+ "extra_special_tokens": [
9
+ "<|im_start|>",
10
+ "<|im_end|>",
11
+ "<|object_ref_start|>",
12
+ "<|object_ref_end|>",
13
+ "<|box_start|>",
14
+ "<|box_end|>",
15
+ "<|quad_start|>",
16
+ "<|quad_end|>",
17
+ "<|vision_start|>",
18
+ "<|vision_end|>",
19
+ "<|vision_pad|>",
20
+ "<|image_pad|>",
21
+ "<|video_pad|>"
22
+ ],
23
+ "is_local": true,
24
+ "model_max_length": 131072,
25
+ "pad_token": "<|endoftext|>",
26
+ "split_special_tokens": false,
27
+ "tokenizer_class": "Qwen2Tokenizer",
28
+ "unk_token": null
29
+ }
D_full_emf1_seed23/training_summary.json ADDED
@@ -0,0 +1,2302 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model_name": "Qwen/Qwen2.5-1.5B-Instruct",
3
+ "resolved_model": "/home/yuxu/.cache/huggingface/hub/models--Qwen--Qwen2.5-1.5B-Instruct/snapshots/989aa7980e4cf806f80c7fef2b1adb7bc71aa306",
4
+ "num_train_records": 10000,
5
+ "num_validation_records_available": 0,
6
+ "training_config": {
7
+ "lora_rank": 16,
8
+ "lora_alpha": 32,
9
+ "learning_rate": 1e-05,
10
+ "num_epochs": 2,
11
+ "per_device_batch_size": 1,
12
+ "per_device_eval_batch_size": 1,
13
+ "gradient_accumulation_steps": 16,
14
+ "beta": 0.1,
15
+ "max_length": 512,
16
+ "max_prompt_length": 384,
17
+ "seed": 23,
18
+ "save_steps": 250,
19
+ "save_total_limit": 2,
20
+ "resume_from_checkpoint": null,
21
+ "precision_dtype": "torch.bfloat16",
22
+ "bf16": true,
23
+ "fp16": false,
24
+ "tokenizer_add_bos_token": false
25
+ },
26
+ "global_step": 1250,
27
+ "best_metric": null,
28
+ "best_model_checkpoint": null,
29
+ "train_metrics": {
30
+ "train_runtime": 6000.0528,
31
+ "train_samples_per_second": 3.333,
32
+ "train_steps_per_second": 0.208,
33
+ "total_flos": 1.3612284112597402e+17,
34
+ "train_loss": 0.452988232421875
35
+ },
36
+ "log_history": [
37
+ {
38
+ "loss": 0.6925445079803467,
39
+ "grad_norm": 0.13106924295425415,
40
+ "learning_rate": 9.928e-06,
41
+ "entropy": 0.8430028882343322,
42
+ "num_tokens": 133829.0,
43
+ "logits/chosen": -1.0539194697152947,
44
+ "logits/rejected": -1.0023873638157341,
45
+ "mean_token_accuracy": 0.7161535605788231,
46
+ "rewards/chosen": 0.0006855225969047751,
47
+ "rewards/rejected": -0.0007722664523498679,
48
+ "rewards/accuracies": 0.54375,
49
+ "rewards/margins": 0.001457789224514272,
50
+ "logps/chosen": -53.864716422557834,
51
+ "logps/rejected": -52.49959944486618,
52
+ "epoch": 0.016,
53
+ "step": 10
54
+ },
55
+ {
56
+ "loss": 0.6846516132354736,
57
+ "grad_norm": 0.09445367753505707,
58
+ "learning_rate": 9.848000000000001e-06,
59
+ "entropy": 0.7865605641389266,
60
+ "num_tokens": 268096.0,
61
+ "logits/chosen": -1.1735790360523626,
62
+ "logits/rejected": -1.0035928764768882,
63
+ "mean_token_accuracy": 0.7369648787193,
64
+ "rewards/chosen": -0.013590605450008297,
65
+ "rewards/rejected": -0.031154271999957926,
66
+ "rewards/accuracies": 0.66875,
67
+ "rewards/margins": 0.017563666505157016,
68
+ "logps/chosen": -48.01739143133163,
69
+ "logps/rejected": -56.277624583244325,
70
+ "epoch": 0.032,
71
+ "step": 20
72
+ },
73
+ {
74
+ "loss": 0.6588961601257324,
75
+ "grad_norm": 0.1251889169216156,
76
+ "learning_rate": 9.768e-06,
77
+ "entropy": 0.9058249982655979,
78
+ "num_tokens": 403100.0,
79
+ "logits/chosen": -0.8840507368526256,
80
+ "logits/rejected": -0.8496724761598647,
81
+ "mean_token_accuracy": 0.7215570319443941,
82
+ "rewards/chosen": -0.034349703128009425,
83
+ "rewards/rejected": -0.10719101511076587,
84
+ "rewards/accuracies": 0.78125,
85
+ "rewards/margins": 0.07284131128399167,
86
+ "logps/chosen": -61.04792865514755,
87
+ "logps/rejected": -61.20545055866241,
88
+ "epoch": 0.048,
89
+ "step": 30
90
+ },
91
+ {
92
+ "loss": 0.6471754550933838,
93
+ "grad_norm": 0.10575459152460098,
94
+ "learning_rate": 9.688000000000001e-06,
95
+ "entropy": 0.8045565326465294,
96
+ "num_tokens": 536957.0,
97
+ "logits/chosen": -0.9277418629935623,
98
+ "logits/rejected": -0.8127428054126742,
99
+ "mean_token_accuracy": 0.7228790700435639,
100
+ "rewards/chosen": -0.0844828439738194,
101
+ "rewards/rejected": -0.18686079327890184,
102
+ "rewards/accuracies": 0.7875,
103
+ "rewards/margins": 0.10237794981803745,
104
+ "logps/chosen": -55.788045692443845,
105
+ "logps/rejected": -51.87638405561447,
106
+ "epoch": 0.064,
107
+ "step": 40
108
+ },
109
+ {
110
+ "loss": 0.6388973236083985,
111
+ "grad_norm": 0.11447733640670776,
112
+ "learning_rate": 9.608e-06,
113
+ "entropy": 0.8310880722478032,
114
+ "num_tokens": 672162.0,
115
+ "logits/chosen": -0.932203738722083,
116
+ "logits/rejected": -0.8394863060549598,
117
+ "mean_token_accuracy": 0.7292114172130824,
118
+ "rewards/chosen": -0.17734425760645536,
119
+ "rewards/rejected": -0.3075421278263093,
120
+ "rewards/accuracies": 0.7,
121
+ "rewards/margins": 0.13019787039374933,
122
+ "logps/chosen": -57.186359715461734,
123
+ "logps/rejected": -59.51659116744995,
124
+ "epoch": 0.08,
125
+ "step": 50
126
+ },
127
+ {
128
+ "loss": 0.584157657623291,
129
+ "grad_norm": 0.10827931016683578,
130
+ "learning_rate": 9.528000000000001e-06,
131
+ "entropy": 0.7849437956116162,
132
+ "num_tokens": 806028.0,
133
+ "logits/chosen": -1.0795894372571302,
134
+ "logits/rejected": -0.9225630624384638,
135
+ "mean_token_accuracy": 0.723660983517766,
136
+ "rewards/chosen": -0.20687476017265,
137
+ "rewards/rejected": -0.4755556690506637,
138
+ "rewards/accuracies": 0.7625,
139
+ "rewards/margins": 0.26868090690113605,
140
+ "logps/chosen": -56.57579958438873,
141
+ "logps/rejected": -55.61295554637909,
142
+ "epoch": 0.096,
143
+ "step": 60
144
+ },
145
+ {
146
+ "loss": 0.5784035205841065,
147
+ "grad_norm": 0.1285804808139801,
148
+ "learning_rate": 9.448e-06,
149
+ "entropy": 0.7840334481210448,
150
+ "num_tokens": 940207.0,
151
+ "logits/chosen": -1.0125293609936816,
152
+ "logits/rejected": -0.8529993941692094,
153
+ "mean_token_accuracy": 0.7125357061624527,
154
+ "rewards/chosen": -0.36272725756798535,
155
+ "rewards/rejected": -0.6677537690615282,
156
+ "rewards/accuracies": 0.75,
157
+ "rewards/margins": 0.3050265107536688,
158
+ "logps/chosen": -56.21787704229355,
159
+ "logps/rejected": -60.29286493062973,
160
+ "epoch": 0.112,
161
+ "step": 70
162
+ },
163
+ {
164
+ "loss": 0.5129581451416015,
165
+ "grad_norm": 0.12409700453281403,
166
+ "learning_rate": 9.368e-06,
167
+ "entropy": 0.8727153117069975,
168
+ "num_tokens": 1075324.0,
169
+ "logits/chosen": -0.9037921948846058,
170
+ "logits/rejected": -0.7711921778344156,
171
+ "mean_token_accuracy": 0.697669517993927,
172
+ "rewards/chosen": -0.45928073021859744,
173
+ "rewards/rejected": -0.9675684184629063,
174
+ "rewards/accuracies": 0.8125,
175
+ "rewards/margins": 0.5082876835484058,
176
+ "logps/chosen": -61.03637161254883,
177
+ "logps/rejected": -65.84102531671525,
178
+ "epoch": 0.128,
179
+ "step": 80
180
+ },
181
+ {
182
+ "loss": 0.5763972282409668,
183
+ "grad_norm": 0.15729039907455444,
184
+ "learning_rate": 9.288e-06,
185
+ "entropy": 0.7766714802710339,
186
+ "num_tokens": 1210083.0,
187
+ "logits/chosen": -1.2244412665554385,
188
+ "logits/rejected": -0.9376890599800589,
189
+ "mean_token_accuracy": 0.6997604581527412,
190
+ "rewards/chosen": -0.7116548144666013,
191
+ "rewards/rejected": -1.167988013192371,
192
+ "rewards/accuracies": 0.7,
193
+ "rewards/margins": 0.4563331992831081,
194
+ "logps/chosen": -58.59838794469833,
195
+ "logps/rejected": -67.74620436429977,
196
+ "epoch": 0.144,
197
+ "step": 90
198
+ },
199
+ {
200
+ "loss": 0.5035501956939697,
201
+ "grad_norm": 0.15428121387958527,
202
+ "learning_rate": 9.208e-06,
203
+ "entropy": 0.7132123028452042,
204
+ "num_tokens": 1343049.0,
205
+ "logits/chosen": -1.3961682586621582,
206
+ "logits/rejected": -1.0052104447720165,
207
+ "mean_token_accuracy": 0.7140212506055832,
208
+ "rewards/chosen": -0.7763332309667021,
209
+ "rewards/rejected": -1.3943074161908953,
210
+ "rewards/accuracies": 0.78125,
211
+ "rewards/margins": 0.6179741863161325,
212
+ "logps/chosen": -47.84958149194718,
213
+ "logps/rejected": -64.15119704008103,
214
+ "epoch": 0.16,
215
+ "step": 100
216
+ },
217
+ {
218
+ "loss": 0.5138976573944092,
219
+ "grad_norm": 0.20266199111938477,
220
+ "learning_rate": 9.128e-06,
221
+ "entropy": 0.7525328360585263,
222
+ "num_tokens": 1477024.0,
223
+ "logits/chosen": -1.3525818556821039,
224
+ "logits/rejected": -1.1510224510108018,
225
+ "mean_token_accuracy": 0.7064479270949959,
226
+ "rewards/chosen": -0.9448475810582749,
227
+ "rewards/rejected": -1.6548427081666888,
228
+ "rewards/accuracies": 0.76875,
229
+ "rewards/margins": 0.7099951250478626,
230
+ "logps/chosen": -60.176875388622285,
231
+ "logps/rejected": -70.95503640174866,
232
+ "epoch": 0.176,
233
+ "step": 110
234
+ },
235
+ {
236
+ "loss": 0.49973697662353517,
237
+ "grad_norm": 0.14444415271282196,
238
+ "learning_rate": 9.048e-06,
239
+ "entropy": 0.7536728045437485,
240
+ "num_tokens": 1610835.0,
241
+ "logits/chosen": -1.2999691318206685,
242
+ "logits/rejected": -1.0529130678090677,
243
+ "mean_token_accuracy": 0.7022320762276649,
244
+ "rewards/chosen": -1.0002616313366162,
245
+ "rewards/rejected": -1.7002884576795623,
246
+ "rewards/accuracies": 0.79375,
247
+ "rewards/margins": 0.7000268258154392,
248
+ "logps/chosen": -60.60152515172958,
249
+ "logps/rejected": -68.34930142164231,
250
+ "epoch": 0.192,
251
+ "step": 120
252
+ },
253
+ {
254
+ "loss": 0.5298746585845947,
255
+ "grad_norm": 0.146174356341362,
256
+ "learning_rate": 8.968000000000001e-06,
257
+ "entropy": 0.8164717306150123,
258
+ "num_tokens": 1745826.0,
259
+ "logits/chosen": -1.23030573718855,
260
+ "logits/rejected": -1.0113300163986259,
261
+ "mean_token_accuracy": 0.6869832375086844,
262
+ "rewards/chosen": -1.121532903493062,
263
+ "rewards/rejected": -1.816200914932415,
264
+ "rewards/accuracies": 0.75,
265
+ "rewards/margins": 0.6946680108085275,
266
+ "logps/chosen": -65.62226895093917,
267
+ "logps/rejected": -73.85321601629258,
268
+ "epoch": 0.208,
269
+ "step": 130
270
+ },
271
+ {
272
+ "loss": 0.45813837051391604,
273
+ "grad_norm": 0.1630212813615799,
274
+ "learning_rate": 8.888e-06,
275
+ "entropy": 0.8052778334313189,
276
+ "num_tokens": 1880204.0,
277
+ "logits/chosen": -1.3770508583620331,
278
+ "logits/rejected": -1.042430434119616,
279
+ "mean_token_accuracy": 0.6877053484320641,
280
+ "rewards/chosen": -1.0758028986107093,
281
+ "rewards/rejected": -1.998533202026738,
282
+ "rewards/accuracies": 0.8,
283
+ "rewards/margins": 0.9227303057909012,
284
+ "logps/chosen": -62.81753187179565,
285
+ "logps/rejected": -76.81555581092834,
286
+ "epoch": 0.224,
287
+ "step": 140
288
+ },
289
+ {
290
+ "loss": 0.49399361610412595,
291
+ "grad_norm": 0.1177593395113945,
292
+ "learning_rate": 8.808000000000001e-06,
293
+ "entropy": 0.7507179609965533,
294
+ "num_tokens": 2014712.0,
295
+ "logits/chosen": -1.2794385478622627,
296
+ "logits/rejected": -0.9678105828288878,
297
+ "mean_token_accuracy": 0.6995128920301795,
298
+ "rewards/chosen": -1.1146712710498832,
299
+ "rewards/rejected": -1.9815675146179275,
300
+ "rewards/accuracies": 0.78125,
301
+ "rewards/margins": 0.8668962439522148,
302
+ "logps/chosen": -59.96316148042679,
303
+ "logps/rejected": -76.80156726837158,
304
+ "epoch": 0.24,
305
+ "step": 150
306
+ },
307
+ {
308
+ "loss": 0.48389606475830077,
309
+ "grad_norm": 0.1614522784948349,
310
+ "learning_rate": 8.728e-06,
311
+ "entropy": 0.767244737688452,
312
+ "num_tokens": 2148822.0,
313
+ "logits/chosen": -1.4473581666816784,
314
+ "logits/rejected": -1.1119019244646073,
315
+ "mean_token_accuracy": 0.7071263090707361,
316
+ "rewards/chosen": -1.1861407140095253,
317
+ "rewards/rejected": -2.0622633112128823,
318
+ "rewards/accuracies": 0.7625,
319
+ "rewards/margins": 0.8761225962080061,
320
+ "logps/chosen": -63.51802418231964,
321
+ "logps/rejected": -73.83984756469727,
322
+ "epoch": 0.256,
323
+ "step": 160
324
+ },
325
+ {
326
+ "loss": 0.538500165939331,
327
+ "grad_norm": 0.20714245736598969,
328
+ "learning_rate": 8.648000000000001e-06,
329
+ "entropy": 0.7619314239942468,
330
+ "num_tokens": 2282595.0,
331
+ "logits/chosen": -1.2495616339762585,
332
+ "logits/rejected": -1.0757967526889842,
333
+ "mean_token_accuracy": 0.7071390090510249,
334
+ "rewards/chosen": -1.1613323532452342,
335
+ "rewards/rejected": -1.9118764613522217,
336
+ "rewards/accuracies": 0.7375,
337
+ "rewards/margins": 0.7505441021174193,
338
+ "logps/chosen": -64.5843218922615,
339
+ "logps/rejected": -70.18264303207397,
340
+ "epoch": 0.272,
341
+ "step": 170
342
+ },
343
+ {
344
+ "loss": 0.46224379539489746,
345
+ "grad_norm": 0.11571654677391052,
346
+ "learning_rate": 8.568e-06,
347
+ "entropy": 0.7852839057624805,
348
+ "num_tokens": 2418209.0,
349
+ "logits/chosen": -1.294616462231843,
350
+ "logits/rejected": -1.1091888609193803,
351
+ "mean_token_accuracy": 0.6972204014658928,
352
+ "rewards/chosen": -1.2717912456544582,
353
+ "rewards/rejected": -2.308060463386937,
354
+ "rewards/accuracies": 0.7875,
355
+ "rewards/margins": 1.036269218660891,
356
+ "logps/chosen": -70.35009993314743,
357
+ "logps/rejected": -85.53125276565552,
358
+ "epoch": 0.288,
359
+ "step": 180
360
+ },
361
+ {
362
+ "loss": 0.5569064140319824,
363
+ "grad_norm": 0.14751504361629486,
364
+ "learning_rate": 8.488e-06,
365
+ "entropy": 0.7947878750099335,
366
+ "num_tokens": 2552678.0,
367
+ "logits/chosen": -1.2534910448087464,
368
+ "logits/rejected": -1.210045775692255,
369
+ "mean_token_accuracy": 0.6766968851909041,
370
+ "rewards/chosen": -1.2856982867000624,
371
+ "rewards/rejected": -2.0018560449709186,
372
+ "rewards/accuracies": 0.71875,
373
+ "rewards/margins": 0.7161577565595507,
374
+ "logps/chosen": -69.15452353954315,
375
+ "logps/rejected": -74.11077741384506,
376
+ "epoch": 0.304,
377
+ "step": 190
378
+ },
379
+ {
380
+ "loss": 0.5386476516723633,
381
+ "grad_norm": 0.16784028708934784,
382
+ "learning_rate": 8.408e-06,
383
+ "entropy": 0.7158474079507868,
384
+ "num_tokens": 2686349.0,
385
+ "logits/chosen": -1.3480244280549025,
386
+ "logits/rejected": -1.1111837274633218,
387
+ "mean_token_accuracy": 0.7138814412057399,
388
+ "rewards/chosen": -1.1463188135036035,
389
+ "rewards/rejected": -1.8588492201874032,
390
+ "rewards/accuracies": 0.75,
391
+ "rewards/margins": 0.7125304029788821,
392
+ "logps/chosen": -64.51462678909301,
393
+ "logps/rejected": -68.44324979782104,
394
+ "epoch": 0.32,
395
+ "step": 200
396
+ },
397
+ {
398
+ "loss": 0.41974539756774903,
399
+ "grad_norm": 0.14496931433677673,
400
+ "learning_rate": 8.328e-06,
401
+ "entropy": 0.7375683297024807,
402
+ "num_tokens": 2821059.0,
403
+ "logits/chosen": -1.5740966382454753,
404
+ "logits/rejected": -1.1473181951261093,
405
+ "mean_token_accuracy": 0.7172042991966009,
406
+ "rewards/chosen": -0.9963440826628357,
407
+ "rewards/rejected": -2.130572400346864,
408
+ "rewards/accuracies": 0.8375,
409
+ "rewards/margins": 1.1342283125966788,
410
+ "logps/chosen": -57.70991215705872,
411
+ "logps/rejected": -79.44850307703018,
412
+ "epoch": 0.336,
413
+ "step": 210
414
+ },
415
+ {
416
+ "loss": 0.419812536239624,
417
+ "grad_norm": 0.16907528042793274,
418
+ "learning_rate": 8.248e-06,
419
+ "entropy": 0.6834075984719675,
420
+ "num_tokens": 2954598.0,
421
+ "logits/chosen": -1.5877836993661458,
422
+ "logits/rejected": -1.2788736724764815,
423
+ "mean_token_accuracy": 0.7134232673794031,
424
+ "rewards/chosen": -1.0092000641292542,
425
+ "rewards/rejected": -2.1286219318164514,
426
+ "rewards/accuracies": 0.81875,
427
+ "rewards/margins": 1.1194218643940985,
428
+ "logps/chosen": -57.48038564920425,
429
+ "logps/rejected": -71.7005465388298,
430
+ "epoch": 0.352,
431
+ "step": 220
432
+ },
433
+ {
434
+ "loss": 0.5000779628753662,
435
+ "grad_norm": 0.21664294600486755,
436
+ "learning_rate": 8.168e-06,
437
+ "entropy": 0.6480607748584589,
438
+ "num_tokens": 3087946.0,
439
+ "logits/chosen": -1.6257516518788577,
440
+ "logits/rejected": -1.3811952023449765,
441
+ "mean_token_accuracy": 0.7170056706294418,
442
+ "rewards/chosen": -1.1005187036818824,
443
+ "rewards/rejected": -2.0874655603431167,
444
+ "rewards/accuracies": 0.75,
445
+ "rewards/margins": 0.9869468596763908,
446
+ "logps/chosen": -53.01660460233688,
447
+ "logps/rejected": -72.73401219844818,
448
+ "epoch": 0.368,
449
+ "step": 230
450
+ },
451
+ {
452
+ "loss": 0.41640191078186034,
453
+ "grad_norm": 0.13618744909763336,
454
+ "learning_rate": 8.088e-06,
455
+ "entropy": 0.735815642774105,
456
+ "num_tokens": 3221706.0,
457
+ "logits/chosen": -1.4518982412503076,
458
+ "logits/rejected": -1.2350048695000762,
459
+ "mean_token_accuracy": 0.7111645181663334,
460
+ "rewards/chosen": -1.09686146506574,
461
+ "rewards/rejected": -2.2318367584608496,
462
+ "rewards/accuracies": 0.8375,
463
+ "rewards/margins": 1.1349752927199006,
464
+ "logps/chosen": -58.26607400178909,
465
+ "logps/rejected": -74.5952651977539,
466
+ "epoch": 0.384,
467
+ "step": 240
468
+ },
469
+ {
470
+ "loss": 0.4902942180633545,
471
+ "grad_norm": 0.21052443981170654,
472
+ "learning_rate": 8.008e-06,
473
+ "entropy": 0.8077279043849558,
474
+ "num_tokens": 3356185.0,
475
+ "logits/chosen": -1.3508111761120858,
476
+ "logits/rejected": -1.1624117580002962,
477
+ "mean_token_accuracy": 0.6951078314334154,
478
+ "rewards/chosen": -1.1994671203377947,
479
+ "rewards/rejected": -2.173786994814873,
480
+ "rewards/accuracies": 0.7625,
481
+ "rewards/margins": 0.9743198692798615,
482
+ "logps/chosen": -70.02799752950668,
483
+ "logps/rejected": -73.7796833872795,
484
+ "epoch": 0.4,
485
+ "step": 250
486
+ },
487
+ {
488
+ "loss": 0.429164457321167,
489
+ "grad_norm": 0.16093610227108002,
490
+ "learning_rate": 7.928e-06,
491
+ "entropy": 0.7886518793180585,
492
+ "num_tokens": 3490468.0,
493
+ "logits/chosen": -1.3261231065347217,
494
+ "logits/rejected": -1.098070382730149,
495
+ "mean_token_accuracy": 0.6995166232809424,
496
+ "rewards/chosen": -1.0775358187383972,
497
+ "rewards/rejected": -2.2392933295108377,
498
+ "rewards/accuracies": 0.86875,
499
+ "rewards/margins": 1.1617575039621442,
500
+ "logps/chosen": -63.11482725143433,
501
+ "logps/rejected": -80.99848538637161,
502
+ "epoch": 0.416,
503
+ "step": 260
504
+ },
505
+ {
506
+ "loss": 0.4255237102508545,
507
+ "grad_norm": 0.194253608584404,
508
+ "learning_rate": 7.848000000000002e-06,
509
+ "entropy": 0.7764837886788882,
510
+ "num_tokens": 3625248.0,
511
+ "logits/chosen": -1.3838655430252698,
512
+ "logits/rejected": -1.1227413434837863,
513
+ "mean_token_accuracy": 0.6960799667984248,
514
+ "rewards/chosen": -1.1910365224350243,
515
+ "rewards/rejected": -2.2339234950137326,
516
+ "rewards/accuracies": 0.80625,
517
+ "rewards/margins": 1.0428869728930295,
518
+ "logps/chosen": -67.41155977249146,
519
+ "logps/rejected": -79.18053728342056,
520
+ "epoch": 0.432,
521
+ "step": 270
522
+ },
523
+ {
524
+ "loss": 0.42293658256530764,
525
+ "grad_norm": 0.2024957239627838,
526
+ "learning_rate": 7.768e-06,
527
+ "entropy": 0.7524384143820498,
528
+ "num_tokens": 3759703.0,
529
+ "logits/chosen": -1.5700863775036777,
530
+ "logits/rejected": -1.2974879702996405,
531
+ "mean_token_accuracy": 0.7092206623405218,
532
+ "rewards/chosen": -1.181411183514865,
533
+ "rewards/rejected": -2.3785619896138086,
534
+ "rewards/accuracies": 0.8375,
535
+ "rewards/margins": 1.1971508040558547,
536
+ "logps/chosen": -64.79122279882431,
537
+ "logps/rejected": -78.0537760257721,
538
+ "epoch": 0.448,
539
+ "step": 280
540
+ },
541
+ {
542
+ "loss": 0.49022955894470216,
543
+ "grad_norm": 0.23429764807224274,
544
+ "learning_rate": 7.688000000000002e-06,
545
+ "entropy": 0.7095387592096813,
546
+ "num_tokens": 3893200.0,
547
+ "logits/chosen": -1.644883176910696,
548
+ "logits/rejected": -1.3690703175511028,
549
+ "mean_token_accuracy": 0.7099431391805411,
550
+ "rewards/chosen": -1.208722565032076,
551
+ "rewards/rejected": -2.302569864381803,
552
+ "rewards/accuracies": 0.73125,
553
+ "rewards/margins": 1.0938472978305072,
554
+ "logps/chosen": -58.66111514568329,
555
+ "logps/rejected": -73.76804026365281,
556
+ "epoch": 0.464,
557
+ "step": 290
558
+ },
559
+ {
560
+ "loss": 0.5151157855987549,
561
+ "grad_norm": 0.18875610828399658,
562
+ "learning_rate": 7.608000000000001e-06,
563
+ "entropy": 0.7552115411614068,
564
+ "num_tokens": 4027530.0,
565
+ "logits/chosen": -1.651739941035044,
566
+ "logits/rejected": -1.2722007430325624,
567
+ "mean_token_accuracy": 0.7032206024974584,
568
+ "rewards/chosen": -1.2901599130476824,
569
+ "rewards/rejected": -2.343320058938116,
570
+ "rewards/accuracies": 0.7625,
571
+ "rewards/margins": 1.0531601494178175,
572
+ "logps/chosen": -65.92262428998947,
573
+ "logps/rejected": -78.2461446762085,
574
+ "epoch": 0.48,
575
+ "step": 300
576
+ },
577
+ {
578
+ "loss": 0.47307710647583007,
579
+ "grad_norm": 0.10863387584686279,
580
+ "learning_rate": 7.528000000000001e-06,
581
+ "entropy": 0.7621748403180391,
582
+ "num_tokens": 4162061.0,
583
+ "logits/chosen": -1.3771063650983688,
584
+ "logits/rejected": -1.2045002001825487,
585
+ "mean_token_accuracy": 0.6764604442752897,
586
+ "rewards/chosen": -1.2184180594878853,
587
+ "rewards/rejected": -2.2775028764503076,
588
+ "rewards/accuracies": 0.7875,
589
+ "rewards/margins": 1.0590848120860756,
590
+ "logps/chosen": -66.88217611312866,
591
+ "logps/rejected": -76.58725030422211,
592
+ "epoch": 0.496,
593
+ "step": 310
594
+ },
595
+ {
596
+ "loss": 0.435822057723999,
597
+ "grad_norm": 0.2315858155488968,
598
+ "learning_rate": 7.4480000000000005e-06,
599
+ "entropy": 0.7862872060039081,
600
+ "num_tokens": 4295767.0,
601
+ "logits/chosen": -1.4690605622435848,
602
+ "logits/rejected": -1.270512638216285,
603
+ "mean_token_accuracy": 0.7008196750655771,
604
+ "rewards/chosen": -1.013645149738295,
605
+ "rewards/rejected": -2.058542217174545,
606
+ "rewards/accuracies": 0.81875,
607
+ "rewards/margins": 1.0448970628902317,
608
+ "logps/chosen": -62.458728992938994,
609
+ "logps/rejected": -71.00610809326172,
610
+ "epoch": 0.512,
611
+ "step": 320
612
+ },
613
+ {
614
+ "loss": 0.5000080585479736,
615
+ "grad_norm": 0.18929436802864075,
616
+ "learning_rate": 7.3680000000000004e-06,
617
+ "entropy": 0.7674915350973606,
618
+ "num_tokens": 4430319.0,
619
+ "logits/chosen": -1.3667780571179007,
620
+ "logits/rejected": -1.1520406470273215,
621
+ "mean_token_accuracy": 0.7238027969375253,
622
+ "rewards/chosen": -1.1733891378389671,
623
+ "rewards/rejected": -2.109529243753059,
624
+ "rewards/accuracies": 0.7625,
625
+ "rewards/margins": 0.9361401099711657,
626
+ "logps/chosen": -65.92721303701401,
627
+ "logps/rejected": -78.01230471134186,
628
+ "epoch": 0.528,
629
+ "step": 330
630
+ },
631
+ {
632
+ "loss": 0.46940155029296876,
633
+ "grad_norm": 0.14189189672470093,
634
+ "learning_rate": 7.288e-06,
635
+ "entropy": 0.7857535354618449,
636
+ "num_tokens": 4565294.0,
637
+ "logits/chosen": -1.4758047716980225,
638
+ "logits/rejected": -1.2134537743928386,
639
+ "mean_token_accuracy": 0.6944835038855672,
640
+ "rewards/chosen": -1.0471536613767967,
641
+ "rewards/rejected": -2.165165621833876,
642
+ "rewards/accuracies": 0.76875,
643
+ "rewards/margins": 1.1180119591765105,
644
+ "logps/chosen": -62.94718644618988,
645
+ "logps/rejected": -79.48942579030991,
646
+ "epoch": 0.544,
647
+ "step": 340
648
+ },
649
+ {
650
+ "loss": 0.3645109415054321,
651
+ "grad_norm": 0.13742217421531677,
652
+ "learning_rate": 7.208e-06,
653
+ "entropy": 0.8591747929778648,
654
+ "num_tokens": 4700673.0,
655
+ "logits/chosen": -1.2994398314971372,
656
+ "logits/rejected": -0.9634321821730494,
657
+ "mean_token_accuracy": 0.6921095721423626,
658
+ "rewards/chosen": -0.9062414692642051,
659
+ "rewards/rejected": -2.211485195462592,
660
+ "rewards/accuracies": 0.875,
661
+ "rewards/margins": 1.3052437256323173,
662
+ "logps/chosen": -65.16439890861511,
663
+ "logps/rejected": -83.85232257843018,
664
+ "epoch": 0.56,
665
+ "step": 350
666
+ },
667
+ {
668
+ "loss": 0.41549930572509763,
669
+ "grad_norm": 0.13630583882331848,
670
+ "learning_rate": 7.128e-06,
671
+ "entropy": 0.7697658954290091,
672
+ "num_tokens": 4834914.0,
673
+ "logits/chosen": -1.4746464063820786,
674
+ "logits/rejected": -1.2137255228371973,
675
+ "mean_token_accuracy": 0.6921661171130836,
676
+ "rewards/chosen": -1.057976609346224,
677
+ "rewards/rejected": -2.2644589847797763,
678
+ "rewards/accuracies": 0.81875,
679
+ "rewards/margins": 1.2064823711523787,
680
+ "logps/chosen": -61.45189489126206,
681
+ "logps/rejected": -74.3291876912117,
682
+ "epoch": 0.576,
683
+ "step": 360
684
+ },
685
+ {
686
+ "loss": 0.5016202449798584,
687
+ "grad_norm": 0.20002736151218414,
688
+ "learning_rate": 7.048e-06,
689
+ "entropy": 0.8047739673376781,
690
+ "num_tokens": 4969481.0,
691
+ "logits/chosen": -1.3463584589105526,
692
+ "logits/rejected": -1.1913337460159867,
693
+ "mean_token_accuracy": 0.6995058806613088,
694
+ "rewards/chosen": -1.2831005254178307,
695
+ "rewards/rejected": -2.3363574695773424,
696
+ "rewards/accuracies": 0.76875,
697
+ "rewards/margins": 1.0532569397240876,
698
+ "logps/chosen": -70.19986630678177,
699
+ "logps/rejected": -73.64605617523193,
700
+ "epoch": 0.592,
701
+ "step": 370
702
+ },
703
+ {
704
+ "loss": 0.4510155200958252,
705
+ "grad_norm": 0.2060878872871399,
706
+ "learning_rate": 6.968e-06,
707
+ "entropy": 0.7111540023062843,
708
+ "num_tokens": 5104134.0,
709
+ "logits/chosen": -1.608769429784676,
710
+ "logits/rejected": -1.205912504773936,
711
+ "mean_token_accuracy": 0.732072526961565,
712
+ "rewards/chosen": -1.1910309330371092,
713
+ "rewards/rejected": -2.485836934146937,
714
+ "rewards/accuracies": 0.7875,
715
+ "rewards/margins": 1.2948059952352196,
716
+ "logps/chosen": -63.09124077558518,
717
+ "logps/rejected": -78.16271492242814,
718
+ "epoch": 0.608,
719
+ "step": 380
720
+ },
721
+ {
722
+ "loss": 0.3789437532424927,
723
+ "grad_norm": 0.16949090361595154,
724
+ "learning_rate": 6.888e-06,
725
+ "entropy": 0.8429804477724246,
726
+ "num_tokens": 5238990.0,
727
+ "logits/chosen": -1.344734235984508,
728
+ "logits/rejected": -1.0792878012791853,
729
+ "mean_token_accuracy": 0.7037996568717062,
730
+ "rewards/chosen": -0.9847486353828572,
731
+ "rewards/rejected": -2.385756150074303,
732
+ "rewards/accuracies": 0.85,
733
+ "rewards/margins": 1.4010075137019158,
734
+ "logps/chosen": -71.131576192379,
735
+ "logps/rejected": -78.69467395544052,
736
+ "epoch": 0.624,
737
+ "step": 390
738
+ },
739
+ {
740
+ "loss": 0.4284682750701904,
741
+ "grad_norm": 0.12163913249969482,
742
+ "learning_rate": 6.808e-06,
743
+ "entropy": 0.8144261223496869,
744
+ "num_tokens": 5373007.0,
745
+ "logits/chosen": -1.5270186574762619,
746
+ "logits/rejected": -1.1437435740491604,
747
+ "mean_token_accuracy": 0.7220658838748932,
748
+ "rewards/chosen": -1.056326786777936,
749
+ "rewards/rejected": -2.289595467923209,
750
+ "rewards/accuracies": 0.81875,
751
+ "rewards/margins": 1.233268681820482,
752
+ "logps/chosen": -62.966822719573976,
753
+ "logps/rejected": -73.83658835887908,
754
+ "epoch": 0.64,
755
+ "step": 400
756
+ },
757
+ {
758
+ "loss": 0.4095573902130127,
759
+ "grad_norm": 0.16153964400291443,
760
+ "learning_rate": 6.728e-06,
761
+ "entropy": 0.8055596031801542,
762
+ "num_tokens": 5507998.0,
763
+ "logits/chosen": -1.3580381465874098,
764
+ "logits/rejected": -1.0995244144140797,
765
+ "mean_token_accuracy": 0.7232280064374208,
766
+ "rewards/chosen": -1.1240590366447578,
767
+ "rewards/rejected": -2.432920588902198,
768
+ "rewards/accuracies": 0.8125,
769
+ "rewards/margins": 1.3088615476619452,
770
+ "logps/chosen": -67.67483884096146,
771
+ "logps/rejected": -79.64460562467575,
772
+ "epoch": 0.656,
773
+ "step": 410
774
+ },
775
+ {
776
+ "loss": 0.4612462520599365,
777
+ "grad_norm": 0.18348106741905212,
778
+ "learning_rate": 6.648e-06,
779
+ "entropy": 0.838780041251448,
780
+ "num_tokens": 5643003.0,
781
+ "logits/chosen": -1.2733183602446794,
782
+ "logits/rejected": -1.0252975904138055,
783
+ "mean_token_accuracy": 0.7087390872649848,
784
+ "rewards/chosen": -1.0622361965593883,
785
+ "rewards/rejected": -2.2466039791703225,
786
+ "rewards/accuracies": 0.79375,
787
+ "rewards/margins": 1.1843677801080048,
788
+ "logps/chosen": -70.36416767835617,
789
+ "logps/rejected": -76.87691588401795,
790
+ "epoch": 0.672,
791
+ "step": 420
792
+ },
793
+ {
794
+ "loss": 0.5008370876312256,
795
+ "grad_norm": 0.3213270604610443,
796
+ "learning_rate": 6.568000000000001e-06,
797
+ "entropy": 0.9088790851383237,
798
+ "num_tokens": 5778181.0,
799
+ "logits/chosen": -1.2890662002693065,
800
+ "logits/rejected": -0.992589689016879,
801
+ "mean_token_accuracy": 0.7122039219364524,
802
+ "rewards/chosen": -0.8109670748352074,
803
+ "rewards/rejected": -1.8928024921566249,
804
+ "rewards/accuracies": 0.79375,
805
+ "rewards/margins": 1.0818354201503098,
806
+ "logps/chosen": -67.84848840236664,
807
+ "logps/rejected": -74.7677659034729,
808
+ "epoch": 0.688,
809
+ "step": 430
810
+ },
811
+ {
812
+ "loss": 0.48210883140563965,
813
+ "grad_norm": 0.17149955034255981,
814
+ "learning_rate": 6.488000000000001e-06,
815
+ "entropy": 0.7832793410867452,
816
+ "num_tokens": 5912330.0,
817
+ "logits/chosen": -1.5082117356293088,
818
+ "logits/rejected": -1.2583976809344715,
819
+ "mean_token_accuracy": 0.7213515549898147,
820
+ "rewards/chosen": -0.8076603990310105,
821
+ "rewards/rejected": -1.880569755542092,
822
+ "rewards/accuracies": 0.76875,
823
+ "rewards/margins": 1.0729093517176806,
824
+ "logps/chosen": -61.79361681938171,
825
+ "logps/rejected": -68.87128767967224,
826
+ "epoch": 0.704,
827
+ "step": 440
828
+ },
829
+ {
830
+ "loss": 0.434552526473999,
831
+ "grad_norm": 0.17293645441532135,
832
+ "learning_rate": 6.408000000000001e-06,
833
+ "entropy": 0.85112169632921,
834
+ "num_tokens": 6046833.0,
835
+ "logits/chosen": -1.4646643974223927,
836
+ "logits/rejected": -1.236012645965301,
837
+ "mean_token_accuracy": 0.6955043694004417,
838
+ "rewards/chosen": -0.6805295475583989,
839
+ "rewards/rejected": -1.8859025583136826,
840
+ "rewards/accuracies": 0.80625,
841
+ "rewards/margins": 1.2053730081766845,
842
+ "logps/chosen": -66.01161818504333,
843
+ "logps/rejected": -72.59794241189957,
844
+ "epoch": 0.72,
845
+ "step": 450
846
+ },
847
+ {
848
+ "loss": 0.4525154590606689,
849
+ "grad_norm": 0.13545100390911102,
850
+ "learning_rate": 6.328000000000001e-06,
851
+ "entropy": 0.7731699298979947,
852
+ "num_tokens": 6180736.0,
853
+ "logits/chosen": -1.5591463232715608,
854
+ "logits/rejected": -1.270020750548368,
855
+ "mean_token_accuracy": 0.7241024266928434,
856
+ "rewards/chosen": -0.6300986663118238,
857
+ "rewards/rejected": -1.714425936579937,
858
+ "rewards/accuracies": 0.775,
859
+ "rewards/margins": 1.0843272741883994,
860
+ "logps/chosen": -56.8658260345459,
861
+ "logps/rejected": -69.70775079727173,
862
+ "epoch": 0.736,
863
+ "step": 460
864
+ },
865
+ {
866
+ "loss": 0.4177194118499756,
867
+ "grad_norm": 0.18396085500717163,
868
+ "learning_rate": 6.248000000000001e-06,
869
+ "entropy": 0.8316918499491294,
870
+ "num_tokens": 6314772.0,
871
+ "logits/chosen": -1.5249799779689304,
872
+ "logits/rejected": -1.1975052540111206,
873
+ "mean_token_accuracy": 0.7292953688651324,
874
+ "rewards/chosen": -0.6027689337788615,
875
+ "rewards/rejected": -1.7004036038677441,
876
+ "rewards/accuracies": 0.80625,
877
+ "rewards/margins": 1.097634667274542,
878
+ "logps/chosen": -56.09835275411606,
879
+ "logps/rejected": -71.92009768486022,
880
+ "epoch": 0.752,
881
+ "step": 470
882
+ },
883
+ {
884
+ "loss": 0.46809401512146,
885
+ "grad_norm": 0.17706090211868286,
886
+ "learning_rate": 6.168000000000001e-06,
887
+ "entropy": 0.7581404208525783,
888
+ "num_tokens": 6449350.0,
889
+ "logits/chosen": -1.6381091898068014,
890
+ "logits/rejected": -1.2200889932680836,
891
+ "mean_token_accuracy": 0.7225047118030489,
892
+ "rewards/chosen": -0.7841349693480879,
893
+ "rewards/rejected": -1.9638352209556615,
894
+ "rewards/accuracies": 0.80625,
895
+ "rewards/margins": 1.1797002504579723,
896
+ "logps/chosen": -57.20818421840668,
897
+ "logps/rejected": -72.92842512130737,
898
+ "epoch": 0.768,
899
+ "step": 480
900
+ },
901
+ {
902
+ "loss": 0.43768625259399413,
903
+ "grad_norm": 0.19130761921405792,
904
+ "learning_rate": 6.088000000000001e-06,
905
+ "entropy": 0.8540503058698959,
906
+ "num_tokens": 6584446.0,
907
+ "logits/chosen": -1.4665205629879048,
908
+ "logits/rejected": -1.209258112589755,
909
+ "mean_token_accuracy": 0.7200203452259302,
910
+ "rewards/chosen": -0.7167962765524862,
911
+ "rewards/rejected": -2.015049184113741,
912
+ "rewards/accuracies": 0.8,
913
+ "rewards/margins": 1.2982529026456178,
914
+ "logps/chosen": -61.549116575717925,
915
+ "logps/rejected": -78.22147595882416,
916
+ "epoch": 0.784,
917
+ "step": 490
918
+ },
919
+ {
920
+ "loss": 0.5317215919494629,
921
+ "grad_norm": 0.23371382057666779,
922
+ "learning_rate": 6.008000000000001e-06,
923
+ "entropy": 0.8205239486735081,
924
+ "num_tokens": 6719638.0,
925
+ "logits/chosen": -1.371530065459643,
926
+ "logits/rejected": -1.2198672509346422,
927
+ "mean_token_accuracy": 0.6944150812923908,
928
+ "rewards/chosen": -0.9274588403815869,
929
+ "rewards/rejected": -1.8801139157498254,
930
+ "rewards/accuracies": 0.75625,
931
+ "rewards/margins": 0.9526550753042102,
932
+ "logps/chosen": -67.30557036399841,
933
+ "logps/rejected": -73.84395973682403,
934
+ "epoch": 0.8,
935
+ "step": 500
936
+ },
937
+ {
938
+ "loss": 0.45224776268005373,
939
+ "grad_norm": 0.182713121175766,
940
+ "learning_rate": 5.928000000000001e-06,
941
+ "entropy": 0.8279478559968994,
942
+ "num_tokens": 6853713.0,
943
+ "logits/chosen": -1.3519609814343059,
944
+ "logits/rejected": -1.1373096500825615,
945
+ "mean_token_accuracy": 0.708798126410693,
946
+ "rewards/chosen": -0.9130903312776354,
947
+ "rewards/rejected": -2.1072214540283314,
948
+ "rewards/accuracies": 0.775,
949
+ "rewards/margins": 1.1941311215050519,
950
+ "logps/chosen": -61.76497374773025,
951
+ "logps/rejected": -74.58511118888855,
952
+ "epoch": 0.816,
953
+ "step": 510
954
+ },
955
+ {
956
+ "loss": 0.5070226192474365,
957
+ "grad_norm": 0.21901287138462067,
958
+ "learning_rate": 5.848000000000001e-06,
959
+ "entropy": 0.7715994188318291,
960
+ "num_tokens": 6988253.0,
961
+ "logits/chosen": -1.5578017508136286,
962
+ "logits/rejected": -1.3082164309090911,
963
+ "mean_token_accuracy": 0.7139061275869608,
964
+ "rewards/chosen": -0.9826734508067603,
965
+ "rewards/rejected": -2.0346623631892724,
966
+ "rewards/accuracies": 0.74375,
967
+ "rewards/margins": 1.051988916611299,
968
+ "logps/chosen": -62.744111156463624,
969
+ "logps/rejected": -71.96990052461624,
970
+ "epoch": 0.832,
971
+ "step": 520
972
+ },
973
+ {
974
+ "loss": 0.45290522575378417,
975
+ "grad_norm": 0.3490127921104431,
976
+ "learning_rate": 5.7680000000000005e-06,
977
+ "entropy": 0.795071688198368,
978
+ "num_tokens": 7122655.0,
979
+ "logits/chosen": -1.4304161762086367,
980
+ "logits/rejected": -1.0907285266174562,
981
+ "mean_token_accuracy": 0.7224397015757859,
982
+ "rewards/chosen": -0.9329047386592719,
983
+ "rewards/rejected": -2.097123019141145,
984
+ "rewards/accuracies": 0.76875,
985
+ "rewards/margins": 1.164218282327056,
986
+ "logps/chosen": -55.81759611964226,
987
+ "logps/rejected": -77.36465810537338,
988
+ "epoch": 0.848,
989
+ "step": 530
990
+ },
991
+ {
992
+ "loss": 0.45181903839111326,
993
+ "grad_norm": 0.27503907680511475,
994
+ "learning_rate": 5.6880000000000004e-06,
995
+ "entropy": 0.7538120721874293,
996
+ "num_tokens": 7256116.0,
997
+ "logits/chosen": -1.6767850959126522,
998
+ "logits/rejected": -1.3242235741540545,
999
+ "mean_token_accuracy": 0.7316061129793525,
1000
+ "rewards/chosen": -0.8911430915890378,
1001
+ "rewards/rejected": -2.0349854178726674,
1002
+ "rewards/accuracies": 0.775,
1003
+ "rewards/margins": 1.1438423283398151,
1004
+ "logps/chosen": -53.21874977350235,
1005
+ "logps/rejected": -76.5598596572876,
1006
+ "epoch": 0.864,
1007
+ "step": 540
1008
+ },
1009
+ {
1010
+ "loss": 0.5414995670318603,
1011
+ "grad_norm": 0.2073371410369873,
1012
+ "learning_rate": 5.608e-06,
1013
+ "entropy": 0.8148633663950022,
1014
+ "num_tokens": 7390370.0,
1015
+ "logits/chosen": -1.3765310828876476,
1016
+ "logits/rejected": -1.133697184223435,
1017
+ "mean_token_accuracy": 0.7053394909948111,
1018
+ "rewards/chosen": -0.90475755288644,
1019
+ "rewards/rejected": -1.7751331690698862,
1020
+ "rewards/accuracies": 0.74375,
1021
+ "rewards/margins": 0.8703756197355688,
1022
+ "logps/chosen": -61.96280990839004,
1023
+ "logps/rejected": -70.7764186501503,
1024
+ "epoch": 0.88,
1025
+ "step": 550
1026
+ },
1027
+ {
1028
+ "loss": 0.5176785945892334,
1029
+ "grad_norm": 0.27757805585861206,
1030
+ "learning_rate": 5.528e-06,
1031
+ "entropy": 0.7701463760924525,
1032
+ "num_tokens": 7524399.0,
1033
+ "logits/chosen": -1.4427345128285418,
1034
+ "logits/rejected": -1.2567077535753297,
1035
+ "mean_token_accuracy": 0.7136867575347423,
1036
+ "rewards/chosen": -0.9190105670393678,
1037
+ "rewards/rejected": -1.8803606960456818,
1038
+ "rewards/accuracies": 0.76875,
1039
+ "rewards/margins": 0.9613501313142478,
1040
+ "logps/chosen": -62.47981760501862,
1041
+ "logps/rejected": -65.90649355649948,
1042
+ "epoch": 0.896,
1043
+ "step": 560
1044
+ },
1045
+ {
1046
+ "loss": 0.4511863708496094,
1047
+ "grad_norm": 0.2078111171722412,
1048
+ "learning_rate": 5.448e-06,
1049
+ "entropy": 0.8631977764249313,
1050
+ "num_tokens": 7658604.0,
1051
+ "logits/chosen": -1.2926124538881012,
1052
+ "logits/rejected": -0.9838834319481562,
1053
+ "mean_token_accuracy": 0.7207308521494269,
1054
+ "rewards/chosen": -0.6676558028753788,
1055
+ "rewards/rejected": -1.7714358688157517,
1056
+ "rewards/accuracies": 0.83125,
1057
+ "rewards/margins": 1.1037800651043654,
1058
+ "logps/chosen": -56.60341747999191,
1059
+ "logps/rejected": -71.80331914424896,
1060
+ "epoch": 0.912,
1061
+ "step": 570
1062
+ },
1063
+ {
1064
+ "loss": 0.4576895713806152,
1065
+ "grad_norm": 0.13427318632602692,
1066
+ "learning_rate": 5.368000000000001e-06,
1067
+ "entropy": 0.8798671936965548,
1068
+ "num_tokens": 7793743.0,
1069
+ "logits/chosen": -1.2397059499933185,
1070
+ "logits/rejected": -0.9909034700496523,
1071
+ "mean_token_accuracy": 0.6908573735505342,
1072
+ "rewards/chosen": -0.7387171853566542,
1073
+ "rewards/rejected": -1.864225831045769,
1074
+ "rewards/accuracies": 0.80625,
1075
+ "rewards/margins": 1.1255086408928037,
1076
+ "logps/chosen": -64.580437374115,
1077
+ "logps/rejected": -73.18329973220825,
1078
+ "epoch": 0.928,
1079
+ "step": 580
1080
+ },
1081
+ {
1082
+ "loss": 0.42533297538757325,
1083
+ "grad_norm": 0.15502135455608368,
1084
+ "learning_rate": 5.288000000000001e-06,
1085
+ "entropy": 0.817069728297065,
1086
+ "num_tokens": 7928689.0,
1087
+ "logits/chosen": -1.2393895301783906,
1088
+ "logits/rejected": -1.1084123908454555,
1089
+ "mean_token_accuracy": 0.7128896466456354,
1090
+ "rewards/chosen": -0.7250971098641458,
1091
+ "rewards/rejected": -1.9982559287804178,
1092
+ "rewards/accuracies": 0.84375,
1093
+ "rewards/margins": 1.2731588228605688,
1094
+ "logps/chosen": -65.04422287940979,
1095
+ "logps/rejected": -75.35328090190887,
1096
+ "epoch": 0.944,
1097
+ "step": 590
1098
+ },
1099
+ {
1100
+ "loss": 0.3770539999008179,
1101
+ "grad_norm": 0.17613562941551208,
1102
+ "learning_rate": 5.208000000000001e-06,
1103
+ "entropy": 0.7778703475603834,
1104
+ "num_tokens": 8062710.0,
1105
+ "logits/chosen": -1.5389842542461873,
1106
+ "logits/rejected": -1.0342297198537742,
1107
+ "mean_token_accuracy": 0.7274640101008117,
1108
+ "rewards/chosen": -0.7972871424448386,
1109
+ "rewards/rejected": -2.1182173368986694,
1110
+ "rewards/accuracies": 0.84375,
1111
+ "rewards/margins": 1.320930197648704,
1112
+ "logps/chosen": -53.877902281284335,
1113
+ "logps/rejected": -77.50610139369965,
1114
+ "epoch": 0.96,
1115
+ "step": 600
1116
+ },
1117
+ {
1118
+ "loss": 0.4678995132446289,
1119
+ "grad_norm": 0.21209311485290527,
1120
+ "learning_rate": 5.128000000000001e-06,
1121
+ "entropy": 0.8264809994332609,
1122
+ "num_tokens": 8197009.0,
1123
+ "logits/chosen": -1.3161340033706996,
1124
+ "logits/rejected": -1.0665738771389415,
1125
+ "mean_token_accuracy": 0.6980931758880615,
1126
+ "rewards/chosen": -0.7594082839557814,
1127
+ "rewards/rejected": -1.9171317781874677,
1128
+ "rewards/accuracies": 0.8125,
1129
+ "rewards/margins": 1.157723485864699,
1130
+ "logps/chosen": -61.800520193576816,
1131
+ "logps/rejected": -72.15935192108154,
1132
+ "epoch": 0.976,
1133
+ "step": 610
1134
+ },
1135
+ {
1136
+ "loss": 0.4798553466796875,
1137
+ "grad_norm": 0.24422219395637512,
1138
+ "learning_rate": 5.048000000000001e-06,
1139
+ "entropy": 0.7734213294519577,
1140
+ "num_tokens": 8330156.0,
1141
+ "logits/chosen": -1.5627198204058765,
1142
+ "logits/rejected": -1.3033627091925726,
1143
+ "mean_token_accuracy": 0.7267525289207697,
1144
+ "rewards/chosen": -0.7573755404679104,
1145
+ "rewards/rejected": -1.7975832854863256,
1146
+ "rewards/accuracies": 0.79375,
1147
+ "rewards/margins": 1.040207749651745,
1148
+ "logps/chosen": -55.06023645401001,
1149
+ "logps/rejected": -68.08906935453415,
1150
+ "epoch": 0.992,
1151
+ "step": 620
1152
+ },
1153
+ {
1154
+ "loss": 0.41657228469848634,
1155
+ "grad_norm": 0.2854296565055847,
1156
+ "learning_rate": 4.9680000000000005e-06,
1157
+ "entropy": 0.7377176167094148,
1158
+ "num_tokens": 8465041.0,
1159
+ "logits/chosen": -1.6654656300451234,
1160
+ "logits/rejected": -1.3485704232572624,
1161
+ "mean_token_accuracy": 0.6977982034906745,
1162
+ "rewards/chosen": -0.827795197776868,
1163
+ "rewards/rejected": -2.1947057927493008,
1164
+ "rewards/accuracies": 0.825,
1165
+ "rewards/margins": 1.3669105987995862,
1166
+ "logps/chosen": -59.07929306030273,
1167
+ "logps/rejected": -76.1623566031456,
1168
+ "epoch": 1.008,
1169
+ "step": 630
1170
+ },
1171
+ {
1172
+ "loss": 0.38203165531158445,
1173
+ "grad_norm": 0.18717509508132935,
1174
+ "learning_rate": 4.8880000000000005e-06,
1175
+ "entropy": 0.8211721338244388,
1176
+ "num_tokens": 8599500.0,
1177
+ "logits/chosen": -1.5114663958371213,
1178
+ "logits/rejected": -1.193993404852716,
1179
+ "mean_token_accuracy": 0.7073404714465141,
1180
+ "rewards/chosen": -0.823921048961347,
1181
+ "rewards/rejected": -2.257023681770079,
1182
+ "rewards/accuracies": 0.79375,
1183
+ "rewards/margins": 1.4331026304280385,
1184
+ "logps/chosen": -59.9299793958664,
1185
+ "logps/rejected": -78.36245132684708,
1186
+ "epoch": 1.024,
1187
+ "step": 640
1188
+ },
1189
+ {
1190
+ "loss": 0.4451735019683838,
1191
+ "grad_norm": 0.21657153964042664,
1192
+ "learning_rate": 4.808e-06,
1193
+ "entropy": 0.8258791111322352,
1194
+ "num_tokens": 8733676.0,
1195
+ "logits/chosen": -1.5098714195765397,
1196
+ "logits/rejected": -1.1212204464595934,
1197
+ "mean_token_accuracy": 0.7025207518599927,
1198
+ "rewards/chosen": -0.8813661304506241,
1199
+ "rewards/rejected": -2.205052966135554,
1200
+ "rewards/accuracies": 0.76875,
1201
+ "rewards/margins": 1.3236868323292583,
1202
+ "logps/chosen": -59.143254685401914,
1203
+ "logps/rejected": -79.33009437322616,
1204
+ "epoch": 1.04,
1205
+ "step": 650
1206
+ },
1207
+ {
1208
+ "loss": 0.44518437385559084,
1209
+ "grad_norm": 0.16692371666431427,
1210
+ "learning_rate": 4.728e-06,
1211
+ "entropy": 0.7720623685941973,
1212
+ "num_tokens": 8866920.0,
1213
+ "logits/chosen": -1.6099649834733871,
1214
+ "logits/rejected": -1.2753671202879713,
1215
+ "mean_token_accuracy": 0.7019124954938889,
1216
+ "rewards/chosen": -0.9054035557142924,
1217
+ "rewards/rejected": -2.102139440679457,
1218
+ "rewards/accuracies": 0.81875,
1219
+ "rewards/margins": 1.1967358850408345,
1220
+ "logps/chosen": -56.078457951545715,
1221
+ "logps/rejected": -74.86194944381714,
1222
+ "epoch": 1.056,
1223
+ "step": 660
1224
+ },
1225
+ {
1226
+ "loss": 0.46517186164855956,
1227
+ "grad_norm": 0.3806668817996979,
1228
+ "learning_rate": 4.648e-06,
1229
+ "entropy": 0.9248056679964065,
1230
+ "num_tokens": 9002809.0,
1231
+ "logits/chosen": -1.4305434844414238,
1232
+ "logits/rejected": -1.1489092484117014,
1233
+ "mean_token_accuracy": 0.6812765257433057,
1234
+ "rewards/chosen": -1.0725531240459532,
1235
+ "rewards/rejected": -2.4423089541844094,
1236
+ "rewards/accuracies": 0.8125,
1237
+ "rewards/margins": 1.3697558240965009,
1238
+ "logps/chosen": -74.38465806245804,
1239
+ "logps/rejected": -88.47626183032989,
1240
+ "epoch": 1.072,
1241
+ "step": 670
1242
+ },
1243
+ {
1244
+ "loss": 0.41553492546081544,
1245
+ "grad_norm": 0.22808755934238434,
1246
+ "learning_rate": 4.568e-06,
1247
+ "entropy": 0.8447681298654061,
1248
+ "num_tokens": 9138006.0,
1249
+ "logits/chosen": -1.591791772365951,
1250
+ "logits/rejected": -1.146695606775978,
1251
+ "mean_token_accuracy": 0.7053618848323822,
1252
+ "rewards/chosen": -1.0293371758598369,
1253
+ "rewards/rejected": -2.4234205832937734,
1254
+ "rewards/accuracies": 0.7875,
1255
+ "rewards/margins": 1.394083405379206,
1256
+ "logps/chosen": -60.523981761932376,
1257
+ "logps/rejected": -88.66759954690933,
1258
+ "epoch": 1.088,
1259
+ "step": 680
1260
+ },
1261
+ {
1262
+ "loss": 0.3357177972793579,
1263
+ "grad_norm": 0.2115124762058258,
1264
+ "learning_rate": 4.488e-06,
1265
+ "entropy": 0.77818886981986,
1266
+ "num_tokens": 9272926.0,
1267
+ "logits/chosen": -1.5370966699642798,
1268
+ "logits/rejected": -1.1325565169583864,
1269
+ "mean_token_accuracy": 0.7299308383837342,
1270
+ "rewards/chosen": -0.9643074480060022,
1271
+ "rewards/rejected": -2.687541061779484,
1272
+ "rewards/accuracies": 0.86875,
1273
+ "rewards/margins": 1.7232336099725216,
1274
+ "logps/chosen": -59.027079343795776,
1275
+ "logps/rejected": -84.05350723266602,
1276
+ "epoch": 1.104,
1277
+ "step": 690
1278
+ },
1279
+ {
1280
+ "loss": 0.4211433410644531,
1281
+ "grad_norm": 0.23426513373851776,
1282
+ "learning_rate": 4.408000000000001e-06,
1283
+ "entropy": 0.7870391614065738,
1284
+ "num_tokens": 9407243.0,
1285
+ "logits/chosen": -1.6077830379249172,
1286
+ "logits/rejected": -1.2221489033385453,
1287
+ "mean_token_accuracy": 0.7154217397794127,
1288
+ "rewards/chosen": -1.0969871749985032,
1289
+ "rewards/rejected": -2.416306406632066,
1290
+ "rewards/accuracies": 0.825,
1291
+ "rewards/margins": 1.3193192333448678,
1292
+ "logps/chosen": -66.31653872728347,
1293
+ "logps/rejected": -74.53792465925217,
1294
+ "epoch": 1.12,
1295
+ "step": 700
1296
+ },
1297
+ {
1298
+ "loss": 0.35266427993774413,
1299
+ "grad_norm": 0.16782480478286743,
1300
+ "learning_rate": 4.328000000000001e-06,
1301
+ "entropy": 0.7525284075178206,
1302
+ "num_tokens": 9541881.0,
1303
+ "logits/chosen": -1.7815538050430466,
1304
+ "logits/rejected": -1.2432088022449368,
1305
+ "mean_token_accuracy": 0.7324884554371238,
1306
+ "rewards/chosen": -1.170151641382836,
1307
+ "rewards/rejected": -2.8821156861260535,
1308
+ "rewards/accuracies": 0.85625,
1309
+ "rewards/margins": 1.7119640467688442,
1310
+ "logps/chosen": -62.426369762420656,
1311
+ "logps/rejected": -82.97551012039185,
1312
+ "epoch": 1.1360000000000001,
1313
+ "step": 710
1314
+ },
1315
+ {
1316
+ "loss": 0.4414065361022949,
1317
+ "grad_norm": 0.17724663019180298,
1318
+ "learning_rate": 4.248000000000001e-06,
1319
+ "entropy": 0.7874836204689928,
1320
+ "num_tokens": 9676124.0,
1321
+ "logits/chosen": -1.5870644241142104,
1322
+ "logits/rejected": -1.2676512314420252,
1323
+ "mean_token_accuracy": 0.7085109381005168,
1324
+ "rewards/chosen": -1.1689644593454431,
1325
+ "rewards/rejected": -2.5695454872446133,
1326
+ "rewards/accuracies": 0.80625,
1327
+ "rewards/margins": 1.400581027008593,
1328
+ "logps/chosen": -64.36232153177261,
1329
+ "logps/rejected": -79.14827445745468,
1330
+ "epoch": 1.152,
1331
+ "step": 720
1332
+ },
1333
+ {
1334
+ "loss": 0.42041378021240233,
1335
+ "grad_norm": 0.15182077884674072,
1336
+ "learning_rate": 4.168000000000001e-06,
1337
+ "entropy": 0.7948870263673598,
1338
+ "num_tokens": 9809272.0,
1339
+ "logits/chosen": -1.5996510929231569,
1340
+ "logits/rejected": -1.2198636359873567,
1341
+ "mean_token_accuracy": 0.6895976271480322,
1342
+ "rewards/chosen": -0.9217694426333765,
1343
+ "rewards/rejected": -2.2751815680006984,
1344
+ "rewards/accuracies": 0.8375,
1345
+ "rewards/margins": 1.3534121236763894,
1346
+ "logps/chosen": -63.298885464668274,
1347
+ "logps/rejected": -69.15098886489868,
1348
+ "epoch": 1.168,
1349
+ "step": 730
1350
+ },
1351
+ {
1352
+ "loss": 0.4149898052215576,
1353
+ "grad_norm": 0.4299209713935852,
1354
+ "learning_rate": 4.0880000000000005e-06,
1355
+ "entropy": 0.8794720381731167,
1356
+ "num_tokens": 9944472.0,
1357
+ "logits/chosen": -1.3574370869924466,
1358
+ "logits/rejected": -1.0639106517819426,
1359
+ "mean_token_accuracy": 0.6969729635864497,
1360
+ "rewards/chosen": -0.867475303565152,
1361
+ "rewards/rejected": -2.344749124685768,
1362
+ "rewards/accuracies": 0.85,
1363
+ "rewards/margins": 1.4772738242521881,
1364
+ "logps/chosen": -65.34813396930694,
1365
+ "logps/rejected": -80.18645774126053,
1366
+ "epoch": 1.184,
1367
+ "step": 740
1368
+ },
1369
+ {
1370
+ "loss": 0.3969083309173584,
1371
+ "grad_norm": 0.16381904482841492,
1372
+ "learning_rate": 4.008e-06,
1373
+ "entropy": 0.8126660047855694,
1374
+ "num_tokens": 10078733.0,
1375
+ "logits/chosen": -1.3498129883483427,
1376
+ "logits/rejected": -1.1121957037881862,
1377
+ "mean_token_accuracy": 0.7128386048600077,
1378
+ "rewards/chosen": -0.8270440307072932,
1379
+ "rewards/rejected": -2.320264756004326,
1380
+ "rewards/accuracies": 0.81875,
1381
+ "rewards/margins": 1.4932207340840251,
1382
+ "logps/chosen": -58.0639621257782,
1383
+ "logps/rejected": -74.64224022626877,
1384
+ "epoch": 1.2,
1385
+ "step": 750
1386
+ },
1387
+ {
1388
+ "loss": 0.3923245668411255,
1389
+ "grad_norm": 0.09231153130531311,
1390
+ "learning_rate": 3.928e-06,
1391
+ "entropy": 0.7907555149227846,
1392
+ "num_tokens": 10212826.0,
1393
+ "logits/chosen": -1.5573132545464914,
1394
+ "logits/rejected": -1.2641684294564186,
1395
+ "mean_token_accuracy": 0.7216938810423017,
1396
+ "rewards/chosen": -0.9051268995186547,
1397
+ "rewards/rejected": -2.3114789802231828,
1398
+ "rewards/accuracies": 0.85625,
1399
+ "rewards/margins": 1.406352074991446,
1400
+ "logps/chosen": -58.32571488022804,
1401
+ "logps/rejected": -83.86995618343353,
1402
+ "epoch": 1.216,
1403
+ "step": 760
1404
+ },
1405
+ {
1406
+ "loss": 0.35955214500427246,
1407
+ "grad_norm": 0.16152027249336243,
1408
+ "learning_rate": 3.848e-06,
1409
+ "entropy": 0.7906852045387496,
1410
+ "num_tokens": 10346556.0,
1411
+ "logits/chosen": -1.5494209585029366,
1412
+ "logits/rejected": -1.2729574881882504,
1413
+ "mean_token_accuracy": 0.7100083495490253,
1414
+ "rewards/chosen": -0.8209864257834851,
1415
+ "rewards/rejected": -2.317021907842718,
1416
+ "rewards/accuracies": 0.88125,
1417
+ "rewards/margins": 1.4960354787297547,
1418
+ "logps/chosen": -58.37631057500839,
1419
+ "logps/rejected": -75.28673508167267,
1420
+ "epoch": 1.232,
1421
+ "step": 770
1422
+ },
1423
+ {
1424
+ "loss": 0.4129960060119629,
1425
+ "grad_norm": 0.24933257699012756,
1426
+ "learning_rate": 3.7680000000000006e-06,
1427
+ "entropy": 0.75614075922349,
1428
+ "num_tokens": 10480829.0,
1429
+ "logits/chosen": -1.6691249020660657,
1430
+ "logits/rejected": -1.218453002782342,
1431
+ "mean_token_accuracy": 0.725784600712359,
1432
+ "rewards/chosen": -1.1460461351904088,
1433
+ "rewards/rejected": -2.7181562868412583,
1434
+ "rewards/accuracies": 0.81875,
1435
+ "rewards/margins": 1.5721101415809244,
1436
+ "logps/chosen": -62.6519087433815,
1437
+ "logps/rejected": -81.97410740852357,
1438
+ "epoch": 1.248,
1439
+ "step": 780
1440
+ },
1441
+ {
1442
+ "loss": 0.4455737113952637,
1443
+ "grad_norm": 0.3030645549297333,
1444
+ "learning_rate": 3.6880000000000005e-06,
1445
+ "entropy": 0.7621263024513609,
1446
+ "num_tokens": 10614414.0,
1447
+ "logits/chosen": -1.700109034199165,
1448
+ "logits/rejected": -1.376628724655141,
1449
+ "mean_token_accuracy": 0.7104939077049494,
1450
+ "rewards/chosen": -1.0354830527561716,
1451
+ "rewards/rejected": -2.3573520673438906,
1452
+ "rewards/accuracies": 0.81875,
1453
+ "rewards/margins": 1.3218690163921565,
1454
+ "logps/chosen": -59.53394418954849,
1455
+ "logps/rejected": -75.5838432431221,
1456
+ "epoch": 1.264,
1457
+ "step": 790
1458
+ },
1459
+ {
1460
+ "loss": 0.4144607067108154,
1461
+ "grad_norm": 0.3101625144481659,
1462
+ "learning_rate": 3.6080000000000004e-06,
1463
+ "entropy": 0.7888491688296199,
1464
+ "num_tokens": 10748424.0,
1465
+ "logits/chosen": -1.744755668223603,
1466
+ "logits/rejected": -1.2454132069381836,
1467
+ "mean_token_accuracy": 0.7081136297434568,
1468
+ "rewards/chosen": -1.042457212501904,
1469
+ "rewards/rejected": -2.5617473446996883,
1470
+ "rewards/accuracies": 0.8125,
1471
+ "rewards/margins": 1.519290132354945,
1472
+ "logps/chosen": -61.47326543331146,
1473
+ "logps/rejected": -79.36946972608567,
1474
+ "epoch": 1.28,
1475
+ "step": 800
1476
+ },
1477
+ {
1478
+ "loss": 0.36916818618774416,
1479
+ "grad_norm": 0.18668942153453827,
1480
+ "learning_rate": 3.5280000000000004e-06,
1481
+ "entropy": 0.8457717320125084,
1482
+ "num_tokens": 10884117.0,
1483
+ "logits/chosen": -1.4954581386967238,
1484
+ "logits/rejected": -1.1664500756033909,
1485
+ "mean_token_accuracy": 0.7208706248551607,
1486
+ "rewards/chosen": -0.9436249577498529,
1487
+ "rewards/rejected": -2.5245022784452886,
1488
+ "rewards/accuracies": 0.85,
1489
+ "rewards/margins": 1.5808773178141564,
1490
+ "logps/chosen": -70.7584779381752,
1491
+ "logps/rejected": -82.38645179271698,
1492
+ "epoch": 1.296,
1493
+ "step": 810
1494
+ },
1495
+ {
1496
+ "loss": 0.41336798667907715,
1497
+ "grad_norm": 0.24846971035003662,
1498
+ "learning_rate": 3.4480000000000003e-06,
1499
+ "entropy": 0.7393746774076135,
1500
+ "num_tokens": 11018693.0,
1501
+ "logits/chosen": -1.5728018848198846,
1502
+ "logits/rejected": -1.3047334613617754,
1503
+ "mean_token_accuracy": 0.7239607466384769,
1504
+ "rewards/chosen": -0.9437924515921623,
1505
+ "rewards/rejected": -2.4474497922346927,
1506
+ "rewards/accuracies": 0.80625,
1507
+ "rewards/margins": 1.5036573376040905,
1508
+ "logps/chosen": -58.04731862545013,
1509
+ "logps/rejected": -79.88022357225418,
1510
+ "epoch": 1.312,
1511
+ "step": 820
1512
+ },
1513
+ {
1514
+ "loss": 0.3941138982772827,
1515
+ "grad_norm": 0.17962393164634705,
1516
+ "learning_rate": 3.368e-06,
1517
+ "entropy": 0.8191202863235958,
1518
+ "num_tokens": 11153738.0,
1519
+ "logits/chosen": -1.569502977982598,
1520
+ "logits/rejected": -1.3446180097251133,
1521
+ "mean_token_accuracy": 0.7013885753229261,
1522
+ "rewards/chosen": -1.0316214625607245,
1523
+ "rewards/rejected": -2.4835243557114155,
1524
+ "rewards/accuracies": 0.83125,
1525
+ "rewards/margins": 1.4519028885290026,
1526
+ "logps/chosen": -66.87270923852921,
1527
+ "logps/rejected": -82.45893884897232,
1528
+ "epoch": 1.328,
1529
+ "step": 830
1530
+ },
1531
+ {
1532
+ "loss": 0.40454444885253904,
1533
+ "grad_norm": 0.26399481296539307,
1534
+ "learning_rate": 3.288e-06,
1535
+ "entropy": 0.8281162801082246,
1536
+ "num_tokens": 11288148.0,
1537
+ "logits/chosen": -1.393732705892854,
1538
+ "logits/rejected": -1.134675861717077,
1539
+ "mean_token_accuracy": 0.711259607039392,
1540
+ "rewards/chosen": -0.8508172139419912,
1541
+ "rewards/rejected": -2.2421938594488893,
1542
+ "rewards/accuracies": 0.7875,
1543
+ "rewards/margins": 1.391376649821177,
1544
+ "logps/chosen": -61.118980848789214,
1545
+ "logps/rejected": -75.8330344080925,
1546
+ "epoch": 1.3439999999999999,
1547
+ "step": 840
1548
+ },
1549
+ {
1550
+ "loss": 0.3927537202835083,
1551
+ "grad_norm": 0.2384471893310547,
1552
+ "learning_rate": 3.208e-06,
1553
+ "entropy": 0.7859910909202881,
1554
+ "num_tokens": 11422122.0,
1555
+ "logits/chosen": -1.559968605653432,
1556
+ "logits/rejected": -1.2226467421665006,
1557
+ "mean_token_accuracy": 0.705523016769439,
1558
+ "rewards/chosen": -0.8587907724882825,
1559
+ "rewards/rejected": -2.3526173725025727,
1560
+ "rewards/accuracies": 0.86875,
1561
+ "rewards/margins": 1.4938265983946621,
1562
+ "logps/chosen": -58.47013804912567,
1563
+ "logps/rejected": -76.32856943607331,
1564
+ "epoch": 1.3599999999999999,
1565
+ "step": 850
1566
+ },
1567
+ {
1568
+ "loss": 0.4346799850463867,
1569
+ "grad_norm": 0.2608790099620819,
1570
+ "learning_rate": 3.1280000000000004e-06,
1571
+ "entropy": 0.7820992226828821,
1572
+ "num_tokens": 11555439.0,
1573
+ "logits/chosen": -1.5948384898114043,
1574
+ "logits/rejected": -1.2975419307108174,
1575
+ "mean_token_accuracy": 0.694941917154938,
1576
+ "rewards/chosen": -0.9103366011011531,
1577
+ "rewards/rejected": -2.206452490389347,
1578
+ "rewards/accuracies": 0.81875,
1579
+ "rewards/margins": 1.2961158849298955,
1580
+ "logps/chosen": -60.45212324857712,
1581
+ "logps/rejected": -70.58573877811432,
1582
+ "epoch": 1.376,
1583
+ "step": 860
1584
+ },
1585
+ {
1586
+ "loss": 0.47821383476257323,
1587
+ "grad_norm": 0.33640041947364807,
1588
+ "learning_rate": 3.0480000000000003e-06,
1589
+ "entropy": 0.7687381034600549,
1590
+ "num_tokens": 11689826.0,
1591
+ "logits/chosen": -1.7085993267610973,
1592
+ "logits/rejected": -1.386772186435975,
1593
+ "mean_token_accuracy": 0.7053665170446038,
1594
+ "rewards/chosen": -0.9841044571541715,
1595
+ "rewards/rejected": -2.290806566970423,
1596
+ "rewards/accuracies": 0.74375,
1597
+ "rewards/margins": 1.306702113803476,
1598
+ "logps/chosen": -61.73239058256149,
1599
+ "logps/rejected": -75.85606197118759,
1600
+ "epoch": 1.392,
1601
+ "step": 870
1602
+ },
1603
+ {
1604
+ "loss": 0.44809565544128416,
1605
+ "grad_norm": 0.19289684295654297,
1606
+ "learning_rate": 2.9680000000000002e-06,
1607
+ "entropy": 0.838317794475006,
1608
+ "num_tokens": 11824262.0,
1609
+ "logits/chosen": -1.415884176472813,
1610
+ "logits/rejected": -1.2410310266034903,
1611
+ "mean_token_accuracy": 0.6912003190256655,
1612
+ "rewards/chosen": -0.9521958501776681,
1613
+ "rewards/rejected": -2.2994155996944756,
1614
+ "rewards/accuracies": 0.8125,
1615
+ "rewards/margins": 1.3472197427414359,
1616
+ "logps/chosen": -67.10248304605484,
1617
+ "logps/rejected": -76.43788787126542,
1618
+ "epoch": 1.408,
1619
+ "step": 880
1620
+ },
1621
+ {
1622
+ "loss": 0.3983212947845459,
1623
+ "grad_norm": 0.137314572930336,
1624
+ "learning_rate": 2.888e-06,
1625
+ "entropy": 0.7771084957581479,
1626
+ "num_tokens": 11958211.0,
1627
+ "logits/chosen": -1.4873145300830262,
1628
+ "logits/rejected": -1.1852639710072062,
1629
+ "mean_token_accuracy": 0.7251299729570746,
1630
+ "rewards/chosen": -0.8975313696777448,
1631
+ "rewards/rejected": -2.268895266018808,
1632
+ "rewards/accuracies": 0.83125,
1633
+ "rewards/margins": 1.3713638976216316,
1634
+ "logps/chosen": -60.558188426494596,
1635
+ "logps/rejected": -73.10897732973099,
1636
+ "epoch": 1.424,
1637
+ "step": 890
1638
+ },
1639
+ {
1640
+ "loss": 0.3957575082778931,
1641
+ "grad_norm": 0.19129854440689087,
1642
+ "learning_rate": 2.808e-06,
1643
+ "entropy": 0.8165824526702636,
1644
+ "num_tokens": 12092461.0,
1645
+ "logits/chosen": -1.5874914451128626,
1646
+ "logits/rejected": -1.329515978271273,
1647
+ "mean_token_accuracy": 0.7155879216268659,
1648
+ "rewards/chosen": -0.7802266632163082,
1649
+ "rewards/rejected": -2.118549132300541,
1650
+ "rewards/accuracies": 0.85,
1651
+ "rewards/margins": 1.3383224747609348,
1652
+ "logps/chosen": -61.53330332040787,
1653
+ "logps/rejected": -73.7201205611229,
1654
+ "epoch": 1.44,
1655
+ "step": 900
1656
+ },
1657
+ {
1658
+ "loss": 0.45516347885131836,
1659
+ "grad_norm": 0.47428420186042786,
1660
+ "learning_rate": 2.728e-06,
1661
+ "entropy": 0.7915405740670394,
1662
+ "num_tokens": 12227051.0,
1663
+ "logits/chosen": -1.6732329517329005,
1664
+ "logits/rejected": -1.3390952331955357,
1665
+ "mean_token_accuracy": 0.7120846627280116,
1666
+ "rewards/chosen": -0.9510568362500635,
1667
+ "rewards/rejected": -2.322500329572358,
1668
+ "rewards/accuracies": 0.83125,
1669
+ "rewards/margins": 1.3714434984140098,
1670
+ "logps/chosen": -61.362674832344055,
1671
+ "logps/rejected": -76.65392490625382,
1672
+ "epoch": 1.456,
1673
+ "step": 910
1674
+ },
1675
+ {
1676
+ "loss": 0.44686598777770997,
1677
+ "grad_norm": 0.17026080191135406,
1678
+ "learning_rate": 2.648e-06,
1679
+ "entropy": 0.7746687031816691,
1680
+ "num_tokens": 12360999.0,
1681
+ "logits/chosen": -1.6152128870414397,
1682
+ "logits/rejected": -1.2774718241622642,
1683
+ "mean_token_accuracy": 0.6930691134184599,
1684
+ "rewards/chosen": -1.0418641724740154,
1685
+ "rewards/rejected": -2.4828481852709956,
1686
+ "rewards/accuracies": 0.8,
1687
+ "rewards/margins": 1.4409840082284062,
1688
+ "logps/chosen": -61.202474081516264,
1689
+ "logps/rejected": -78.0609146118164,
1690
+ "epoch": 1.472,
1691
+ "step": 920
1692
+ },
1693
+ {
1694
+ "loss": 0.41604127883911135,
1695
+ "grad_norm": 0.23857389390468597,
1696
+ "learning_rate": 2.568e-06,
1697
+ "entropy": 0.8160373901191633,
1698
+ "num_tokens": 12495017.0,
1699
+ "logits/chosen": -1.5685694604309866,
1700
+ "logits/rejected": -1.288015625585243,
1701
+ "mean_token_accuracy": 0.6899296241812408,
1702
+ "rewards/chosen": -0.9305556651204825,
1703
+ "rewards/rejected": -2.4140758615511,
1704
+ "rewards/accuracies": 0.81875,
1705
+ "rewards/margins": 1.483520200336352,
1706
+ "logps/chosen": -64.11480586528778,
1707
+ "logps/rejected": -76.87684850692749,
1708
+ "epoch": 1.488,
1709
+ "step": 930
1710
+ },
1711
+ {
1712
+ "loss": 0.41258530616760253,
1713
+ "grad_norm": 0.19719047844409943,
1714
+ "learning_rate": 2.488e-06,
1715
+ "entropy": 0.8179522630613064,
1716
+ "num_tokens": 12628825.0,
1717
+ "logits/chosen": -1.6273103299993834,
1718
+ "logits/rejected": -1.3035281686517532,
1719
+ "mean_token_accuracy": 0.7133962934836745,
1720
+ "rewards/chosen": -0.8954242441719543,
1721
+ "rewards/rejected": -2.4310544121120072,
1722
+ "rewards/accuracies": 0.8125,
1723
+ "rewards/margins": 1.5356301709543914,
1724
+ "logps/chosen": -66.09550179243088,
1725
+ "logps/rejected": -76.01929485797882,
1726
+ "epoch": 1.504,
1727
+ "step": 940
1728
+ },
1729
+ {
1730
+ "loss": 0.38037173748016356,
1731
+ "grad_norm": 0.13135337829589844,
1732
+ "learning_rate": 2.408e-06,
1733
+ "entropy": 0.7855818087118678,
1734
+ "num_tokens": 12763474.0,
1735
+ "logits/chosen": -1.64132315324206,
1736
+ "logits/rejected": -1.2714727687609813,
1737
+ "mean_token_accuracy": 0.715859504416585,
1738
+ "rewards/chosen": -0.9226883488332532,
1739
+ "rewards/rejected": -2.500108515098691,
1740
+ "rewards/accuracies": 0.8375,
1741
+ "rewards/margins": 1.577420162782073,
1742
+ "logps/chosen": -62.92022385001182,
1743
+ "logps/rejected": -80.72790479660034,
1744
+ "epoch": 1.52,
1745
+ "step": 950
1746
+ },
1747
+ {
1748
+ "loss": 0.4409198760986328,
1749
+ "grad_norm": 0.31303665041923523,
1750
+ "learning_rate": 2.3280000000000004e-06,
1751
+ "entropy": 0.8127735982066951,
1752
+ "num_tokens": 12897107.0,
1753
+ "logits/chosen": -1.4399391210346026,
1754
+ "logits/rejected": -1.230631261634329,
1755
+ "mean_token_accuracy": 0.7026735378429294,
1756
+ "rewards/chosen": -0.934967651846091,
1757
+ "rewards/rejected": -2.3322817377047613,
1758
+ "rewards/accuracies": 0.8125,
1759
+ "rewards/margins": 1.397314086277038,
1760
+ "logps/chosen": -62.542164742946625,
1761
+ "logps/rejected": -73.16161739826202,
1762
+ "epoch": 1.536,
1763
+ "step": 960
1764
+ },
1765
+ {
1766
+ "loss": 0.4280536651611328,
1767
+ "grad_norm": 0.23763145506381989,
1768
+ "learning_rate": 2.2480000000000003e-06,
1769
+ "entropy": 0.7570945325132925,
1770
+ "num_tokens": 13030353.0,
1771
+ "logits/chosen": -1.7085164768196859,
1772
+ "logits/rejected": -1.3653086009027349,
1773
+ "mean_token_accuracy": 0.7043427483178675,
1774
+ "rewards/chosen": -0.8528924703747179,
1775
+ "rewards/rejected": -2.3349083499619154,
1776
+ "rewards/accuracies": 0.84375,
1777
+ "rewards/margins": 1.4820158663205802,
1778
+ "logps/chosen": -54.941452419757844,
1779
+ "logps/rejected": -76.01085047721863,
1780
+ "epoch": 1.552,
1781
+ "step": 970
1782
+ },
1783
+ {
1784
+ "loss": 0.4093909740447998,
1785
+ "grad_norm": 0.15855129063129425,
1786
+ "learning_rate": 2.1680000000000002e-06,
1787
+ "entropy": 0.8031133261421928,
1788
+ "num_tokens": 13164375.0,
1789
+ "logits/chosen": -1.6047969528216535,
1790
+ "logits/rejected": -1.3126213199277794,
1791
+ "mean_token_accuracy": 0.7228384926915169,
1792
+ "rewards/chosen": -0.9882222296495456,
1793
+ "rewards/rejected": -2.488050222734455,
1794
+ "rewards/accuracies": 0.7875,
1795
+ "rewards/margins": 1.49982799179852,
1796
+ "logps/chosen": -55.37274434566498,
1797
+ "logps/rejected": -80.98553432226181,
1798
+ "epoch": 1.568,
1799
+ "step": 980
1800
+ },
1801
+ {
1802
+ "loss": 0.4008018016815186,
1803
+ "grad_norm": 0.2002083659172058,
1804
+ "learning_rate": 2.088e-06,
1805
+ "entropy": 0.7641958858119324,
1806
+ "num_tokens": 13298403.0,
1807
+ "logits/chosen": -1.6807618807671876,
1808
+ "logits/rejected": -1.4103444427587308,
1809
+ "mean_token_accuracy": 0.7030234351754189,
1810
+ "rewards/chosen": -1.01242817313032,
1811
+ "rewards/rejected": -2.5514646800002083,
1812
+ "rewards/accuracies": 0.85,
1813
+ "rewards/margins": 1.5390365039929748,
1814
+ "logps/chosen": -60.99553867578506,
1815
+ "logps/rejected": -78.78072011470795,
1816
+ "epoch": 1.584,
1817
+ "step": 990
1818
+ },
1819
+ {
1820
+ "loss": 0.36574759483337405,
1821
+ "grad_norm": 0.20195689797401428,
1822
+ "learning_rate": 2.008e-06,
1823
+ "entropy": 0.7913652153627482,
1824
+ "num_tokens": 13433900.0,
1825
+ "logits/chosen": -1.6205719198466766,
1826
+ "logits/rejected": -1.2734592295015583,
1827
+ "mean_token_accuracy": 0.7198475800454617,
1828
+ "rewards/chosen": -1.0852013303767307,
1829
+ "rewards/rejected": -2.7301569358445703,
1830
+ "rewards/accuracies": 0.83125,
1831
+ "rewards/margins": 1.6449556024745107,
1832
+ "logps/chosen": -61.82057131528855,
1833
+ "logps/rejected": -90.16037954092026,
1834
+ "epoch": 1.6,
1835
+ "step": 1000
1836
+ },
1837
+ {
1838
+ "loss": 0.4564220905303955,
1839
+ "grad_norm": 0.23998261988162994,
1840
+ "learning_rate": 1.928e-06,
1841
+ "entropy": 0.7775021609733812,
1842
+ "num_tokens": 13567714.0,
1843
+ "logits/chosen": -1.6069885571949023,
1844
+ "logits/rejected": -1.2448455268540815,
1845
+ "mean_token_accuracy": 0.7207059916108847,
1846
+ "rewards/chosen": -0.9900020190340001,
1847
+ "rewards/rejected": -2.2949246817035602,
1848
+ "rewards/accuracies": 0.80625,
1849
+ "rewards/margins": 1.30492265666835,
1850
+ "logps/chosen": -56.62804977893829,
1851
+ "logps/rejected": -74.89186335802079,
1852
+ "epoch": 1.616,
1853
+ "step": 1010
1854
+ },
1855
+ {
1856
+ "loss": 0.42406411170959474,
1857
+ "grad_norm": 0.15388637781143188,
1858
+ "learning_rate": 1.8480000000000001e-06,
1859
+ "entropy": 0.8878116343752481,
1860
+ "num_tokens": 13702663.0,
1861
+ "logits/chosen": -1.4586615375446985,
1862
+ "logits/rejected": -1.202710052546826,
1863
+ "mean_token_accuracy": 0.697345650754869,
1864
+ "rewards/chosen": -0.8269692128349562,
1865
+ "rewards/rejected": -2.332517017016653,
1866
+ "rewards/accuracies": 0.8,
1867
+ "rewards/margins": 1.5055477982386947,
1868
+ "logps/chosen": -67.33907754421234,
1869
+ "logps/rejected": -78.72829058170319,
1870
+ "epoch": 1.6320000000000001,
1871
+ "step": 1020
1872
+ },
1873
+ {
1874
+ "loss": 0.5315371036529541,
1875
+ "grad_norm": 0.457735151052475,
1876
+ "learning_rate": 1.7680000000000003e-06,
1877
+ "entropy": 0.7946982815090451,
1878
+ "num_tokens": 13836837.0,
1879
+ "logits/chosen": -1.5394904545256396,
1880
+ "logits/rejected": -1.3461529774623355,
1881
+ "mean_token_accuracy": 0.7092686965130269,
1882
+ "rewards/chosen": -1.002942830277607,
1883
+ "rewards/rejected": -2.0356479603942716,
1884
+ "rewards/accuracies": 0.78125,
1885
+ "rewards/margins": 1.032705131266266,
1886
+ "logps/chosen": -59.03670599460602,
1887
+ "logps/rejected": -74.02852568626403,
1888
+ "epoch": 1.6480000000000001,
1889
+ "step": 1030
1890
+ },
1891
+ {
1892
+ "loss": 0.38461852073669434,
1893
+ "grad_norm": 0.39034000039100647,
1894
+ "learning_rate": 1.6880000000000002e-06,
1895
+ "entropy": 0.8253316642483697,
1896
+ "num_tokens": 13971505.0,
1897
+ "logits/chosen": -1.5883768642108542,
1898
+ "logits/rejected": -1.1797071518191893,
1899
+ "mean_token_accuracy": 0.7223691996186972,
1900
+ "rewards/chosen": -0.8903896576404804,
1901
+ "rewards/rejected": -2.397843297244981,
1902
+ "rewards/accuracies": 0.8625,
1903
+ "rewards/margins": 1.5074536396190523,
1904
+ "logps/chosen": -66.58087438344955,
1905
+ "logps/rejected": -80.14289541244507,
1906
+ "epoch": 1.6640000000000001,
1907
+ "step": 1040
1908
+ },
1909
+ {
1910
+ "loss": 0.382495641708374,
1911
+ "grad_norm": 0.1509310007095337,
1912
+ "learning_rate": 1.608e-06,
1913
+ "entropy": 0.7834752728114835,
1914
+ "num_tokens": 14105815.0,
1915
+ "logits/chosen": -1.7158877727658357,
1916
+ "logits/rejected": -1.4181691521558832,
1917
+ "mean_token_accuracy": 0.7118882562965154,
1918
+ "rewards/chosen": -0.8125111373268737,
1919
+ "rewards/rejected": -2.3814144938398387,
1920
+ "rewards/accuracies": 0.825,
1921
+ "rewards/margins": 1.5689033489674329,
1922
+ "logps/chosen": -59.85800029039383,
1923
+ "logps/rejected": -76.31336205005645,
1924
+ "epoch": 1.6800000000000002,
1925
+ "step": 1050
1926
+ },
1927
+ {
1928
+ "loss": 0.3997781276702881,
1929
+ "grad_norm": 0.16973033547401428,
1930
+ "learning_rate": 1.528e-06,
1931
+ "entropy": 0.7523306506569497,
1932
+ "num_tokens": 14238856.0,
1933
+ "logits/chosen": -1.6062346133682144,
1934
+ "logits/rejected": -1.2810464342593764,
1935
+ "mean_token_accuracy": 0.7258081361651421,
1936
+ "rewards/chosen": -0.6798284199699992,
1937
+ "rewards/rejected": -2.1458812093129382,
1938
+ "rewards/accuracies": 0.825,
1939
+ "rewards/margins": 1.4660527911037207,
1940
+ "logps/chosen": -52.1538228392601,
1941
+ "logps/rejected": -69.79548509120941,
1942
+ "epoch": 1.696,
1943
+ "step": 1060
1944
+ },
1945
+ {
1946
+ "loss": 0.4718148708343506,
1947
+ "grad_norm": 0.20180265605449677,
1948
+ "learning_rate": 1.4480000000000002e-06,
1949
+ "entropy": 0.8426862467269529,
1950
+ "num_tokens": 14373384.0,
1951
+ "logits/chosen": -1.414872733093532,
1952
+ "logits/rejected": -1.2033987674482276,
1953
+ "mean_token_accuracy": 0.7098671667277813,
1954
+ "rewards/chosen": -0.7758016889652936,
1955
+ "rewards/rejected": -1.9979332615272143,
1956
+ "rewards/accuracies": 0.80625,
1957
+ "rewards/margins": 1.2221315732225775,
1958
+ "logps/chosen": -61.47320030927658,
1959
+ "logps/rejected": -75.88288476467133,
1960
+ "epoch": 1.712,
1961
+ "step": 1070
1962
+ },
1963
+ {
1964
+ "loss": 0.40792551040649416,
1965
+ "grad_norm": 0.12882812321186066,
1966
+ "learning_rate": 1.368e-06,
1967
+ "entropy": 0.8100415779626928,
1968
+ "num_tokens": 14507731.0,
1969
+ "logits/chosen": -1.554711909013513,
1970
+ "logits/rejected": -1.286161994780994,
1971
+ "mean_token_accuracy": 0.7126545551232993,
1972
+ "rewards/chosen": -0.7657065154984594,
1973
+ "rewards/rejected": -2.140209031692939,
1974
+ "rewards/accuracies": 0.83125,
1975
+ "rewards/margins": 1.3745025174692274,
1976
+ "logps/chosen": -59.775043559074405,
1977
+ "logps/rejected": -73.95411350727082,
1978
+ "epoch": 1.728,
1979
+ "step": 1080
1980
+ },
1981
+ {
1982
+ "loss": 0.460341215133667,
1983
+ "grad_norm": 0.22980692982673645,
1984
+ "learning_rate": 1.288e-06,
1985
+ "entropy": 0.8181033694170765,
1986
+ "num_tokens": 14642108.0,
1987
+ "logits/chosen": -1.6803376592297787,
1988
+ "logits/rejected": -1.3255758714406825,
1989
+ "mean_token_accuracy": 0.6975156743079424,
1990
+ "rewards/chosen": -0.8895529725443339,
1991
+ "rewards/rejected": -2.2926501425448804,
1992
+ "rewards/accuracies": 0.78125,
1993
+ "rewards/margins": 1.4030971705913544,
1994
+ "logps/chosen": -61.22287553548813,
1995
+ "logps/rejected": -76.53585437536239,
1996
+ "epoch": 1.744,
1997
+ "step": 1090
1998
+ },
1999
+ {
2000
+ "loss": 0.38245701789855957,
2001
+ "grad_norm": 0.3598242700099945,
2002
+ "learning_rate": 1.2080000000000001e-06,
2003
+ "entropy": 0.8136682996293529,
2004
+ "num_tokens": 14775766.0,
2005
+ "logits/chosen": -1.748982279233705,
2006
+ "logits/rejected": -1.3789075393037096,
2007
+ "mean_token_accuracy": 0.704171646013856,
2008
+ "rewards/chosen": -0.8589008188049775,
2009
+ "rewards/rejected": -2.463993888767436,
2010
+ "rewards/accuracies": 0.80625,
2011
+ "rewards/margins": 1.6050930766854434,
2012
+ "logps/chosen": -59.82941732406616,
2013
+ "logps/rejected": -79.58926742076873,
2014
+ "epoch": 1.76,
2015
+ "step": 1100
2016
+ },
2017
+ {
2018
+ "loss": 0.3972444772720337,
2019
+ "grad_norm": 0.1654120236635208,
2020
+ "learning_rate": 1.128e-06,
2021
+ "entropy": 0.8605185098713264,
2022
+ "num_tokens": 14910427.0,
2023
+ "logits/chosen": -1.5821960481799344,
2024
+ "logits/rejected": -1.3003056640036224,
2025
+ "mean_token_accuracy": 0.7196848660707473,
2026
+ "rewards/chosen": -0.6700921900264802,
2027
+ "rewards/rejected": -2.134859440010041,
2028
+ "rewards/accuracies": 0.8375,
2029
+ "rewards/margins": 1.464767256891355,
2030
+ "logps/chosen": -62.29144715070724,
2031
+ "logps/rejected": -75.43621026277542,
2032
+ "epoch": 1.776,
2033
+ "step": 1110
2034
+ },
2035
+ {
2036
+ "loss": 0.3881003141403198,
2037
+ "grad_norm": 0.31780576705932617,
2038
+ "learning_rate": 1.0480000000000002e-06,
2039
+ "entropy": 0.7536086188949411,
2040
+ "num_tokens": 15044039.0,
2041
+ "logits/chosen": -1.841065192100882,
2042
+ "logits/rejected": -1.4748827260004975,
2043
+ "mean_token_accuracy": 0.7127156775444746,
2044
+ "rewards/chosen": -0.8550866460078396,
2045
+ "rewards/rejected": -2.4443933775830375,
2046
+ "rewards/accuracies": 0.8125,
2047
+ "rewards/margins": 1.589306729659438,
2048
+ "logps/chosen": -58.62155553102493,
2049
+ "logps/rejected": -75.7669577240944,
2050
+ "epoch": 1.792,
2051
+ "step": 1120
2052
+ },
2053
+ {
2054
+ "loss": 0.4013789653778076,
2055
+ "grad_norm": 0.2001297026872635,
2056
+ "learning_rate": 9.68e-07,
2057
+ "entropy": 0.7950713085068856,
2058
+ "num_tokens": 15178463.0,
2059
+ "logits/chosen": -1.5685507002654315,
2060
+ "logits/rejected": -1.2775390358253036,
2061
+ "mean_token_accuracy": 0.7291223388165236,
2062
+ "rewards/chosen": -0.9785112287499942,
2063
+ "rewards/rejected": -2.3648490178980865,
2064
+ "rewards/accuracies": 0.80625,
2065
+ "rewards/margins": 1.3863377826288343,
2066
+ "logps/chosen": -57.15689754486084,
2067
+ "logps/rejected": -79.94988844394683,
2068
+ "epoch": 1.808,
2069
+ "step": 1130
2070
+ },
2071
+ {
2072
+ "loss": 0.49084672927856443,
2073
+ "grad_norm": 0.282905250787735,
2074
+ "learning_rate": 8.880000000000001e-07,
2075
+ "entropy": 0.8204654254193884,
2076
+ "num_tokens": 15312634.0,
2077
+ "logits/chosen": -1.7517282709034656,
2078
+ "logits/rejected": -1.3190052625389146,
2079
+ "mean_token_accuracy": 0.702907775528729,
2080
+ "rewards/chosen": -1.0180173698186992,
2081
+ "rewards/rejected": -2.349904873233754,
2082
+ "rewards/accuracies": 0.74375,
2083
+ "rewards/margins": 1.3318874984048308,
2084
+ "logps/chosen": -60.69031958580017,
2085
+ "logps/rejected": -82.0468565583229,
2086
+ "epoch": 1.8239999999999998,
2087
+ "step": 1140
2088
+ },
2089
+ {
2090
+ "loss": 0.41397271156311033,
2091
+ "grad_norm": 0.24510224163532257,
2092
+ "learning_rate": 8.08e-07,
2093
+ "entropy": 0.7518876982045185,
2094
+ "num_tokens": 15447212.0,
2095
+ "logits/chosen": -1.7534279282280079,
2096
+ "logits/rejected": -1.4486691671151501,
2097
+ "mean_token_accuracy": 0.7159834343940019,
2098
+ "rewards/chosen": -0.8752170269319322,
2099
+ "rewards/rejected": -2.376165826232318,
2100
+ "rewards/accuracies": 0.8125,
2101
+ "rewards/margins": 1.5009488008916378,
2102
+ "logps/chosen": -62.758730709552765,
2103
+ "logps/rejected": -75.16731867790222,
2104
+ "epoch": 1.8399999999999999,
2105
+ "step": 1150
2106
+ },
2107
+ {
2108
+ "loss": 0.394866418838501,
2109
+ "grad_norm": 0.24172107875347137,
2110
+ "learning_rate": 7.280000000000001e-07,
2111
+ "entropy": 0.8392532223559102,
2112
+ "num_tokens": 15582198.0,
2113
+ "logits/chosen": -1.611792128266145,
2114
+ "logits/rejected": -1.3081702823225343,
2115
+ "mean_token_accuracy": 0.6921530704945326,
2116
+ "rewards/chosen": -0.891454957460519,
2117
+ "rewards/rejected": -2.299446607741993,
2118
+ "rewards/accuracies": 0.825,
2119
+ "rewards/margins": 1.4079916514456272,
2120
+ "logps/chosen": -66.89741308689118,
2121
+ "logps/rejected": -77.80138423442841,
2122
+ "epoch": 1.8559999999999999,
2123
+ "step": 1160
2124
+ },
2125
+ {
2126
+ "loss": 0.36963462829589844,
2127
+ "grad_norm": 0.10854224115610123,
2128
+ "learning_rate": 6.48e-07,
2129
+ "entropy": 0.7845139768323861,
2130
+ "num_tokens": 15716912.0,
2131
+ "logits/chosen": -1.669064124473416,
2132
+ "logits/rejected": -1.3501869835794094,
2133
+ "mean_token_accuracy": 0.6950992489233613,
2134
+ "rewards/chosen": -1.0043300430756061,
2135
+ "rewards/rejected": -2.6331260551698508,
2136
+ "rewards/accuracies": 0.85625,
2137
+ "rewards/margins": 1.6287960140965878,
2138
+ "logps/chosen": -63.72115622758865,
2139
+ "logps/rejected": -79.68026465177536,
2140
+ "epoch": 1.8719999999999999,
2141
+ "step": 1170
2142
+ },
2143
+ {
2144
+ "loss": 0.4263630390167236,
2145
+ "grad_norm": 0.5233930349349976,
2146
+ "learning_rate": 5.680000000000001e-07,
2147
+ "entropy": 0.784919643367175,
2148
+ "num_tokens": 15851192.0,
2149
+ "logits/chosen": -1.6582383122340094,
2150
+ "logits/rejected": -1.4570516865536298,
2151
+ "mean_token_accuracy": 0.7130840895697474,
2152
+ "rewards/chosen": -0.924873108274187,
2153
+ "rewards/rejected": -2.3207803161232734,
2154
+ "rewards/accuracies": 0.79375,
2155
+ "rewards/margins": 1.3959072068799288,
2156
+ "logps/chosen": -62.35584118366241,
2157
+ "logps/rejected": -71.84658821821213,
2158
+ "epoch": 1.888,
2159
+ "step": 1180
2160
+ },
2161
+ {
2162
+ "loss": 0.4169583797454834,
2163
+ "grad_norm": 0.2042553722858429,
2164
+ "learning_rate": 4.88e-07,
2165
+ "entropy": 0.7986534590294468,
2166
+ "num_tokens": 15986206.0,
2167
+ "logits/chosen": -1.625323136112677,
2168
+ "logits/rejected": -1.3687231216559412,
2169
+ "mean_token_accuracy": 0.709136931784451,
2170
+ "rewards/chosen": -0.9780737107619644,
2171
+ "rewards/rejected": -2.4485225888201967,
2172
+ "rewards/accuracies": 0.80625,
2173
+ "rewards/margins": 1.4704488803166895,
2174
+ "logps/chosen": -69.08510230779648,
2175
+ "logps/rejected": -75.75201008319854,
2176
+ "epoch": 1.904,
2177
+ "step": 1190
2178
+ },
2179
+ {
2180
+ "loss": 0.49296092987060547,
2181
+ "grad_norm": 0.15136049687862396,
2182
+ "learning_rate": 4.0800000000000005e-07,
2183
+ "entropy": 0.7618352607241832,
2184
+ "num_tokens": 16119991.0,
2185
+ "logits/chosen": -1.6908642001340586,
2186
+ "logits/rejected": -1.4333833514773324,
2187
+ "mean_token_accuracy": 0.7040262173861265,
2188
+ "rewards/chosen": -1.0545528033093432,
2189
+ "rewards/rejected": -2.3307074559561443,
2190
+ "rewards/accuracies": 0.78125,
2191
+ "rewards/margins": 1.276154650375247,
2192
+ "logps/chosen": -61.58516470193863,
2193
+ "logps/rejected": -72.52572029829025,
2194
+ "epoch": 1.92,
2195
+ "step": 1200
2196
+ },
2197
+ {
2198
+ "loss": 0.43592305183410646,
2199
+ "grad_norm": 0.13972248136997223,
2200
+ "learning_rate": 3.280000000000001e-07,
2201
+ "entropy": 0.8202263483690331,
2202
+ "num_tokens": 16254379.0,
2203
+ "logits/chosen": -1.6105296053254246,
2204
+ "logits/rejected": -1.2790083528502694,
2205
+ "mean_token_accuracy": 0.7206195367500186,
2206
+ "rewards/chosen": -0.9561634575518838,
2207
+ "rewards/rejected": -2.4314136517699807,
2208
+ "rewards/accuracies": 0.8125,
2209
+ "rewards/margins": 1.4752501933835447,
2210
+ "logps/chosen": -60.72013909816742,
2211
+ "logps/rejected": -81.33328273296357,
2212
+ "epoch": 1.936,
2213
+ "step": 1210
2214
+ },
2215
+ {
2216
+ "loss": 0.45383148193359374,
2217
+ "grad_norm": 0.3797275125980377,
2218
+ "learning_rate": 2.48e-07,
2219
+ "entropy": 0.8815733156981878,
2220
+ "num_tokens": 16389460.0,
2221
+ "logits/chosen": -1.29787982782845,
2222
+ "logits/rejected": -1.1528923226810408,
2223
+ "mean_token_accuracy": 0.6916974617168308,
2224
+ "rewards/chosen": -0.8694630793921533,
2225
+ "rewards/rejected": -2.179070246774063,
2226
+ "rewards/accuracies": 0.8,
2227
+ "rewards/margins": 1.3096071674488485,
2228
+ "logps/chosen": -68.63869899511337,
2229
+ "logps/rejected": -76.16187700033188,
2230
+ "epoch": 1.952,
2231
+ "step": 1220
2232
+ },
2233
+ {
2234
+ "loss": 0.4355313301086426,
2235
+ "grad_norm": 0.20707087218761444,
2236
+ "learning_rate": 1.68e-07,
2237
+ "entropy": 0.8257959268114063,
2238
+ "num_tokens": 16523707.0,
2239
+ "logits/chosen": -1.5610055057823797,
2240
+ "logits/rejected": -1.2919258374928781,
2241
+ "mean_token_accuracy": 0.7034160443581641,
2242
+ "rewards/chosen": -0.8847868947021198,
2243
+ "rewards/rejected": -2.1883990670132336,
2244
+ "rewards/accuracies": 0.81875,
2245
+ "rewards/margins": 1.3036121717654168,
2246
+ "logps/chosen": -63.40972650051117,
2247
+ "logps/rejected": -76.90884720087051,
2248
+ "epoch": 1.968,
2249
+ "step": 1230
2250
+ },
2251
+ {
2252
+ "loss": 0.4611621379852295,
2253
+ "grad_norm": 0.2545054852962494,
2254
+ "learning_rate": 8.800000000000001e-08,
2255
+ "entropy": 0.8352547256625258,
2256
+ "num_tokens": 16659265.0,
2257
+ "logits/chosen": -1.5704459906119035,
2258
+ "logits/rejected": -1.2433016542196085,
2259
+ "mean_token_accuracy": 0.7052778167650103,
2260
+ "rewards/chosen": -0.9597635358106344,
2261
+ "rewards/rejected": -2.3284011104144158,
2262
+ "rewards/accuracies": 0.80625,
2263
+ "rewards/margins": 1.3686375686433165,
2264
+ "logps/chosen": -68.85014188289642,
2265
+ "logps/rejected": -77.95877922773361,
2266
+ "epoch": 1.984,
2267
+ "step": 1240
2268
+ },
2269
+ {
2270
+ "loss": 0.4011569023132324,
2271
+ "grad_norm": 0.2973766326904297,
2272
+ "learning_rate": 8e-09,
2273
+ "entropy": 0.8292072300857398,
2274
+ "num_tokens": 16794078.0,
2275
+ "logits/chosen": -1.5225679573518773,
2276
+ "logits/rejected": -1.2299553825384233,
2277
+ "mean_token_accuracy": 0.727184671908617,
2278
+ "rewards/chosen": -0.8619254208082566,
2279
+ "rewards/rejected": -2.372782723305863,
2280
+ "rewards/accuracies": 0.80625,
2281
+ "rewards/margins": 1.5108572976663708,
2282
+ "logps/chosen": -63.519434094429016,
2283
+ "logps/rejected": -76.77453536987305,
2284
+ "epoch": 2.0,
2285
+ "step": 1250
2286
+ },
2287
+ {
2288
+ "train_runtime": 6000.0528,
2289
+ "train_samples_per_second": 3.333,
2290
+ "train_steps_per_second": 0.208,
2291
+ "total_flos": 1.3612284112597402e+17,
2292
+ "train_loss": 0.452988232421875,
2293
+ "epoch": 2.0,
2294
+ "step": 1250
2295
+ }
2296
+ ],
2297
+ "validation_monitor_size": 0,
2298
+ "validation_monitor_selection": "fixed_seed_random_without_replacement",
2299
+ "validation_monitor_seed": 23,
2300
+ "validation_monitor_indices": [],
2301
+ "early_stopping_patience": null
2302
+ }