sravanthib commited on
Commit
cbd6734
·
verified ·
1 Parent(s): 14af568

Training completed

Browse files
Files changed (4) hide show
  1. README.md +6 -6
  2. all_results.json +6 -6
  3. train_results.json +6 -6
  4. trainer_state.json +45 -16
README.md CHANGED
@@ -1,9 +1,9 @@
1
  ---
 
2
  license: apache-2.0
3
  base_model: Qwen/Qwen2.5-7B-Instruct
4
  tags:
5
  - generated_from_trainer
6
- library_name: peft
7
  model-index:
8
  - name: refactored-code-llama-3-2-3b
9
  results: []
@@ -42,10 +42,10 @@ The following hyperparameters were used during training:
42
  - gradient_accumulation_steps: 10
43
  - total_train_batch_size: 160
44
  - total_eval_batch_size: 64
45
- - optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
46
  - lr_scheduler_type: cosine
47
  - lr_scheduler_warmup_ratio: 0.05
48
- - training_steps: 10
49
 
50
  ### Training results
51
 
@@ -54,7 +54,7 @@ The following hyperparameters were used during training:
54
  ### Framework versions
55
 
56
  - PEFT 0.14.0
57
- - Transformers 4.43.3
58
  - Pytorch 2.3.0+cu121
59
- - Datasets 3.2.0
60
- - Tokenizers 0.19.1
 
1
  ---
2
+ library_name: peft
3
  license: apache-2.0
4
  base_model: Qwen/Qwen2.5-7B-Instruct
5
  tags:
6
  - generated_from_trainer
 
7
  model-index:
8
  - name: refactored-code-llama-3-2-3b
9
  results: []
 
42
  - gradient_accumulation_steps: 10
43
  - total_train_batch_size: 160
44
  - total_eval_batch_size: 64
45
+ - optimizer: Use adamw_torch with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
46
  - lr_scheduler_type: cosine
47
  - lr_scheduler_warmup_ratio: 0.05
48
+ - training_steps: 50
49
 
50
  ### Training results
51
 
 
54
  ### Framework versions
55
 
56
  - PEFT 0.14.0
57
+ - Transformers 4.51.3
58
  - Pytorch 2.3.0+cu121
59
+ - Datasets 2.15.0
60
+ - Tokenizers 0.21.2
all_results.json CHANGED
@@ -1,8 +1,8 @@
1
  {
2
- "epoch": 1.5873015873015874,
3
- "total_flos": 1.394108846267433e+17,
4
- "train_loss": 4.131035614013672,
5
- "train_runtime": 154.8297,
6
- "train_samples_per_second": 10.334,
7
- "train_steps_per_second": 0.065
8
  }
 
1
  {
2
+ "epoch": 7.158730158730159,
3
+ "total_flos": 6.287430713700516e+17,
4
+ "train_loss": 0.9039687210321427,
5
+ "train_runtime": 620.4093,
6
+ "train_samples_per_second": 12.895,
7
+ "train_steps_per_second": 0.081
8
  }
train_results.json CHANGED
@@ -1,8 +1,8 @@
1
  {
2
- "epoch": 1.5873015873015874,
3
- "total_flos": 1.394108846267433e+17,
4
- "train_loss": 4.131035614013672,
5
- "train_runtime": 154.8297,
6
- "train_samples_per_second": 10.334,
7
- "train_steps_per_second": 0.065
8
  }
 
1
  {
2
+ "epoch": 7.158730158730159,
3
+ "total_flos": 6.287430713700516e+17,
4
+ "train_loss": 0.9039687210321427,
5
+ "train_runtime": 620.4093,
6
+ "train_samples_per_second": 12.895,
7
+ "train_steps_per_second": 0.081
8
  }
trainer_state.json CHANGED
@@ -1,35 +1,64 @@
1
  {
 
2
  "best_metric": null,
3
  "best_model_checkpoint": null,
4
- "epoch": 1.5873015873015874,
5
  "eval_steps": 0,
6
- "global_step": 10,
7
  "is_hyper_param_search": false,
8
  "is_local_process_zero": true,
9
  "is_world_process_zero": true,
10
  "log_history": [
11
  {
12
- "epoch": 1.5873015873015874,
13
- "grad_norm": 0.2575690448284149,
14
  "learning_rate": 0.0001,
15
- "loss": 4.131,
16
  "step": 10
17
  },
18
  {
19
- "epoch": 1.5873015873015874,
20
- "step": 10,
21
- "total_flos": 1.394108846267433e+17,
22
- "train_loss": 4.131035614013672,
23
- "train_runtime": 154.8297,
24
- "train_samples_per_second": 10.334,
25
- "train_steps_per_second": 0.065
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
26
  }
27
  ],
28
  "logging_steps": 10,
29
- "max_steps": 10,
30
  "num_input_tokens_seen": 0,
31
- "num_train_epochs": 2,
32
- "save_steps": 10,
33
  "stateful_callbacks": {
34
  "TrainerControl": {
35
  "args": {
@@ -42,7 +71,7 @@
42
  "attributes": {}
43
  }
44
  },
45
- "total_flos": 1.394108846267433e+17,
46
  "train_batch_size": 2,
47
  "trial_name": null,
48
  "trial_params": null
 
1
  {
2
+ "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 7.158730158730159,
6
  "eval_steps": 0,
7
+ "global_step": 50,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 1.4761904761904763,
14
+ "grad_norm": 0.3249737322330475,
15
  "learning_rate": 0.0001,
16
+ "loss": 4.3222,
17
  "step": 10
18
  },
19
  {
20
+ "epoch": 2.9523809523809526,
21
+ "grad_norm": 0.1562434732913971,
22
+ "learning_rate": 0.0001,
23
+ "loss": 0.055,
24
+ "step": 20
25
+ },
26
+ {
27
+ "epoch": 4.317460317460317,
28
+ "grad_norm": 0.16819268465042114,
29
+ "learning_rate": 0.0001,
30
+ "loss": 0.0541,
31
+ "step": 30
32
+ },
33
+ {
34
+ "epoch": 5.7936507936507935,
35
+ "grad_norm": 0.13744346797466278,
36
+ "learning_rate": 0.0001,
37
+ "loss": 0.0479,
38
+ "step": 40
39
+ },
40
+ {
41
+ "epoch": 7.158730158730159,
42
+ "grad_norm": 0.11455884575843811,
43
+ "learning_rate": 0.0001,
44
+ "loss": 0.0406,
45
+ "step": 50
46
+ },
47
+ {
48
+ "epoch": 7.158730158730159,
49
+ "step": 50,
50
+ "total_flos": 6.287430713700516e+17,
51
+ "train_loss": 0.9039687210321427,
52
+ "train_runtime": 620.4093,
53
+ "train_samples_per_second": 12.895,
54
+ "train_steps_per_second": 0.081
55
  }
56
  ],
57
  "logging_steps": 10,
58
+ "max_steps": 50,
59
  "num_input_tokens_seen": 0,
60
+ "num_train_epochs": 9,
61
+ "save_steps": 50,
62
  "stateful_callbacks": {
63
  "TrainerControl": {
64
  "args": {
 
71
  "attributes": {}
72
  }
73
  },
74
+ "total_flos": 6.287430713700516e+17,
75
  "train_batch_size": 2,
76
  "trial_name": null,
77
  "trial_params": null