anhdai312 commited on
Commit
546a44f
·
verified ·
1 Parent(s): 5ee855e

Training in progress, step 260, checkpoint

Browse files
last-checkpoint/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bd8a132253c786b9766718b1d46ee5f7b122eff07ab4586bcbbe30fa1c9b9abc
3
  size 161533192
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c4bbf0992a106f4baa01a514ae01216614042b5d5e90f8621a2e9625d793e64f
3
  size 161533192
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:77866aee42e7ae10bb21f219d3d9878bbabad58f8a99649056001a38dd2e1b33
3
- size 82465029
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c74fea9bec98892c11696c52d0751f8eae129e8bfdf2383ae6e538abe462147b
3
+ size 82465413
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:043fc09537ee90b36f4cec07dde959cf1694373f1f0db19fed754bb7a97ff016
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e3679b5332bd6913a80c9d4c9aefd42fb13000e50001b9fe813643d1433503fd
3
  size 14645
last-checkpoint/scaler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8d6fca631a6bcdfa2416587314d206a68f40e27a07bc674b76e72a93db4e5058
3
  size 1383
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4b4e1c57c7cbee6e029ea75fc88a26c3704cad5c13afadd670c74d698d66cb3e
3
  size 1383
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:655325b0ef9c3f1ebcf83e3585352bef2e1a353ede191932bf42d88645c9c9e4
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d251eb269cc220cd4f9e310470b60ac80072d6ccf3fde870ee5d392976862ef6
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -1,10 +1,10 @@
1
  {
2
- "best_global_step": 240,
3
- "best_metric": 0.7851760983467102,
4
- "best_model_checkpoint": "/tmp/checkpoints_/job_bf4d9449-335c-4598-aae6-39588820e13b/checkpoint-240",
5
- "epoch": 1.8428835489833642,
6
  "eval_steps": 10,
7
- "global_step": 250,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -1958,6 +1958,84 @@
1958
  "eval_samples_per_second": 3.4,
1959
  "eval_steps_per_second": 0.884,
1960
  "step": 250
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1961
  }
1962
  ],
1963
  "logging_steps": 1,
@@ -1977,7 +2055,7 @@
1977
  "attributes": {}
1978
  }
1979
  },
1980
- "total_flos": 8032673080685568.0,
1981
  "train_batch_size": 1,
1982
  "trial_name": null,
1983
  "trial_params": null
 
1
  {
2
+ "best_global_step": 260,
3
+ "best_metric": 0.7780888080596924,
4
+ "best_model_checkpoint": "/tmp/checkpoints_/job_bf4d9449-335c-4598-aae6-39588820e13b/checkpoint-260",
5
+ "epoch": 1.9168207024029575,
6
  "eval_steps": 10,
7
+ "global_step": 260,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
1958
  "eval_samples_per_second": 3.4,
1959
  "eval_steps_per_second": 0.884,
1960
  "step": 250
1961
+ },
1962
+ {
1963
+ "epoch": 1.8502772643253236,
1964
+ "grad_norm": 3.506394386291504,
1965
+ "learning_rate": 1.9602977667493796e-05,
1966
+ "loss": 0.759330153465271,
1967
+ "step": 251
1968
+ },
1969
+ {
1970
+ "epoch": 1.8576709796672828,
1971
+ "grad_norm": 4.319957256317139,
1972
+ "learning_rate": 1.947890818858561e-05,
1973
+ "loss": 0.9550069570541382,
1974
+ "step": 252
1975
+ },
1976
+ {
1977
+ "epoch": 1.865064695009242,
1978
+ "grad_norm": 4.66499662399292,
1979
+ "learning_rate": 1.935483870967742e-05,
1980
+ "loss": 0.7672110199928284,
1981
+ "step": 253
1982
+ },
1983
+ {
1984
+ "epoch": 1.8724584103512014,
1985
+ "grad_norm": 3.980341672897339,
1986
+ "learning_rate": 1.923076923076923e-05,
1987
+ "loss": 1.0426957607269287,
1988
+ "step": 254
1989
+ },
1990
+ {
1991
+ "epoch": 1.8798521256931608,
1992
+ "grad_norm": 2.3597588539123535,
1993
+ "learning_rate": 1.9106699751861042e-05,
1994
+ "loss": 0.5822687745094299,
1995
+ "step": 255
1996
+ },
1997
+ {
1998
+ "epoch": 1.8872458410351203,
1999
+ "grad_norm": 3.7864487171173096,
2000
+ "learning_rate": 1.8982630272952853e-05,
2001
+ "loss": 0.6077347993850708,
2002
+ "step": 256
2003
+ },
2004
+ {
2005
+ "epoch": 1.8946395563770795,
2006
+ "grad_norm": 2.9949333667755127,
2007
+ "learning_rate": 1.8858560794044667e-05,
2008
+ "loss": 0.5098516345024109,
2009
+ "step": 257
2010
+ },
2011
+ {
2012
+ "epoch": 1.9020332717190387,
2013
+ "grad_norm": 1.3919459581375122,
2014
+ "learning_rate": 1.8734491315136477e-05,
2015
+ "loss": 0.40490952134132385,
2016
+ "step": 258
2017
+ },
2018
+ {
2019
+ "epoch": 1.9094269870609981,
2020
+ "grad_norm": 3.4704983234405518,
2021
+ "learning_rate": 1.8610421836228288e-05,
2022
+ "loss": 0.4017954468727112,
2023
+ "step": 259
2024
+ },
2025
+ {
2026
+ "epoch": 1.9168207024029575,
2027
+ "grad_norm": 3.2767493724823,
2028
+ "learning_rate": 1.84863523573201e-05,
2029
+ "loss": 0.4063960611820221,
2030
+ "step": 260
2031
+ },
2032
+ {
2033
+ "epoch": 1.9168207024029575,
2034
+ "eval_loss": 0.7780888080596924,
2035
+ "eval_runtime": 14.5949,
2036
+ "eval_samples_per_second": 3.426,
2037
+ "eval_steps_per_second": 0.891,
2038
+ "step": 260
2039
  }
2040
  ],
2041
  "logging_steps": 1,
 
2055
  "attributes": {}
2056
  }
2057
  },
2058
+ "total_flos": 8365040721128448.0,
2059
  "train_batch_size": 1,
2060
  "trial_name": null,
2061
  "trial_params": null