Training in progress, step 12000, checkpoint
Browse files
last-checkpoint/model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 579824888
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:38983cc6baa199b78ad222dae4c477c4bd0c63e2458372366630348ee28383b5
|
| 3 |
size 579824888
|
last-checkpoint/optimizer.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1159794763
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:7fd8341a68b63315868b34bd0e54e5f6c54b4a66537f640753aed597e0d3b48d
|
| 3 |
size 1159794763
|
last-checkpoint/rng_state.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 14645
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4d31404d4c654929d8c8604a09997c74ec2ccd4b35e0d5562c9b8d160dc81e06
|
| 3 |
size 14645
|
last-checkpoint/scheduler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1465
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:51b5657716e2096af61b1cdab76b9fd3dc4ab393f10b4ad41400692973ae8e3f
|
| 3 |
size 1465
|
last-checkpoint/trainer_state.json
CHANGED
|
@@ -2,9 +2,9 @@
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
-
"epoch": 0.
|
| 6 |
"eval_steps": 1000,
|
| 7 |
-
"global_step":
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
@@ -798,6 +798,164 @@
|
|
| 798 |
"eval_samples_per_second": 307.239,
|
| 799 |
"eval_steps_per_second": 19.311,
|
| 800 |
"step": 10000
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 801 |
}
|
| 802 |
],
|
| 803 |
"logging_steps": 100,
|
|
@@ -817,7 +975,7 @@
|
|
| 817 |
"attributes": {}
|
| 818 |
}
|
| 819 |
},
|
| 820 |
-
"total_flos":
|
| 821 |
"train_batch_size": 120,
|
| 822 |
"trial_name": null,
|
| 823 |
"trial_params": null
|
|
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.24,
|
| 6 |
"eval_steps": 1000,
|
| 7 |
+
"global_step": 12000,
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
|
|
| 798 |
"eval_samples_per_second": 307.239,
|
| 799 |
"eval_steps_per_second": 19.311,
|
| 800 |
"step": 10000
|
| 801 |
+
},
|
| 802 |
+
{
|
| 803 |
+
"epoch": 0.202,
|
| 804 |
+
"grad_norm": 0.18158847093582153,
|
| 805 |
+
"learning_rate": 0.0009048970918589055,
|
| 806 |
+
"loss": 3.607147521972656,
|
| 807 |
+
"step": 10100
|
| 808 |
+
},
|
| 809 |
+
{
|
| 810 |
+
"epoch": 0.204,
|
| 811 |
+
"grad_norm": 0.15705344080924988,
|
| 812 |
+
"learning_rate": 0.0009030403007569094,
|
| 813 |
+
"loss": 3.5972610473632813,
|
| 814 |
+
"step": 10200
|
| 815 |
+
},
|
| 816 |
+
{
|
| 817 |
+
"epoch": 0.206,
|
| 818 |
+
"grad_norm": 0.18561947345733643,
|
| 819 |
+
"learning_rate": 0.0009011675024148955,
|
| 820 |
+
"loss": 3.5994192504882814,
|
| 821 |
+
"step": 10300
|
| 822 |
+
},
|
| 823 |
+
{
|
| 824 |
+
"epoch": 0.208,
|
| 825 |
+
"grad_norm": 0.17375363409519196,
|
| 826 |
+
"learning_rate": 0.0008992787712133476,
|
| 827 |
+
"loss": 3.592384948730469,
|
| 828 |
+
"step": 10400
|
| 829 |
+
},
|
| 830 |
+
{
|
| 831 |
+
"epoch": 0.21,
|
| 832 |
+
"grad_norm": 0.14704184234142303,
|
| 833 |
+
"learning_rate": 0.0008973741821655428,
|
| 834 |
+
"loss": 3.5763116455078126,
|
| 835 |
+
"step": 10500
|
| 836 |
+
},
|
| 837 |
+
{
|
| 838 |
+
"epoch": 0.212,
|
| 839 |
+
"grad_norm": 0.1663106381893158,
|
| 840 |
+
"learning_rate": 0.0008954538109145713,
|
| 841 |
+
"loss": 3.59366455078125,
|
| 842 |
+
"step": 10600
|
| 843 |
+
},
|
| 844 |
+
{
|
| 845 |
+
"epoch": 0.214,
|
| 846 |
+
"grad_norm": 0.15191592276096344,
|
| 847 |
+
"learning_rate": 0.0008935177337303337,
|
| 848 |
+
"loss": 3.5883197021484374,
|
| 849 |
+
"step": 10700
|
| 850 |
+
},
|
| 851 |
+
{
|
| 852 |
+
"epoch": 0.216,
|
| 853 |
+
"grad_norm": 0.15566915273666382,
|
| 854 |
+
"learning_rate": 0.0008915660275065107,
|
| 855 |
+
"loss": 3.5549887084960936,
|
| 856 |
+
"step": 10800
|
| 857 |
+
},
|
| 858 |
+
{
|
| 859 |
+
"epoch": 0.218,
|
| 860 |
+
"grad_norm": 0.17490389943122864,
|
| 861 |
+
"learning_rate": 0.0008895987697575093,
|
| 862 |
+
"loss": 3.558960266113281,
|
| 863 |
+
"step": 10900
|
| 864 |
+
},
|
| 865 |
+
{
|
| 866 |
+
"epoch": 0.22,
|
| 867 |
+
"grad_norm": 0.17277678847312927,
|
| 868 |
+
"learning_rate": 0.0008876160386153846,
|
| 869 |
+
"loss": 3.5671484375,
|
| 870 |
+
"step": 11000
|
| 871 |
+
},
|
| 872 |
+
{
|
| 873 |
+
"epoch": 0.22,
|
| 874 |
+
"eval_accuracy": 0.3558709927196726,
|
| 875 |
+
"eval_loss": 3.554290771484375,
|
| 876 |
+
"eval_runtime": 6.8937,
|
| 877 |
+
"eval_samples_per_second": 281.559,
|
| 878 |
+
"eval_steps_per_second": 17.697,
|
| 879 |
+
"step": 11000
|
| 880 |
+
},
|
| 881 |
+
{
|
| 882 |
+
"epoch": 0.222,
|
| 883 |
+
"grad_norm": 0.15808428823947906,
|
| 884 |
+
"learning_rate": 0.0008856179128267363,
|
| 885 |
+
"loss": 3.578575439453125,
|
| 886 |
+
"step": 11100
|
| 887 |
+
},
|
| 888 |
+
{
|
| 889 |
+
"epoch": 0.224,
|
| 890 |
+
"grad_norm": 0.14474111795425415,
|
| 891 |
+
"learning_rate": 0.0008836044717495819,
|
| 892 |
+
"loss": 3.5772747802734375,
|
| 893 |
+
"step": 11200
|
| 894 |
+
},
|
| 895 |
+
{
|
| 896 |
+
"epoch": 0.226,
|
| 897 |
+
"grad_norm": 0.1413886845111847,
|
| 898 |
+
"learning_rate": 0.0008815757953502035,
|
| 899 |
+
"loss": 3.556199645996094,
|
| 900 |
+
"step": 11300
|
| 901 |
+
},
|
| 902 |
+
{
|
| 903 |
+
"epoch": 0.228,
|
| 904 |
+
"grad_norm": 0.1502675712108612,
|
| 905 |
+
"learning_rate": 0.0008795319641999735,
|
| 906 |
+
"loss": 3.570118103027344,
|
| 907 |
+
"step": 11400
|
| 908 |
+
},
|
| 909 |
+
{
|
| 910 |
+
"epoch": 0.23,
|
| 911 |
+
"grad_norm": 0.1517445147037506,
|
| 912 |
+
"learning_rate": 0.0008774730594721534,
|
| 913 |
+
"loss": 3.5563198852539064,
|
| 914 |
+
"step": 11500
|
| 915 |
+
},
|
| 916 |
+
{
|
| 917 |
+
"epoch": 0.232,
|
| 918 |
+
"grad_norm": 0.16406166553497314,
|
| 919 |
+
"learning_rate": 0.0008753991629386706,
|
| 920 |
+
"loss": 3.5616604614257814,
|
| 921 |
+
"step": 11600
|
| 922 |
+
},
|
| 923 |
+
{
|
| 924 |
+
"epoch": 0.234,
|
| 925 |
+
"grad_norm": 0.14764074981212616,
|
| 926 |
+
"learning_rate": 0.0008733103569668701,
|
| 927 |
+
"loss": 3.5495458984375,
|
| 928 |
+
"step": 11700
|
| 929 |
+
},
|
| 930 |
+
{
|
| 931 |
+
"epoch": 0.236,
|
| 932 |
+
"grad_norm": 0.17058512568473816,
|
| 933 |
+
"learning_rate": 0.0008712067245162439,
|
| 934 |
+
"loss": 3.5244882202148435,
|
| 935 |
+
"step": 11800
|
| 936 |
+
},
|
| 937 |
+
{
|
| 938 |
+
"epoch": 0.238,
|
| 939 |
+
"grad_norm": 0.16127121448516846,
|
| 940 |
+
"learning_rate": 0.0008690883491351356,
|
| 941 |
+
"loss": 3.5396826171875,
|
| 942 |
+
"step": 11900
|
| 943 |
+
},
|
| 944 |
+
{
|
| 945 |
+
"epoch": 0.24,
|
| 946 |
+
"grad_norm": 0.14211590588092804,
|
| 947 |
+
"learning_rate": 0.0008669553149574224,
|
| 948 |
+
"loss": 3.522979431152344,
|
| 949 |
+
"step": 12000
|
| 950 |
+
},
|
| 951 |
+
{
|
| 952 |
+
"epoch": 0.24,
|
| 953 |
+
"eval_accuracy": 0.3578128166428224,
|
| 954 |
+
"eval_loss": 3.5307533740997314,
|
| 955 |
+
"eval_runtime": 6.6725,
|
| 956 |
+
"eval_samples_per_second": 290.897,
|
| 957 |
+
"eval_steps_per_second": 18.284,
|
| 958 |
+
"step": 12000
|
| 959 |
}
|
| 960 |
],
|
| 961 |
"logging_steps": 100,
|
|
|
|
| 975 |
"attributes": {}
|
| 976 |
}
|
| 977 |
},
|
| 978 |
+
"total_flos": 4.7039530401792e+17,
|
| 979 |
"train_batch_size": 120,
|
| 980 |
"trial_name": null,
|
| 981 |
"trial_params": null
|