Training in progress, step 10000, checkpoint
Browse files
last-checkpoint/model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 4523108832
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:1df18a4aec9d3abf4f510ecab2cb8c7518e9ba7bd3e25d996b3161de01cf276a
|
| 3 |
size 4523108832
|
last-checkpoint/optimizer.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 2912179275
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:47d979b442d673cdbb05a40a587e0662655b1f2e124adba979944ec598c3e143
|
| 3 |
size 2912179275
|
last-checkpoint/rng_state.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 14645
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f0f228bc9d37c157100b0d778f23b620c8b5988daf96ff0ee904bc425b8369fe
|
| 3 |
size 14645
|
last-checkpoint/scaler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1383
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:98a4a7b37f5cde47c1e6ef8c45c8be72b8145f8a1fa693c82f737ca4d6544179
|
| 3 |
size 1383
|
last-checkpoint/scheduler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1465
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:cdd3530189ae6fa9c161e0b25ed625427bf22843ba1712b5853be76852883ddb
|
| 3 |
size 1465
|
last-checkpoint/trainer_state.json
CHANGED
|
@@ -2,9 +2,9 @@
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
-
"epoch":
|
| 6 |
"eval_steps": 500,
|
| 7 |
-
"global_step":
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
@@ -6658,6 +6658,356 @@
|
|
| 6658 |
"learning_rate": 1.004e-05,
|
| 6659 |
"loss": 0.014750830829143524,
|
| 6660 |
"step": 9500
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 6661 |
}
|
| 6662 |
],
|
| 6663 |
"logging_steps": 10,
|
|
@@ -6672,12 +7022,12 @@
|
|
| 6672 |
"should_evaluate": false,
|
| 6673 |
"should_log": false,
|
| 6674 |
"should_save": true,
|
| 6675 |
-
"should_training_stop":
|
| 6676 |
},
|
| 6677 |
"attributes": {}
|
| 6678 |
}
|
| 6679 |
},
|
| 6680 |
-
"total_flos": 8.
|
| 6681 |
"train_batch_size": 1,
|
| 6682 |
"trial_name": null,
|
| 6683 |
"trial_params": null
|
|
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 2.0188,
|
| 6 |
"eval_steps": 500,
|
| 7 |
+
"global_step": 10000,
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
|
|
| 6658 |
"learning_rate": 1.004e-05,
|
| 6659 |
"loss": 0.014750830829143524,
|
| 6660 |
"step": 9500
|
| 6661 |
+
},
|
| 6662 |
+
{
|
| 6663 |
+
"epoch": 1.001,
|
| 6664 |
+
"grad_norm": 0.09777779877185822,
|
| 6665 |
+
"learning_rate": 9.84e-06,
|
| 6666 |
+
"loss": 0.025202512741088867,
|
| 6667 |
+
"step": 9510
|
| 6668 |
+
},
|
| 6669 |
+
{
|
| 6670 |
+
"epoch": 1.002,
|
| 6671 |
+
"grad_norm": 0.08488325029611588,
|
| 6672 |
+
"learning_rate": 9.640000000000001e-06,
|
| 6673 |
+
"loss": 0.017650887370109558,
|
| 6674 |
+
"step": 9520
|
| 6675 |
+
},
|
| 6676 |
+
{
|
| 6677 |
+
"epoch": 1.003,
|
| 6678 |
+
"grad_norm": 0.05732690170407295,
|
| 6679 |
+
"learning_rate": 9.44e-06,
|
| 6680 |
+
"loss": 0.01551215648651123,
|
| 6681 |
+
"step": 9530
|
| 6682 |
+
},
|
| 6683 |
+
{
|
| 6684 |
+
"epoch": 1.004,
|
| 6685 |
+
"grad_norm": 0.0768381655216217,
|
| 6686 |
+
"learning_rate": 9.24e-06,
|
| 6687 |
+
"loss": 0.015778852999210356,
|
| 6688 |
+
"step": 9540
|
| 6689 |
+
},
|
| 6690 |
+
{
|
| 6691 |
+
"epoch": 1.005,
|
| 6692 |
+
"grad_norm": 0.06292874366044998,
|
| 6693 |
+
"learning_rate": 9.04e-06,
|
| 6694 |
+
"loss": 0.015921856462955474,
|
| 6695 |
+
"step": 9550
|
| 6696 |
+
},
|
| 6697 |
+
{
|
| 6698 |
+
"epoch": 1.006,
|
| 6699 |
+
"grad_norm": 0.05529346317052841,
|
| 6700 |
+
"learning_rate": 8.840000000000002e-06,
|
| 6701 |
+
"loss": 0.016185162961483,
|
| 6702 |
+
"step": 9560
|
| 6703 |
+
},
|
| 6704 |
+
{
|
| 6705 |
+
"epoch": 1.007,
|
| 6706 |
+
"grad_norm": 0.07324839383363724,
|
| 6707 |
+
"learning_rate": 8.64e-06,
|
| 6708 |
+
"loss": 0.014256039261817932,
|
| 6709 |
+
"step": 9570
|
| 6710 |
+
},
|
| 6711 |
+
{
|
| 6712 |
+
"epoch": 1.008,
|
| 6713 |
+
"grad_norm": 0.07430668920278549,
|
| 6714 |
+
"learning_rate": 8.44e-06,
|
| 6715 |
+
"loss": 0.01393248736858368,
|
| 6716 |
+
"step": 9580
|
| 6717 |
+
},
|
| 6718 |
+
{
|
| 6719 |
+
"epoch": 1.009,
|
| 6720 |
+
"grad_norm": 0.05947092920541763,
|
| 6721 |
+
"learning_rate": 8.24e-06,
|
| 6722 |
+
"loss": 0.014715026319026946,
|
| 6723 |
+
"step": 9590
|
| 6724 |
+
},
|
| 6725 |
+
{
|
| 6726 |
+
"epoch": 1.01,
|
| 6727 |
+
"grad_norm": 0.05222109332680702,
|
| 6728 |
+
"learning_rate": 8.040000000000001e-06,
|
| 6729 |
+
"loss": 0.014007921516895293,
|
| 6730 |
+
"step": 9600
|
| 6731 |
+
},
|
| 6732 |
+
{
|
| 6733 |
+
"epoch": 1.011,
|
| 6734 |
+
"grad_norm": 0.06184246763586998,
|
| 6735 |
+
"learning_rate": 7.84e-06,
|
| 6736 |
+
"loss": 0.014500398933887482,
|
| 6737 |
+
"step": 9610
|
| 6738 |
+
},
|
| 6739 |
+
{
|
| 6740 |
+
"epoch": 1.012,
|
| 6741 |
+
"grad_norm": 0.06747237592935562,
|
| 6742 |
+
"learning_rate": 7.64e-06,
|
| 6743 |
+
"loss": 0.014911913871765136,
|
| 6744 |
+
"step": 9620
|
| 6745 |
+
},
|
| 6746 |
+
{
|
| 6747 |
+
"epoch": 1.013,
|
| 6748 |
+
"grad_norm": 0.07077904045581818,
|
| 6749 |
+
"learning_rate": 7.44e-06,
|
| 6750 |
+
"loss": 0.01411098539829254,
|
| 6751 |
+
"step": 9630
|
| 6752 |
+
},
|
| 6753 |
+
{
|
| 6754 |
+
"epoch": 1.014,
|
| 6755 |
+
"grad_norm": 0.07017918676137924,
|
| 6756 |
+
"learning_rate": 7.240000000000001e-06,
|
| 6757 |
+
"loss": 0.013570456206798554,
|
| 6758 |
+
"step": 9640
|
| 6759 |
+
},
|
| 6760 |
+
{
|
| 6761 |
+
"epoch": 1.015,
|
| 6762 |
+
"grad_norm": 0.08114173263311386,
|
| 6763 |
+
"learning_rate": 7.04e-06,
|
| 6764 |
+
"loss": 0.013726058602333068,
|
| 6765 |
+
"step": 9650
|
| 6766 |
+
},
|
| 6767 |
+
{
|
| 6768 |
+
"epoch": 1.016,
|
| 6769 |
+
"grad_norm": 0.07676446437835693,
|
| 6770 |
+
"learning_rate": 6.840000000000001e-06,
|
| 6771 |
+
"loss": 0.016030623018741606,
|
| 6772 |
+
"step": 9660
|
| 6773 |
+
},
|
| 6774 |
+
{
|
| 6775 |
+
"epoch": 1.017,
|
| 6776 |
+
"grad_norm": 0.05721115320920944,
|
| 6777 |
+
"learning_rate": 6.640000000000001e-06,
|
| 6778 |
+
"loss": 0.014686207473278045,
|
| 6779 |
+
"step": 9670
|
| 6780 |
+
},
|
| 6781 |
+
{
|
| 6782 |
+
"epoch": 1.018,
|
| 6783 |
+
"grad_norm": 0.08408799022436142,
|
| 6784 |
+
"learning_rate": 6.44e-06,
|
| 6785 |
+
"loss": 0.015205322206020356,
|
| 6786 |
+
"step": 9680
|
| 6787 |
+
},
|
| 6788 |
+
{
|
| 6789 |
+
"epoch": 1.019,
|
| 6790 |
+
"grad_norm": 0.08085671067237854,
|
| 6791 |
+
"learning_rate": 6.24e-06,
|
| 6792 |
+
"loss": 0.01706176847219467,
|
| 6793 |
+
"step": 9690
|
| 6794 |
+
},
|
| 6795 |
+
{
|
| 6796 |
+
"epoch": 1.02,
|
| 6797 |
+
"grad_norm": 0.09435422718524933,
|
| 6798 |
+
"learning_rate": 6.040000000000001e-06,
|
| 6799 |
+
"loss": 0.017468377947807312,
|
| 6800 |
+
"step": 9700
|
| 6801 |
+
},
|
| 6802 |
+
{
|
| 6803 |
+
"epoch": 1.021,
|
| 6804 |
+
"grad_norm": 0.0752953365445137,
|
| 6805 |
+
"learning_rate": 5.84e-06,
|
| 6806 |
+
"loss": 0.0176930233836174,
|
| 6807 |
+
"step": 9710
|
| 6808 |
+
},
|
| 6809 |
+
{
|
| 6810 |
+
"epoch": 1.022,
|
| 6811 |
+
"grad_norm": 0.07494309544563293,
|
| 6812 |
+
"learning_rate": 5.64e-06,
|
| 6813 |
+
"loss": 0.016850067675113677,
|
| 6814 |
+
"step": 9720
|
| 6815 |
+
},
|
| 6816 |
+
{
|
| 6817 |
+
"epoch": 1.023,
|
| 6818 |
+
"grad_norm": 0.08355386555194855,
|
| 6819 |
+
"learning_rate": 5.44e-06,
|
| 6820 |
+
"loss": 0.015157189965248109,
|
| 6821 |
+
"step": 9730
|
| 6822 |
+
},
|
| 6823 |
+
{
|
| 6824 |
+
"epoch": 1.024,
|
| 6825 |
+
"grad_norm": 0.08324045687913895,
|
| 6826 |
+
"learning_rate": 5.240000000000001e-06,
|
| 6827 |
+
"loss": 0.015080301463603974,
|
| 6828 |
+
"step": 9740
|
| 6829 |
+
},
|
| 6830 |
+
{
|
| 6831 |
+
"epoch": 1.025,
|
| 6832 |
+
"grad_norm": 0.07760655134916306,
|
| 6833 |
+
"learning_rate": 5.04e-06,
|
| 6834 |
+
"loss": 0.01745104193687439,
|
| 6835 |
+
"step": 9750
|
| 6836 |
+
},
|
| 6837 |
+
{
|
| 6838 |
+
"epoch": 1.026,
|
| 6839 |
+
"grad_norm": 0.08728311955928802,
|
| 6840 |
+
"learning_rate": 4.84e-06,
|
| 6841 |
+
"loss": 0.01614951491355896,
|
| 6842 |
+
"step": 9760
|
| 6843 |
+
},
|
| 6844 |
+
{
|
| 6845 |
+
"epoch": 1.027,
|
| 6846 |
+
"grad_norm": 0.08304473012685776,
|
| 6847 |
+
"learning_rate": 4.64e-06,
|
| 6848 |
+
"loss": 0.01723228096961975,
|
| 6849 |
+
"step": 9770
|
| 6850 |
+
},
|
| 6851 |
+
{
|
| 6852 |
+
"epoch": 1.028,
|
| 6853 |
+
"grad_norm": 0.0646970123052597,
|
| 6854 |
+
"learning_rate": 4.440000000000001e-06,
|
| 6855 |
+
"loss": 0.01564721018075943,
|
| 6856 |
+
"step": 9780
|
| 6857 |
+
},
|
| 6858 |
+
{
|
| 6859 |
+
"epoch": 1.029,
|
| 6860 |
+
"grad_norm": 0.11390984058380127,
|
| 6861 |
+
"learning_rate": 4.24e-06,
|
| 6862 |
+
"loss": 0.01521741896867752,
|
| 6863 |
+
"step": 9790
|
| 6864 |
+
},
|
| 6865 |
+
{
|
| 6866 |
+
"epoch": 1.03,
|
| 6867 |
+
"grad_norm": 0.08274708688259125,
|
| 6868 |
+
"learning_rate": 4.04e-06,
|
| 6869 |
+
"loss": 0.015826791524887085,
|
| 6870 |
+
"step": 9800
|
| 6871 |
+
},
|
| 6872 |
+
{
|
| 6873 |
+
"epoch": 1.031,
|
| 6874 |
+
"grad_norm": 0.07968990504741669,
|
| 6875 |
+
"learning_rate": 3.84e-06,
|
| 6876 |
+
"loss": 0.016426579654216768,
|
| 6877 |
+
"step": 9810
|
| 6878 |
+
},
|
| 6879 |
+
{
|
| 6880 |
+
"epoch": 2.0008,
|
| 6881 |
+
"grad_norm": 0.06300608068704605,
|
| 6882 |
+
"learning_rate": 3.6400000000000003e-06,
|
| 6883 |
+
"loss": 0.015782804787158967,
|
| 6884 |
+
"step": 9820
|
| 6885 |
+
},
|
| 6886 |
+
{
|
| 6887 |
+
"epoch": 2.0018,
|
| 6888 |
+
"grad_norm": 0.08467205613851547,
|
| 6889 |
+
"learning_rate": 3.44e-06,
|
| 6890 |
+
"loss": 0.014097627997398377,
|
| 6891 |
+
"step": 9830
|
| 6892 |
+
},
|
| 6893 |
+
{
|
| 6894 |
+
"epoch": 2.0028,
|
| 6895 |
+
"grad_norm": 0.09556452929973602,
|
| 6896 |
+
"learning_rate": 3.24e-06,
|
| 6897 |
+
"loss": 0.01549130529165268,
|
| 6898 |
+
"step": 9840
|
| 6899 |
+
},
|
| 6900 |
+
{
|
| 6901 |
+
"epoch": 2.0038,
|
| 6902 |
+
"grad_norm": 0.07436936348676682,
|
| 6903 |
+
"learning_rate": 3.04e-06,
|
| 6904 |
+
"loss": 0.015328900516033172,
|
| 6905 |
+
"step": 9850
|
| 6906 |
+
},
|
| 6907 |
+
{
|
| 6908 |
+
"epoch": 2.0048,
|
| 6909 |
+
"grad_norm": 0.07495304942131042,
|
| 6910 |
+
"learning_rate": 2.8400000000000003e-06,
|
| 6911 |
+
"loss": 0.015208512544631958,
|
| 6912 |
+
"step": 9860
|
| 6913 |
+
},
|
| 6914 |
+
{
|
| 6915 |
+
"epoch": 2.0058,
|
| 6916 |
+
"grad_norm": 0.10458475351333618,
|
| 6917 |
+
"learning_rate": 2.64e-06,
|
| 6918 |
+
"loss": 0.015952044725418092,
|
| 6919 |
+
"step": 9870
|
| 6920 |
+
},
|
| 6921 |
+
{
|
| 6922 |
+
"epoch": 2.0068,
|
| 6923 |
+
"grad_norm": 0.13968482613563538,
|
| 6924 |
+
"learning_rate": 2.4400000000000004e-06,
|
| 6925 |
+
"loss": 0.015596236288547515,
|
| 6926 |
+
"step": 9880
|
| 6927 |
+
},
|
| 6928 |
+
{
|
| 6929 |
+
"epoch": 2.0078,
|
| 6930 |
+
"grad_norm": 0.09523583203554153,
|
| 6931 |
+
"learning_rate": 2.24e-06,
|
| 6932 |
+
"loss": 0.014299987256526947,
|
| 6933 |
+
"step": 9890
|
| 6934 |
+
},
|
| 6935 |
+
{
|
| 6936 |
+
"epoch": 2.0088,
|
| 6937 |
+
"grad_norm": 0.08944617211818695,
|
| 6938 |
+
"learning_rate": 2.0400000000000004e-06,
|
| 6939 |
+
"loss": 0.014749652147293091,
|
| 6940 |
+
"step": 9900
|
| 6941 |
+
},
|
| 6942 |
+
{
|
| 6943 |
+
"epoch": 2.0098,
|
| 6944 |
+
"grad_norm": 0.27204543352127075,
|
| 6945 |
+
"learning_rate": 1.84e-06,
|
| 6946 |
+
"loss": 0.013910163938999177,
|
| 6947 |
+
"step": 9910
|
| 6948 |
+
},
|
| 6949 |
+
{
|
| 6950 |
+
"epoch": 2.0108,
|
| 6951 |
+
"grad_norm": 0.3379315137863159,
|
| 6952 |
+
"learning_rate": 1.6400000000000002e-06,
|
| 6953 |
+
"loss": 0.015016606450080872,
|
| 6954 |
+
"step": 9920
|
| 6955 |
+
},
|
| 6956 |
+
{
|
| 6957 |
+
"epoch": 2.0118,
|
| 6958 |
+
"grad_norm": 0.10731206089258194,
|
| 6959 |
+
"learning_rate": 1.44e-06,
|
| 6960 |
+
"loss": 0.016171526908874512,
|
| 6961 |
+
"step": 9930
|
| 6962 |
+
},
|
| 6963 |
+
{
|
| 6964 |
+
"epoch": 2.0128,
|
| 6965 |
+
"grad_norm": 0.15397508442401886,
|
| 6966 |
+
"learning_rate": 1.24e-06,
|
| 6967 |
+
"loss": 0.01619943231344223,
|
| 6968 |
+
"step": 9940
|
| 6969 |
+
},
|
| 6970 |
+
{
|
| 6971 |
+
"epoch": 2.0138,
|
| 6972 |
+
"grad_norm": 0.07552789896726608,
|
| 6973 |
+
"learning_rate": 1.04e-06,
|
| 6974 |
+
"loss": 0.015332949161529542,
|
| 6975 |
+
"step": 9950
|
| 6976 |
+
},
|
| 6977 |
+
{
|
| 6978 |
+
"epoch": 2.0148,
|
| 6979 |
+
"grad_norm": 0.13802768290042877,
|
| 6980 |
+
"learning_rate": 8.4e-07,
|
| 6981 |
+
"loss": 0.0159247025847435,
|
| 6982 |
+
"step": 9960
|
| 6983 |
+
},
|
| 6984 |
+
{
|
| 6985 |
+
"epoch": 2.0158,
|
| 6986 |
+
"grad_norm": 0.18125946819782257,
|
| 6987 |
+
"learning_rate": 6.4e-07,
|
| 6988 |
+
"loss": 0.01946225166320801,
|
| 6989 |
+
"step": 9970
|
| 6990 |
+
},
|
| 6991 |
+
{
|
| 6992 |
+
"epoch": 2.0168,
|
| 6993 |
+
"grad_norm": 0.1346278339624405,
|
| 6994 |
+
"learning_rate": 4.4e-07,
|
| 6995 |
+
"loss": 0.019359566271305084,
|
| 6996 |
+
"step": 9980
|
| 6997 |
+
},
|
| 6998 |
+
{
|
| 6999 |
+
"epoch": 2.0178,
|
| 7000 |
+
"grad_norm": 0.11318124085664749,
|
| 7001 |
+
"learning_rate": 2.4e-07,
|
| 7002 |
+
"loss": 0.022229455411434174,
|
| 7003 |
+
"step": 9990
|
| 7004 |
+
},
|
| 7005 |
+
{
|
| 7006 |
+
"epoch": 2.0188,
|
| 7007 |
+
"grad_norm": 0.13011205196380615,
|
| 7008 |
+
"learning_rate": 4e-08,
|
| 7009 |
+
"loss": 0.025185179710388184,
|
| 7010 |
+
"step": 10000
|
| 7011 |
}
|
| 7012 |
],
|
| 7013 |
"logging_steps": 10,
|
|
|
|
| 7022 |
"should_evaluate": false,
|
| 7023 |
"should_log": false,
|
| 7024 |
"should_save": true,
|
| 7025 |
+
"should_training_stop": true
|
| 7026 |
},
|
| 7027 |
"attributes": {}
|
| 7028 |
}
|
| 7029 |
},
|
| 7030 |
+
"total_flos": 8.465117552687677e+17,
|
| 7031 |
"train_batch_size": 1,
|
| 7032 |
"trial_name": null,
|
| 7033 |
"trial_params": null
|