Instructions to use inference-optimization/Kimi-K3-0.40B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use inference-optimization/Kimi-K3-0.40B with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("feature-extraction", model="inference-optimization/Kimi-K3-0.40B", trust_remote_code=True)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("inference-optimization/Kimi-K3-0.40B", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 500.0, | |
| "eval_steps": 500, | |
| "global_step": 1500, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.3333333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.001, | |
| "loss": 12.006645202636719, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 3.3333333333333335, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009955, | |
| "loss": 12.006645202636719, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 6.666666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009905, | |
| "loss": 12.006645202636719, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 10.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009855, | |
| "loss": 12.006645202636719, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 13.333333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009805, | |
| "loss": 12.006645202636719, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 16.666666666666668, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009755, | |
| "loss": 12.006645202636719, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 20.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009705, | |
| "loss": 12.006645202636719, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 23.333333333333332, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009655, | |
| "loss": 12.006645202636719, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 26.666666666666668, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009605000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 30.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009555000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 33.333333333333336, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009505000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 36.666666666666664, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009455, | |
| "loss": 12.006645202636719, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 40.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009405, | |
| "loss": 12.006645202636719, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 43.333333333333336, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009355, | |
| "loss": 12.006645202636719, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 46.666666666666664, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009305, | |
| "loss": 12.006645202636719, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 50.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009255, | |
| "loss": 12.006645202636719, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 53.333333333333336, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009205, | |
| "loss": 12.006645202636719, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 56.666666666666664, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009155, | |
| "loss": 12.006645202636719, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 60.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009105, | |
| "loss": 12.006645202636719, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 63.333333333333336, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009055, | |
| "loss": 12.006645202636719, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 66.66666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009004999999999999, | |
| "loss": 12.006645202636719, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 70.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008955, | |
| "loss": 12.006645202636719, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 73.33333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008905, | |
| "loss": 12.006645202636719, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 76.66666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008855, | |
| "loss": 12.006645202636719, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 80.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008805, | |
| "loss": 12.006645202636719, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 83.33333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008755, | |
| "loss": 12.006645202636719, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 86.66666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008705000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 90.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008655000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 93.33333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008605, | |
| "loss": 12.006645202636719, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 96.66666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008555, | |
| "loss": 12.006645202636719, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 100.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008505, | |
| "loss": 12.006645202636719, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 103.33333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008455, | |
| "loss": 12.006645202636719, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 106.66666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008405, | |
| "loss": 12.006645202636719, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 110.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008355000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 113.33333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008305000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 116.66666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008255000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 120.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008205, | |
| "loss": 12.006645202636719, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 123.33333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008155, | |
| "loss": 12.006645202636719, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 126.66666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008105, | |
| "loss": 12.006645202636719, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 130.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008055, | |
| "loss": 12.006645202636719, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 133.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008005, | |
| "loss": 12.006645202636719, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 136.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007955, | |
| "loss": 12.006645202636719, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 140.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007905, | |
| "loss": 12.006645202636719, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 143.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007855, | |
| "loss": 12.006645202636719, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 146.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007804999999999999, | |
| "loss": 12.006645202636719, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 150.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007754999999999999, | |
| "loss": 12.006645202636719, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 153.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007705, | |
| "loss": 12.006645202636719, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 156.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007655, | |
| "loss": 12.006645202636719, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 160.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007605, | |
| "loss": 12.006645202636719, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 163.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007555, | |
| "loss": 12.006645202636719, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 166.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007505, | |
| "loss": 12.006645202636719, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 170.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007455000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 173.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007405000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 176.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007355, | |
| "loss": 12.006645202636719, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 180.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007305, | |
| "loss": 12.006645202636719, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 183.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007255, | |
| "loss": 12.006645202636719, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 186.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007205, | |
| "loss": 12.006645202636719, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 190.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007155, | |
| "loss": 12.006645202636719, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 193.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007105000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 196.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007055000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 200.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007005000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 203.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006955, | |
| "loss": 12.006645202636719, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 206.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006905, | |
| "loss": 12.006645202636719, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 210.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006855, | |
| "loss": 12.006645202636719, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 213.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006805, | |
| "loss": 12.006645202636719, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 216.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006755, | |
| "loss": 12.006645202636719, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 220.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006705, | |
| "loss": 12.006645202636719, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 223.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006655, | |
| "loss": 12.006645202636719, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 226.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006605, | |
| "loss": 12.006645202636719, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 230.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006554999999999999, | |
| "loss": 12.006645202636719, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 233.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006504999999999999, | |
| "loss": 12.006645202636719, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 236.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006455, | |
| "loss": 12.006645202636719, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 240.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006405, | |
| "loss": 12.006645202636719, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 243.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006355, | |
| "loss": 12.006645202636719, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 246.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006305, | |
| "loss": 12.006645202636719, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 250.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006255, | |
| "loss": 12.006645202636719, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 253.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006205000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 256.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006155, | |
| "loss": 12.006645202636719, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 260.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006105, | |
| "loss": 12.006645202636719, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 263.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006055, | |
| "loss": 12.006645202636719, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 266.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006005, | |
| "loss": 12.006645202636719, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 270.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005955, | |
| "loss": 12.006645202636719, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 273.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005905, | |
| "loss": 12.006645202636719, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 276.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005855000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 280.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005805000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 283.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005755000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 286.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005705, | |
| "loss": 12.006645202636719, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 290.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005655, | |
| "loss": 12.006645202636719, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 293.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005605, | |
| "loss": 12.006645202636719, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 296.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005555, | |
| "loss": 12.006645202636719, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 300.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005505, | |
| "loss": 12.006645202636719, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 303.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005455, | |
| "loss": 12.006645202636719, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 306.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005405, | |
| "loss": 12.006645202636719, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 310.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005355, | |
| "loss": 12.006645202636719, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 313.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005304999999999999, | |
| "loss": 12.006645202636719, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 316.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005254999999999999, | |
| "loss": 12.006645202636719, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 320.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005205, | |
| "loss": 12.006645202636719, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 323.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005155, | |
| "loss": 12.006645202636719, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 326.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005105, | |
| "loss": 12.006645202636719, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 330.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005055, | |
| "loss": 12.006645202636719, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 333.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005005, | |
| "loss": 12.006645202636719, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 336.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0004955, | |
| "loss": 12.006645202636719, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 340.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0004905, | |
| "loss": 12.006645202636719, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 343.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0004855, | |
| "loss": 12.006645202636719, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 346.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00048049999999999997, | |
| "loss": 12.006645202636719, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 350.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0004755, | |
| "loss": 12.006645202636719, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 353.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0004705, | |
| "loss": 12.006645202636719, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 356.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00046550000000000004, | |
| "loss": 12.006645202636719, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 360.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0004605, | |
| "loss": 12.006645202636719, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 363.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0004555, | |
| "loss": 12.006645202636719, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 366.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0004505, | |
| "loss": 12.006645202636719, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 370.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00044550000000000004, | |
| "loss": 12.006645202636719, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 373.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00044050000000000003, | |
| "loss": 12.006645202636719, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 376.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0004355, | |
| "loss": 12.006645202636719, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 380.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0004305, | |
| "loss": 12.006645202636719, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 383.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0004255, | |
| "loss": 12.006645202636719, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 386.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0004205, | |
| "loss": 12.006645202636719, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 390.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00041549999999999996, | |
| "loss": 12.006645202636719, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 393.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0004105, | |
| "loss": 12.006645202636719, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 396.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00040550000000000004, | |
| "loss": 12.006645202636719, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 400.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00040050000000000003, | |
| "loss": 12.006645202636719, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 403.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0003955, | |
| "loss": 12.006645202636719, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 406.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0003905, | |
| "loss": 12.006645202636719, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 410.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0003855, | |
| "loss": 12.006645202636719, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 413.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00038050000000000003, | |
| "loss": 12.006645202636719, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 416.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0003755, | |
| "loss": 12.006645202636719, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 420.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0003705, | |
| "loss": 12.006645202636719, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 423.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0003655, | |
| "loss": 12.006645202636719, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 426.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0003605, | |
| "loss": 12.006645202636719, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 430.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00035549999999999997, | |
| "loss": 12.006645202636719, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 433.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0003505, | |
| "loss": 12.006645202636719, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 436.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0003455, | |
| "loss": 12.006645202636719, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 440.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00034050000000000004, | |
| "loss": 12.006645202636719, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 443.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0003355, | |
| "loss": 12.006645202636719, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 446.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0003305, | |
| "loss": 12.006645202636719, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 450.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0003255, | |
| "loss": 12.006645202636719, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 453.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00032050000000000004, | |
| "loss": 12.006645202636719, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 456.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0003155, | |
| "loss": 12.006645202636719, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 460.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0003105, | |
| "loss": 12.006645202636719, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 463.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0003055, | |
| "loss": 12.006645202636719, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 466.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0003005, | |
| "loss": 12.006645202636719, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 470.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00029549999999999997, | |
| "loss": 12.006645202636719, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 473.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00029049999999999996, | |
| "loss": 12.006645202636719, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 476.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002855, | |
| "loss": 12.006645202636719, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 480.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028050000000000004, | |
| "loss": 12.006645202636719, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 483.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027550000000000003, | |
| "loss": 12.006645202636719, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 486.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002705, | |
| "loss": 12.006645202636719, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 490.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002655, | |
| "loss": 12.006645202636719, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 493.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002605, | |
| "loss": 12.006645202636719, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 496.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00025550000000000003, | |
| "loss": 12.006645202636719, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 500.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002505, | |
| "loss": 12.006645202636719, | |
| "step": 1500 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 2000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 667, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 874733721600000.0, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |