Instructions to use inference-optimization/Kimi-K3-0.40B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use inference-optimization/Kimi-K3-0.40B with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("feature-extraction", model="inference-optimization/Kimi-K3-0.40B", trust_remote_code=True)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("inference-optimization/Kimi-K3-0.40B", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 333.3333333333333, | |
| "eval_steps": 500, | |
| "global_step": 1000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.3333333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.001, | |
| "loss": 12.006645202636719, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 3.3333333333333335, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009955, | |
| "loss": 12.006645202636719, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 6.666666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009905, | |
| "loss": 12.006645202636719, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 10.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009855, | |
| "loss": 12.006645202636719, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 13.333333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009805, | |
| "loss": 12.006645202636719, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 16.666666666666668, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009755, | |
| "loss": 12.006645202636719, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 20.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009705, | |
| "loss": 12.006645202636719, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 23.333333333333332, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009655, | |
| "loss": 12.006645202636719, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 26.666666666666668, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009605000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 30.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009555000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 33.333333333333336, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009505000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 36.666666666666664, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009455, | |
| "loss": 12.006645202636719, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 40.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009405, | |
| "loss": 12.006645202636719, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 43.333333333333336, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009355, | |
| "loss": 12.006645202636719, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 46.666666666666664, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009305, | |
| "loss": 12.006645202636719, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 50.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009255, | |
| "loss": 12.006645202636719, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 53.333333333333336, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009205, | |
| "loss": 12.006645202636719, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 56.666666666666664, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009155, | |
| "loss": 12.006645202636719, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 60.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009105, | |
| "loss": 12.006645202636719, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 63.333333333333336, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009055, | |
| "loss": 12.006645202636719, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 66.66666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0009004999999999999, | |
| "loss": 12.006645202636719, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 70.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008955, | |
| "loss": 12.006645202636719, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 73.33333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008905, | |
| "loss": 12.006645202636719, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 76.66666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008855, | |
| "loss": 12.006645202636719, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 80.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008805, | |
| "loss": 12.006645202636719, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 83.33333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008755, | |
| "loss": 12.006645202636719, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 86.66666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008705000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 90.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008655000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 93.33333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008605, | |
| "loss": 12.006645202636719, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 96.66666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008555, | |
| "loss": 12.006645202636719, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 100.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008505, | |
| "loss": 12.006645202636719, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 103.33333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008455, | |
| "loss": 12.006645202636719, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 106.66666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008405, | |
| "loss": 12.006645202636719, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 110.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008355000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 113.33333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008305000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 116.66666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008255000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 120.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008205, | |
| "loss": 12.006645202636719, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 123.33333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008155, | |
| "loss": 12.006645202636719, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 126.66666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008105, | |
| "loss": 12.006645202636719, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 130.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008055, | |
| "loss": 12.006645202636719, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 133.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0008005, | |
| "loss": 12.006645202636719, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 136.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007955, | |
| "loss": 12.006645202636719, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 140.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007905, | |
| "loss": 12.006645202636719, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 143.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007855, | |
| "loss": 12.006645202636719, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 146.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007804999999999999, | |
| "loss": 12.006645202636719, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 150.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007754999999999999, | |
| "loss": 12.006645202636719, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 153.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007705, | |
| "loss": 12.006645202636719, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 156.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007655, | |
| "loss": 12.006645202636719, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 160.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007605, | |
| "loss": 12.006645202636719, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 163.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007555, | |
| "loss": 12.006645202636719, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 166.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007505, | |
| "loss": 12.006645202636719, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 170.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007455000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 173.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007405000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 176.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007355, | |
| "loss": 12.006645202636719, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 180.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007305, | |
| "loss": 12.006645202636719, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 183.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007255, | |
| "loss": 12.006645202636719, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 186.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007205, | |
| "loss": 12.006645202636719, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 190.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007155, | |
| "loss": 12.006645202636719, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 193.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007105000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 196.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007055000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 200.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0007005000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 203.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006955, | |
| "loss": 12.006645202636719, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 206.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006905, | |
| "loss": 12.006645202636719, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 210.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006855, | |
| "loss": 12.006645202636719, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 213.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006805, | |
| "loss": 12.006645202636719, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 216.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006755, | |
| "loss": 12.006645202636719, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 220.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006705, | |
| "loss": 12.006645202636719, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 223.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006655, | |
| "loss": 12.006645202636719, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 226.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006605, | |
| "loss": 12.006645202636719, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 230.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006554999999999999, | |
| "loss": 12.006645202636719, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 233.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006504999999999999, | |
| "loss": 12.006645202636719, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 236.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006455, | |
| "loss": 12.006645202636719, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 240.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006405, | |
| "loss": 12.006645202636719, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 243.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006355, | |
| "loss": 12.006645202636719, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 246.66666666666666, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006305, | |
| "loss": 12.006645202636719, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 250.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006255, | |
| "loss": 12.006645202636719, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 253.33333333333334, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006205000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 256.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006155, | |
| "loss": 12.006645202636719, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 260.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006105, | |
| "loss": 12.006645202636719, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 263.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006055, | |
| "loss": 12.006645202636719, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 266.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0006005, | |
| "loss": 12.006645202636719, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 270.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005955, | |
| "loss": 12.006645202636719, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 273.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005905, | |
| "loss": 12.006645202636719, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 276.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005855000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 280.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005805000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 283.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005755000000000001, | |
| "loss": 12.006645202636719, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 286.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005705, | |
| "loss": 12.006645202636719, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 290.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005655, | |
| "loss": 12.006645202636719, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 293.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005605, | |
| "loss": 12.006645202636719, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 296.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005555, | |
| "loss": 12.006645202636719, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 300.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005505, | |
| "loss": 12.006645202636719, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 303.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005455, | |
| "loss": 12.006645202636719, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 306.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005405, | |
| "loss": 12.006645202636719, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 310.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005355, | |
| "loss": 12.006645202636719, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 313.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005304999999999999, | |
| "loss": 12.006645202636719, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 316.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005254999999999999, | |
| "loss": 12.006645202636719, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 320.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005205, | |
| "loss": 12.006645202636719, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 323.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005155, | |
| "loss": 12.006645202636719, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 326.6666666666667, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005105, | |
| "loss": 12.006645202636719, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 330.0, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005055, | |
| "loss": 12.006645202636719, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 333.3333333333333, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0005005, | |
| "loss": 12.006645202636719, | |
| "step": 1000 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 2000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 667, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 583272445562880.0, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |