CodeIsAbstract commited on
Commit
4dd07fb
·
verified ·
1 Parent(s): c98c58e

Training in progress, step 1500, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b7da8882c4eba065851f3d33946d222f14c2f723a8e4b466de1f227567d55531
3
  size 579748776
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:badfbe39f8402d520d6a259ad2deb9dd7e1f6dfb6b9e1a7169877f5ecc01c510
3
  size 579748776
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3dc6db80c72368f3c3b7f1bca017a3f8af377e6e79bfb95dfa6de9e3819b27d4
3
  size 1159627083
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4613374d2023ed2b9eeed79a32ef746ff946c02062fd7d42e828096eaa259890
3
  size 1159627083
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a4d8242b37901ec7cc0992b7a6173ea32c89632c26198ca917c21035a4c247c4
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:71ed970edcf023c3a09dae82375e820aadbfb7a0861253f35a94fb8633387ad3
3
  size 14917
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6bbac1cf1ce1610978037481a5035e6b523662562dd00a236dbb2507431643e9
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ef3ace7f288164d473a0c04358ab1c2df011edbd9de5a6bde6ef84f6a044d402
3
  size 14917
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4d78ed09f8ef41008377f42bff0e363b7ba82ecd1c922f2e831caad0254e1ac5
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dbe99df1134c19a237dcc24ad13c86b0959bc0c02f203c836365c9b3181e5558
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.6,
6
  "eval_steps": 100,
7
- "global_step": 1200,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -452,6 +452,117 @@
452
  "eval_samples_per_second": 64.855,
453
  "eval_steps_per_second": 2.14,
454
  "step": 1200
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
455
  }
456
  ],
457
  "logging_steps": 25,
@@ -471,7 +582,7 @@
471
  "attributes": {}
472
  }
473
  },
474
- "total_flos": 8.026688285835264e+17,
475
  "train_batch_size": 64,
476
  "trial_name": null,
477
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.75,
6
  "eval_steps": 100,
7
+ "global_step": 1500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
452
  "eval_samples_per_second": 64.855,
453
  "eval_steps_per_second": 2.14,
454
  "step": 1200
455
+ },
456
+ {
457
+ "epoch": 0.6125,
458
+ "grad_norm": 843.0389404296875,
459
+ "learning_rate": 3.748328323876868e-05,
460
+ "loss": 97.997,
461
+ "step": 1225
462
+ },
463
+ {
464
+ "epoch": 0.625,
465
+ "grad_norm": 657.6774291992188,
466
+ "learning_rate": 3.544006862640916e-05,
467
+ "loss": 97.6659,
468
+ "step": 1250
469
+ },
470
+ {
471
+ "epoch": 0.6375,
472
+ "grad_norm": 736.9610595703125,
473
+ "learning_rate": 3.342309199449991e-05,
474
+ "loss": 97.2111,
475
+ "step": 1275
476
+ },
477
+ {
478
+ "epoch": 0.65,
479
+ "grad_norm": 629.177490234375,
480
+ "learning_rate": 3.143598807126035e-05,
481
+ "loss": 97.152,
482
+ "step": 1300
483
+ },
484
+ {
485
+ "epoch": 0.65,
486
+ "eval_accuracy": 0.15122059588304496,
487
+ "eval_loss": 6.054599761962891,
488
+ "eval_runtime": 7.3568,
489
+ "eval_samples_per_second": 65.926,
490
+ "eval_steps_per_second": 2.175,
491
+ "step": 1300
492
+ },
493
+ {
494
+ "epoch": 0.6625,
495
+ "grad_norm": 690.4661254882812,
496
+ "learning_rate": 2.9482337752269752e-05,
497
+ "loss": 97.7027,
498
+ "step": 1325
499
+ },
500
+ {
501
+ "epoch": 0.675,
502
+ "grad_norm": 853.2005615234375,
503
+ "learning_rate": 2.7565661647451425e-05,
504
+ "loss": 98.0302,
505
+ "step": 1350
506
+ },
507
+ {
508
+ "epoch": 0.6875,
509
+ "grad_norm": 652.2321166992188,
510
+ "learning_rate": 2.568941373669562e-05,
511
+ "loss": 97.5237,
512
+ "step": 1375
513
+ },
514
+ {
515
+ "epoch": 0.7,
516
+ "grad_norm": 17031.59375,
517
+ "learning_rate": 2.3856975145554318e-05,
518
+ "loss": 97.8734,
519
+ "step": 1400
520
+ },
521
+ {
522
+ "epoch": 0.7,
523
+ "eval_accuracy": 0.14743788467072944,
524
+ "eval_loss": 6.094700336456299,
525
+ "eval_runtime": 7.6558,
526
+ "eval_samples_per_second": 63.351,
527
+ "eval_steps_per_second": 2.09,
528
+ "step": 1400
529
+ },
530
+ {
531
+ "epoch": 0.7125,
532
+ "grad_norm": 795.8380126953125,
533
+ "learning_rate": 2.2071648052224408e-05,
534
+ "loss": 98.055,
535
+ "step": 1425
536
+ },
537
+ {
538
+ "epoch": 0.725,
539
+ "grad_norm": 1413.1805419921875,
540
+ "learning_rate": 2.0336649736799495e-05,
541
+ "loss": 98.1603,
542
+ "step": 1450
543
+ },
544
+ {
545
+ "epoch": 0.7375,
546
+ "grad_norm": 746.7064208984375,
547
+ "learning_rate": 1.865510678351361e-05,
548
+ "loss": 97.9418,
549
+ "step": 1475
550
+ },
551
+ {
552
+ "epoch": 0.75,
553
+ "grad_norm": 505.42279052734375,
554
+ "learning_rate": 1.7030049446425132e-05,
555
+ "loss": 97.4964,
556
+ "step": 1500
557
+ },
558
+ {
559
+ "epoch": 0.75,
560
+ "eval_accuracy": 0.15097016545574804,
561
+ "eval_loss": 6.041877746582031,
562
+ "eval_runtime": 7.513,
563
+ "eval_samples_per_second": 64.555,
564
+ "eval_steps_per_second": 2.13,
565
+ "step": 1500
566
  }
567
  ],
568
  "logging_steps": 25,
 
582
  "attributes": {}
583
  }
584
  },
585
+ "total_flos": 1.003336035729408e+18,
586
  "train_batch_size": 64,
587
  "trial_name": null,
588
  "trial_params": null