CodeIsAbstract commited on
Commit
3686120
·
verified ·
1 Parent(s): 6bbf0e7

Training in progress, step 20000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6a028a1582a4cdcab16eaa810c62dd5a92cfee0e12fcbc95547030d75ad6054d
3
  size 529337896
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:751294f048537038e250758d573a29f1e0658edad8e94d39ab9d4d3a09e6f9e8
3
  size 529337896
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b858949970024f5c82faf265e8d537dcfb88c2afcfff507a59916042fcf45114
3
  size 871247243
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:003047188ae7aacd3b6801dc800cc4445151ccae190e498568ef9ad5e60978c7
3
  size 871247243
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:68fb3c6eb1526b3dbce1657a61fe1a7b19cc45a43a389d7261b3c6e19d29ffb1
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:91540c364711a6d4c4520973b3a3f4e9bff7842caef75dc08d20a08085c05012
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b1ec2a8f346b82ffd82d9deb224e5a88186c4ed8b6b71f4b78140ea3176eb4f4
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fc15c4e3a3da92e36573426a7711e53525f3873e45550434cb0365a46f480e71
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.36,
6
  "eval_steps": 1000,
7
- "global_step": 18000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -1430,6 +1430,164 @@
1430
  "eval_samples_per_second": 78.744,
1431
  "eval_steps_per_second": 0.63,
1432
  "step": 18000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1433
  }
1434
  ],
1435
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.4,
6
  "eval_steps": 1000,
7
+ "global_step": 20000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
1430
  "eval_samples_per_second": 78.744,
1431
  "eval_steps_per_second": 0.63,
1432
  "step": 18000
1433
+ },
1434
+ {
1435
+ "epoch": 0.362,
1436
+ "grad_norm": 0.15682971477508545,
1437
+ "learning_rate": 0.0015133615281026555,
1438
+ "loss": 3.426,
1439
+ "step": 18100
1440
+ },
1441
+ {
1442
+ "epoch": 0.364,
1443
+ "grad_norm": 0.15073339641094208,
1444
+ "learning_rate": 0.0015076744925048868,
1445
+ "loss": 3.4358,
1446
+ "step": 18200
1447
+ },
1448
+ {
1449
+ "epoch": 0.366,
1450
+ "grad_norm": 0.18040859699249268,
1451
+ "learning_rate": 0.0015019652495801786,
1452
+ "loss": 3.4261,
1453
+ "step": 18300
1454
+ },
1455
+ {
1456
+ "epoch": 0.368,
1457
+ "grad_norm": 0.18911828100681305,
1458
+ "learning_rate": 0.0014962340490693121,
1459
+ "loss": 3.4359,
1460
+ "step": 18400
1461
+ },
1462
+ {
1463
+ "epoch": 0.37,
1464
+ "grad_norm": 0.15816016495227814,
1465
+ "learning_rate": 0.0014904811416735636,
1466
+ "loss": 3.4216,
1467
+ "step": 18500
1468
+ },
1469
+ {
1470
+ "epoch": 0.372,
1471
+ "grad_norm": 0.17654721438884735,
1472
+ "learning_rate": 0.0014847067790437396,
1473
+ "loss": 3.4347,
1474
+ "step": 18600
1475
+ },
1476
+ {
1477
+ "epoch": 0.374,
1478
+ "grad_norm": 0.17527590692043304,
1479
+ "learning_rate": 0.0014789112137691682,
1480
+ "loss": 3.4256,
1481
+ "step": 18700
1482
+ },
1483
+ {
1484
+ "epoch": 0.376,
1485
+ "grad_norm": 0.15412954986095428,
1486
+ "learning_rate": 0.001473094699366649,
1487
+ "loss": 3.4074,
1488
+ "step": 18800
1489
+ },
1490
+ {
1491
+ "epoch": 0.378,
1492
+ "grad_norm": 0.1891617327928543,
1493
+ "learning_rate": 0.0014672574902693661,
1494
+ "loss": 3.4338,
1495
+ "step": 18900
1496
+ },
1497
+ {
1498
+ "epoch": 0.38,
1499
+ "grad_norm": 0.16060151159763336,
1500
+ "learning_rate": 0.001461399841815754,
1501
+ "loss": 3.4372,
1502
+ "step": 19000
1503
+ },
1504
+ {
1505
+ "epoch": 0.38,
1506
+ "eval_accuracy": 0.3734951076320939,
1507
+ "eval_loss": 3.3982865810394287,
1508
+ "eval_runtime": 12.1716,
1509
+ "eval_samples_per_second": 82.158,
1510
+ "eval_steps_per_second": 0.657,
1511
+ "step": 19000
1512
+ },
1513
+ {
1514
+ "epoch": 0.382,
1515
+ "grad_norm": 0.17226573824882507,
1516
+ "learning_rate": 0.0014555220102383326,
1517
+ "loss": 3.4123,
1518
+ "step": 19100
1519
+ },
1520
+ {
1521
+ "epoch": 0.384,
1522
+ "grad_norm": 0.15569022297859192,
1523
+ "learning_rate": 0.0014496242526524964,
1524
+ "loss": 3.4226,
1525
+ "step": 19200
1526
+ },
1527
+ {
1528
+ "epoch": 0.386,
1529
+ "grad_norm": 0.16819970309734344,
1530
+ "learning_rate": 0.001443706827045269,
1531
+ "loss": 3.4294,
1532
+ "step": 19300
1533
+ },
1534
+ {
1535
+ "epoch": 0.388,
1536
+ "grad_norm": 0.14779409766197205,
1537
+ "learning_rate": 0.0014377699922640157,
1538
+ "loss": 3.4233,
1539
+ "step": 19400
1540
+ },
1541
+ {
1542
+ "epoch": 0.39,
1543
+ "grad_norm": 0.1541208177804947,
1544
+ "learning_rate": 0.0014318140080051228,
1545
+ "loss": 3.4087,
1546
+ "step": 19500
1547
+ },
1548
+ {
1549
+ "epoch": 0.392,
1550
+ "grad_norm": 0.1646755486726761,
1551
+ "learning_rate": 0.0014258391348026362,
1552
+ "loss": 3.398,
1553
+ "step": 19600
1554
+ },
1555
+ {
1556
+ "epoch": 0.394,
1557
+ "grad_norm": 0.18935076892375946,
1558
+ "learning_rate": 0.0014198456340168662,
1559
+ "loss": 3.4231,
1560
+ "step": 19700
1561
+ },
1562
+ {
1563
+ "epoch": 0.396,
1564
+ "grad_norm": 0.1867913156747818,
1565
+ "learning_rate": 0.0014138337678229528,
1566
+ "loss": 3.4129,
1567
+ "step": 19800
1568
+ },
1569
+ {
1570
+ "epoch": 0.398,
1571
+ "grad_norm": 0.15837714076042175,
1572
+ "learning_rate": 0.0014078037991993992,
1573
+ "loss": 3.3952,
1574
+ "step": 19900
1575
+ },
1576
+ {
1577
+ "epoch": 0.4,
1578
+ "grad_norm": 0.15315821766853333,
1579
+ "learning_rate": 0.0014017559919165675,
1580
+ "loss": 3.4155,
1581
+ "step": 20000
1582
+ },
1583
+ {
1584
+ "epoch": 0.4,
1585
+ "eval_accuracy": 0.37439138943248534,
1586
+ "eval_loss": 3.387746572494507,
1587
+ "eval_runtime": 12.7148,
1588
+ "eval_samples_per_second": 78.648,
1589
+ "eval_steps_per_second": 0.629,
1590
+ "step": 20000
1591
  }
1592
  ],
1593
  "logging_steps": 100,