Instructions to use CodeIsAbstract/HybridModelScratch with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use CodeIsAbstract/HybridModelScratch with Transformers:
# Load model directly from transformers import HybridFourierLM model = HybridFourierLM.from_pretrained("CodeIsAbstract/HybridModelScratch", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Training in progress, step 1800, checkpoint
Browse files
last-checkpoint/model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 579748776
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:206c62db0b89449568ebdd8c25cd017d55ecb7bf6df86bab1e451b3b3fd8f88e
|
| 3 |
size 579748776
|
last-checkpoint/optimizer.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1159627083
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:5a9af1204c1f4878c612726d1537329b4144d6b734182cd55d2c644c1a10e4b7
|
| 3 |
size 1159627083
|
last-checkpoint/rng_state_0.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 14917
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:5445b36fdb78ff76c2ef206d44397c5aad17f330414e24d03bab0de9bf0e9222
|
| 3 |
size 14917
|
last-checkpoint/rng_state_1.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 14917
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:108a89056f023268994da88aac029418224df4448adc2b0cb4d1083cb65ac2b0
|
| 3 |
size 14917
|
last-checkpoint/scheduler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1465
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:6d0f2c84615336a1d1664a4244642bd13601391ec93a4749b9c0e0cdc17433aa
|
| 3 |
size 1465
|
last-checkpoint/trainer_state.json
CHANGED
|
@@ -2,9 +2,9 @@
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
-
"epoch": 0.
|
| 6 |
"eval_steps": 100,
|
| 7 |
-
"global_step":
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
@@ -563,6 +563,117 @@
|
|
| 563 |
"eval_samples_per_second": 64.555,
|
| 564 |
"eval_steps_per_second": 2.13,
|
| 565 |
"step": 1500
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 566 |
}
|
| 567 |
],
|
| 568 |
"logging_steps": 25,
|
|
@@ -582,7 +693,7 @@
|
|
| 582 |
"attributes": {}
|
| 583 |
}
|
| 584 |
},
|
| 585 |
-
"total_flos": 1.
|
| 586 |
"train_batch_size": 64,
|
| 587 |
"trial_name": null,
|
| 588 |
"trial_params": null
|
|
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.9,
|
| 6 |
"eval_steps": 100,
|
| 7 |
+
"global_step": 1800,
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
|
|
| 563 |
"eval_samples_per_second": 64.555,
|
| 564 |
"eval_steps_per_second": 2.13,
|
| 565 |
"step": 1500
|
| 566 |
+
},
|
| 567 |
+
{
|
| 568 |
+
"epoch": 0.7625,
|
| 569 |
+
"grad_norm": 2972.94580078125,
|
| 570 |
+
"learning_rate": 1.5464406188694174e-05,
|
| 571 |
+
"loss": 97.7231,
|
| 572 |
+
"step": 1525
|
| 573 |
+
},
|
| 574 |
+
{
|
| 575 |
+
"epoch": 0.775,
|
| 576 |
+
"grad_norm": 2009.724609375,
|
| 577 |
+
"learning_rate": 1.3960998405293963e-05,
|
| 578 |
+
"loss": 97.6005,
|
| 579 |
+
"step": 1550
|
| 580 |
+
},
|
| 581 |
+
{
|
| 582 |
+
"epoch": 0.7875,
|
| 583 |
+
"grad_norm": 955.8128051757812,
|
| 584 |
+
"learning_rate": 1.2522535338666486e-05,
|
| 585 |
+
"loss": 97.5096,
|
| 586 |
+
"step": 1575
|
| 587 |
+
},
|
| 588 |
+
{
|
| 589 |
+
"epoch": 0.8,
|
| 590 |
+
"grad_norm": 1708.3966064453125,
|
| 591 |
+
"learning_rate": 1.1151609196484447e-05,
|
| 592 |
+
"loss": 97.562,
|
| 593 |
+
"step": 1600
|
| 594 |
+
},
|
| 595 |
+
{
|
| 596 |
+
"epoch": 0.8,
|
| 597 |
+
"eval_accuracy": 0.15179921134611404,
|
| 598 |
+
"eval_loss": 6.027195930480957,
|
| 599 |
+
"eval_runtime": 7.3648,
|
| 600 |
+
"eval_samples_per_second": 65.853,
|
| 601 |
+
"eval_steps_per_second": 2.172,
|
| 602 |
+
"step": 1600
|
| 603 |
+
},
|
| 604 |
+
{
|
| 605 |
+
"epoch": 0.8125,
|
| 606 |
+
"grad_norm": 249.3505096435547,
|
| 607 |
+
"learning_rate": 9.850690480317837e-06,
|
| 608 |
+
"loss": 97.4989,
|
| 609 |
+
"step": 1625
|
| 610 |
+
},
|
| 611 |
+
{
|
| 612 |
+
"epoch": 0.825,
|
| 613 |
+
"grad_norm": 493.7890930175781,
|
| 614 |
+
"learning_rate": 8.622123533623077e-06,
|
| 615 |
+
"loss": 97.3748,
|
| 616 |
+
"step": 1650
|
| 617 |
+
},
|
| 618 |
+
{
|
| 619 |
+
"epoch": 0.8375,
|
| 620 |
+
"grad_norm": 1148.812744140625,
|
| 621 |
+
"learning_rate": 7.468122317077786e-06,
|
| 622 |
+
"loss": 97.3686,
|
| 623 |
+
"step": 1675
|
| 624 |
+
},
|
| 625 |
+
{
|
| 626 |
+
"epoch": 0.85,
|
| 627 |
+
"grad_norm": 719.5657958984375,
|
| 628 |
+
"learning_rate": 6.390766418873812e-06,
|
| 629 |
+
"loss": 97.3206,
|
| 630 |
+
"step": 1700
|
| 631 |
+
},
|
| 632 |
+
{
|
| 633 |
+
"epoch": 0.85,
|
| 634 |
+
"eval_accuracy": 0.15286253086201587,
|
| 635 |
+
"eval_loss": 6.017110824584961,
|
| 636 |
+
"eval_runtime": 7.5198,
|
| 637 |
+
"eval_samples_per_second": 64.496,
|
| 638 |
+
"eval_steps_per_second": 2.128,
|
| 639 |
+
"step": 1700
|
| 640 |
+
},
|
| 641 |
+
{
|
| 642 |
+
"epoch": 0.8625,
|
| 643 |
+
"grad_norm": 585.3778686523438,
|
| 644 |
+
"learning_rate": 5.391997307158919e-06,
|
| 645 |
+
"loss": 97.2298,
|
| 646 |
+
"step": 1725
|
| 647 |
+
},
|
| 648 |
+
{
|
| 649 |
+
"epoch": 0.875,
|
| 650 |
+
"grad_norm": 2988.042236328125,
|
| 651 |
+
"learning_rate": 4.473614831379824e-06,
|
| 652 |
+
"loss": 97.108,
|
| 653 |
+
"step": 1750
|
| 654 |
+
},
|
| 655 |
+
{
|
| 656 |
+
"epoch": 0.8875,
|
| 657 |
+
"grad_norm": 3200.808837890625,
|
| 658 |
+
"learning_rate": 3.6372739788319843e-06,
|
| 659 |
+
"loss": 97.0287,
|
| 660 |
+
"step": 1775
|
| 661 |
+
},
|
| 662 |
+
{
|
| 663 |
+
"epoch": 0.9,
|
| 664 |
+
"grad_norm": 263.6023254394531,
|
| 665 |
+
"learning_rate": 2.88448189226046e-06,
|
| 666 |
+
"loss": 96.8684,
|
| 667 |
+
"step": 1800
|
| 668 |
+
},
|
| 669 |
+
{
|
| 670 |
+
"epoch": 0.9,
|
| 671 |
+
"eval_accuracy": 0.15323817650296123,
|
| 672 |
+
"eval_loss": 6.016338348388672,
|
| 673 |
+
"eval_runtime": 14.8413,
|
| 674 |
+
"eval_samples_per_second": 32.679,
|
| 675 |
+
"eval_steps_per_second": 1.078,
|
| 676 |
+
"step": 1800
|
| 677 |
}
|
| 678 |
],
|
| 679 |
"logging_steps": 25,
|
|
|
|
| 693 |
"attributes": {}
|
| 694 |
}
|
| 695 |
},
|
| 696 |
+
"total_flos": 1.2040032428752896e+18,
|
| 697 |
"train_batch_size": 64,
|
| 698 |
"trial_name": null,
|
| 699 |
"trial_params": null
|