Instructions to use CodeIsAbstract/HybridModelScratch_lightn_Conti with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use CodeIsAbstract/HybridModelScratch_lightn_Conti with Transformers:
# Load model directly from transformers import HybridFourierLM model = HybridFourierLM.from_pretrained("CodeIsAbstract/HybridModelScratch_lightn_Conti", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Training in progress, step 46000, checkpoint
Browse files
last-checkpoint/model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 579824888
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:aba48a88f14f88d2c676b3120dd7519cd2ee052cab006b018c9a25681e031cfa
|
| 3 |
size 579824888
|
last-checkpoint/optimizer.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1159794763
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:ad957f747373b217d0825dc13fc9b44c586655ceaf668fd0b235b21ea08e71e9
|
| 3 |
size 1159794763
|
last-checkpoint/rng_state.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 14645
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:ae7080db6ca7826aa7327063ffbab1e6619bd0540a568acd2fb404342bae3b24
|
| 3 |
size 14645
|
last-checkpoint/scheduler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1465
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:8d4c064c012204759619753d64e389586d8e5d36728d74e01c63e63ba6b44abd
|
| 3 |
size 1465
|
last-checkpoint/trainer_state.json
CHANGED
|
@@ -2,9 +2,9 @@
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
-
"epoch": 0.
|
| 6 |
"eval_steps": 1000,
|
| 7 |
-
"global_step":
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
@@ -3484,6 +3484,164 @@
|
|
| 3484 |
"eval_samples_per_second": 225.69,
|
| 3485 |
"eval_steps_per_second": 14.186,
|
| 3486 |
"step": 44000
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 3487 |
}
|
| 3488 |
],
|
| 3489 |
"logging_steps": 100,
|
|
@@ -3503,7 +3661,7 @@
|
|
| 3503 |
"attributes": {}
|
| 3504 |
}
|
| 3505 |
},
|
| 3506 |
-
"total_flos": 1.
|
| 3507 |
"train_batch_size": 120,
|
| 3508 |
"trial_name": null,
|
| 3509 |
"trial_params": null
|
|
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.28,
|
| 6 |
"eval_steps": 1000,
|
| 7 |
+
"global_step": 46000,
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
|
|
| 3484 |
"eval_samples_per_second": 225.69,
|
| 3485 |
"eval_steps_per_second": 14.186,
|
| 3486 |
"step": 44000
|
| 3487 |
+
},
|
| 3488 |
+
{
|
| 3489 |
+
"epoch": 0.242,
|
| 3490 |
+
"grad_norm": 0.1386120468378067,
|
| 3491 |
+
"learning_rate": 3.4178236498548566e-05,
|
| 3492 |
+
"loss": 2.9823358154296873,
|
| 3493 |
+
"step": 44100
|
| 3494 |
+
},
|
| 3495 |
+
{
|
| 3496 |
+
"epoch": 0.244,
|
| 3497 |
+
"grad_norm": 0.14559704065322876,
|
| 3498 |
+
"learning_rate": 3.304248771632068e-05,
|
| 3499 |
+
"loss": 3.000511474609375,
|
| 3500 |
+
"step": 44200
|
| 3501 |
+
},
|
| 3502 |
+
{
|
| 3503 |
+
"epoch": 0.246,
|
| 3504 |
+
"grad_norm": 0.1556394100189209,
|
| 3505 |
+
"learning_rate": 3.192528472458356e-05,
|
| 3506 |
+
"loss": 2.974275817871094,
|
| 3507 |
+
"step": 44300
|
| 3508 |
+
},
|
| 3509 |
+
{
|
| 3510 |
+
"epoch": 0.248,
|
| 3511 |
+
"grad_norm": 0.14107827842235565,
|
| 3512 |
+
"learning_rate": 3.0826671894424896e-05,
|
| 3513 |
+
"loss": 2.9849594116210936,
|
| 3514 |
+
"step": 44400
|
| 3515 |
+
},
|
| 3516 |
+
{
|
| 3517 |
+
"epoch": 0.25,
|
| 3518 |
+
"grad_norm": 0.1435183584690094,
|
| 3519 |
+
"learning_rate": 2.9746692858601153e-05,
|
| 3520 |
+
"loss": 2.986834716796875,
|
| 3521 |
+
"step": 44500
|
| 3522 |
+
},
|
| 3523 |
+
{
|
| 3524 |
+
"epoch": 0.252,
|
| 3525 |
+
"grad_norm": 0.14042021334171295,
|
| 3526 |
+
"learning_rate": 2.86853905098044e-05,
|
| 3527 |
+
"loss": 2.9832034301757813,
|
| 3528 |
+
"step": 44600
|
| 3529 |
+
},
|
| 3530 |
+
{
|
| 3531 |
+
"epoch": 0.254,
|
| 3532 |
+
"grad_norm": 0.14901328086853027,
|
| 3533 |
+
"learning_rate": 2.7642806998959825e-05,
|
| 3534 |
+
"loss": 2.9711032104492188,
|
| 3535 |
+
"step": 44700
|
| 3536 |
+
},
|
| 3537 |
+
{
|
| 3538 |
+
"epoch": 0.256,
|
| 3539 |
+
"grad_norm": 0.1637275367975235,
|
| 3540 |
+
"learning_rate": 2.6618983733550428e-05,
|
| 3541 |
+
"loss": 3.0130319213867187,
|
| 3542 |
+
"step": 44800
|
| 3543 |
+
},
|
| 3544 |
+
{
|
| 3545 |
+
"epoch": 0.258,
|
| 3546 |
+
"grad_norm": 0.15092074871063232,
|
| 3547 |
+
"learning_rate": 2.5613961375973384e-05,
|
| 3548 |
+
"loss": 2.976082458496094,
|
| 3549 |
+
"step": 44900
|
| 3550 |
+
},
|
| 3551 |
+
{
|
| 3552 |
+
"epoch": 0.26,
|
| 3553 |
+
"grad_norm": 0.15425318479537964,
|
| 3554 |
+
"learning_rate": 2.46277798419246e-05,
|
| 3555 |
+
"loss": 2.9721246337890626,
|
| 3556 |
+
"step": 45000
|
| 3557 |
+
},
|
| 3558 |
+
{
|
| 3559 |
+
"epoch": 0.26,
|
| 3560 |
+
"eval_accuracy": 0.3843389783344474,
|
| 3561 |
+
"eval_loss": 3.277207612991333,
|
| 3562 |
+
"eval_runtime": 9.0174,
|
| 3563 |
+
"eval_samples_per_second": 215.251,
|
| 3564 |
+
"eval_steps_per_second": 13.529,
|
| 3565 |
+
"step": 45000
|
| 3566 |
+
},
|
| 3567 |
+
{
|
| 3568 |
+
"epoch": 0.262,
|
| 3569 |
+
"grad_norm": 0.14529016613960266,
|
| 3570 |
+
"learning_rate": 2.3660478298813682e-05,
|
| 3571 |
+
"loss": 2.955975341796875,
|
| 3572 |
+
"step": 45100
|
| 3573 |
+
},
|
| 3574 |
+
{
|
| 3575 |
+
"epoch": 0.264,
|
| 3576 |
+
"grad_norm": 0.1409466564655304,
|
| 3577 |
+
"learning_rate": 2.271209516420808e-05,
|
| 3578 |
+
"loss": 2.9534814453125,
|
| 3579 |
+
"step": 45200
|
| 3580 |
+
},
|
| 3581 |
+
{
|
| 3582 |
+
"epoch": 0.266,
|
| 3583 |
+
"grad_norm": 0.1580328494310379,
|
| 3584 |
+
"learning_rate": 2.1782668104307513e-05,
|
| 3585 |
+
"loss": 2.9937799072265623,
|
| 3586 |
+
"step": 45300
|
| 3587 |
+
},
|
| 3588 |
+
{
|
| 3589 |
+
"epoch": 0.268,
|
| 3590 |
+
"grad_norm": 0.1395774632692337,
|
| 3591 |
+
"learning_rate": 2.087223403244809e-05,
|
| 3592 |
+
"loss": 2.9789169311523436,
|
| 3593 |
+
"step": 45400
|
| 3594 |
+
},
|
| 3595 |
+
{
|
| 3596 |
+
"epoch": 0.27,
|
| 3597 |
+
"grad_norm": 0.1499042958021164,
|
| 3598 |
+
"learning_rate": 1.9980829107635658e-05,
|
| 3599 |
+
"loss": 2.9510009765625,
|
| 3600 |
+
"step": 45500
|
| 3601 |
+
},
|
| 3602 |
+
{
|
| 3603 |
+
"epoch": 0.272,
|
| 3604 |
+
"grad_norm": 0.1363893300294876,
|
| 3605 |
+
"learning_rate": 1.9108488733110718e-05,
|
| 3606 |
+
"loss": 2.9952117919921877,
|
| 3607 |
+
"step": 45600
|
| 3608 |
+
},
|
| 3609 |
+
{
|
| 3610 |
+
"epoch": 0.274,
|
| 3611 |
+
"grad_norm": 0.15024074912071228,
|
| 3612 |
+
"learning_rate": 1.8255247554941346e-05,
|
| 3613 |
+
"loss": 2.942423095703125,
|
| 3614 |
+
"step": 45700
|
| 3615 |
+
},
|
| 3616 |
+
{
|
| 3617 |
+
"epoch": 0.276,
|
| 3618 |
+
"grad_norm": 0.1419738084077835,
|
| 3619 |
+
"learning_rate": 1.7421139460647716e-05,
|
| 3620 |
+
"loss": 2.964244689941406,
|
| 3621 |
+
"step": 45800
|
| 3622 |
+
},
|
| 3623 |
+
{
|
| 3624 |
+
"epoch": 0.278,
|
| 3625 |
+
"grad_norm": 0.14513224363327026,
|
| 3626 |
+
"learning_rate": 1.6606197577856196e-05,
|
| 3627 |
+
"loss": 2.977562255859375,
|
| 3628 |
+
"step": 45900
|
| 3629 |
+
},
|
| 3630 |
+
{
|
| 3631 |
+
"epoch": 0.28,
|
| 3632 |
+
"grad_norm": 0.1422048956155777,
|
| 3633 |
+
"learning_rate": 1.5810454272983443e-05,
|
| 3634 |
+
"loss": 2.969391174316406,
|
| 3635 |
+
"step": 46000
|
| 3636 |
+
},
|
| 3637 |
+
{
|
| 3638 |
+
"epoch": 0.28,
|
| 3639 |
+
"eval_accuracy": 0.38465757457521343,
|
| 3640 |
+
"eval_loss": 3.2764923572540283,
|
| 3641 |
+
"eval_runtime": 8.5865,
|
| 3642 |
+
"eval_samples_per_second": 226.054,
|
| 3643 |
+
"eval_steps_per_second": 14.208,
|
| 3644 |
+
"step": 46000
|
| 3645 |
}
|
| 3646 |
],
|
| 3647 |
"logging_steps": 100,
|
|
|
|
| 3661 |
"attributes": {}
|
| 3662 |
}
|
| 3663 |
},
|
| 3664 |
+
"total_flos": 1.80318199873536e+18,
|
| 3665 |
"train_batch_size": 120,
|
| 3666 |
"trial_name": null,
|
| 3667 |
"trial_params": null
|