Instructions to use CodeIsAbstract/HybridModelScratch_lightn_Conti with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use CodeIsAbstract/HybridModelScratch_lightn_Conti with Transformers:
# Load model directly from transformers import HybridFourierLM model = HybridFourierLM.from_pretrained("CodeIsAbstract/HybridModelScratch_lightn_Conti", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Training in progress, step 42000, checkpoint
Browse files
last-checkpoint/model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 579824888
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:90615d1d2178f5b43d414dd7d578f864f00b4f2a8cd51186bc86a62375823fa5
|
| 3 |
size 579824888
|
last-checkpoint/optimizer.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1159794763
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:13df368800beae9d4318c6d8b41062821af4d94ce7343c05db2b88f701598d75
|
| 3 |
size 1159794763
|
last-checkpoint/rng_state.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 14645
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:1900219b8b9edacee7fac6b19a0563f8d104e8198851f8681ad0fcf475ad606d
|
| 3 |
size 14645
|
last-checkpoint/scheduler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1465
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:d406c9f3bd6b7c91833c1f6b701e14e2778777027556d7f617683149adeaebed
|
| 3 |
size 1465
|
last-checkpoint/trainer_state.json
CHANGED
|
@@ -2,9 +2,9 @@
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
-
"epoch": 0.
|
| 6 |
"eval_steps": 1000,
|
| 7 |
-
"global_step":
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
@@ -3168,6 +3168,164 @@
|
|
| 3168 |
"eval_samples_per_second": 225.184,
|
| 3169 |
"eval_steps_per_second": 14.154,
|
| 3170 |
"step": 40000
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 3171 |
}
|
| 3172 |
],
|
| 3173 |
"logging_steps": 100,
|
|
@@ -3187,7 +3345,7 @@
|
|
| 3187 |
"attributes": {}
|
| 3188 |
}
|
| 3189 |
},
|
| 3190 |
-
"total_flos": 1.
|
| 3191 |
"train_batch_size": 120,
|
| 3192 |
"trial_name": null,
|
| 3193 |
"trial_params": null
|
|
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.2,
|
| 6 |
"eval_steps": 1000,
|
| 7 |
+
"global_step": 42000,
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
|
|
| 3168 |
"eval_samples_per_second": 225.184,
|
| 3169 |
"eval_steps_per_second": 14.154,
|
| 3170 |
"step": 40000
|
| 3171 |
+
},
|
| 3172 |
+
{
|
| 3173 |
+
"epoch": 0.162,
|
| 3174 |
+
"grad_norm": 0.15037383139133453,
|
| 3175 |
+
"learning_rate": 9.421735586195107e-05,
|
| 3176 |
+
"loss": 2.9509246826171873,
|
| 3177 |
+
"step": 40100
|
| 3178 |
+
},
|
| 3179 |
+
{
|
| 3180 |
+
"epoch": 0.164,
|
| 3181 |
+
"grad_norm": 0.1613582968711853,
|
| 3182 |
+
"learning_rate": 9.238439062409743e-05,
|
| 3183 |
+
"loss": 2.9910101318359374,
|
| 3184 |
+
"step": 40200
|
| 3185 |
+
},
|
| 3186 |
+
{
|
| 3187 |
+
"epoch": 0.166,
|
| 3188 |
+
"grad_norm": 0.14735275506973267,
|
| 3189 |
+
"learning_rate": 9.056761434025673e-05,
|
| 3190 |
+
"loss": 2.9853973388671875,
|
| 3191 |
+
"step": 40300
|
| 3192 |
+
},
|
| 3193 |
+
{
|
| 3194 |
+
"epoch": 0.168,
|
| 3195 |
+
"grad_norm": 0.1489039957523346,
|
| 3196 |
+
"learning_rate": 8.876709916592768e-05,
|
| 3197 |
+
"loss": 2.9695831298828126,
|
| 3198 |
+
"step": 40400
|
| 3199 |
+
},
|
| 3200 |
+
{
|
| 3201 |
+
"epoch": 0.17,
|
| 3202 |
+
"grad_norm": 0.15305224061012268,
|
| 3203 |
+
"learning_rate": 8.698291661077995e-05,
|
| 3204 |
+
"loss": 2.9895590209960936,
|
| 3205 |
+
"step": 40500
|
| 3206 |
+
},
|
| 3207 |
+
{
|
| 3208 |
+
"epoch": 0.172,
|
| 3209 |
+
"grad_norm": 0.14815682172775269,
|
| 3210 |
+
"learning_rate": 8.521513753581222e-05,
|
| 3211 |
+
"loss": 2.991077880859375,
|
| 3212 |
+
"step": 40600
|
| 3213 |
+
},
|
| 3214 |
+
{
|
| 3215 |
+
"epoch": 0.174,
|
| 3216 |
+
"grad_norm": 0.16085270047187805,
|
| 3217 |
+
"learning_rate": 8.346383215053938e-05,
|
| 3218 |
+
"loss": 2.9522689819335937,
|
| 3219 |
+
"step": 40700
|
| 3220 |
+
},
|
| 3221 |
+
{
|
| 3222 |
+
"epoch": 0.176,
|
| 3223 |
+
"grad_norm": 0.15213212370872498,
|
| 3224 |
+
"learning_rate": 8.172907001020341e-05,
|
| 3225 |
+
"loss": 2.9664620971679687,
|
| 3226 |
+
"step": 40800
|
| 3227 |
+
},
|
| 3228 |
+
{
|
| 3229 |
+
"epoch": 0.178,
|
| 3230 |
+
"grad_norm": 0.1419726014137268,
|
| 3231 |
+
"learning_rate": 8.001092001301107e-05,
|
| 3232 |
+
"loss": 2.97818115234375,
|
| 3233 |
+
"step": 40900
|
| 3234 |
+
},
|
| 3235 |
+
{
|
| 3236 |
+
"epoch": 0.18,
|
| 3237 |
+
"grad_norm": 0.15810449421405792,
|
| 3238 |
+
"learning_rate": 7.830945039739745e-05,
|
| 3239 |
+
"loss": 2.9653594970703123,
|
| 3240 |
+
"step": 41000
|
| 3241 |
+
},
|
| 3242 |
+
{
|
| 3243 |
+
"epoch": 0.18,
|
| 3244 |
+
"eval_accuracy": 0.383703802284819,
|
| 3245 |
+
"eval_loss": 3.2846739292144775,
|
| 3246 |
+
"eval_runtime": 8.7053,
|
| 3247 |
+
"eval_samples_per_second": 222.968,
|
| 3248 |
+
"eval_steps_per_second": 14.014,
|
| 3249 |
+
"step": 41000
|
| 3250 |
+
},
|
| 3251 |
+
{
|
| 3252 |
+
"epoch": 0.182,
|
| 3253 |
+
"grad_norm": 0.13863492012023926,
|
| 3254 |
+
"learning_rate": 7.66247287393157e-05,
|
| 3255 |
+
"loss": 2.974002685546875,
|
| 3256 |
+
"step": 41100
|
| 3257 |
+
},
|
| 3258 |
+
{
|
| 3259 |
+
"epoch": 0.184,
|
| 3260 |
+
"grad_norm": 0.14595595002174377,
|
| 3261 |
+
"learning_rate": 7.495682194955355e-05,
|
| 3262 |
+
"loss": 2.95628173828125,
|
| 3263 |
+
"step": 41200
|
| 3264 |
+
},
|
| 3265 |
+
{
|
| 3266 |
+
"epoch": 0.186,
|
| 3267 |
+
"grad_norm": 0.1462547481060028,
|
| 3268 |
+
"learning_rate": 7.330579627107508e-05,
|
| 3269 |
+
"loss": 2.9797796630859374,
|
| 3270 |
+
"step": 41300
|
| 3271 |
+
},
|
| 3272 |
+
{
|
| 3273 |
+
"epoch": 0.188,
|
| 3274 |
+
"grad_norm": 0.14023055136203766,
|
| 3275 |
+
"learning_rate": 7.167171727639105e-05,
|
| 3276 |
+
"loss": 2.97584716796875,
|
| 3277 |
+
"step": 41400
|
| 3278 |
+
},
|
| 3279 |
+
{
|
| 3280 |
+
"epoch": 0.19,
|
| 3281 |
+
"grad_norm": 0.15168802440166473,
|
| 3282 |
+
"learning_rate": 7.005464986495352e-05,
|
| 3283 |
+
"loss": 2.971091613769531,
|
| 3284 |
+
"step": 41500
|
| 3285 |
+
},
|
| 3286 |
+
{
|
| 3287 |
+
"epoch": 0.192,
|
| 3288 |
+
"grad_norm": 0.15589351952075958,
|
| 3289 |
+
"learning_rate": 6.845465826057828e-05,
|
| 3290 |
+
"loss": 2.972411804199219,
|
| 3291 |
+
"step": 41600
|
| 3292 |
+
},
|
| 3293 |
+
{
|
| 3294 |
+
"epoch": 0.194,
|
| 3295 |
+
"grad_norm": 0.15626484155654907,
|
| 3296 |
+
"learning_rate": 6.68718060088953e-05,
|
| 3297 |
+
"loss": 2.947337341308594,
|
| 3298 |
+
"step": 41700
|
| 3299 |
+
},
|
| 3300 |
+
{
|
| 3301 |
+
"epoch": 0.196,
|
| 3302 |
+
"grad_norm": 0.1376980096101761,
|
| 3303 |
+
"learning_rate": 6.530615597482342e-05,
|
| 3304 |
+
"loss": 2.9626498413085938,
|
| 3305 |
+
"step": 41800
|
| 3306 |
+
},
|
| 3307 |
+
{
|
| 3308 |
+
"epoch": 0.198,
|
| 3309 |
+
"grad_norm": 0.14533552527427673,
|
| 3310 |
+
"learning_rate": 6.375777034007463e-05,
|
| 3311 |
+
"loss": 3.0008612060546875,
|
| 3312 |
+
"step": 41900
|
| 3313 |
+
},
|
| 3314 |
+
{
|
| 3315 |
+
"epoch": 0.2,
|
| 3316 |
+
"grad_norm": 0.15397998690605164,
|
| 3317 |
+
"learning_rate": 6.222671060068407e-05,
|
| 3318 |
+
"loss": 2.9751876831054687,
|
| 3319 |
+
"step": 42000
|
| 3320 |
+
},
|
| 3321 |
+
{
|
| 3322 |
+
"epoch": 0.2,
|
| 3323 |
+
"eval_accuracy": 0.3838933468837557,
|
| 3324 |
+
"eval_loss": 3.282271385192871,
|
| 3325 |
+
"eval_runtime": 8.7427,
|
| 3326 |
+
"eval_samples_per_second": 222.015,
|
| 3327 |
+
"eval_steps_per_second": 13.955,
|
| 3328 |
+
"step": 42000
|
| 3329 |
}
|
| 3330 |
],
|
| 3331 |
"logging_steps": 100,
|
|
|
|
| 3345 |
"attributes": {}
|
| 3346 |
}
|
| 3347 |
},
|
| 3348 |
+
"total_flos": 1.64638356406272e+18,
|
| 3349 |
"train_batch_size": 120,
|
| 3350 |
"trial_name": null,
|
| 3351 |
"trial_params": null
|