Instructions to use kiritan/iteboshi with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use kiritan/iteboshi with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("automatic-speech-recognition", model="kiritan/iteboshi")# Load model directly from transformers import AutoProcessor, AutoModelForSpeechSeq2Seq processor = AutoProcessor.from_pretrained("kiritan/iteboshi") model = AutoModelForSpeechSeq2Seq.from_pretrained("kiritan/iteboshi", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Training in progress, step 9000, checkpoint
Browse files
last-checkpoint/model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 223144592
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4a3e022ac84f30ae31895f4c1fdd4193fd8cb87243b838bb4ab04a2c81125f34
|
| 3 |
size 223144592
|
last-checkpoint/optimizer.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 440235130
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:1fae576b7632ab80a241b724184858bc03dc6b8a5ab033b8c1557876af5ec635
|
| 3 |
size 440235130
|
last-checkpoint/rng_state.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 14244
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:c3298c1164420f34245720421f1fd62a2032e0dd6a714db661d3c5d891d94340
|
| 3 |
size 14244
|
last-checkpoint/scheduler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1064
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:5a126852a43e277e33e1e252a3fd6921630733a3af73c3c23e0911537695bad3
|
| 3 |
size 1064
|
last-checkpoint/trainer_state.json
CHANGED
|
@@ -1,9 +1,9 @@
|
|
| 1 |
{
|
| 2 |
"best_metric": Infinity,
|
| 3 |
"best_model_checkpoint": null,
|
| 4 |
-
"epoch":
|
| 5 |
"eval_steps": 1000,
|
| 6 |
-
"global_step":
|
| 7 |
"is_hyper_param_search": false,
|
| 8 |
"is_local_process_zero": true,
|
| 9 |
"is_world_process_zero": true,
|
|
@@ -2319,6 +2319,295 @@
|
|
| 2319 |
"eval_steps_per_second": 1.254,
|
| 2320 |
"eval_wer": Infinity,
|
| 2321 |
"step": 8000
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 2322 |
}
|
| 2323 |
],
|
| 2324 |
"logging_steps": 25,
|
|
@@ -2338,7 +2627,7 @@
|
|
| 2338 |
"attributes": {}
|
| 2339 |
}
|
| 2340 |
},
|
| 2341 |
-
"total_flos": 1.
|
| 2342 |
"train_batch_size": 12,
|
| 2343 |
"trial_name": null,
|
| 2344 |
"trial_params": null
|
|
|
|
| 1 |
{
|
| 2 |
"best_metric": Infinity,
|
| 3 |
"best_model_checkpoint": null,
|
| 4 |
+
"epoch": 14.852188274153592,
|
| 5 |
"eval_steps": 1000,
|
| 6 |
+
"global_step": 9000,
|
| 7 |
"is_hyper_param_search": false,
|
| 8 |
"is_local_process_zero": true,
|
| 9 |
"is_world_process_zero": true,
|
|
|
|
| 2319 |
"eval_steps_per_second": 1.254,
|
| 2320 |
"eval_wer": Infinity,
|
| 2321 |
"step": 8000
|
| 2322 |
+
},
|
| 2323 |
+
{
|
| 2324 |
+
"epoch": 13.242774566473988,
|
| 2325 |
+
"grad_norm": 4.316694736480713,
|
| 2326 |
+
"learning_rate": 4.162105263157895e-06,
|
| 2327 |
+
"loss": 0.2075,
|
| 2328 |
+
"step": 8025
|
| 2329 |
+
},
|
| 2330 |
+
{
|
| 2331 |
+
"epoch": 13.284062758051197,
|
| 2332 |
+
"grad_norm": 4.108456611633301,
|
| 2333 |
+
"learning_rate": 4.109473684210527e-06,
|
| 2334 |
+
"loss": 0.1654,
|
| 2335 |
+
"step": 8050
|
| 2336 |
+
},
|
| 2337 |
+
{
|
| 2338 |
+
"epoch": 13.325350949628406,
|
| 2339 |
+
"grad_norm": 3.923902750015259,
|
| 2340 |
+
"learning_rate": 4.056842105263158e-06,
|
| 2341 |
+
"loss": 0.19,
|
| 2342 |
+
"step": 8075
|
| 2343 |
+
},
|
| 2344 |
+
{
|
| 2345 |
+
"epoch": 13.366639141205615,
|
| 2346 |
+
"grad_norm": 3.792008638381958,
|
| 2347 |
+
"learning_rate": 4.00421052631579e-06,
|
| 2348 |
+
"loss": 0.1924,
|
| 2349 |
+
"step": 8100
|
| 2350 |
+
},
|
| 2351 |
+
{
|
| 2352 |
+
"epoch": 13.407927332782824,
|
| 2353 |
+
"grad_norm": 4.64762020111084,
|
| 2354 |
+
"learning_rate": 3.951578947368422e-06,
|
| 2355 |
+
"loss": 0.1988,
|
| 2356 |
+
"step": 8125
|
| 2357 |
+
},
|
| 2358 |
+
{
|
| 2359 |
+
"epoch": 13.449215524360033,
|
| 2360 |
+
"grad_norm": 4.5705246925354,
|
| 2361 |
+
"learning_rate": 3.898947368421052e-06,
|
| 2362 |
+
"loss": 0.1857,
|
| 2363 |
+
"step": 8150
|
| 2364 |
+
},
|
| 2365 |
+
{
|
| 2366 |
+
"epoch": 13.490503715937242,
|
| 2367 |
+
"grad_norm": 4.8831610679626465,
|
| 2368 |
+
"learning_rate": 3.846315789473685e-06,
|
| 2369 |
+
"loss": 0.1813,
|
| 2370 |
+
"step": 8175
|
| 2371 |
+
},
|
| 2372 |
+
{
|
| 2373 |
+
"epoch": 13.531791907514451,
|
| 2374 |
+
"grad_norm": 3.7012646198272705,
|
| 2375 |
+
"learning_rate": 3.793684210526316e-06,
|
| 2376 |
+
"loss": 0.212,
|
| 2377 |
+
"step": 8200
|
| 2378 |
+
},
|
| 2379 |
+
{
|
| 2380 |
+
"epoch": 13.57308009909166,
|
| 2381 |
+
"grad_norm": 4.698606967926025,
|
| 2382 |
+
"learning_rate": 3.7410526315789473e-06,
|
| 2383 |
+
"loss": 0.1999,
|
| 2384 |
+
"step": 8225
|
| 2385 |
+
},
|
| 2386 |
+
{
|
| 2387 |
+
"epoch": 13.61436829066887,
|
| 2388 |
+
"grad_norm": 5.355463027954102,
|
| 2389 |
+
"learning_rate": 3.6884210526315794e-06,
|
| 2390 |
+
"loss": 0.188,
|
| 2391 |
+
"step": 8250
|
| 2392 |
+
},
|
| 2393 |
+
{
|
| 2394 |
+
"epoch": 13.655656482246078,
|
| 2395 |
+
"grad_norm": 4.198258876800537,
|
| 2396 |
+
"learning_rate": 3.635789473684211e-06,
|
| 2397 |
+
"loss": 0.187,
|
| 2398 |
+
"step": 8275
|
| 2399 |
+
},
|
| 2400 |
+
{
|
| 2401 |
+
"epoch": 13.696944673823287,
|
| 2402 |
+
"grad_norm": 4.937903881072998,
|
| 2403 |
+
"learning_rate": 3.5831578947368422e-06,
|
| 2404 |
+
"loss": 0.1942,
|
| 2405 |
+
"step": 8300
|
| 2406 |
+
},
|
| 2407 |
+
{
|
| 2408 |
+
"epoch": 13.738232865400496,
|
| 2409 |
+
"grad_norm": 5.5391645431518555,
|
| 2410 |
+
"learning_rate": 3.5305263157894743e-06,
|
| 2411 |
+
"loss": 0.1897,
|
| 2412 |
+
"step": 8325
|
| 2413 |
+
},
|
| 2414 |
+
{
|
| 2415 |
+
"epoch": 13.779521056977705,
|
| 2416 |
+
"grad_norm": 3.7583065032958984,
|
| 2417 |
+
"learning_rate": 3.4778947368421055e-06,
|
| 2418 |
+
"loss": 0.1932,
|
| 2419 |
+
"step": 8350
|
| 2420 |
+
},
|
| 2421 |
+
{
|
| 2422 |
+
"epoch": 13.820809248554914,
|
| 2423 |
+
"grad_norm": 5.243954181671143,
|
| 2424 |
+
"learning_rate": 3.425263157894737e-06,
|
| 2425 |
+
"loss": 0.198,
|
| 2426 |
+
"step": 8375
|
| 2427 |
+
},
|
| 2428 |
+
{
|
| 2429 |
+
"epoch": 13.862097440132121,
|
| 2430 |
+
"grad_norm": 5.0445556640625,
|
| 2431 |
+
"learning_rate": 3.3726315789473683e-06,
|
| 2432 |
+
"loss": 0.1773,
|
| 2433 |
+
"step": 8400
|
| 2434 |
+
},
|
| 2435 |
+
{
|
| 2436 |
+
"epoch": 13.90338563170933,
|
| 2437 |
+
"grad_norm": 4.348180770874023,
|
| 2438 |
+
"learning_rate": 3.3200000000000004e-06,
|
| 2439 |
+
"loss": 0.1834,
|
| 2440 |
+
"step": 8425
|
| 2441 |
+
},
|
| 2442 |
+
{
|
| 2443 |
+
"epoch": 13.94467382328654,
|
| 2444 |
+
"grad_norm": 5.649644374847412,
|
| 2445 |
+
"learning_rate": 3.267368421052632e-06,
|
| 2446 |
+
"loss": 0.1772,
|
| 2447 |
+
"step": 8450
|
| 2448 |
+
},
|
| 2449 |
+
{
|
| 2450 |
+
"epoch": 13.985962014863748,
|
| 2451 |
+
"grad_norm": 5.276495933532715,
|
| 2452 |
+
"learning_rate": 3.2147368421052633e-06,
|
| 2453 |
+
"loss": 0.211,
|
| 2454 |
+
"step": 8475
|
| 2455 |
+
},
|
| 2456 |
+
{
|
| 2457 |
+
"epoch": 14.026424442609414,
|
| 2458 |
+
"grad_norm": 4.379940032958984,
|
| 2459 |
+
"learning_rate": 3.1621052631578953e-06,
|
| 2460 |
+
"loss": 0.1697,
|
| 2461 |
+
"step": 8500
|
| 2462 |
+
},
|
| 2463 |
+
{
|
| 2464 |
+
"epoch": 14.067712634186623,
|
| 2465 |
+
"grad_norm": 4.398263454437256,
|
| 2466 |
+
"learning_rate": 3.1094736842105265e-06,
|
| 2467 |
+
"loss": 0.1656,
|
| 2468 |
+
"step": 8525
|
| 2469 |
+
},
|
| 2470 |
+
{
|
| 2471 |
+
"epoch": 14.109000825763832,
|
| 2472 |
+
"grad_norm": 5.636984348297119,
|
| 2473 |
+
"learning_rate": 3.056842105263158e-06,
|
| 2474 |
+
"loss": 0.1613,
|
| 2475 |
+
"step": 8550
|
| 2476 |
+
},
|
| 2477 |
+
{
|
| 2478 |
+
"epoch": 14.15028901734104,
|
| 2479 |
+
"grad_norm": 5.673081398010254,
|
| 2480 |
+
"learning_rate": 3.0042105263157894e-06,
|
| 2481 |
+
"loss": 0.1814,
|
| 2482 |
+
"step": 8575
|
| 2483 |
+
},
|
| 2484 |
+
{
|
| 2485 |
+
"epoch": 14.191577208918249,
|
| 2486 |
+
"grad_norm": 4.340714454650879,
|
| 2487 |
+
"learning_rate": 2.9515789473684214e-06,
|
| 2488 |
+
"loss": 0.1482,
|
| 2489 |
+
"step": 8600
|
| 2490 |
+
},
|
| 2491 |
+
{
|
| 2492 |
+
"epoch": 14.232865400495458,
|
| 2493 |
+
"grad_norm": 4.788120269775391,
|
| 2494 |
+
"learning_rate": 2.8989473684210526e-06,
|
| 2495 |
+
"loss": 0.1688,
|
| 2496 |
+
"step": 8625
|
| 2497 |
+
},
|
| 2498 |
+
{
|
| 2499 |
+
"epoch": 14.274153592072667,
|
| 2500 |
+
"grad_norm": 4.258752822875977,
|
| 2501 |
+
"learning_rate": 2.8463157894736843e-06,
|
| 2502 |
+
"loss": 0.1623,
|
| 2503 |
+
"step": 8650
|
| 2504 |
+
},
|
| 2505 |
+
{
|
| 2506 |
+
"epoch": 14.315441783649876,
|
| 2507 |
+
"grad_norm": 5.6167988777160645,
|
| 2508 |
+
"learning_rate": 2.7936842105263163e-06,
|
| 2509 |
+
"loss": 0.1736,
|
| 2510 |
+
"step": 8675
|
| 2511 |
+
},
|
| 2512 |
+
{
|
| 2513 |
+
"epoch": 14.356729975227084,
|
| 2514 |
+
"grad_norm": 4.973904609680176,
|
| 2515 |
+
"learning_rate": 2.7410526315789476e-06,
|
| 2516 |
+
"loss": 0.163,
|
| 2517 |
+
"step": 8700
|
| 2518 |
+
},
|
| 2519 |
+
{
|
| 2520 |
+
"epoch": 14.398018166804293,
|
| 2521 |
+
"grad_norm": 5.393108367919922,
|
| 2522 |
+
"learning_rate": 2.688421052631579e-06,
|
| 2523 |
+
"loss": 0.1721,
|
| 2524 |
+
"step": 8725
|
| 2525 |
+
},
|
| 2526 |
+
{
|
| 2527 |
+
"epoch": 14.439306358381502,
|
| 2528 |
+
"grad_norm": 3.455310583114624,
|
| 2529 |
+
"learning_rate": 2.635789473684211e-06,
|
| 2530 |
+
"loss": 0.1762,
|
| 2531 |
+
"step": 8750
|
| 2532 |
+
},
|
| 2533 |
+
{
|
| 2534 |
+
"epoch": 14.480594549958711,
|
| 2535 |
+
"grad_norm": 4.485291957855225,
|
| 2536 |
+
"learning_rate": 2.5831578947368425e-06,
|
| 2537 |
+
"loss": 0.167,
|
| 2538 |
+
"step": 8775
|
| 2539 |
+
},
|
| 2540 |
+
{
|
| 2541 |
+
"epoch": 14.52188274153592,
|
| 2542 |
+
"grad_norm": 5.023384094238281,
|
| 2543 |
+
"learning_rate": 2.5305263157894737e-06,
|
| 2544 |
+
"loss": 0.1797,
|
| 2545 |
+
"step": 8800
|
| 2546 |
+
},
|
| 2547 |
+
{
|
| 2548 |
+
"epoch": 14.56317093311313,
|
| 2549 |
+
"grad_norm": 3.6772608757019043,
|
| 2550 |
+
"learning_rate": 2.4778947368421053e-06,
|
| 2551 |
+
"loss": 0.1688,
|
| 2552 |
+
"step": 8825
|
| 2553 |
+
},
|
| 2554 |
+
{
|
| 2555 |
+
"epoch": 14.604459124690338,
|
| 2556 |
+
"grad_norm": 4.417513847351074,
|
| 2557 |
+
"learning_rate": 2.425263157894737e-06,
|
| 2558 |
+
"loss": 0.176,
|
| 2559 |
+
"step": 8850
|
| 2560 |
+
},
|
| 2561 |
+
{
|
| 2562 |
+
"epoch": 14.645747316267547,
|
| 2563 |
+
"grad_norm": 5.2892231941223145,
|
| 2564 |
+
"learning_rate": 2.3726315789473686e-06,
|
| 2565 |
+
"loss": 0.1802,
|
| 2566 |
+
"step": 8875
|
| 2567 |
+
},
|
| 2568 |
+
{
|
| 2569 |
+
"epoch": 14.687035507844756,
|
| 2570 |
+
"grad_norm": 5.4643025398254395,
|
| 2571 |
+
"learning_rate": 2.3200000000000002e-06,
|
| 2572 |
+
"loss": 0.1914,
|
| 2573 |
+
"step": 8900
|
| 2574 |
+
},
|
| 2575 |
+
{
|
| 2576 |
+
"epoch": 14.728323699421965,
|
| 2577 |
+
"grad_norm": 3.4271011352539062,
|
| 2578 |
+
"learning_rate": 2.267368421052632e-06,
|
| 2579 |
+
"loss": 0.1668,
|
| 2580 |
+
"step": 8925
|
| 2581 |
+
},
|
| 2582 |
+
{
|
| 2583 |
+
"epoch": 14.769611890999174,
|
| 2584 |
+
"grad_norm": 4.431731224060059,
|
| 2585 |
+
"learning_rate": 2.2147368421052635e-06,
|
| 2586 |
+
"loss": 0.1725,
|
| 2587 |
+
"step": 8950
|
| 2588 |
+
},
|
| 2589 |
+
{
|
| 2590 |
+
"epoch": 14.810900082576383,
|
| 2591 |
+
"grad_norm": 3.5097200870513916,
|
| 2592 |
+
"learning_rate": 2.1621052631578947e-06,
|
| 2593 |
+
"loss": 0.169,
|
| 2594 |
+
"step": 8975
|
| 2595 |
+
},
|
| 2596 |
+
{
|
| 2597 |
+
"epoch": 14.852188274153592,
|
| 2598 |
+
"grad_norm": 4.471765995025635,
|
| 2599 |
+
"learning_rate": 2.1094736842105264e-06,
|
| 2600 |
+
"loss": 0.1424,
|
| 2601 |
+
"step": 9000
|
| 2602 |
+
},
|
| 2603 |
+
{
|
| 2604 |
+
"epoch": 14.852188274153592,
|
| 2605 |
+
"eval_loss": 1.1418445110321045,
|
| 2606 |
+
"eval_runtime": 697.6196,
|
| 2607 |
+
"eval_samples_per_second": 15.167,
|
| 2608 |
+
"eval_steps_per_second": 1.264,
|
| 2609 |
+
"eval_wer": Infinity,
|
| 2610 |
+
"step": 9000
|
| 2611 |
}
|
| 2612 |
],
|
| 2613 |
"logging_steps": 25,
|
|
|
|
| 2627 |
"attributes": {}
|
| 2628 |
}
|
| 2629 |
},
|
| 2630 |
+
"total_flos": 1.754287797436416e+19,
|
| 2631 |
"train_batch_size": 12,
|
| 2632 |
"trial_name": null,
|
| 2633 |
"trial_params": null
|