Instructions to use ypl/bart_test_p2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use ypl/bart_test_p2 with Transformers:
# Load model directly from transformers import AutoTokenizer, AutoModelForSeq2SeqLM tokenizer = AutoTokenizer.from_pretrained("ypl/bart_test_p2") model = AutoModelForSeq2SeqLM.from_pretrained("ypl/bart_test_p2", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_metric": 0.016377536579966545, | |
| "best_model_checkpoint": "bart_test_p2/checkpoint-8500", | |
| "epoch": 2.9782761037140855, | |
| "eval_steps": 500, | |
| "global_step": 8500, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0, | |
| "learning_rate": 9.99883204858678e-06, | |
| "loss": 0.0025, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "learning_rate": 9.416024293389396e-06, | |
| "loss": 0.0083, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "eval_loss": 0.022603686898946762, | |
| "eval_runtime": 64.8155, | |
| "eval_samples_per_second": 150.952, | |
| "eval_steps_per_second": 18.869, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "learning_rate": 8.83204858677879e-06, | |
| "loss": 0.0075, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "eval_loss": 0.022469399496912956, | |
| "eval_runtime": 64.9299, | |
| "eval_samples_per_second": 150.686, | |
| "eval_steps_per_second": 18.836, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "learning_rate": 8.248072880168185e-06, | |
| "loss": 0.0073, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "eval_loss": 0.021044988185167313, | |
| "eval_runtime": 64.7915, | |
| "eval_samples_per_second": 151.008, | |
| "eval_steps_per_second": 18.876, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "learning_rate": 7.664097173557581e-06, | |
| "loss": 0.0062, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "eval_loss": 0.02233254536986351, | |
| "eval_runtime": 64.8144, | |
| "eval_samples_per_second": 150.954, | |
| "eval_steps_per_second": 18.869, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "learning_rate": 7.080121466946975e-06, | |
| "loss": 0.007, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "eval_loss": 0.020101269707083702, | |
| "eval_runtime": 64.955, | |
| "eval_samples_per_second": 150.627, | |
| "eval_steps_per_second": 18.828, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "learning_rate": 6.496145760336371e-06, | |
| "loss": 0.0072, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "eval_loss": 0.020503461360931396, | |
| "eval_runtime": 64.8414, | |
| "eval_samples_per_second": 150.891, | |
| "eval_steps_per_second": 18.861, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "learning_rate": 5.912170053725765e-06, | |
| "loss": 0.006, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "eval_loss": 0.01998145505785942, | |
| "eval_runtime": 64.8121, | |
| "eval_samples_per_second": 150.96, | |
| "eval_steps_per_second": 18.87, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "learning_rate": 5.328194347115161e-06, | |
| "loss": 0.005, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "eval_loss": 0.020134715363383293, | |
| "eval_runtime": 65.0335, | |
| "eval_samples_per_second": 150.445, | |
| "eval_steps_per_second": 18.806, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "learning_rate": 4.744218640504556e-06, | |
| "loss": 0.0058, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "eval_loss": 0.019398093223571777, | |
| "eval_runtime": 64.8875, | |
| "eval_samples_per_second": 150.784, | |
| "eval_steps_per_second": 18.848, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "learning_rate": 4.16024293389395e-06, | |
| "loss": 0.0062, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "eval_loss": 0.018503881990909576, | |
| "eval_runtime": 64.9786, | |
| "eval_samples_per_second": 150.573, | |
| "eval_steps_per_second": 18.822, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "learning_rate": 3.5762672272833454e-06, | |
| "loss": 0.0068, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "eval_loss": 0.017726033926010132, | |
| "eval_runtime": 64.7672, | |
| "eval_samples_per_second": 151.064, | |
| "eval_steps_per_second": 18.883, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 2.1, | |
| "learning_rate": 2.9922915206727405e-06, | |
| "loss": 0.0069, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 2.1, | |
| "eval_loss": 0.017498329281806946, | |
| "eval_runtime": 64.8308, | |
| "eval_samples_per_second": 150.916, | |
| "eval_steps_per_second": 18.864, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 2.28, | |
| "learning_rate": 2.4083158140621352e-06, | |
| "loss": 0.0061, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 2.28, | |
| "eval_loss": 0.017673367634415627, | |
| "eval_runtime": 64.856, | |
| "eval_samples_per_second": 150.857, | |
| "eval_steps_per_second": 18.857, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 2.45, | |
| "learning_rate": 1.8243401074515301e-06, | |
| "loss": 0.0074, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 2.45, | |
| "eval_loss": 0.017499757930636406, | |
| "eval_runtime": 64.9811, | |
| "eval_samples_per_second": 150.567, | |
| "eval_steps_per_second": 18.821, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 2.63, | |
| "learning_rate": 1.2403644008409253e-06, | |
| "loss": 0.0092, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 2.63, | |
| "eval_loss": 0.016884520649909973, | |
| "eval_runtime": 64.8891, | |
| "eval_samples_per_second": 150.78, | |
| "eval_steps_per_second": 18.848, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 2.8, | |
| "learning_rate": 6.563886942303201e-07, | |
| "loss": 0.011, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 2.8, | |
| "eval_loss": 0.016412850469350815, | |
| "eval_runtime": 64.9682, | |
| "eval_samples_per_second": 150.597, | |
| "eval_steps_per_second": 18.825, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 2.98, | |
| "learning_rate": 7.241298761971503e-08, | |
| "loss": 0.0125, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 2.98, | |
| "eval_loss": 0.016377536579966545, | |
| "eval_runtime": 64.7805, | |
| "eval_samples_per_second": 151.033, | |
| "eval_steps_per_second": 18.879, | |
| "step": 8500 | |
| } | |
| ], | |
| "logging_steps": 500, | |
| "max_steps": 8562, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "total_flos": 2548110095032320.0, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |