Text Generation
PEFT
Safetensors
lora
qlora
tool-calling
agentic
function-calling
cohere
tiny-aya
sft
trl
conversational
Instructions to use ferscm44/tiny-aya-agent with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use ferscm44/tiny-aya-agent with PEFT:
Task type is invalid.
- Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 3.0, | |
| "eval_steps": 500, | |
| "global_step": 60, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 0.3058870881795883, | |
| "epoch": 0.05063291139240506, | |
| "grad_norm": 1.2109375, | |
| "learning_rate": 0.0, | |
| "loss": 0.8967164754867554, | |
| "mean_token_accuracy": 0.7853250801563263, | |
| "num_tokens": 4094.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 0.2770821340382099, | |
| "epoch": 0.10126582278481013, | |
| "grad_norm": 1.1953125, | |
| "learning_rate": 4e-05, | |
| "loss": 0.8378055095672607, | |
| "mean_token_accuracy": 0.8762781769037247, | |
| "num_tokens": 8270.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 0.33289381861686707, | |
| "epoch": 0.1518987341772152, | |
| "grad_norm": 2.28125, | |
| "learning_rate": 8e-05, | |
| "loss": 1.3381309509277344, | |
| "mean_token_accuracy": 0.8489641100168228, | |
| "num_tokens": 12538.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 0.2396358586847782, | |
| "epoch": 0.20253164556962025, | |
| "grad_norm": 0.8125, | |
| "learning_rate": 0.00012, | |
| "loss": 0.4996604919433594, | |
| "mean_token_accuracy": 0.9098183065652847, | |
| "num_tokens": 16803.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 0.3024279847741127, | |
| "epoch": 0.25316455696202533, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.00016, | |
| "loss": 0.57768714427948, | |
| "mean_token_accuracy": 0.8811647891998291, | |
| "num_tokens": 21541.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 0.2746536508202553, | |
| "epoch": 0.3037974683544304, | |
| "grad_norm": 0.84375, | |
| "learning_rate": 0.0002, | |
| "loss": 0.2727876305580139, | |
| "mean_token_accuracy": 0.925768256187439, | |
| "num_tokens": 25660.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 0.21791627258062363, | |
| "epoch": 0.35443037974683544, | |
| "grad_norm": 0.515625, | |
| "learning_rate": 0.00019636363636363636, | |
| "loss": 0.13589006662368774, | |
| "mean_token_accuracy": 0.9386249780654907, | |
| "num_tokens": 29675.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 0.23072286322712898, | |
| "epoch": 0.4050632911392405, | |
| "grad_norm": 0.66796875, | |
| "learning_rate": 0.00019272727272727274, | |
| "loss": 0.22619852423667908, | |
| "mean_token_accuracy": 0.9601024985313416, | |
| "num_tokens": 33786.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 0.12776251882314682, | |
| "epoch": 0.45569620253164556, | |
| "grad_norm": 0.3359375, | |
| "learning_rate": 0.0001890909090909091, | |
| "loss": 0.12999381124973297, | |
| "mean_token_accuracy": 0.964403823018074, | |
| "num_tokens": 38029.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 0.15997863747179508, | |
| "epoch": 0.5063291139240507, | |
| "grad_norm": 0.380859375, | |
| "learning_rate": 0.00018545454545454545, | |
| "loss": 0.1289505809545517, | |
| "mean_token_accuracy": 0.9806439429521561, | |
| "num_tokens": 41940.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 0.17812986858189106, | |
| "epoch": 0.5569620253164557, | |
| "grad_norm": 0.6328125, | |
| "learning_rate": 0.00018181818181818183, | |
| "loss": 0.09373250603675842, | |
| "mean_token_accuracy": 0.9405141770839691, | |
| "num_tokens": 45774.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 0.12172849662601948, | |
| "epoch": 0.6075949367088608, | |
| "grad_norm": 0.2177734375, | |
| "learning_rate": 0.0001781818181818182, | |
| "loss": 0.03453471511602402, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 49748.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 0.18016426265239716, | |
| "epoch": 0.6582278481012658, | |
| "grad_norm": 0.28125, | |
| "learning_rate": 0.00017454545454545454, | |
| "loss": 0.156061589717865, | |
| "mean_token_accuracy": 0.9543326944112778, | |
| "num_tokens": 54197.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 0.13954658806324005, | |
| "epoch": 0.7088607594936709, | |
| "grad_norm": 0.296875, | |
| "learning_rate": 0.0001709090909090909, | |
| "loss": 0.10283268988132477, | |
| "mean_token_accuracy": 0.9802946299314499, | |
| "num_tokens": 58556.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 0.08406208734959364, | |
| "epoch": 0.759493670886076, | |
| "grad_norm": 0.5234375, | |
| "learning_rate": 0.00016727272727272728, | |
| "loss": 0.057560667395591736, | |
| "mean_token_accuracy": 0.9583040475845337, | |
| "num_tokens": 62314.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 0.14593530632555485, | |
| "epoch": 0.810126582278481, | |
| "grad_norm": 0.2890625, | |
| "learning_rate": 0.00016363636363636366, | |
| "loss": 0.13262268900871277, | |
| "mean_token_accuracy": 0.9821915328502655, | |
| "num_tokens": 66709.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 0.12713714689016342, | |
| "epoch": 0.8607594936708861, | |
| "grad_norm": 0.232421875, | |
| "learning_rate": 0.00016, | |
| "loss": 0.098836250603199, | |
| "mean_token_accuracy": 0.9742450714111328, | |
| "num_tokens": 71033.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 0.07605009153485298, | |
| "epoch": 0.9113924050632911, | |
| "grad_norm": 0.275390625, | |
| "learning_rate": 0.00015636363636363637, | |
| "loss": 0.06675960123538971, | |
| "mean_token_accuracy": 0.9730987101793289, | |
| "num_tokens": 75240.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 0.08511319197714329, | |
| "epoch": 0.9620253164556962, | |
| "grad_norm": 0.251953125, | |
| "learning_rate": 0.00015272727272727275, | |
| "loss": 0.06137944757938385, | |
| "mean_token_accuracy": 0.9560078978538513, | |
| "num_tokens": 79484.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 0.09591637427608173, | |
| "epoch": 1.0, | |
| "grad_norm": 0.1982421875, | |
| "learning_rate": 0.0001490909090909091, | |
| "loss": 0.09518605470657349, | |
| "mean_token_accuracy": 0.9860279361406962, | |
| "num_tokens": 82572.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 0.09083444299176335, | |
| "epoch": 1.0506329113924051, | |
| "grad_norm": 0.2294921875, | |
| "learning_rate": 0.00014545454545454546, | |
| "loss": 0.06781512498855591, | |
| "mean_token_accuracy": 0.9847126454114914, | |
| "num_tokens": 87051.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 0.07092627324163914, | |
| "epoch": 1.1012658227848102, | |
| "grad_norm": 0.1875, | |
| "learning_rate": 0.00014181818181818184, | |
| "loss": 0.051979709416627884, | |
| "mean_token_accuracy": 0.9823355972766876, | |
| "num_tokens": 91753.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 0.05573681928217411, | |
| "epoch": 1.1518987341772151, | |
| "grad_norm": 0.373046875, | |
| "learning_rate": 0.0001381818181818182, | |
| "loss": 0.04127391055226326, | |
| "mean_token_accuracy": 0.9915009140968323, | |
| "num_tokens": 95997.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 0.06601053988561034, | |
| "epoch": 1.2025316455696202, | |
| "grad_norm": 0.1669921875, | |
| "learning_rate": 0.00013454545454545455, | |
| "loss": 0.029800206422805786, | |
| "mean_token_accuracy": 0.99110147356987, | |
| "num_tokens": 100340.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 0.06689108535647392, | |
| "epoch": 1.2531645569620253, | |
| "grad_norm": 0.1572265625, | |
| "learning_rate": 0.00013090909090909093, | |
| "loss": 0.03818785399198532, | |
| "mean_token_accuracy": 0.98154416680336, | |
| "num_tokens": 104255.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 0.11440154490992427, | |
| "epoch": 1.3037974683544304, | |
| "grad_norm": 0.197265625, | |
| "learning_rate": 0.00012727272727272728, | |
| "loss": 0.07071410864591599, | |
| "mean_token_accuracy": 0.9655913859605789, | |
| "num_tokens": 108510.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 0.05173112731426954, | |
| "epoch": 1.3544303797468356, | |
| "grad_norm": 0.181640625, | |
| "learning_rate": 0.00012363636363636364, | |
| "loss": 0.04332485422492027, | |
| "mean_token_accuracy": 0.9889708757400513, | |
| "num_tokens": 112648.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 0.11879035737365484, | |
| "epoch": 1.4050632911392404, | |
| "grad_norm": 0.2890625, | |
| "learning_rate": 0.00012, | |
| "loss": 0.030448323115706444, | |
| "mean_token_accuracy": 0.9249999970197678, | |
| "num_tokens": 116428.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 0.04456495773047209, | |
| "epoch": 1.4556962025316456, | |
| "grad_norm": 0.263671875, | |
| "learning_rate": 0.00011636363636363636, | |
| "loss": 0.026923775672912598, | |
| "mean_token_accuracy": 0.9970930218696594, | |
| "num_tokens": 120223.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 0.05467428918927908, | |
| "epoch": 1.5063291139240507, | |
| "grad_norm": 0.30078125, | |
| "learning_rate": 0.00011272727272727272, | |
| "loss": 0.05243736505508423, | |
| "mean_token_accuracy": 0.9819361567497253, | |
| "num_tokens": 124463.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.12604457885026932, | |
| "epoch": 1.5569620253164556, | |
| "grad_norm": 0.232421875, | |
| "learning_rate": 0.00010909090909090909, | |
| "loss": 0.09929254651069641, | |
| "mean_token_accuracy": 0.9316810220479965, | |
| "num_tokens": 128541.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 0.05706793861463666, | |
| "epoch": 1.6075949367088609, | |
| "grad_norm": 0.1513671875, | |
| "learning_rate": 0.00010545454545454545, | |
| "loss": 0.06422308087348938, | |
| "mean_token_accuracy": 0.986874520778656, | |
| "num_tokens": 133117.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 0.07498226407915354, | |
| "epoch": 1.6582278481012658, | |
| "grad_norm": 0.21484375, | |
| "learning_rate": 0.00010181818181818181, | |
| "loss": 0.0917193740606308, | |
| "mean_token_accuracy": 0.9649497419595718, | |
| "num_tokens": 137164.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 0.04969165986403823, | |
| "epoch": 1.7088607594936709, | |
| "grad_norm": 0.1845703125, | |
| "learning_rate": 9.818181818181818e-05, | |
| "loss": 0.03874623030424118, | |
| "mean_token_accuracy": 0.9855220764875412, | |
| "num_tokens": 141297.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 0.059562995098531246, | |
| "epoch": 1.759493670886076, | |
| "grad_norm": 0.234375, | |
| "learning_rate": 9.454545454545455e-05, | |
| "loss": 0.07269799709320068, | |
| "mean_token_accuracy": 0.9904753267765045, | |
| "num_tokens": 145157.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 0.06618588929995894, | |
| "epoch": 1.810126582278481, | |
| "grad_norm": 0.154296875, | |
| "learning_rate": 9.090909090909092e-05, | |
| "loss": 0.05096203833818436, | |
| "mean_token_accuracy": 0.9642254859209061, | |
| "num_tokens": 149499.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 0.06980292382650077, | |
| "epoch": 1.8607594936708862, | |
| "grad_norm": 0.2080078125, | |
| "learning_rate": 8.727272727272727e-05, | |
| "loss": 0.015605948865413666, | |
| "mean_token_accuracy": 0.9749999940395355, | |
| "num_tokens": 153413.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 0.0673763882368803, | |
| "epoch": 1.9113924050632911, | |
| "grad_norm": 0.56640625, | |
| "learning_rate": 8.363636363636364e-05, | |
| "loss": 0.12869100272655487, | |
| "mean_token_accuracy": 0.9618695080280304, | |
| "num_tokens": 157547.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 0.04205051809549332, | |
| "epoch": 1.9620253164556962, | |
| "grad_norm": 0.1533203125, | |
| "learning_rate": 8e-05, | |
| "loss": 0.051324643194675446, | |
| "mean_token_accuracy": 0.9915735274553299, | |
| "num_tokens": 161912.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 0.03731320612132549, | |
| "epoch": 2.0, | |
| "grad_norm": 0.15234375, | |
| "learning_rate": 7.636363636363637e-05, | |
| "loss": 0.03378448635339737, | |
| "mean_token_accuracy": 0.9946303764979044, | |
| "num_tokens": 165144.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.07533124275505543, | |
| "epoch": 2.050632911392405, | |
| "grad_norm": 0.216796875, | |
| "learning_rate": 7.272727272727273e-05, | |
| "loss": 0.04694521799683571, | |
| "mean_token_accuracy": 0.9949748814105988, | |
| "num_tokens": 169344.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 0.045258086174726486, | |
| "epoch": 2.1012658227848102, | |
| "grad_norm": 0.158203125, | |
| "learning_rate": 6.90909090909091e-05, | |
| "loss": 0.03484552353620529, | |
| "mean_token_accuracy": 0.9914986789226532, | |
| "num_tokens": 173572.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 0.05962226795963943, | |
| "epoch": 2.151898734177215, | |
| "grad_norm": 0.15234375, | |
| "learning_rate": 6.545454545454546e-05, | |
| "loss": 0.05552398040890694, | |
| "mean_token_accuracy": 0.9867942631244659, | |
| "num_tokens": 178049.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 0.04453732492402196, | |
| "epoch": 2.2025316455696204, | |
| "grad_norm": 0.25, | |
| "learning_rate": 6.181818181818182e-05, | |
| "loss": 0.07184948027133942, | |
| "mean_token_accuracy": 0.9885145127773285, | |
| "num_tokens": 182147.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 0.036392109002918005, | |
| "epoch": 2.2531645569620253, | |
| "grad_norm": 0.26953125, | |
| "learning_rate": 5.818181818181818e-05, | |
| "loss": 0.028611719608306885, | |
| "mean_token_accuracy": 0.9898450970649719, | |
| "num_tokens": 186075.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 0.046361514599993825, | |
| "epoch": 2.3037974683544302, | |
| "grad_norm": 0.1630859375, | |
| "learning_rate": 5.4545454545454546e-05, | |
| "loss": 0.02000986412167549, | |
| "mean_token_accuracy": 0.9895833283662796, | |
| "num_tokens": 189736.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 0.059202448232099414, | |
| "epoch": 2.3544303797468356, | |
| "grad_norm": 0.2216796875, | |
| "learning_rate": 5.090909090909091e-05, | |
| "loss": 0.03575129061937332, | |
| "mean_token_accuracy": 0.9949752688407898, | |
| "num_tokens": 194069.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 0.0532573452219367, | |
| "epoch": 2.4050632911392404, | |
| "grad_norm": 0.13671875, | |
| "learning_rate": 4.7272727272727275e-05, | |
| "loss": 0.037198036909103394, | |
| "mean_token_accuracy": 0.9947335422039032, | |
| "num_tokens": 198435.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 0.046060606604442, | |
| "epoch": 2.4556962025316453, | |
| "grad_norm": 0.171875, | |
| "learning_rate": 4.3636363636363636e-05, | |
| "loss": 0.0407770499587059, | |
| "mean_token_accuracy": 0.9934192597866058, | |
| "num_tokens": 202365.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 0.051424249075353146, | |
| "epoch": 2.5063291139240507, | |
| "grad_norm": 0.2353515625, | |
| "learning_rate": 4e-05, | |
| "loss": 0.04629915952682495, | |
| "mean_token_accuracy": 0.9804457575082779, | |
| "num_tokens": 206300.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.05351645685732365, | |
| "epoch": 2.5569620253164556, | |
| "grad_norm": 0.1474609375, | |
| "learning_rate": 3.6363636363636364e-05, | |
| "loss": 0.03186073899269104, | |
| "mean_token_accuracy": 0.9686382859945297, | |
| "num_tokens": 210440.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 0.0505744197871536, | |
| "epoch": 2.607594936708861, | |
| "grad_norm": 0.1328125, | |
| "learning_rate": 3.272727272727273e-05, | |
| "loss": 0.034618668258190155, | |
| "mean_token_accuracy": 0.9690476208925247, | |
| "num_tokens": 214755.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 0.09076045430265367, | |
| "epoch": 2.6582278481012658, | |
| "grad_norm": 0.1123046875, | |
| "learning_rate": 2.909090909090909e-05, | |
| "loss": 0.03738842159509659, | |
| "mean_token_accuracy": 0.9946236610412598, | |
| "num_tokens": 219052.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 0.03509035054594278, | |
| "epoch": 2.708860759493671, | |
| "grad_norm": 0.09716796875, | |
| "learning_rate": 2.5454545454545454e-05, | |
| "loss": 0.017466925084590912, | |
| "mean_token_accuracy": 0.9951923042535782, | |
| "num_tokens": 223211.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 0.03864420251920819, | |
| "epoch": 2.759493670886076, | |
| "grad_norm": 0.10595703125, | |
| "learning_rate": 2.1818181818181818e-05, | |
| "loss": 0.023350555449724197, | |
| "mean_token_accuracy": 0.9902347922325134, | |
| "num_tokens": 227258.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 0.06260875472798944, | |
| "epoch": 2.810126582278481, | |
| "grad_norm": 0.2333984375, | |
| "learning_rate": 1.8181818181818182e-05, | |
| "loss": 0.06964948028326035, | |
| "mean_token_accuracy": 0.9637512564659119, | |
| "num_tokens": 231368.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 0.03902584942989051, | |
| "epoch": 2.8607594936708862, | |
| "grad_norm": 0.08447265625, | |
| "learning_rate": 1.4545454545454545e-05, | |
| "loss": 0.026787985116243362, | |
| "mean_token_accuracy": 0.9909819066524506, | |
| "num_tokens": 235881.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 0.026682122610509396, | |
| "epoch": 2.911392405063291, | |
| "grad_norm": 0.1455078125, | |
| "learning_rate": 1.0909090909090909e-05, | |
| "loss": 0.017513107508420944, | |
| "mean_token_accuracy": 0.9918909966945648, | |
| "num_tokens": 240330.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 0.02819057530723512, | |
| "epoch": 2.962025316455696, | |
| "grad_norm": 0.126953125, | |
| "learning_rate": 7.272727272727272e-06, | |
| "loss": 0.016973333433270454, | |
| "mean_token_accuracy": 0.9969512224197388, | |
| "num_tokens": 244397.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 0.09315565973520279, | |
| "epoch": 3.0, | |
| "grad_norm": 0.1376953125, | |
| "learning_rate": 3.636363636363636e-06, | |
| "loss": 0.037921059876680374, | |
| "mean_token_accuracy": 0.9591470758120219, | |
| "num_tokens": 247716.0, | |
| "step": 60 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 60, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4269851314864128.0, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |