Instructions to use arshjaved/shake-spear-neftune with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use arshjaved/shake-spear-neftune with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("TinyLlama/TinyLlama-1.1B-Chat-v1.0") model = PeftModel.from_pretrained(base_model, "arshjaved/shake-spear-neftune") - Transformers
How to use arshjaved/shake-spear-neftune with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="arshjaved/shake-spear-neftune", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("arshjaved/shake-spear-neftune", dtype="auto", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use arshjaved/shake-spear-neftune with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "arshjaved/shake-spear-neftune" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "arshjaved/shake-spear-neftune", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/arshjaved/shake-spear-neftune
- SGLang
How to use arshjaved/shake-spear-neftune with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "arshjaved/shake-spear-neftune" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "arshjaved/shake-spear-neftune", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "arshjaved/shake-spear-neftune" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "arshjaved/shake-spear-neftune", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use arshjaved/shake-spear-neftune with Docker Model Runner:
docker model run hf.co/arshjaved/shake-spear-neftune
| { | |
| "best_global_step": 520, | |
| "best_metric": 1.7184369564056396, | |
| "best_model_checkpoint": "/kaggle/working/exp_a/checkpoint-520", | |
| "epoch": 5.0, | |
| "eval_steps": 500, | |
| "global_step": 520, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 2.5125404238700866, | |
| "epoch": 0.04819277108433735, | |
| "grad_norm": 3.107343912124634, | |
| "learning_rate": 8e-05, | |
| "loss": 3.331409454345703, | |
| "mean_token_accuracy": 0.4246453382074833, | |
| "num_tokens": 3544.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 2.473379173874855, | |
| "epoch": 0.0963855421686747, | |
| "grad_norm": 4.13798189163208, | |
| "learning_rate": 0.00018, | |
| "loss": 3.170204734802246, | |
| "mean_token_accuracy": 0.44643297120928765, | |
| "num_tokens": 6921.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 2.7136070847511293, | |
| "epoch": 0.14457831325301204, | |
| "grad_norm": 1.889716625213623, | |
| "learning_rate": 0.00019843137254901963, | |
| "loss": 2.8694551467895506, | |
| "mean_token_accuracy": 0.4593485899269581, | |
| "num_tokens": 9897.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 2.638975989818573, | |
| "epoch": 0.1927710843373494, | |
| "grad_norm": 1.5089645385742188, | |
| "learning_rate": 0.00019647058823529413, | |
| "loss": 2.4013465881347655, | |
| "mean_token_accuracy": 0.5249107554554939, | |
| "num_tokens": 13386.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 2.554114228487015, | |
| "epoch": 0.24096385542168675, | |
| "grad_norm": 1.3503361940383911, | |
| "learning_rate": 0.00019450980392156863, | |
| "loss": 2.3163000106811524, | |
| "mean_token_accuracy": 0.56058479398489, | |
| "num_tokens": 16770.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 2.2394246786832808, | |
| "epoch": 0.2891566265060241, | |
| "grad_norm": 1.2784709930419922, | |
| "learning_rate": 0.00019254901960784316, | |
| "loss": 2.078316879272461, | |
| "mean_token_accuracy": 0.5896236382424831, | |
| "num_tokens": 19815.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 2.1424703538417815, | |
| "epoch": 0.3373493975903614, | |
| "grad_norm": 2.2359020709991455, | |
| "learning_rate": 0.00019058823529411766, | |
| "loss": 2.087246894836426, | |
| "mean_token_accuracy": 0.5787902362644672, | |
| "num_tokens": 22956.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 2.093654748797417, | |
| "epoch": 0.3855421686746988, | |
| "grad_norm": 2.349356174468994, | |
| "learning_rate": 0.00018862745098039216, | |
| "loss": 2.0384281158447264, | |
| "mean_token_accuracy": 0.5887037836015224, | |
| "num_tokens": 26147.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 2.0577339619398116, | |
| "epoch": 0.43373493975903615, | |
| "grad_norm": 1.649864912033081, | |
| "learning_rate": 0.0001866666666666667, | |
| "loss": 2.0328414916992186, | |
| "mean_token_accuracy": 0.602185083180666, | |
| "num_tokens": 29290.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 2.033597409725189, | |
| "epoch": 0.4819277108433735, | |
| "grad_norm": 1.2588778734207153, | |
| "learning_rate": 0.0001847058823529412, | |
| "loss": 2.0368608474731444, | |
| "mean_token_accuracy": 0.5883708715438842, | |
| "num_tokens": 32774.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 1.9881025731563569, | |
| "epoch": 0.5301204819277109, | |
| "grad_norm": 1.3411701917648315, | |
| "learning_rate": 0.0001827450980392157, | |
| "loss": 1.946812629699707, | |
| "mean_token_accuracy": 0.5845362402498722, | |
| "num_tokens": 36361.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 1.974584263563156, | |
| "epoch": 0.5783132530120482, | |
| "grad_norm": 2.2939326763153076, | |
| "learning_rate": 0.00018078431372549022, | |
| "loss": 2.0149436950683595, | |
| "mean_token_accuracy": 0.5910582594573498, | |
| "num_tokens": 39883.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 1.892711740732193, | |
| "epoch": 0.6265060240963856, | |
| "grad_norm": 2.040877342224121, | |
| "learning_rate": 0.00017882352941176472, | |
| "loss": 1.8759027481079102, | |
| "mean_token_accuracy": 0.617172273248434, | |
| "num_tokens": 43257.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 1.921028771996498, | |
| "epoch": 0.6746987951807228, | |
| "grad_norm": 1.2713969945907593, | |
| "learning_rate": 0.00017686274509803922, | |
| "loss": 1.8866106033325196, | |
| "mean_token_accuracy": 0.6131292454898357, | |
| "num_tokens": 46204.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 1.8816440194845199, | |
| "epoch": 0.7228915662650602, | |
| "grad_norm": 1.4800573587417603, | |
| "learning_rate": 0.00017490196078431375, | |
| "loss": 1.9057266235351562, | |
| "mean_token_accuracy": 0.5993098318576813, | |
| "num_tokens": 49793.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 1.8062270611524582, | |
| "epoch": 0.7710843373493976, | |
| "grad_norm": 2.195326566696167, | |
| "learning_rate": 0.00017294117647058825, | |
| "loss": 1.8263084411621093, | |
| "mean_token_accuracy": 0.6268978863954544, | |
| "num_tokens": 53104.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 1.7734803646802901, | |
| "epoch": 0.8192771084337349, | |
| "grad_norm": 1.90998375415802, | |
| "learning_rate": 0.00017098039215686275, | |
| "loss": 1.7766584396362304, | |
| "mean_token_accuracy": 0.6333199128508568, | |
| "num_tokens": 56062.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 1.8309715777635573, | |
| "epoch": 0.8674698795180723, | |
| "grad_norm": 1.3006683588027954, | |
| "learning_rate": 0.00016901960784313725, | |
| "loss": 1.857182502746582, | |
| "mean_token_accuracy": 0.6287190951406956, | |
| "num_tokens": 59161.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 1.8734614104032516, | |
| "epoch": 0.9156626506024096, | |
| "grad_norm": 1.5136709213256836, | |
| "learning_rate": 0.00016705882352941178, | |
| "loss": 1.8590967178344726, | |
| "mean_token_accuracy": 0.6196285620331764, | |
| "num_tokens": 62426.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 1.7397653341293335, | |
| "epoch": 0.963855421686747, | |
| "grad_norm": 1.647998571395874, | |
| "learning_rate": 0.00016509803921568628, | |
| "loss": 1.7337995529174806, | |
| "mean_token_accuracy": 0.6293763548135758, | |
| "num_tokens": 65573.0, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_entropy": 1.8366776154591486, | |
| "eval_loss": 1.8674575090408325, | |
| "eval_mean_token_accuracy": 0.5964838358072134, | |
| "eval_num_tokens": 68001.0, | |
| "eval_runtime": 14.8665, | |
| "eval_samples_per_second": 13.991, | |
| "eval_steps_per_second": 1.749, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 1.7183971075635207, | |
| "epoch": 1.0096385542168675, | |
| "grad_norm": 2.0711727142333984, | |
| "learning_rate": 0.00016313725490196078, | |
| "loss": 1.7683034896850587, | |
| "mean_token_accuracy": 0.6259415377127496, | |
| "num_tokens": 68613.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 1.8635606437921524, | |
| "epoch": 1.0578313253012048, | |
| "grad_norm": 1.2785375118255615, | |
| "learning_rate": 0.0001611764705882353, | |
| "loss": 1.8564044952392578, | |
| "mean_token_accuracy": 0.6166318386793137, | |
| "num_tokens": 72379.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 1.8101747632026672, | |
| "epoch": 1.106024096385542, | |
| "grad_norm": 1.634289264678955, | |
| "learning_rate": 0.0001592156862745098, | |
| "loss": 1.8175914764404297, | |
| "mean_token_accuracy": 0.6229961954057217, | |
| "num_tokens": 75330.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 1.7687339812517167, | |
| "epoch": 1.1542168674698796, | |
| "grad_norm": 1.4806301593780518, | |
| "learning_rate": 0.0001572549019607843, | |
| "loss": 1.7809358596801759, | |
| "mean_token_accuracy": 0.6301124401390552, | |
| "num_tokens": 78552.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 1.7583049044013024, | |
| "epoch": 1.202409638554217, | |
| "grad_norm": 1.6424956321716309, | |
| "learning_rate": 0.00015529411764705884, | |
| "loss": 1.744133186340332, | |
| "mean_token_accuracy": 0.6302636325359344, | |
| "num_tokens": 81798.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 1.6877357229590415, | |
| "epoch": 1.2506024096385542, | |
| "grad_norm": 1.5315968990325928, | |
| "learning_rate": 0.00015333333333333334, | |
| "loss": 1.637476348876953, | |
| "mean_token_accuracy": 0.650700282305479, | |
| "num_tokens": 85117.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 1.7318841934204101, | |
| "epoch": 1.2987951807228915, | |
| "grad_norm": 1.4535908699035645, | |
| "learning_rate": 0.00015137254901960784, | |
| "loss": 1.7752351760864258, | |
| "mean_token_accuracy": 0.6226705864071846, | |
| "num_tokens": 88742.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 1.7382851645350457, | |
| "epoch": 1.346987951807229, | |
| "grad_norm": 1.5624728202819824, | |
| "learning_rate": 0.00014941176470588237, | |
| "loss": 1.7821353912353515, | |
| "mean_token_accuracy": 0.6388084962964058, | |
| "num_tokens": 92210.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 1.657819251716137, | |
| "epoch": 1.3951807228915662, | |
| "grad_norm": 1.827693223953247, | |
| "learning_rate": 0.00014745098039215687, | |
| "loss": 1.620370864868164, | |
| "mean_token_accuracy": 0.6545050926506519, | |
| "num_tokens": 95303.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 1.6616802349686624, | |
| "epoch": 1.4433734939759035, | |
| "grad_norm": 1.8607943058013916, | |
| "learning_rate": 0.00014549019607843137, | |
| "loss": 1.5599291801452637, | |
| "mean_token_accuracy": 0.6593139126896859, | |
| "num_tokens": 98384.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 1.5860232621431352, | |
| "epoch": 1.491566265060241, | |
| "grad_norm": 1.9932466745376587, | |
| "learning_rate": 0.0001435294117647059, | |
| "loss": 1.6419692993164063, | |
| "mean_token_accuracy": 0.6570444725453853, | |
| "num_tokens": 101490.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 1.551141259074211, | |
| "epoch": 1.5397590361445783, | |
| "grad_norm": 2.086176872253418, | |
| "learning_rate": 0.0001415686274509804, | |
| "loss": 1.5585495948791503, | |
| "mean_token_accuracy": 0.6683049827814103, | |
| "num_tokens": 104191.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 1.6165375381708145, | |
| "epoch": 1.5879518072289156, | |
| "grad_norm": 1.7320177555084229, | |
| "learning_rate": 0.0001396078431372549, | |
| "loss": 1.6773378372192382, | |
| "mean_token_accuracy": 0.6502716824412346, | |
| "num_tokens": 107261.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 1.704845277965069, | |
| "epoch": 1.636144578313253, | |
| "grad_norm": 1.967751383781433, | |
| "learning_rate": 0.00013764705882352943, | |
| "loss": 1.7607194900512695, | |
| "mean_token_accuracy": 0.6385575778782367, | |
| "num_tokens": 110608.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 1.6652135044336318, | |
| "epoch": 1.6843373493975904, | |
| "grad_norm": 1.616722822189331, | |
| "learning_rate": 0.00013568627450980393, | |
| "loss": 1.6635320663452149, | |
| "mean_token_accuracy": 0.6614525228738785, | |
| "num_tokens": 113881.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 1.6908259093761444, | |
| "epoch": 1.7325301204819277, | |
| "grad_norm": 1.711729645729065, | |
| "learning_rate": 0.00013372549019607843, | |
| "loss": 1.6920236587524413, | |
| "mean_token_accuracy": 0.6418330393731594, | |
| "num_tokens": 117044.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 1.7484796479344369, | |
| "epoch": 1.7807228915662652, | |
| "grad_norm": 1.5955023765563965, | |
| "learning_rate": 0.00013176470588235296, | |
| "loss": 1.717266845703125, | |
| "mean_token_accuracy": 0.6351907752454281, | |
| "num_tokens": 120606.0, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 1.6216741874814034, | |
| "epoch": 1.8289156626506025, | |
| "grad_norm": 1.622183084487915, | |
| "learning_rate": 0.00012980392156862746, | |
| "loss": 1.674321174621582, | |
| "mean_token_accuracy": 0.6502599447965622, | |
| "num_tokens": 123899.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 1.6669133231043816, | |
| "epoch": 1.8771084337349397, | |
| "grad_norm": 1.867492914199829, | |
| "learning_rate": 0.00012784313725490196, | |
| "loss": 1.7255191802978516, | |
| "mean_token_accuracy": 0.6400439321994782, | |
| "num_tokens": 127473.0, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 1.675342607498169, | |
| "epoch": 1.9253012048192772, | |
| "grad_norm": 1.855635166168213, | |
| "learning_rate": 0.0001258823529411765, | |
| "loss": 1.7129255294799806, | |
| "mean_token_accuracy": 0.62674540579319, | |
| "num_tokens": 130771.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 1.6791207402944566, | |
| "epoch": 1.9734939759036143, | |
| "grad_norm": 1.7303972244262695, | |
| "learning_rate": 0.000123921568627451, | |
| "loss": 1.7065092086791993, | |
| "mean_token_accuracy": 0.6443807639181613, | |
| "num_tokens": 134125.0, | |
| "step": 205 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_entropy": 1.8138972566677973, | |
| "eval_loss": 1.7650498151779175, | |
| "eval_mean_token_accuracy": 0.6141013021652515, | |
| "eval_num_tokens": 136002.0, | |
| "eval_runtime": 14.8533, | |
| "eval_samples_per_second": 14.004, | |
| "eval_steps_per_second": 1.75, | |
| "step": 208 | |
| }, | |
| { | |
| "entropy": 1.6970797196814889, | |
| "epoch": 2.019277108433735, | |
| "grad_norm": 1.7416448593139648, | |
| "learning_rate": 0.0001219607843137255, | |
| "loss": 1.692988395690918, | |
| "mean_token_accuracy": 0.6389423718577937, | |
| "num_tokens": 137377.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 1.7040952891111374, | |
| "epoch": 2.067469879518072, | |
| "grad_norm": 1.8894716501235962, | |
| "learning_rate": 0.00012, | |
| "loss": 1.6213483810424805, | |
| "mean_token_accuracy": 0.6468638084828854, | |
| "num_tokens": 141109.0, | |
| "step": 215 | |
| }, | |
| { | |
| "entropy": 1.5890287652611732, | |
| "epoch": 2.1156626506024097, | |
| "grad_norm": 2.304762601852417, | |
| "learning_rate": 0.00011803921568627452, | |
| "loss": 1.5466879844665526, | |
| "mean_token_accuracy": 0.6704243734478951, | |
| "num_tokens": 144100.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 1.6182831943035125, | |
| "epoch": 2.163855421686747, | |
| "grad_norm": 1.9651720523834229, | |
| "learning_rate": 0.00011607843137254903, | |
| "loss": 1.6720081329345704, | |
| "mean_token_accuracy": 0.65214222073555, | |
| "num_tokens": 147584.0, | |
| "step": 225 | |
| }, | |
| { | |
| "entropy": 1.5671581000089645, | |
| "epoch": 2.212048192771084, | |
| "grad_norm": 1.9738132953643799, | |
| "learning_rate": 0.00011411764705882353, | |
| "loss": 1.647587203979492, | |
| "mean_token_accuracy": 0.6729991242289544, | |
| "num_tokens": 150511.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 1.6577306151390077, | |
| "epoch": 2.2602409638554217, | |
| "grad_norm": 1.8251382112503052, | |
| "learning_rate": 0.00011215686274509805, | |
| "loss": 1.5790367126464844, | |
| "mean_token_accuracy": 0.6663866609334945, | |
| "num_tokens": 154053.0, | |
| "step": 235 | |
| }, | |
| { | |
| "entropy": 1.5505558550357819, | |
| "epoch": 2.3084337349397592, | |
| "grad_norm": 2.1022140979766846, | |
| "learning_rate": 0.00011019607843137256, | |
| "loss": 1.588535976409912, | |
| "mean_token_accuracy": 0.6634533762931824, | |
| "num_tokens": 157138.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 1.5530098304152489, | |
| "epoch": 2.3566265060240963, | |
| "grad_norm": 2.045732259750366, | |
| "learning_rate": 0.00010823529411764706, | |
| "loss": 1.5270882606506349, | |
| "mean_token_accuracy": 0.6741401948034763, | |
| "num_tokens": 160436.0, | |
| "step": 245 | |
| }, | |
| { | |
| "entropy": 1.596367821097374, | |
| "epoch": 2.404819277108434, | |
| "grad_norm": 1.6421279907226562, | |
| "learning_rate": 0.00010627450980392158, | |
| "loss": 1.56561279296875, | |
| "mean_token_accuracy": 0.6635179311037064, | |
| "num_tokens": 163761.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 1.6159405663609505, | |
| "epoch": 2.453012048192771, | |
| "grad_norm": 1.8586058616638184, | |
| "learning_rate": 0.00010431372549019609, | |
| "loss": 1.5304578781127929, | |
| "mean_token_accuracy": 0.6609816014766693, | |
| "num_tokens": 166898.0, | |
| "step": 255 | |
| }, | |
| { | |
| "entropy": 1.5298877507448196, | |
| "epoch": 2.5012048192771084, | |
| "grad_norm": 2.2185778617858887, | |
| "learning_rate": 0.00010235294117647058, | |
| "loss": 1.552015781402588, | |
| "mean_token_accuracy": 0.6700602419674396, | |
| "num_tokens": 169909.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 1.6168403923511505, | |
| "epoch": 2.549397590361446, | |
| "grad_norm": 1.8064223527908325, | |
| "learning_rate": 0.00010039215686274511, | |
| "loss": 1.5809405326843262, | |
| "mean_token_accuracy": 0.6531007468700409, | |
| "num_tokens": 173365.0, | |
| "step": 265 | |
| }, | |
| { | |
| "entropy": 1.6430342257022859, | |
| "epoch": 2.597590361445783, | |
| "grad_norm": 2.219008684158325, | |
| "learning_rate": 9.843137254901961e-05, | |
| "loss": 1.661992073059082, | |
| "mean_token_accuracy": 0.6535247735679149, | |
| "num_tokens": 176834.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 1.5823266848921775, | |
| "epoch": 2.6457831325301204, | |
| "grad_norm": 1.9590431451797485, | |
| "learning_rate": 9.647058823529412e-05, | |
| "loss": 1.515106773376465, | |
| "mean_token_accuracy": 0.6696497216820717, | |
| "num_tokens": 180153.0, | |
| "step": 275 | |
| }, | |
| { | |
| "entropy": 1.6698341622948647, | |
| "epoch": 2.693975903614458, | |
| "grad_norm": 1.6002068519592285, | |
| "learning_rate": 9.450980392156862e-05, | |
| "loss": 1.6272111892700196, | |
| "mean_token_accuracy": 0.6547548659145832, | |
| "num_tokens": 183512.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 1.5231620341539382, | |
| "epoch": 2.742168674698795, | |
| "grad_norm": 1.950395941734314, | |
| "learning_rate": 9.254901960784315e-05, | |
| "loss": 1.5006098747253418, | |
| "mean_token_accuracy": 0.679551114141941, | |
| "num_tokens": 186472.0, | |
| "step": 285 | |
| }, | |
| { | |
| "entropy": 1.4535922273993491, | |
| "epoch": 2.7903614457831325, | |
| "grad_norm": 2.09175705909729, | |
| "learning_rate": 9.058823529411765e-05, | |
| "loss": 1.467922306060791, | |
| "mean_token_accuracy": 0.695755822956562, | |
| "num_tokens": 189517.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 1.5150477439165115, | |
| "epoch": 2.83855421686747, | |
| "grad_norm": 2.532780170440674, | |
| "learning_rate": 8.862745098039215e-05, | |
| "loss": 1.5379227638244628, | |
| "mean_token_accuracy": 0.6792982123792172, | |
| "num_tokens": 192652.0, | |
| "step": 295 | |
| }, | |
| { | |
| "entropy": 1.5019459277391434, | |
| "epoch": 2.886746987951807, | |
| "grad_norm": 2.0246798992156982, | |
| "learning_rate": 8.666666666666667e-05, | |
| "loss": 1.5374203681945802, | |
| "mean_token_accuracy": 0.6916215568780899, | |
| "num_tokens": 195757.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 1.480114082992077, | |
| "epoch": 2.9349397590361446, | |
| "grad_norm": 1.8221111297607422, | |
| "learning_rate": 8.470588235294118e-05, | |
| "loss": 1.4599919319152832, | |
| "mean_token_accuracy": 0.6793610081076622, | |
| "num_tokens": 198807.0, | |
| "step": 305 | |
| }, | |
| { | |
| "entropy": 1.5545434340834619, | |
| "epoch": 2.983132530120482, | |
| "grad_norm": 1.9728882312774658, | |
| "learning_rate": 8.274509803921568e-05, | |
| "loss": 1.5928434371948241, | |
| "mean_token_accuracy": 0.6610011547803879, | |
| "num_tokens": 202500.0, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_entropy": 1.6712642128650959, | |
| "eval_loss": 1.735916256904602, | |
| "eval_mean_token_accuracy": 0.6211101160599635, | |
| "eval_num_tokens": 204003.0, | |
| "eval_runtime": 14.8568, | |
| "eval_samples_per_second": 14.0, | |
| "eval_steps_per_second": 1.75, | |
| "step": 312 | |
| }, | |
| { | |
| "entropy": 1.5852490004740263, | |
| "epoch": 3.0289156626506024, | |
| "grad_norm": 2.1537606716156006, | |
| "learning_rate": 8.07843137254902e-05, | |
| "loss": 1.5842859268188476, | |
| "mean_token_accuracy": 0.6565342867060712, | |
| "num_tokens": 205682.0, | |
| "step": 315 | |
| }, | |
| { | |
| "entropy": 1.5908529162406921, | |
| "epoch": 3.07710843373494, | |
| "grad_norm": 2.137528657913208, | |
| "learning_rate": 7.882352941176471e-05, | |
| "loss": 1.5232861518859864, | |
| "mean_token_accuracy": 0.6684555158019065, | |
| "num_tokens": 209067.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 1.5832848131656647, | |
| "epoch": 3.125301204819277, | |
| "grad_norm": 1.7512741088867188, | |
| "learning_rate": 7.686274509803923e-05, | |
| "loss": 1.5101547241210938, | |
| "mean_token_accuracy": 0.6740351840853691, | |
| "num_tokens": 212352.0, | |
| "step": 325 | |
| }, | |
| { | |
| "entropy": 1.5094462752342224, | |
| "epoch": 3.1734939759036145, | |
| "grad_norm": 1.860220193862915, | |
| "learning_rate": 7.490196078431373e-05, | |
| "loss": 1.4551105499267578, | |
| "mean_token_accuracy": 0.6776747345924378, | |
| "num_tokens": 215682.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 1.522706066071987, | |
| "epoch": 3.221686746987952, | |
| "grad_norm": 1.954549789428711, | |
| "learning_rate": 7.294117647058823e-05, | |
| "loss": 1.4975555419921875, | |
| "mean_token_accuracy": 0.6802921906113625, | |
| "num_tokens": 219099.0, | |
| "step": 335 | |
| }, | |
| { | |
| "entropy": 1.409603290259838, | |
| "epoch": 3.269879518072289, | |
| "grad_norm": 1.8153287172317505, | |
| "learning_rate": 7.098039215686276e-05, | |
| "loss": 1.4376014709472655, | |
| "mean_token_accuracy": 0.7023592889308929, | |
| "num_tokens": 222041.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 1.5369486555457115, | |
| "epoch": 3.3180722891566266, | |
| "grad_norm": 2.893878698348999, | |
| "learning_rate": 6.901960784313726e-05, | |
| "loss": 1.521450901031494, | |
| "mean_token_accuracy": 0.6780011773109436, | |
| "num_tokens": 225295.0, | |
| "step": 345 | |
| }, | |
| { | |
| "entropy": 1.464533470571041, | |
| "epoch": 3.3662650602409636, | |
| "grad_norm": 2.23521089553833, | |
| "learning_rate": 6.705882352941176e-05, | |
| "loss": 1.4850872993469237, | |
| "mean_token_accuracy": 0.6781729541718959, | |
| "num_tokens": 228520.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 1.5792654797434806, | |
| "epoch": 3.414457831325301, | |
| "grad_norm": 2.3811116218566895, | |
| "learning_rate": 6.509803921568627e-05, | |
| "loss": 1.5071654319763184, | |
| "mean_token_accuracy": 0.6727619431912899, | |
| "num_tokens": 231944.0, | |
| "step": 355 | |
| }, | |
| { | |
| "entropy": 1.5043073087930678, | |
| "epoch": 3.4626506024096386, | |
| "grad_norm": 2.0156142711639404, | |
| "learning_rate": 6.313725490196079e-05, | |
| "loss": 1.457301425933838, | |
| "mean_token_accuracy": 0.6823700666427612, | |
| "num_tokens": 235338.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 1.515394613146782, | |
| "epoch": 3.5108433734939757, | |
| "grad_norm": 2.451681613922119, | |
| "learning_rate": 6.11764705882353e-05, | |
| "loss": 1.5563648223876954, | |
| "mean_token_accuracy": 0.6691546641290188, | |
| "num_tokens": 238515.0, | |
| "step": 365 | |
| }, | |
| { | |
| "entropy": 1.3954612508416175, | |
| "epoch": 3.559036144578313, | |
| "grad_norm": 2.3322858810424805, | |
| "learning_rate": 5.921568627450981e-05, | |
| "loss": 1.3666942596435547, | |
| "mean_token_accuracy": 0.7175338268280029, | |
| "num_tokens": 241407.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 1.55018198043108, | |
| "epoch": 3.6072289156626507, | |
| "grad_norm": 2.3056695461273193, | |
| "learning_rate": 5.725490196078431e-05, | |
| "loss": 1.5389293670654296, | |
| "mean_token_accuracy": 0.6681547790765763, | |
| "num_tokens": 244810.0, | |
| "step": 375 | |
| }, | |
| { | |
| "entropy": 1.5046127676963805, | |
| "epoch": 3.6554216867469878, | |
| "grad_norm": 3.010859966278076, | |
| "learning_rate": 5.529411764705883e-05, | |
| "loss": 1.4678150177001954, | |
| "mean_token_accuracy": 0.6847188517451286, | |
| "num_tokens": 247917.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 1.4361775398254395, | |
| "epoch": 3.7036144578313253, | |
| "grad_norm": 2.5851047039031982, | |
| "learning_rate": 5.333333333333333e-05, | |
| "loss": 1.3650499343872071, | |
| "mean_token_accuracy": 0.6972122386097908, | |
| "num_tokens": 251035.0, | |
| "step": 385 | |
| }, | |
| { | |
| "entropy": 1.3817903518676757, | |
| "epoch": 3.7518072289156628, | |
| "grad_norm": 2.435213565826416, | |
| "learning_rate": 5.137254901960784e-05, | |
| "loss": 1.4766757011413574, | |
| "mean_token_accuracy": 0.6866693139076233, | |
| "num_tokens": 254564.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 1.4502640128135682, | |
| "epoch": 3.8, | |
| "grad_norm": 2.1120645999908447, | |
| "learning_rate": 4.9411764705882355e-05, | |
| "loss": 1.433640480041504, | |
| "mean_token_accuracy": 0.6859976917505264, | |
| "num_tokens": 258001.0, | |
| "step": 395 | |
| }, | |
| { | |
| "entropy": 1.539687316119671, | |
| "epoch": 3.8481927710843373, | |
| "grad_norm": 2.2516636848449707, | |
| "learning_rate": 4.745098039215686e-05, | |
| "loss": 1.4595802307128907, | |
| "mean_token_accuracy": 0.682227948307991, | |
| "num_tokens": 260974.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 1.4997100606560707, | |
| "epoch": 3.896385542168675, | |
| "grad_norm": 2.310636281967163, | |
| "learning_rate": 4.549019607843137e-05, | |
| "loss": 1.5333876609802246, | |
| "mean_token_accuracy": 0.6781212002038955, | |
| "num_tokens": 264415.0, | |
| "step": 405 | |
| }, | |
| { | |
| "entropy": 1.5281791225075723, | |
| "epoch": 3.944578313253012, | |
| "grad_norm": 2.4731054306030273, | |
| "learning_rate": 4.3529411764705885e-05, | |
| "loss": 1.5099031448364257, | |
| "mean_token_accuracy": 0.6849689528346061, | |
| "num_tokens": 267945.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 1.5134592086076737, | |
| "epoch": 3.9927710843373494, | |
| "grad_norm": 2.097576379776001, | |
| "learning_rate": 4.156862745098039e-05, | |
| "loss": 1.5098279953002929, | |
| "mean_token_accuracy": 0.6759081065654755, | |
| "num_tokens": 271493.0, | |
| "step": 415 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "eval_entropy": 1.650996024792011, | |
| "eval_loss": 1.719327688217163, | |
| "eval_mean_token_accuracy": 0.6236885969455426, | |
| "eval_num_tokens": 272004.0, | |
| "eval_runtime": 14.8466, | |
| "eval_samples_per_second": 14.01, | |
| "eval_steps_per_second": 1.751, | |
| "step": 416 | |
| }, | |
| { | |
| "entropy": 1.461619540264732, | |
| "epoch": 4.03855421686747, | |
| "grad_norm": 2.1332545280456543, | |
| "learning_rate": 3.96078431372549e-05, | |
| "loss": 1.4738554954528809, | |
| "mean_token_accuracy": 0.6778466685822135, | |
| "num_tokens": 274843.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 1.4357808396220206, | |
| "epoch": 4.086746987951807, | |
| "grad_norm": 2.94267201423645, | |
| "learning_rate": 3.7647058823529415e-05, | |
| "loss": 1.2882400512695313, | |
| "mean_token_accuracy": 0.7100980252027511, | |
| "num_tokens": 277622.0, | |
| "step": 425 | |
| }, | |
| { | |
| "entropy": 1.5216135740280152, | |
| "epoch": 4.134939759036144, | |
| "grad_norm": 2.0942740440368652, | |
| "learning_rate": 3.568627450980392e-05, | |
| "loss": 1.4425686836242675, | |
| "mean_token_accuracy": 0.6826648101210594, | |
| "num_tokens": 281115.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 1.4814609438180923, | |
| "epoch": 4.183132530120482, | |
| "grad_norm": 1.7694135904312134, | |
| "learning_rate": 3.372549019607844e-05, | |
| "loss": 1.4820951461791991, | |
| "mean_token_accuracy": 0.6858769103884697, | |
| "num_tokens": 284784.0, | |
| "step": 435 | |
| }, | |
| { | |
| "entropy": 1.4060292541980743, | |
| "epoch": 4.231325301204819, | |
| "grad_norm": 1.7684255838394165, | |
| "learning_rate": 3.176470588235294e-05, | |
| "loss": 1.464186668395996, | |
| "mean_token_accuracy": 0.6873476430773735, | |
| "num_tokens": 288256.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 1.4001563966274262, | |
| "epoch": 4.279518072289156, | |
| "grad_norm": 2.206958770751953, | |
| "learning_rate": 2.9803921568627453e-05, | |
| "loss": 1.4205841064453124, | |
| "mean_token_accuracy": 0.6965109631419182, | |
| "num_tokens": 291712.0, | |
| "step": 445 | |
| }, | |
| { | |
| "entropy": 1.4542587012052537, | |
| "epoch": 4.327710843373494, | |
| "grad_norm": 2.2863240242004395, | |
| "learning_rate": 2.7843137254901964e-05, | |
| "loss": 1.3530636787414552, | |
| "mean_token_accuracy": 0.6990203335881233, | |
| "num_tokens": 294817.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 1.4617966890335083, | |
| "epoch": 4.375903614457831, | |
| "grad_norm": 2.059224843978882, | |
| "learning_rate": 2.5882352941176475e-05, | |
| "loss": 1.4458779335021972, | |
| "mean_token_accuracy": 0.6859977036714554, | |
| "num_tokens": 298135.0, | |
| "step": 455 | |
| }, | |
| { | |
| "entropy": 1.4295916080474853, | |
| "epoch": 4.424096385542168, | |
| "grad_norm": 2.397486686706543, | |
| "learning_rate": 2.3921568627450983e-05, | |
| "loss": 1.3852792739868165, | |
| "mean_token_accuracy": 0.6985011547803879, | |
| "num_tokens": 301380.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 1.4523922324180603, | |
| "epoch": 4.472289156626506, | |
| "grad_norm": 2.7501327991485596, | |
| "learning_rate": 2.196078431372549e-05, | |
| "loss": 1.3924354553222655, | |
| "mean_token_accuracy": 0.682592722773552, | |
| "num_tokens": 304449.0, | |
| "step": 465 | |
| }, | |
| { | |
| "entropy": 1.4958537325263024, | |
| "epoch": 4.5204819277108435, | |
| "grad_norm": 2.457711935043335, | |
| "learning_rate": 2e-05, | |
| "loss": 1.4587836265563965, | |
| "mean_token_accuracy": 0.6754888102412224, | |
| "num_tokens": 307631.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 1.4366480574011802, | |
| "epoch": 4.5686746987951805, | |
| "grad_norm": 2.3415169715881348, | |
| "learning_rate": 1.803921568627451e-05, | |
| "loss": 1.3680506706237794, | |
| "mean_token_accuracy": 0.7045732125639915, | |
| "num_tokens": 310718.0, | |
| "step": 475 | |
| }, | |
| { | |
| "entropy": 1.4801016479730607, | |
| "epoch": 4.6168674698795185, | |
| "grad_norm": 2.1724977493286133, | |
| "learning_rate": 1.607843137254902e-05, | |
| "loss": 1.4241137504577637, | |
| "mean_token_accuracy": 0.6980501919984817, | |
| "num_tokens": 313936.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 1.5258657872676848, | |
| "epoch": 4.6650602409638555, | |
| "grad_norm": 2.35538387298584, | |
| "learning_rate": 1.411764705882353e-05, | |
| "loss": 1.3901150703430176, | |
| "mean_token_accuracy": 0.6908862113952636, | |
| "num_tokens": 317225.0, | |
| "step": 485 | |
| }, | |
| { | |
| "entropy": 1.5328210130333901, | |
| "epoch": 4.713253012048193, | |
| "grad_norm": 2.4136812686920166, | |
| "learning_rate": 1.215686274509804e-05, | |
| "loss": 1.5781697273254394, | |
| "mean_token_accuracy": 0.667643653601408, | |
| "num_tokens": 320998.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 1.41236270070076, | |
| "epoch": 4.76144578313253, | |
| "grad_norm": 2.197669744491577, | |
| "learning_rate": 1.0196078431372549e-05, | |
| "loss": 1.412532138824463, | |
| "mean_token_accuracy": 0.7016989126801491, | |
| "num_tokens": 324049.0, | |
| "step": 495 | |
| }, | |
| { | |
| "entropy": 1.4892181918025016, | |
| "epoch": 4.809638554216868, | |
| "grad_norm": 2.3088886737823486, | |
| "learning_rate": 8.23529411764706e-06, | |
| "loss": 1.516150665283203, | |
| "mean_token_accuracy": 0.681061764806509, | |
| "num_tokens": 327578.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 1.413595749437809, | |
| "epoch": 4.857831325301205, | |
| "grad_norm": 2.792482852935791, | |
| "learning_rate": 6.274509803921569e-06, | |
| "loss": 1.3113953590393066, | |
| "mean_token_accuracy": 0.7035295680165291, | |
| "num_tokens": 330740.0, | |
| "step": 505 | |
| }, | |
| { | |
| "entropy": 1.3732035428285598, | |
| "epoch": 4.906024096385542, | |
| "grad_norm": 2.567453145980835, | |
| "learning_rate": 4.313725490196079e-06, | |
| "loss": 1.3159814834594727, | |
| "mean_token_accuracy": 0.7268049910664558, | |
| "num_tokens": 334020.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 1.4876835718750954, | |
| "epoch": 4.95421686746988, | |
| "grad_norm": 2.4423370361328125, | |
| "learning_rate": 2.3529411764705885e-06, | |
| "loss": 1.4042280197143555, | |
| "mean_token_accuracy": 0.7043518707156181, | |
| "num_tokens": 336979.0, | |
| "step": 515 | |
| }, | |
| { | |
| "entropy": 1.4772268110199978, | |
| "epoch": 5.0, | |
| "grad_norm": 2.651355028152466, | |
| "learning_rate": 3.921568627450981e-07, | |
| "loss": 1.4333177566528321, | |
| "mean_token_accuracy": 0.6867847709279311, | |
| "num_tokens": 340005.0, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "eval_entropy": 1.6117543578147888, | |
| "eval_loss": 1.7184369564056396, | |
| "eval_mean_token_accuracy": 0.6235387462836045, | |
| "eval_num_tokens": 340005.0, | |
| "eval_runtime": 14.8702, | |
| "eval_samples_per_second": 13.988, | |
| "eval_steps_per_second": 1.748, | |
| "step": 520 | |
| } | |
| ], | |
| "logging_steps": 5, | |
| "max_steps": 520, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2115032078315520.0, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |