Instructions to use Taywon/B1plus_v4_qwen72_e2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Taywon/B1plus_v4_qwen72_e2 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-72B-Instruct") model = PeftModel.from_pretrained(base_model, "Taywon/B1plus_v4_qwen72_e2") - Transformers
How to use Taywon/B1plus_v4_qwen72_e2 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Taywon/B1plus_v4_qwen72_e2") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Taywon/B1plus_v4_qwen72_e2", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Taywon/B1plus_v4_qwen72_e2 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Taywon/B1plus_v4_qwen72_e2" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/B1plus_v4_qwen72_e2", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Taywon/B1plus_v4_qwen72_e2
- SGLang
How to use Taywon/B1plus_v4_qwen72_e2 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Taywon/B1plus_v4_qwen72_e2" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/B1plus_v4_qwen72_e2", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Taywon/B1plus_v4_qwen72_e2" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/B1plus_v4_qwen72_e2", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use Taywon/B1plus_v4_qwen72_e2 with Docker Model Runner:
docker model run hf.co/Taywon/B1plus_v4_qwen72_e2
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.0, | |
| "eval_steps": 500, | |
| "global_step": 208, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.2957205325365067, | |
| "epoch": 0.009685230024213076, | |
| "grad_norm": 0.9995483160018921, | |
| "learning_rate": 0.0, | |
| "loss": 1.9372434616088867, | |
| "mean_token_accuracy": 0.5489737018942833, | |
| "num_tokens": 97740.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 1.3194782882928848, | |
| "epoch": 0.01937046004842615, | |
| "grad_norm": 0.9814075827598572, | |
| "learning_rate": 3.125e-06, | |
| "loss": 1.95685613155365, | |
| "mean_token_accuracy": 0.5466571971774101, | |
| "num_tokens": 194347.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 1.3409326374530792, | |
| "epoch": 0.029055690072639227, | |
| "grad_norm": 0.9050161838531494, | |
| "learning_rate": 6.25e-06, | |
| "loss": 1.938143253326416, | |
| "mean_token_accuracy": 0.5483311638236046, | |
| "num_tokens": 292306.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 1.4396293759346008, | |
| "epoch": 0.0387409200968523, | |
| "grad_norm": 0.7553433775901794, | |
| "learning_rate": 9.375000000000001e-06, | |
| "loss": 1.9240221977233887, | |
| "mean_token_accuracy": 0.5431711822748184, | |
| "num_tokens": 389675.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 1.5236343890428543, | |
| "epoch": 0.048426150121065374, | |
| "grad_norm": 0.5566913485527039, | |
| "learning_rate": 1.25e-05, | |
| "loss": 1.8870434761047363, | |
| "mean_token_accuracy": 0.5487127229571342, | |
| "num_tokens": 482548.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 1.587360993027687, | |
| "epoch": 0.05811138014527845, | |
| "grad_norm": 0.41897791624069214, | |
| "learning_rate": 1.5625e-05, | |
| "loss": 1.790077567100525, | |
| "mean_token_accuracy": 0.5560380145907402, | |
| "num_tokens": 579772.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 1.701308086514473, | |
| "epoch": 0.06779661016949153, | |
| "grad_norm": 0.3749634921550751, | |
| "learning_rate": 1.8750000000000002e-05, | |
| "loss": 1.7975553274154663, | |
| "mean_token_accuracy": 0.5572659820318222, | |
| "num_tokens": 677650.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 1.7159235179424286, | |
| "epoch": 0.0774818401937046, | |
| "grad_norm": 0.32318735122680664, | |
| "learning_rate": 2.1875e-05, | |
| "loss": 1.726526141166687, | |
| "mean_token_accuracy": 0.5642273500561714, | |
| "num_tokens": 774231.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 1.828441396355629, | |
| "epoch": 0.08716707021791767, | |
| "grad_norm": 0.3263152837753296, | |
| "learning_rate": 2.5e-05, | |
| "loss": 1.7625732421875, | |
| "mean_token_accuracy": 0.5538319870829582, | |
| "num_tokens": 868913.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 1.8398680537939072, | |
| "epoch": 0.09685230024213075, | |
| "grad_norm": 0.3322964608669281, | |
| "learning_rate": 2.8125000000000003e-05, | |
| "loss": 1.6790331602096558, | |
| "mean_token_accuracy": 0.5727217048406601, | |
| "num_tokens": 966483.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.800604209303856, | |
| "epoch": 0.10653753026634383, | |
| "grad_norm": 0.3253025412559509, | |
| "learning_rate": 3.125e-05, | |
| "loss": 1.6130985021591187, | |
| "mean_token_accuracy": 0.5812065601348877, | |
| "num_tokens": 1062677.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 1.8502707928419113, | |
| "epoch": 0.1162227602905569, | |
| "grad_norm": 0.35978925228118896, | |
| "learning_rate": 3.4375e-05, | |
| "loss": 1.628458857536316, | |
| "mean_token_accuracy": 0.5780329182744026, | |
| "num_tokens": 1160086.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 1.7924207001924515, | |
| "epoch": 0.12590799031476999, | |
| "grad_norm": 0.331644743680954, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 1.5732147693634033, | |
| "mean_token_accuracy": 0.5900157392024994, | |
| "num_tokens": 1257647.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 1.7685164362192154, | |
| "epoch": 0.13559322033898305, | |
| "grad_norm": 0.326431006193161, | |
| "learning_rate": 4.0625000000000005e-05, | |
| "loss": 1.5668952465057373, | |
| "mean_token_accuracy": 0.5877715274691582, | |
| "num_tokens": 1354505.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 1.5795451253652573, | |
| "epoch": 0.14527845036319612, | |
| "grad_norm": 0.26537618041038513, | |
| "learning_rate": 4.375e-05, | |
| "loss": 1.4661058187484741, | |
| "mean_token_accuracy": 0.6071906611323357, | |
| "num_tokens": 1450622.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 1.5185481905937195, | |
| "epoch": 0.1549636803874092, | |
| "grad_norm": 0.24135415256023407, | |
| "learning_rate": 4.6875e-05, | |
| "loss": 1.4757945537567139, | |
| "mean_token_accuracy": 0.6041631400585175, | |
| "num_tokens": 1547908.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 1.4099202752113342, | |
| "epoch": 0.16464891041162227, | |
| "grad_norm": 0.2752665579319, | |
| "learning_rate": 5e-05, | |
| "loss": 1.4465235471725464, | |
| "mean_token_accuracy": 0.6097583919763565, | |
| "num_tokens": 1645426.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 1.3497764021158218, | |
| "epoch": 0.17433414043583534, | |
| "grad_norm": 0.26331380009651184, | |
| "learning_rate": 4.999859193643945e-05, | |
| "loss": 1.4109758138656616, | |
| "mean_token_accuracy": 0.6169496104121208, | |
| "num_tokens": 1742103.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 1.3129477798938751, | |
| "epoch": 0.18401937046004843, | |
| "grad_norm": 0.25825461745262146, | |
| "learning_rate": 4.999436790436924e-05, | |
| "loss": 1.3865187168121338, | |
| "mean_token_accuracy": 0.6188722252845764, | |
| "num_tokens": 1839477.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 1.292990192770958, | |
| "epoch": 0.1937046004842615, | |
| "grad_norm": 0.19367851316928864, | |
| "learning_rate": 4.9987328379605816e-05, | |
| "loss": 1.3164660930633545, | |
| "mean_token_accuracy": 0.6362323462963104, | |
| "num_tokens": 1936962.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.376704841852188, | |
| "epoch": 0.2033898305084746, | |
| "grad_norm": 0.19777517020702362, | |
| "learning_rate": 4.9977474155117045e-05, | |
| "loss": 1.3734445571899414, | |
| "mean_token_accuracy": 0.623312383890152, | |
| "num_tokens": 2034780.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 1.3632780611515045, | |
| "epoch": 0.21307506053268765, | |
| "grad_norm": 0.20455984771251678, | |
| "learning_rate": 4.9964806340932865e-05, | |
| "loss": 1.3468432426452637, | |
| "mean_token_accuracy": 0.6259733065962791, | |
| "num_tokens": 2132583.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 1.3963707983493805, | |
| "epoch": 0.22276029055690072, | |
| "grad_norm": 0.20235121250152588, | |
| "learning_rate": 4.9949326364020314e-05, | |
| "loss": 1.3420944213867188, | |
| "mean_token_accuracy": 0.629428505897522, | |
| "num_tokens": 2226009.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 1.3728236258029938, | |
| "epoch": 0.2324455205811138, | |
| "grad_norm": 0.19748054444789886, | |
| "learning_rate": 4.993103596812268e-05, | |
| "loss": 1.311779260635376, | |
| "mean_token_accuracy": 0.6367133855819702, | |
| "num_tokens": 2323884.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 1.3855281174182892, | |
| "epoch": 0.24213075060532688, | |
| "grad_norm": 0.1842709332704544, | |
| "learning_rate": 4.9909937213563165e-05, | |
| "loss": 1.3212249279022217, | |
| "mean_token_accuracy": 0.6343293562531471, | |
| "num_tokens": 2420260.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 1.3564256578683853, | |
| "epoch": 0.25181598062953997, | |
| "grad_norm": 0.17390435934066772, | |
| "learning_rate": 4.988603247701277e-05, | |
| "loss": 1.29941725730896, | |
| "mean_token_accuracy": 0.6395170390605927, | |
| "num_tokens": 2517078.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 1.340470239520073, | |
| "epoch": 0.26150121065375304, | |
| "grad_norm": 0.16865943372249603, | |
| "learning_rate": 4.985932445122257e-05, | |
| "loss": 1.305230736732483, | |
| "mean_token_accuracy": 0.6346895545721054, | |
| "num_tokens": 2614502.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 1.249424859881401, | |
| "epoch": 0.2711864406779661, | |
| "grad_norm": 0.16522753238677979, | |
| "learning_rate": 4.982981614472039e-05, | |
| "loss": 1.2451016902923584, | |
| "mean_token_accuracy": 0.648459404706955, | |
| "num_tokens": 2710926.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 1.241905003786087, | |
| "epoch": 0.28087167070217917, | |
| "grad_norm": 0.1635328084230423, | |
| "learning_rate": 4.979751088147192e-05, | |
| "loss": 1.2533214092254639, | |
| "mean_token_accuracy": 0.6469609588384628, | |
| "num_tokens": 2807646.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 1.2305553704500198, | |
| "epoch": 0.29055690072639223, | |
| "grad_norm": 0.1724368929862976, | |
| "learning_rate": 4.97624123005063e-05, | |
| "loss": 1.2500461339950562, | |
| "mean_token_accuracy": 0.6472327932715416, | |
| "num_tokens": 2905309.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 1.2676000744104385, | |
| "epoch": 0.30024213075060535, | |
| "grad_norm": 0.1697048544883728, | |
| "learning_rate": 4.972452435550614e-05, | |
| "loss": 1.2715867757797241, | |
| "mean_token_accuracy": 0.6399261504411697, | |
| "num_tokens": 3002360.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 1.259141355752945, | |
| "epoch": 0.3099273607748184, | |
| "grad_norm": 0.1588452011346817, | |
| "learning_rate": 4.968385131436222e-05, | |
| "loss": 1.2634798288345337, | |
| "mean_token_accuracy": 0.6464442312717438, | |
| "num_tokens": 3098670.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 1.240147739648819, | |
| "epoch": 0.3196125907990315, | |
| "grad_norm": 0.16833168268203735, | |
| "learning_rate": 4.9640397758692715e-05, | |
| "loss": 1.234930396080017, | |
| "mean_token_accuracy": 0.6492077708244324, | |
| "num_tokens": 3196614.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 1.2283259332180023, | |
| "epoch": 0.32929782082324455, | |
| "grad_norm": 0.15456287562847137, | |
| "learning_rate": 4.9594168583327094e-05, | |
| "loss": 1.209458589553833, | |
| "mean_token_accuracy": 0.654823787510395, | |
| "num_tokens": 3294374.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 1.2569270879030228, | |
| "epoch": 0.3389830508474576, | |
| "grad_norm": 0.1605941504240036, | |
| "learning_rate": 4.954516899575473e-05, | |
| "loss": 1.239461898803711, | |
| "mean_token_accuracy": 0.6469651088118553, | |
| "num_tokens": 3392016.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 1.2405883818864822, | |
| "epoch": 0.3486682808716707, | |
| "grad_norm": 0.14910897612571716, | |
| "learning_rate": 4.949340451553833e-05, | |
| "loss": 1.2166962623596191, | |
| "mean_token_accuracy": 0.6551224812865257, | |
| "num_tokens": 3489070.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 1.215465858578682, | |
| "epoch": 0.3583535108958838, | |
| "grad_norm": 0.147048220038414, | |
| "learning_rate": 4.943888097369216e-05, | |
| "loss": 1.2016295194625854, | |
| "mean_token_accuracy": 0.6562318950891495, | |
| "num_tokens": 3586431.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 1.2163386642932892, | |
| "epoch": 0.36803874092009686, | |
| "grad_norm": 0.15423355996608734, | |
| "learning_rate": 4.938160451202521e-05, | |
| "loss": 1.205035924911499, | |
| "mean_token_accuracy": 0.6569599062204361, | |
| "num_tokens": 3684062.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 1.2028222680091858, | |
| "epoch": 0.37772397094430993, | |
| "grad_norm": 0.15404321253299713, | |
| "learning_rate": 4.9321581582449365e-05, | |
| "loss": 1.192380428314209, | |
| "mean_token_accuracy": 0.6554796397686005, | |
| "num_tokens": 3780819.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 1.2089442908763885, | |
| "epoch": 0.387409200968523, | |
| "grad_norm": 0.14532388746738434, | |
| "learning_rate": 4.9258818946252624e-05, | |
| "loss": 1.2102763652801514, | |
| "mean_token_accuracy": 0.6531244814395905, | |
| "num_tokens": 3878336.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 1.1934202015399933, | |
| "epoch": 0.39709443099273606, | |
| "grad_norm": 0.1453426033258438, | |
| "learning_rate": 4.9193323673337476e-05, | |
| "loss": 1.1972005367279053, | |
| "mean_token_accuracy": 0.6552818641066551, | |
| "num_tokens": 3975553.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 1.1711555123329163, | |
| "epoch": 0.4067796610169492, | |
| "grad_norm": 0.1477774679660797, | |
| "learning_rate": 4.912510314142448e-05, | |
| "loss": 1.170544147491455, | |
| "mean_token_accuracy": 0.6620478183031082, | |
| "num_tokens": 4072191.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 1.1826989650726318, | |
| "epoch": 0.41646489104116224, | |
| "grad_norm": 0.14542169868946075, | |
| "learning_rate": 4.9054165035221236e-05, | |
| "loss": 1.1799176931381226, | |
| "mean_token_accuracy": 0.6598139330744743, | |
| "num_tokens": 4169972.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 1.1880664974451065, | |
| "epoch": 0.4261501210653753, | |
| "grad_norm": 0.1443413645029068, | |
| "learning_rate": 4.898051734555676e-05, | |
| "loss": 1.1854431629180908, | |
| "mean_token_accuracy": 0.66011131554842, | |
| "num_tokens": 4266802.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 1.1752376854419708, | |
| "epoch": 0.4358353510895884, | |
| "grad_norm": 0.23293092846870422, | |
| "learning_rate": 4.890416836848127e-05, | |
| "loss": 1.172422170639038, | |
| "mean_token_accuracy": 0.6633148416876793, | |
| "num_tokens": 4364720.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 1.1703867614269257, | |
| "epoch": 0.44552058111380144, | |
| "grad_norm": 0.1400470733642578, | |
| "learning_rate": 4.88251267043318e-05, | |
| "loss": 1.1647189855575562, | |
| "mean_token_accuracy": 0.665075309574604, | |
| "num_tokens": 4460849.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 1.17378731071949, | |
| "epoch": 0.4552058111380145, | |
| "grad_norm": 0.1396193504333496, | |
| "learning_rate": 4.87434012567633e-05, | |
| "loss": 1.1746811866760254, | |
| "mean_token_accuracy": 0.6617837771773338, | |
| "num_tokens": 4558078.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 1.1466614976525307, | |
| "epoch": 0.4648910411622276, | |
| "grad_norm": 0.14611490070819855, | |
| "learning_rate": 4.865900123174574e-05, | |
| "loss": 1.1373505592346191, | |
| "mean_token_accuracy": 0.6694466471672058, | |
| "num_tokens": 4656144.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 1.1598657816648483, | |
| "epoch": 0.4745762711864407, | |
| "grad_norm": 0.1434149593114853, | |
| "learning_rate": 4.857193613652711e-05, | |
| "loss": 1.1583551168441772, | |
| "mean_token_accuracy": 0.6666313409805298, | |
| "num_tokens": 4752916.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 1.1331430822610855, | |
| "epoch": 0.48426150121065376, | |
| "grad_norm": 0.13973699510097504, | |
| "learning_rate": 4.848221577856243e-05, | |
| "loss": 1.1207313537597656, | |
| "mean_token_accuracy": 0.6732116788625717, | |
| "num_tokens": 4850493.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 1.145334169268608, | |
| "epoch": 0.4939467312348668, | |
| "grad_norm": 0.13802146911621094, | |
| "learning_rate": 4.838985026440905e-05, | |
| "loss": 1.134577989578247, | |
| "mean_token_accuracy": 0.6739182397723198, | |
| "num_tokens": 4948257.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 1.1789843142032623, | |
| "epoch": 0.5036319612590799, | |
| "grad_norm": 0.14845487475395203, | |
| "learning_rate": 4.829484999858815e-05, | |
| "loss": 1.1688673496246338, | |
| "mean_token_accuracy": 0.6578787639737129, | |
| "num_tokens": 5045927.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 1.1895974725484848, | |
| "epoch": 0.513317191283293, | |
| "grad_norm": 0.1441718488931656, | |
| "learning_rate": 4.819722568241274e-05, | |
| "loss": 1.1826505661010742, | |
| "mean_token_accuracy": 0.6588587313890457, | |
| "num_tokens": 5142165.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 1.1316261738538742, | |
| "epoch": 0.5230024213075061, | |
| "grad_norm": 0.14087459444999695, | |
| "learning_rate": 4.8096988312782174e-05, | |
| "loss": 1.1231753826141357, | |
| "mean_token_accuracy": 0.6710022836923599, | |
| "num_tokens": 5239937.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 1.1435543149709702, | |
| "epoch": 0.5326876513317191, | |
| "grad_norm": 0.14454324543476105, | |
| "learning_rate": 4.799414918094347e-05, | |
| "loss": 1.1403521299362183, | |
| "mean_token_accuracy": 0.6671252995729446, | |
| "num_tokens": 5336273.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 1.0858831107616425, | |
| "epoch": 0.5423728813559322, | |
| "grad_norm": 0.14002826809883118, | |
| "learning_rate": 4.788871987121937e-05, | |
| "loss": 1.086983561515808, | |
| "mean_token_accuracy": 0.6800005808472633, | |
| "num_tokens": 5434119.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 1.1357448101043701, | |
| "epoch": 0.5520581113801453, | |
| "grad_norm": 0.1409410983324051, | |
| "learning_rate": 4.77807122597034e-05, | |
| "loss": 1.145082950592041, | |
| "mean_token_accuracy": 0.6666935756802559, | |
| "num_tokens": 5530374.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 1.121580258011818, | |
| "epoch": 0.5617433414043583, | |
| "grad_norm": 0.14635145664215088, | |
| "learning_rate": 4.767013851292212e-05, | |
| "loss": 1.134584665298462, | |
| "mean_token_accuracy": 0.6697172001004219, | |
| "num_tokens": 5627067.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 1.1188838332891464, | |
| "epoch": 0.5714285714285714, | |
| "grad_norm": 0.14798252284526825, | |
| "learning_rate": 4.755701108646463e-05, | |
| "loss": 1.128434419631958, | |
| "mean_token_accuracy": 0.6693471819162369, | |
| "num_tokens": 5721452.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 1.1582091152668, | |
| "epoch": 0.5811138014527845, | |
| "grad_norm": 0.14457716047763824, | |
| "learning_rate": 4.744134272357948e-05, | |
| "loss": 1.1655305624008179, | |
| "mean_token_accuracy": 0.6602210402488708, | |
| "num_tokens": 5818528.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 1.1417238414287567, | |
| "epoch": 0.5907990314769975, | |
| "grad_norm": 0.1429831087589264, | |
| "learning_rate": 4.732314645373921e-05, | |
| "loss": 1.1227712631225586, | |
| "mean_token_accuracy": 0.6702725440263748, | |
| "num_tokens": 5915548.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 1.1103073507547379, | |
| "epoch": 0.6004842615012107, | |
| "grad_norm": 0.14573390781879425, | |
| "learning_rate": 4.7202435591172676e-05, | |
| "loss": 1.0962705612182617, | |
| "mean_token_accuracy": 0.6774255335330963, | |
| "num_tokens": 6011742.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 1.122736319899559, | |
| "epoch": 0.6101694915254238, | |
| "grad_norm": 0.14568699896335602, | |
| "learning_rate": 4.7079223733365237e-05, | |
| "loss": 1.108860731124878, | |
| "mean_token_accuracy": 0.6744343638420105, | |
| "num_tokens": 6108610.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 1.1377546936273575, | |
| "epoch": 0.6198547215496368, | |
| "grad_norm": 0.15811605751514435, | |
| "learning_rate": 4.6953524759527054e-05, | |
| "loss": 1.1342792510986328, | |
| "mean_token_accuracy": 0.6696078702807426, | |
| "num_tokens": 6205888.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 1.117256410419941, | |
| "epoch": 0.6295399515738499, | |
| "grad_norm": 0.14264215528964996, | |
| "learning_rate": 4.6825352829029705e-05, | |
| "loss": 1.112156629562378, | |
| "mean_token_accuracy": 0.6736717820167542, | |
| "num_tokens": 6303176.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 1.1090807020664215, | |
| "epoch": 0.639225181598063, | |
| "grad_norm": 0.14527742564678192, | |
| "learning_rate": 4.6694722379811185e-05, | |
| "loss": 1.115394115447998, | |
| "mean_token_accuracy": 0.6744855791330338, | |
| "num_tokens": 6400425.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 1.1179847419261932, | |
| "epoch": 0.648910411622276, | |
| "grad_norm": 0.14383482933044434, | |
| "learning_rate": 4.656164812674951e-05, | |
| "loss": 1.1273249387741089, | |
| "mean_token_accuracy": 0.6708880066871643, | |
| "num_tokens": 6497165.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 1.1409042179584503, | |
| "epoch": 0.6585956416464891, | |
| "grad_norm": 0.15300460159778595, | |
| "learning_rate": 4.642614506000523e-05, | |
| "loss": 1.1354745626449585, | |
| "mean_token_accuracy": 0.6670901477336884, | |
| "num_tokens": 6594629.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 1.0936977565288544, | |
| "epoch": 0.6682808716707022, | |
| "grad_norm": 0.14818546175956726, | |
| "learning_rate": 4.628822844333278e-05, | |
| "loss": 1.0947887897491455, | |
| "mean_token_accuracy": 0.6786026880145073, | |
| "num_tokens": 6691606.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 1.1090299785137177, | |
| "epoch": 0.6779661016949152, | |
| "grad_norm": 0.14709310233592987, | |
| "learning_rate": 4.614791381236115e-05, | |
| "loss": 1.108567476272583, | |
| "mean_token_accuracy": 0.6737446561455727, | |
| "num_tokens": 6787144.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 1.1130342036485672, | |
| "epoch": 0.6876513317191283, | |
| "grad_norm": 0.14786535501480103, | |
| "learning_rate": 4.6005216972843864e-05, | |
| "loss": 1.1175450086593628, | |
| "mean_token_accuracy": 0.6724362820386887, | |
| "num_tokens": 6884460.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 1.090154156088829, | |
| "epoch": 0.6973365617433414, | |
| "grad_norm": 0.14625772833824158, | |
| "learning_rate": 4.5860153998878494e-05, | |
| "loss": 1.0817482471466064, | |
| "mean_token_accuracy": 0.67938332259655, | |
| "num_tokens": 6982209.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 1.1123566552996635, | |
| "epoch": 0.7070217917675545, | |
| "grad_norm": 0.14828450977802277, | |
| "learning_rate": 4.571274123109606e-05, | |
| "loss": 1.1023019552230835, | |
| "mean_token_accuracy": 0.675434984266758, | |
| "num_tokens": 7078357.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 1.1003855466842651, | |
| "epoch": 0.7167070217917676, | |
| "grad_norm": 0.14769022166728973, | |
| "learning_rate": 4.5562995274820284e-05, | |
| "loss": 1.0925781726837158, | |
| "mean_token_accuracy": 0.679414302110672, | |
| "num_tokens": 7174932.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 1.066821463406086, | |
| "epoch": 0.7263922518159807, | |
| "grad_norm": 0.14872464537620544, | |
| "learning_rate": 4.541093299819714e-05, | |
| "loss": 1.0721882581710815, | |
| "mean_token_accuracy": 0.6860671788454056, | |
| "num_tokens": 7271358.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 1.1028296649456024, | |
| "epoch": 0.7360774818401937, | |
| "grad_norm": 0.1491360366344452, | |
| "learning_rate": 4.5256571530294664e-05, | |
| "loss": 1.110499382019043, | |
| "mean_token_accuracy": 0.6740638688206673, | |
| "num_tokens": 7368532.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 1.0569827035069466, | |
| "epoch": 0.7457627118644068, | |
| "grad_norm": 0.14861756563186646, | |
| "learning_rate": 4.5099928259173516e-05, | |
| "loss": 1.0642375946044922, | |
| "mean_token_accuracy": 0.6815041974186897, | |
| "num_tokens": 7465042.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 1.0828624665737152, | |
| "epoch": 0.7554479418886199, | |
| "grad_norm": 0.15817824006080627, | |
| "learning_rate": 4.4941020829928245e-05, | |
| "loss": 1.086707353591919, | |
| "mean_token_accuracy": 0.6801510155200958, | |
| "num_tokens": 7561958.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 1.0969925075769424, | |
| "epoch": 0.7651331719128329, | |
| "grad_norm": 0.1529255509376526, | |
| "learning_rate": 4.477986714269972e-05, | |
| "loss": 1.0899672508239746, | |
| "mean_token_accuracy": 0.678456224501133, | |
| "num_tokens": 7659711.0, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 1.0624620243906975, | |
| "epoch": 0.774818401937046, | |
| "grad_norm": 0.15455132722854614, | |
| "learning_rate": 4.4616485350658685e-05, | |
| "loss": 1.0544354915618896, | |
| "mean_token_accuracy": 0.6855011060833931, | |
| "num_tokens": 7756475.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 1.1112875491380692, | |
| "epoch": 0.784503631961259, | |
| "grad_norm": 0.14817237854003906, | |
| "learning_rate": 4.445089385796099e-05, | |
| "loss": 1.096229076385498, | |
| "mean_token_accuracy": 0.6748161613941193, | |
| "num_tokens": 7853572.0, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 1.1143488436937332, | |
| "epoch": 0.7941888619854721, | |
| "grad_norm": 0.15500982105731964, | |
| "learning_rate": 4.4283111317674374e-05, | |
| "loss": 1.1159741878509521, | |
| "mean_token_accuracy": 0.6718207076191902, | |
| "num_tokens": 7951478.0, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 1.0716768354177475, | |
| "epoch": 0.8038740920096852, | |
| "grad_norm": 0.14607810974121094, | |
| "learning_rate": 4.4113156629677316e-05, | |
| "loss": 1.0741264820098877, | |
| "mean_token_accuracy": 0.6826100572943687, | |
| "num_tokens": 8048090.0, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 1.08623006939888, | |
| "epoch": 0.8135593220338984, | |
| "grad_norm": 0.1486004889011383, | |
| "learning_rate": 4.394104893853007e-05, | |
| "loss": 1.0830330848693848, | |
| "mean_token_accuracy": 0.678254209458828, | |
| "num_tokens": 8145495.0, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 1.0595624893903732, | |
| "epoch": 0.8232445520581114, | |
| "grad_norm": 0.15346822142601013, | |
| "learning_rate": 4.3766807631318106e-05, | |
| "loss": 1.0648397207260132, | |
| "mean_token_accuracy": 0.6820255219936371, | |
| "num_tokens": 8243257.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 1.0569987148046494, | |
| "epoch": 0.8329297820823245, | |
| "grad_norm": 0.15623626112937927, | |
| "learning_rate": 4.359045233546827e-05, | |
| "loss": 1.0685005187988281, | |
| "mean_token_accuracy": 0.684545986354351, | |
| "num_tokens": 8338257.0, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 1.0479903519153595, | |
| "epoch": 0.8426150121065376, | |
| "grad_norm": 0.14811332523822784, | |
| "learning_rate": 4.341200291653781e-05, | |
| "loss": 1.058138132095337, | |
| "mean_token_accuracy": 0.6859943941235542, | |
| "num_tokens": 8436280.0, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 1.1004953235387802, | |
| "epoch": 0.8523002421307506, | |
| "grad_norm": 0.1508825272321701, | |
| "learning_rate": 4.323147947597666e-05, | |
| "loss": 1.1114561557769775, | |
| "mean_token_accuracy": 0.6722725033760071, | |
| "num_tokens": 8534296.0, | |
| "step": 88 | |
| }, | |
| { | |
| "entropy": 1.0389911904931068, | |
| "epoch": 0.8619854721549637, | |
| "grad_norm": 0.1480080932378769, | |
| "learning_rate": 4.3048902348863116e-05, | |
| "loss": 1.0304014682769775, | |
| "mean_token_accuracy": 0.6923525035381317, | |
| "num_tokens": 8631835.0, | |
| "step": 89 | |
| }, | |
| { | |
| "entropy": 1.0742208510637283, | |
| "epoch": 0.8716707021791767, | |
| "grad_norm": 0.14625877141952515, | |
| "learning_rate": 4.2864292101613136e-05, | |
| "loss": 1.0725879669189453, | |
| "mean_token_accuracy": 0.6854639276862144, | |
| "num_tokens": 8728666.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 1.036693975329399, | |
| "epoch": 0.8813559322033898, | |
| "grad_norm": 0.14420975744724274, | |
| "learning_rate": 4.267766952966369e-05, | |
| "loss": 1.0207698345184326, | |
| "mean_token_accuracy": 0.6963317543268204, | |
| "num_tokens": 8826157.0, | |
| "step": 91 | |
| }, | |
| { | |
| "entropy": 1.066306859254837, | |
| "epoch": 0.8910411622276029, | |
| "grad_norm": 0.154633030295372, | |
| "learning_rate": 4.248905565513023e-05, | |
| "loss": 1.0533056259155273, | |
| "mean_token_accuracy": 0.6857179254293442, | |
| "num_tokens": 8919599.0, | |
| "step": 92 | |
| }, | |
| { | |
| "entropy": 1.0462640300393105, | |
| "epoch": 0.9007263922518159, | |
| "grad_norm": 0.15113948285579681, | |
| "learning_rate": 4.229847172443866e-05, | |
| "loss": 1.0407187938690186, | |
| "mean_token_accuracy": 0.6907829195261002, | |
| "num_tokens": 9017083.0, | |
| "step": 93 | |
| }, | |
| { | |
| "entropy": 1.0615776777267456, | |
| "epoch": 0.910411622276029, | |
| "grad_norm": 0.1515236496925354, | |
| "learning_rate": 4.210593920593201e-05, | |
| "loss": 1.0574121475219727, | |
| "mean_token_accuracy": 0.6874448731541634, | |
| "num_tokens": 9114699.0, | |
| "step": 94 | |
| }, | |
| { | |
| "entropy": 1.0619953870773315, | |
| "epoch": 0.9200968523002422, | |
| "grad_norm": 0.15497922897338867, | |
| "learning_rate": 4.191147978745218e-05, | |
| "loss": 1.0640019178390503, | |
| "mean_token_accuracy": 0.6830037236213684, | |
| "num_tokens": 9212478.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 1.0610519051551819, | |
| "epoch": 0.9297820823244553, | |
| "grad_norm": 0.16060221195220947, | |
| "learning_rate": 4.171511537389684e-05, | |
| "loss": 1.0584205389022827, | |
| "mean_token_accuracy": 0.6856881454586983, | |
| "num_tokens": 9309385.0, | |
| "step": 96 | |
| }, | |
| { | |
| "entropy": 1.0446307063102722, | |
| "epoch": 0.9394673123486683, | |
| "grad_norm": 0.15420550107955933, | |
| "learning_rate": 4.151686808475204e-05, | |
| "loss": 1.047270655632019, | |
| "mean_token_accuracy": 0.6872993409633636, | |
| "num_tokens": 9405674.0, | |
| "step": 97 | |
| }, | |
| { | |
| "entropy": 1.054522544145584, | |
| "epoch": 0.9491525423728814, | |
| "grad_norm": 0.15661559998989105, | |
| "learning_rate": 4.131676025160047e-05, | |
| "loss": 1.0625941753387451, | |
| "mean_token_accuracy": 0.6845473125576973, | |
| "num_tokens": 9502863.0, | |
| "step": 98 | |
| }, | |
| { | |
| "entropy": 1.0278218686580658, | |
| "epoch": 0.9588377723970944, | |
| "grad_norm": 0.15473391115665436, | |
| "learning_rate": 4.111481441560598e-05, | |
| "loss": 1.0273422002792358, | |
| "mean_token_accuracy": 0.6932465434074402, | |
| "num_tokens": 9600669.0, | |
| "step": 99 | |
| }, | |
| { | |
| "entropy": 1.041596107184887, | |
| "epoch": 0.9685230024213075, | |
| "grad_norm": 0.1449374407529831, | |
| "learning_rate": 4.091105332497439e-05, | |
| "loss": 1.0463595390319824, | |
| "mean_token_accuracy": 0.6912512555718422, | |
| "num_tokens": 9697304.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 1.0684800148010254, | |
| "epoch": 0.9782082324455206, | |
| "grad_norm": 0.1515686959028244, | |
| "learning_rate": 4.070549993239106e-05, | |
| "loss": 1.0661861896514893, | |
| "mean_token_accuracy": 0.6858441829681396, | |
| "num_tokens": 9794066.0, | |
| "step": 101 | |
| }, | |
| { | |
| "entropy": 1.0518590733408928, | |
| "epoch": 0.9878934624697336, | |
| "grad_norm": 0.15803049504756927, | |
| "learning_rate": 4.049817739243532e-05, | |
| "loss": 1.037236213684082, | |
| "mean_token_accuracy": 0.689392939209938, | |
| "num_tokens": 9889545.0, | |
| "step": 102 | |
| }, | |
| { | |
| "entropy": 1.0445326566696167, | |
| "epoch": 0.9975786924939467, | |
| "grad_norm": 0.15257743000984192, | |
| "learning_rate": 4.028910905897229e-05, | |
| "loss": 1.0427336692810059, | |
| "mean_token_accuracy": 0.6887638568878174, | |
| "num_tokens": 9984866.0, | |
| "step": 103 | |
| }, | |
| { | |
| "entropy": 1.0611678957939148, | |
| "epoch": 1.0, | |
| "grad_norm": 0.2940840721130371, | |
| "learning_rate": 4.007831848252211e-05, | |
| "loss": 1.0530990362167358, | |
| "mean_token_accuracy": 0.6814314126968384, | |
| "num_tokens": 10009403.0, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 1.0497082397341728, | |
| "epoch": 1.0096852300242132, | |
| "grad_norm": 0.1564565747976303, | |
| "learning_rate": 3.986582940760717e-05, | |
| "loss": 1.030436396598816, | |
| "mean_token_accuracy": 0.6926182061433792, | |
| "num_tokens": 10106335.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 1.0123815387487411, | |
| "epoch": 1.0193704600484261, | |
| "grad_norm": 0.1642434448003769, | |
| "learning_rate": 3.965166577007733e-05, | |
| "loss": 1.0002119541168213, | |
| "mean_token_accuracy": 0.6985866278409958, | |
| "num_tokens": 10202191.0, | |
| "step": 106 | |
| }, | |
| { | |
| "entropy": 1.0041352361440659, | |
| "epoch": 1.0290556900726393, | |
| "grad_norm": 0.1648867130279541, | |
| "learning_rate": 3.94358516944137e-05, | |
| "loss": 1.0050082206726074, | |
| "mean_token_accuracy": 0.6969355717301369, | |
| "num_tokens": 10299771.0, | |
| "step": 107 | |
| }, | |
| { | |
| "entropy": 1.0074616223573685, | |
| "epoch": 1.0387409200968523, | |
| "grad_norm": 0.16517765820026398, | |
| "learning_rate": 3.9218411491011176e-05, | |
| "loss": 1.014854907989502, | |
| "mean_token_accuracy": 0.6966256648302078, | |
| "num_tokens": 10397225.0, | |
| "step": 108 | |
| }, | |
| { | |
| "entropy": 0.9936244934797287, | |
| "epoch": 1.0484261501210654, | |
| "grad_norm": 0.16205355525016785, | |
| "learning_rate": 3.899936965343989e-05, | |
| "loss": 1.0037654638290405, | |
| "mean_token_accuracy": 0.6981071457266808, | |
| "num_tokens": 10495072.0, | |
| "step": 109 | |
| }, | |
| { | |
| "entropy": 0.988917775452137, | |
| "epoch": 1.0581113801452784, | |
| "grad_norm": 0.16487880051136017, | |
| "learning_rate": 3.877875085568623e-05, | |
| "loss": 0.9998143911361694, | |
| "mean_token_accuracy": 0.6989010348916054, | |
| "num_tokens": 10593014.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 1.0223135277628899, | |
| "epoch": 1.0677966101694916, | |
| "grad_norm": 0.1645587831735611, | |
| "learning_rate": 3.8556579949373384e-05, | |
| "loss": 1.023576021194458, | |
| "mean_token_accuracy": 0.692980445921421, | |
| "num_tokens": 10690703.0, | |
| "step": 111 | |
| }, | |
| { | |
| "entropy": 1.015090361237526, | |
| "epoch": 1.0774818401937045, | |
| "grad_norm": 0.15396536886692047, | |
| "learning_rate": 3.833288196096194e-05, | |
| "loss": 1.0166376829147339, | |
| "mean_token_accuracy": 0.6936796456575394, | |
| "num_tokens": 10788092.0, | |
| "step": 112 | |
| }, | |
| { | |
| "entropy": 1.0370544865727425, | |
| "epoch": 1.0871670702179177, | |
| "grad_norm": 0.159644216299057, | |
| "learning_rate": 3.8107682088930794e-05, | |
| "loss": 1.023399829864502, | |
| "mean_token_accuracy": 0.6933755651116371, | |
| "num_tokens": 10884533.0, | |
| "step": 113 | |
| }, | |
| { | |
| "entropy": 1.0179733633995056, | |
| "epoch": 1.0968523002421307, | |
| "grad_norm": 0.16513484716415405, | |
| "learning_rate": 3.7881005700938635e-05, | |
| "loss": 1.0117831230163574, | |
| "mean_token_accuracy": 0.6966173946857452, | |
| "num_tokens": 10980390.0, | |
| "step": 114 | |
| }, | |
| { | |
| "entropy": 1.0589358359575272, | |
| "epoch": 1.1065375302663438, | |
| "grad_norm": 0.16453009843826294, | |
| "learning_rate": 3.7652878330966415e-05, | |
| "loss": 1.041041612625122, | |
| "mean_token_accuracy": 0.6878631860017776, | |
| "num_tokens": 11076573.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 1.0219000279903412, | |
| "epoch": 1.116222760290557, | |
| "grad_norm": 0.1623397022485733, | |
| "learning_rate": 3.742332567644107e-05, | |
| "loss": 1.0067601203918457, | |
| "mean_token_accuracy": 0.6953606754541397, | |
| "num_tokens": 11173211.0, | |
| "step": 116 | |
| }, | |
| { | |
| "entropy": 0.9765115603804588, | |
| "epoch": 1.12590799031477, | |
| "grad_norm": 0.15821851789951324, | |
| "learning_rate": 3.719237359534087e-05, | |
| "loss": 0.9680384397506714, | |
| "mean_token_accuracy": 0.7078221663832664, | |
| "num_tokens": 11269149.0, | |
| "step": 117 | |
| }, | |
| { | |
| "entropy": 1.0054796189069748, | |
| "epoch": 1.1355932203389831, | |
| "grad_norm": 0.16345135867595673, | |
| "learning_rate": 3.6960048103282566e-05, | |
| "loss": 1.0104200839996338, | |
| "mean_token_accuracy": 0.6938582733273506, | |
| "num_tokens": 11366538.0, | |
| "step": 118 | |
| }, | |
| { | |
| "entropy": 1.0051406398415565, | |
| "epoch": 1.145278450363196, | |
| "grad_norm": 0.155021533370018, | |
| "learning_rate": 3.672637537059093e-05, | |
| "loss": 1.0087268352508545, | |
| "mean_token_accuracy": 0.6973330229520798, | |
| "num_tokens": 11464379.0, | |
| "step": 119 | |
| }, | |
| { | |
| "entropy": 1.0200638100504875, | |
| "epoch": 1.1549636803874093, | |
| "grad_norm": 0.17094552516937256, | |
| "learning_rate": 3.6491381719350756e-05, | |
| "loss": 1.036880612373352, | |
| "mean_token_accuracy": 0.6878476142883301, | |
| "num_tokens": 11561148.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 1.012288749217987, | |
| "epoch": 1.1646489104116222, | |
| "grad_norm": 0.16450250148773193, | |
| "learning_rate": 3.6255093620441834e-05, | |
| "loss": 1.0213954448699951, | |
| "mean_token_accuracy": 0.6948853880167007, | |
| "num_tokens": 11658242.0, | |
| "step": 121 | |
| }, | |
| { | |
| "entropy": 1.0086817741394043, | |
| "epoch": 1.1743341404358354, | |
| "grad_norm": 0.1626807153224945, | |
| "learning_rate": 3.6017537690557115e-05, | |
| "loss": 1.0057084560394287, | |
| "mean_token_accuracy": 0.6975555568933487, | |
| "num_tokens": 11754691.0, | |
| "step": 122 | |
| }, | |
| { | |
| "entropy": 0.9957757294178009, | |
| "epoch": 1.1840193704600483, | |
| "grad_norm": 0.15866564214229584, | |
| "learning_rate": 3.577874068920446e-05, | |
| "loss": 0.9769740104675293, | |
| "mean_token_accuracy": 0.7049618437886238, | |
| "num_tokens": 11851957.0, | |
| "step": 123 | |
| }, | |
| { | |
| "entropy": 1.023524522781372, | |
| "epoch": 1.1937046004842615, | |
| "grad_norm": 0.15701547265052795, | |
| "learning_rate": 3.553872951569236e-05, | |
| "loss": 1.0102542638778687, | |
| "mean_token_accuracy": 0.6948281303048134, | |
| "num_tokens": 11949158.0, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 1.0255613550543785, | |
| "epoch": 1.2033898305084745, | |
| "grad_norm": 0.160598024725914, | |
| "learning_rate": 3.529753120609982e-05, | |
| "loss": 1.0142004489898682, | |
| "mean_token_accuracy": 0.6950482055544853, | |
| "num_tokens": 12047065.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 1.0207768678665161, | |
| "epoch": 1.2130750605326877, | |
| "grad_norm": 0.1668667197227478, | |
| "learning_rate": 3.505517293023088e-05, | |
| "loss": 1.0299181938171387, | |
| "mean_token_accuracy": 0.6932333111763, | |
| "num_tokens": 12140843.0, | |
| "step": 126 | |
| }, | |
| { | |
| "entropy": 1.0096961930394173, | |
| "epoch": 1.2227602905569008, | |
| "grad_norm": 0.15583710372447968, | |
| "learning_rate": 3.481168198855409e-05, | |
| "loss": 1.0230910778045654, | |
| "mean_token_accuracy": 0.6935219466686249, | |
| "num_tokens": 12238169.0, | |
| "step": 127 | |
| }, | |
| { | |
| "entropy": 1.0121450945734978, | |
| "epoch": 1.2324455205811138, | |
| "grad_norm": 0.1601191908121109, | |
| "learning_rate": 3.456708580912725e-05, | |
| "loss": 1.0020897388458252, | |
| "mean_token_accuracy": 0.6964283734560013, | |
| "num_tokens": 12336055.0, | |
| "step": 128 | |
| }, | |
| { | |
| "entropy": 1.0203755050897598, | |
| "epoch": 1.242130750605327, | |
| "grad_norm": 0.16153757274150848, | |
| "learning_rate": 3.432141194450772e-05, | |
| "loss": 1.0235494375228882, | |
| "mean_token_accuracy": 0.6922239810228348, | |
| "num_tokens": 12433292.0, | |
| "step": 129 | |
| }, | |
| { | |
| "entropy": 0.9952817261219025, | |
| "epoch": 1.25181598062954, | |
| "grad_norm": 0.16117016971111298, | |
| "learning_rate": 3.407468806864883e-05, | |
| "loss": 0.9944422245025635, | |
| "mean_token_accuracy": 0.6995577961206436, | |
| "num_tokens": 12529632.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 1.0067841857671738, | |
| "epoch": 1.261501210653753, | |
| "grad_norm": 0.15968872606754303, | |
| "learning_rate": 3.382694197378252e-05, | |
| "loss": 1.0131640434265137, | |
| "mean_token_accuracy": 0.6946265995502472, | |
| "num_tokens": 12627363.0, | |
| "step": 131 | |
| }, | |
| { | |
| "entropy": 1.0088231563568115, | |
| "epoch": 1.271186440677966, | |
| "grad_norm": 0.16917093098163605, | |
| "learning_rate": 3.357820156728867e-05, | |
| "loss": 1.0098109245300293, | |
| "mean_token_accuracy": 0.6978933215141296, | |
| "num_tokens": 12722873.0, | |
| "step": 132 | |
| }, | |
| { | |
| "entropy": 1.0022346451878548, | |
| "epoch": 1.2808716707021792, | |
| "grad_norm": 0.16208580136299133, | |
| "learning_rate": 3.332849486855144e-05, | |
| "loss": 1.0061886310577393, | |
| "mean_token_accuracy": 0.6940922066569328, | |
| "num_tokens": 12818842.0, | |
| "step": 133 | |
| }, | |
| { | |
| "entropy": 0.9971742331981659, | |
| "epoch": 1.2905569007263922, | |
| "grad_norm": 0.15936775505542755, | |
| "learning_rate": 3.307785000580313e-05, | |
| "loss": 0.9899219870567322, | |
| "mean_token_accuracy": 0.7014091834425926, | |
| "num_tokens": 12916424.0, | |
| "step": 134 | |
| }, | |
| { | |
| "entropy": 0.9976816847920418, | |
| "epoch": 1.3002421307506054, | |
| "grad_norm": 0.2688247561454773, | |
| "learning_rate": 3.282629521295556e-05, | |
| "loss": 1.000976324081421, | |
| "mean_token_accuracy": 0.6989069283008575, | |
| "num_tokens": 13012418.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 0.9814217463135719, | |
| "epoch": 1.3099273607748185, | |
| "grad_norm": 0.1612652987241745, | |
| "learning_rate": 3.257385882641971e-05, | |
| "loss": 0.9776369333267212, | |
| "mean_token_accuracy": 0.7035728245973587, | |
| "num_tokens": 13109173.0, | |
| "step": 136 | |
| }, | |
| { | |
| "entropy": 1.001495622098446, | |
| "epoch": 1.3196125907990315, | |
| "grad_norm": 0.15470746159553528, | |
| "learning_rate": 3.232056928191376e-05, | |
| "loss": 0.9890879988670349, | |
| "mean_token_accuracy": 0.6988591179251671, | |
| "num_tokens": 13207226.0, | |
| "step": 137 | |
| }, | |
| { | |
| "entropy": 0.9967611879110336, | |
| "epoch": 1.3292978208232444, | |
| "grad_norm": 0.1591372787952423, | |
| "learning_rate": 3.2066455111259945e-05, | |
| "loss": 0.9965915679931641, | |
| "mean_token_accuracy": 0.6986541524529457, | |
| "num_tokens": 13304690.0, | |
| "step": 138 | |
| }, | |
| { | |
| "entropy": 0.9881946295499802, | |
| "epoch": 1.3389830508474576, | |
| "grad_norm": 0.16304631531238556, | |
| "learning_rate": 3.1811544939170575e-05, | |
| "loss": 0.9952649474143982, | |
| "mean_token_accuracy": 0.6945862323045731, | |
| "num_tokens": 13402318.0, | |
| "step": 139 | |
| }, | |
| { | |
| "entropy": 0.9948993697762489, | |
| "epoch": 1.3486682808716708, | |
| "grad_norm": 0.162835955619812, | |
| "learning_rate": 3.155586748002362e-05, | |
| "loss": 1.0011897087097168, | |
| "mean_token_accuracy": 0.6979707032442093, | |
| "num_tokens": 13498911.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 1.0100372210144997, | |
| "epoch": 1.3583535108958837, | |
| "grad_norm": 0.1653631329536438, | |
| "learning_rate": 3.1299451534628135e-05, | |
| "loss": 1.0079827308654785, | |
| "mean_token_accuracy": 0.6955159679055214, | |
| "num_tokens": 13596489.0, | |
| "step": 141 | |
| }, | |
| { | |
| "entropy": 1.0005303993821144, | |
| "epoch": 1.368038740920097, | |
| "grad_norm": 0.15816530585289001, | |
| "learning_rate": 3.1042325986980064e-05, | |
| "loss": 0.9934114813804626, | |
| "mean_token_accuracy": 0.6982027143239975, | |
| "num_tokens": 13693181.0, | |
| "step": 142 | |
| }, | |
| { | |
| "entropy": 1.0108712911605835, | |
| "epoch": 1.3777239709443099, | |
| "grad_norm": 0.16801035404205322, | |
| "learning_rate": 3.0784519801008546e-05, | |
| "loss": 1.0035772323608398, | |
| "mean_token_accuracy": 0.6946400851011276, | |
| "num_tokens": 13790207.0, | |
| "step": 143 | |
| }, | |
| { | |
| "entropy": 0.9940394014120102, | |
| "epoch": 1.387409200968523, | |
| "grad_norm": 0.16538861393928528, | |
| "learning_rate": 3.0526062017313254e-05, | |
| "loss": 0.9854618906974792, | |
| "mean_token_accuracy": 0.6998060122132301, | |
| "num_tokens": 13886824.0, | |
| "step": 144 | |
| }, | |
| { | |
| "entropy": 1.015800602734089, | |
| "epoch": 1.397094430992736, | |
| "grad_norm": 0.16404059529304504, | |
| "learning_rate": 3.0266981749893157e-05, | |
| "loss": 1.010426640510559, | |
| "mean_token_accuracy": 0.6951465085148811, | |
| "num_tokens": 13984711.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 1.0125101953744888, | |
| "epoch": 1.4067796610169492, | |
| "grad_norm": 0.1646854728460312, | |
| "learning_rate": 3.0007308182866985e-05, | |
| "loss": 1.0053914785385132, | |
| "mean_token_accuracy": 0.693408191204071, | |
| "num_tokens": 14082491.0, | |
| "step": 146 | |
| }, | |
| { | |
| "entropy": 1.0149571672081947, | |
| "epoch": 1.4164648910411621, | |
| "grad_norm": 0.27195093035697937, | |
| "learning_rate": 2.974707056718571e-05, | |
| "loss": 1.0218114852905273, | |
| "mean_token_accuracy": 0.6915486976504326, | |
| "num_tokens": 14178367.0, | |
| "step": 147 | |
| }, | |
| { | |
| "entropy": 1.0098140239715576, | |
| "epoch": 1.4261501210653753, | |
| "grad_norm": 0.16734321415424347, | |
| "learning_rate": 2.9486298217337637e-05, | |
| "loss": 1.0243513584136963, | |
| "mean_token_accuracy": 0.6904255822300911, | |
| "num_tokens": 14275669.0, | |
| "step": 148 | |
| }, | |
| { | |
| "entropy": 0.9736747220158577, | |
| "epoch": 1.4358353510895885, | |
| "grad_norm": 0.1625024378299713, | |
| "learning_rate": 2.9225020508046232e-05, | |
| "loss": 0.9738012552261353, | |
| "mean_token_accuracy": 0.7017730921506882, | |
| "num_tokens": 14372400.0, | |
| "step": 149 | |
| }, | |
| { | |
| "entropy": 1.016117848455906, | |
| "epoch": 1.4455205811138014, | |
| "grad_norm": 0.16163532435894012, | |
| "learning_rate": 2.8963266870961226e-05, | |
| "loss": 1.0025385618209839, | |
| "mean_token_accuracy": 0.6962382420897484, | |
| "num_tokens": 14468895.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 1.000129446387291, | |
| "epoch": 1.4552058111380144, | |
| "grad_norm": 0.1636207103729248, | |
| "learning_rate": 2.8701066791343288e-05, | |
| "loss": 0.9981441497802734, | |
| "mean_token_accuracy": 0.6979088559746742, | |
| "num_tokens": 14566496.0, | |
| "step": 151 | |
| }, | |
| { | |
| "entropy": 1.0115438923239708, | |
| "epoch": 1.4648910411622276, | |
| "grad_norm": 0.16182203590869904, | |
| "learning_rate": 2.8438449804742628e-05, | |
| "loss": 1.0085995197296143, | |
| "mean_token_accuracy": 0.6946075111627579, | |
| "num_tokens": 14664097.0, | |
| "step": 152 | |
| }, | |
| { | |
| "entropy": 0.9745980277657509, | |
| "epoch": 1.4745762711864407, | |
| "grad_norm": 0.1606246829032898, | |
| "learning_rate": 2.8175445493671972e-05, | |
| "loss": 0.9741977453231812, | |
| "mean_token_accuracy": 0.7038497105240822, | |
| "num_tokens": 14761778.0, | |
| "step": 153 | |
| }, | |
| { | |
| "entropy": 0.9997073635458946, | |
| "epoch": 1.4842615012106537, | |
| "grad_norm": 0.1606900691986084, | |
| "learning_rate": 2.7912083484274266e-05, | |
| "loss": 1.0080050230026245, | |
| "mean_token_accuracy": 0.6961813271045685, | |
| "num_tokens": 14858797.0, | |
| "step": 154 | |
| }, | |
| { | |
| "entropy": 1.014495812356472, | |
| "epoch": 1.4939467312348669, | |
| "grad_norm": 0.16178575158119202, | |
| "learning_rate": 2.7648393442985403e-05, | |
| "loss": 1.0042692422866821, | |
| "mean_token_accuracy": 0.69585070759058, | |
| "num_tokens": 14955777.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 1.0302998945116997, | |
| "epoch": 1.5036319612590798, | |
| "grad_norm": 0.16053006052970886, | |
| "learning_rate": 2.7384405073192454e-05, | |
| "loss": 1.0217926502227783, | |
| "mean_token_accuracy": 0.6916443780064583, | |
| "num_tokens": 15052841.0, | |
| "step": 156 | |
| }, | |
| { | |
| "entropy": 0.9914230555295944, | |
| "epoch": 1.513317191283293, | |
| "grad_norm": 0.15790845453739166, | |
| "learning_rate": 2.7120148111887732e-05, | |
| "loss": 0.9867815971374512, | |
| "mean_token_accuracy": 0.7012891918420792, | |
| "num_tokens": 15146917.0, | |
| "step": 157 | |
| }, | |
| { | |
| "entropy": 0.9733176603913307, | |
| "epoch": 1.5230024213075062, | |
| "grad_norm": 0.15671640634536743, | |
| "learning_rate": 2.6855652326319063e-05, | |
| "loss": 0.9663571715354919, | |
| "mean_token_accuracy": 0.7067279890179634, | |
| "num_tokens": 15244027.0, | |
| "step": 158 | |
| }, | |
| { | |
| "entropy": 0.9909517616033554, | |
| "epoch": 1.5326876513317191, | |
| "grad_norm": 0.15879209339618683, | |
| "learning_rate": 2.659094751063666e-05, | |
| "loss": 0.9971685409545898, | |
| "mean_token_accuracy": 0.6988729164004326, | |
| "num_tokens": 15340804.0, | |
| "step": 159 | |
| }, | |
| { | |
| "entropy": 1.0000923573970795, | |
| "epoch": 1.542372881355932, | |
| "grad_norm": 0.15917372703552246, | |
| "learning_rate": 2.6326063482536934e-05, | |
| "loss": 1.0012197494506836, | |
| "mean_token_accuracy": 0.6966550797224045, | |
| "num_tokens": 15437706.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 1.0145022571086884, | |
| "epoch": 1.5520581113801453, | |
| "grad_norm": 0.16265787184238434, | |
| "learning_rate": 2.606103007990371e-05, | |
| "loss": 1.0111325979232788, | |
| "mean_token_accuracy": 0.6933945044875145, | |
| "num_tokens": 15531879.0, | |
| "step": 161 | |
| }, | |
| { | |
| "entropy": 1.0036377906799316, | |
| "epoch": 1.5617433414043584, | |
| "grad_norm": 0.16375237703323364, | |
| "learning_rate": 2.579587715744712e-05, | |
| "loss": 1.0029797554016113, | |
| "mean_token_accuracy": 0.6955940127372742, | |
| "num_tokens": 15629721.0, | |
| "step": 162 | |
| }, | |
| { | |
| "entropy": 1.0386734753847122, | |
| "epoch": 1.5714285714285714, | |
| "grad_norm": 0.16306881606578827, | |
| "learning_rate": 2.5530634583340592e-05, | |
| "loss": 1.0406312942504883, | |
| "mean_token_accuracy": 0.6886710077524185, | |
| "num_tokens": 15727030.0, | |
| "step": 163 | |
| }, | |
| { | |
| "entropy": 0.9940996393561363, | |
| "epoch": 1.5811138014527844, | |
| "grad_norm": 0.16509971022605896, | |
| "learning_rate": 2.526533223585641e-05, | |
| "loss": 0.9921597838401794, | |
| "mean_token_accuracy": 0.7000836208462715, | |
| "num_tokens": 15823642.0, | |
| "step": 164 | |
| }, | |
| { | |
| "entropy": 1.0113196671009064, | |
| "epoch": 1.5907990314769975, | |
| "grad_norm": 0.17014694213867188, | |
| "learning_rate": 2.5e-05, | |
| "loss": 1.000211238861084, | |
| "mean_token_accuracy": 0.696845568716526, | |
| "num_tokens": 15920894.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 1.0079443007707596, | |
| "epoch": 1.6004842615012107, | |
| "grad_norm": 0.16094236075878143, | |
| "learning_rate": 2.47346677641436e-05, | |
| "loss": 0.9985548257827759, | |
| "mean_token_accuracy": 0.6970102190971375, | |
| "num_tokens": 16018678.0, | |
| "step": 166 | |
| }, | |
| { | |
| "entropy": 1.0026478096842766, | |
| "epoch": 1.6101694915254239, | |
| "grad_norm": 0.16517619788646698, | |
| "learning_rate": 2.446936541665941e-05, | |
| "loss": 0.9906925559043884, | |
| "mean_token_accuracy": 0.6991379931569099, | |
| "num_tokens": 16115100.0, | |
| "step": 167 | |
| }, | |
| { | |
| "entropy": 1.009756289422512, | |
| "epoch": 1.6198547215496368, | |
| "grad_norm": 0.16483961045742035, | |
| "learning_rate": 2.4204122842552896e-05, | |
| "loss": 1.0100080966949463, | |
| "mean_token_accuracy": 0.6920091360807419, | |
| "num_tokens": 16212185.0, | |
| "step": 168 | |
| }, | |
| { | |
| "entropy": 0.9892624393105507, | |
| "epoch": 1.6295399515738498, | |
| "grad_norm": 0.16626964509487152, | |
| "learning_rate": 2.39389699200963e-05, | |
| "loss": 0.9917020797729492, | |
| "mean_token_accuracy": 0.6994179859757423, | |
| "num_tokens": 16309607.0, | |
| "step": 169 | |
| }, | |
| { | |
| "entropy": 0.9693093672394753, | |
| "epoch": 1.639225181598063, | |
| "grad_norm": 0.16250012814998627, | |
| "learning_rate": 2.3673936517463075e-05, | |
| "loss": 0.9778143763542175, | |
| "mean_token_accuracy": 0.7030152902007103, | |
| "num_tokens": 16403478.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.999257817864418, | |
| "epoch": 1.6489104116222761, | |
| "grad_norm": 0.16267414391040802, | |
| "learning_rate": 2.3409052489363342e-05, | |
| "loss": 1.008827805519104, | |
| "mean_token_accuracy": 0.6968575343489647, | |
| "num_tokens": 16499376.0, | |
| "step": 171 | |
| }, | |
| { | |
| "entropy": 0.9948962330818176, | |
| "epoch": 1.658595641646489, | |
| "grad_norm": 0.16714368760585785, | |
| "learning_rate": 2.3144347673680936e-05, | |
| "loss": 1.0074965953826904, | |
| "mean_token_accuracy": 0.694792777299881, | |
| "num_tokens": 16597152.0, | |
| "step": 172 | |
| }, | |
| { | |
| "entropy": 0.9955190569162369, | |
| "epoch": 1.668280871670702, | |
| "grad_norm": 0.17781881988048553, | |
| "learning_rate": 2.287985188811228e-05, | |
| "loss": 0.9991034269332886, | |
| "mean_token_accuracy": 0.697237454354763, | |
| "num_tokens": 16693593.0, | |
| "step": 173 | |
| }, | |
| { | |
| "entropy": 0.9868601709604263, | |
| "epoch": 1.6779661016949152, | |
| "grad_norm": 0.1637657880783081, | |
| "learning_rate": 2.261559492680755e-05, | |
| "loss": 0.9883804321289062, | |
| "mean_token_accuracy": 0.7004631012678146, | |
| "num_tokens": 16791648.0, | |
| "step": 174 | |
| }, | |
| { | |
| "entropy": 0.9998594745993614, | |
| "epoch": 1.6876513317191284, | |
| "grad_norm": 0.16492129862308502, | |
| "learning_rate": 2.23516065570146e-05, | |
| "loss": 0.988003134727478, | |
| "mean_token_accuracy": 0.7004012763500214, | |
| "num_tokens": 16887565.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 0.9922599494457245, | |
| "epoch": 1.6973365617433414, | |
| "grad_norm": 0.16476185619831085, | |
| "learning_rate": 2.2087916515725737e-05, | |
| "loss": 0.9830120801925659, | |
| "mean_token_accuracy": 0.7036381214857101, | |
| "num_tokens": 16983866.0, | |
| "step": 176 | |
| }, | |
| { | |
| "entropy": 0.9667748808860779, | |
| "epoch": 1.7070217917675545, | |
| "grad_norm": 0.1622721403837204, | |
| "learning_rate": 2.182455450632803e-05, | |
| "loss": 0.9589613676071167, | |
| "mean_token_accuracy": 0.7059106230735779, | |
| "num_tokens": 17080511.0, | |
| "step": 177 | |
| }, | |
| { | |
| "entropy": 1.0044486820697784, | |
| "epoch": 1.7167070217917675, | |
| "grad_norm": 0.16303181648254395, | |
| "learning_rate": 2.1561550195257378e-05, | |
| "loss": 1.0007452964782715, | |
| "mean_token_accuracy": 0.6962373182177544, | |
| "num_tokens": 17177327.0, | |
| "step": 178 | |
| }, | |
| { | |
| "entropy": 0.9671204686164856, | |
| "epoch": 1.7263922518159807, | |
| "grad_norm": 0.16110743582248688, | |
| "learning_rate": 2.1298933208656718e-05, | |
| "loss": 0.9604004621505737, | |
| "mean_token_accuracy": 0.7054437473416328, | |
| "num_tokens": 17272025.0, | |
| "step": 179 | |
| }, | |
| { | |
| "entropy": 0.9986064434051514, | |
| "epoch": 1.7360774818401938, | |
| "grad_norm": 0.17059385776519775, | |
| "learning_rate": 2.103673312903878e-05, | |
| "loss": 1.0034087896347046, | |
| "mean_token_accuracy": 0.695854052901268, | |
| "num_tokens": 17369047.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 1.0043450593948364, | |
| "epoch": 1.7457627118644068, | |
| "grad_norm": 0.16405996680259705, | |
| "learning_rate": 2.0774979491953777e-05, | |
| "loss": 1.004425048828125, | |
| "mean_token_accuracy": 0.6962170526385307, | |
| "num_tokens": 17466402.0, | |
| "step": 181 | |
| }, | |
| { | |
| "entropy": 0.9758473634719849, | |
| "epoch": 1.7554479418886197, | |
| "grad_norm": 0.1624099463224411, | |
| "learning_rate": 2.0513701782662366e-05, | |
| "loss": 0.9758256673812866, | |
| "mean_token_accuracy": 0.702741451561451, | |
| "num_tokens": 17563946.0, | |
| "step": 182 | |
| }, | |
| { | |
| "entropy": 0.9875493124127388, | |
| "epoch": 1.765133171912833, | |
| "grad_norm": 0.16150467097759247, | |
| "learning_rate": 2.025292943281429e-05, | |
| "loss": 0.9866945743560791, | |
| "mean_token_accuracy": 0.7015281021595001, | |
| "num_tokens": 17661994.0, | |
| "step": 183 | |
| }, | |
| { | |
| "entropy": 0.9763547852635384, | |
| "epoch": 1.774818401937046, | |
| "grad_norm": 0.16172127425670624, | |
| "learning_rate": 1.9992691817133024e-05, | |
| "loss": 0.9720677733421326, | |
| "mean_token_accuracy": 0.7051981464028358, | |
| "num_tokens": 17759062.0, | |
| "step": 184 | |
| }, | |
| { | |
| "entropy": 0.9876666143536568, | |
| "epoch": 1.784503631961259, | |
| "grad_norm": 0.1627873331308365, | |
| "learning_rate": 1.973301825010685e-05, | |
| "loss": 0.9883197546005249, | |
| "mean_token_accuracy": 0.7009499967098236, | |
| "num_tokens": 17857030.0, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 0.9885219484567642, | |
| "epoch": 1.794188861985472, | |
| "grad_norm": 0.16328956186771393, | |
| "learning_rate": 1.947393798268676e-05, | |
| "loss": 0.9787638187408447, | |
| "mean_token_accuracy": 0.7017620652914047, | |
| "num_tokens": 17954718.0, | |
| "step": 186 | |
| }, | |
| { | |
| "entropy": 0.9936325624585152, | |
| "epoch": 1.8038740920096852, | |
| "grad_norm": 0.16579745709896088, | |
| "learning_rate": 1.9215480198991466e-05, | |
| "loss": 0.9860278964042664, | |
| "mean_token_accuracy": 0.7013640478253365, | |
| "num_tokens": 18052307.0, | |
| "step": 187 | |
| }, | |
| { | |
| "entropy": 0.9761279001832008, | |
| "epoch": 1.8135593220338984, | |
| "grad_norm": 0.16758285462856293, | |
| "learning_rate": 1.895767401301994e-05, | |
| "loss": 0.9741207361221313, | |
| "mean_token_accuracy": 0.7015948817133904, | |
| "num_tokens": 18149449.0, | |
| "step": 188 | |
| }, | |
| { | |
| "entropy": 0.9821500703692436, | |
| "epoch": 1.8232445520581115, | |
| "grad_norm": 0.15871122479438782, | |
| "learning_rate": 1.8700548465371874e-05, | |
| "loss": 0.9747895002365112, | |
| "mean_token_accuracy": 0.7048889771103859, | |
| "num_tokens": 18247120.0, | |
| "step": 189 | |
| }, | |
| { | |
| "entropy": 1.0027316063642502, | |
| "epoch": 1.8329297820823245, | |
| "grad_norm": 0.1635945439338684, | |
| "learning_rate": 1.84441325199764e-05, | |
| "loss": 1.0001788139343262, | |
| "mean_token_accuracy": 0.696582555770874, | |
| "num_tokens": 18344157.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.9462392926216125, | |
| "epoch": 1.8426150121065374, | |
| "grad_norm": 0.1615677773952484, | |
| "learning_rate": 1.818845506082943e-05, | |
| "loss": 0.9510740637779236, | |
| "mean_token_accuracy": 0.70773646235466, | |
| "num_tokens": 18441268.0, | |
| "step": 191 | |
| }, | |
| { | |
| "entropy": 1.0037222057580948, | |
| "epoch": 1.8523002421307506, | |
| "grad_norm": 0.16842308640480042, | |
| "learning_rate": 1.793354488874006e-05, | |
| "loss": 1.0088788270950317, | |
| "mean_token_accuracy": 0.6934759691357613, | |
| "num_tokens": 18537788.0, | |
| "step": 192 | |
| }, | |
| { | |
| "entropy": 0.9667429774999619, | |
| "epoch": 1.8619854721549638, | |
| "grad_norm": 0.16219115257263184, | |
| "learning_rate": 1.7679430718086243e-05, | |
| "loss": 0.969014585018158, | |
| "mean_token_accuracy": 0.7043875381350517, | |
| "num_tokens": 18634210.0, | |
| "step": 193 | |
| }, | |
| { | |
| "entropy": 0.9850651919841766, | |
| "epoch": 1.8716707021791767, | |
| "grad_norm": 0.16740399599075317, | |
| "learning_rate": 1.742614117358029e-05, | |
| "loss": 0.9887316226959229, | |
| "mean_token_accuracy": 0.6999648213386536, | |
| "num_tokens": 18730773.0, | |
| "step": 194 | |
| }, | |
| { | |
| "entropy": 0.9965796321630478, | |
| "epoch": 1.8813559322033897, | |
| "grad_norm": 0.1601548194885254, | |
| "learning_rate": 1.7173704787044446e-05, | |
| "loss": 1.0006155967712402, | |
| "mean_token_accuracy": 0.6969467177987099, | |
| "num_tokens": 18828751.0, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 0.9734840467572212, | |
| "epoch": 1.8910411622276029, | |
| "grad_norm": 0.16879691183567047, | |
| "learning_rate": 1.6922149994196878e-05, | |
| "loss": 0.9744443297386169, | |
| "mean_token_accuracy": 0.7044009938836098, | |
| "num_tokens": 18924854.0, | |
| "step": 196 | |
| }, | |
| { | |
| "entropy": 0.9900180175900459, | |
| "epoch": 1.900726392251816, | |
| "grad_norm": 0.16602978110313416, | |
| "learning_rate": 1.667150513144856e-05, | |
| "loss": 0.9910145998001099, | |
| "mean_token_accuracy": 0.6993976980447769, | |
| "num_tokens": 19022636.0, | |
| "step": 197 | |
| }, | |
| { | |
| "entropy": 1.0208289474248886, | |
| "epoch": 1.910411622276029, | |
| "grad_norm": 0.16639183461666107, | |
| "learning_rate": 1.6421798432711345e-05, | |
| "loss": 1.0081907510757446, | |
| "mean_token_accuracy": 0.6937614306807518, | |
| "num_tokens": 19119897.0, | |
| "step": 198 | |
| }, | |
| { | |
| "entropy": 1.0175106599926949, | |
| "epoch": 1.9200968523002422, | |
| "grad_norm": 0.16621938347816467, | |
| "learning_rate": 1.617305802621748e-05, | |
| "loss": 1.0121101140975952, | |
| "mean_token_accuracy": 0.6952445805072784, | |
| "num_tokens": 19216975.0, | |
| "step": 199 | |
| }, | |
| { | |
| "entropy": 0.993683896958828, | |
| "epoch": 1.9297820823244551, | |
| "grad_norm": 0.16414102911949158, | |
| "learning_rate": 1.5925311931351172e-05, | |
| "loss": 0.9927324056625366, | |
| "mean_token_accuracy": 0.7005998194217682, | |
| "num_tokens": 19314144.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.9706481248140335, | |
| "epoch": 1.9394673123486683, | |
| "grad_norm": 0.16486144065856934, | |
| "learning_rate": 1.567858805549229e-05, | |
| "loss": 0.9645916819572449, | |
| "mean_token_accuracy": 0.7075545489788055, | |
| "num_tokens": 19411168.0, | |
| "step": 201 | |
| }, | |
| { | |
| "entropy": 0.9547639638185501, | |
| "epoch": 1.9491525423728815, | |
| "grad_norm": 0.16740481555461884, | |
| "learning_rate": 1.5432914190872757e-05, | |
| "loss": 0.9521715044975281, | |
| "mean_token_accuracy": 0.7096640020608902, | |
| "num_tokens": 19508050.0, | |
| "step": 202 | |
| }, | |
| { | |
| "entropy": 0.9757836386561394, | |
| "epoch": 1.9588377723970944, | |
| "grad_norm": 0.16067975759506226, | |
| "learning_rate": 1.5188318011445906e-05, | |
| "loss": 0.976540207862854, | |
| "mean_token_accuracy": 0.7041280418634415, | |
| "num_tokens": 19604931.0, | |
| "step": 203 | |
| }, | |
| { | |
| "entropy": 0.960599772632122, | |
| "epoch": 1.9685230024213074, | |
| "grad_norm": 0.16080203652381897, | |
| "learning_rate": 1.4944827069769123e-05, | |
| "loss": 0.9553600549697876, | |
| "mean_token_accuracy": 0.7085657268762589, | |
| "num_tokens": 19700943.0, | |
| "step": 204 | |
| }, | |
| { | |
| "entropy": 0.9594792500138283, | |
| "epoch": 1.9782082324455206, | |
| "grad_norm": 0.1573885977268219, | |
| "learning_rate": 1.4702468793900188e-05, | |
| "loss": 0.9603473544120789, | |
| "mean_token_accuracy": 0.7059226110577583, | |
| "num_tokens": 19798974.0, | |
| "step": 205 | |
| }, | |
| { | |
| "entropy": 0.9801315888762474, | |
| "epoch": 1.9878934624697338, | |
| "grad_norm": 0.16511794924736023, | |
| "learning_rate": 1.4461270484307643e-05, | |
| "loss": 0.9834091663360596, | |
| "mean_token_accuracy": 0.7020789682865143, | |
| "num_tokens": 19896619.0, | |
| "step": 206 | |
| }, | |
| { | |
| "entropy": 1.0063806548714638, | |
| "epoch": 1.9975786924939467, | |
| "grad_norm": 0.16854998469352722, | |
| "learning_rate": 1.4221259310795543e-05, | |
| "loss": 1.0062599182128906, | |
| "mean_token_accuracy": 0.6940593868494034, | |
| "num_tokens": 19994525.0, | |
| "step": 207 | |
| }, | |
| { | |
| "entropy": 1.0087562799453735, | |
| "epoch": 2.0, | |
| "grad_norm": 0.32751402258872986, | |
| "learning_rate": 1.3982462309442889e-05, | |
| "loss": 1.0107228755950928, | |
| "mean_token_accuracy": 0.6938549876213074, | |
| "num_tokens": 20018806.0, | |
| "step": 208 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 312, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.8948254401683784e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |