Instructions to use Jeppcode/ScalableLab2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Jeppcode/ScalableLab2 with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Jeppcode/ScalableLab2", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use Jeppcode/ScalableLab2 with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf Jeppcode/ScalableLab2:F16 # Run inference directly in the terminal: llama cli -hf Jeppcode/ScalableLab2:F16
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf Jeppcode/ScalableLab2:F16 # Run inference directly in the terminal: llama cli -hf Jeppcode/ScalableLab2:F16
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf Jeppcode/ScalableLab2:F16 # Run inference directly in the terminal: ./llama-cli -hf Jeppcode/ScalableLab2:F16
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf Jeppcode/ScalableLab2:F16 # Run inference directly in the terminal: ./build/bin/llama-cli -hf Jeppcode/ScalableLab2:F16
Use Docker
docker model run hf.co/Jeppcode/ScalableLab2:F16
- LM Studio
- Jan
- Ollama
How to use Jeppcode/ScalableLab2 with Ollama:
ollama run hf.co/Jeppcode/ScalableLab2:F16
- Unsloth Desktop
- Pi
How to use Jeppcode/ScalableLab2 with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf Jeppcode/ScalableLab2:F16
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "Jeppcode/ScalableLab2:F16" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Docker Model Runner
How to use Jeppcode/ScalableLab2 with Docker Model Runner:
docker model run hf.co/Jeppcode/ScalableLab2:F16
- Lemonade
How to use Jeppcode/ScalableLab2 with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull Jeppcode/ScalableLab2:F16
Run and chat with the model
lemonade run user.ScalableLab2-F16
List all available models
lemonade list
- Hermes Agent
How to use Jeppcode/ScalableLab2 with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf Jeppcode/ScalableLab2:F16
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default Jeppcode/ScalableLab2:F16
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use Jeppcode/ScalableLab2 with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf Jeppcode/ScalableLab2:F16
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "Jeppcode/ScalableLab2:F16" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.0, | |
| "eval_steps": 500, | |
| "global_step": 10688, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.004678362573099415, | |
| "grad_norm": 0.2359442412853241, | |
| "learning_rate": 0.0001991762613498081, | |
| "loss": 0.8207, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.00935672514619883, | |
| "grad_norm": 0.1787925511598587, | |
| "learning_rate": 0.00019824019470186279, | |
| "loss": 0.7803, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.014035087719298246, | |
| "grad_norm": 0.19425372779369354, | |
| "learning_rate": 0.00019730412805391744, | |
| "loss": 0.752, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.01871345029239766, | |
| "grad_norm": 0.1763751357793808, | |
| "learning_rate": 0.0001963680614059721, | |
| "loss": 0.7502, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.023391812865497075, | |
| "grad_norm": 0.208680659532547, | |
| "learning_rate": 0.00019543199475802677, | |
| "loss": 0.7493, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.028070175438596492, | |
| "grad_norm": 0.1655270755290985, | |
| "learning_rate": 0.00019449592811008145, | |
| "loss": 0.7551, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.03274853801169591, | |
| "grad_norm": 0.1512351781129837, | |
| "learning_rate": 0.0001935598614621361, | |
| "loss": 0.7418, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.03742690058479532, | |
| "grad_norm": 0.19491629302501678, | |
| "learning_rate": 0.00019262379481419078, | |
| "loss": 0.7278, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.042105263157894736, | |
| "grad_norm": 0.1969548463821411, | |
| "learning_rate": 0.00019168772816624546, | |
| "loss": 0.7365, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.04678362573099415, | |
| "grad_norm": 0.21336689591407776, | |
| "learning_rate": 0.00019075166151830012, | |
| "loss": 0.7834, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.05146198830409357, | |
| "grad_norm": 0.23860010504722595, | |
| "learning_rate": 0.0001898155948703548, | |
| "loss": 0.7523, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.056140350877192984, | |
| "grad_norm": 0.16545253992080688, | |
| "learning_rate": 0.00018887952822240945, | |
| "loss": 0.7365, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.0608187134502924, | |
| "grad_norm": 0.17125707864761353, | |
| "learning_rate": 0.00018794346157446413, | |
| "loss": 0.7455, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.06549707602339182, | |
| "grad_norm": 0.20272980630397797, | |
| "learning_rate": 0.00018700739492651878, | |
| "loss": 0.7322, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.07017543859649122, | |
| "grad_norm": 0.22747305035591125, | |
| "learning_rate": 0.00018607132827857346, | |
| "loss": 0.7369, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.07485380116959064, | |
| "grad_norm": 0.1757550686597824, | |
| "learning_rate": 0.00018513526163062811, | |
| "loss": 0.7377, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.07953216374269007, | |
| "grad_norm": 0.2243908941745758, | |
| "learning_rate": 0.00018419919498268277, | |
| "loss": 0.7519, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.08421052631578947, | |
| "grad_norm": 0.2035253494977951, | |
| "learning_rate": 0.00018326312833473745, | |
| "loss": 0.7228, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.08888888888888889, | |
| "grad_norm": 0.18074704706668854, | |
| "learning_rate": 0.0001823270616867921, | |
| "loss": 0.7152, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.0935672514619883, | |
| "grad_norm": 0.20341496169567108, | |
| "learning_rate": 0.00018139099503884678, | |
| "loss": 0.7386, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.09824561403508772, | |
| "grad_norm": 0.20967456698417664, | |
| "learning_rate": 0.00018045492839090143, | |
| "loss": 0.7212, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.10292397660818714, | |
| "grad_norm": 0.20394659042358398, | |
| "learning_rate": 0.0001795188617429561, | |
| "loss": 0.7487, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.10760233918128655, | |
| "grad_norm": 0.19915203750133514, | |
| "learning_rate": 0.00017858279509501076, | |
| "loss": 0.7678, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.11228070175438597, | |
| "grad_norm": 0.2663570046424866, | |
| "learning_rate": 0.00017764672844706544, | |
| "loss": 0.7409, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.11695906432748537, | |
| "grad_norm": 0.24071092903614044, | |
| "learning_rate": 0.0001767106617991201, | |
| "loss": 0.7216, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.1216374269005848, | |
| "grad_norm": 0.1935265064239502, | |
| "learning_rate": 0.00017577459515117478, | |
| "loss": 0.7306, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.12631578947368421, | |
| "grad_norm": 0.2921196222305298, | |
| "learning_rate": 0.00017483852850322943, | |
| "loss": 0.7306, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.13099415204678364, | |
| "grad_norm": 0.24034500122070312, | |
| "learning_rate": 0.0001739024618552841, | |
| "loss": 0.725, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.13567251461988303, | |
| "grad_norm": 0.2127804309129715, | |
| "learning_rate": 0.00017296639520733876, | |
| "loss": 0.7266, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.14035087719298245, | |
| "grad_norm": 0.2236451804637909, | |
| "learning_rate": 0.00017203032855939341, | |
| "loss": 0.7101, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.14502923976608187, | |
| "grad_norm": 0.22269318997859955, | |
| "learning_rate": 0.0001710942619114481, | |
| "loss": 0.7292, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 0.1497076023391813, | |
| "grad_norm": 0.2598223090171814, | |
| "learning_rate": 0.00017015819526350277, | |
| "loss": 0.7073, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.1543859649122807, | |
| "grad_norm": 0.21632170677185059, | |
| "learning_rate": 0.00016922212861555743, | |
| "loss": 0.7451, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 0.15906432748538013, | |
| "grad_norm": 0.2735025882720947, | |
| "learning_rate": 0.0001682860619676121, | |
| "loss": 0.7234, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.16374269005847952, | |
| "grad_norm": 0.2583097219467163, | |
| "learning_rate": 0.0001673499953196668, | |
| "loss": 0.7145, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 0.16842105263157894, | |
| "grad_norm": 0.300374299287796, | |
| "learning_rate": 0.00016641392867172144, | |
| "loss": 0.7382, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.17309941520467836, | |
| "grad_norm": 0.25665584206581116, | |
| "learning_rate": 0.00016547786202377612, | |
| "loss": 0.7111, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 0.17777777777777778, | |
| "grad_norm": 0.17964990437030792, | |
| "learning_rate": 0.00016454179537583077, | |
| "loss": 0.7428, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 0.1824561403508772, | |
| "grad_norm": 0.2846137583255768, | |
| "learning_rate": 0.00016360572872788545, | |
| "loss": 0.7071, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 0.1871345029239766, | |
| "grad_norm": 0.23494410514831543, | |
| "learning_rate": 0.0001626696620799401, | |
| "loss": 0.7313, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.19181286549707602, | |
| "grad_norm": 0.2580121159553528, | |
| "learning_rate": 0.00016173359543199476, | |
| "loss": 0.7091, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 0.19649122807017544, | |
| "grad_norm": 0.2654828727245331, | |
| "learning_rate": 0.00016079752878404944, | |
| "loss": 0.7171, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 0.20116959064327486, | |
| "grad_norm": 0.22615693509578705, | |
| "learning_rate": 0.0001598614621361041, | |
| "loss": 0.7189, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 0.20584795321637428, | |
| "grad_norm": 0.19022518396377563, | |
| "learning_rate": 0.00015892539548815877, | |
| "loss": 0.716, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 0.21052631578947367, | |
| "grad_norm": 0.23111920058727264, | |
| "learning_rate": 0.00015798932884021342, | |
| "loss": 0.7446, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 0.2152046783625731, | |
| "grad_norm": 0.22850322723388672, | |
| "learning_rate": 0.0001570532621922681, | |
| "loss": 0.7243, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 0.2198830409356725, | |
| "grad_norm": 0.24424132704734802, | |
| "learning_rate": 0.00015611719554432276, | |
| "loss": 0.7072, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 0.22456140350877193, | |
| "grad_norm": 0.31915757060050964, | |
| "learning_rate": 0.00015518112889637743, | |
| "loss": 0.7098, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 0.22923976608187135, | |
| "grad_norm": 0.21317467093467712, | |
| "learning_rate": 0.0001542450622484321, | |
| "loss": 0.7472, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 0.23391812865497075, | |
| "grad_norm": 0.2181481122970581, | |
| "learning_rate": 0.00015330899560048677, | |
| "loss": 0.7295, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.23859649122807017, | |
| "grad_norm": 0.17121131718158722, | |
| "learning_rate": 0.00015237292895254142, | |
| "loss": 0.6705, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 0.2432748538011696, | |
| "grad_norm": 0.21892113983631134, | |
| "learning_rate": 0.0001514368623045961, | |
| "loss": 0.7284, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 0.247953216374269, | |
| "grad_norm": 0.2405460923910141, | |
| "learning_rate": 0.00015050079565665075, | |
| "loss": 0.7128, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 0.25263157894736843, | |
| "grad_norm": 0.30338019132614136, | |
| "learning_rate": 0.0001495647290087054, | |
| "loss": 0.7355, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 0.2573099415204678, | |
| "grad_norm": 0.288082480430603, | |
| "learning_rate": 0.00014862866236076009, | |
| "loss": 0.7038, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 0.26198830409356727, | |
| "grad_norm": 0.25093698501586914, | |
| "learning_rate": 0.00014769259571281477, | |
| "loss": 0.7207, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 0.26666666666666666, | |
| "grad_norm": 0.21849419176578522, | |
| "learning_rate": 0.00014675652906486942, | |
| "loss": 0.7001, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 0.27134502923976606, | |
| "grad_norm": 0.27592793107032776, | |
| "learning_rate": 0.0001458204624169241, | |
| "loss": 0.6953, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 0.2760233918128655, | |
| "grad_norm": 0.22119542956352234, | |
| "learning_rate": 0.00014488439576897878, | |
| "loss": 0.6827, | |
| "step": 2950 | |
| }, | |
| { | |
| "epoch": 0.2807017543859649, | |
| "grad_norm": 0.2122359573841095, | |
| "learning_rate": 0.00014394832912103343, | |
| "loss": 0.7163, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.28538011695906434, | |
| "grad_norm": 0.24913975596427917, | |
| "learning_rate": 0.0001430122624730881, | |
| "loss": 0.7182, | |
| "step": 3050 | |
| }, | |
| { | |
| "epoch": 0.29005847953216374, | |
| "grad_norm": 0.2344418615102768, | |
| "learning_rate": 0.00014207619582514276, | |
| "loss": 0.6989, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 0.29473684210526313, | |
| "grad_norm": 0.2660394608974457, | |
| "learning_rate": 0.00014114012917719744, | |
| "loss": 0.7247, | |
| "step": 3150 | |
| }, | |
| { | |
| "epoch": 0.2994152046783626, | |
| "grad_norm": 0.21425625681877136, | |
| "learning_rate": 0.0001402040625292521, | |
| "loss": 0.6875, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 0.30409356725146197, | |
| "grad_norm": 0.2691395580768585, | |
| "learning_rate": 0.00013926799588130675, | |
| "loss": 0.7112, | |
| "step": 3250 | |
| }, | |
| { | |
| "epoch": 0.3087719298245614, | |
| "grad_norm": 0.28755274415016174, | |
| "learning_rate": 0.00013833192923336143, | |
| "loss": 0.7212, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 0.3134502923976608, | |
| "grad_norm": 0.22710080444812775, | |
| "learning_rate": 0.00013739586258541608, | |
| "loss": 0.6994, | |
| "step": 3350 | |
| }, | |
| { | |
| "epoch": 0.31812865497076026, | |
| "grad_norm": 0.2685355246067047, | |
| "learning_rate": 0.00013645979593747076, | |
| "loss": 0.6774, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 0.32280701754385965, | |
| "grad_norm": 0.28679826855659485, | |
| "learning_rate": 0.0001355237292895254, | |
| "loss": 0.7081, | |
| "step": 3450 | |
| }, | |
| { | |
| "epoch": 0.32748538011695905, | |
| "grad_norm": 0.25061824917793274, | |
| "learning_rate": 0.0001345876626415801, | |
| "loss": 0.7078, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.3321637426900585, | |
| "grad_norm": 0.1860637366771698, | |
| "learning_rate": 0.00013365159599363475, | |
| "loss": 0.7008, | |
| "step": 3550 | |
| }, | |
| { | |
| "epoch": 0.3368421052631579, | |
| "grad_norm": 0.21458761394023895, | |
| "learning_rate": 0.00013271552934568943, | |
| "loss": 0.765, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 0.34152046783625734, | |
| "grad_norm": 0.3054530918598175, | |
| "learning_rate": 0.00013177946269774408, | |
| "loss": 0.6864, | |
| "step": 3650 | |
| }, | |
| { | |
| "epoch": 0.34619883040935673, | |
| "grad_norm": 0.27829650044441223, | |
| "learning_rate": 0.00013084339604979876, | |
| "loss": 0.6915, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 0.3508771929824561, | |
| "grad_norm": 0.2334837019443512, | |
| "learning_rate": 0.0001299073294018534, | |
| "loss": 0.712, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 0.35555555555555557, | |
| "grad_norm": 0.257228285074234, | |
| "learning_rate": 0.0001289712627539081, | |
| "loss": 0.7008, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 0.36023391812865496, | |
| "grad_norm": 0.24542610347270966, | |
| "learning_rate": 0.00012803519610596274, | |
| "loss": 0.6876, | |
| "step": 3850 | |
| }, | |
| { | |
| "epoch": 0.3649122807017544, | |
| "grad_norm": 0.2166256308555603, | |
| "learning_rate": 0.0001270991294580174, | |
| "loss": 0.7191, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 0.3695906432748538, | |
| "grad_norm": 0.2670128345489502, | |
| "learning_rate": 0.00012616306281007208, | |
| "loss": 0.6869, | |
| "step": 3950 | |
| }, | |
| { | |
| "epoch": 0.3742690058479532, | |
| "grad_norm": 0.23986391723155975, | |
| "learning_rate": 0.00012522699616212673, | |
| "loss": 0.6916, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.37894736842105264, | |
| "grad_norm": 0.2251734882593155, | |
| "learning_rate": 0.0001242909295141814, | |
| "loss": 0.7147, | |
| "step": 4050 | |
| }, | |
| { | |
| "epoch": 0.38362573099415204, | |
| "grad_norm": 0.21978424489498138, | |
| "learning_rate": 0.0001233548628662361, | |
| "loss": 0.6995, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 0.3883040935672515, | |
| "grad_norm": 0.24759012460708618, | |
| "learning_rate": 0.00012241879621829074, | |
| "loss": 0.7101, | |
| "step": 4150 | |
| }, | |
| { | |
| "epoch": 0.3929824561403509, | |
| "grad_norm": 0.24026772379875183, | |
| "learning_rate": 0.00012148272957034541, | |
| "loss": 0.7108, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 0.39766081871345027, | |
| "grad_norm": 0.2681400179862976, | |
| "learning_rate": 0.00012054666292240009, | |
| "loss": 0.7008, | |
| "step": 4250 | |
| }, | |
| { | |
| "epoch": 0.4023391812865497, | |
| "grad_norm": 0.28573960065841675, | |
| "learning_rate": 0.00011961059627445474, | |
| "loss": 0.668, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 0.4070175438596491, | |
| "grad_norm": 0.20998354256153107, | |
| "learning_rate": 0.00011867452962650942, | |
| "loss": 0.7022, | |
| "step": 4350 | |
| }, | |
| { | |
| "epoch": 0.41169590643274856, | |
| "grad_norm": 0.24716372787952423, | |
| "learning_rate": 0.00011773846297856407, | |
| "loss": 0.6983, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 0.41637426900584795, | |
| "grad_norm": 0.25760316848754883, | |
| "learning_rate": 0.00011680239633061874, | |
| "loss": 0.6914, | |
| "step": 4450 | |
| }, | |
| { | |
| "epoch": 0.42105263157894735, | |
| "grad_norm": 0.24404512345790863, | |
| "learning_rate": 0.00011586632968267342, | |
| "loss": 0.6941, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 0.4257309941520468, | |
| "grad_norm": 0.26983878016471863, | |
| "learning_rate": 0.00011493026303472807, | |
| "loss": 0.6881, | |
| "step": 4550 | |
| }, | |
| { | |
| "epoch": 0.4304093567251462, | |
| "grad_norm": 0.28383776545524597, | |
| "learning_rate": 0.00011399419638678275, | |
| "loss": 0.7449, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 0.43508771929824563, | |
| "grad_norm": 0.3157394230365753, | |
| "learning_rate": 0.0001130581297388374, | |
| "loss": 0.7065, | |
| "step": 4650 | |
| }, | |
| { | |
| "epoch": 0.439766081871345, | |
| "grad_norm": 0.2585708796977997, | |
| "learning_rate": 0.00011212206309089208, | |
| "loss": 0.6915, | |
| "step": 4700 | |
| }, | |
| { | |
| "epoch": 0.4444444444444444, | |
| "grad_norm": 0.26849091053009033, | |
| "learning_rate": 0.00011118599644294674, | |
| "loss": 0.7182, | |
| "step": 4750 | |
| }, | |
| { | |
| "epoch": 0.44912280701754387, | |
| "grad_norm": 0.32337141036987305, | |
| "learning_rate": 0.00011024992979500142, | |
| "loss": 0.7003, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 0.45380116959064326, | |
| "grad_norm": 0.2619641423225403, | |
| "learning_rate": 0.00010931386314705607, | |
| "loss": 0.693, | |
| "step": 4850 | |
| }, | |
| { | |
| "epoch": 0.4584795321637427, | |
| "grad_norm": 0.22884933650493622, | |
| "learning_rate": 0.00010837779649911075, | |
| "loss": 0.6987, | |
| "step": 4900 | |
| }, | |
| { | |
| "epoch": 0.4631578947368421, | |
| "grad_norm": 0.2512333393096924, | |
| "learning_rate": 0.0001074417298511654, | |
| "loss": 0.6628, | |
| "step": 4950 | |
| }, | |
| { | |
| "epoch": 0.4678362573099415, | |
| "grad_norm": 0.2615059018135071, | |
| "learning_rate": 0.00010650566320322008, | |
| "loss": 0.7093, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.47251461988304094, | |
| "grad_norm": 0.2515311539173126, | |
| "learning_rate": 0.00010556959655527475, | |
| "loss": 0.7151, | |
| "step": 5050 | |
| }, | |
| { | |
| "epoch": 0.47719298245614034, | |
| "grad_norm": 0.3073877990245819, | |
| "learning_rate": 0.0001046335299073294, | |
| "loss": 0.7217, | |
| "step": 5100 | |
| }, | |
| { | |
| "epoch": 0.4818713450292398, | |
| "grad_norm": 0.2709997296333313, | |
| "learning_rate": 0.00010369746325938408, | |
| "loss": 0.6995, | |
| "step": 5150 | |
| }, | |
| { | |
| "epoch": 0.4865497076023392, | |
| "grad_norm": 0.25649893283843994, | |
| "learning_rate": 0.00010276139661143873, | |
| "loss": 0.7028, | |
| "step": 5200 | |
| }, | |
| { | |
| "epoch": 0.49122807017543857, | |
| "grad_norm": 0.2822120487689972, | |
| "learning_rate": 0.00010182532996349341, | |
| "loss": 0.6855, | |
| "step": 5250 | |
| }, | |
| { | |
| "epoch": 0.495906432748538, | |
| "grad_norm": 0.2896905541419983, | |
| "learning_rate": 0.00010088926331554807, | |
| "loss": 0.6737, | |
| "step": 5300 | |
| }, | |
| { | |
| "epoch": 0.5005847953216375, | |
| "grad_norm": 0.23256748914718628, | |
| "learning_rate": 9.995319666760273e-05, | |
| "loss": 0.7149, | |
| "step": 5350 | |
| }, | |
| { | |
| "epoch": 0.5052631578947369, | |
| "grad_norm": 0.3130648136138916, | |
| "learning_rate": 9.90171300196574e-05, | |
| "loss": 0.7355, | |
| "step": 5400 | |
| }, | |
| { | |
| "epoch": 0.5099415204678363, | |
| "grad_norm": 0.24791193008422852, | |
| "learning_rate": 9.808106337171206e-05, | |
| "loss": 0.6764, | |
| "step": 5450 | |
| }, | |
| { | |
| "epoch": 0.5146198830409356, | |
| "grad_norm": 0.28329938650131226, | |
| "learning_rate": 9.714499672376673e-05, | |
| "loss": 0.7058, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 0.519298245614035, | |
| "grad_norm": 0.3048527240753174, | |
| "learning_rate": 9.62089300758214e-05, | |
| "loss": 0.6993, | |
| "step": 5550 | |
| }, | |
| { | |
| "epoch": 0.5239766081871345, | |
| "grad_norm": 0.2914963960647583, | |
| "learning_rate": 9.527286342787606e-05, | |
| "loss": 0.6802, | |
| "step": 5600 | |
| }, | |
| { | |
| "epoch": 0.5286549707602339, | |
| "grad_norm": 0.3110167682170868, | |
| "learning_rate": 9.433679677993073e-05, | |
| "loss": 0.6779, | |
| "step": 5650 | |
| }, | |
| { | |
| "epoch": 0.5333333333333333, | |
| "grad_norm": 0.30692344903945923, | |
| "learning_rate": 9.340073013198541e-05, | |
| "loss": 0.7139, | |
| "step": 5700 | |
| }, | |
| { | |
| "epoch": 0.5380116959064327, | |
| "grad_norm": 0.2898903787136078, | |
| "learning_rate": 9.246466348404008e-05, | |
| "loss": 0.6889, | |
| "step": 5750 | |
| }, | |
| { | |
| "epoch": 0.5426900584795321, | |
| "grad_norm": 0.2612452507019043, | |
| "learning_rate": 9.152859683609474e-05, | |
| "loss": 0.7074, | |
| "step": 5800 | |
| }, | |
| { | |
| "epoch": 0.5473684210526316, | |
| "grad_norm": 0.32114362716674805, | |
| "learning_rate": 9.059253018814941e-05, | |
| "loss": 0.7213, | |
| "step": 5850 | |
| }, | |
| { | |
| "epoch": 0.552046783625731, | |
| "grad_norm": 0.2521548271179199, | |
| "learning_rate": 8.965646354020407e-05, | |
| "loss": 0.6989, | |
| "step": 5900 | |
| }, | |
| { | |
| "epoch": 0.5567251461988304, | |
| "grad_norm": 0.25725868344306946, | |
| "learning_rate": 8.872039689225873e-05, | |
| "loss": 0.6849, | |
| "step": 5950 | |
| }, | |
| { | |
| "epoch": 0.5614035087719298, | |
| "grad_norm": 0.3528817892074585, | |
| "learning_rate": 8.77843302443134e-05, | |
| "loss": 0.6836, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 0.5660818713450292, | |
| "grad_norm": 0.2749318778514862, | |
| "learning_rate": 8.684826359636806e-05, | |
| "loss": 0.6688, | |
| "step": 6050 | |
| }, | |
| { | |
| "epoch": 0.5707602339181287, | |
| "grad_norm": 0.23874488472938538, | |
| "learning_rate": 8.591219694842273e-05, | |
| "loss": 0.6975, | |
| "step": 6100 | |
| }, | |
| { | |
| "epoch": 0.5754385964912281, | |
| "grad_norm": 0.268975168466568, | |
| "learning_rate": 8.497613030047739e-05, | |
| "loss": 0.704, | |
| "step": 6150 | |
| }, | |
| { | |
| "epoch": 0.5801169590643275, | |
| "grad_norm": 0.2570686638355255, | |
| "learning_rate": 8.404006365253206e-05, | |
| "loss": 0.6826, | |
| "step": 6200 | |
| }, | |
| { | |
| "epoch": 0.5847953216374269, | |
| "grad_norm": 0.26320692896842957, | |
| "learning_rate": 8.310399700458673e-05, | |
| "loss": 0.6997, | |
| "step": 6250 | |
| }, | |
| { | |
| "epoch": 0.5894736842105263, | |
| "grad_norm": 0.2496190369129181, | |
| "learning_rate": 8.21679303566414e-05, | |
| "loss": 0.7193, | |
| "step": 6300 | |
| }, | |
| { | |
| "epoch": 0.5941520467836258, | |
| "grad_norm": 0.29877322912216187, | |
| "learning_rate": 8.123186370869607e-05, | |
| "loss": 0.7071, | |
| "step": 6350 | |
| }, | |
| { | |
| "epoch": 0.5988304093567252, | |
| "grad_norm": 0.3319626748561859, | |
| "learning_rate": 8.029579706075074e-05, | |
| "loss": 0.6961, | |
| "step": 6400 | |
| }, | |
| { | |
| "epoch": 0.6035087719298246, | |
| "grad_norm": 0.30963343381881714, | |
| "learning_rate": 7.93597304128054e-05, | |
| "loss": 0.6892, | |
| "step": 6450 | |
| }, | |
| { | |
| "epoch": 0.6081871345029239, | |
| "grad_norm": 0.2534225583076477, | |
| "learning_rate": 7.842366376486007e-05, | |
| "loss": 0.6887, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 0.6128654970760234, | |
| "grad_norm": 0.23774613440036774, | |
| "learning_rate": 7.748759711691472e-05, | |
| "loss": 0.6858, | |
| "step": 6550 | |
| }, | |
| { | |
| "epoch": 0.6175438596491228, | |
| "grad_norm": 0.2526530623435974, | |
| "learning_rate": 7.655153046896939e-05, | |
| "loss": 0.6729, | |
| "step": 6600 | |
| }, | |
| { | |
| "epoch": 0.6222222222222222, | |
| "grad_norm": 0.21034641563892365, | |
| "learning_rate": 7.561546382102406e-05, | |
| "loss": 0.6555, | |
| "step": 6650 | |
| }, | |
| { | |
| "epoch": 0.6269005847953216, | |
| "grad_norm": 0.2742060422897339, | |
| "learning_rate": 7.467939717307872e-05, | |
| "loss": 0.6543, | |
| "step": 6700 | |
| }, | |
| { | |
| "epoch": 0.631578947368421, | |
| "grad_norm": 0.2967930734157562, | |
| "learning_rate": 7.374333052513339e-05, | |
| "loss": 0.7058, | |
| "step": 6750 | |
| }, | |
| { | |
| "epoch": 0.6362573099415205, | |
| "grad_norm": 0.26209503412246704, | |
| "learning_rate": 7.280726387718805e-05, | |
| "loss": 0.7027, | |
| "step": 6800 | |
| }, | |
| { | |
| "epoch": 0.6409356725146199, | |
| "grad_norm": 0.2824839949607849, | |
| "learning_rate": 7.187119722924272e-05, | |
| "loss": 0.7019, | |
| "step": 6850 | |
| }, | |
| { | |
| "epoch": 0.6456140350877193, | |
| "grad_norm": 0.23571640253067017, | |
| "learning_rate": 7.093513058129739e-05, | |
| "loss": 0.6787, | |
| "step": 6900 | |
| }, | |
| { | |
| "epoch": 0.6502923976608187, | |
| "grad_norm": 0.27061739563941956, | |
| "learning_rate": 6.999906393335207e-05, | |
| "loss": 0.7513, | |
| "step": 6950 | |
| }, | |
| { | |
| "epoch": 0.6549707602339181, | |
| "grad_norm": 0.2449525147676468, | |
| "learning_rate": 6.906299728540673e-05, | |
| "loss": 0.7028, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 0.6596491228070176, | |
| "grad_norm": 0.294810026884079, | |
| "learning_rate": 6.81269306374614e-05, | |
| "loss": 0.6994, | |
| "step": 7050 | |
| }, | |
| { | |
| "epoch": 0.664327485380117, | |
| "grad_norm": 0.3177715837955475, | |
| "learning_rate": 6.719086398951607e-05, | |
| "loss": 0.6799, | |
| "step": 7100 | |
| }, | |
| { | |
| "epoch": 0.6690058479532164, | |
| "grad_norm": 0.30433663725852966, | |
| "learning_rate": 6.625479734157072e-05, | |
| "loss": 0.6938, | |
| "step": 7150 | |
| }, | |
| { | |
| "epoch": 0.6736842105263158, | |
| "grad_norm": 0.2912716567516327, | |
| "learning_rate": 6.531873069362538e-05, | |
| "loss": 0.7484, | |
| "step": 7200 | |
| }, | |
| { | |
| "epoch": 0.6783625730994152, | |
| "grad_norm": 0.22346681356430054, | |
| "learning_rate": 6.438266404568005e-05, | |
| "loss": 0.673, | |
| "step": 7250 | |
| }, | |
| { | |
| "epoch": 0.6830409356725147, | |
| "grad_norm": 0.31418198347091675, | |
| "learning_rate": 6.344659739773472e-05, | |
| "loss": 0.7023, | |
| "step": 7300 | |
| }, | |
| { | |
| "epoch": 0.6877192982456141, | |
| "grad_norm": 0.27822884917259216, | |
| "learning_rate": 6.251053074978938e-05, | |
| "loss": 0.6923, | |
| "step": 7350 | |
| }, | |
| { | |
| "epoch": 0.6923976608187135, | |
| "grad_norm": 0.3008076250553131, | |
| "learning_rate": 6.157446410184405e-05, | |
| "loss": 0.6966, | |
| "step": 7400 | |
| }, | |
| { | |
| "epoch": 0.6970760233918128, | |
| "grad_norm": 0.27879807353019714, | |
| "learning_rate": 6.063839745389872e-05, | |
| "loss": 0.6674, | |
| "step": 7450 | |
| }, | |
| { | |
| "epoch": 0.7017543859649122, | |
| "grad_norm": 0.29556870460510254, | |
| "learning_rate": 5.970233080595339e-05, | |
| "loss": 0.6949, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 0.7064327485380117, | |
| "grad_norm": 0.31239598989486694, | |
| "learning_rate": 5.8766264158008055e-05, | |
| "loss": 0.7039, | |
| "step": 7550 | |
| }, | |
| { | |
| "epoch": 0.7111111111111111, | |
| "grad_norm": 0.2879217863082886, | |
| "learning_rate": 5.783019751006272e-05, | |
| "loss": 0.7058, | |
| "step": 7600 | |
| }, | |
| { | |
| "epoch": 0.7157894736842105, | |
| "grad_norm": 0.2703321576118469, | |
| "learning_rate": 5.689413086211739e-05, | |
| "loss": 0.6766, | |
| "step": 7650 | |
| }, | |
| { | |
| "epoch": 0.7204678362573099, | |
| "grad_norm": 0.2751176655292511, | |
| "learning_rate": 5.5958064214172054e-05, | |
| "loss": 0.6735, | |
| "step": 7700 | |
| }, | |
| { | |
| "epoch": 0.7251461988304093, | |
| "grad_norm": 0.31331416964530945, | |
| "learning_rate": 5.5021997566226714e-05, | |
| "loss": 0.6852, | |
| "step": 7750 | |
| }, | |
| { | |
| "epoch": 0.7298245614035088, | |
| "grad_norm": 0.2925184369087219, | |
| "learning_rate": 5.408593091828138e-05, | |
| "loss": 0.7044, | |
| "step": 7800 | |
| }, | |
| { | |
| "epoch": 0.7345029239766082, | |
| "grad_norm": 0.2615364193916321, | |
| "learning_rate": 5.3149864270336046e-05, | |
| "loss": 0.7049, | |
| "step": 7850 | |
| }, | |
| { | |
| "epoch": 0.7391812865497076, | |
| "grad_norm": 0.33412986993789673, | |
| "learning_rate": 5.221379762239071e-05, | |
| "loss": 0.6653, | |
| "step": 7900 | |
| }, | |
| { | |
| "epoch": 0.743859649122807, | |
| "grad_norm": 0.30998972058296204, | |
| "learning_rate": 5.127773097444538e-05, | |
| "loss": 0.7081, | |
| "step": 7950 | |
| }, | |
| { | |
| "epoch": 0.7485380116959064, | |
| "grad_norm": 0.2581268548965454, | |
| "learning_rate": 5.034166432650005e-05, | |
| "loss": 0.7073, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 0.7532163742690059, | |
| "grad_norm": 0.23186282813549042, | |
| "learning_rate": 4.940559767855472e-05, | |
| "loss": 0.7033, | |
| "step": 8050 | |
| }, | |
| { | |
| "epoch": 0.7578947368421053, | |
| "grad_norm": 0.28655052185058594, | |
| "learning_rate": 4.8469531030609384e-05, | |
| "loss": 0.6702, | |
| "step": 8100 | |
| }, | |
| { | |
| "epoch": 0.7625730994152047, | |
| "grad_norm": 0.2882712185382843, | |
| "learning_rate": 4.753346438266405e-05, | |
| "loss": 0.6704, | |
| "step": 8150 | |
| }, | |
| { | |
| "epoch": 0.7672514619883041, | |
| "grad_norm": 0.28367742896080017, | |
| "learning_rate": 4.659739773471871e-05, | |
| "loss": 0.7011, | |
| "step": 8200 | |
| }, | |
| { | |
| "epoch": 0.7719298245614035, | |
| "grad_norm": 0.2787933051586151, | |
| "learning_rate": 4.5661331086773376e-05, | |
| "loss": 0.6957, | |
| "step": 8250 | |
| }, | |
| { | |
| "epoch": 0.776608187134503, | |
| "grad_norm": 0.3134559690952301, | |
| "learning_rate": 4.472526443882805e-05, | |
| "loss": 0.7143, | |
| "step": 8300 | |
| }, | |
| { | |
| "epoch": 0.7812865497076024, | |
| "grad_norm": 0.2954425811767578, | |
| "learning_rate": 4.3789197790882716e-05, | |
| "loss": 0.6948, | |
| "step": 8350 | |
| }, | |
| { | |
| "epoch": 0.7859649122807018, | |
| "grad_norm": 0.24117419123649597, | |
| "learning_rate": 4.285313114293738e-05, | |
| "loss": 0.6859, | |
| "step": 8400 | |
| }, | |
| { | |
| "epoch": 0.7906432748538011, | |
| "grad_norm": 0.32657894492149353, | |
| "learning_rate": 4.191706449499205e-05, | |
| "loss": 0.691, | |
| "step": 8450 | |
| }, | |
| { | |
| "epoch": 0.7953216374269005, | |
| "grad_norm": 0.3736024796962738, | |
| "learning_rate": 4.098099784704671e-05, | |
| "loss": 0.6687, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 0.2669476866722107, | |
| "learning_rate": 4.0044931199101374e-05, | |
| "loss": 0.71, | |
| "step": 8550 | |
| }, | |
| { | |
| "epoch": 0.8046783625730994, | |
| "grad_norm": 0.25700825452804565, | |
| "learning_rate": 3.910886455115604e-05, | |
| "loss": 0.6938, | |
| "step": 8600 | |
| }, | |
| { | |
| "epoch": 0.8093567251461988, | |
| "grad_norm": 0.22253499925136566, | |
| "learning_rate": 3.817279790321071e-05, | |
| "loss": 0.7247, | |
| "step": 8650 | |
| }, | |
| { | |
| "epoch": 0.8140350877192982, | |
| "grad_norm": 0.34762486815452576, | |
| "learning_rate": 3.723673125526538e-05, | |
| "loss": 0.6928, | |
| "step": 8700 | |
| }, | |
| { | |
| "epoch": 0.8187134502923976, | |
| "grad_norm": 0.22078180313110352, | |
| "learning_rate": 3.6300664607320046e-05, | |
| "loss": 0.7218, | |
| "step": 8750 | |
| }, | |
| { | |
| "epoch": 0.8233918128654971, | |
| "grad_norm": 0.2702735364437103, | |
| "learning_rate": 3.5364597959374705e-05, | |
| "loss": 0.707, | |
| "step": 8800 | |
| }, | |
| { | |
| "epoch": 0.8280701754385965, | |
| "grad_norm": 0.302895724773407, | |
| "learning_rate": 3.442853131142937e-05, | |
| "loss": 0.6811, | |
| "step": 8850 | |
| }, | |
| { | |
| "epoch": 0.8327485380116959, | |
| "grad_norm": 0.28420576453208923, | |
| "learning_rate": 3.349246466348404e-05, | |
| "loss": 0.6807, | |
| "step": 8900 | |
| }, | |
| { | |
| "epoch": 0.8374269005847953, | |
| "grad_norm": 0.259122371673584, | |
| "learning_rate": 3.255639801553871e-05, | |
| "loss": 0.6807, | |
| "step": 8950 | |
| }, | |
| { | |
| "epoch": 0.8421052631578947, | |
| "grad_norm": 0.2519673705101013, | |
| "learning_rate": 3.162033136759338e-05, | |
| "loss": 0.7102, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 0.8467836257309942, | |
| "grad_norm": 0.21814559400081635, | |
| "learning_rate": 3.0684264719648044e-05, | |
| "loss": 0.6916, | |
| "step": 9050 | |
| }, | |
| { | |
| "epoch": 0.8514619883040936, | |
| "grad_norm": 0.22553086280822754, | |
| "learning_rate": 2.9748198071702703e-05, | |
| "loss": 0.6623, | |
| "step": 9100 | |
| }, | |
| { | |
| "epoch": 0.856140350877193, | |
| "grad_norm": 0.25638681650161743, | |
| "learning_rate": 2.8812131423757373e-05, | |
| "loss": 0.6994, | |
| "step": 9150 | |
| }, | |
| { | |
| "epoch": 0.8608187134502924, | |
| "grad_norm": 0.2546500265598297, | |
| "learning_rate": 2.787606477581204e-05, | |
| "loss": 0.704, | |
| "step": 9200 | |
| }, | |
| { | |
| "epoch": 0.8654970760233918, | |
| "grad_norm": 0.2655654549598694, | |
| "learning_rate": 2.6939998127866705e-05, | |
| "loss": 0.6795, | |
| "step": 9250 | |
| }, | |
| { | |
| "epoch": 0.8701754385964913, | |
| "grad_norm": 0.27429452538490295, | |
| "learning_rate": 2.600393147992137e-05, | |
| "loss": 0.6848, | |
| "step": 9300 | |
| }, | |
| { | |
| "epoch": 0.8748538011695907, | |
| "grad_norm": 0.2434183955192566, | |
| "learning_rate": 2.506786483197604e-05, | |
| "loss": 0.6924, | |
| "step": 9350 | |
| }, | |
| { | |
| "epoch": 0.87953216374269, | |
| "grad_norm": 0.2134724110364914, | |
| "learning_rate": 2.4131798184030704e-05, | |
| "loss": 0.7131, | |
| "step": 9400 | |
| }, | |
| { | |
| "epoch": 0.8842105263157894, | |
| "grad_norm": 0.3318798243999481, | |
| "learning_rate": 2.319573153608537e-05, | |
| "loss": 0.6652, | |
| "step": 9450 | |
| }, | |
| { | |
| "epoch": 0.8888888888888888, | |
| "grad_norm": 0.2777431011199951, | |
| "learning_rate": 2.2259664888140037e-05, | |
| "loss": 0.6911, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 0.8935672514619883, | |
| "grad_norm": 0.29116806387901306, | |
| "learning_rate": 2.1323598240194703e-05, | |
| "loss": 0.6855, | |
| "step": 9550 | |
| }, | |
| { | |
| "epoch": 0.8982456140350877, | |
| "grad_norm": 0.28743380308151245, | |
| "learning_rate": 2.038753159224937e-05, | |
| "loss": 0.7057, | |
| "step": 9600 | |
| }, | |
| { | |
| "epoch": 0.9029239766081871, | |
| "grad_norm": 0.30142566561698914, | |
| "learning_rate": 1.9451464944304036e-05, | |
| "loss": 0.7153, | |
| "step": 9650 | |
| }, | |
| { | |
| "epoch": 0.9076023391812865, | |
| "grad_norm": 0.26111066341400146, | |
| "learning_rate": 1.8515398296358702e-05, | |
| "loss": 0.6843, | |
| "step": 9700 | |
| }, | |
| { | |
| "epoch": 0.9122807017543859, | |
| "grad_norm": 0.25944146513938904, | |
| "learning_rate": 1.7579331648413368e-05, | |
| "loss": 0.6955, | |
| "step": 9750 | |
| }, | |
| { | |
| "epoch": 0.9169590643274854, | |
| "grad_norm": 0.3067375719547272, | |
| "learning_rate": 1.6643265000468034e-05, | |
| "loss": 0.7066, | |
| "step": 9800 | |
| }, | |
| { | |
| "epoch": 0.9216374269005848, | |
| "grad_norm": 0.2763468623161316, | |
| "learning_rate": 1.57071983525227e-05, | |
| "loss": 0.6799, | |
| "step": 9850 | |
| }, | |
| { | |
| "epoch": 0.9263157894736842, | |
| "grad_norm": 0.35574787855148315, | |
| "learning_rate": 1.4771131704577367e-05, | |
| "loss": 0.6601, | |
| "step": 9900 | |
| }, | |
| { | |
| "epoch": 0.9309941520467836, | |
| "grad_norm": 0.2564525902271271, | |
| "learning_rate": 1.3835065056632032e-05, | |
| "loss": 0.666, | |
| "step": 9950 | |
| }, | |
| { | |
| "epoch": 0.935672514619883, | |
| "grad_norm": 0.2216213494539261, | |
| "learning_rate": 1.28989984086867e-05, | |
| "loss": 0.6848, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 0.9403508771929825, | |
| "grad_norm": 0.24584440886974335, | |
| "learning_rate": 1.1962931760741366e-05, | |
| "loss": 0.6414, | |
| "step": 10050 | |
| }, | |
| { | |
| "epoch": 0.9450292397660819, | |
| "grad_norm": 0.28561264276504517, | |
| "learning_rate": 1.102686511279603e-05, | |
| "loss": 0.6891, | |
| "step": 10100 | |
| }, | |
| { | |
| "epoch": 0.9497076023391813, | |
| "grad_norm": 0.3367581367492676, | |
| "learning_rate": 1.0090798464850698e-05, | |
| "loss": 0.6703, | |
| "step": 10150 | |
| }, | |
| { | |
| "epoch": 0.9543859649122807, | |
| "grad_norm": 0.28867948055267334, | |
| "learning_rate": 9.154731816905365e-06, | |
| "loss": 0.7203, | |
| "step": 10200 | |
| }, | |
| { | |
| "epoch": 0.9590643274853801, | |
| "grad_norm": 0.24281640350818634, | |
| "learning_rate": 8.21866516896003e-06, | |
| "loss": 0.6786, | |
| "step": 10250 | |
| }, | |
| { | |
| "epoch": 0.9637426900584796, | |
| "grad_norm": 0.26338231563568115, | |
| "learning_rate": 7.282598521014697e-06, | |
| "loss": 0.6712, | |
| "step": 10300 | |
| }, | |
| { | |
| "epoch": 0.968421052631579, | |
| "grad_norm": 0.2599546015262604, | |
| "learning_rate": 6.346531873069363e-06, | |
| "loss": 0.6857, | |
| "step": 10350 | |
| }, | |
| { | |
| "epoch": 0.9730994152046784, | |
| "grad_norm": 0.2876617908477783, | |
| "learning_rate": 5.410465225124029e-06, | |
| "loss": 0.6699, | |
| "step": 10400 | |
| }, | |
| { | |
| "epoch": 0.9777777777777777, | |
| "grad_norm": 0.366769015789032, | |
| "learning_rate": 4.474398577178695e-06, | |
| "loss": 0.6677, | |
| "step": 10450 | |
| }, | |
| { | |
| "epoch": 0.9824561403508771, | |
| "grad_norm": 0.2691202163696289, | |
| "learning_rate": 3.5383319292333616e-06, | |
| "loss": 0.6572, | |
| "step": 10500 | |
| }, | |
| { | |
| "epoch": 0.9871345029239766, | |
| "grad_norm": 0.2817225158214569, | |
| "learning_rate": 2.602265281288028e-06, | |
| "loss": 0.6772, | |
| "step": 10550 | |
| }, | |
| { | |
| "epoch": 0.991812865497076, | |
| "grad_norm": 0.29911836981773376, | |
| "learning_rate": 1.666198633342694e-06, | |
| "loss": 0.7113, | |
| "step": 10600 | |
| }, | |
| { | |
| "epoch": 0.9964912280701754, | |
| "grad_norm": 0.25651147961616516, | |
| "learning_rate": 7.301319853973604e-07, | |
| "loss": 0.6651, | |
| "step": 10650 | |
| } | |
| ], | |
| "logging_steps": 50, | |
| "max_steps": 10688, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 9.962227515107451e+17, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |