Instructions to use PILAADS/SFT-Qwen3-4B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use PILAADS/SFT-Qwen3-4B with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-4B-Instruct-2507") model = PeftModel.from_pretrained(base_model, "PILAADS/SFT-Qwen3-4B") - Transformers
How to use PILAADS/SFT-Qwen3-4B with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="PILAADS/SFT-Qwen3-4B") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("PILAADS/SFT-Qwen3-4B", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use PILAADS/SFT-Qwen3-4B with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "PILAADS/SFT-Qwen3-4B" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "PILAADS/SFT-Qwen3-4B", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/PILAADS/SFT-Qwen3-4B
- SGLang
How to use PILAADS/SFT-Qwen3-4B with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "PILAADS/SFT-Qwen3-4B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "PILAADS/SFT-Qwen3-4B", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "PILAADS/SFT-Qwen3-4B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "PILAADS/SFT-Qwen3-4B", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use PILAADS/SFT-Qwen3-4B with Docker Model Runner:
docker model run hf.co/PILAADS/SFT-Qwen3-4B
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 3.0, | |
| "eval_steps": 20, | |
| "global_step": 513, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.05865102639296188, | |
| "grad_norm": 0.2199089378118515, | |
| "learning_rate": 9.992407582166581e-05, | |
| "loss": 2.171413612365723, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.11730205278592376, | |
| "grad_norm": 0.18916942179203033, | |
| "learning_rate": 9.966191788709716e-05, | |
| "loss": 1.8421794891357421, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.11730205278592376, | |
| "eval_loss": 1.7743369340896606, | |
| "eval_runtime": 61.8903, | |
| "eval_samples_per_second": 39.263, | |
| "eval_steps_per_second": 0.42, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.17595307917888564, | |
| "grad_norm": 0.12417227029800415, | |
| "learning_rate": 9.921357148779606e-05, | |
| "loss": 1.7548107147216796, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.23460410557184752, | |
| "grad_norm": 0.0854392722249031, | |
| "learning_rate": 9.85807175279907e-05, | |
| "loss": 1.7152568817138671, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.23460410557184752, | |
| "eval_loss": 1.6997339725494385, | |
| "eval_runtime": 50.7944, | |
| "eval_samples_per_second": 47.84, | |
| "eval_steps_per_second": 0.512, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.2932551319648094, | |
| "grad_norm": 0.07562987506389618, | |
| "learning_rate": 9.776572865280207e-05, | |
| "loss": 1.6737960815429687, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.3519061583577713, | |
| "grad_norm": 0.07606321573257446, | |
| "learning_rate": 9.677166035291405e-05, | |
| "loss": 1.6580020904541015, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.3519061583577713, | |
| "eval_loss": 1.6625698804855347, | |
| "eval_runtime": 50.7016, | |
| "eval_samples_per_second": 47.928, | |
| "eval_steps_per_second": 0.513, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.41055718475073316, | |
| "grad_norm": 0.07690507918596268, | |
| "learning_rate": 9.560223950917353e-05, | |
| "loss": 1.658456802368164, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.46920821114369504, | |
| "grad_norm": 0.08297807723283768, | |
| "learning_rate": 9.42618504200689e-05, | |
| "loss": 1.6370161056518555, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.46920821114369504, | |
| "eval_loss": 1.6375877857208252, | |
| "eval_runtime": 50.7877, | |
| "eval_samples_per_second": 47.846, | |
| "eval_steps_per_second": 0.512, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.5278592375366569, | |
| "grad_norm": 0.09066126495599747, | |
| "learning_rate": 9.275551836447103e-05, | |
| "loss": 1.639760971069336, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.5865102639296188, | |
| "grad_norm": 0.08974612504243851, | |
| "learning_rate": 9.108889076126226e-05, | |
| "loss": 1.6200483322143555, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.5865102639296188, | |
| "eval_loss": 1.6185985803604126, | |
| "eval_runtime": 50.8043, | |
| "eval_samples_per_second": 47.831, | |
| "eval_steps_per_second": 0.512, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.6451612903225806, | |
| "grad_norm": 0.0942302867770195, | |
| "learning_rate": 8.926821599648816e-05, | |
| "loss": 1.6054956436157226, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.7038123167155426, | |
| "grad_norm": 0.10261812061071396, | |
| "learning_rate": 8.730031999741158e-05, | |
| "loss": 1.6100627899169921, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.7038123167155426, | |
| "eval_loss": 1.6033717393875122, | |
| "eval_runtime": 50.7978, | |
| "eval_samples_per_second": 47.837, | |
| "eval_steps_per_second": 0.512, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.7624633431085044, | |
| "grad_norm": 0.1043047085404396, | |
| "learning_rate": 8.519258064129558e-05, | |
| "loss": 1.6290523529052734, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.8211143695014663, | |
| "grad_norm": 0.11067894846200943, | |
| "learning_rate": 8.295290009486006e-05, | |
| "loss": 1.5792938232421876, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.8211143695014663, | |
| "eval_loss": 1.5912233591079712, | |
| "eval_runtime": 50.855, | |
| "eval_samples_per_second": 47.783, | |
| "eval_steps_per_second": 0.511, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.8797653958944281, | |
| "grad_norm": 0.10661020874977112, | |
| "learning_rate": 8.058967518811425e-05, | |
| "loss": 1.5838823318481445, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.9384164222873901, | |
| "grad_norm": 0.12469790130853653, | |
| "learning_rate": 7.811176593363772e-05, | |
| "loss": 1.5862667083740234, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.9384164222873901, | |
| "eval_loss": 1.5811413526535034, | |
| "eval_runtime": 50.8651, | |
| "eval_samples_per_second": 47.773, | |
| "eval_steps_per_second": 0.511, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.9970674486803519, | |
| "grad_norm": 0.125987708568573, | |
| "learning_rate": 7.552846230933437e-05, | |
| "loss": 1.5710247039794922, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 1.0527859237536656, | |
| "grad_norm": 0.12022332847118378, | |
| "learning_rate": 7.284944942919519e-05, | |
| "loss": 1.5837053298950194, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 1.0527859237536656, | |
| "eval_loss": 1.573178768157959, | |
| "eval_runtime": 50.8352, | |
| "eval_samples_per_second": 47.802, | |
| "eval_steps_per_second": 0.511, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 1.1114369501466275, | |
| "grad_norm": 0.13042506575584412, | |
| "learning_rate": 7.008477123264848e-05, | |
| "loss": 1.5391403198242188, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 1.1700879765395895, | |
| "grad_norm": 0.12966230511665344, | |
| "learning_rate": 6.724479282863072e-05, | |
| "loss": 1.5630327224731446, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 1.1700879765395895, | |
| "eval_loss": 1.5658373832702637, | |
| "eval_runtime": 50.7515, | |
| "eval_samples_per_second": 47.88, | |
| "eval_steps_per_second": 0.512, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 1.2287390029325513, | |
| "grad_norm": 0.12177792936563492, | |
| "learning_rate": 6.434016163555452e-05, | |
| "loss": 1.5479339599609374, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 1.2873900293255132, | |
| "grad_norm": 0.1271909475326538, | |
| "learning_rate": 6.138176746286468e-05, | |
| "loss": 1.5333200454711915, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 1.2873900293255132, | |
| "eval_loss": 1.5592361688613892, | |
| "eval_runtime": 50.88, | |
| "eval_samples_per_second": 47.759, | |
| "eval_steps_per_second": 0.511, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 1.3460410557184752, | |
| "grad_norm": 0.13476736843585968, | |
| "learning_rate": 5.838070168384118e-05, | |
| "loss": 1.548457717895508, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 1.404692082111437, | |
| "grad_norm": 0.1285582035779953, | |
| "learning_rate": 5.534821565271542e-05, | |
| "loss": 1.5389267921447753, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 1.404692082111437, | |
| "eval_loss": 1.5531750917434692, | |
| "eval_runtime": 50.7263, | |
| "eval_samples_per_second": 47.904, | |
| "eval_steps_per_second": 0.513, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 1.4633431085043989, | |
| "grad_norm": 0.5709601640701294, | |
| "learning_rate": 5.229567852199859e-05, | |
| "loss": 1.544548225402832, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 1.5219941348973607, | |
| "grad_norm": 0.14010146260261536, | |
| "learning_rate": 4.9234534618170395e-05, | |
| "loss": 1.5372689247131348, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 1.5219941348973607, | |
| "eval_loss": 1.5480340719223022, | |
| "eval_runtime": 50.6848, | |
| "eval_samples_per_second": 47.943, | |
| "eval_steps_per_second": 0.513, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 1.5806451612903225, | |
| "grad_norm": 0.14289264380931854, | |
| "learning_rate": 4.6176260535531395e-05, | |
| "loss": 1.5423521041870116, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 1.6392961876832843, | |
| "grad_norm": 0.13429485261440277, | |
| "learning_rate": 4.3132322109079596e-05, | |
| "loss": 1.5462657928466796, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 1.6392961876832843, | |
| "eval_loss": 1.5433279275894165, | |
| "eval_runtime": 50.7331, | |
| "eval_samples_per_second": 47.898, | |
| "eval_steps_per_second": 0.512, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 1.6979472140762464, | |
| "grad_norm": 0.14501748979091644, | |
| "learning_rate": 4.011413142772484e-05, | |
| "loss": 1.5275556564331054, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 1.7565982404692082, | |
| "grad_norm": 0.13486360013484955, | |
| "learning_rate": 3.713300404900376e-05, | |
| "loss": 1.5159502029418945, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.7565982404692082, | |
| "eval_loss": 1.5394600629806519, | |
| "eval_runtime": 50.742, | |
| "eval_samples_per_second": 47.889, | |
| "eval_steps_per_second": 0.512, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.8152492668621703, | |
| "grad_norm": 0.1557241827249527, | |
| "learning_rate": 3.420011657570238e-05, | |
| "loss": 1.5319683074951171, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 1.873900293255132, | |
| "grad_norm": 0.14938898384571075, | |
| "learning_rate": 3.132646475343665e-05, | |
| "loss": 1.534824275970459, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 1.873900293255132, | |
| "eval_loss": 1.535933494567871, | |
| "eval_runtime": 50.6698, | |
| "eval_samples_per_second": 47.958, | |
| "eval_steps_per_second": 0.513, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 1.932551319648094, | |
| "grad_norm": 0.14145061373710632, | |
| "learning_rate": 2.8522822246288173e-05, | |
| "loss": 1.5147466659545898, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 1.9912023460410557, | |
| "grad_norm": 0.1560547649860382, | |
| "learning_rate": 2.5799700245050074e-05, | |
| "loss": 1.5312614440917969, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 1.9912023460410557, | |
| "eval_loss": 1.5332497358322144, | |
| "eval_runtime": 50.7774, | |
| "eval_samples_per_second": 47.856, | |
| "eval_steps_per_second": 0.512, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 2.0469208211143695, | |
| "grad_norm": 0.15864278376102448, | |
| "learning_rate": 2.3167308059516678e-05, | |
| "loss": 1.5440088272094727, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 2.1055718475073313, | |
| "grad_norm": 0.14240412414073944, | |
| "learning_rate": 2.063551484256107e-05, | |
| "loss": 1.516731357574463, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 2.1055718475073313, | |
| "eval_loss": 1.5310300588607788, | |
| "eval_runtime": 50.8129, | |
| "eval_samples_per_second": 47.823, | |
| "eval_steps_per_second": 0.512, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 2.164222873900293, | |
| "grad_norm": 0.15173648297786713, | |
| "learning_rate": 1.821381258950161e-05, | |
| "loss": 1.4962255477905273, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 2.222873900293255, | |
| "grad_norm": 0.15619643032550812, | |
| "learning_rate": 1.5911280551477185e-05, | |
| "loss": 1.5161256790161133, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 2.222873900293255, | |
| "eval_loss": 1.5295287370681763, | |
| "eval_runtime": 50.8214, | |
| "eval_samples_per_second": 47.814, | |
| "eval_steps_per_second": 0.512, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 2.281524926686217, | |
| "grad_norm": 0.1521531194448471, | |
| "learning_rate": 1.3736551196249759e-05, | |
| "loss": 1.4899578094482422, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 2.340175953079179, | |
| "grad_norm": 0.15226739645004272, | |
| "learning_rate": 1.1697777844051105e-05, | |
| "loss": 1.5050838470458985, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 2.340175953079179, | |
| "eval_loss": 1.5282557010650635, | |
| "eval_runtime": 50.8187, | |
| "eval_samples_per_second": 47.817, | |
| "eval_steps_per_second": 0.512, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 2.398826979472141, | |
| "grad_norm": 0.14956440031528473, | |
| "learning_rate": 9.802604099810997e-06, | |
| "loss": 1.5099305152893066, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 2.4574780058651027, | |
| "grad_norm": 0.15371431410312653, | |
| "learning_rate": 8.058135196368877e-06, | |
| "loss": 1.4888692855834962, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 2.4574780058651027, | |
| "eval_loss": 1.5272583961486816, | |
| "eval_runtime": 50.6668, | |
| "eval_samples_per_second": 47.96, | |
| "eval_steps_per_second": 0.513, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 2.5161290322580645, | |
| "grad_norm": 0.15528695285320282, | |
| "learning_rate": 6.470911356106885e-06, | |
| "loss": 1.5185343742370605, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 2.5747800586510263, | |
| "grad_norm": 0.16078710556030273, | |
| "learning_rate": 5.046883270874603e-06, | |
| "loss": 1.506414794921875, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 2.5747800586510263, | |
| "eval_loss": 1.5265320539474487, | |
| "eval_runtime": 50.6741, | |
| "eval_samples_per_second": 47.954, | |
| "eval_steps_per_second": 0.513, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 2.633431085043988, | |
| "grad_norm": 0.15603981912136078, | |
| "learning_rate": 3.7913897921341866e-06, | |
| "loss": 1.5100496292114258, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 2.6920821114369504, | |
| "grad_norm": 0.15229907631874084, | |
| "learning_rate": 2.7091379149682685e-06, | |
| "loss": 1.493442916870117, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 2.6920821114369504, | |
| "eval_loss": 1.5261310338974, | |
| "eval_runtime": 50.735, | |
| "eval_samples_per_second": 47.896, | |
| "eval_steps_per_second": 0.512, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 2.7507331378299122, | |
| "grad_norm": 0.15283197164535522, | |
| "learning_rate": 1.8041851309928802e-06, | |
| "loss": 1.4831109046936035, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 2.809384164222874, | |
| "grad_norm": 0.15298782289028168, | |
| "learning_rate": 1.0799242163365419e-06, | |
| "loss": 1.505828285217285, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 2.809384164222874, | |
| "eval_loss": 1.5259722471237183, | |
| "eval_runtime": 50.8213, | |
| "eval_samples_per_second": 47.815, | |
| "eval_steps_per_second": 0.512, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 2.868035190615836, | |
| "grad_norm": 0.1547379195690155, | |
| "learning_rate": 5.390705117171047e-07, | |
| "loss": 1.5249052047729492, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 2.9266862170087977, | |
| "grad_norm": 0.14859049022197723, | |
| "learning_rate": 1.8365174230492998e-07, | |
| "loss": 1.497894287109375, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.9266862170087977, | |
| "eval_loss": 1.5259029865264893, | |
| "eval_runtime": 50.8143, | |
| "eval_samples_per_second": 47.821, | |
| "eval_steps_per_second": 0.512, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.9853372434017595, | |
| "grad_norm": 0.16615204513072968, | |
| "learning_rate": 1.5000415538901636e-08, | |
| "loss": 1.4946805953979492, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_loss": 1.525899887084961, | |
| "eval_runtime": 50.8318, | |
| "eval_samples_per_second": 47.805, | |
| "eval_steps_per_second": 0.511, | |
| "step": 513 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 513, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 250, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.7660971754916413e+18, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |