Instructions to use anhdai312/MathDeepSeek2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use anhdai312/MathDeepSeek2 with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("anhdai312/MathDeepSeek2", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- Unsloth Studio
How to use anhdai312/MathDeepSeek2 with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for anhdai312/MathDeepSeek2 to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for anhdai312/MathDeepSeek2 to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for anhdai312/MathDeepSeek2 to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="anhdai312/MathDeepSeek2", max_seq_length=2048, )
Training in progress, step 408, checkpoint
Browse files
last-checkpoint/adapter_model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 161533192
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:96284a4b1392614c523c3255652c7551518662ea2a124d2f983daa73adf17958
|
| 3 |
size 161533192
|
last-checkpoint/optimizer.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 82465413
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:82d2dbf6406017979f81c144f501157ce7316b647cefc393c420dbc793a2b0f3
|
| 3 |
size 82465413
|
last-checkpoint/rng_state.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 14645
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:7c3f77b7459f441b76ed48c2a706f466e60e41b340446bcd79f06cc225528cb6
|
| 3 |
size 14645
|
last-checkpoint/scaler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1383
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:743837d2c104d9a7e4469ef2df904879cedfd16f5b6f1c1800c57f24e23d6664
|
| 3 |
size 1383
|
last-checkpoint/scheduler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1465
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:c2b1a8f6f22dc8cc638d8eead1fc33bb9ec79f1b92763dd81711b31971dda1e5
|
| 3 |
size 1465
|
last-checkpoint/trainer_state.json
CHANGED
|
@@ -1,10 +1,10 @@
|
|
| 1 |
{
|
| 2 |
-
"best_global_step":
|
| 3 |
-
"best_metric": 0.
|
| 4 |
-
"best_model_checkpoint": "/kaggle/working/sep490_checkpoints/job_ce30cf18-8eef-4444-8cae-3f972a780634/checkpoint-
|
| 5 |
-
"epoch":
|
| 6 |
"eval_steps": 10,
|
| 7 |
-
"global_step":
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
@@ -3128,6 +3128,70 @@
|
|
| 3128 |
"eval_samples_per_second": 4.009,
|
| 3129 |
"eval_steps_per_second": 1.042,
|
| 3130 |
"step": 400
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 3131 |
}
|
| 3132 |
],
|
| 3133 |
"logging_steps": 1,
|
|
@@ -3142,12 +3206,12 @@
|
|
| 3142 |
"should_evaluate": false,
|
| 3143 |
"should_log": false,
|
| 3144 |
"should_save": true,
|
| 3145 |
-
"should_training_stop":
|
| 3146 |
},
|
| 3147 |
"attributes": {}
|
| 3148 |
}
|
| 3149 |
},
|
| 3150 |
-
"total_flos": 1.
|
| 3151 |
"train_batch_size": 1,
|
| 3152 |
"trial_name": null,
|
| 3153 |
"trial_params": null
|
|
|
|
| 1 |
{
|
| 2 |
+
"best_global_step": 408,
|
| 3 |
+
"best_metric": 0.6750363707542419,
|
| 4 |
+
"best_model_checkpoint": "/kaggle/working/sep490_checkpoints/job_ce30cf18-8eef-4444-8cae-3f972a780634/checkpoint-408",
|
| 5 |
+
"epoch": 3.0,
|
| 6 |
"eval_steps": 10,
|
| 7 |
+
"global_step": 408,
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
|
|
| 3128 |
"eval_samples_per_second": 4.009,
|
| 3129 |
"eval_steps_per_second": 1.042,
|
| 3130 |
"step": 400
|
| 3131 |
+
},
|
| 3132 |
+
{
|
| 3133 |
+
"epoch": 2.9537892791127542,
|
| 3134 |
+
"grad_norm": 4.688410758972168,
|
| 3135 |
+
"learning_rate": 1.1166253101736972e-06,
|
| 3136 |
+
"loss": 0.31728246808052063,
|
| 3137 |
+
"step": 401
|
| 3138 |
+
},
|
| 3139 |
+
{
|
| 3140 |
+
"epoch": 2.9611829944547132,
|
| 3141 |
+
"grad_norm": 3.6959214210510254,
|
| 3142 |
+
"learning_rate": 9.925558312655088e-07,
|
| 3143 |
+
"loss": 0.296553373336792,
|
| 3144 |
+
"step": 402
|
| 3145 |
+
},
|
| 3146 |
+
{
|
| 3147 |
+
"epoch": 2.9685767097966727,
|
| 3148 |
+
"grad_norm": 4.490988254547119,
|
| 3149 |
+
"learning_rate": 8.684863523573202e-07,
|
| 3150 |
+
"loss": 0.41596537828445435,
|
| 3151 |
+
"step": 403
|
| 3152 |
+
},
|
| 3153 |
+
{
|
| 3154 |
+
"epoch": 2.975970425138632,
|
| 3155 |
+
"grad_norm": 5.713006019592285,
|
| 3156 |
+
"learning_rate": 7.444168734491315e-07,
|
| 3157 |
+
"loss": 0.5145145654678345,
|
| 3158 |
+
"step": 404
|
| 3159 |
+
},
|
| 3160 |
+
{
|
| 3161 |
+
"epoch": 2.9833641404805915,
|
| 3162 |
+
"grad_norm": 4.68435001373291,
|
| 3163 |
+
"learning_rate": 6.20347394540943e-07,
|
| 3164 |
+
"loss": 0.47570955753326416,
|
| 3165 |
+
"step": 405
|
| 3166 |
+
},
|
| 3167 |
+
{
|
| 3168 |
+
"epoch": 2.990757855822551,
|
| 3169 |
+
"grad_norm": 3.961190938949585,
|
| 3170 |
+
"learning_rate": 4.962779156327544e-07,
|
| 3171 |
+
"loss": 0.4042632579803467,
|
| 3172 |
+
"step": 406
|
| 3173 |
+
},
|
| 3174 |
+
{
|
| 3175 |
+
"epoch": 2.9981515711645104,
|
| 3176 |
+
"grad_norm": 5.057858467102051,
|
| 3177 |
+
"learning_rate": 3.7220843672456576e-07,
|
| 3178 |
+
"loss": 0.4465891718864441,
|
| 3179 |
+
"step": 407
|
| 3180 |
+
},
|
| 3181 |
+
{
|
| 3182 |
+
"epoch": 3.0,
|
| 3183 |
+
"grad_norm": 8.670039176940918,
|
| 3184 |
+
"learning_rate": 2.481389578163772e-07,
|
| 3185 |
+
"loss": 0.4737997353076935,
|
| 3186 |
+
"step": 408
|
| 3187 |
+
},
|
| 3188 |
+
{
|
| 3189 |
+
"epoch": 3.0,
|
| 3190 |
+
"eval_loss": 0.6750363707542419,
|
| 3191 |
+
"eval_runtime": 12.4809,
|
| 3192 |
+
"eval_samples_per_second": 4.006,
|
| 3193 |
+
"eval_steps_per_second": 1.042,
|
| 3194 |
+
"step": 408
|
| 3195 |
}
|
| 3196 |
],
|
| 3197 |
"logging_steps": 1,
|
|
|
|
| 3206 |
"should_evaluate": false,
|
| 3207 |
"should_log": false,
|
| 3208 |
"should_save": true,
|
| 3209 |
+
"should_training_stop": true
|
| 3210 |
},
|
| 3211 |
"attributes": {}
|
| 3212 |
}
|
| 3213 |
},
|
| 3214 |
+
"total_flos": 1.1448379908790272e+16,
|
| 3215 |
"train_batch_size": 1,
|
| 3216 |
"trial_name": null,
|
| 3217 |
"trial_params": null
|