Instructions to use anhdai312/MathDeepSeek with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use anhdai312/MathDeepSeek with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("anhdai312/MathDeepSeek", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- Unsloth Studio
How to use anhdai312/MathDeepSeek with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for anhdai312/MathDeepSeek to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for anhdai312/MathDeepSeek to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for anhdai312/MathDeepSeek to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="anhdai312/MathDeepSeek", max_seq_length=2048, )
Training in progress, step 260, checkpoint
Browse files
last-checkpoint/adapter_model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 161533192
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:c4bbf0992a106f4baa01a514ae01216614042b5d5e90f8621a2e9625d793e64f
|
| 3 |
size 161533192
|
last-checkpoint/optimizer.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:c74fea9bec98892c11696c52d0751f8eae129e8bfdf2383ae6e538abe462147b
|
| 3 |
+
size 82465413
|
last-checkpoint/rng_state.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 14645
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:e3679b5332bd6913a80c9d4c9aefd42fb13000e50001b9fe813643d1433503fd
|
| 3 |
size 14645
|
last-checkpoint/scaler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1383
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4b4e1c57c7cbee6e029ea75fc88a26c3704cad5c13afadd670c74d698d66cb3e
|
| 3 |
size 1383
|
last-checkpoint/scheduler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1465
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:d251eb269cc220cd4f9e310470b60ac80072d6ccf3fde870ee5d392976862ef6
|
| 3 |
size 1465
|
last-checkpoint/trainer_state.json
CHANGED
|
@@ -1,10 +1,10 @@
|
|
| 1 |
{
|
| 2 |
-
"best_global_step":
|
| 3 |
-
"best_metric": 0.
|
| 4 |
-
"best_model_checkpoint": "/tmp/checkpoints_/job_bf4d9449-335c-4598-aae6-39588820e13b/checkpoint-
|
| 5 |
-
"epoch": 1.
|
| 6 |
"eval_steps": 10,
|
| 7 |
-
"global_step":
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
@@ -1958,6 +1958,84 @@
|
|
| 1958 |
"eval_samples_per_second": 3.4,
|
| 1959 |
"eval_steps_per_second": 0.884,
|
| 1960 |
"step": 250
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1961 |
}
|
| 1962 |
],
|
| 1963 |
"logging_steps": 1,
|
|
@@ -1977,7 +2055,7 @@
|
|
| 1977 |
"attributes": {}
|
| 1978 |
}
|
| 1979 |
},
|
| 1980 |
-
"total_flos":
|
| 1981 |
"train_batch_size": 1,
|
| 1982 |
"trial_name": null,
|
| 1983 |
"trial_params": null
|
|
|
|
| 1 |
{
|
| 2 |
+
"best_global_step": 260,
|
| 3 |
+
"best_metric": 0.7780888080596924,
|
| 4 |
+
"best_model_checkpoint": "/tmp/checkpoints_/job_bf4d9449-335c-4598-aae6-39588820e13b/checkpoint-260",
|
| 5 |
+
"epoch": 1.9168207024029575,
|
| 6 |
"eval_steps": 10,
|
| 7 |
+
"global_step": 260,
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
|
|
| 1958 |
"eval_samples_per_second": 3.4,
|
| 1959 |
"eval_steps_per_second": 0.884,
|
| 1960 |
"step": 250
|
| 1961 |
+
},
|
| 1962 |
+
{
|
| 1963 |
+
"epoch": 1.8502772643253236,
|
| 1964 |
+
"grad_norm": 3.506394386291504,
|
| 1965 |
+
"learning_rate": 1.9602977667493796e-05,
|
| 1966 |
+
"loss": 0.759330153465271,
|
| 1967 |
+
"step": 251
|
| 1968 |
+
},
|
| 1969 |
+
{
|
| 1970 |
+
"epoch": 1.8576709796672828,
|
| 1971 |
+
"grad_norm": 4.319957256317139,
|
| 1972 |
+
"learning_rate": 1.947890818858561e-05,
|
| 1973 |
+
"loss": 0.9550069570541382,
|
| 1974 |
+
"step": 252
|
| 1975 |
+
},
|
| 1976 |
+
{
|
| 1977 |
+
"epoch": 1.865064695009242,
|
| 1978 |
+
"grad_norm": 4.66499662399292,
|
| 1979 |
+
"learning_rate": 1.935483870967742e-05,
|
| 1980 |
+
"loss": 0.7672110199928284,
|
| 1981 |
+
"step": 253
|
| 1982 |
+
},
|
| 1983 |
+
{
|
| 1984 |
+
"epoch": 1.8724584103512014,
|
| 1985 |
+
"grad_norm": 3.980341672897339,
|
| 1986 |
+
"learning_rate": 1.923076923076923e-05,
|
| 1987 |
+
"loss": 1.0426957607269287,
|
| 1988 |
+
"step": 254
|
| 1989 |
+
},
|
| 1990 |
+
{
|
| 1991 |
+
"epoch": 1.8798521256931608,
|
| 1992 |
+
"grad_norm": 2.3597588539123535,
|
| 1993 |
+
"learning_rate": 1.9106699751861042e-05,
|
| 1994 |
+
"loss": 0.5822687745094299,
|
| 1995 |
+
"step": 255
|
| 1996 |
+
},
|
| 1997 |
+
{
|
| 1998 |
+
"epoch": 1.8872458410351203,
|
| 1999 |
+
"grad_norm": 3.7864487171173096,
|
| 2000 |
+
"learning_rate": 1.8982630272952853e-05,
|
| 2001 |
+
"loss": 0.6077347993850708,
|
| 2002 |
+
"step": 256
|
| 2003 |
+
},
|
| 2004 |
+
{
|
| 2005 |
+
"epoch": 1.8946395563770795,
|
| 2006 |
+
"grad_norm": 2.9949333667755127,
|
| 2007 |
+
"learning_rate": 1.8858560794044667e-05,
|
| 2008 |
+
"loss": 0.5098516345024109,
|
| 2009 |
+
"step": 257
|
| 2010 |
+
},
|
| 2011 |
+
{
|
| 2012 |
+
"epoch": 1.9020332717190387,
|
| 2013 |
+
"grad_norm": 1.3919459581375122,
|
| 2014 |
+
"learning_rate": 1.8734491315136477e-05,
|
| 2015 |
+
"loss": 0.40490952134132385,
|
| 2016 |
+
"step": 258
|
| 2017 |
+
},
|
| 2018 |
+
{
|
| 2019 |
+
"epoch": 1.9094269870609981,
|
| 2020 |
+
"grad_norm": 3.4704983234405518,
|
| 2021 |
+
"learning_rate": 1.8610421836228288e-05,
|
| 2022 |
+
"loss": 0.4017954468727112,
|
| 2023 |
+
"step": 259
|
| 2024 |
+
},
|
| 2025 |
+
{
|
| 2026 |
+
"epoch": 1.9168207024029575,
|
| 2027 |
+
"grad_norm": 3.2767493724823,
|
| 2028 |
+
"learning_rate": 1.84863523573201e-05,
|
| 2029 |
+
"loss": 0.4063960611820221,
|
| 2030 |
+
"step": 260
|
| 2031 |
+
},
|
| 2032 |
+
{
|
| 2033 |
+
"epoch": 1.9168207024029575,
|
| 2034 |
+
"eval_loss": 0.7780888080596924,
|
| 2035 |
+
"eval_runtime": 14.5949,
|
| 2036 |
+
"eval_samples_per_second": 3.426,
|
| 2037 |
+
"eval_steps_per_second": 0.891,
|
| 2038 |
+
"step": 260
|
| 2039 |
}
|
| 2040 |
],
|
| 2041 |
"logging_steps": 1,
|
|
|
|
| 2055 |
"attributes": {}
|
| 2056 |
}
|
| 2057 |
},
|
| 2058 |
+
"total_flos": 8365040721128448.0,
|
| 2059 |
"train_batch_size": 1,
|
| 2060 |
"trial_name": null,
|
| 2061 |
"trial_params": null
|