Transformers
Safetensors
nano_deep_reasoner_hypermini
causal-lm
decoder-only
reasoning
deep-reasoning
recurrent-transformer
adaptive-computation
chain-of-thought
adaptive-reasoning
Instructions to use 11-47/Nano.Deep.Reasoner.11m-HyperMini with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use 11-47/Nano.Deep.Reasoner.11m-HyperMini with Transformers:
# Load model directly from transformers import HyperMiniReasoner model = HyperMiniReasoner.from_pretrained("11-47/Nano.Deep.Reasoner.11m-HyperMini", device_map="auto") - Notebooks
- Google Colab
- Kaggle
HyperMini Session 3 complete | 20,000 examples | loss=1.343789
Browse files- README.md +6 -6
- example_ledger.json +0 -0
- model.safetensors +1 -1
- optimizer.pt +2 -2
- rng_state.pt +1 -1
- tokenizer_config.json +1 -0
- training_state.json +0 -0
README.md
CHANGED
|
@@ -59,7 +59,7 @@ Dataset:
|
|
| 59 |
|
| 60 |
Plans11/Organized_PreTrain_1k_Context
|
| 61 |
|
| 62 |
-
Each session contains up to
|
| 63 |
|
| 64 |
Examples are protected by SHA-256 hashes.
|
| 65 |
|
|
@@ -87,16 +87,16 @@ before resume.
|
|
| 87 |
## Current state
|
| 88 |
|
| 89 |
Completed sessions:
|
| 90 |
-
|
| 91 |
|
| 92 |
Unique examples reserved/trained:
|
| 93 |
-
|
| 94 |
|
| 95 |
Unique completed examples:
|
| 96 |
-
|
| 97 |
|
| 98 |
Global optimizer steps:
|
| 99 |
-
|
| 100 |
|
| 101 |
Last session loss:
|
| 102 |
-
|
|
|
|
| 59 |
|
| 60 |
Plans11/Organized_PreTrain_1k_Context
|
| 61 |
|
| 62 |
+
Each session contains up to 200,000 NEW examples.
|
| 63 |
|
| 64 |
Examples are protected by SHA-256 hashes.
|
| 65 |
|
|
|
|
| 87 |
## Current state
|
| 88 |
|
| 89 |
Completed sessions:
|
| 90 |
+
3
|
| 91 |
|
| 92 |
Unique examples reserved/trained:
|
| 93 |
+
0
|
| 94 |
|
| 95 |
Unique completed examples:
|
| 96 |
+
60,000
|
| 97 |
|
| 98 |
Global optimizer steps:
|
| 99 |
+
939
|
| 100 |
|
| 101 |
Last session loss:
|
| 102 |
+
1.3437887360095977
|
example_ledger.json
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|
model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 59742900
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:45e25b7cb4a59e783e4d8e37d345051909703bc97fe63e3909c24f51ee40a092
|
| 3 |
size 59742900
|
optimizer.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:3b9358427a9c8b4715941c79894f9f76ca531fd2155d4248a98cc8797ded0eda
|
| 3 |
+
size 88812619
|
rng_state.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 10931
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:b3379799a4824e1efe76695d57b9d5339e7a7e76e0f36ac561d1ed73d67a443f
|
| 3 |
size 10931
|
tokenizer_config.json
CHANGED
|
@@ -2,6 +2,7 @@
|
|
| 2 |
"backend": "tokenizers",
|
| 3 |
"bos_token": "<bos>",
|
| 4 |
"eos_token": "<eos>",
|
|
|
|
| 5 |
"model_max_length": 1000000000000000019884624838656,
|
| 6 |
"pad_token": "<pad>",
|
| 7 |
"tokenizer_class": "TokenizersBackend",
|
|
|
|
| 2 |
"backend": "tokenizers",
|
| 3 |
"bos_token": "<bos>",
|
| 4 |
"eos_token": "<eos>",
|
| 5 |
+
"is_local": true,
|
| 6 |
"model_max_length": 1000000000000000019884624838656,
|
| 7 |
"pad_token": "<pad>",
|
| 8 |
"tokenizer_class": "TokenizersBackend",
|
training_state.json
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|