OliverSundaram commited on
Commit
79bbbbf
·
verified ·
1 Parent(s): 1f37888

Upload folder using huggingface_hub

Browse files
Files changed (2) hide show
  1. README.md +2 -2
  2. assets/speed_results.json +88 -12
README.md CHANGED
@@ -105,8 +105,8 @@ its standard published shot count, compared against the un-tuned base model.
105
  | HellaSwag | 64.2% | 63.6% | 🔴 -0.6% |
106
  | WinoGrande | 60.8% | 61.4% | 🟢 +0.6% |
107
 
108
- **Speed** (single-request generation, greedy, RTX 4060): **37.84 tokens/sec**
109
- (base model: 12.74 tokens/sec)
110
 
111
  ### MMLU by category
112
 
 
105
  | HellaSwag | 64.2% | 63.6% | 🔴 -0.6% |
106
  | WinoGrande | 60.8% | 61.4% | 🟢 +0.6% |
107
 
108
+ **Speed:** **40.63 tokens/sec**
109
+ (base model: 40.59 tokens/sec)
110
 
111
  ### MMLU by category
112
 
assets/speed_results.json CHANGED
@@ -1,16 +1,92 @@
1
  {
2
- "base": {
3
- "model_path": "unsloth/Llama-3.2-1B",
4
- "generated_tokens_per_run": 1,
5
- "avg_seconds_per_run": 0.079,
6
- "tokens_per_sec": 12.74,
7
- "num_timed_runs": 5
 
 
 
8
  },
9
- "20k": {
10
- "model_path": "Llama-3.2-1B-MathCodeInstruct-20k\\outputs\\llama-3.2-1b-20k",
11
- "generated_tokens_per_run": 256,
12
- "avg_seconds_per_run": 6.764,
13
- "tokens_per_sec": 37.84,
14
- "num_timed_runs": 5
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
15
  }
16
  }
 
1
  {
2
+ "config": {
3
+ "prompt": "Natalia sold clips to 48 of her friends in April, and then she sold half as many clips in May. How many clips did Natalia sell altogether in April and May? Solve step by step.",
4
+ "tokens_per_run": 256,
5
+ "rounds": 3,
6
+ "interleaved": true,
7
+ "dtype": "bfloat16",
8
+ "greedy": true,
9
+ "device": "NVIDIA GeForce RTX 4060",
10
+ "torch": "2.11.0+cu128"
11
  },
12
+ "models": {
13
+ "base": {
14
+ "model_path": "unsloth/Llama-3.2-1B",
15
+ "decode_tok_s": 40.59,
16
+ "decode_tok_s_min": 39.28,
17
+ "decode_tok_s_max": 40.62,
18
+ "end_to_end_tok_s": 40.56,
19
+ "prefill_ms": 29.3,
20
+ "prompt_tokens": 44,
21
+ "generated_tokens": 256,
22
+ "rounds": [
23
+ {
24
+ "prompt_tokens": 44,
25
+ "generated_tokens": 256,
26
+ "prefill_s": 0.0321,
27
+ "total_s": 6.5236,
28
+ "decode_tok_s": 39.28,
29
+ "end_to_end_tok_s": 39.24,
30
+ "gpu": "51C / 2775MHz"
31
+ },
32
+ {
33
+ "prompt_tokens": 44,
34
+ "generated_tokens": 256,
35
+ "prefill_s": 0.0293,
36
+ "total_s": 6.307,
37
+ "decode_tok_s": 40.62,
38
+ "end_to_end_tok_s": 40.59,
39
+ "gpu": "58C / 2775MHz"
40
+ },
41
+ {
42
+ "prompt_tokens": 44,
43
+ "generated_tokens": 256,
44
+ "prefill_s": 0.0293,
45
+ "total_s": 6.3119,
46
+ "decode_tok_s": 40.59,
47
+ "end_to_end_tok_s": 40.56,
48
+ "gpu": "51C / 2775MHz"
49
+ }
50
+ ]
51
+ },
52
+ "20k": {
53
+ "model_path": "Llama-3.2-1B-MathCodeInstruct-20k/outputs/llama-3.2-1b-20k",
54
+ "decode_tok_s": 40.63,
55
+ "decode_tok_s_min": 40.61,
56
+ "decode_tok_s_max": 40.67,
57
+ "end_to_end_tok_s": 40.6,
58
+ "prefill_ms": 29.7,
59
+ "prompt_tokens": 44,
60
+ "generated_tokens": 256,
61
+ "rounds": [
62
+ {
63
+ "prompt_tokens": 44,
64
+ "generated_tokens": 256,
65
+ "prefill_s": 0.0295,
66
+ "total_s": 6.3088,
67
+ "decode_tok_s": 40.61,
68
+ "end_to_end_tok_s": 40.58,
69
+ "gpu": "57C / 2775MHz"
70
+ },
71
+ {
72
+ "prompt_tokens": 44,
73
+ "generated_tokens": 256,
74
+ "prefill_s": 0.0308,
75
+ "total_s": 6.3005,
76
+ "decode_tok_s": 40.67,
77
+ "end_to_end_tok_s": 40.63,
78
+ "gpu": "51C / 2775MHz"
79
+ },
80
+ {
81
+ "prompt_tokens": 44,
82
+ "generated_tokens": 256,
83
+ "prefill_s": 0.0297,
84
+ "total_s": 6.3062,
85
+ "decode_tok_s": 40.63,
86
+ "end_to_end_tok_s": 40.6,
87
+ "gpu": "52C / 2775MHz"
88
+ }
89
+ ]
90
+ }
91
  }
92
  }