File size: 1,900 Bytes
e98a4f1
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
{
  "model": "North-ML1/Aurora-Proelia-ChatML",
  "before_checkpoint": "North-ML1/Aurora-Proelia",
  "after_checkpoint": "/home/arthur/ember-proelia/exports/aurora-proelia-chatml-20260815",
  "matched_public_slice": {
    "mmlu": {
      "released": {
        "dataset": "cais/mmlu",
        "config": "all",
        "split": "test",
        "n": 57,
        "correct": 14,
        "accuracy": 0.24561403508771928
      },
      "chatml": {
        "dataset": "cais/mmlu",
        "config": "all",
        "split": "test",
        "n": 57,
        "correct": 16,
        "accuracy": 0.2807017543859649
      }
    },
    "arc_challenge": {
      "released": {
        "dataset": "allenai/ai2_arc",
        "config": "ARC-Challenge",
        "split": "test",
        "n": 50,
        "correct": 13,
        "accuracy": 0.26
      },
      "chatml": {
        "dataset": "allenai/ai2_arc",
        "config": "ARC-Challenge",
        "split": "test",
        "n": 50,
        "correct": 15,
        "accuracy": 0.3
      }
    },
    "hellaswag": {
      "released": {
        "dataset": "Rowan/hellaswag",
        "split": "validation",
        "n": 50,
        "correct": 19,
        "accuracy": 0.38
      },
      "chatml": {
        "dataset": "Rowan/hellaswag",
        "split": "validation",
        "n": 50,
        "correct": 19,
        "accuracy": 0.38
      }
    },
    "gsm8k": {
      "released": {
        "dataset": "openai/gsm8k",
        "config": "main",
        "split": "test",
        "n": 50,
        "correct": 1,
        "accuracy": 0.02
      },
      "chatml": {
        "dataset": "openai/gsm8k",
        "config": "main",
        "split": "test",
        "n": 50,
        "correct": 0,
        "accuracy": 0.0
      }
    }
  },
  "note": "Same public dataset slices and native Aurora scoring code; directional regression check, not an official leaderboard evaluation."
}\n