File size: 1,900 Bytes
e98a4f1 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 | {
"model": "North-ML1/Aurora-Proelia-ChatML",
"before_checkpoint": "North-ML1/Aurora-Proelia",
"after_checkpoint": "/home/arthur/ember-proelia/exports/aurora-proelia-chatml-20260815",
"matched_public_slice": {
"mmlu": {
"released": {
"dataset": "cais/mmlu",
"config": "all",
"split": "test",
"n": 57,
"correct": 14,
"accuracy": 0.24561403508771928
},
"chatml": {
"dataset": "cais/mmlu",
"config": "all",
"split": "test",
"n": 57,
"correct": 16,
"accuracy": 0.2807017543859649
}
},
"arc_challenge": {
"released": {
"dataset": "allenai/ai2_arc",
"config": "ARC-Challenge",
"split": "test",
"n": 50,
"correct": 13,
"accuracy": 0.26
},
"chatml": {
"dataset": "allenai/ai2_arc",
"config": "ARC-Challenge",
"split": "test",
"n": 50,
"correct": 15,
"accuracy": 0.3
}
},
"hellaswag": {
"released": {
"dataset": "Rowan/hellaswag",
"split": "validation",
"n": 50,
"correct": 19,
"accuracy": 0.38
},
"chatml": {
"dataset": "Rowan/hellaswag",
"split": "validation",
"n": 50,
"correct": 19,
"accuracy": 0.38
}
},
"gsm8k": {
"released": {
"dataset": "openai/gsm8k",
"config": "main",
"split": "test",
"n": 50,
"correct": 1,
"accuracy": 0.02
},
"chatml": {
"dataset": "openai/gsm8k",
"config": "main",
"split": "test",
"n": 50,
"correct": 0,
"accuracy": 0.0
}
}
},
"note": "Same public dataset slices and native Aurora scoring code; directional regression check, not an official leaderboard evaluation."
}\n |