Router / scores.json
CompactAI's picture
Upload 11 files
35700de verified
Raw
History Blame Contribute Delete
5.7 kB
{
"model": "Glint-Router-1M",
"author": "Glint-Research",
"parameters": 985826,
"baseline": "SupraLabs/Supra-Router-51M (51,786,240 params)",
"training": {
"params": 985826,
"train_rows": 87604,
"val_rows": 7617,
"steps": 14479,
"minutes": 15.0,
"domain": 0.9464356045687279,
"route": 0.939608769856899,
"complexity": 0.7923066824209006,
"code": 0.991466456610214,
"math": 0.978075357752396,
"reasoning": 0.8949717736641722,
"long_output": 0.9516870158855192,
"ece_raw": 0.05564934242829622,
"ece_calibrated": 0.02029288645098859,
"hardware": "RTX 3060 Ti",
"rounds": 1,
"wall_clock_minutes": 15.0,
"corpus_rows": 95221
},
"neutral_holdout": {
"val_rows": 3418,
"slice_rows": {
"aqua_rat": 254,
"dolly": 2500,
"humaneval": 164,
"mbpp": 500
},
"glint": {
"route_accuracy": 0.9441193680514921,
"code_accuracy": 0.9751316559391457,
"math_accuracy": 0.9526038619075483,
"complexity_exact": 0.46284376828554713,
"complexity_within_1": 0.9590403744880047,
"ms_per_prompt": 0.05992146021082586,
"parse_failures": 0
},
"glint_aqua_rat": {
"route_accuracy": 0.9094488188976378,
"code_accuracy": 0.9960629921259843,
"math_accuracy": 0.889763779527559,
"complexity_exact": 0.1141732283464567,
"complexity_within_1": 0.8070866141732284,
"ms_per_prompt": 0.05992146021082586,
"parse_failures": 0
},
"glint_dolly": {
"route_accuracy": 0.9424,
"code_accuracy": 0.9956,
"math_accuracy": 0.9612,
"complexity_exact": 0.5688,
"complexity_within_1": 0.9944,
"ms_per_prompt": 0.05992146021082586,
"parse_failures": 0
},
"glint_humaneval": {
"route_accuracy": 0.8719512195121951,
"code_accuracy": 0.5670731707317073,
"math_accuracy": 0.9024390243902439,
"complexity_exact": 0.4451219512195122,
"complexity_within_1": 0.9817073170731707,
"ms_per_prompt": 0.05992146021082586,
"parse_failures": 0
},
"glint_mbpp": {
"route_accuracy": 0.994,
"code_accuracy": 0.996,
"math_accuracy": 0.958,
"complexity_exact": 0.116,
"complexity_within_1": 0.852,
"ms_per_prompt": 0.05992146021082586,
"parse_failures": 0
},
"supra": {
"route_accuracy": 0.903744880046811,
"code_accuracy": 0.9643066120538326,
"math_accuracy": 0.9207138677589234,
"complexity_exact": 0.3905792861322411,
"complexity_within_1": 0.9163253364540667,
"ms_per_prompt": 14.334112498536923,
"parse_failures": 4
},
"supra_aqua_rat": {
"route_accuracy": 0.9133858267716536,
"code_accuracy": 1.0,
"math_accuracy": 0.9094488188976378,
"complexity_exact": 0.0,
"complexity_within_1": 0.09448818897637795,
"ms_per_prompt": 14.334112498536923,
"parse_failures": 4
},
"supra_dolly": {
"route_accuracy": 0.8896,
"code_accuracy": 0.996,
"math_accuracy": 0.9428,
"complexity_exact": 0.482,
"complexity_within_1": 0.9776,
"ms_per_prompt": 14.334112498536923,
"parse_failures": 4
},
"supra_humaneval": {
"route_accuracy": 0.8292682926829268,
"code_accuracy": 0.676829268292683,
"math_accuracy": 0.8414634146341463,
"complexity_exact": 0.16463414634146342,
"complexity_within_1": 1.0,
"ms_per_prompt": 14.334112498536923,
"parse_failures": 4
},
"supra_mbpp": {
"route_accuracy": 0.994,
"code_accuracy": 0.882,
"math_accuracy": 0.842,
"complexity_exact": 0.206,
"complexity_within_1": 1.0,
"ms_per_prompt": 14.334112498536923,
"parse_failures": 4
}
},
"in_corpus_val": {
"val_rows": 7617,
"glint": {
"route_accuracy": 0.939608769856899,
"code_accuracy": 0.991466456610214,
"math_accuracy": 0.978075357752396,
"complexity_exact": 0.7923066824209006,
"complexity_within_1": 0.9883156098201391,
"ms_per_prompt": 0.0748591950898926,
"parse_failures": 0
},
"glint_trap": {
"route_accuracy": 1.0,
"code_accuracy": 1.0,
"math_accuracy": 1.0,
"complexity_exact": 1.0,
"complexity_within_1": 1.0,
"parse_failures": 0
},
"supra": {
"route_accuracy": 0.8575554680320336,
"code_accuracy": 0.9761060785085992,
"math_accuracy": 0.9400026257056584,
"complexity_exact": 0.4629119075751608,
"complexity_within_1": 0.923723250623605,
"ms_per_prompt": 14.768008985689887,
"parse_failures": 1
},
"supra_trap": {
"route_accuracy": 0.908695652173913,
"code_accuracy": 0.9869565217391304,
"math_accuracy": 1.0,
"complexity_exact": 0.33043478260869563,
"complexity_within_1": 0.8391304347826087,
"parse_failures": 1
},
"note": "labels from the glint pipeline. glint is in-distribution here, supra is not. read the holdout numbers for the fair comparison."
},
"supra_own_rows": {
"val_rows": 91,
"glint": {
"route_accuracy": 0.8901098901098901,
"code_accuracy": 0.9010989010989011,
"math_accuracy": 0.8131868131868132,
"complexity_exact": 0.5054945054945055
},
"supra": {
"route_accuracy": 0.967032967032967,
"code_accuracy": 1.0,
"math_accuracy": 0.978021978021978,
"complexity_exact": 0.8571428571428571
},
"note": "supra's own 992-row dataset, held out of glint training. these rows are supra's TRAINING data, so supra is scoring a memorised set. published because leaving it out would be dishonest."
}
}