tiny-hinglish-turn-detector / reports /partial_baseline_metrics.json
suvradeepp's picture
Publish Tiny Hinglish Turn Detector development preview
35d483e verified
Raw
History Blame Contribute Delete
5.03 kB
{
"data_revision": "e564e2ac567f774d1880aa1db6ce97afb8c519b7",
"group_count": 3265,
"group_overlap_count": 0,
"grouping_note": "All observed groups are singleton rows; speaker/conversation/voice identity separation is not established.",
"hyperparameters": {
"epochs": 1000,
"fpr_budget": 0.02,
"l2": 0.001,
"learning_rate": 0.05,
"max_seconds": 4.0
},
"largest_group_rows": 1,
"limitations": [
"One of 83 upstream training shards was locally available.",
"This is an interpretable sanity baseline, not the submitted neural model.",
"The threshold was selected on this validation split and must not be tuned on test."
],
"manifest": "data/processed/partial-iid-splits.jsonl",
"manifest_sha256": "cae0765d18467186c0e890c35fd94c0fcc70ae3483b5a1ce31814dd8ffa37b50",
"model": {
"bytes": 1240,
"path": "artifacts/partial-baseline/model.json",
"sha256": "8a2c230027f07c99241392bc031d835586e3d5ce4e90ffbb22871ceeddcf6ff7"
},
"scope": "audited local training shard; official test remains sealed",
"source_root": ".",
"status": "development_only",
"threshold_selection": {
"accuracy": 0.5644171779141104,
"average_precision": 0.7310146473284146,
"balanced_accuracy": 0.5565888554216868,
"brier_score": 0.20382910064244883,
"count": 326,
"expected_calibration_error": 0.08678660959363686,
"f1": 0.22826086956521738,
"false_negative_rate": 0.86875,
"false_positive_rate": 0.018072289156626505,
"fn": 139,
"fp": 3,
"log_loss": 0.591045865107666,
"macro_f1": 0.462421033073207,
"max_false_positive_rate": 0.02,
"negative_count": 166,
"positive_count": 160,
"precision": 0.875,
"recall": 0.13125,
"roc_auc": 0.752183734939759,
"specificity": 0.9819277108433735,
"threshold": 0.7638751511278986,
"tn": 163,
"tp": 21
},
"train_examples": 2939,
"train_metrics_at_validation_threshold": {
"accuracy": 0.5440626063286832,
"average_precision": 0.6528796660335541,
"balanced_accuracy": 0.5349069558634532,
"brier_score": 0.21565992251834837,
"count": 2939,
"expected_calibration_error": 0.05208070343574749,
"f1": 0.18787878787878787,
"false_negative_rate": 0.89221140472879,
"false_positive_rate": 0.0379746835443038,
"fn": 1283,
"fp": 57,
"log_loss": 0.6229624981492231,
"macro_f1": 0.4354720334852785,
"negative_count": 1501,
"positive_count": 1438,
"precision": 0.7311320754716981,
"recall": 0.10778859527121001,
"roc_auc": 0.7162675045565358,
"specificity": 0.9620253164556962,
"threshold": 0.7638751511278986,
"tn": 1444,
"tp": 155
},
"train_split": "train",
"validation_examples": 326,
"validation_metrics": {
"accuracy": 0.5644171779141104,
"average_precision": 0.7310146473284146,
"balanced_accuracy": 0.5565888554216868,
"brier_score": 0.20382910064244883,
"count": 326,
"expected_calibration_error": 0.08678660959363686,
"f1": 0.22826086956521738,
"false_negative_rate": 0.86875,
"false_positive_rate": 0.018072289156626505,
"fn": 139,
"fp": 3,
"log_loss": 0.591045865107666,
"macro_f1": 0.462421033073207,
"negative_count": 166,
"positive_count": 160,
"precision": 0.875,
"recall": 0.13125,
"roc_auc": 0.752183734939759,
"specificity": 0.9819277108433735,
"threshold": 0.7638751511278986,
"tn": 163,
"tp": 21
},
"validation_reliability": [
{
"count": 2,
"lower": 0.0,
"mean_probability": 0.07256123833644303,
"observed_rate": 0,
"upper": 0.1
},
{
"count": 15,
"lower": 0.1,
"mean_probability": 0.1637974159539599,
"observed_rate": 0,
"upper": 0.2
},
{
"count": 33,
"lower": 0.2,
"mean_probability": 0.24781361783797937,
"observed_rate": 0.15151515151515152,
"upper": 0.3
},
{
"count": 60,
"lower": 0.3,
"mean_probability": 0.3501448253606763,
"observed_rate": 0.3,
"upper": 0.4
},
{
"count": 72,
"lower": 0.4,
"mean_probability": 0.44860372731312476,
"observed_rate": 0.5,
"upper": 0.5
},
{
"count": 62,
"lower": 0.5,
"mean_probability": 0.5475329234533823,
"observed_rate": 0.7096774193548387,
"upper": 0.6
},
{
"count": 42,
"lower": 0.6,
"mean_probability": 0.6424729141775747,
"observed_rate": 0.5714285714285714,
"upper": 0.7
},
{
"count": 25,
"lower": 0.7,
"mean_probability": 0.7485065215622557,
"observed_rate": 0.72,
"upper": 0.8
},
{
"count": 10,
"lower": 0.8,
"mean_probability": 0.8286639570658632,
"observed_rate": 1,
"upper": 0.9
},
{
"count": 5,
"lower": 0.9,
"mean_probability": 0.9319128283903566,
"observed_rate": 1,
"upper": 1.0
}
],
"validation_split": "validation"
}