SabaPivot's picture
Upgrade ViPll with official-code real-data reproduction
ed5994a
Raw
History Blame Contribute Delete
32.5 kB
{
"by_dataset": {
"bird-song": {
"official_five_fold_ablation_mean": 0.7224853999999999,
"official_five_fold_accuracy_delta": 0.03901739999999998,
"official_five_fold_vi_pll_mean": 0.7615027999999999,
"shortened_ablation_mean_test_accuracy": 0.678,
"shortened_accuracy_delta": 0.03966666666666663,
"shortened_vi_pll_mean_test_accuracy": 0.7176666666666667
},
"lost": {
"official_five_fold_ablation_mean": 0.7700237999999999,
"official_five_fold_accuracy_delta": 0.015138600000000113,
"official_five_fold_vi_pll_mean": 0.7851624,
"shortened_ablation_mean_test_accuracy": 0.7496296296296295,
"shortened_accuracy_delta": 0.0503703703703704,
"shortened_vi_pll_mean_test_accuracy": 0.7999999999999999
}
},
"campaign": "official-code real-data bounded reproduction v2",
"default_schedule_unchanged": {
"main_loop_iterations": 1001,
"paper_reported_epochs": [
500,
1000
],
"warmup_loop_iterations": 501
},
"environment": {
"device": "cpu",
"numpy": "1.26.4",
"platform": "Linux-6.18.33.2-microsoft-standard-WSL2-x86_64-with-glibc2.39",
"python": "3.12.13",
"scipy": "1.16.3",
"sklearn": "1.5.1",
"torch": "2.13.0+cpu",
"torch_threads": 8
},
"instrumentation_patch_sha256": "e8f17ae7d85dfbeaea52a22ff8957ea92722b7f30d356219120dca6475c0d756",
"max_rss_mib": 484.05078125,
"official_commit": "dc0adebd2466cb862879ba309b30e66a37b10473",
"official_released_csv_audit": {
"bird-song": {
"test_accuracy_delta_vi_minus_ablation": 0.03901739999999998,
"vi-ablation": {
"file": "results/bird-song_vi-ablation.csv",
"folds": 5,
"sha256": "504ae9ac414a72c8c45b7d3f932158fc922a74a4caa91629c7939244d078c9f3",
"test_accuracy_mean": 0.7224853999999999,
"test_accuracy_population_std": 0.015510104082178169,
"test_mcc_mean": 0.6802716,
"train_accuracy_mean": 0.7858154
},
"vi-pll": {
"file": "results/bird-song_vi-pll.csv",
"folds": 5,
"sha256": "e560ac9cf02970bdb0b7fd9d7fcdd967aae5d7d205f87955a41e1babb54b60fe",
"test_accuracy_mean": 0.7615027999999999,
"test_accuracy_population_std": 0.015580385481752381,
"test_mcc_mean": 0.725596,
"train_accuracy_mean": 0.867097
}
},
"cifar10": {
"test_accuracy_delta_vi_minus_ablation": 0.08213999999999999,
"vi-ablation": {
"file": "results/cifar10_vi-ablation.csv",
"folds": 5,
"sha256": "a00bcb60d62c2f4dfca30f7af77847afd217c592241a38413374fb8bf698056c",
"test_accuracy_mean": 0.8842800000000001,
"test_accuracy_population_std": 0.0013585286158193175,
"test_mcc_mean": 0.8820615999999999,
"train_accuracy_mean": 0.9821626
},
"vi-pll": {
"file": "results/cifar10_vi-pll.csv",
"folds": 5,
"sha256": "4801b6aa5b684b1ab717e7dadf7ce19a1b3edd160f29960a3ffc307320034ef0",
"test_accuracy_mean": 0.9664200000000001,
"test_accuracy_population_std": 0.03916526011658802,
"test_mcc_mean": 0.9642268000000002,
"train_accuracy_mean": 0.9914476000000001
}
},
"cifar100": {
"test_accuracy_delta_vi_minus_ablation": 0.3202399999999999,
"vi-ablation": {
"file": "results/cifar100_vi-ablation.csv",
"folds": 5,
"sha256": "2f32c9a8d3b09c5916698a5753e2957afe56dd0f2a92bd0221b326b0af2d313c",
"test_accuracy_mean": 0.4574,
"test_accuracy_population_std": 0.02485855989392788,
"test_mcc_mean": 0.45415219999999995,
"train_accuracy_mean": 0.8434963999999999
},
"vi-pll": {
"file": "results/cifar100_vi-pll.csv",
"folds": 5,
"sha256": "470eafb37c06988e80afcf5f49e751f226082a79ee854a8c81ef0ccaf3f30cd1",
"test_accuracy_mean": 0.7776399999999999,
"test_accuracy_population_std": 0.005073696877031549,
"test_mcc_mean": 0.7761578,
"train_accuracy_mean": 0.9632153999999999
}
},
"fmnist": {
"test_accuracy_delta_vi_minus_ablation": 0.07510000000000006,
"vi-ablation": {
"file": "results/fmnist_vi-ablation.csv",
"folds": 5,
"sha256": "2b516cb473e730ea9898e6aa947d7acfcdf9584dcf97455eb97a0ca557bc2403",
"test_accuracy_mean": 0.67364,
"test_accuracy_population_std": 0.006577111828150716,
"test_mcc_mean": 0.6546687999999999,
"train_accuracy_mean": 0.9082718
},
"vi-pll": {
"file": "results/fmnist_vi-pll.csv",
"folds": 5,
"sha256": "692d8691cd94c7f7b35227724fa4b4f1bd906842f0a6b203bed23dc62172ee89",
"test_accuracy_mean": 0.7487400000000001,
"test_accuracy_population_std": 0.009289262618744295,
"test_mcc_mean": 0.7257798000000001,
"train_accuracy_mean": 0.9207942000000001
}
},
"kmnist": {
"test_accuracy_delta_vi_minus_ablation": 0.18367999999999995,
"vi-ablation": {
"file": "results/kmnist_vi-ablation.csv",
"folds": 5,
"sha256": "0deaac66d893a09f864d357a01189819bd6aabcb5199a165933cb194e466458e",
"test_accuracy_mean": 0.40414000000000005,
"test_accuracy_population_std": 0.007038920371761569,
"test_mcc_mean": 0.3671206,
"train_accuracy_mean": 0.780351
},
"vi-pll": {
"file": "results/kmnist_vi-pll.csv",
"folds": 5,
"sha256": "07d38755af2513e47b768bc68664f1f87aa2c70bf8572786b29a8c038a91fe5f",
"test_accuracy_mean": 0.58782,
"test_accuracy_population_std": 0.013390205375572095,
"test_mcc_mean": 0.549998,
"train_accuracy_mean": 0.9051665999999999
}
},
"lost": {
"test_accuracy_delta_vi_minus_ablation": 0.015138600000000113,
"vi-ablation": {
"file": "results/lost_vi-ablation.csv",
"folds": 5,
"sha256": "dc122e19283334f495806b65b6869413dccff9fa0727114aac71fb7b4d1d3a25",
"test_accuracy_mean": 0.7700237999999999,
"test_accuracy_population_std": 0.022041438305156032,
"test_mcc_mean": 0.7412328,
"train_accuracy_mean": 0.9017383999999999
},
"vi-pll": {
"file": "results/lost_vi-pll.csv",
"folds": 5,
"sha256": "9b5e1f419946a5fb7a55d4c3eae0872460c6906b9fc157da8c196075573deb73",
"test_accuracy_mean": 0.7851624,
"test_accuracy_population_std": 0.022658168474967252,
"test_mcc_mean": 0.7592215999999999,
"train_accuracy_mean": 0.9251394
}
},
"mir-flickr": {
"test_accuracy_delta_vi_minus_ablation": 0.03237419999999991,
"vi-ablation": {
"file": "results/mir-flickr_vi-ablation.csv",
"folds": 5,
"sha256": "b7ab3b15bbfb73ea8b40e55da9100bda92c14669b6cfcf8c22381aced0592124",
"test_accuracy_mean": 0.6525178,
"test_accuracy_population_std": 0.028378408295040073,
"test_mcc_mean": 0.5886464,
"train_accuracy_mean": 0.6952338
},
"vi-pll": {
"file": "results/mir-flickr_vi-pll.csv",
"folds": 5,
"sha256": "025b01750ff7ad490684671f38d9e2ea13558b455f3b9a823b6bbce5e680f558",
"test_accuracy_mean": 0.684892,
"test_accuracy_population_std": 0.021262655713715547,
"test_mcc_mean": 0.6256385999999999,
"train_accuracy_mean": 0.7312048
}
},
"mnist": {
"test_accuracy_delta_vi_minus_ablation": 0.2787599999999999,
"vi-ablation": {
"file": "results/mnist_vi-ablation.csv",
"folds": 5,
"sha256": "136646ab76148a9066fec1fbfb743299caee5fddc7dea9df9c5892ef485b6fde",
"test_accuracy_mean": 0.5293,
"test_accuracy_population_std": 0.01757885092945496,
"test_mcc_mean": 0.5119868000000001,
"train_accuracy_mean": 0.7570106000000001
},
"vi-pll": {
"file": "results/mnist_vi-pll.csv",
"folds": 5,
"sha256": "503f25d7e78a8312f92ae5ea6ebbb7c3007d5211e7d22b8c7d80877e6f7300a0",
"test_accuracy_mean": 0.8080599999999999,
"test_accuracy_population_std": 0.006041390568403929,
"test_mcc_mean": 0.7882378,
"train_accuracy_mean": 0.848588
}
},
"msrc-v2": {
"test_accuracy_delta_vi_minus_ablation": 0.0682531999999999,
"vi-ablation": {
"file": "results/msrc-v2_vi-ablation.csv",
"folds": 5,
"sha256": "9ce2cd8c7cc75399bc8ae8d118b2bd47d9eeec74f0e441747ae6c54ec5d12a3d",
"test_accuracy_mean": 0.5341086,
"test_accuracy_population_std": 0.028223971319429893,
"test_mcc_mean": 0.4919354,
"train_accuracy_mean": 0.6240064000000001
},
"vi-pll": {
"file": "results/msrc-v2_vi-pll.csv",
"folds": 5,
"sha256": "b180c8d06119e3a48ba9d38e4608fb1288c9df306711ff57a1a6eed9e00c5264",
"test_accuracy_mean": 0.6023618,
"test_accuracy_population_std": 0.024490100615554834,
"test_mcc_mean": 0.5686742,
"train_accuracy_mean": 0.734077
}
},
"yahoo-news": {
"test_accuracy_delta_vi_minus_ablation": 0.1457526,
"vi-ablation": {
"file": "results/yahoo-news_vi-ablation.csv",
"folds": 5,
"sha256": "af085e6ce5309d482b4e5b9eedb8d7bbbc6e1cbce5317e971b9f3856e942e6e0",
"test_accuracy_mean": 0.49410619999999994,
"test_accuracy_population_std": 0.005239724015632858,
"test_mcc_mean": 0.4313508,
"train_accuracy_mean": 0.5088189999999999
},
"vi-pll": {
"file": "results/yahoo-news_vi-pll.csv",
"folds": 5,
"sha256": "154865abb59741ff79c12bd220ebb7c44c0cc4fc6facfaa4c836bef15b82ec76",
"test_accuracy_mean": 0.6398588,
"test_accuracy_population_std": 0.005750534875991952,
"test_mcc_mean": 0.598954,
"train_accuracy_mean": 0.8573464
}
}
},
"official_repository": "https://github.com/mathefuchs/vi-pll",
"protocol": {
"datasets": [
"bird-song",
"lost"
],
"main_epochs": 120,
"mc_samples": 5,
"seeds": [
42,
43,
44
],
"train_cap": 5000,
"warmup_epochs": 60
},
"runs": [
{
"algorithm": "vi-pll",
"audit_trace": {
"main": [
{
"candidate_weight_entropy": 0.2708108723163605,
"epoch": 0,
"log_p_s_xy": -16.173489816727177,
"log_p_x_y": 0.2934362783787712,
"log_p_y": -2.5748081822549143,
"log_q_y_x": -2.153297983830975,
"loss": 26.181508894889586,
"pxy_model": 0.1443041766361423
},
{
"candidate_weight_entropy": 0.10281724482774734,
"epoch": 119,
"log_p_s_xy": -4.392915444989359,
"log_p_x_y": 0.5753799662474663,
"log_p_y": -2.368265901842425,
"log_q_y_x": -0.6041090344229052,
"loss": 14.207726663158786,
"pxy_model": 0.12638849899108556
}
],
"warmup": [
{
"epoch": 0,
"rmse": 0.23563429918748635
},
{
"epoch": 59,
"rmse": 0.14410038673162456
}
]
},
"candidate_constraint_max_violation": 0.0,
"classes_after_official_filter": 13,
"classifier_parameters": 16213,
"cvae_label_conditioning_probe": {
"max_pairwise_decoder_distance": 1.7622679471969604,
"mean_pairwise_decoder_distance": 0.9605048894882202
},
"cvae_parameters": 25702,
"dataset": "bird-song",
"estimated_sigma": 0.14506038849623284,
"factorization_terms_executed": [
"log Q(Y|X)",
"log P(Y)",
"log P(X|Y)",
"log P(S|X,Y)"
],
"features_after_official_filter": 38,
"full_instances": 4998,
"main_epochs_executed": 120,
"max_entropy_prior": {
"entropy": 2.4025229262129,
"max_bound_violation": 0.0,
"min_bound_violation": 0.0,
"sum_residual": 1.2027934204184021e-11
},
"mc_samples": 5,
"mean_candidate_set_size": 2.17158579826355,
"official_fold": 0,
"posterior_rowsum_max_residual": 1.1920928955078125e-07,
"runtime_seconds": 75.83538559899898,
"second_classifier_parameters": 16213,
"seed": 42,
"test_accuracy": 0.723,
"test_instances": 1000,
"test_mcc": 0.6826080665048163,
"total_trainable_parameters": 58128,
"train_accuracy": 0.863431715857929,
"train_cap": 5000,
"train_instances": 3998,
"train_mcc": 0.8442761062287867,
"true_label_in_candidate_rate": 1.0,
"warmup_epochs_executed": 60
},
{
"algorithm": "vi-ablation",
"audit_trace": [
{
"epoch": 0,
"loss": 30.44137124092348,
"posterior_entropy": 0.6166298389434814
},
{
"epoch": 119,
"loss": 8.01852886907516,
"posterior_entropy": 0.19968274235725403
}
],
"candidate_constraint_max_violation": 0.9720022678375244,
"classes_after_official_filter": 13,
"classifier_parameters": 16213,
"dataset": "bird-song",
"features_after_official_filter": 38,
"full_instances": 4998,
"main_epochs_executed": 120,
"mc_samples": 10,
"mean_candidate_set_size": 2.17158579826355,
"official_fold": 0,
"posterior_rowsum_max_residual": 3.5762786865234375e-07,
"runtime_seconds": 23.84957359100008,
"seed": 42,
"test_accuracy": 0.678,
"test_instances": 1000,
"test_mcc": 0.634686927712594,
"train_accuracy": 0.73911955977989,
"train_cap": 5000,
"train_instances": 3998,
"train_mcc": 0.7044501198372473,
"true_label_in_candidate_rate": 1.0,
"warmup_epochs_executed": 0
},
{
"algorithm": "vi-pll",
"audit_trace": {
"main": [
{
"candidate_weight_entropy": 0.2768377363681793,
"epoch": 0,
"log_p_s_xy": -16.39540793818812,
"log_p_x_y": 0.288194453524005,
"log_p_y": -2.5875435836853518,
"log_q_y_x": -2.166056042717349,
"loss": 26.467449557396673,
"pxy_model": 0.14430939603363374
},
{
"candidate_weight_entropy": 0.09859249740839005,
"epoch": 119,
"log_p_s_xy": -4.334124311324088,
"log_p_x_y": 0.581076713338975,
"log_p_y": -2.371040874911893,
"log_q_y_x": -0.5967644866435758,
"loss": 14.155870529913134,
"pxy_model": 0.1262076888750626
}
],
"warmup": [
{
"epoch": 0,
"rmse": 0.22772943046603802
},
{
"epoch": 59,
"rmse": 0.1443892883496011
}
]
},
"candidate_constraint_max_violation": 0.0,
"classes_after_official_filter": 13,
"classifier_parameters": 16213,
"cvae_label_conditioning_probe": {
"max_pairwise_decoder_distance": 1.7702217102050781,
"mean_pairwise_decoder_distance": 0.9625462293624878
},
"cvae_parameters": 25702,
"dataset": "bird-song",
"estimated_sigma": 0.1436564624245045,
"factorization_terms_executed": [
"log Q(Y|X)",
"log P(Y)",
"log P(X|Y)",
"log P(S|X,Y)"
],
"features_after_official_filter": 38,
"full_instances": 4998,
"main_epochs_executed": 120,
"max_entropy_prior": {
"entropy": 2.4025229262129,
"max_bound_violation": 0.0,
"min_bound_violation": 0.0,
"sum_residual": 1.2027934204184021e-11
},
"mc_samples": 5,
"mean_candidate_set_size": 2.17158579826355,
"official_fold": 0,
"posterior_rowsum_max_residual": 1.7881393432617188e-07,
"runtime_seconds": 77.79380788900016,
"second_classifier_parameters": 16213,
"seed": 43,
"test_accuracy": 0.719,
"test_instances": 1000,
"test_mcc": 0.6792958254388105,
"total_trainable_parameters": 58128,
"train_accuracy": 0.8699349674837419,
"train_cap": 5000,
"train_instances": 3998,
"train_mcc": 0.8517890966322198,
"true_label_in_candidate_rate": 1.0,
"warmup_epochs_executed": 60
},
{
"algorithm": "vi-ablation",
"audit_trace": [
{
"epoch": 0,
"loss": 30.814381014916204,
"posterior_entropy": 0.61581951379776
},
{
"epoch": 119,
"loss": 7.997587257815946,
"posterior_entropy": 0.19672448933124542
}
],
"candidate_constraint_max_violation": 0.9702976942062378,
"classes_after_official_filter": 13,
"classifier_parameters": 16213,
"dataset": "bird-song",
"features_after_official_filter": 38,
"full_instances": 4998,
"main_epochs_executed": 120,
"mc_samples": 10,
"mean_candidate_set_size": 2.17158579826355,
"official_fold": 0,
"posterior_rowsum_max_residual": 3.5762786865234375e-07,
"runtime_seconds": 23.00018137799998,
"seed": 43,
"test_accuracy": 0.683,
"test_instances": 1000,
"test_mcc": 0.6388721826666496,
"train_accuracy": 0.7478739369684843,
"train_cap": 5000,
"train_instances": 3998,
"train_mcc": 0.7142363575176744,
"true_label_in_candidate_rate": 1.0,
"warmup_epochs_executed": 0
},
{
"algorithm": "vi-pll",
"audit_trace": {
"main": [
{
"candidate_weight_entropy": 0.28922101855278015,
"epoch": 0,
"log_p_s_xy": -16.328172345315256,
"log_p_x_y": 0.3027941380296984,
"log_p_y": -2.581121502384063,
"log_q_y_x": -2.1572925217690004,
"loss": 26.340367963237146,
"pxy_model": 0.14431963454686322
},
{
"candidate_weight_entropy": 0.10308544337749481,
"epoch": 119,
"log_p_s_xy": -4.317468335551601,
"log_p_x_y": 0.5742396231620542,
"log_p_y": -2.3687866849284016,
"log_q_y_x": -0.6072116191348722,
"loss": 14.134589441360966,
"pxy_model": 0.12625577046383094
}
],
"warmup": [
{
"epoch": 0,
"rmse": 0.2340078299516348
},
{
"epoch": 59,
"rmse": 0.14433669468598934
}
]
},
"candidate_constraint_max_violation": 0.0,
"classes_after_official_filter": 13,
"classifier_parameters": 16213,
"cvae_label_conditioning_probe": {
"max_pairwise_decoder_distance": 1.7789095640182495,
"mean_pairwise_decoder_distance": 0.969994843006134
},
"cvae_parameters": 25702,
"dataset": "bird-song",
"estimated_sigma": 0.1464925477520259,
"factorization_terms_executed": [
"log Q(Y|X)",
"log P(Y)",
"log P(X|Y)",
"log P(S|X,Y)"
],
"features_after_official_filter": 38,
"full_instances": 4998,
"main_epochs_executed": 120,
"max_entropy_prior": {
"entropy": 2.4025229262129,
"max_bound_violation": 0.0,
"min_bound_violation": 0.0,
"sum_residual": 1.2027934204184021e-11
},
"mc_samples": 5,
"mean_candidate_set_size": 2.17158579826355,
"official_fold": 0,
"posterior_rowsum_max_residual": 1.7881393432617188e-07,
"runtime_seconds": 75.5674572909993,
"second_classifier_parameters": 16213,
"seed": 44,
"test_accuracy": 0.711,
"test_instances": 1000,
"test_mcc": 0.6707274442706338,
"total_trainable_parameters": 58128,
"train_accuracy": 0.8514257128564282,
"train_cap": 5000,
"train_instances": 3998,
"train_mcc": 0.8311559461813258,
"true_label_in_candidate_rate": 1.0,
"warmup_epochs_executed": 60
},
{
"algorithm": "vi-ablation",
"audit_trace": [
{
"epoch": 0,
"loss": 30.660704366622433,
"posterior_entropy": 0.610693633556366
},
{
"epoch": 119,
"loss": 7.786863526990337,
"posterior_entropy": 0.19398967921733856
}
],
"candidate_constraint_max_violation": 0.970436155796051,
"classes_after_official_filter": 13,
"classifier_parameters": 16213,
"dataset": "bird-song",
"features_after_official_filter": 38,
"full_instances": 4998,
"main_epochs_executed": 120,
"mc_samples": 10,
"mean_candidate_set_size": 2.17158579826355,
"official_fold": 0,
"posterior_rowsum_max_residual": 4.172325134277344e-07,
"runtime_seconds": 23.32986260400139,
"seed": 44,
"test_accuracy": 0.673,
"test_instances": 1000,
"test_mcc": 0.6280691416621966,
"train_accuracy": 0.7368684342171086,
"train_cap": 5000,
"train_instances": 3998,
"train_mcc": 0.7010679694817208,
"true_label_in_candidate_rate": 1.0,
"warmup_epochs_executed": 0
},
{
"algorithm": "vi-pll",
"audit_trace": {
"main": [
{
"candidate_weight_entropy": 0.15046530961990356,
"epoch": 0,
"log_p_s_xy": -19.270621708461217,
"log_p_x_y": 0.6419406448091779,
"log_p_y": -2.6742364849363054,
"log_q_y_x": -2.3874726125172208,
"loss": -15.19903836931501,
"pxy_model": 0.12173546624446008
},
{
"candidate_weight_entropy": 0.14434659481048584,
"epoch": 119,
"log_p_s_xy": -3.900912914957319,
"log_p_x_y": 0.6794598272868565,
"log_p_y": -2.5575463260923113,
"log_q_y_x": -0.8986693024635315,
"loss": -30.95614733014788,
"pxy_model": 0.12076304395414368
}
],
"warmup": [
{
"epoch": 0,
"rmse": 0.13617287380058787
},
{
"epoch": 59,
"rmse": 0.12180864659672788
}
]
},
"candidate_constraint_max_violation": 0.0,
"classes_after_official_filter": 14,
"classifier_parameters": 37514,
"cvae_label_conditioning_probe": {
"max_pairwise_decoder_distance": 0.6741830706596375,
"mean_pairwise_decoder_distance": 0.5169421434402466
},
"cvae_parameters": 43948,
"dataset": "lost",
"estimated_sigma": 0.12118840773035228,
"factorization_terms_executed": [
"log Q(Y|X)",
"log P(Y)",
"log P(X|Y)",
"log P(S|X,Y)"
],
"features_after_official_filter": 108,
"full_instances": 1122,
"main_epochs_executed": 120,
"max_entropy_prior": {
"entropy": 2.608857796452674,
"max_bound_violation": 0.0,
"min_bound_violation": 0.0,
"sum_residual": 1.1102230246251565e-16
},
"mc_samples": 5,
"mean_candidate_set_size": 2.218506097793579,
"official_fold": 0,
"posterior_rowsum_max_residual": 1.1920928955078125e-07,
"runtime_seconds": 21.29557384099826,
"second_classifier_parameters": 37514,
"seed": 42,
"test_accuracy": 0.7866666666666666,
"test_instances": 225,
"test_mcc": 0.7587857130444665,
"total_trainable_parameters": 118976,
"train_accuracy": 0.9096989966555183,
"train_cap": 5000,
"train_instances": 897,
"train_mcc": 0.8984177459761418,
"true_label_in_candidate_rate": 1.0,
"warmup_epochs_executed": 60
},
{
"algorithm": "vi-ablation",
"audit_trace": [
{
"epoch": 0,
"loss": 36.31639562334333,
"posterior_entropy": 0.7571771144866943
},
{
"epoch": 119,
"loss": 6.836584057126727,
"posterior_entropy": 0.3071111738681793
}
],
"candidate_constraint_max_violation": 0.8402968049049377,
"classes_after_official_filter": 14,
"classifier_parameters": 37514,
"dataset": "lost",
"features_after_official_filter": 108,
"full_instances": 1122,
"main_epochs_executed": 120,
"mc_samples": 10,
"mean_candidate_set_size": 2.218506097793579,
"official_fold": 0,
"posterior_rowsum_max_residual": 3.5762786865234375e-07,
"runtime_seconds": 5.929461564999656,
"seed": 42,
"test_accuracy": 0.7422222222222222,
"test_instances": 225,
"test_mcc": 0.7082425084809693,
"train_accuracy": 0.8617614269788183,
"train_cap": 5000,
"train_instances": 897,
"train_mcc": 0.8438786667189287,
"true_label_in_candidate_rate": 1.0,
"warmup_epochs_executed": 0
},
{
"algorithm": "vi-pll",
"audit_trace": {
"main": [
{
"candidate_weight_entropy": 0.16198872029781342,
"epoch": 0,
"log_p_s_xy": -19.22972297668457,
"log_p_x_y": 0.6386122192655291,
"log_p_y": -2.673332231385367,
"log_q_y_x": -2.385913065501622,
"loss": -15.071918215070452,
"pxy_model": 0.12183219179456341
},
{
"candidate_weight_entropy": 0.14957979321479797,
"epoch": 119,
"log_p_s_xy": -4.004478795187814,
"log_p_x_y": 0.6767580807209015,
"log_p_y": -2.5565474033355713,
"log_q_y_x": -0.9191818194729942,
"loss": -30.73798656463623,
"pxy_model": 0.12069734300549294
}
],
"warmup": [
{
"epoch": 0,
"rmse": 0.1360717764413006
},
{
"epoch": 59,
"rmse": 0.12189789056578378
}
]
},
"candidate_constraint_max_violation": 0.0,
"classes_after_official_filter": 14,
"classifier_parameters": 37514,
"cvae_label_conditioning_probe": {
"max_pairwise_decoder_distance": 0.7016123533248901,
"mean_pairwise_decoder_distance": 0.5112101435661316
},
"cvae_parameters": 43948,
"dataset": "lost",
"estimated_sigma": 0.11756013757205908,
"factorization_terms_executed": [
"log Q(Y|X)",
"log P(Y)",
"log P(X|Y)",
"log P(S|X,Y)"
],
"features_after_official_filter": 108,
"full_instances": 1122,
"main_epochs_executed": 120,
"max_entropy_prior": {
"entropy": 2.608857796452674,
"max_bound_violation": 0.0,
"min_bound_violation": 0.0,
"sum_residual": 1.1102230246251565e-16
},
"mc_samples": 5,
"mean_candidate_set_size": 2.218506097793579,
"official_fold": 0,
"posterior_rowsum_max_residual": 1.1920928955078125e-07,
"runtime_seconds": 23.520829045999562,
"second_classifier_parameters": 37514,
"seed": 43,
"test_accuracy": 0.8044444444444444,
"test_instances": 225,
"test_mcc": 0.7793682729730292,
"total_trainable_parameters": 118976,
"train_accuracy": 0.903010033444816,
"train_cap": 5000,
"train_instances": 897,
"train_mcc": 0.8906299650249241,
"true_label_in_candidate_rate": 1.0,
"warmup_epochs_executed": 60
},
{
"algorithm": "vi-ablation",
"audit_trace": [
{
"epoch": 0,
"loss": 36.30288124084473,
"posterior_entropy": 0.7567180395126343
},
{
"epoch": 119,
"loss": 6.661709308624268,
"posterior_entropy": 0.30992892384529114
}
],
"candidate_constraint_max_violation": 0.8136563897132874,
"classes_after_official_filter": 14,
"classifier_parameters": 37514,
"dataset": "lost",
"features_after_official_filter": 108,
"full_instances": 1122,
"main_epochs_executed": 120,
"mc_samples": 10,
"mean_candidate_set_size": 2.218506097793579,
"official_fold": 0,
"posterior_rowsum_max_residual": 4.76837158203125e-07,
"runtime_seconds": 6.960834924000665,
"seed": 43,
"test_accuracy": 0.7288888888888889,
"test_instances": 225,
"test_mcc": 0.6958009330671128,
"train_accuracy": 0.855072463768116,
"train_cap": 5000,
"train_instances": 897,
"train_mcc": 0.8367646264212416,
"true_label_in_candidate_rate": 1.0,
"warmup_epochs_executed": 0
},
{
"algorithm": "vi-pll",
"audit_trace": {
"main": [
{
"candidate_weight_entropy": 0.16210441291332245,
"epoch": 0,
"log_p_s_xy": -19.23987020765032,
"log_p_x_y": 0.6429869490010398,
"log_p_y": -2.672427569116865,
"log_q_y_x": -2.38821804523468,
"loss": -15.282821655273438,
"pxy_model": 0.1218777564954407
},
{
"candidate_weight_entropy": 0.1467060148715973,
"epoch": 119,
"log_p_s_xy": -4.055566651480539,
"log_p_x_y": 0.6794576006276267,
"log_p_y": -2.556765386036464,
"log_q_y_x": -0.9188610655920846,
"loss": -30.82157584599086,
"pxy_model": 0.12074240149111233
}
],
"warmup": [
{
"epoch": 0,
"rmse": 0.13782092395532877
},
{
"epoch": 59,
"rmse": 0.12190104501576896
}
]
},
"candidate_constraint_max_violation": 0.0,
"classes_after_official_filter": 14,
"classifier_parameters": 37514,
"cvae_label_conditioning_probe": {
"max_pairwise_decoder_distance": 0.7064527273178101,
"mean_pairwise_decoder_distance": 0.5155908465385437
},
"cvae_parameters": 43948,
"dataset": "lost",
"estimated_sigma": 0.12315943971947536,
"factorization_terms_executed": [
"log Q(Y|X)",
"log P(Y)",
"log P(X|Y)",
"log P(S|X,Y)"
],
"features_after_official_filter": 108,
"full_instances": 1122,
"main_epochs_executed": 120,
"max_entropy_prior": {
"entropy": 2.608857796452674,
"max_bound_violation": 0.0,
"min_bound_violation": 0.0,
"sum_residual": 1.1102230246251565e-16
},
"mc_samples": 5,
"mean_candidate_set_size": 2.218506097793579,
"official_fold": 0,
"posterior_rowsum_max_residual": 1.1920928955078125e-07,
"runtime_seconds": 26.15351639599976,
"second_classifier_parameters": 37514,
"seed": 44,
"test_accuracy": 0.8088888888888889,
"test_instances": 225,
"test_mcc": 0.784477934804284,
"total_trainable_parameters": 118976,
"train_accuracy": 0.9085841694537347,
"train_cap": 5000,
"train_instances": 897,
"train_mcc": 0.8970442211588884,
"true_label_in_candidate_rate": 1.0,
"warmup_epochs_executed": 60
},
{
"algorithm": "vi-ablation",
"audit_trace": [
{
"epoch": 0,
"loss": 36.23127365112305,
"posterior_entropy": 0.7565066814422607
},
{
"epoch": 119,
"loss": 7.287430627005441,
"posterior_entropy": 0.30685684084892273
}
],
"candidate_constraint_max_violation": 0.8275954723358154,
"classes_after_official_filter": 14,
"classifier_parameters": 37514,
"dataset": "lost",
"features_after_official_filter": 108,
"full_instances": 1122,
"main_epochs_executed": 120,
"mc_samples": 10,
"mean_candidate_set_size": 2.218506097793579,
"official_fold": 0,
"posterior_rowsum_max_residual": 4.172325134277344e-07,
"runtime_seconds": 7.156720177998068,
"seed": 44,
"test_accuracy": 0.7777777777777778,
"test_instances": 225,
"test_mcc": 0.7499112288128404,
"train_accuracy": 0.8494983277591973,
"train_cap": 5000,
"train_instances": 897,
"train_mcc": 0.8304056931793165,
"true_label_in_candidate_rate": 1.0,
"warmup_epochs_executed": 0
}
],
"runtime_seconds": 390.83336939700166
}