{ "by_dataset": { "bird-song": { "official_five_fold_ablation_mean": 0.7224853999999999, "official_five_fold_accuracy_delta": 0.03901739999999998, "official_five_fold_vi_pll_mean": 0.7615027999999999, "shortened_ablation_mean_test_accuracy": 0.678, "shortened_accuracy_delta": 0.03966666666666663, "shortened_vi_pll_mean_test_accuracy": 0.7176666666666667 }, "lost": { "official_five_fold_ablation_mean": 0.7700237999999999, "official_five_fold_accuracy_delta": 0.015138600000000113, "official_five_fold_vi_pll_mean": 0.7851624, "shortened_ablation_mean_test_accuracy": 0.7496296296296295, "shortened_accuracy_delta": 0.0503703703703704, "shortened_vi_pll_mean_test_accuracy": 0.7999999999999999 } }, "campaign": "official-code real-data bounded reproduction v2", "default_schedule_unchanged": { "main_loop_iterations": 1001, "paper_reported_epochs": [ 500, 1000 ], "warmup_loop_iterations": 501 }, "environment": { "device": "cpu", "numpy": "1.26.4", "platform": "Linux-6.18.33.2-microsoft-standard-WSL2-x86_64-with-glibc2.39", "python": "3.12.13", "scipy": "1.16.3", "sklearn": "1.5.1", "torch": "2.13.0+cpu", "torch_threads": 8 }, "instrumentation_patch_sha256": "e8f17ae7d85dfbeaea52a22ff8957ea92722b7f30d356219120dca6475c0d756", "max_rss_mib": 484.05078125, "official_commit": "dc0adebd2466cb862879ba309b30e66a37b10473", "official_released_csv_audit": { "bird-song": { "test_accuracy_delta_vi_minus_ablation": 0.03901739999999998, "vi-ablation": { "file": "results/bird-song_vi-ablation.csv", "folds": 5, "sha256": "504ae9ac414a72c8c45b7d3f932158fc922a74a4caa91629c7939244d078c9f3", "test_accuracy_mean": 0.7224853999999999, "test_accuracy_population_std": 0.015510104082178169, "test_mcc_mean": 0.6802716, "train_accuracy_mean": 0.7858154 }, "vi-pll": { "file": "results/bird-song_vi-pll.csv", "folds": 5, "sha256": "e560ac9cf02970bdb0b7fd9d7fcdd967aae5d7d205f87955a41e1babb54b60fe", "test_accuracy_mean": 0.7615027999999999, "test_accuracy_population_std": 0.015580385481752381, "test_mcc_mean": 0.725596, "train_accuracy_mean": 0.867097 } }, "cifar10": { "test_accuracy_delta_vi_minus_ablation": 0.08213999999999999, "vi-ablation": { "file": "results/cifar10_vi-ablation.csv", "folds": 5, "sha256": "a00bcb60d62c2f4dfca30f7af77847afd217c592241a38413374fb8bf698056c", "test_accuracy_mean": 0.8842800000000001, "test_accuracy_population_std": 0.0013585286158193175, "test_mcc_mean": 0.8820615999999999, "train_accuracy_mean": 0.9821626 }, "vi-pll": { "file": "results/cifar10_vi-pll.csv", "folds": 5, "sha256": "4801b6aa5b684b1ab717e7dadf7ce19a1b3edd160f29960a3ffc307320034ef0", "test_accuracy_mean": 0.9664200000000001, "test_accuracy_population_std": 0.03916526011658802, "test_mcc_mean": 0.9642268000000002, "train_accuracy_mean": 0.9914476000000001 } }, "cifar100": { "test_accuracy_delta_vi_minus_ablation": 0.3202399999999999, "vi-ablation": { "file": "results/cifar100_vi-ablation.csv", "folds": 5, "sha256": "2f32c9a8d3b09c5916698a5753e2957afe56dd0f2a92bd0221b326b0af2d313c", "test_accuracy_mean": 0.4574, "test_accuracy_population_std": 0.02485855989392788, "test_mcc_mean": 0.45415219999999995, "train_accuracy_mean": 0.8434963999999999 }, "vi-pll": { "file": "results/cifar100_vi-pll.csv", "folds": 5, "sha256": "470eafb37c06988e80afcf5f49e751f226082a79ee854a8c81ef0ccaf3f30cd1", "test_accuracy_mean": 0.7776399999999999, "test_accuracy_population_std": 0.005073696877031549, "test_mcc_mean": 0.7761578, "train_accuracy_mean": 0.9632153999999999 } }, "fmnist": { "test_accuracy_delta_vi_minus_ablation": 0.07510000000000006, "vi-ablation": { "file": "results/fmnist_vi-ablation.csv", "folds": 5, "sha256": "2b516cb473e730ea9898e6aa947d7acfcdf9584dcf97455eb97a0ca557bc2403", "test_accuracy_mean": 0.67364, "test_accuracy_population_std": 0.006577111828150716, "test_mcc_mean": 0.6546687999999999, "train_accuracy_mean": 0.9082718 }, "vi-pll": { "file": "results/fmnist_vi-pll.csv", "folds": 5, "sha256": "692d8691cd94c7f7b35227724fa4b4f1bd906842f0a6b203bed23dc62172ee89", "test_accuracy_mean": 0.7487400000000001, "test_accuracy_population_std": 0.009289262618744295, "test_mcc_mean": 0.7257798000000001, "train_accuracy_mean": 0.9207942000000001 } }, "kmnist": { "test_accuracy_delta_vi_minus_ablation": 0.18367999999999995, "vi-ablation": { "file": "results/kmnist_vi-ablation.csv", "folds": 5, "sha256": "0deaac66d893a09f864d357a01189819bd6aabcb5199a165933cb194e466458e", "test_accuracy_mean": 0.40414000000000005, "test_accuracy_population_std": 0.007038920371761569, "test_mcc_mean": 0.3671206, "train_accuracy_mean": 0.780351 }, "vi-pll": { "file": "results/kmnist_vi-pll.csv", "folds": 5, "sha256": "07d38755af2513e47b768bc68664f1f87aa2c70bf8572786b29a8c038a91fe5f", "test_accuracy_mean": 0.58782, "test_accuracy_population_std": 0.013390205375572095, "test_mcc_mean": 0.549998, "train_accuracy_mean": 0.9051665999999999 } }, "lost": { "test_accuracy_delta_vi_minus_ablation": 0.015138600000000113, "vi-ablation": { "file": "results/lost_vi-ablation.csv", "folds": 5, "sha256": "dc122e19283334f495806b65b6869413dccff9fa0727114aac71fb7b4d1d3a25", "test_accuracy_mean": 0.7700237999999999, "test_accuracy_population_std": 0.022041438305156032, "test_mcc_mean": 0.7412328, "train_accuracy_mean": 0.9017383999999999 }, "vi-pll": { "file": "results/lost_vi-pll.csv", "folds": 5, "sha256": "9b5e1f419946a5fb7a55d4c3eae0872460c6906b9fc157da8c196075573deb73", "test_accuracy_mean": 0.7851624, "test_accuracy_population_std": 0.022658168474967252, "test_mcc_mean": 0.7592215999999999, "train_accuracy_mean": 0.9251394 } }, "mir-flickr": { "test_accuracy_delta_vi_minus_ablation": 0.03237419999999991, "vi-ablation": { "file": "results/mir-flickr_vi-ablation.csv", "folds": 5, "sha256": "b7ab3b15bbfb73ea8b40e55da9100bda92c14669b6cfcf8c22381aced0592124", "test_accuracy_mean": 0.6525178, "test_accuracy_population_std": 0.028378408295040073, "test_mcc_mean": 0.5886464, "train_accuracy_mean": 0.6952338 }, "vi-pll": { "file": "results/mir-flickr_vi-pll.csv", "folds": 5, "sha256": "025b01750ff7ad490684671f38d9e2ea13558b455f3b9a823b6bbce5e680f558", "test_accuracy_mean": 0.684892, "test_accuracy_population_std": 0.021262655713715547, "test_mcc_mean": 0.6256385999999999, "train_accuracy_mean": 0.7312048 } }, "mnist": { "test_accuracy_delta_vi_minus_ablation": 0.2787599999999999, "vi-ablation": { "file": "results/mnist_vi-ablation.csv", "folds": 5, "sha256": "136646ab76148a9066fec1fbfb743299caee5fddc7dea9df9c5892ef485b6fde", "test_accuracy_mean": 0.5293, "test_accuracy_population_std": 0.01757885092945496, "test_mcc_mean": 0.5119868000000001, "train_accuracy_mean": 0.7570106000000001 }, "vi-pll": { "file": "results/mnist_vi-pll.csv", "folds": 5, "sha256": "503f25d7e78a8312f92ae5ea6ebbb7c3007d5211e7d22b8c7d80877e6f7300a0", "test_accuracy_mean": 0.8080599999999999, "test_accuracy_population_std": 0.006041390568403929, "test_mcc_mean": 0.7882378, "train_accuracy_mean": 0.848588 } }, "msrc-v2": { "test_accuracy_delta_vi_minus_ablation": 0.0682531999999999, "vi-ablation": { "file": "results/msrc-v2_vi-ablation.csv", "folds": 5, "sha256": "9ce2cd8c7cc75399bc8ae8d118b2bd47d9eeec74f0e441747ae6c54ec5d12a3d", "test_accuracy_mean": 0.5341086, "test_accuracy_population_std": 0.028223971319429893, "test_mcc_mean": 0.4919354, "train_accuracy_mean": 0.6240064000000001 }, "vi-pll": { "file": "results/msrc-v2_vi-pll.csv", "folds": 5, "sha256": "b180c8d06119e3a48ba9d38e4608fb1288c9df306711ff57a1a6eed9e00c5264", "test_accuracy_mean": 0.6023618, "test_accuracy_population_std": 0.024490100615554834, "test_mcc_mean": 0.5686742, "train_accuracy_mean": 0.734077 } }, "yahoo-news": { "test_accuracy_delta_vi_minus_ablation": 0.1457526, "vi-ablation": { "file": "results/yahoo-news_vi-ablation.csv", "folds": 5, "sha256": "af085e6ce5309d482b4e5b9eedb8d7bbbc6e1cbce5317e971b9f3856e942e6e0", "test_accuracy_mean": 0.49410619999999994, "test_accuracy_population_std": 0.005239724015632858, "test_mcc_mean": 0.4313508, "train_accuracy_mean": 0.5088189999999999 }, "vi-pll": { "file": "results/yahoo-news_vi-pll.csv", "folds": 5, "sha256": "154865abb59741ff79c12bd220ebb7c44c0cc4fc6facfaa4c836bef15b82ec76", "test_accuracy_mean": 0.6398588, "test_accuracy_population_std": 0.005750534875991952, "test_mcc_mean": 0.598954, "train_accuracy_mean": 0.8573464 } } }, "official_repository": "https://github.com/mathefuchs/vi-pll", "protocol": { "datasets": [ "bird-song", "lost" ], "main_epochs": 120, "mc_samples": 5, "seeds": [ 42, 43, 44 ], "train_cap": 5000, "warmup_epochs": 60 }, "runs": [ { "algorithm": "vi-pll", "audit_trace": { "main": [ { "candidate_weight_entropy": 0.2708108723163605, "epoch": 0, "log_p_s_xy": -16.173489816727177, "log_p_x_y": 0.2934362783787712, "log_p_y": -2.5748081822549143, "log_q_y_x": -2.153297983830975, "loss": 26.181508894889586, "pxy_model": 0.1443041766361423 }, { "candidate_weight_entropy": 0.10281724482774734, "epoch": 119, "log_p_s_xy": -4.392915444989359, "log_p_x_y": 0.5753799662474663, "log_p_y": -2.368265901842425, "log_q_y_x": -0.6041090344229052, "loss": 14.207726663158786, "pxy_model": 0.12638849899108556 } ], "warmup": [ { "epoch": 0, "rmse": 0.23563429918748635 }, { "epoch": 59, "rmse": 0.14410038673162456 } ] }, "candidate_constraint_max_violation": 0.0, "classes_after_official_filter": 13, "classifier_parameters": 16213, "cvae_label_conditioning_probe": { "max_pairwise_decoder_distance": 1.7622679471969604, "mean_pairwise_decoder_distance": 0.9605048894882202 }, "cvae_parameters": 25702, "dataset": "bird-song", "estimated_sigma": 0.14506038849623284, "factorization_terms_executed": [ "log Q(Y|X)", "log P(Y)", "log P(X|Y)", "log P(S|X,Y)" ], "features_after_official_filter": 38, "full_instances": 4998, "main_epochs_executed": 120, "max_entropy_prior": { "entropy": 2.4025229262129, "max_bound_violation": 0.0, "min_bound_violation": 0.0, "sum_residual": 1.2027934204184021e-11 }, "mc_samples": 5, "mean_candidate_set_size": 2.17158579826355, "official_fold": 0, "posterior_rowsum_max_residual": 1.1920928955078125e-07, "runtime_seconds": 75.83538559899898, "second_classifier_parameters": 16213, "seed": 42, "test_accuracy": 0.723, "test_instances": 1000, "test_mcc": 0.6826080665048163, "total_trainable_parameters": 58128, "train_accuracy": 0.863431715857929, "train_cap": 5000, "train_instances": 3998, "train_mcc": 0.8442761062287867, "true_label_in_candidate_rate": 1.0, "warmup_epochs_executed": 60 }, { "algorithm": "vi-ablation", "audit_trace": [ { "epoch": 0, "loss": 30.44137124092348, "posterior_entropy": 0.6166298389434814 }, { "epoch": 119, "loss": 8.01852886907516, "posterior_entropy": 0.19968274235725403 } ], "candidate_constraint_max_violation": 0.9720022678375244, "classes_after_official_filter": 13, "classifier_parameters": 16213, "dataset": "bird-song", "features_after_official_filter": 38, "full_instances": 4998, "main_epochs_executed": 120, "mc_samples": 10, "mean_candidate_set_size": 2.17158579826355, "official_fold": 0, "posterior_rowsum_max_residual": 3.5762786865234375e-07, "runtime_seconds": 23.84957359100008, "seed": 42, "test_accuracy": 0.678, "test_instances": 1000, "test_mcc": 0.634686927712594, "train_accuracy": 0.73911955977989, "train_cap": 5000, "train_instances": 3998, "train_mcc": 0.7044501198372473, "true_label_in_candidate_rate": 1.0, "warmup_epochs_executed": 0 }, { "algorithm": "vi-pll", "audit_trace": { "main": [ { "candidate_weight_entropy": 0.2768377363681793, "epoch": 0, "log_p_s_xy": -16.39540793818812, "log_p_x_y": 0.288194453524005, "log_p_y": -2.5875435836853518, "log_q_y_x": -2.166056042717349, "loss": 26.467449557396673, "pxy_model": 0.14430939603363374 }, { "candidate_weight_entropy": 0.09859249740839005, "epoch": 119, "log_p_s_xy": -4.334124311324088, "log_p_x_y": 0.581076713338975, "log_p_y": -2.371040874911893, "log_q_y_x": -0.5967644866435758, "loss": 14.155870529913134, "pxy_model": 0.1262076888750626 } ], "warmup": [ { "epoch": 0, "rmse": 0.22772943046603802 }, { "epoch": 59, "rmse": 0.1443892883496011 } ] }, "candidate_constraint_max_violation": 0.0, "classes_after_official_filter": 13, "classifier_parameters": 16213, "cvae_label_conditioning_probe": { "max_pairwise_decoder_distance": 1.7702217102050781, "mean_pairwise_decoder_distance": 0.9625462293624878 }, "cvae_parameters": 25702, "dataset": "bird-song", "estimated_sigma": 0.1436564624245045, "factorization_terms_executed": [ "log Q(Y|X)", "log P(Y)", "log P(X|Y)", "log P(S|X,Y)" ], "features_after_official_filter": 38, "full_instances": 4998, "main_epochs_executed": 120, "max_entropy_prior": { "entropy": 2.4025229262129, "max_bound_violation": 0.0, "min_bound_violation": 0.0, "sum_residual": 1.2027934204184021e-11 }, "mc_samples": 5, "mean_candidate_set_size": 2.17158579826355, "official_fold": 0, "posterior_rowsum_max_residual": 1.7881393432617188e-07, "runtime_seconds": 77.79380788900016, "second_classifier_parameters": 16213, "seed": 43, "test_accuracy": 0.719, "test_instances": 1000, "test_mcc": 0.6792958254388105, "total_trainable_parameters": 58128, "train_accuracy": 0.8699349674837419, "train_cap": 5000, "train_instances": 3998, "train_mcc": 0.8517890966322198, "true_label_in_candidate_rate": 1.0, "warmup_epochs_executed": 60 }, { "algorithm": "vi-ablation", "audit_trace": [ { "epoch": 0, "loss": 30.814381014916204, "posterior_entropy": 0.61581951379776 }, { "epoch": 119, "loss": 7.997587257815946, "posterior_entropy": 0.19672448933124542 } ], "candidate_constraint_max_violation": 0.9702976942062378, "classes_after_official_filter": 13, "classifier_parameters": 16213, "dataset": "bird-song", "features_after_official_filter": 38, "full_instances": 4998, "main_epochs_executed": 120, "mc_samples": 10, "mean_candidate_set_size": 2.17158579826355, "official_fold": 0, "posterior_rowsum_max_residual": 3.5762786865234375e-07, "runtime_seconds": 23.00018137799998, "seed": 43, "test_accuracy": 0.683, "test_instances": 1000, "test_mcc": 0.6388721826666496, "train_accuracy": 0.7478739369684843, "train_cap": 5000, "train_instances": 3998, "train_mcc": 0.7142363575176744, "true_label_in_candidate_rate": 1.0, "warmup_epochs_executed": 0 }, { "algorithm": "vi-pll", "audit_trace": { "main": [ { "candidate_weight_entropy": 0.28922101855278015, "epoch": 0, "log_p_s_xy": -16.328172345315256, "log_p_x_y": 0.3027941380296984, "log_p_y": -2.581121502384063, "log_q_y_x": -2.1572925217690004, "loss": 26.340367963237146, "pxy_model": 0.14431963454686322 }, { "candidate_weight_entropy": 0.10308544337749481, "epoch": 119, "log_p_s_xy": -4.317468335551601, "log_p_x_y": 0.5742396231620542, "log_p_y": -2.3687866849284016, "log_q_y_x": -0.6072116191348722, "loss": 14.134589441360966, "pxy_model": 0.12625577046383094 } ], "warmup": [ { "epoch": 0, "rmse": 0.2340078299516348 }, { "epoch": 59, "rmse": 0.14433669468598934 } ] }, "candidate_constraint_max_violation": 0.0, "classes_after_official_filter": 13, "classifier_parameters": 16213, "cvae_label_conditioning_probe": { "max_pairwise_decoder_distance": 1.7789095640182495, "mean_pairwise_decoder_distance": 0.969994843006134 }, "cvae_parameters": 25702, "dataset": "bird-song", "estimated_sigma": 0.1464925477520259, "factorization_terms_executed": [ "log Q(Y|X)", "log P(Y)", "log P(X|Y)", "log P(S|X,Y)" ], "features_after_official_filter": 38, "full_instances": 4998, "main_epochs_executed": 120, "max_entropy_prior": { "entropy": 2.4025229262129, "max_bound_violation": 0.0, "min_bound_violation": 0.0, "sum_residual": 1.2027934204184021e-11 }, "mc_samples": 5, "mean_candidate_set_size": 2.17158579826355, "official_fold": 0, "posterior_rowsum_max_residual": 1.7881393432617188e-07, "runtime_seconds": 75.5674572909993, "second_classifier_parameters": 16213, "seed": 44, "test_accuracy": 0.711, "test_instances": 1000, "test_mcc": 0.6707274442706338, "total_trainable_parameters": 58128, "train_accuracy": 0.8514257128564282, "train_cap": 5000, "train_instances": 3998, "train_mcc": 0.8311559461813258, "true_label_in_candidate_rate": 1.0, "warmup_epochs_executed": 60 }, { "algorithm": "vi-ablation", "audit_trace": [ { "epoch": 0, "loss": 30.660704366622433, "posterior_entropy": 0.610693633556366 }, { "epoch": 119, "loss": 7.786863526990337, "posterior_entropy": 0.19398967921733856 } ], "candidate_constraint_max_violation": 0.970436155796051, "classes_after_official_filter": 13, "classifier_parameters": 16213, "dataset": "bird-song", "features_after_official_filter": 38, "full_instances": 4998, "main_epochs_executed": 120, "mc_samples": 10, "mean_candidate_set_size": 2.17158579826355, "official_fold": 0, "posterior_rowsum_max_residual": 4.172325134277344e-07, "runtime_seconds": 23.32986260400139, "seed": 44, "test_accuracy": 0.673, "test_instances": 1000, "test_mcc": 0.6280691416621966, "train_accuracy": 0.7368684342171086, "train_cap": 5000, "train_instances": 3998, "train_mcc": 0.7010679694817208, "true_label_in_candidate_rate": 1.0, "warmup_epochs_executed": 0 }, { "algorithm": "vi-pll", "audit_trace": { "main": [ { "candidate_weight_entropy": 0.15046530961990356, "epoch": 0, "log_p_s_xy": -19.270621708461217, "log_p_x_y": 0.6419406448091779, "log_p_y": -2.6742364849363054, "log_q_y_x": -2.3874726125172208, "loss": -15.19903836931501, "pxy_model": 0.12173546624446008 }, { "candidate_weight_entropy": 0.14434659481048584, "epoch": 119, "log_p_s_xy": -3.900912914957319, "log_p_x_y": 0.6794598272868565, "log_p_y": -2.5575463260923113, "log_q_y_x": -0.8986693024635315, "loss": -30.95614733014788, "pxy_model": 0.12076304395414368 } ], "warmup": [ { "epoch": 0, "rmse": 0.13617287380058787 }, { "epoch": 59, "rmse": 0.12180864659672788 } ] }, "candidate_constraint_max_violation": 0.0, "classes_after_official_filter": 14, "classifier_parameters": 37514, "cvae_label_conditioning_probe": { "max_pairwise_decoder_distance": 0.6741830706596375, "mean_pairwise_decoder_distance": 0.5169421434402466 }, "cvae_parameters": 43948, "dataset": "lost", "estimated_sigma": 0.12118840773035228, "factorization_terms_executed": [ "log Q(Y|X)", "log P(Y)", "log P(X|Y)", "log P(S|X,Y)" ], "features_after_official_filter": 108, "full_instances": 1122, "main_epochs_executed": 120, "max_entropy_prior": { "entropy": 2.608857796452674, "max_bound_violation": 0.0, "min_bound_violation": 0.0, "sum_residual": 1.1102230246251565e-16 }, "mc_samples": 5, "mean_candidate_set_size": 2.218506097793579, "official_fold": 0, "posterior_rowsum_max_residual": 1.1920928955078125e-07, "runtime_seconds": 21.29557384099826, "second_classifier_parameters": 37514, "seed": 42, "test_accuracy": 0.7866666666666666, "test_instances": 225, "test_mcc": 0.7587857130444665, "total_trainable_parameters": 118976, "train_accuracy": 0.9096989966555183, "train_cap": 5000, "train_instances": 897, "train_mcc": 0.8984177459761418, "true_label_in_candidate_rate": 1.0, "warmup_epochs_executed": 60 }, { "algorithm": "vi-ablation", "audit_trace": [ { "epoch": 0, "loss": 36.31639562334333, "posterior_entropy": 0.7571771144866943 }, { "epoch": 119, "loss": 6.836584057126727, "posterior_entropy": 0.3071111738681793 } ], "candidate_constraint_max_violation": 0.8402968049049377, "classes_after_official_filter": 14, "classifier_parameters": 37514, "dataset": "lost", "features_after_official_filter": 108, "full_instances": 1122, "main_epochs_executed": 120, "mc_samples": 10, "mean_candidate_set_size": 2.218506097793579, "official_fold": 0, "posterior_rowsum_max_residual": 3.5762786865234375e-07, "runtime_seconds": 5.929461564999656, "seed": 42, "test_accuracy": 0.7422222222222222, "test_instances": 225, "test_mcc": 0.7082425084809693, "train_accuracy": 0.8617614269788183, "train_cap": 5000, "train_instances": 897, "train_mcc": 0.8438786667189287, "true_label_in_candidate_rate": 1.0, "warmup_epochs_executed": 0 }, { "algorithm": "vi-pll", "audit_trace": { "main": [ { "candidate_weight_entropy": 0.16198872029781342, "epoch": 0, "log_p_s_xy": -19.22972297668457, "log_p_x_y": 0.6386122192655291, "log_p_y": -2.673332231385367, "log_q_y_x": -2.385913065501622, "loss": -15.071918215070452, "pxy_model": 0.12183219179456341 }, { "candidate_weight_entropy": 0.14957979321479797, "epoch": 119, "log_p_s_xy": -4.004478795187814, "log_p_x_y": 0.6767580807209015, "log_p_y": -2.5565474033355713, "log_q_y_x": -0.9191818194729942, "loss": -30.73798656463623, "pxy_model": 0.12069734300549294 } ], "warmup": [ { "epoch": 0, "rmse": 0.1360717764413006 }, { "epoch": 59, "rmse": 0.12189789056578378 } ] }, "candidate_constraint_max_violation": 0.0, "classes_after_official_filter": 14, "classifier_parameters": 37514, "cvae_label_conditioning_probe": { "max_pairwise_decoder_distance": 0.7016123533248901, "mean_pairwise_decoder_distance": 0.5112101435661316 }, "cvae_parameters": 43948, "dataset": "lost", "estimated_sigma": 0.11756013757205908, "factorization_terms_executed": [ "log Q(Y|X)", "log P(Y)", "log P(X|Y)", "log P(S|X,Y)" ], "features_after_official_filter": 108, "full_instances": 1122, "main_epochs_executed": 120, "max_entropy_prior": { "entropy": 2.608857796452674, "max_bound_violation": 0.0, "min_bound_violation": 0.0, "sum_residual": 1.1102230246251565e-16 }, "mc_samples": 5, "mean_candidate_set_size": 2.218506097793579, "official_fold": 0, "posterior_rowsum_max_residual": 1.1920928955078125e-07, "runtime_seconds": 23.520829045999562, "second_classifier_parameters": 37514, "seed": 43, "test_accuracy": 0.8044444444444444, "test_instances": 225, "test_mcc": 0.7793682729730292, "total_trainable_parameters": 118976, "train_accuracy": 0.903010033444816, "train_cap": 5000, "train_instances": 897, "train_mcc": 0.8906299650249241, "true_label_in_candidate_rate": 1.0, "warmup_epochs_executed": 60 }, { "algorithm": "vi-ablation", "audit_trace": [ { "epoch": 0, "loss": 36.30288124084473, "posterior_entropy": 0.7567180395126343 }, { "epoch": 119, "loss": 6.661709308624268, "posterior_entropy": 0.30992892384529114 } ], "candidate_constraint_max_violation": 0.8136563897132874, "classes_after_official_filter": 14, "classifier_parameters": 37514, "dataset": "lost", "features_after_official_filter": 108, "full_instances": 1122, "main_epochs_executed": 120, "mc_samples": 10, "mean_candidate_set_size": 2.218506097793579, "official_fold": 0, "posterior_rowsum_max_residual": 4.76837158203125e-07, "runtime_seconds": 6.960834924000665, "seed": 43, "test_accuracy": 0.7288888888888889, "test_instances": 225, "test_mcc": 0.6958009330671128, "train_accuracy": 0.855072463768116, "train_cap": 5000, "train_instances": 897, "train_mcc": 0.8367646264212416, "true_label_in_candidate_rate": 1.0, "warmup_epochs_executed": 0 }, { "algorithm": "vi-pll", "audit_trace": { "main": [ { "candidate_weight_entropy": 0.16210441291332245, "epoch": 0, "log_p_s_xy": -19.23987020765032, "log_p_x_y": 0.6429869490010398, "log_p_y": -2.672427569116865, "log_q_y_x": -2.38821804523468, "loss": -15.282821655273438, "pxy_model": 0.1218777564954407 }, { "candidate_weight_entropy": 0.1467060148715973, "epoch": 119, "log_p_s_xy": -4.055566651480539, "log_p_x_y": 0.6794576006276267, "log_p_y": -2.556765386036464, "log_q_y_x": -0.9188610655920846, "loss": -30.82157584599086, "pxy_model": 0.12074240149111233 } ], "warmup": [ { "epoch": 0, "rmse": 0.13782092395532877 }, { "epoch": 59, "rmse": 0.12190104501576896 } ] }, "candidate_constraint_max_violation": 0.0, "classes_after_official_filter": 14, "classifier_parameters": 37514, "cvae_label_conditioning_probe": { "max_pairwise_decoder_distance": 0.7064527273178101, "mean_pairwise_decoder_distance": 0.5155908465385437 }, "cvae_parameters": 43948, "dataset": "lost", "estimated_sigma": 0.12315943971947536, "factorization_terms_executed": [ "log Q(Y|X)", "log P(Y)", "log P(X|Y)", "log P(S|X,Y)" ], "features_after_official_filter": 108, "full_instances": 1122, "main_epochs_executed": 120, "max_entropy_prior": { "entropy": 2.608857796452674, "max_bound_violation": 0.0, "min_bound_violation": 0.0, "sum_residual": 1.1102230246251565e-16 }, "mc_samples": 5, "mean_candidate_set_size": 2.218506097793579, "official_fold": 0, "posterior_rowsum_max_residual": 1.1920928955078125e-07, "runtime_seconds": 26.15351639599976, "second_classifier_parameters": 37514, "seed": 44, "test_accuracy": 0.8088888888888889, "test_instances": 225, "test_mcc": 0.784477934804284, "total_trainable_parameters": 118976, "train_accuracy": 0.9085841694537347, "train_cap": 5000, "train_instances": 897, "train_mcc": 0.8970442211588884, "true_label_in_candidate_rate": 1.0, "warmup_epochs_executed": 60 }, { "algorithm": "vi-ablation", "audit_trace": [ { "epoch": 0, "loss": 36.23127365112305, "posterior_entropy": 0.7565066814422607 }, { "epoch": 119, "loss": 7.287430627005441, "posterior_entropy": 0.30685684084892273 } ], "candidate_constraint_max_violation": 0.8275954723358154, "classes_after_official_filter": 14, "classifier_parameters": 37514, "dataset": "lost", "features_after_official_filter": 108, "full_instances": 1122, "main_epochs_executed": 120, "mc_samples": 10, "mean_candidate_set_size": 2.218506097793579, "official_fold": 0, "posterior_rowsum_max_residual": 4.172325134277344e-07, "runtime_seconds": 7.156720177998068, "seed": 44, "test_accuracy": 0.7777777777777778, "test_instances": 225, "test_mcc": 0.7499112288128404, "train_accuracy": 0.8494983277591973, "train_cap": 5000, "train_instances": 897, "train_mcc": 0.8304056931793165, "true_label_in_candidate_rate": 1.0, "warmup_epochs_executed": 0 } ], "runtime_seconds": 390.83336939700166 }