Buckets:

glennmatlin's picture
download
raw
20.6 kB
[2026-06-10 21:49:28,765][__main__][INFO] - Config:
model:
model_id: allenai/OLMo-3-1025-7B
torch_dtype: bfloat16
attn_implementation: sdpa
lora:
r: 8
target_modules:
- q_proj
- k_proj
- v_proj
- o_proj
lora_alpha: 16
lora_dropout: 0.05
bias: none
task_type: CAUSAL_LM
trainer:
max_steps: 5000
per_device_train_batch_size: 4
gradient_accumulation_steps: 4
learning_rate: 1.0e-05
lr_scheduler_type: constant
warmup_steps: 0
weight_decay: 0.0
adam_beta1: 0.9
adam_beta2: 0.999
adam_epsilon: 1.0e-08
max_grad_norm: 1.0
auto_lr: true
lr_delta: 1.0e-05
max_walltime_minutes: 340
logging_steps: 50
save_steps: 200
eval_steps: 1000
report_to:
- wandb
bf16: true
fp16: false
gradient_checkpointing: true
length_normalized_loss: true
ppl_shuffle_mode: segments
ppl_n_factor: 10
cooldown_enabled: false
cooldown_every_k: 200
cooldown_steps: 50
data:
max_length: 2048
batch_size: 4
num_workers: 0
max_forget_docs: 2000
max_retain_docs: 9000
docs_per_retain_bin: null
min_tokens: 0
resample_interval: 0
seed: 42
forget_manifest_path: null
topic_bin: software
topic_bins: null
output_dir: /storage/ice-shared/cs7634/staff/TDA/arc_rescore/binlevel_redo/easy/expA__software__arc_easy_seed42
retain_topics: null
seed: 42
wandb_project: data-attribution-unlearn-multiseed
wandb_entity: hcai-lab
forget_texts_file: /storage/ice-shared/cs7634/staff/TDA/arc_rescore/forget_texts_binlevel_easy/expA__software__arc_easy.parquet
[2026-06-10 21:49:28,778][__main__][INFO] - Target topic(s): software
[2026-06-10 21:49:29,055][unlearning.data.dolma_pool][INFO] - Loading 6T-filtered Arrow cache from /storage/ice-shared/cs7634/staff/TDA/arc_rescore/dolma_cache/dolma3_6t_filtered ...
[2026-06-10 21:49:34,203][unlearning.data.dolma_pool][INFO] - Faithful forget set from /storage/ice-shared/cs7634/staff/TDA/arc_rescore/forget_texts_binlevel_easy/expA__software__arc_easy.parquet: 200 texts
[2026-06-10 21:49:53,296][unlearning.data.dolma_pool][INFO] - Sampled (text-file): 200 forget, 9000 retain.
[2026-06-10 21:49:53,304][unlearning.data.sampling][INFO] - Sampling manifest saved to /storage/ice-shared/cs7634/staff/TDA/arc_rescore/binlevel_redo/easy/expA__software__arc_easy_seed42/sampling_manifest.json
[2026-06-10 21:49:53,304][unlearning.data.dolma_pool][INFO] - Tokenizing 200 forget + 9000 retain docs ...
[2026-06-10 21:50:36,752][__main__][INFO] - Starting fresh training in: /storage/ice-shared/cs7634/staff/TDA/arc_rescore/binlevel_redo/easy/expA__software__arc_easy_seed42
[2026-06-10 21:50:36,753][__main__][INFO] - Loading model allenai/OLMo-3-1025-7B ...
[2026-06-10 21:50:37,051][accelerate.utils.modeling][INFO] - We will use 90% of the memory on device 0 for storing the model, and 10% for the buffer to avoid OOM. You can set `max_memory` in to a higher value to use more memory (at your own risk).
[2026-06-10 21:51:12,889][__main__][INFO] - Loading MMLU subset (100 questions) for safety guard ...
[2026-06-10 21:51:12,926][datasets.load][WARNING] - Using the latest cached version of the dataset since cais/mmlu couldn't be found on the Hugging Face Hub (offline mode is enabled).
[2026-06-10 21:51:12,947][datasets.packaged_modules.cache.cache][WARNING] - Found the latest cached dataset configuration 'all' at /home/hice1/gmatlin3/scratch/hf_cache/datasets/cais___mmlu/all/0.0.0/c30699e8356da336a370243923dbaf21066bb9fe (last modified on Mon May 25 20:02:16 2026).
[2026-06-10 21:51:18,258][__main__][INFO] - Original model MMLU accuracy (n=100): 0.5600
[2026-06-10 21:51:20,245][__main__][INFO] - Base model shuffled-token PPL (forget set, mode=segments): 17.1667
[2026-06-10 21:51:25,597][__main__][INFO] - Starting NGDiff unlearning for topic(s) 'software'...
[2026-06-10 21:51:25,598][__main__][INFO] - MMLU safety baseline: 0.5600 (threshold: 0.5040)
[2026-06-10 21:53:24,919][unlearning.trainer.ngdiff][INFO] - step=50 opt_step=12 f_loss=2.8922 r_loss=2.4484 mmlu=0.5600 lr=1.00e-05
[2026-06-10 21:55:23,424][unlearning.trainer.ngdiff][INFO] - step=100 opt_step=25 f_loss=2.5504 r_loss=2.8893 mmlu=0.5600 lr=1.00e-05
[2026-06-10 21:57:17,976][unlearning.trainer.ngdiff][INFO] - step=150 opt_step=37 f_loss=3.0652 r_loss=2.3035 mmlu=0.5600 lr=1.00e-05
[2026-06-10 21:59:17,486][unlearning.trainer.ngdiff][INFO] - step=200 opt_step=50 f_loss=2.5145 r_loss=2.4064 mmlu=0.5600 lr=1.55e-06
[2026-06-10 21:59:26,500][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=50: forget=10.5665 retain=10.3778
[2026-06-10 22:01:22,248][unlearning.trainer.ngdiff][INFO] - step=250 opt_step=62 f_loss=2.1024 r_loss=1.8531 mmlu=0.5600 lr=1.00e-05
[2026-06-10 22:03:11,182][unlearning.trainer.ngdiff][INFO] - step=300 opt_step=75 f_loss=2.1392 r_loss=1.7530 mmlu=0.5600 lr=1.00e-05
[2026-06-10 22:05:05,080][unlearning.trainer.ngdiff][INFO] - step=350 opt_step=87 f_loss=1.9639 r_loss=2.3199 mmlu=0.5700 lr=1.00e-05
[2026-06-10 22:07:00,109][unlearning.trainer.ngdiff][INFO] - step=400 opt_step=100 f_loss=1.0378 r_loss=2.0681 mmlu=0.5600 lr=1.00e-07
[2026-06-10 22:07:07,485][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=100: forget=10.5703 retain=10.3622
[2026-06-10 22:09:03,207][unlearning.trainer.ngdiff][INFO] - step=450 opt_step=112 f_loss=2.6791 r_loss=1.7851 mmlu=0.5600 lr=1.00e-05
[2026-06-10 22:10:56,780][unlearning.trainer.ngdiff][INFO] - step=500 opt_step=125 f_loss=1.1199 r_loss=2.1322 mmlu=0.5600 lr=1.00e-05
[2026-06-10 22:12:50,776][unlearning.trainer.ngdiff][INFO] - step=550 opt_step=137 f_loss=1.7805 r_loss=1.9440 mmlu=0.5600 lr=1.00e-05
[2026-06-10 22:14:42,807][unlearning.trainer.ngdiff][INFO] - step=600 opt_step=150 f_loss=2.7785 r_loss=1.7157 mmlu=0.5600 lr=1.00e-07
[2026-06-10 22:14:50,193][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=150: forget=10.5789 retain=10.3331
[2026-06-10 22:16:45,868][unlearning.trainer.ngdiff][INFO] - step=650 opt_step=162 f_loss=1.9000 r_loss=2.0780 mmlu=0.5600 lr=1.00e-05
[2026-06-10 22:18:44,407][unlearning.trainer.ngdiff][INFO] - step=700 opt_step=175 f_loss=2.9894 r_loss=1.4766 mmlu=0.5600 lr=1.00e-05
[2026-06-10 22:20:40,929][unlearning.trainer.ngdiff][INFO] - step=750 opt_step=187 f_loss=2.4293 r_loss=3.0631 mmlu=0.5600 lr=1.00e-05
[2026-06-10 22:22:37,507][unlearning.trainer.ngdiff][INFO] - step=800 opt_step=200 f_loss=2.3601 r_loss=2.9455 mmlu=0.5600 lr=2.34e-06
[2026-06-10 22:22:44,895][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=200: forget=10.5939 retain=10.2895
[2026-06-10 22:24:35,973][unlearning.trainer.ngdiff][INFO] - step=850 opt_step=212 f_loss=2.6522 r_loss=3.0245 mmlu=0.5700 lr=1.00e-05
[2026-06-10 22:26:29,921][unlearning.trainer.ngdiff][INFO] - step=900 opt_step=225 f_loss=2.4199 r_loss=1.6134 mmlu=0.5700 lr=1.00e-05
[2026-06-10 22:28:22,453][unlearning.trainer.ngdiff][INFO] - step=950 opt_step=237 f_loss=2.3413 r_loss=2.0347 mmlu=0.5600 lr=1.00e-05
[2026-06-10 22:30:14,098][unlearning.trainer.ngdiff][INFO] - step=1000 opt_step=250 f_loss=2.0311 r_loss=1.9686 mmlu=0.5600 lr=2.65e-06
[2026-06-10 22:30:21,484][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=250: forget=10.6060 retain=10.2643
[2026-06-10 22:32:11,641][unlearning.trainer.ngdiff][INFO] - step=1050 opt_step=262 f_loss=2.6443 r_loss=2.4260 mmlu=0.5700 lr=1.00e-05
[2026-06-10 22:34:05,578][unlearning.trainer.ngdiff][INFO] - step=1100 opt_step=275 f_loss=2.5719 r_loss=2.8390 mmlu=0.5700 lr=1.00e-05
[2026-06-10 22:35:59,776][unlearning.trainer.ngdiff][INFO] - step=1150 opt_step=287 f_loss=2.3344 r_loss=1.3976 mmlu=0.5600 lr=1.00e-05
[2026-06-10 22:37:53,374][unlearning.trainer.ngdiff][INFO] - step=1200 opt_step=300 f_loss=2.5158 r_loss=2.3675 mmlu=0.5700 lr=1.49e-06
[2026-06-10 22:38:00,754][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=300: forget=10.6309 retain=10.2113
[2026-06-10 22:39:51,254][unlearning.trainer.ngdiff][INFO] - step=1250 opt_step=312 f_loss=2.6991 r_loss=2.4943 mmlu=0.5600 lr=1.00e-05
[2026-06-10 22:41:46,954][unlearning.trainer.ngdiff][INFO] - step=1300 opt_step=325 f_loss=2.2803 r_loss=2.4593 mmlu=0.5700 lr=1.00e-05
[2026-06-10 22:43:39,269][unlearning.trainer.ngdiff][INFO] - step=1350 opt_step=337 f_loss=1.9154 r_loss=2.8416 mmlu=0.5700 lr=1.00e-05
[2026-06-10 22:45:31,354][unlearning.trainer.ngdiff][INFO] - step=1400 opt_step=350 f_loss=1.9170 r_loss=2.9491 mmlu=0.5700 lr=1.00e-07
[2026-06-10 22:45:38,740][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=350: forget=10.6669 retain=10.1514
[2026-06-10 22:47:34,211][unlearning.trainer.ngdiff][INFO] - step=1450 opt_step=362 f_loss=1.9418 r_loss=2.0824 mmlu=0.5600 lr=1.00e-05
[2026-06-10 22:49:30,005][unlearning.trainer.ngdiff][INFO] - step=1500 opt_step=375 f_loss=2.7123 r_loss=2.1049 mmlu=0.5700 lr=1.00e-05
[2026-06-10 22:51:26,124][unlearning.trainer.ngdiff][INFO] - step=1550 opt_step=387 f_loss=2.5022 r_loss=2.4260 mmlu=0.5800 lr=1.00e-05
[2026-06-10 22:53:22,006][unlearning.trainer.ngdiff][INFO] - step=1600 opt_step=400 f_loss=2.5555 r_loss=2.2263 mmlu=0.5800 lr=1.00e-07
[2026-06-10 22:53:29,371][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=400: forget=10.7101 retain=10.0870
[2026-06-10 22:55:22,487][unlearning.trainer.ngdiff][INFO] - step=1650 opt_step=412 f_loss=2.5178 r_loss=2.3100 mmlu=0.5700 lr=1.00e-05
[2026-06-10 22:57:18,320][unlearning.trainer.ngdiff][INFO] - step=1700 opt_step=425 f_loss=2.3764 r_loss=2.7052 mmlu=0.5500 lr=1.00e-05
[2026-06-10 22:59:14,964][unlearning.trainer.ngdiff][INFO] - step=1750 opt_step=437 f_loss=2.4479 r_loss=2.4799 mmlu=0.5800 lr=1.00e-05
[2026-06-10 23:01:09,204][unlearning.trainer.ngdiff][INFO] - step=1800 opt_step=450 f_loss=2.4634 r_loss=2.1371 mmlu=0.5800 lr=1.00e-07
[2026-06-10 23:01:16,570][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=450: forget=10.7376 retain=10.0431
[2026-06-10 23:03:08,845][unlearning.trainer.ngdiff][INFO] - step=1850 opt_step=462 f_loss=2.8994 r_loss=2.4814 mmlu=0.5800 lr=1.00e-05
[2026-06-10 23:05:07,012][unlearning.trainer.ngdiff][INFO] - step=1900 opt_step=475 f_loss=3.0218 r_loss=1.9783 mmlu=0.5700 lr=1.00e-05
[2026-06-10 23:06:54,879][unlearning.trainer.ngdiff][INFO] - step=1950 opt_step=487 f_loss=1.8473 r_loss=2.3838 mmlu=0.5800 lr=1.00e-05
[2026-06-10 23:08:51,800][unlearning.trainer.ngdiff][INFO] - step=2000 opt_step=500 f_loss=2.6984 r_loss=2.1664 mmlu=0.5700 lr=1.31e-05
[2026-06-10 23:08:59,164][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=500: forget=10.7887 retain=9.9892
[2026-06-10 23:10:53,461][unlearning.trainer.ngdiff][INFO] - step=2050 opt_step=512 f_loss=2.1463 r_loss=2.8176 mmlu=0.5700 lr=1.00e-05
[2026-06-10 23:12:46,139][unlearning.trainer.ngdiff][INFO] - step=2100 opt_step=525 f_loss=2.7724 r_loss=2.2560 mmlu=0.5800 lr=1.00e-05
[2026-06-10 23:14:38,394][unlearning.trainer.ngdiff][INFO] - step=2150 opt_step=537 f_loss=3.5468 r_loss=2.2257 mmlu=0.5600 lr=1.00e-05
[2026-06-10 23:16:33,524][unlearning.trainer.ngdiff][INFO] - step=2200 opt_step=550 f_loss=2.2377 r_loss=2.0482 mmlu=0.5800 lr=1.29e-05
[2026-06-10 23:16:40,883][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=550: forget=10.8511 retain=9.9353
[2026-06-10 23:18:36,995][unlearning.trainer.ngdiff][INFO] - step=2250 opt_step=562 f_loss=2.2542 r_loss=1.6400 mmlu=0.5700 lr=1.00e-05
[2026-06-10 23:20:30,696][unlearning.trainer.ngdiff][INFO] - step=2300 opt_step=575 f_loss=1.9811 r_loss=1.9825 mmlu=0.5800 lr=1.00e-05
[2026-06-10 23:22:24,744][unlearning.trainer.ngdiff][INFO] - step=2350 opt_step=587 f_loss=2.3942 r_loss=2.4383 mmlu=0.5800 lr=1.00e-05
[2026-06-10 23:24:22,666][unlearning.trainer.ngdiff][INFO] - step=2400 opt_step=600 f_loss=2.1646 r_loss=2.4911 mmlu=0.5700 lr=1.00e-07
[2026-06-10 23:24:30,052][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=600: forget=10.9149 retain=9.8464
[2026-06-10 23:26:24,225][unlearning.trainer.ngdiff][INFO] - step=2450 opt_step=612 f_loss=2.1926 r_loss=2.0154 mmlu=0.5700 lr=1.00e-05
[2026-06-10 23:28:15,025][unlearning.trainer.ngdiff][INFO] - step=2500 opt_step=625 f_loss=2.6275 r_loss=2.0188 mmlu=0.5800 lr=1.00e-05
[2026-06-10 23:30:06,728][unlearning.trainer.ngdiff][INFO] - step=2550 opt_step=637 f_loss=2.4086 r_loss=2.0568 mmlu=0.5800 lr=1.00e-05
[2026-06-10 23:32:00,682][unlearning.trainer.ngdiff][INFO] - step=2600 opt_step=650 f_loss=3.0105 r_loss=1.9685 mmlu=0.5800 lr=1.00e-07
[2026-06-10 23:32:08,039][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=650: forget=11.0021 retain=9.7923
[2026-06-10 23:34:01,683][unlearning.trainer.ngdiff][INFO] - step=2650 opt_step=662 f_loss=2.9234 r_loss=2.1888 mmlu=0.5800 lr=1.00e-05
[2026-06-10 23:35:55,172][unlearning.trainer.ngdiff][INFO] - step=2700 opt_step=675 f_loss=2.0653 r_loss=2.3469 mmlu=0.5700 lr=1.00e-05
[2026-06-10 23:37:48,492][unlearning.trainer.ngdiff][INFO] - step=2750 opt_step=687 f_loss=3.0451 r_loss=2.5250 mmlu=0.5700 lr=1.00e-05
[2026-06-10 23:39:42,723][unlearning.trainer.ngdiff][INFO] - step=2800 opt_step=700 f_loss=2.6837 r_loss=1.9776 mmlu=0.5800 lr=1.00e-07
[2026-06-10 23:39:50,083][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=700: forget=11.0919 retain=9.7007
[2026-06-10 23:41:43,946][unlearning.trainer.ngdiff][INFO] - step=2850 opt_step=712 f_loss=2.3616 r_loss=2.1134 mmlu=0.5800 lr=1.00e-05
[2026-06-10 23:43:39,126][unlearning.trainer.ngdiff][INFO] - step=2900 opt_step=725 f_loss=2.7586 r_loss=2.4845 mmlu=0.5800 lr=1.00e-05
[2026-06-10 23:45:30,900][unlearning.trainer.ngdiff][INFO] - step=2950 opt_step=737 f_loss=2.7411 r_loss=1.9173 mmlu=0.5600 lr=1.00e-05
[2026-06-10 23:47:21,633][unlearning.trainer.ngdiff][INFO] - step=3000 opt_step=750 f_loss=2.7081 r_loss=1.9119 mmlu=0.5600 lr=5.10e-06
[2026-06-10 23:47:28,996][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=750: forget=11.2209 retain=9.6385
[2026-06-10 23:49:24,719][unlearning.trainer.ngdiff][INFO] - step=3050 opt_step=762 f_loss=2.2724 r_loss=2.0745 mmlu=0.5600 lr=1.00e-05
[2026-06-10 23:51:20,223][unlearning.trainer.ngdiff][INFO] - step=3100 opt_step=775 f_loss=1.9708 r_loss=2.5713 mmlu=0.5500 lr=1.00e-05
[2026-06-10 23:53:13,973][unlearning.trainer.ngdiff][INFO] - step=3150 opt_step=787 f_loss=2.6826 r_loss=1.7217 mmlu=0.5600 lr=1.00e-05
[2026-06-10 23:55:08,096][unlearning.trainer.ngdiff][INFO] - step=3200 opt_step=800 f_loss=2.7646 r_loss=2.3801 mmlu=0.5700 lr=1.00e-07
[2026-06-10 23:55:15,477][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=800: forget=11.3081 retain=9.6052
[2026-06-10 23:57:12,563][unlearning.trainer.ngdiff][INFO] - step=3250 opt_step=812 f_loss=1.9600 r_loss=2.5433 mmlu=0.5400 lr=1.00e-05
[2026-06-10 23:59:11,403][unlearning.trainer.ngdiff][INFO] - step=3300 opt_step=825 f_loss=2.7711 r_loss=2.4887 mmlu=0.5500 lr=1.00e-05
[2026-06-11 00:01:05,730][unlearning.trainer.ngdiff][INFO] - step=3350 opt_step=837 f_loss=3.5948 r_loss=2.0995 mmlu=0.5400 lr=1.00e-05
[2026-06-11 00:03:00,284][unlearning.trainer.ngdiff][INFO] - step=3400 opt_step=850 f_loss=1.7446 r_loss=2.4711 mmlu=0.5400 lr=3.65e-06
[2026-06-11 00:03:07,640][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=850: forget=11.4548 retain=9.5725
[2026-06-11 00:05:02,450][unlearning.trainer.ngdiff][INFO] - step=3450 opt_step=862 f_loss=2.9381 r_loss=2.9009 mmlu=0.5600 lr=1.00e-05
[2026-06-11 00:06:59,827][unlearning.trainer.ngdiff][INFO] - step=3500 opt_step=875 f_loss=2.4068 r_loss=2.1252 mmlu=0.5400 lr=1.00e-05
[2026-06-11 00:08:55,833][unlearning.trainer.ngdiff][INFO] - step=3550 opt_step=887 f_loss=2.6311 r_loss=2.0733 mmlu=0.5400 lr=1.00e-05
[2026-06-11 00:10:51,985][unlearning.trainer.ngdiff][INFO] - step=3600 opt_step=900 f_loss=3.4743 r_loss=2.5115 mmlu=0.5400 lr=1.85e-05
[2026-06-11 00:10:59,354][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=900: forget=11.6074 retain=9.5258
[2026-06-11 00:12:54,154][unlearning.trainer.ngdiff][INFO] - step=3650 opt_step=912 f_loss=2.1108 r_loss=2.4155 mmlu=0.5500 lr=1.00e-05
[2026-06-11 00:14:46,436][unlearning.trainer.ngdiff][INFO] - step=3700 opt_step=925 f_loss=2.1000 r_loss=2.5438 mmlu=0.5400 lr=1.00e-05
[2026-06-11 00:16:39,762][unlearning.trainer.ngdiff][INFO] - step=3750 opt_step=937 f_loss=2.7970 r_loss=2.9371 mmlu=0.5400 lr=1.00e-05
[2026-06-11 00:18:34,066][unlearning.trainer.ngdiff][INFO] - step=3800 opt_step=950 f_loss=3.0250 r_loss=2.1721 mmlu=0.5500 lr=4.03e-06
[2026-06-11 00:18:41,427][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=950: forget=11.8460 retain=9.5212
[2026-06-11 00:20:37,282][unlearning.trainer.ngdiff][INFO] - step=3850 opt_step=962 f_loss=3.0069 r_loss=2.2527 mmlu=0.5500 lr=1.00e-05
[2026-06-11 00:22:29,440][unlearning.trainer.ngdiff][INFO] - step=3900 opt_step=975 f_loss=2.3372 r_loss=1.8680 mmlu=0.5500 lr=1.00e-05
[2026-06-11 00:24:24,777][unlearning.trainer.ngdiff][INFO] - step=3950 opt_step=987 f_loss=3.1538 r_loss=2.3397 mmlu=0.5500 lr=1.00e-05
[2026-06-11 00:26:17,400][unlearning.trainer.ngdiff][INFO] - step=4000 opt_step=1000 f_loss=2.4877 r_loss=2.2879 mmlu=0.5400 lr=1.00e-07
[2026-06-11 00:26:24,767][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=1000: forget=12.2091 retain=9.5051
[2026-06-11 00:28:19,976][unlearning.trainer.ngdiff][INFO] - step=4050 opt_step=1012 f_loss=3.1588 r_loss=2.5778 mmlu=0.5500 lr=1.00e-05
[2026-06-11 00:30:15,274][unlearning.trainer.ngdiff][INFO] - step=4100 opt_step=1025 f_loss=3.9616 r_loss=2.4114 mmlu=0.5500 lr=1.00e-05
[2026-06-11 00:32:09,040][unlearning.trainer.ngdiff][INFO] - step=4150 opt_step=1037 f_loss=2.3132 r_loss=2.8173 mmlu=0.5500 lr=1.00e-05
[2026-06-11 00:33:58,403][unlearning.trainer.ngdiff][INFO] - step=4200 opt_step=1050 f_loss=2.8260 r_loss=2.6172 mmlu=0.5300 lr=1.00e-07
[2026-06-11 00:34:06,001][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=1050: forget=12.6673 retain=9.5546
[2026-06-11 00:35:59,992][unlearning.trainer.ngdiff][INFO] - step=4250 opt_step=1062 f_loss=2.8957 r_loss=2.2392 mmlu=0.5300 lr=1.00e-05
[2026-06-11 00:37:50,914][unlearning.trainer.ngdiff][INFO] - step=4300 opt_step=1075 f_loss=2.7473 r_loss=2.5906 mmlu=0.5400 lr=1.00e-05
[2026-06-11 00:39:44,302][unlearning.trainer.ngdiff][INFO] - step=4350 opt_step=1087 f_loss=2.7563 r_loss=2.4055 mmlu=0.5400 lr=1.00e-05
[2026-06-11 00:41:40,810][unlearning.trainer.ngdiff][INFO] - step=4400 opt_step=1100 f_loss=2.5812 r_loss=2.2343 mmlu=0.5400 lr=1.00e-07
[2026-06-11 00:41:48,172][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=1100: forget=13.4560 retain=9.6434
[2026-06-11 00:43:44,378][unlearning.trainer.ngdiff][INFO] - step=4450 opt_step=1112 f_loss=2.6112 r_loss=2.0279 mmlu=0.5400 lr=1.00e-05
[2026-06-11 00:45:37,272][unlearning.trainer.ngdiff][INFO] - step=4500 opt_step=1125 f_loss=2.7066 r_loss=2.3225 mmlu=0.5400 lr=1.00e-05
[2026-06-11 00:47:31,474][unlearning.trainer.ngdiff][INFO] - step=4550 opt_step=1137 f_loss=3.4913 r_loss=1.8876 mmlu=0.5400 lr=1.00e-05
[2026-06-11 00:49:24,429][unlearning.trainer.ngdiff][INFO] - step=4600 opt_step=1150 f_loss=2.2897 r_loss=2.4211 mmlu=0.5400 lr=7.09e-06
[2026-06-11 00:49:31,789][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=1150: forget=15.3192 retain=9.8881
[2026-06-11 00:51:24,797][unlearning.trainer.ngdiff][INFO] - step=4650 opt_step=1162 f_loss=3.7186 r_loss=2.6043 mmlu=0.5500 lr=1.00e-05
[2026-06-11 00:53:14,904][unlearning.trainer.ngdiff][INFO] - step=4700 opt_step=1175 f_loss=3.0270 r_loss=1.9320 mmlu=0.5500 lr=1.00e-05
[2026-06-11 00:55:09,540][unlearning.trainer.ngdiff][INFO] - step=4750 opt_step=1187 f_loss=3.5908 r_loss=1.4275 mmlu=0.5500 lr=1.00e-05
[2026-06-11 00:57:06,182][unlearning.trainer.ngdiff][INFO] - step=4800 opt_step=1200 f_loss=3.9692 r_loss=2.5011 mmlu=0.5600 lr=1.00e-07
[2026-06-11 00:57:13,543][unlearning.trainer.ngdiff][INFO] - PPL at optimizer_step=1200: forget=20.6341 retain=10.4455
[2026-06-11 00:57:13,549][unlearning.trainer.ngdiff][INFO] - PPL stopping triggered at optimizer_step=1200: PPL=20.6341 >= threshold=17.1667
[2026-06-11 00:57:14,049][__main__][INFO] - LoRA adapter saved to /storage/ice-shared/cs7634/staff/TDA/arc_rescore/binlevel_redo/easy/expA__software__arc_easy_seed42/adapter (step 1248)
[2026-06-11 00:57:14,050][__main__][INFO] - Done.

Xet Storage Details

Size:
20.6 kB
·
Xet hash:
28dc60bcb7fcc3fb3a0a88fa2ea046ae5f4a293140e272a98876936bcc9877df

Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.