Jeesup commited on
Commit
488daeb
·
verified ·
1 Parent(s): 1b26cae

add eval: gptq_w4

Browse files
evals/gptq_w4/.hydra/config.yaml ADDED
@@ -0,0 +1,546 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ model:
2
+ model_args:
3
+ device_map: cuda
4
+ pretrained_model_name_or_path: saves/unlearn/tofu_1B_f01_DPO_lr7e-6
5
+ attn_implementation: sdpa
6
+ torch_dtype: bfloat16
7
+ tokenizer_args:
8
+ pretrained_model_name_or_path: open-unlearning/tofu_Llama-3.2-1B-Instruct_full
9
+ template_args:
10
+ apply_chat_template: true
11
+ system_prompt: You are a helpful assistant.
12
+ system_prompt_with_special_tokens: '<|begin_of_text|><|start_header_id|>system<|end_header_id|>
13
+
14
+
15
+ You are a helpful assistant.<|eot_id|>'
16
+ user_start_tag: '<|start_header_id|>user<|end_header_id|>
17
+
18
+
19
+ '
20
+ user_end_tag: <|eot_id|>
21
+ asst_start_tag: '<|start_header_id|>assistant<|end_header_id|>
22
+
23
+
24
+ '
25
+ asst_end_tag: <|eot_id|>
26
+ date_string: 10 Apr 2025
27
+ mode: eval
28
+ task_name: tofu_1B_f01_DPO_lr7e-6_eval_gptq_w4
29
+ seed: 0
30
+ eval:
31
+ tofu:
32
+ metrics:
33
+ forget_truth_ratio:
34
+ pre_compute:
35
+ forget_Q_A_PARA_Prob:
36
+ datasets:
37
+ TOFU_QA_forget_para:
38
+ handler: QADataset
39
+ args:
40
+ hf_args:
41
+ name: ${eval.tofu.forget_split}_perturbed
42
+ split: train
43
+ path: locuslab/TOFU
44
+ question_key: ${eval.tofu.question_key}
45
+ answer_key: paraphrased_answer
46
+ max_length: 512
47
+ collators:
48
+ DataCollatorForSupervisedDataset:
49
+ handler: DataCollatorForSupervisedDataset
50
+ args:
51
+ padding_side: right
52
+ index: index
53
+ handler: probability
54
+ batch_size: ${eval.tofu.batch_size}
55
+ access_key: correct
56
+ forget_Q_A_PERT_Prob:
57
+ datasets:
58
+ TOFU_QA_forget_pert:
59
+ handler: QADataset
60
+ args:
61
+ hf_args:
62
+ name: ${eval.tofu.forget_split}_perturbed
63
+ split: train
64
+ path: locuslab/TOFU
65
+ question_key: ${eval.tofu.question_key}
66
+ answer_key: perturbed_answer
67
+ max_length: 512
68
+ collators:
69
+ DataCollatorForSupervisedDataset:
70
+ handler: DataCollatorForSupervisedDataset
71
+ args:
72
+ padding_side: right
73
+ index: index
74
+ handler: probability
75
+ batch_size: ${eval.tofu.batch_size}
76
+ access_key: wrong
77
+ handler: truth_ratio
78
+ aggregator: closer_to_1_better
79
+ forget_quality:
80
+ pre_compute:
81
+ forget_truth_ratio:
82
+ pre_compute:
83
+ forget_Q_A_PARA_Prob:
84
+ datasets:
85
+ TOFU_QA_forget_para:
86
+ handler: QADataset
87
+ args:
88
+ hf_args:
89
+ name: ${eval.tofu.forget_split}_perturbed
90
+ split: train
91
+ path: locuslab/TOFU
92
+ question_key: ${eval.tofu.question_key}
93
+ answer_key: paraphrased_answer
94
+ max_length: 512
95
+ collators:
96
+ DataCollatorForSupervisedDataset:
97
+ handler: DataCollatorForSupervisedDataset
98
+ args:
99
+ padding_side: right
100
+ index: index
101
+ handler: probability
102
+ batch_size: ${eval.tofu.batch_size}
103
+ access_key: correct
104
+ forget_Q_A_PERT_Prob:
105
+ datasets:
106
+ TOFU_QA_forget_pert:
107
+ handler: QADataset
108
+ args:
109
+ hf_args:
110
+ name: ${eval.tofu.forget_split}_perturbed
111
+ split: train
112
+ path: locuslab/TOFU
113
+ question_key: ${eval.tofu.question_key}
114
+ answer_key: perturbed_answer
115
+ max_length: 512
116
+ collators:
117
+ DataCollatorForSupervisedDataset:
118
+ handler: DataCollatorForSupervisedDataset
119
+ args:
120
+ padding_side: right
121
+ index: index
122
+ handler: probability
123
+ batch_size: ${eval.tofu.batch_size}
124
+ access_key: wrong
125
+ handler: truth_ratio
126
+ aggregator: closer_to_1_better
127
+ access_key: forget
128
+ reference_logs:
129
+ retain_model_logs:
130
+ path: ${eval.tofu.retain_logs_path}
131
+ include:
132
+ forget_truth_ratio:
133
+ access_key: retain
134
+ handler: ks_test
135
+ forget_Q_A_Prob:
136
+ datasets:
137
+ TOFU_QA_forget:
138
+ handler: QADataset
139
+ args:
140
+ hf_args:
141
+ name: ${eval.tofu.forget_split}_perturbed
142
+ split: train
143
+ path: locuslab/TOFU
144
+ question_key: ${eval.tofu.question_key}
145
+ answer_key: answer
146
+ max_length: 512
147
+ collators:
148
+ DataCollatorForSupervisedDataset:
149
+ handler: DataCollatorForSupervisedDataset
150
+ args:
151
+ padding_side: right
152
+ index: index
153
+ handler: probability
154
+ batch_size: ${eval.tofu.batch_size}
155
+ forget_Q_A_ROUGE:
156
+ datasets:
157
+ TOFU_QA_forget:
158
+ handler: QADataset
159
+ args:
160
+ hf_args:
161
+ name: ${eval.tofu.forget_split}_perturbed
162
+ split: train
163
+ path: locuslab/TOFU
164
+ question_key: ${eval.tofu.question_key}
165
+ answer_key: answer
166
+ max_length: 512
167
+ predict_with_generate: true
168
+ collators:
169
+ DataCollatorForSupervisedDataset:
170
+ handler: DataCollatorForSupervisedDataset
171
+ args:
172
+ padding_side: left
173
+ index: index
174
+ generation_args:
175
+ do_sample: false
176
+ top_p: null
177
+ temperature: null
178
+ max_new_tokens: 200
179
+ use_cache: true
180
+ handler: rouge
181
+ rouge_type: rougeL_recall
182
+ batch_size: ${eval.tofu.batch_size}
183
+ model_utility:
184
+ pre_compute:
185
+ retain_Q_A_Prob:
186
+ datasets:
187
+ TOFU_QA_retain_eval:
188
+ handler: QADataset
189
+ args:
190
+ hf_args:
191
+ name: retain_perturbed
192
+ split: train
193
+ path: locuslab/TOFU
194
+ question_key: ${eval.tofu.question_key}
195
+ answer_key: answer
196
+ max_length: 512
197
+ collators:
198
+ DataCollatorForSupervisedDataset:
199
+ handler: DataCollatorForSupervisedDataset
200
+ args:
201
+ padding_side: right
202
+ index: index
203
+ handler: probability
204
+ batch_size: ${eval.tofu.batch_size}
205
+ retain_Q_A_ROUGE:
206
+ datasets:
207
+ TOFU_QA_retain_eval:
208
+ handler: QADataset
209
+ args:
210
+ hf_args:
211
+ name: retain_perturbed
212
+ split: train
213
+ path: locuslab/TOFU
214
+ question_key: ${eval.tofu.question_key}
215
+ answer_key: answer
216
+ max_length: 512
217
+ predict_with_generate: true
218
+ collators:
219
+ DataCollatorForSupervisedDataset:
220
+ handler: DataCollatorForSupervisedDataset
221
+ args:
222
+ padding_side: left
223
+ index: index
224
+ generation_args:
225
+ do_sample: false
226
+ top_p: null
227
+ temperature: null
228
+ max_new_tokens: 200
229
+ use_cache: true
230
+ handler: rouge
231
+ rouge_type: rougeL_recall
232
+ batch_size: ${eval.tofu.batch_size}
233
+ retain_Truth_Ratio:
234
+ pre_compute:
235
+ retain_Q_A_PARA_Prob:
236
+ datasets:
237
+ TOFU_QA_retain_para:
238
+ handler: QADataset
239
+ args:
240
+ hf_args:
241
+ name: retain_perturbed
242
+ split: train
243
+ path: locuslab/TOFU
244
+ question_key: ${eval.tofu.question_key}
245
+ answer_key: paraphrased_answer
246
+ max_length: 512
247
+ collators:
248
+ DataCollatorForSupervisedDataset:
249
+ handler: DataCollatorForSupervisedDataset
250
+ args:
251
+ padding_side: right
252
+ index: index
253
+ handler: probability
254
+ batch_size: ${eval.tofu.batch_size}
255
+ access_key: correct
256
+ retain_Q_A_PERT_Prob:
257
+ datasets:
258
+ TOFU_QA_retain_pert:
259
+ handler: QADataset
260
+ args:
261
+ hf_args:
262
+ name: retain_perturbed
263
+ split: train
264
+ path: locuslab/TOFU
265
+ question_key: ${eval.tofu.question_key}
266
+ answer_key: perturbed_answer
267
+ max_length: 512
268
+ collators:
269
+ DataCollatorForSupervisedDataset:
270
+ handler: DataCollatorForSupervisedDataset
271
+ args:
272
+ padding_side: right
273
+ index: index
274
+ handler: probability
275
+ batch_size: ${eval.tofu.batch_size}
276
+ access_key: wrong
277
+ handler: truth_ratio
278
+ aggregator: true_better
279
+ ra_Q_A_Prob_normalised:
280
+ pre_compute:
281
+ ra_Q_A_Prob:
282
+ datasets:
283
+ TOFU_QA_ra:
284
+ handler: QADataset
285
+ args:
286
+ hf_args:
287
+ name: real_authors_perturbed
288
+ split: train
289
+ path: locuslab/TOFU
290
+ question_key: question
291
+ answer_key: answer
292
+ max_length: 512
293
+ collators:
294
+ DataCollatorForSupervisedDataset:
295
+ handler: DataCollatorForSupervisedDataset
296
+ args:
297
+ padding_side: right
298
+ index: index
299
+ handler: probability
300
+ batch_size: ${eval.tofu.batch_size}
301
+ access_key: correct
302
+ ra_Q_A_PERT_Prob:
303
+ datasets:
304
+ TOFU_QA_ra_pert:
305
+ handler: QADataset
306
+ args:
307
+ hf_args:
308
+ name: real_authors_perturbed
309
+ split: train
310
+ path: locuslab/TOFU
311
+ question_key: question
312
+ answer_key: perturbed_answer
313
+ max_length: 512
314
+ collators:
315
+ DataCollatorForSupervisedDataset:
316
+ handler: DataCollatorForSupervisedDataset
317
+ args:
318
+ padding_side: right
319
+ index: index
320
+ handler: probability
321
+ batch_size: ${eval.tofu.batch_size}
322
+ access_key: wrong
323
+ handler: probability_w_options
324
+ ra_Q_A_ROUGE:
325
+ datasets:
326
+ TOFU_QA_ra:
327
+ handler: QADataset
328
+ args:
329
+ hf_args:
330
+ name: real_authors_perturbed
331
+ split: train
332
+ path: locuslab/TOFU
333
+ question_key: question
334
+ answer_key: answer
335
+ max_length: 512
336
+ predict_with_generate: true
337
+ collators:
338
+ DataCollatorForSupervisedDataset:
339
+ handler: DataCollatorForSupervisedDataset
340
+ args:
341
+ padding_side: left
342
+ index: index
343
+ generation_args:
344
+ do_sample: false
345
+ top_p: null
346
+ temperature: null
347
+ max_new_tokens: 200
348
+ use_cache: true
349
+ handler: rouge
350
+ rouge_type: rougeL_recall
351
+ batch_size: ${eval.tofu.batch_size}
352
+ ra_Truth_Ratio:
353
+ pre_compute:
354
+ ra_Q_A_Prob:
355
+ datasets:
356
+ TOFU_QA_ra:
357
+ handler: QADataset
358
+ args:
359
+ hf_args:
360
+ name: real_authors_perturbed
361
+ split: train
362
+ path: locuslab/TOFU
363
+ question_key: question
364
+ answer_key: answer
365
+ max_length: 512
366
+ collators:
367
+ DataCollatorForSupervisedDataset:
368
+ handler: DataCollatorForSupervisedDataset
369
+ args:
370
+ padding_side: right
371
+ index: index
372
+ handler: probability
373
+ batch_size: ${eval.tofu.batch_size}
374
+ access_key: correct
375
+ ra_Q_A_PERT_Prob:
376
+ datasets:
377
+ TOFU_QA_ra_pert:
378
+ handler: QADataset
379
+ args:
380
+ hf_args:
381
+ name: real_authors_perturbed
382
+ split: train
383
+ path: locuslab/TOFU
384
+ question_key: question
385
+ answer_key: perturbed_answer
386
+ max_length: 512
387
+ collators:
388
+ DataCollatorForSupervisedDataset:
389
+ handler: DataCollatorForSupervisedDataset
390
+ args:
391
+ padding_side: right
392
+ index: index
393
+ handler: probability
394
+ batch_size: ${eval.tofu.batch_size}
395
+ access_key: wrong
396
+ handler: truth_ratio
397
+ aggregator: true_better
398
+ wf_Q_A_Prob_normalised:
399
+ pre_compute:
400
+ wf_Q_A_Prob:
401
+ datasets:
402
+ TOFU_QA_wf:
403
+ handler: QADataset
404
+ args:
405
+ hf_args:
406
+ name: world_facts_perturbed
407
+ split: train
408
+ path: locuslab/TOFU
409
+ question_key: question
410
+ answer_key: answer
411
+ max_length: 512
412
+ collators:
413
+ DataCollatorForSupervisedDataset:
414
+ handler: DataCollatorForSupervisedDataset
415
+ args:
416
+ padding_side: right
417
+ index: index
418
+ handler: probability
419
+ batch_size: ${eval.tofu.batch_size}
420
+ access_key: correct
421
+ wf_Q_A_PERT_Prob:
422
+ datasets:
423
+ TOFU_QA_wf_pert:
424
+ handler: QADataset
425
+ args:
426
+ hf_args:
427
+ name: world_facts_perturbed
428
+ split: train
429
+ path: locuslab/TOFU
430
+ question_key: question
431
+ answer_key: perturbed_answer
432
+ max_length: 512
433
+ collators:
434
+ DataCollatorForSupervisedDataset:
435
+ handler: DataCollatorForSupervisedDataset
436
+ args:
437
+ padding_side: right
438
+ index: index
439
+ handler: probability
440
+ batch_size: ${eval.tofu.batch_size}
441
+ access_key: wrong
442
+ handler: probability_w_options
443
+ wf_Q_A_ROUGE:
444
+ datasets:
445
+ TOFU_QA_wf:
446
+ handler: QADataset
447
+ args:
448
+ hf_args:
449
+ name: world_facts_perturbed
450
+ split: train
451
+ path: locuslab/TOFU
452
+ question_key: question
453
+ answer_key: answer
454
+ max_length: 512
455
+ predict_with_generate: true
456
+ collators:
457
+ DataCollatorForSupervisedDataset:
458
+ handler: DataCollatorForSupervisedDataset
459
+ args:
460
+ padding_side: left
461
+ index: index
462
+ generation_args:
463
+ do_sample: false
464
+ top_p: null
465
+ temperature: null
466
+ max_new_tokens: 200
467
+ use_cache: true
468
+ handler: rouge
469
+ rouge_type: rougeL_recall
470
+ batch_size: ${eval.tofu.batch_size}
471
+ wf_Truth_Ratio:
472
+ pre_compute:
473
+ wf_Q_A_Prob:
474
+ datasets:
475
+ TOFU_QA_wf:
476
+ handler: QADataset
477
+ args:
478
+ hf_args:
479
+ name: world_facts_perturbed
480
+ split: train
481
+ path: locuslab/TOFU
482
+ question_key: question
483
+ answer_key: answer
484
+ max_length: 512
485
+ collators:
486
+ DataCollatorForSupervisedDataset:
487
+ handler: DataCollatorForSupervisedDataset
488
+ args:
489
+ padding_side: right
490
+ index: index
491
+ handler: probability
492
+ batch_size: ${eval.tofu.batch_size}
493
+ access_key: correct
494
+ wf_Q_A_PERT_Prob:
495
+ datasets:
496
+ TOFU_QA_wf_pert:
497
+ handler: QADataset
498
+ args:
499
+ hf_args:
500
+ name: world_facts_perturbed
501
+ split: train
502
+ path: locuslab/TOFU
503
+ question_key: question
504
+ answer_key: perturbed_answer
505
+ max_length: 512
506
+ collators:
507
+ DataCollatorForSupervisedDataset:
508
+ handler: DataCollatorForSupervisedDataset
509
+ args:
510
+ padding_side: right
511
+ index: index
512
+ handler: probability
513
+ batch_size: ${eval.tofu.batch_size}
514
+ access_key: wrong
515
+ handler: truth_ratio
516
+ aggregator: true_better
517
+ handler: hm_aggregate
518
+ handler: TOFUEvaluator
519
+ output_dir: ${paths.output_dir}
520
+ overwrite: false
521
+ forget_split: ${forget_split}
522
+ holdout_split: ${holdout_split}
523
+ retain_logs_path: ${retain_logs_path}
524
+ question_key: question
525
+ batch_size: 32
526
+ paths:
527
+ root_dir: .
528
+ data_dir: ${paths.root_dir}/data/
529
+ datasets: ${paths.root_dir}/configs/data/datasets
530
+ output_dir: saves/unlearn/tofu_1B_f01_DPO_lr7e-6/evals/gptq_w4
531
+ work_dir: ${hydra:runtime.cwd}
532
+ forget_split: forget01
533
+ holdout_split: holdout01
534
+ retain_logs_path: saves/eval/tofu_Llama-3.2-1B-Instruct_retain99/TOFU_EVAL.json
535
+ quant:
536
+ enabled: true
537
+ apply_fn: apply_autogptq_w4
538
+ args:
539
+ n_bits: 4
540
+ group_size: 128
541
+ calib_dataset: c4
542
+ n_calib_samples: 128
543
+ model_seqlen: 2048
544
+ sym: true
545
+ desc_act: false
546
+ damp_percent: 0.01
evals/gptq_w4/.hydra/hydra.yaml ADDED
@@ -0,0 +1,274 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ hydra:
2
+ run:
3
+ dir: ${paths.output_dir}
4
+ sweep:
5
+ dir: multirun/${now:%Y-%m-%d}/${now:%H-%M-%S}
6
+ subdir: ${hydra.job.num}
7
+ launcher:
8
+ _target_: hydra._internal.core_plugins.basic_launcher.BasicLauncher
9
+ sweeper:
10
+ _target_: hydra._internal.core_plugins.basic_sweeper.BasicSweeper
11
+ max_batch_size: null
12
+ params: null
13
+ help:
14
+ app_name: ${hydra.job.name}
15
+ header: '${hydra.help.app_name} is powered by Hydra.
16
+
17
+ '
18
+ footer: 'Powered by Hydra (https://hydra.cc)
19
+
20
+ Use --hydra-help to view Hydra specific help
21
+
22
+ '
23
+ template: '${hydra.help.header}
24
+
25
+ == Configuration groups ==
26
+
27
+ Compose your configuration from those groups (group=option)
28
+
29
+
30
+ $APP_CONFIG_GROUPS
31
+
32
+
33
+ == Config ==
34
+
35
+ Override anything in the config (foo.bar=value)
36
+
37
+
38
+ $CONFIG
39
+
40
+
41
+ ${hydra.help.footer}
42
+
43
+ '
44
+ hydra_help:
45
+ template: 'Hydra (${hydra.runtime.version})
46
+
47
+ See https://hydra.cc for more info.
48
+
49
+
50
+ == Flags ==
51
+
52
+ $FLAGS_HELP
53
+
54
+
55
+ == Configuration groups ==
56
+
57
+ Compose your configuration from those groups (For example, append hydra/job_logging=disabled
58
+ to command line)
59
+
60
+
61
+ $HYDRA_CONFIG_GROUPS
62
+
63
+
64
+ Use ''--cfg hydra'' to Show the Hydra config.
65
+
66
+ '
67
+ hydra_help: ???
68
+ hydra_logging:
69
+ version: 1
70
+ formatters:
71
+ colorlog:
72
+ (): colorlog.ColoredFormatter
73
+ format: '[%(cyan)s%(asctime)s%(reset)s][%(purple)sHYDRA%(reset)s] %(message)s'
74
+ handlers:
75
+ console:
76
+ class: logging.StreamHandler
77
+ formatter: colorlog
78
+ stream: ext://sys.stdout
79
+ root:
80
+ level: INFO
81
+ handlers:
82
+ - console
83
+ disable_existing_loggers: false
84
+ job_logging:
85
+ version: 1
86
+ formatters:
87
+ simple:
88
+ format: '[%(asctime)s][%(name)s][%(levelname)s] - %(message)s'
89
+ colorlog:
90
+ (): colorlog.ColoredFormatter
91
+ format: '[%(cyan)s%(asctime)s%(reset)s][%(blue)s%(name)s%(reset)s][%(log_color)s%(levelname)s%(reset)s]
92
+ - %(message)s'
93
+ log_colors:
94
+ DEBUG: purple
95
+ INFO: green
96
+ WARNING: yellow
97
+ ERROR: red
98
+ CRITICAL: red
99
+ handlers:
100
+ console:
101
+ class: logging.StreamHandler
102
+ formatter: colorlog
103
+ stream: ext://sys.stdout
104
+ file:
105
+ class: logging.FileHandler
106
+ formatter: simple
107
+ filename: ${hydra.runtime.output_dir}/eval.log
108
+ root:
109
+ level: INFO
110
+ handlers:
111
+ - console
112
+ - file
113
+ disable_existing_loggers: false
114
+ env: {}
115
+ mode: RUN
116
+ searchpath: []
117
+ callbacks: {}
118
+ output_subdir: .hydra
119
+ overrides:
120
+ hydra:
121
+ - hydra.mode=RUN
122
+ task:
123
+ - experiment=eval/tofu/fast
124
+ - model=Llama-3.2-1B-Instruct
125
+ - forget_split=forget01
126
+ - holdout_split=holdout01
127
+ - retain_logs_path=saves/eval/tofu_Llama-3.2-1B-Instruct_retain99/TOFU_EVAL.json
128
+ - model.tokenizer_args.pretrained_model_name_or_path=open-unlearning/tofu_Llama-3.2-1B-Instruct_full
129
+ - model.model_args.attn_implementation=sdpa
130
+ - model.model_args.pretrained_model_name_or_path=saves/unlearn/tofu_1B_f01_DPO_lr7e-6
131
+ - paths.output_dir=saves/unlearn/tofu_1B_f01_DPO_lr7e-6/evals/gptq_w4
132
+ - task_name=tofu_1B_f01_DPO_lr7e-6_eval_gptq_w4
133
+ - +quant=ptq_gptq_w4
134
+ job:
135
+ name: eval
136
+ chdir: null
137
+ override_dirname: +quant=ptq_gptq_w4,experiment=eval/tofu/fast,forget_split=forget01,holdout_split=holdout01,model.model_args.attn_implementation=sdpa,model.model_args.pretrained_model_name_or_path=saves/unlearn/tofu_1B_f01_DPO_lr7e-6,model.tokenizer_args.pretrained_model_name_or_path=open-unlearning/tofu_Llama-3.2-1B-Instruct_full,model=Llama-3.2-1B-Instruct,paths.output_dir=saves/unlearn/tofu_1B_f01_DPO_lr7e-6/evals/gptq_w4,retain_logs_path=saves/eval/tofu_Llama-3.2-1B-Instruct_retain99/TOFU_EVAL.json,task_name=tofu_1B_f01_DPO_lr7e-6_eval_gptq_w4
138
+ id: ???
139
+ num: ???
140
+ config_name: eval.yaml
141
+ env_set: {}
142
+ env_copy: []
143
+ config:
144
+ override_dirname:
145
+ kv_sep: '='
146
+ item_sep: ','
147
+ exclude_keys: []
148
+ runtime:
149
+ version: 1.3.2
150
+ version_base: '1.3'
151
+ cwd: /NHNHOME/0226010080_A/BASE/jeesuppark/open-unlearning
152
+ config_sources:
153
+ - path: hydra.conf
154
+ schema: pkg
155
+ provider: hydra
156
+ - path: /NHNHOME/0226010080_A/BASE/jeesuppark/open-unlearning/configs
157
+ schema: file
158
+ provider: main
159
+ - path: hydra_plugins.hydra_colorlog.conf
160
+ schema: pkg
161
+ provider: hydra-colorlog
162
+ - path: ''
163
+ schema: structured
164
+ provider: schema
165
+ output_dir: /NHNHOME/0226010080_A/BASE/jeesuppark/open-unlearning/saves/unlearn/tofu_1B_f01_DPO_lr7e-6/evals/gptq_w4
166
+ choices:
167
+ quant: ptq_gptq_w4
168
+ experiment: eval/tofu/fast
169
+ hydra: eval
170
+ paths: default
171
+ eval: tofu_fast
172
+ eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio: wf_Truth_Ratio
173
+ eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_PERT_Prob: wf_Q_A_PERT_Prob
174
+ ? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_PERT_Prob.collators
175
+ : DataCollatorForSupervisedDatasetwithIndex
176
+ ? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_PERT_Prob.datasets
177
+ : TOFU_QA_wf_pert
178
+ eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_Prob: wf_Q_A_Prob
179
+ ? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_Prob.collators
180
+ : DataCollatorForSupervisedDatasetwithIndex
181
+ ? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_Prob.datasets
182
+ : TOFU_QA_wf
183
+ eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_ROUGE: wf_Q_A_ROUGE
184
+ eval/tofu_metrics/./../../generation@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_ROUGE.generation_args: default
185
+ eval/tofu_metrics/./../../collator@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_ROUGE.collators: DataCollatorForSupervisedDatasetwithIndex
186
+ eval/tofu_metrics/./../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_ROUGE.datasets: TOFU_QA_wf
187
+ eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised: wf_Q_A_Prob_normalised
188
+ eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_PERT_Prob: wf_Q_A_PERT_Prob
189
+ ? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_PERT_Prob.collators
190
+ : DataCollatorForSupervisedDatasetwithIndex
191
+ ? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_PERT_Prob.datasets
192
+ : TOFU_QA_wf_pert
193
+ eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_Prob: wf_Q_A_Prob
194
+ ? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_Prob.collators
195
+ : DataCollatorForSupervisedDatasetwithIndex
196
+ ? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_Prob.datasets
197
+ : TOFU_QA_wf
198
+ eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio: ra_Truth_Ratio
199
+ eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_PERT_Prob: ra_Q_A_PERT_Prob
200
+ ? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_PERT_Prob.collators
201
+ : DataCollatorForSupervisedDatasetwithIndex
202
+ ? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_PERT_Prob.datasets
203
+ : TOFU_QA_ra_pert
204
+ eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_Prob: ra_Q_A_Prob
205
+ ? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_Prob.collators
206
+ : DataCollatorForSupervisedDatasetwithIndex
207
+ ? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_Prob.datasets
208
+ : TOFU_QA_ra
209
+ eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_ROUGE: ra_Q_A_ROUGE
210
+ eval/tofu_metrics/./../../generation@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_ROUGE.generation_args: default
211
+ eval/tofu_metrics/./../../collator@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_ROUGE.collators: DataCollatorForSupervisedDatasetwithIndex
212
+ eval/tofu_metrics/./../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_ROUGE.datasets: TOFU_QA_ra
213
+ eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised: ra_Q_A_Prob_normalised
214
+ eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_PERT_Prob: ra_Q_A_PERT_Prob
215
+ ? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_PERT_Prob.collators
216
+ : DataCollatorForSupervisedDatasetwithIndex
217
+ ? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_PERT_Prob.datasets
218
+ : TOFU_QA_ra_pert
219
+ eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_Prob: ra_Q_A_Prob
220
+ ? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_Prob.collators
221
+ : DataCollatorForSupervisedDatasetwithIndex
222
+ ? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_Prob.datasets
223
+ : TOFU_QA_ra
224
+ eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio: retain_Truth_Ratio
225
+ eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PERT_Prob: retain_Q_A_PERT_Prob
226
+ ? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PERT_Prob.collators
227
+ : DataCollatorForSupervisedDatasetwithIndex
228
+ ? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PERT_Prob.datasets
229
+ : TOFU_QA_retain_pert
230
+ eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PARA_Prob: retain_Q_A_PARA_Prob
231
+ ? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PARA_Prob.collators
232
+ : DataCollatorForSupervisedDatasetwithIndex
233
+ ? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PARA_Prob.datasets
234
+ : TOFU_QA_retain_para
235
+ eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_ROUGE: retain_Q_A_ROUGE
236
+ eval/tofu_metrics/./../../generation@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_ROUGE.generation_args: default
237
+ eval/tofu_metrics/./../../collator@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_ROUGE.collators: DataCollatorForSupervisedDatasetwithIndex
238
+ eval/tofu_metrics/./../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_ROUGE.datasets: TOFU_QA_retain_eval
239
+ eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_Prob: retain_Q_A_Prob
240
+ eval/tofu_metrics/./../../collator@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_Prob.collators: DataCollatorForSupervisedDatasetwithIndex
241
+ eval/tofu_metrics/./../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_Prob.datasets: TOFU_QA_retain_eval
242
+ eval/tofu_metrics/../../generation@eval.tofu.metrics.forget_Q_A_ROUGE.generation_args: default
243
+ eval/tofu_metrics/../../collator@eval.tofu.metrics.forget_Q_A_ROUGE.collators: DataCollatorForSupervisedDatasetwithIndex
244
+ eval/tofu_metrics/../../data/datasets@eval.tofu.metrics.forget_Q_A_ROUGE.datasets: TOFU_QA_forget
245
+ eval/tofu_metrics/../../collator@eval.tofu.metrics.forget_Q_A_Prob.collators: DataCollatorForSupervisedDatasetwithIndex
246
+ eval/tofu_metrics/../../data/datasets@eval.tofu.metrics.forget_Q_A_Prob.datasets: TOFU_QA_forget
247
+ eval/tofu_metrics/.@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio: forget_Truth_Ratio
248
+ eval/tofu_metrics/./.@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PERT_Prob: forget_Q_A_PERT_Prob
249
+ ? eval/tofu_metrics/././../../collator@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PERT_Prob.collators
250
+ : DataCollatorForSupervisedDatasetwithIndex
251
+ ? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PERT_Prob.datasets
252
+ : TOFU_QA_forget_pert
253
+ eval/tofu_metrics/./.@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PARA_Prob: forget_Q_A_PARA_Prob
254
+ ? eval/tofu_metrics/././../../collator@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PARA_Prob.collators
255
+ : DataCollatorForSupervisedDatasetwithIndex
256
+ ? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PARA_Prob.datasets
257
+ : TOFU_QA_forget_para
258
+ eval/tofu_metrics/.@eval.tofu.metrics.forget_truth_ratio.pre_compute.forget_Q_A_PERT_Prob: forget_Q_A_PERT_Prob
259
+ eval/tofu_metrics/./../../collator@eval.tofu.metrics.forget_truth_ratio.pre_compute.forget_Q_A_PERT_Prob.collators: DataCollatorForSupervisedDatasetwithIndex
260
+ eval/tofu_metrics/./../../data/datasets@eval.tofu.metrics.forget_truth_ratio.pre_compute.forget_Q_A_PERT_Prob.datasets: TOFU_QA_forget_pert
261
+ eval/tofu_metrics/.@eval.tofu.metrics.forget_truth_ratio.pre_compute.forget_Q_A_PARA_Prob: forget_Q_A_PARA_Prob
262
+ eval/tofu_metrics/./../../collator@eval.tofu.metrics.forget_truth_ratio.pre_compute.forget_Q_A_PARA_Prob.collators: DataCollatorForSupervisedDatasetwithIndex
263
+ eval/tofu_metrics/./../../data/datasets@eval.tofu.metrics.forget_truth_ratio.pre_compute.forget_Q_A_PARA_Prob.datasets: TOFU_QA_forget_para
264
+ model: Llama-3.2-1B-Instruct
265
+ hydra/env: default
266
+ hydra/callbacks: null
267
+ hydra/job_logging: colorlog
268
+ hydra/hydra_logging: colorlog
269
+ hydra/hydra_help: default
270
+ hydra/help: default
271
+ hydra/sweeper: basic
272
+ hydra/launcher: basic
273
+ hydra/output: default
274
+ verbose: false
evals/gptq_w4/.hydra/overrides.yaml ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ - experiment=eval/tofu/fast
2
+ - model=Llama-3.2-1B-Instruct
3
+ - forget_split=forget01
4
+ - holdout_split=holdout01
5
+ - retain_logs_path=saves/eval/tofu_Llama-3.2-1B-Instruct_retain99/TOFU_EVAL.json
6
+ - model.tokenizer_args.pretrained_model_name_or_path=open-unlearning/tofu_Llama-3.2-1B-Instruct_full
7
+ - model.model_args.attn_implementation=sdpa
8
+ - model.model_args.pretrained_model_name_or_path=saves/unlearn/tofu_1B_f01_DPO_lr7e-6
9
+ - paths.output_dir=saves/unlearn/tofu_1B_f01_DPO_lr7e-6/evals/gptq_w4
10
+ - task_name=tofu_1B_f01_DPO_lr7e-6_eval_gptq_w4
11
+ - +quant=ptq_gptq_w4
evals/gptq_w4/TOFU_EVAL.json ADDED
The diff for this file is too large to render. See raw diff
 
evals/gptq_w4/TOFU_SUMMARY.json ADDED
@@ -0,0 +1,7 @@
 
 
 
 
 
 
 
 
1
+ {
2
+ "forget_Q_A_Prob": 1.2359581887722015e-06,
3
+ "forget_Q_A_ROUGE": 0.0,
4
+ "forget_quality": 0.006760732303569208,
5
+ "forget_truth_ratio": 0.8509333224109856,
6
+ "model_utility": 0.0
7
+ }