haochengsama commited on
Commit
527cee6
·
verified ·
1 Parent(s): 1e8914a

Add files using upload-large-folder tool

Browse files
This view is limited to 50 files because it contains too many changes.   See raw diff
Files changed (50) hide show
  1. eval/ar_baseline_latest_test/logs/temp0.2_gpu1.log +50 -0
  2. eval/ar_baseline_latest_test/logs/temp0.2_gpu3.log +50 -0
  3. eval/ar_baseline_latest_test/logs/temp0.2_gpu5.log +50 -0
  4. eval/ar_baseline_latest_test/logs/temp0.4_gpu5.log +50 -0
  5. eval/ar_baseline_latest_test/logs/temp0.4_gpu7.log +50 -0
  6. eval/ar_baseline_latest_test/logs/temp0.82_gpu6.log +50 -0
  7. eval/ar_baseline_latest_test/logs/temp0.84_gpu0.log +50 -0
  8. eval/ar_baseline_latest_test/logs/temp0.84_gpu2.log +50 -0
  9. eval/ar_baseline_latest_test/logs/temp0.84_gpu6.log +50 -0
  10. eval/ar_baseline_latest_test/logs/temp0.86_gpu0.log +50 -0
  11. eval/ar_baseline_latest_test/logs/temp0.8_gpu3.log +50 -0
  12. eval/ar_baseline_latest_test/logs/temp0.8_gpu4.log +50 -0
  13. eval/ar_baseline_latest_test/logs/temp0.8_gpu7.log +50 -0
  14. eval/ar_baseline_latest_test/logs/temp0.92_gpu0.log +50 -0
  15. eval/ar_baseline_latest_test/logs/temp0.92_gpu6.log +50 -0
  16. eval/ar_baseline_latest_test/logs/temp0.94_gpu0.log +50 -0
  17. eval/ar_baseline_latest_test/logs/temp0.94_gpu2.log +50 -0
  18. eval/ar_baseline_latest_test/logs/temp0.94_gpu5.log +50 -0
  19. eval/ar_baseline_latest_test/logs/temp0.94_gpu6.log +50 -0
  20. eval/ar_baseline_latest_test/logs/temp0.96_gpu7.log +50 -0
  21. eval/ar_baseline_latest_test/logs/temp0.98_gpu1.log +50 -0
  22. eval/ar_baseline_latest_test/logs/temp0.98_gpu2.log +50 -0
  23. eval/ar_baseline_latest_test/logs/temp0.9_gpu2.log +50 -0
  24. eval/ar_baseline_latest_test/logs/temp0.9_gpu4.log +50 -0
  25. eval/ar_baseline_latest_test/logs/temp1_gpu7.log +50 -0
  26. eval/h2_mixed_latest_test/logs/pps1_lam0.2_temp0.98_gpu4.log +53 -0
  27. eval/h2_mixed_latest_test/logs/pps1_lam0.2_temp1_gpu6.log +53 -0
  28. eval/h2_mixed_latest_test/logs/pps1_lam0.2_temp1_gpu7.log +53 -0
  29. eval/h2_mixed_latest_test/logs/pps1_lam0.3_temp0.8_gpu1.log +52 -0
  30. eval/h2_mixed_latest_test/logs/pps1_lam0.3_temp0.8_gpu3.log +52 -0
  31. eval/h2_mixed_latest_test/logs/pps1_lam0.4_temp0.8_gpu0.log +40 -0
  32. eval/h2_mixed_latest_test/logs/pps1_lam0.6_temp0.98_gpu4.log +53 -0
  33. eval/h2_mixed_latest_test/logs/pps1_lam0.6_temp0.9_gpu5.log +55 -0
  34. eval/h2_mixed_latest_test/logs/pps1_lam0.7_temp0.9_gpu0.log +51 -0
  35. eval/h2_mixed_latest_test/logs/pps1_lam0_temp0.7_gpu1.log +55 -0
  36. eval/h2_mixed_latest_test/logs/pps2_lam0.2_temp1_gpu1.log +53 -0
  37. eval/h2_mixed_latest_test/logs/pps2_lam0.3_temp0.8_gpu4.log +52 -0
  38. eval/h2_mixed_latest_test/logs/pps2_lam0.3_temp0.9_gpu4.log +51 -0
  39. eval/h2_mixed_latest_test/logs/pps2_lam0.6_temp0.94_gpu3.log +53 -0
  40. eval/h2_mixed_latest_test/logs/pps2_lam0.6_temp1_gpu5.log +53 -0
  41. eval/h2_mixed_latest_test/logs/pps2_lam0.6_temp1_gpu6.log +53 -0
  42. eval/h2_mixed_latest_test/logs/pps2_lam0.7_temp0.9_gpu6.log +51 -0
  43. eval/h2_mixed_latest_test/logs/pps2_lam0.8_temp0.7_gpu4.log +51 -0
  44. eval/h2_mixed_latest_test/logs/pps2_lam0.8_temp0.94_gpu1.log +53 -0
  45. eval/h2_mixed_latest_test/logs/pps2_lam0.8_temp0.96_gpu0.log +53 -0
  46. eval/h2_mixed_latest_test/logs/pps2_lam0.8_temp0.96_gpu3.log +53 -0
  47. eval/h2_mixed_latest_test/logs/pps2_lam0.9_temp0.8_gpu7.log +52 -0
  48. eval/h2_mixed_latest_test/logs/pps2_lam0_temp0.8_gpu2.log +51 -0
  49. eval/h2_mixed_latest_test/logs/pps2_lam1_temp0.8_gpu3.log +51 -0
  50. eval/h2_mixed_latest_test/logs/pps2_lam1_temp0.9_gpu6.log +51 -0
eval/ar_baseline_latest_test/logs/temp0.2_gpu1.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.2)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'The first-ever “Star Wars” movie is set to hit theaters on May 25, 2018, but the film’s director, George Lucas, has alre'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 0.3384644670114785,
17
+ "median_nll": 0.002919342485256493,
18
+ "ppl": 1.4027919026796367,
19
+ "acc": 0.9352297310387137,
20
+ "tokens": 61942,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.2,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.2_gpu1.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.2_gpu1.json
36
+ Diversity metrics for temp0.2_gpu1.json:
37
+ distinct_1: 0.0380
38
+ repetition_1: 0.8770
39
+ d1: 0.0380
40
+ r1: 0.8770
41
+ distinct_2: 0.0906
42
+ repetition_2: 0.8249
43
+ d2: 0.0906
44
+ r2: 0.8249
45
+ distinct_4: 0.1524
46
+ repetition_4: 0.7935
47
+ d4: 0.1524
48
+ r4: 0.7935
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.2_gpu1.json
eval/ar_baseline_latest_test/logs/temp0.2_gpu3.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.2)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'The U.S. Army Corps of Engineers has approved a plan to build a $1.6 billion, 1,000-mile pipeline that would carry oil f'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 0.35488078943010276,
17
+ "median_nll": 0.003100768430158496,
18
+ "ppl": 1.4260106486063449,
19
+ "acc": 0.9321503131524008,
20
+ "tokens": 62270,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.2,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.2_gpu3.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.2_gpu3.json
36
+ Diversity metrics for temp0.2_gpu3.json:
37
+ distinct_1: 0.0375
38
+ repetition_1: 0.8804
39
+ d1: 0.0375
40
+ r1: 0.8804
41
+ distinct_2: 0.0909
42
+ repetition_2: 0.8279
43
+ d2: 0.0909
44
+ r2: 0.8279
45
+ distinct_4: 0.1540
46
+ repetition_4: 0.7965
47
+ d4: 0.1540
48
+ r4: 0.7965
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.2_gpu3.json
eval/ar_baseline_latest_test/logs/temp0.2_gpu5.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.2)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'The first time I saw the movie, I was in the middle of a long drive to the airport. I was driving a car, and I was in th'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 0.36794694845510534,
17
+ "median_nll": 0.0035996540682390332,
18
+ "ppl": 1.4447653899047765,
19
+ "acc": 0.9298173021834617,
20
+ "tokens": 62836,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.2,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.2_gpu5.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.2_gpu5.json
36
+ Diversity metrics for temp0.2_gpu5.json:
37
+ distinct_1: 0.0388
38
+ repetition_1: 0.8733
39
+ d1: 0.0388
40
+ r1: 0.8733
41
+ distinct_2: 0.0973
42
+ repetition_2: 0.8148
43
+ d2: 0.0973
44
+ r2: 0.8148
45
+ distinct_4: 0.1693
46
+ repetition_4: 0.7799
47
+ d4: 0.1693
48
+ r4: 0.7799
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.2_gpu5.json
eval/ar_baseline_latest_test/logs/temp0.4_gpu5.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.4)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'The United States has been on a roll in the global economic and financial crisis, but its efforts to contain the crisis '
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 0.6422196306169079,
17
+ "median_nll": 0.022978578694164753,
18
+ "ppl": 1.900695041540618,
19
+ "acc": 0.8628368331338628,
20
+ "tokens": 55146,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.4,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.4_gpu5.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.4_gpu5.json
36
+ Diversity metrics for temp0.4_gpu5.json:
37
+ distinct_1: 0.0767
38
+ repetition_1: 0.7744
39
+ d1: 0.0767
40
+ r1: 0.7744
41
+ distinct_2: 0.2035
42
+ repetition_2: 0.6561
43
+ d2: 0.2035
44
+ r2: 0.6561
45
+ distinct_4: 0.3410
46
+ repetition_4: 0.5816
47
+ d4: 0.3410
48
+ r4: 0.5816
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.4_gpu5.json
eval/ar_baseline_latest_test/logs/temp0.4_gpu7.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.4)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'The U.S. Department of Justice has issued a subpoena to the New York Times and its owner, Daniel Richman, seeking docume'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 0.6613957768165036,
17
+ "median_nll": 0.03448391519486904,
18
+ "ppl": 1.9374947582386717,
19
+ "acc": 0.8539113160163424,
20
+ "tokens": 53358,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.4,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.4_gpu7.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.4_gpu7.json
36
+ Diversity metrics for temp0.4_gpu7.json:
37
+ distinct_1: 0.0866
38
+ repetition_1: 0.7545
39
+ d1: 0.0866
40
+ r1: 0.7545
41
+ distinct_2: 0.2257
42
+ repetition_2: 0.6243
43
+ d2: 0.2257
44
+ r2: 0.6243
45
+ distinct_4: 0.3803
46
+ repetition_4: 0.5404
47
+ d4: 0.3803
48
+ r4: 0.5404
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.4_gpu7.json
eval/ar_baseline_latest_test/logs/temp0.82_gpu6.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.82)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'BETHLEHEM (Ma’an) -- The Palestinian Authority on Wednesday announced it was establishing a new state in the West Bank w'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 2.3033388616360484,
17
+ "median_nll": 1.5766230821609497,
18
+ "ppl": 10.007540527969768,
19
+ "acc": 0.5048616140997784,
20
+ "tokens": 45561,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.82,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.82_gpu6.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.82_gpu6.json
36
+ Diversity metrics for temp0.82_gpu6.json:
37
+ distinct_1: 0.2445
38
+ repetition_1: 0.4226
39
+ d1: 0.2445
40
+ r1: 0.4226
41
+ distinct_2: 0.6910
42
+ repetition_2: 0.1198
43
+ d2: 0.6910
44
+ r2: 0.1198
45
+ distinct_4: 0.9589
46
+ repetition_4: 0.0340
47
+ d4: 0.9589
48
+ r4: 0.0340
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.82_gpu6.json
eval/ar_baseline_latest_test/logs/temp0.84_gpu0.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.84)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'The protagonist of the Möbius strip is a high school student who is teaching the world about the “Mokai,” the Japanese t'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 2.4762633348149796,
17
+ "median_nll": 1.748022437095642,
18
+ "ppl": 11.896727173041405,
19
+ "acc": 0.477586398488721,
20
+ "tokens": 44995,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.84,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.84_gpu0.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.84_gpu0.json
36
+ Diversity metrics for temp0.84_gpu0.json:
37
+ distinct_1: 0.2500
38
+ repetition_1: 0.4025
39
+ d1: 0.2500
40
+ r1: 0.4025
41
+ distinct_2: 0.7106
42
+ repetition_2: 0.0995
43
+ d2: 0.7106
44
+ r2: 0.0995
45
+ distinct_4: 0.9752
46
+ repetition_4: 0.0205
47
+ d4: 0.9752
48
+ r4: 0.0205
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.84_gpu0.json
eval/ar_baseline_latest_test/logs/temp0.84_gpu2.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.84)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'LONDON — The British government’s allowance for tax avoidance had been so underreported that in some cases they were so '
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 2.436140074805089,
17
+ "median_nll": 1.7247057557106018,
18
+ "ppl": 11.428841022454263,
19
+ "acc": 0.47911668951336533,
20
+ "tokens": 46688,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.84,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.84_gpu2.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.84_gpu2.json
36
+ Diversity metrics for temp0.84_gpu2.json:
37
+ distinct_1: 0.2474
38
+ repetition_1: 0.4114
39
+ d1: 0.2474
40
+ r1: 0.4114
41
+ distinct_2: 0.7007
42
+ repetition_2: 0.1073
43
+ d2: 0.7007
44
+ r2: 0.1073
45
+ distinct_4: 0.9659
46
+ repetition_4: 0.0270
47
+ d4: 0.9659
48
+ r4: 0.0270
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.84_gpu2.json
eval/ar_baseline_latest_test/logs/temp0.84_gpu6.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.84)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'BETHLEHEM (Ma’an) -- The Palestinian Authority on Wednesday announced it was establishing a “protective force” in the We'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 2.484979679385866,
17
+ "median_nll": 1.7636990547180176,
18
+ "ppl": 12.000876387175099,
19
+ "acc": 0.47349288778505305,
20
+ "tokens": 44290,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.84,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.84_gpu6.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.84_gpu6.json
36
+ Diversity metrics for temp0.84_gpu6.json:
37
+ distinct_1: 0.2487
38
+ repetition_1: 0.4072
39
+ d1: 0.2487
40
+ r1: 0.4072
41
+ distinct_2: 0.7112
42
+ repetition_2: 0.1041
43
+ d2: 0.7112
44
+ r2: 0.1041
45
+ distinct_4: 0.9685
46
+ repetition_4: 0.0285
47
+ d4: 0.9685
48
+ r4: 0.0285
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.84_gpu6.json
eval/ar_baseline_latest_test/logs/temp0.86_gpu0.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.86)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'The protagonist of the Möbius strip is a high school student who is teaching the world about the “Mokai,” the Japanese t'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 2.579709587299751,
17
+ "median_nll": 1.811776041984558,
18
+ "ppl": 13.193306099596239,
19
+ "acc": 0.46876446089773255,
20
+ "tokens": 45381,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.86,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.86_gpu0.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.86_gpu0.json
36
+ Diversity metrics for temp0.86_gpu0.json:
37
+ distinct_1: 0.2587
38
+ repetition_1: 0.3975
39
+ d1: 0.2587
40
+ r1: 0.3975
41
+ distinct_2: 0.7234
42
+ repetition_2: 0.0981
43
+ d2: 0.7234
44
+ r2: 0.0981
45
+ distinct_4: 0.9763
46
+ repetition_4: 0.0233
47
+ d4: 0.9763
48
+ r4: 0.0233
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.86_gpu0.json
eval/ar_baseline_latest_test/logs/temp0.8_gpu3.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.8)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'Jürgen Klopp has hailed the work of the Liverpool Foundation, who are working to raise funds to help children in the are'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 2.2107951077390418,
17
+ "median_nll": 1.5452141761779785,
18
+ "ppl": 9.122967251916329,
19
+ "acc": 0.5083579377697025,
20
+ "tokens": 44030,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.8,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.8_gpu3.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.8_gpu3.json
36
+ Diversity metrics for temp0.8_gpu3.json:
37
+ distinct_1: 0.2305
38
+ repetition_1: 0.4438
39
+ d1: 0.2305
40
+ r1: 0.4438
41
+ distinct_2: 0.6679
42
+ repetition_2: 0.1320
43
+ d2: 0.6679
44
+ r2: 0.1320
45
+ distinct_4: 0.9588
46
+ repetition_4: 0.0337
47
+ d4: 0.9588
48
+ r4: 0.0337
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.8_gpu3.json
eval/ar_baseline_latest_test/logs/temp0.8_gpu4.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.8)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'There is a lot of interest when it comes to the Blackhawks, and the World Series and Stanley Cup. Here’s a few great way'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 2.2282093542073826,
17
+ "median_nll": 1.5320324897766113,
18
+ "ppl": 9.283228214123909,
19
+ "acc": 0.5137793978787413,
20
+ "tokens": 45539,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.8,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.8_gpu4.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.8_gpu4.json
36
+ Diversity metrics for temp0.8_gpu4.json:
37
+ distinct_1: 0.2408
38
+ repetition_1: 0.4306
39
+ d1: 0.2408
40
+ r1: 0.4306
41
+ distinct_2: 0.6806
42
+ repetition_2: 0.1304
43
+ d2: 0.6806
44
+ r2: 0.1304
45
+ distinct_4: 0.9530
46
+ repetition_4: 0.0372
47
+ d4: 0.9530
48
+ r4: 0.0372
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.8_gpu4.json
eval/ar_baseline_latest_test/logs/temp0.8_gpu7.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.8)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: '“Muppets” creators John DiLanzo and Gary Ungarick have announced that they will be returning to the studio with “Star Wa'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 2.2224382537774003,
17
+ "median_nll": 1.5243245959281921,
18
+ "ppl": 9.229808066569772,
19
+ "acc": 0.5135588247621443,
20
+ "tokens": 47718,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.8,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.8_gpu7.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.8_gpu7.json
36
+ Diversity metrics for temp0.8_gpu7.json:
37
+ distinct_1: 0.2386
38
+ repetition_1: 0.4307
39
+ d1: 0.2386
40
+ r1: 0.4307
41
+ distinct_2: 0.6809
42
+ repetition_2: 0.1280
43
+ d2: 0.6809
44
+ r2: 0.1280
45
+ distinct_4: 0.9595
46
+ repetition_4: 0.0308
47
+ d4: 0.9595
48
+ r4: 0.0308
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.8_gpu7.json
eval/ar_baseline_latest_test/logs/temp0.92_gpu0.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.92)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'The protagonist? Angela Möller. The screenwriter?\n\nGlenn Tych at The Telegraph has had a chance to take a look at the sc'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 3.0223417018101086,
17
+ "median_nll": 2.2005038261413574,
18
+ "ppl": 20.53933240559053,
19
+ "acc": 0.41460409186513414,
20
+ "tokens": 47069,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.92,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.92_gpu0.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.92_gpu0.json
36
+ Diversity metrics for temp0.92_gpu0.json:
37
+ distinct_1: 0.2825
38
+ repetition_1: 0.3581
39
+ d1: 0.2825
40
+ r1: 0.3581
41
+ distinct_2: 0.7673
42
+ repetition_2: 0.0632
43
+ d2: 0.7673
44
+ r2: 0.0632
45
+ distinct_4: 0.9886
46
+ repetition_4: 0.0095
47
+ d4: 0.9886
48
+ r4: 0.0095
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.92_gpu0.json
eval/ar_baseline_latest_test/logs/temp0.92_gpu6.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.92)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'BETHLEHEM (Ma’an) -- The Palestinian Authority on Wednesday announced it was establishing a “protective force” in the We'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 3.0061634738295786,
17
+ "median_nll": 2.166841506958008,
18
+ "ppl": 20.209715898184825,
19
+ "acc": 0.41916044648359924,
20
+ "tokens": 43809,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.92,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.92_gpu6.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.92_gpu6.json
36
+ Diversity metrics for temp0.92_gpu6.json:
37
+ distinct_1: 0.2937
38
+ repetition_1: 0.3543
39
+ d1: 0.2937
40
+ r1: 0.3543
41
+ distinct_2: 0.7686
42
+ repetition_2: 0.0697
43
+ d2: 0.7686
44
+ r2: 0.0697
45
+ distinct_4: 0.9845
46
+ repetition_4: 0.0134
47
+ d4: 0.9845
48
+ r4: 0.0134
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.92_gpu6.json
eval/ar_baseline_latest_test/logs/temp0.94_gpu0.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.94)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'The protagonist? Angela Möttins, better known as "Griezmann" at Real Madrid.\n\nIn reality, this role in the history of th'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 3.186605011933174,
17
+ "median_nll": 2.3521339893341064,
18
+ "ppl": 24.20610833702178,
19
+ "acc": 0.39720741418151806,
20
+ "tokens": 44833,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.94,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.94_gpu0.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.94_gpu0.json
36
+ Diversity metrics for temp0.94_gpu0.json:
37
+ distinct_1: 0.2940
38
+ repetition_1: 0.3367
39
+ d1: 0.2940
40
+ r1: 0.3367
41
+ distinct_2: 0.7849
42
+ repetition_2: 0.0527
43
+ d2: 0.7849
44
+ r2: 0.0527
45
+ distinct_4: 0.9901
46
+ repetition_4: 0.0084
47
+ d4: 0.9901
48
+ r4: 0.0084
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.94_gpu0.json
eval/ar_baseline_latest_test/logs/temp0.94_gpu2.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.94)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'LONDON — The British media reported in articles Wednesday that ISIS has taken over Kirkuk, the Iraqi town that is disput'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 3.175500140291807,
17
+ "median_nll": 2.341375946998596,
18
+ "ppl": 23.93878962807616,
19
+ "acc": 0.3984287317620651,
20
+ "tokens": 44550,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.94,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.94_gpu2.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.94_gpu2.json
36
+ Diversity metrics for temp0.94_gpu2.json:
37
+ distinct_1: 0.2911
38
+ repetition_1: 0.3433
39
+ d1: 0.2911
40
+ r1: 0.3433
41
+ distinct_2: 0.7821
42
+ repetition_2: 0.0540
43
+ d2: 0.7821
44
+ r2: 0.0540
45
+ distinct_4: 0.9914
46
+ repetition_4: 0.0063
47
+ d4: 0.9914
48
+ r4: 0.0063
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.94_gpu2.json
eval/ar_baseline_latest_test/logs/temp0.94_gpu5.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.94)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'Bless up! So happy to be back to where I started!I want to thank yoeoi for the email comment taking me back to when I go'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 3.2659872423456764,
17
+ "median_nll": 2.4272470474243164,
18
+ "ppl": 26.205969867396313,
19
+ "acc": 0.39182821610689156,
20
+ "tokens": 46477,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.94,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.94_gpu5.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.94_gpu5.json
36
+ Diversity metrics for temp0.94_gpu5.json:
37
+ distinct_1: 0.2964
38
+ repetition_1: 0.3412
39
+ d1: 0.2964
40
+ r1: 0.3412
41
+ distinct_2: 0.7810
42
+ repetition_2: 0.0550
43
+ d2: 0.7810
44
+ r2: 0.0550
45
+ distinct_4: 0.9902
46
+ repetition_4: 0.0068
47
+ d4: 0.9902
48
+ r4: 0.0068
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.94_gpu5.json
eval/ar_baseline_latest_test/logs/temp0.94_gpu6.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.94)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'BETHLEHEM (Ma’an) -- The Palestinian Authority on Wednesday announced it was establishing a “protective force” in the We'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 3.192733724355068,
17
+ "median_nll": 2.3344547748565674,
18
+ "ppl": 24.354916148231116,
19
+ "acc": 0.4002527817274923,
20
+ "tokens": 44307,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.94,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.94_gpu6.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.94_gpu6.json
36
+ Diversity metrics for temp0.94_gpu6.json:
37
+ distinct_1: 0.3008
38
+ repetition_1: 0.3345
39
+ d1: 0.3008
40
+ r1: 0.3345
41
+ distinct_2: 0.7881
42
+ repetition_2: 0.0529
43
+ d2: 0.7881
44
+ r2: 0.0529
45
+ distinct_4: 0.9895
46
+ repetition_4: 0.0072
47
+ d4: 0.9895
48
+ r4: 0.0072
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.94_gpu6.json
eval/ar_baseline_latest_test/logs/temp0.96_gpu7.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.96)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: '“Muppets” creators William And Bryan Thompson and Coleman Hentzen are perhaps the biggest Javascript evangelists you won'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 3.347551785956083,
17
+ "median_nll": 2.4971165657043457,
18
+ "ppl": 28.43303820046356,
19
+ "acc": 0.3820270361761188,
20
+ "tokens": 44311,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.96,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.96_gpu7.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.96_gpu7.json
36
+ Diversity metrics for temp0.96_gpu7.json:
37
+ distinct_1: 0.3048
38
+ repetition_1: 0.3282
39
+ d1: 0.3048
40
+ r1: 0.3282
41
+ distinct_2: 0.7967
42
+ repetition_2: 0.0504
43
+ d2: 0.7967
44
+ r2: 0.0504
45
+ distinct_4: 0.9934
46
+ repetition_4: 0.0056
47
+ d4: 0.9934
48
+ r4: 0.0056
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.96_gpu7.json
eval/ar_baseline_latest_test/logs/temp0.98_gpu1.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.98)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: "First and foremost we'd like to thank everyone who participated in the Equestrian/SFX / Rock ’Em Puppy contest and those"
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 3.492161918339162,
17
+ "median_nll": 2.6467158794403076,
18
+ "ppl": 32.8569049220607,
19
+ "acc": 0.37063684761544113,
20
+ "tokens": 44893,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.98,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.98_gpu1.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.98_gpu1.json
36
+ Diversity metrics for temp0.98_gpu1.json:
37
+ distinct_1: 0.3052
38
+ repetition_1: 0.3218
39
+ d1: 0.3052
40
+ r1: 0.3218
41
+ distinct_2: 0.7911
42
+ repetition_2: 0.0527
43
+ d2: 0.7911
44
+ r2: 0.0527
45
+ distinct_4: 0.9768
46
+ repetition_4: 0.0154
47
+ d4: 0.9768
48
+ r4: 0.0154
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.98_gpu1.json
eval/ar_baseline_latest_test/logs/temp0.98_gpu2.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.98)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'LONDON — The British media reported in articles Wednesday that ISIS has taken over Kirkuk, the Iraqi town that is disput'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 3.5845073000923775,
17
+ "median_nll": 2.740861415863037,
18
+ "ppl": 36.03559860815703,
19
+ "acc": 0.3579749002996643,
20
+ "tokens": 44383,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.98,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.98_gpu2.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.98_gpu2.json
36
+ Diversity metrics for temp0.98_gpu2.json:
37
+ distinct_1: 0.3213
38
+ repetition_1: 0.3055
39
+ d1: 0.3213
40
+ r1: 0.3055
41
+ distinct_2: 0.8150
42
+ repetition_2: 0.0394
43
+ d2: 0.8150
44
+ r2: 0.0394
45
+ distinct_4: 0.9945
46
+ repetition_4: 0.0031
47
+ d4: 0.9945
48
+ r4: 0.0031
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.98_gpu2.json
eval/ar_baseline_latest_test/logs/temp0.9_gpu2.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.9)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'LONDON — The British media reported in articles Wednesday that the New York-based investment fund founded in London by e'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 2.8760180329326013,
17
+ "median_nll": 2.0924065113067627,
18
+ "ppl": 17.74347837531484,
19
+ "acc": 0.4278127152729939,
20
+ "tokens": 45001,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.9,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.9_gpu2.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.9_gpu2.json
36
+ Diversity metrics for temp0.9_gpu2.json:
37
+ distinct_1: 0.2695
38
+ repetition_1: 0.3647
39
+ d1: 0.2695
40
+ r1: 0.3647
41
+ distinct_2: 0.7520
42
+ repetition_2: 0.0685
43
+ d2: 0.7520
44
+ r2: 0.0685
45
+ distinct_4: 0.9846
46
+ repetition_4: 0.0106
47
+ d4: 0.9846
48
+ r4: 0.0106
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.9_gpu2.json
eval/ar_baseline_latest_test/logs/temp0.9_gpu4.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=0.9)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: 'There is much heroism in the history of theatre in the United States. Whom to thank for this? Civil rights activist and '
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 2.866953418245275,
17
+ "median_nll": 2.039194107055664,
18
+ "ppl": 17.58336734933049,
19
+ "acc": 0.4339618499901223,
20
+ "tokens": 45557,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 0.9,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.9_gpu4.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.9_gpu4.json
36
+ Diversity metrics for temp0.9_gpu4.json:
37
+ distinct_1: 0.2818
38
+ repetition_1: 0.3673
39
+ d1: 0.2818
40
+ r1: 0.3673
41
+ distinct_2: 0.7574
42
+ repetition_2: 0.0721
43
+ d2: 0.7574
44
+ r2: 0.0721
45
+ distinct_4: 0.9824
46
+ repetition_4: 0.0126
47
+ d4: 0.9824
48
+ r4: 0.0126
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.9_gpu4.json
eval/ar_baseline_latest_test/logs/temp1_gpu7.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
3
+ Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
4
+ Generating 128 samples (seq_len=512, temperature=1.0)...
5
+ sampled 64/128
6
+ sampled 128/128
7
+ First sample preview: '“Muppets” creators William And Bryan Thompson and Coleman Hentzen are perhaps the biggest Javascript evangelists you won'
8
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
9
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
10
+
11
+ Eval LM loaded (774,030,080 params)
12
+ Scoring samples under eval LM...
13
+ scored 64/128
14
+ scored 128/128
15
+ {
16
+ "avg_nll": 3.868952017700726,
17
+ "median_nll": 3.053391456604004,
18
+ "ppl": 47.892169626395194,
19
+ "acc": 0.3375880753003662,
20
+ "tokens": 46693,
21
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
22
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
23
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
24
+ "num_samples": 128,
25
+ "generated_seq_len": 512,
26
+ "mode": "ar_generation",
27
+ "temperature": 1.0,
28
+ "top_k": 0,
29
+ "top_p": 1.0,
30
+ "prompt_len": 1,
31
+ "max_new_tokens": 511,
32
+ "stop_on_eos": false
33
+ }
34
+ Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp1_gpu7.json
35
+ Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp1_gpu7.json
36
+ Diversity metrics for temp1_gpu7.json:
37
+ distinct_1: 0.3382
38
+ repetition_1: 0.2992
39
+ d1: 0.3382
40
+ r1: 0.2992
41
+ distinct_2: 0.8313
42
+ repetition_2: 0.0370
43
+ d2: 0.8313
44
+ r2: 0.0370
45
+ distinct_4: 0.9945
46
+ repetition_4: 0.0036
47
+ d4: 0.9945
48
+ r4: 0.0036
49
+ num_samples: 128.0000
50
+ Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp1_gpu7.json
eval/h2_mixed_latest_test/logs/pps1_lam0.2_temp0.98_gpu4.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.2, 0.2]
5
+ leaf_temperature = 0.98
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 871)
8
+ Average denoising rounds per sample: 871.00
9
+ First sample preview: '. "It was like it was the alleged victim at night. It was so dark, and as the computers woke up -- having really shut up'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.002073652772666,
21
+ "median_nll": 4.476129055023193,
22
+ "ppl": 148.72123577307576,
23
+ "acc": 0.2389584100110416,
24
+ "tokens": 65208,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.2,0.2",
33
+ "avg_steps": 871.0,
34
+ "positions_per_step": 1,
35
+ "leaf_temperature": 0.98
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.2_temp0.98_gpu4.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.2_temp0.98_gpu4.json
39
+ Diversity metrics for pps1_lam0.2_temp0.98_gpu4.json:
40
+ distinct_1: 0.3263
41
+ repetition_1: 0.3001
42
+ d1: 0.3263
43
+ r1: 0.3001
44
+ distinct_2: 0.8356
45
+ repetition_2: 0.0237
46
+ d2: 0.8356
47
+ r2: 0.0237
48
+ distinct_4: 0.9988
49
+ repetition_4: 0.0006
50
+ d4: 0.9988
51
+ r4: 0.0006
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0.2_temp0.98_gpu4.json
eval/h2_mixed_latest_test/logs/pps1_lam0.2_temp1_gpu6.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.2, 0.2]
5
+ leaf_temperature = 1.0
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 953)
8
+ Average denoising rounds per sample: 953.00
9
+ First sample preview: ' to point to Twitter will help too.\n\n20: The CW •• DC • Eleventh\u200bArrow plus CW\n\nTriDest does have an expanded look withi'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.225233735122243,
21
+ "median_nll": 4.764096021652222,
22
+ "ppl": 185.9046178867565,
23
+ "acc": 0.21908647504524678,
24
+ "tokens": 65198,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.2,0.2",
33
+ "avg_steps": 953.0,
34
+ "positions_per_step": 1,
35
+ "leaf_temperature": 1.0
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.2_temp1_gpu6.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.2_temp1_gpu6.json
39
+ Diversity metrics for pps1_lam0.2_temp1_gpu6.json:
40
+ distinct_1: 0.3313
41
+ repetition_1: 0.3016
42
+ d1: 0.3313
43
+ r1: 0.3016
44
+ distinct_2: 0.8383
45
+ repetition_2: 0.0243
46
+ d2: 0.8383
47
+ r2: 0.0243
48
+ distinct_4: 0.9984
49
+ repetition_4: 0.0009
50
+ d4: 0.9984
51
+ r4: 0.0009
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0.2_temp1_gpu6.json
eval/h2_mixed_latest_test/logs/pps1_lam0.2_temp1_gpu7.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.2, 0.2]
5
+ leaf_temperature = 1.0
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 939)
8
+ Average denoising rounds per sample: 939.00
9
+ First sample preview: 's her resounding expedition to fuel use failed to kill the house, which eloquently echoes a notorious perhaps like Frank'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.26980805105218,
21
+ "median_nll": 4.809404373168945,
22
+ "ppl": 194.3786480873024,
23
+ "acc": 0.21971532869106414,
24
+ "tokens": 65198,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.2,0.2",
33
+ "avg_steps": 939.0,
34
+ "positions_per_step": 1,
35
+ "leaf_temperature": 1.0
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.2_temp1_gpu7.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.2_temp1_gpu7.json
39
+ Diversity metrics for pps1_lam0.2_temp1_gpu7.json:
40
+ distinct_1: 0.3403
41
+ repetition_1: 0.2934
42
+ d1: 0.3403
43
+ r1: 0.2934
44
+ distinct_2: 0.8462
45
+ repetition_2: 0.0225
46
+ d2: 0.8462
47
+ r2: 0.0225
48
+ distinct_4: 0.9992
49
+ repetition_4: 0.0003
50
+ d4: 0.9992
51
+ r4: 0.0003
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0.2_temp1_gpu7.json
eval/h2_mixed_latest_test/logs/pps1_lam0.3_temp0.8_gpu1.log ADDED
@@ -0,0 +1,52 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.3, 0.3]
5
+ leaf_temperature = 0.8
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 736)
8
+ Average denoising rounds per sample: 736.00
9
+ First sample preview: ' 3, 4, 7 3, 2, 8, 5, 7 3, 3, 3, 4 3, 3, 5 3, 3, 3 3, 3, 8, 7 3, 3, 6, 5 3, 3, 6, 6 3, 3, 3, 3 7 3, 5 4, 1, 2, 1, 7 5, 1,'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 3.1288898825283176,
21
+ "median_nll": 2.3229328393936157,
22
+ "ppl": 22.848600827387646,
23
+ "acc": 0.39922337845719374,
24
+ "tokens": 65154,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "level_lambdas": "0.3,0.3",
32
+ "avg_steps": 736.0,
33
+ "positions_per_step": 1,
34
+ "leaf_temperature": 0.8
35
+ }
36
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.3_temp0.8_gpu1.json
37
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.3_temp0.8_gpu1.json
38
+ Diversity metrics for pps1_lam0.3_temp0.8_gpu1.json:
39
+ distinct_1: 0.2121
40
+ repetition_1: 0.4603
41
+ d1: 0.2121
42
+ r1: 0.4603
43
+ distinct_2: 0.6760
44
+ repetition_2: 0.1178
45
+ d2: 0.6760
46
+ r2: 0.1178
47
+ distinct_4: 0.9735
48
+ repetition_4: 0.0227
49
+ d4: 0.9735
50
+ r4: 0.0227
51
+ num_samples: 128.0000
52
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0.3_temp0.8_gpu1.json
eval/h2_mixed_latest_test/logs/pps1_lam0.3_temp0.8_gpu3.log ADDED
@@ -0,0 +1,52 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.3, 0.3]
5
+ leaf_temperature = 0.8
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 753)
8
+ Average denoising rounds per sample: 753.00
9
+ First sample preview: ' sure that nobody covers them.\n\nAdvertisement\n\nThey chanted and sang for the national anthem and the Astoria State anthe'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 3.202027189317,
21
+ "median_nll": 2.4177517890930176,
22
+ "ppl": 24.582312722497303,
23
+ "acc": 0.3893960081616372,
24
+ "tokens": 65183,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "level_lambdas": "0.3,0.3",
32
+ "avg_steps": 753.0,
33
+ "positions_per_step": 1,
34
+ "leaf_temperature": 0.8
35
+ }
36
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.3_temp0.8_gpu3.json
37
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.3_temp0.8_gpu3.json
38
+ Diversity metrics for pps1_lam0.3_temp0.8_gpu3.json:
39
+ distinct_1: 0.2134
40
+ repetition_1: 0.4545
41
+ d1: 0.2134
42
+ r1: 0.4545
43
+ distinct_2: 0.6809
44
+ repetition_2: 0.1049
45
+ d2: 0.6809
46
+ r2: 0.1049
47
+ distinct_4: 0.9807
48
+ repetition_4: 0.0124
49
+ d4: 0.9807
50
+ r4: 0.0124
51
+ num_samples: 128.0000
52
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0.3_temp0.8_gpu3.json
eval/h2_mixed_latest_test/logs/pps1_lam0.4_temp0.8_gpu0.log ADDED
@@ -0,0 +1,40 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.4, 0.4]
5
+ leaf_temperature = 0.8
6
+ Generating 128 samples (L=512)...
7
+ sampled 32/128 (steps this call: 778)
8
+ sampled 64/128 (steps this call: 812)
9
+ sampled 96/128 (steps this call: 821)
10
+ sampled 128/128 (steps this call: 832)
11
+ Average denoising rounds per sample: 810.75
12
+ First sample preview: 'Australians hate Kim Shau, a social media user who would like to say: "Oh no, only rich people are waiting for me", says'
13
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
14
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
15
+
16
+ Eval LM loaded (774,030,080 params)
17
+ Scoring samples under eval LM...
18
+ scored 32/128
19
+ scored 64/128
20
+ scored 96/128
21
+ scored 128/128
22
+ {
23
+ "avg_nll": 3.2707012796030432,
24
+ "median_nll": 2.45578670501709,
25
+ "ppl": 26.329797420256064,
26
+ "acc": 0.3880606172157801,
27
+ "tokens": 65196,
28
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
29
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
30
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "num_samples": 128,
32
+ "generated_seq_len": 512,
33
+ "mode": "sad_generation",
34
+ "level_lambdas": "0.4,0.4",
35
+ "avg_steps": 810.75,
36
+ "positions_per_step": 1,
37
+ "leaf_temperature": 0.8
38
+ }
39
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.4_temp0.8_gpu0.json
40
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.4_temp0.8_gpu0.json
eval/h2_mixed_latest_test/logs/pps1_lam0.6_temp0.98_gpu4.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.6, 0.6]
5
+ leaf_temperature = 0.98
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 1333)
8
+ Average denoising rounds per sample: 1333.00
9
+ First sample preview: '. "It was clear what came out of the scorpion. We ran a tar, tape and a pencil as it goes but we have our first nail cut'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 4.9946654149401475,
21
+ "median_nll": 4.464876890182495,
22
+ "ppl": 147.62354448706483,
23
+ "acc": 0.2424953959484346,
24
+ "tokens": 65160,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6,0.6",
33
+ "avg_steps": 1333.0,
34
+ "positions_per_step": 1,
35
+ "leaf_temperature": 0.98
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.6_temp0.98_gpu4.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.6_temp0.98_gpu4.json
39
+ Diversity metrics for pps1_lam0.6_temp0.98_gpu4.json:
40
+ distinct_1: 0.3372
41
+ repetition_1: 0.3038
42
+ d1: 0.3372
43
+ r1: 0.3038
44
+ distinct_2: 0.8377
45
+ repetition_2: 0.0283
46
+ d2: 0.8377
47
+ r2: 0.0283
48
+ distinct_4: 0.9982
49
+ repetition_4: 0.0012
50
+ d4: 0.9982
51
+ r4: 0.0012
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0.6_temp0.98_gpu4.json
eval/h2_mixed_latest_test/logs/pps1_lam0.6_temp0.9_gpu5.log ADDED
@@ -0,0 +1,55 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.6, 0.6]
5
+ leaf_temperature = 0.9
6
+ Generating 128 samples (L=512)...
7
+ sampled 32/128 (steps this call: 1105)
8
+ sampled 64/128 (steps this call: 1157)
9
+ sampled 96/128 (steps this call: 1120)
10
+ sampled 128/128 (steps this call: 1127)
11
+ Average denoising rounds per sample: 1127.25
12
+ First sample preview: ' hemp.\n\nLegal\n\nThe growing market for hemp has drummed up goodwill. According to its website, the American Dictionary of'
13
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
14
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
15
+
16
+ Eval LM loaded (774,030,080 params)
17
+ Scoring samples under eval LM...
18
+ scored 32/128
19
+ scored 64/128
20
+ scored 96/128
21
+ scored 128/128
22
+ {
23
+ "avg_nll": 4.223532691408287,
24
+ "median_nll": 3.5249366760253906,
25
+ "ppl": 68.27425062102515,
26
+ "acc": 0.29709878247002175,
27
+ "tokens": 65214,
28
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
29
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
30
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "num_samples": 128,
32
+ "generated_seq_len": 512,
33
+ "mode": "sad_generation",
34
+ "level_lambdas": "0.6,0.6",
35
+ "avg_steps": 1127.25,
36
+ "positions_per_step": 1,
37
+ "leaf_temperature": 0.9
38
+ }
39
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.6_temp0.9_gpu5.json
40
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.6_temp0.9_gpu5.json
41
+ Diversity metrics for pps1_lam0.6_temp0.9_gpu5.json:
42
+ distinct_1: 0.2830
43
+ repetition_1: 0.3659
44
+ d1: 0.2830
45
+ r1: 0.3659
46
+ distinct_2: 0.7855
47
+ repetition_2: 0.0505
48
+ d2: 0.7855
49
+ r2: 0.0505
50
+ distinct_4: 0.9954
51
+ repetition_4: 0.0029
52
+ d4: 0.9954
53
+ r4: 0.0029
54
+ num_samples: 128.0000
55
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0.6_temp0.9_gpu5.json
eval/h2_mixed_latest_test/logs/pps1_lam0.7_temp0.9_gpu0.log ADDED
@@ -0,0 +1,51 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.7, 0.7]
5
+ leaf_temperature = 0.9
6
+ Generating 128 samples (L=512)...
7
+ sampled 64/128 (steps this call: 1215)
8
+ sampled 128/128 (steps this call: 1198)
9
+ Average denoising rounds per sample: 1206.50
10
+ First sample preview: "'s why [the] state's like destabilizing it. I remember [the state] had a 100-page list of nuclear weapons and they didn'"
11
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
12
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
13
+
14
+ Eval LM loaded (774,030,080 params)
15
+ Scoring samples under eval LM...
16
+ scored 64/128
17
+ scored 128/128
18
+ {
19
+ "avg_nll": 4.1800211892045365,
20
+ "median_nll": 3.4635732173919678,
21
+ "ppl": 65.36723827911753,
22
+ "acc": 0.30498641742253324,
23
+ "tokens": 65157,
24
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
25
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
26
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "num_samples": 128,
28
+ "generated_seq_len": 512,
29
+ "mode": "sad_generation",
30
+ "level_lambdas": "0.7,0.7",
31
+ "avg_steps": 1206.5,
32
+ "positions_per_step": 1,
33
+ "leaf_temperature": 0.9
34
+ }
35
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.7_temp0.9_gpu0.json
36
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.7_temp0.9_gpu0.json
37
+ Diversity metrics for pps1_lam0.7_temp0.9_gpu0.json:
38
+ distinct_1: 0.2883
39
+ repetition_1: 0.3510
40
+ d1: 0.2883
41
+ r1: 0.3510
42
+ distinct_2: 0.7919
43
+ repetition_2: 0.0445
44
+ d2: 0.7919
45
+ r2: 0.0445
46
+ distinct_4: 0.9962
47
+ repetition_4: 0.0023
48
+ d4: 0.9962
49
+ r4: 0.0023
50
+ num_samples: 128.0000
51
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0.7_temp0.9_gpu0.json
eval/h2_mixed_latest_test/logs/pps1_lam0_temp0.7_gpu1.log ADDED
@@ -0,0 +1,55 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.0, 0.0]
5
+ leaf_temperature = 0.7
6
+ Generating 128 samples (L=512)...
7
+ sampled 32/128 (steps this call: 512)
8
+ sampled 64/128 (steps this call: 512)
9
+ sampled 96/128 (steps this call: 512)
10
+ sampled 128/128 (steps this call: 512)
11
+ Average denoising rounds per sample: 512.00
12
+ First sample preview: 'Hello Military Users,\n\n---\n\nNote: Some want to quote us from:\n\nAs of last Thursday, we went to work on the new engine us'
13
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
14
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
15
+
16
+ Eval LM loaded (774,030,080 params)
17
+ Scoring samples under eval LM...
18
+ scored 32/128
19
+ scored 64/128
20
+ scored 96/128
21
+ scored 128/128
22
+ {
23
+ "avg_nll": 2.4444901757231374,
24
+ "median_nll": 1.648135781288147,
25
+ "ppl": 11.524672542987966,
26
+ "acc": 0.4860126989969633,
27
+ "tokens": 65202,
28
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
29
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
30
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "num_samples": 128,
32
+ "generated_seq_len": 512,
33
+ "mode": "sad_generation",
34
+ "level_lambdas": "0,0",
35
+ "avg_steps": 512.0,
36
+ "positions_per_step": 1,
37
+ "leaf_temperature": 0.7
38
+ }
39
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0_temp0.7_gpu1.json
40
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0_temp0.7_gpu1.json
41
+ Diversity metrics for pps1_lam0_temp0.7_gpu1.json:
42
+ distinct_1: 0.1709
43
+ repetition_1: 0.5429
44
+ d1: 0.1709
45
+ r1: 0.5429
46
+ distinct_2: 0.5770
47
+ repetition_2: 0.2116
48
+ d2: 0.5770
49
+ r2: 0.2116
50
+ distinct_4: 0.9309
51
+ repetition_4: 0.0593
52
+ d4: 0.9309
53
+ r4: 0.0593
54
+ num_samples: 128.0000
55
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0_temp0.7_gpu1.json
eval/h2_mixed_latest_test/logs/pps2_lam0.2_temp1_gpu1.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.2, 0.2]
5
+ leaf_temperature = 1.0
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 512)
8
+ Average denoising rounds per sample: 512.00
9
+ First sample preview: ' and donate to a grassroots movement\n\nin Bali municipalities,\nweijmas Campaign for demolition of 3rd house and stone ent'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.675843099708208,
21
+ "median_nll": 5.313490867614746,
22
+ "ppl": 291.73419590506444,
23
+ "acc": 0.19218306073869307,
24
+ "tokens": 65115,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.2,0.2",
33
+ "avg_steps": 512.0,
34
+ "positions_per_step": 2,
35
+ "leaf_temperature": 1.0
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.2_temp1_gpu1.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.2_temp1_gpu1.json
39
+ Diversity metrics for pps2_lam0.2_temp1_gpu1.json:
40
+ distinct_1: 0.3569
41
+ repetition_1: 0.2830
42
+ d1: 0.3569
43
+ r1: 0.2830
44
+ distinct_2: 0.8555
45
+ repetition_2: 0.0209
46
+ d2: 0.8555
47
+ r2: 0.0209
48
+ distinct_4: 0.9994
49
+ repetition_4: 0.0001
50
+ d4: 0.9994
51
+ r4: 0.0001
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.2_temp1_gpu1.json
eval/h2_mixed_latest_test/logs/pps2_lam0.3_temp0.8_gpu4.log ADDED
@@ -0,0 +1,52 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.3, 0.3]
5
+ leaf_temperature = 0.8
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 387)
8
+ Average denoising rounds per sample: 387.00
9
+ First sample preview: '"It was like we gave up," he said.\n\nThe residents of the tower declined to comment for the story, but have pointed to th'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 3.482659498755244,
21
+ "median_nll": 2.7303624153137207,
22
+ "ppl": 32.54616356088146,
23
+ "acc": 0.3610560447497426,
24
+ "tokens": 65073,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "level_lambdas": "0.3,0.3",
32
+ "avg_steps": 387.0,
33
+ "positions_per_step": 2,
34
+ "leaf_temperature": 0.8
35
+ }
36
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.3_temp0.8_gpu4.json
37
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.3_temp0.8_gpu4.json
38
+ Diversity metrics for pps2_lam0.3_temp0.8_gpu4.json:
39
+ distinct_1: 0.2266
40
+ repetition_1: 0.4379
41
+ d1: 0.2266
42
+ r1: 0.4379
43
+ distinct_2: 0.7021
44
+ repetition_2: 0.0890
45
+ d2: 0.7021
46
+ r2: 0.0890
47
+ distinct_4: 0.9878
48
+ repetition_4: 0.0079
49
+ d4: 0.9878
50
+ r4: 0.0079
51
+ num_samples: 128.0000
52
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.3_temp0.8_gpu4.json
eval/h2_mixed_latest_test/logs/pps2_lam0.3_temp0.9_gpu4.log ADDED
@@ -0,0 +1,51 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.3, 0.3]
5
+ leaf_temperature = 0.9
6
+ Generating 128 samples (L=512)...
7
+ sampled 64/128 (steps this call: 453)
8
+ sampled 128/128 (steps this call: 454)
9
+ Average denoising rounds per sample: 453.50
10
+ First sample preview: ' that rather than being helped by others like Manning’s chronic lack of eagerness.\n\nThat said, the Broncos need a dire c'
11
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
12
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
13
+
14
+ Eval LM loaded (774,030,080 params)
15
+ Scoring samples under eval LM...
16
+ scored 64/128
17
+ scored 128/128
18
+ {
19
+ "avg_nll": 4.41296852458639,
20
+ "median_nll": 3.775259852409363,
21
+ "ppl": 82.514045273213,
22
+ "acc": 0.27863040608981243,
23
+ "tokens": 65158,
24
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
25
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
26
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "num_samples": 128,
28
+ "generated_seq_len": 512,
29
+ "mode": "sad_generation",
30
+ "level_lambdas": "0.3,0.3",
31
+ "avg_steps": 453.5,
32
+ "positions_per_step": 2,
33
+ "leaf_temperature": 0.9
34
+ }
35
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.3_temp0.9_gpu4.json
36
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.3_temp0.9_gpu4.json
37
+ Diversity metrics for pps2_lam0.3_temp0.9_gpu4.json:
38
+ distinct_1: 0.2770
39
+ repetition_1: 0.3646
40
+ d1: 0.2770
41
+ r1: 0.3646
42
+ distinct_2: 0.7787
43
+ repetition_2: 0.0444
44
+ d2: 0.7787
45
+ r2: 0.0444
46
+ distinct_4: 0.9964
47
+ repetition_4: 0.0013
48
+ d4: 0.9964
49
+ r4: 0.0013
50
+ num_samples: 128.0000
51
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.3_temp0.9_gpu4.json
eval/h2_mixed_latest_test/logs/pps2_lam0.6_temp0.94_gpu3.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.6, 0.6]
5
+ leaf_temperature = 0.94
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 652)
8
+ Average denoising rounds per sample: 652.00
9
+ First sample preview: ' Minutearo Minus.\n\n9,8 Marcel Jr.\n\n9\n\nmolonio Junior nabbed a replay, adding 1 TOV to the game in a row.\n\nJust 2 percent'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 4.835658662038316,
21
+ "median_nll": 4.23482084274292,
22
+ "ppl": 125.9214956072145,
23
+ "acc": 0.25355377483037056,
24
+ "tokens": 65142,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6,0.6",
33
+ "avg_steps": 652.0,
34
+ "positions_per_step": 2,
35
+ "leaf_temperature": 0.94
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.6_temp0.94_gpu3.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.6_temp0.94_gpu3.json
39
+ Diversity metrics for pps2_lam0.6_temp0.94_gpu3.json:
40
+ distinct_1: 0.3206
41
+ repetition_1: 0.3197
42
+ d1: 0.3206
43
+ r1: 0.3197
44
+ distinct_2: 0.8238
45
+ repetition_2: 0.0345
46
+ d2: 0.8238
47
+ r2: 0.0345
48
+ distinct_4: 0.9980
49
+ repetition_4: 0.0011
50
+ d4: 0.9980
51
+ r4: 0.0011
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.6_temp0.94_gpu3.json
eval/h2_mixed_latest_test/logs/pps2_lam0.6_temp1_gpu5.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.6, 0.6]
5
+ leaf_temperature = 1.0
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 719)
8
+ Average denoising rounds per sample: 719.00
9
+ First sample preview: ' the quasi-Suicide template.\n\nEvery surrogate of the Australian “killer cop” provided by Spox (whose cops were eclipsed '
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.496910366953119,
21
+ "median_nll": 5.08622932434082,
22
+ "ppl": 243.9370906762153,
23
+ "acc": 0.20297705823678355,
24
+ "tokens": 65165,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6,0.6",
33
+ "avg_steps": 719.0,
34
+ "positions_per_step": 2,
35
+ "leaf_temperature": 1.0
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.6_temp1_gpu5.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.6_temp1_gpu5.json
39
+ Diversity metrics for pps2_lam0.6_temp1_gpu5.json:
40
+ distinct_1: 0.3585
41
+ repetition_1: 0.2841
42
+ d1: 0.3585
43
+ r1: 0.2841
44
+ distinct_2: 0.8633
45
+ repetition_2: 0.0215
46
+ d2: 0.8633
47
+ r2: 0.0215
48
+ distinct_4: 0.9991
49
+ repetition_4: 0.0005
50
+ d4: 0.9991
51
+ r4: 0.0005
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.6_temp1_gpu5.json
eval/h2_mixed_latest_test/logs/pps2_lam0.6_temp1_gpu6.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.6, 0.6]
5
+ leaf_temperature = 1.0
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 703)
8
+ Average denoising rounds per sample: 703.00
9
+ First sample preview: ' -- I had the [Obama] children on that plane, they really have to." He offered recollections about the Romney\'s White Ho'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.530916663150708,
21
+ "median_nll": 5.155064582824707,
22
+ "ppl": 252.3751480224496,
23
+ "acc": 0.20308688381227083,
24
+ "tokens": 65179,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6,0.6",
33
+ "avg_steps": 703.0,
34
+ "positions_per_step": 2,
35
+ "leaf_temperature": 1.0
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.6_temp1_gpu6.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.6_temp1_gpu6.json
39
+ Diversity metrics for pps2_lam0.6_temp1_gpu6.json:
40
+ distinct_1: 0.3621
41
+ repetition_1: 0.2806
42
+ d1: 0.3621
43
+ r1: 0.2806
44
+ distinct_2: 0.8631
45
+ repetition_2: 0.0215
46
+ d2: 0.8631
47
+ r2: 0.0215
48
+ distinct_4: 0.9989
49
+ repetition_4: 0.0005
50
+ d4: 0.9989
51
+ r4: 0.0005
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.6_temp1_gpu6.json
eval/h2_mixed_latest_test/logs/pps2_lam0.7_temp0.9_gpu6.log ADDED
@@ -0,0 +1,51 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.7, 0.7]
5
+ leaf_temperature = 0.9
6
+ Generating 128 samples (L=512)...
7
+ sampled 64/128 (steps this call: 620)
8
+ sampled 128/128 (steps this call: 622)
9
+ Average denoising rounds per sample: 621.00
10
+ First sample preview: 'Earlier this week, father of two Supreme Court Justices, S. Humayun (also known as the father of equal marriage) was ask'
11
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
12
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
13
+
14
+ Eval LM loaded (774,030,080 params)
15
+ Scoring samples under eval LM...
16
+ scored 64/128
17
+ scored 128/128
18
+ {
19
+ "avg_nll": 4.467391929840715,
20
+ "median_nll": 3.795100212097168,
21
+ "ppl": 87.1291873943412,
22
+ "acc": 0.28252462940797346,
23
+ "tokens": 65166,
24
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
25
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
26
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "num_samples": 128,
28
+ "generated_seq_len": 512,
29
+ "mode": "sad_generation",
30
+ "level_lambdas": "0.7,0.7",
31
+ "avg_steps": 621.0,
32
+ "positions_per_step": 2,
33
+ "leaf_temperature": 0.9
34
+ }
35
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.7_temp0.9_gpu6.json
36
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.7_temp0.9_gpu6.json
37
+ Diversity metrics for pps2_lam0.7_temp0.9_gpu6.json:
38
+ distinct_1: 0.3043
39
+ repetition_1: 0.3403
40
+ d1: 0.3043
41
+ r1: 0.3403
42
+ distinct_2: 0.8084
43
+ repetition_2: 0.0394
44
+ d2: 0.8084
45
+ r2: 0.0394
46
+ distinct_4: 0.9975
47
+ repetition_4: 0.0012
48
+ d4: 0.9975
49
+ r4: 0.0012
50
+ num_samples: 128.0000
51
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.7_temp0.9_gpu6.json
eval/h2_mixed_latest_test/logs/pps2_lam0.8_temp0.7_gpu4.log ADDED
@@ -0,0 +1,51 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.8, 0.8]
5
+ leaf_temperature = 0.7
6
+ Generating 128 samples (L=512)...
7
+ sampled 64/128 (steps this call: 508)
8
+ sampled 128/128 (steps this call: 505)
9
+ Average denoising rounds per sample: 506.50
10
+ First sample preview: ' stage at the newly opened Lucas and Mark Parker’s The Tour of Owings.\n\nI arrived in Raleigh to celebrate The Tour and t'
11
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
12
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
13
+
14
+ Eval LM loaded (774,030,080 params)
15
+ Scoring samples under eval LM...
16
+ scored 64/128
17
+ scored 128/128
18
+ {
19
+ "avg_nll": 3.015721177860601,
20
+ "median_nll": 2.095865249633789,
21
+ "ppl": 20.40380040496583,
22
+ "acc": 0.4302159379082456,
23
+ "tokens": 65065,
24
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
25
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
26
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "num_samples": 128,
28
+ "generated_seq_len": 512,
29
+ "mode": "sad_generation",
30
+ "level_lambdas": "0.8,0.8",
31
+ "avg_steps": 506.5,
32
+ "positions_per_step": 2,
33
+ "leaf_temperature": 0.7
34
+ }
35
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.8_temp0.7_gpu4.json
36
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.8_temp0.7_gpu4.json
37
+ Diversity metrics for pps2_lam0.8_temp0.7_gpu4.json:
38
+ distinct_1: 0.2162
39
+ repetition_1: 0.4844
40
+ d1: 0.2162
41
+ r1: 0.4844
42
+ distinct_2: 0.6706
43
+ repetition_2: 0.1492
44
+ d2: 0.6706
45
+ r2: 0.1492
46
+ distinct_4: 0.9678
47
+ repetition_4: 0.0299
48
+ d4: 0.9678
49
+ r4: 0.0299
50
+ num_samples: 128.0000
51
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.8_temp0.7_gpu4.json
eval/h2_mixed_latest_test/logs/pps2_lam0.8_temp0.94_gpu1.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.8, 0.8]
5
+ leaf_temperature = 0.94
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 695)
8
+ Average denoising rounds per sample: 695.00
9
+ First sample preview: 'A young Australian citizen has been taken to a police station in Christchurch, charged with simple theft of his identity'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 4.888195943640045,
21
+ "median_nll": 4.315791606903076,
22
+ "ppl": 132.7139345370263,
23
+ "acc": 0.2462536619783119,
24
+ "tokens": 65197,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.8,0.8",
33
+ "avg_steps": 695.0,
34
+ "positions_per_step": 2,
35
+ "leaf_temperature": 0.94
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.8_temp0.94_gpu1.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.8_temp0.94_gpu1.json
39
+ Diversity metrics for pps2_lam0.8_temp0.94_gpu1.json:
40
+ distinct_1: 0.3206
41
+ repetition_1: 0.3230
42
+ d1: 0.3206
43
+ r1: 0.3230
44
+ distinct_2: 0.8286
45
+ repetition_2: 0.0332
46
+ d2: 0.8286
47
+ r2: 0.0332
48
+ distinct_4: 0.9986
49
+ repetition_4: 0.0007
50
+ d4: 0.9986
51
+ r4: 0.0007
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.8_temp0.94_gpu1.json
eval/h2_mixed_latest_test/logs/pps2_lam0.8_temp0.96_gpu0.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.8, 0.8]
5
+ leaf_temperature = 0.96
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 694)
8
+ Average denoising rounds per sample: 694.00
9
+ First sample preview: 'Microsoft CEO, Dennis Hewitt in his keynote speech this week called layoffs "unthinkable and unary" and What he reported'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.019142003605953,
21
+ "median_nll": 4.467703580856323,
22
+ "ppl": 151.28144915675097,
23
+ "acc": 0.24060150375939848,
24
+ "tokens": 65170,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.8,0.8",
33
+ "avg_steps": 694.0,
34
+ "positions_per_step": 2,
35
+ "leaf_temperature": 0.96
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.8_temp0.96_gpu0.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.8_temp0.96_gpu0.json
39
+ Diversity metrics for pps2_lam0.8_temp0.96_gpu0.json:
40
+ distinct_1: 0.3321
41
+ repetition_1: 0.3117
42
+ d1: 0.3321
43
+ r1: 0.3117
44
+ distinct_2: 0.8361
45
+ repetition_2: 0.0299
46
+ d2: 0.8361
47
+ r2: 0.0299
48
+ distinct_4: 0.9982
49
+ repetition_4: 0.0012
50
+ d4: 0.9982
51
+ r4: 0.0012
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.8_temp0.96_gpu0.json
eval/h2_mixed_latest_test/logs/pps2_lam0.8_temp0.96_gpu3.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.8, 0.8]
5
+ leaf_temperature = 0.96
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 704)
8
+ Average denoising rounds per sample: 704.00
9
+ First sample preview: " sure, you'll choose.\n\nFavor white. Range can be $necky. Then vary the widest. Exclusively in store TICKS TO Configure t"
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 4.978640177831968,
21
+ "median_nll": 4.449566602706909,
22
+ "ppl": 145.27669680313952,
23
+ "acc": 0.24482377841170516,
24
+ "tokens": 65202,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.8,0.8",
33
+ "avg_steps": 704.0,
34
+ "positions_per_step": 2,
35
+ "leaf_temperature": 0.96
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.8_temp0.96_gpu3.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.8_temp0.96_gpu3.json
39
+ Diversity metrics for pps2_lam0.8_temp0.96_gpu3.json:
40
+ distinct_1: 0.3278
41
+ repetition_1: 0.3168
42
+ d1: 0.3278
43
+ r1: 0.3168
44
+ distinct_2: 0.8327
45
+ repetition_2: 0.0312
46
+ d2: 0.8327
47
+ r2: 0.0312
48
+ distinct_4: 0.9980
49
+ repetition_4: 0.0010
50
+ d4: 0.9980
51
+ r4: 0.0010
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.8_temp0.96_gpu3.json
eval/h2_mixed_latest_test/logs/pps2_lam0.9_temp0.8_gpu7.log ADDED
@@ -0,0 +1,52 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.9, 0.9]
5
+ leaf_temperature = 0.8
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 606)
8
+ Average denoising rounds per sample: 606.00
9
+ First sample preview: '\nPolice say the habit of drifting in, from water, streams and streams driven by burning cars, is colloquially known as “'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 3.702768828146601,
21
+ "median_nll": 2.8821914196014404,
22
+ "ppl": 40.559451180823665,
23
+ "acc": 0.354950692759055,
24
+ "tokens": 65102,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "level_lambdas": "0.9,0.9",
32
+ "avg_steps": 606.0,
33
+ "positions_per_step": 2,
34
+ "leaf_temperature": 0.8
35
+ }
36
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.9_temp0.8_gpu7.json
37
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.9_temp0.8_gpu7.json
38
+ Diversity metrics for pps2_lam0.9_temp0.8_gpu7.json:
39
+ distinct_1: 0.2659
40
+ repetition_1: 0.3970
41
+ d1: 0.2659
42
+ r1: 0.3970
43
+ distinct_2: 0.7519
44
+ repetition_2: 0.0752
45
+ d2: 0.7519
46
+ r2: 0.0752
47
+ distinct_4: 0.9895
48
+ repetition_4: 0.0076
49
+ d4: 0.9895
50
+ r4: 0.0076
51
+ num_samples: 128.0000
52
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.9_temp0.8_gpu7.json
eval/h2_mixed_latest_test/logs/pps2_lam0_temp0.8_gpu2.log ADDED
@@ -0,0 +1,51 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [0.0, 0.0]
5
+ leaf_temperature = 0.8
6
+ Generating 128 samples (L=512)...
7
+ sampled 64/128 (steps this call: 256)
8
+ sampled 128/128 (steps this call: 256)
9
+ Average denoising rounds per sample: 256.00
10
+ First sample preview: ' hotel bookings lost interest in the second half of the year after another 19-year-old student suffered an overdose in J'
11
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
12
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
13
+
14
+ Eval LM loaded (774,030,080 params)
15
+ Scoring samples under eval LM...
16
+ scored 64/128
17
+ scored 128/128
18
+ {
19
+ "avg_nll": 3.3971109011650245,
20
+ "median_nll": 2.6199722290039062,
21
+ "ppl": 29.877655734069887,
22
+ "acc": 0.37552833407620306,
23
+ "tokens": 65063,
24
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
25
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
26
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "num_samples": 128,
28
+ "generated_seq_len": 512,
29
+ "mode": "sad_generation",
30
+ "level_lambdas": "0,0",
31
+ "avg_steps": 256.0,
32
+ "positions_per_step": 2,
33
+ "leaf_temperature": 0.8
34
+ }
35
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0_temp0.8_gpu2.json
36
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0_temp0.8_gpu2.json
37
+ Diversity metrics for pps2_lam0_temp0.8_gpu2.json:
38
+ distinct_1: 0.2232
39
+ repetition_1: 0.4462
40
+ d1: 0.2232
41
+ r1: 0.4462
42
+ distinct_2: 0.6930
43
+ repetition_2: 0.1038
44
+ d2: 0.6930
45
+ r2: 0.1038
46
+ distinct_4: 0.9848
47
+ repetition_4: 0.0122
48
+ d4: 0.9848
49
+ r4: 0.0122
50
+ num_samples: 128.0000
51
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0_temp0.8_gpu2.json
eval/h2_mixed_latest_test/logs/pps2_lam1_temp0.8_gpu3.log ADDED
@@ -0,0 +1,51 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [1.0, 1.0]
5
+ leaf_temperature = 0.8
6
+ Generating 128 samples (L=512)...
7
+ sampled 64/128 (steps this call: 633)
8
+ sampled 128/128 (steps this call: 619)
9
+ Average denoising rounds per sample: 626.00
10
+ First sample preview: ' Novemberó, Pan, Kyana, Picá and Cocoding. You can check out the Loop’s history of graffiti, or view a text list of graf'
11
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
12
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
13
+
14
+ Eval LM loaded (774,030,080 params)
15
+ Scoring samples under eval LM...
16
+ scored 64/128
17
+ scored 128/128
18
+ {
19
+ "avg_nll": 3.7846832664012395,
20
+ "median_nll": 2.987057089805603,
21
+ "ppl": 44.02172519093987,
22
+ "acc": 0.3443800055233361,
23
+ "tokens": 65178,
24
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
25
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
26
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "num_samples": 128,
28
+ "generated_seq_len": 512,
29
+ "mode": "sad_generation",
30
+ "level_lambdas": "1,1",
31
+ "avg_steps": 626.0,
32
+ "positions_per_step": 2,
33
+ "leaf_temperature": 0.8
34
+ }
35
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam1_temp0.8_gpu3.json
36
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam1_temp0.8_gpu3.json
37
+ Diversity metrics for pps2_lam1_temp0.8_gpu3.json:
38
+ distinct_1: 0.2723
39
+ repetition_1: 0.3864
40
+ d1: 0.2723
41
+ r1: 0.3864
42
+ distinct_2: 0.7657
43
+ repetition_2: 0.0654
44
+ d2: 0.7657
45
+ r2: 0.0654
46
+ distinct_4: 0.9943
47
+ repetition_4: 0.0030
48
+ d4: 0.9943
49
+ r4: 0.0030
50
+ num_samples: 128.0000
51
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam1_temp0.8_gpu3.json
eval/h2_mixed_latest_test/logs/pps2_lam1_temp0.9_gpu6.log ADDED
@@ -0,0 +1,51 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
4
+ level_lambdas = [1.0, 1.0]
5
+ leaf_temperature = 0.9
6
+ Generating 128 samples (L=512)...
7
+ sampled 64/128 (steps this call: 686)
8
+ sampled 128/128 (steps this call: 677)
9
+ Average denoising rounds per sample: 681.50
10
+ First sample preview: 'Earlier this year, gender was being enforced with our calendar, but this year that is correct. We know it with most peop'
11
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
12
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
13
+
14
+ Eval LM loaded (774,030,080 params)
15
+ Scoring samples under eval LM...
16
+ scored 64/128
17
+ scored 128/128
18
+ {
19
+ "avg_nll": 4.535560568098103,
20
+ "median_nll": 3.8875941038131714,
21
+ "ppl": 93.27578808295372,
22
+ "acc": 0.27707348517404384,
23
+ "tokens": 65156,
24
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
25
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
26
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "num_samples": 128,
28
+ "generated_seq_len": 512,
29
+ "mode": "sad_generation",
30
+ "level_lambdas": "1,1",
31
+ "avg_steps": 681.5,
32
+ "positions_per_step": 2,
33
+ "leaf_temperature": 0.9
34
+ }
35
+ Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam1_temp0.9_gpu6.json
36
+ Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam1_temp0.9_gpu6.json
37
+ Diversity metrics for pps2_lam1_temp0.9_gpu6.json:
38
+ distinct_1: 0.3009
39
+ repetition_1: 0.3398
40
+ d1: 0.3009
41
+ r1: 0.3398
42
+ distinct_2: 0.8093
43
+ repetition_2: 0.0405
44
+ d2: 0.8093
45
+ r2: 0.0405
46
+ distinct_4: 0.9974
47
+ repetition_4: 0.0018
48
+ d4: 0.9974
49
+ r4: 0.0018
50
+ num_samples: 128.0000
51
+ Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam1_temp0.9_gpu6.json