Add files using upload-large-folder tool
Browse filesThis view is limited to 50 files because it contains too many changes. See raw diff
- eval/ar_baseline_latest_test/logs/temp0.2_gpu1.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.2_gpu3.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.2_gpu5.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.4_gpu5.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.4_gpu7.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.82_gpu6.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.84_gpu0.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.84_gpu2.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.84_gpu6.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.86_gpu0.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.8_gpu3.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.8_gpu4.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.8_gpu7.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.92_gpu0.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.92_gpu6.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.94_gpu0.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.94_gpu2.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.94_gpu5.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.94_gpu6.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.96_gpu7.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.98_gpu1.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.98_gpu2.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.9_gpu2.log +50 -0
- eval/ar_baseline_latest_test/logs/temp0.9_gpu4.log +50 -0
- eval/ar_baseline_latest_test/logs/temp1_gpu7.log +50 -0
- eval/h2_mixed_latest_test/logs/pps1_lam0.2_temp0.98_gpu4.log +53 -0
- eval/h2_mixed_latest_test/logs/pps1_lam0.2_temp1_gpu6.log +53 -0
- eval/h2_mixed_latest_test/logs/pps1_lam0.2_temp1_gpu7.log +53 -0
- eval/h2_mixed_latest_test/logs/pps1_lam0.3_temp0.8_gpu1.log +52 -0
- eval/h2_mixed_latest_test/logs/pps1_lam0.3_temp0.8_gpu3.log +52 -0
- eval/h2_mixed_latest_test/logs/pps1_lam0.4_temp0.8_gpu0.log +40 -0
- eval/h2_mixed_latest_test/logs/pps1_lam0.6_temp0.98_gpu4.log +53 -0
- eval/h2_mixed_latest_test/logs/pps1_lam0.6_temp0.9_gpu5.log +55 -0
- eval/h2_mixed_latest_test/logs/pps1_lam0.7_temp0.9_gpu0.log +51 -0
- eval/h2_mixed_latest_test/logs/pps1_lam0_temp0.7_gpu1.log +55 -0
- eval/h2_mixed_latest_test/logs/pps2_lam0.2_temp1_gpu1.log +53 -0
- eval/h2_mixed_latest_test/logs/pps2_lam0.3_temp0.8_gpu4.log +52 -0
- eval/h2_mixed_latest_test/logs/pps2_lam0.3_temp0.9_gpu4.log +51 -0
- eval/h2_mixed_latest_test/logs/pps2_lam0.6_temp0.94_gpu3.log +53 -0
- eval/h2_mixed_latest_test/logs/pps2_lam0.6_temp1_gpu5.log +53 -0
- eval/h2_mixed_latest_test/logs/pps2_lam0.6_temp1_gpu6.log +53 -0
- eval/h2_mixed_latest_test/logs/pps2_lam0.7_temp0.9_gpu6.log +51 -0
- eval/h2_mixed_latest_test/logs/pps2_lam0.8_temp0.7_gpu4.log +51 -0
- eval/h2_mixed_latest_test/logs/pps2_lam0.8_temp0.94_gpu1.log +53 -0
- eval/h2_mixed_latest_test/logs/pps2_lam0.8_temp0.96_gpu0.log +53 -0
- eval/h2_mixed_latest_test/logs/pps2_lam0.8_temp0.96_gpu3.log +53 -0
- eval/h2_mixed_latest_test/logs/pps2_lam0.9_temp0.8_gpu7.log +52 -0
- eval/h2_mixed_latest_test/logs/pps2_lam0_temp0.8_gpu2.log +51 -0
- eval/h2_mixed_latest_test/logs/pps2_lam1_temp0.8_gpu3.log +51 -0
- eval/h2_mixed_latest_test/logs/pps2_lam1_temp0.9_gpu6.log +51 -0
eval/ar_baseline_latest_test/logs/temp0.2_gpu1.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.2)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'The first-ever “Star Wars” movie is set to hit theaters on May 25, 2018, but the film’s director, George Lucas, has alre'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 0.3384644670114785,
|
| 17 |
+
"median_nll": 0.002919342485256493,
|
| 18 |
+
"ppl": 1.4027919026796367,
|
| 19 |
+
"acc": 0.9352297310387137,
|
| 20 |
+
"tokens": 61942,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.2,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.2_gpu1.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.2_gpu1.json
|
| 36 |
+
Diversity metrics for temp0.2_gpu1.json:
|
| 37 |
+
distinct_1: 0.0380
|
| 38 |
+
repetition_1: 0.8770
|
| 39 |
+
d1: 0.0380
|
| 40 |
+
r1: 0.8770
|
| 41 |
+
distinct_2: 0.0906
|
| 42 |
+
repetition_2: 0.8249
|
| 43 |
+
d2: 0.0906
|
| 44 |
+
r2: 0.8249
|
| 45 |
+
distinct_4: 0.1524
|
| 46 |
+
repetition_4: 0.7935
|
| 47 |
+
d4: 0.1524
|
| 48 |
+
r4: 0.7935
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.2_gpu1.json
|
eval/ar_baseline_latest_test/logs/temp0.2_gpu3.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.2)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'The U.S. Army Corps of Engineers has approved a plan to build a $1.6 billion, 1,000-mile pipeline that would carry oil f'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 0.35488078943010276,
|
| 17 |
+
"median_nll": 0.003100768430158496,
|
| 18 |
+
"ppl": 1.4260106486063449,
|
| 19 |
+
"acc": 0.9321503131524008,
|
| 20 |
+
"tokens": 62270,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.2,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.2_gpu3.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.2_gpu3.json
|
| 36 |
+
Diversity metrics for temp0.2_gpu3.json:
|
| 37 |
+
distinct_1: 0.0375
|
| 38 |
+
repetition_1: 0.8804
|
| 39 |
+
d1: 0.0375
|
| 40 |
+
r1: 0.8804
|
| 41 |
+
distinct_2: 0.0909
|
| 42 |
+
repetition_2: 0.8279
|
| 43 |
+
d2: 0.0909
|
| 44 |
+
r2: 0.8279
|
| 45 |
+
distinct_4: 0.1540
|
| 46 |
+
repetition_4: 0.7965
|
| 47 |
+
d4: 0.1540
|
| 48 |
+
r4: 0.7965
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.2_gpu3.json
|
eval/ar_baseline_latest_test/logs/temp0.2_gpu5.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.2)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'The first time I saw the movie, I was in the middle of a long drive to the airport. I was driving a car, and I was in th'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 0.36794694845510534,
|
| 17 |
+
"median_nll": 0.0035996540682390332,
|
| 18 |
+
"ppl": 1.4447653899047765,
|
| 19 |
+
"acc": 0.9298173021834617,
|
| 20 |
+
"tokens": 62836,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.2,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.2_gpu5.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.2_gpu5.json
|
| 36 |
+
Diversity metrics for temp0.2_gpu5.json:
|
| 37 |
+
distinct_1: 0.0388
|
| 38 |
+
repetition_1: 0.8733
|
| 39 |
+
d1: 0.0388
|
| 40 |
+
r1: 0.8733
|
| 41 |
+
distinct_2: 0.0973
|
| 42 |
+
repetition_2: 0.8148
|
| 43 |
+
d2: 0.0973
|
| 44 |
+
r2: 0.8148
|
| 45 |
+
distinct_4: 0.1693
|
| 46 |
+
repetition_4: 0.7799
|
| 47 |
+
d4: 0.1693
|
| 48 |
+
r4: 0.7799
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.2_gpu5.json
|
eval/ar_baseline_latest_test/logs/temp0.4_gpu5.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.4)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'The United States has been on a roll in the global economic and financial crisis, but its efforts to contain the crisis '
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 0.6422196306169079,
|
| 17 |
+
"median_nll": 0.022978578694164753,
|
| 18 |
+
"ppl": 1.900695041540618,
|
| 19 |
+
"acc": 0.8628368331338628,
|
| 20 |
+
"tokens": 55146,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.4,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.4_gpu5.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.4_gpu5.json
|
| 36 |
+
Diversity metrics for temp0.4_gpu5.json:
|
| 37 |
+
distinct_1: 0.0767
|
| 38 |
+
repetition_1: 0.7744
|
| 39 |
+
d1: 0.0767
|
| 40 |
+
r1: 0.7744
|
| 41 |
+
distinct_2: 0.2035
|
| 42 |
+
repetition_2: 0.6561
|
| 43 |
+
d2: 0.2035
|
| 44 |
+
r2: 0.6561
|
| 45 |
+
distinct_4: 0.3410
|
| 46 |
+
repetition_4: 0.5816
|
| 47 |
+
d4: 0.3410
|
| 48 |
+
r4: 0.5816
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.4_gpu5.json
|
eval/ar_baseline_latest_test/logs/temp0.4_gpu7.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.4)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'The U.S. Department of Justice has issued a subpoena to the New York Times and its owner, Daniel Richman, seeking docume'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 0.6613957768165036,
|
| 17 |
+
"median_nll": 0.03448391519486904,
|
| 18 |
+
"ppl": 1.9374947582386717,
|
| 19 |
+
"acc": 0.8539113160163424,
|
| 20 |
+
"tokens": 53358,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.4,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.4_gpu7.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.4_gpu7.json
|
| 36 |
+
Diversity metrics for temp0.4_gpu7.json:
|
| 37 |
+
distinct_1: 0.0866
|
| 38 |
+
repetition_1: 0.7545
|
| 39 |
+
d1: 0.0866
|
| 40 |
+
r1: 0.7545
|
| 41 |
+
distinct_2: 0.2257
|
| 42 |
+
repetition_2: 0.6243
|
| 43 |
+
d2: 0.2257
|
| 44 |
+
r2: 0.6243
|
| 45 |
+
distinct_4: 0.3803
|
| 46 |
+
repetition_4: 0.5404
|
| 47 |
+
d4: 0.3803
|
| 48 |
+
r4: 0.5404
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.4_gpu7.json
|
eval/ar_baseline_latest_test/logs/temp0.82_gpu6.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.82)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'BETHLEHEM (Ma’an) -- The Palestinian Authority on Wednesday announced it was establishing a new state in the West Bank w'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 2.3033388616360484,
|
| 17 |
+
"median_nll": 1.5766230821609497,
|
| 18 |
+
"ppl": 10.007540527969768,
|
| 19 |
+
"acc": 0.5048616140997784,
|
| 20 |
+
"tokens": 45561,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.82,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.82_gpu6.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.82_gpu6.json
|
| 36 |
+
Diversity metrics for temp0.82_gpu6.json:
|
| 37 |
+
distinct_1: 0.2445
|
| 38 |
+
repetition_1: 0.4226
|
| 39 |
+
d1: 0.2445
|
| 40 |
+
r1: 0.4226
|
| 41 |
+
distinct_2: 0.6910
|
| 42 |
+
repetition_2: 0.1198
|
| 43 |
+
d2: 0.6910
|
| 44 |
+
r2: 0.1198
|
| 45 |
+
distinct_4: 0.9589
|
| 46 |
+
repetition_4: 0.0340
|
| 47 |
+
d4: 0.9589
|
| 48 |
+
r4: 0.0340
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.82_gpu6.json
|
eval/ar_baseline_latest_test/logs/temp0.84_gpu0.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.84)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'The protagonist of the Möbius strip is a high school student who is teaching the world about the “Mokai,” the Japanese t'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 2.4762633348149796,
|
| 17 |
+
"median_nll": 1.748022437095642,
|
| 18 |
+
"ppl": 11.896727173041405,
|
| 19 |
+
"acc": 0.477586398488721,
|
| 20 |
+
"tokens": 44995,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.84,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.84_gpu0.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.84_gpu0.json
|
| 36 |
+
Diversity metrics for temp0.84_gpu0.json:
|
| 37 |
+
distinct_1: 0.2500
|
| 38 |
+
repetition_1: 0.4025
|
| 39 |
+
d1: 0.2500
|
| 40 |
+
r1: 0.4025
|
| 41 |
+
distinct_2: 0.7106
|
| 42 |
+
repetition_2: 0.0995
|
| 43 |
+
d2: 0.7106
|
| 44 |
+
r2: 0.0995
|
| 45 |
+
distinct_4: 0.9752
|
| 46 |
+
repetition_4: 0.0205
|
| 47 |
+
d4: 0.9752
|
| 48 |
+
r4: 0.0205
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.84_gpu0.json
|
eval/ar_baseline_latest_test/logs/temp0.84_gpu2.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.84)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'LONDON — The British government’s allowance for tax avoidance had been so underreported that in some cases they were so '
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 2.436140074805089,
|
| 17 |
+
"median_nll": 1.7247057557106018,
|
| 18 |
+
"ppl": 11.428841022454263,
|
| 19 |
+
"acc": 0.47911668951336533,
|
| 20 |
+
"tokens": 46688,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.84,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.84_gpu2.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.84_gpu2.json
|
| 36 |
+
Diversity metrics for temp0.84_gpu2.json:
|
| 37 |
+
distinct_1: 0.2474
|
| 38 |
+
repetition_1: 0.4114
|
| 39 |
+
d1: 0.2474
|
| 40 |
+
r1: 0.4114
|
| 41 |
+
distinct_2: 0.7007
|
| 42 |
+
repetition_2: 0.1073
|
| 43 |
+
d2: 0.7007
|
| 44 |
+
r2: 0.1073
|
| 45 |
+
distinct_4: 0.9659
|
| 46 |
+
repetition_4: 0.0270
|
| 47 |
+
d4: 0.9659
|
| 48 |
+
r4: 0.0270
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.84_gpu2.json
|
eval/ar_baseline_latest_test/logs/temp0.84_gpu6.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.84)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'BETHLEHEM (Ma’an) -- The Palestinian Authority on Wednesday announced it was establishing a “protective force” in the We'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 2.484979679385866,
|
| 17 |
+
"median_nll": 1.7636990547180176,
|
| 18 |
+
"ppl": 12.000876387175099,
|
| 19 |
+
"acc": 0.47349288778505305,
|
| 20 |
+
"tokens": 44290,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.84,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.84_gpu6.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.84_gpu6.json
|
| 36 |
+
Diversity metrics for temp0.84_gpu6.json:
|
| 37 |
+
distinct_1: 0.2487
|
| 38 |
+
repetition_1: 0.4072
|
| 39 |
+
d1: 0.2487
|
| 40 |
+
r1: 0.4072
|
| 41 |
+
distinct_2: 0.7112
|
| 42 |
+
repetition_2: 0.1041
|
| 43 |
+
d2: 0.7112
|
| 44 |
+
r2: 0.1041
|
| 45 |
+
distinct_4: 0.9685
|
| 46 |
+
repetition_4: 0.0285
|
| 47 |
+
d4: 0.9685
|
| 48 |
+
r4: 0.0285
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.84_gpu6.json
|
eval/ar_baseline_latest_test/logs/temp0.86_gpu0.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.86)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'The protagonist of the Möbius strip is a high school student who is teaching the world about the “Mokai,” the Japanese t'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 2.579709587299751,
|
| 17 |
+
"median_nll": 1.811776041984558,
|
| 18 |
+
"ppl": 13.193306099596239,
|
| 19 |
+
"acc": 0.46876446089773255,
|
| 20 |
+
"tokens": 45381,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.86,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.86_gpu0.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.86_gpu0.json
|
| 36 |
+
Diversity metrics for temp0.86_gpu0.json:
|
| 37 |
+
distinct_1: 0.2587
|
| 38 |
+
repetition_1: 0.3975
|
| 39 |
+
d1: 0.2587
|
| 40 |
+
r1: 0.3975
|
| 41 |
+
distinct_2: 0.7234
|
| 42 |
+
repetition_2: 0.0981
|
| 43 |
+
d2: 0.7234
|
| 44 |
+
r2: 0.0981
|
| 45 |
+
distinct_4: 0.9763
|
| 46 |
+
repetition_4: 0.0233
|
| 47 |
+
d4: 0.9763
|
| 48 |
+
r4: 0.0233
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.86_gpu0.json
|
eval/ar_baseline_latest_test/logs/temp0.8_gpu3.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.8)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'Jürgen Klopp has hailed the work of the Liverpool Foundation, who are working to raise funds to help children in the are'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 2.2107951077390418,
|
| 17 |
+
"median_nll": 1.5452141761779785,
|
| 18 |
+
"ppl": 9.122967251916329,
|
| 19 |
+
"acc": 0.5083579377697025,
|
| 20 |
+
"tokens": 44030,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.8,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.8_gpu3.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.8_gpu3.json
|
| 36 |
+
Diversity metrics for temp0.8_gpu3.json:
|
| 37 |
+
distinct_1: 0.2305
|
| 38 |
+
repetition_1: 0.4438
|
| 39 |
+
d1: 0.2305
|
| 40 |
+
r1: 0.4438
|
| 41 |
+
distinct_2: 0.6679
|
| 42 |
+
repetition_2: 0.1320
|
| 43 |
+
d2: 0.6679
|
| 44 |
+
r2: 0.1320
|
| 45 |
+
distinct_4: 0.9588
|
| 46 |
+
repetition_4: 0.0337
|
| 47 |
+
d4: 0.9588
|
| 48 |
+
r4: 0.0337
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.8_gpu3.json
|
eval/ar_baseline_latest_test/logs/temp0.8_gpu4.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.8)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'There is a lot of interest when it comes to the Blackhawks, and the World Series and Stanley Cup. Here’s a few great way'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 2.2282093542073826,
|
| 17 |
+
"median_nll": 1.5320324897766113,
|
| 18 |
+
"ppl": 9.283228214123909,
|
| 19 |
+
"acc": 0.5137793978787413,
|
| 20 |
+
"tokens": 45539,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.8,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.8_gpu4.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.8_gpu4.json
|
| 36 |
+
Diversity metrics for temp0.8_gpu4.json:
|
| 37 |
+
distinct_1: 0.2408
|
| 38 |
+
repetition_1: 0.4306
|
| 39 |
+
d1: 0.2408
|
| 40 |
+
r1: 0.4306
|
| 41 |
+
distinct_2: 0.6806
|
| 42 |
+
repetition_2: 0.1304
|
| 43 |
+
d2: 0.6806
|
| 44 |
+
r2: 0.1304
|
| 45 |
+
distinct_4: 0.9530
|
| 46 |
+
repetition_4: 0.0372
|
| 47 |
+
d4: 0.9530
|
| 48 |
+
r4: 0.0372
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.8_gpu4.json
|
eval/ar_baseline_latest_test/logs/temp0.8_gpu7.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.8)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: '“Muppets” creators John DiLanzo and Gary Ungarick have announced that they will be returning to the studio with “Star Wa'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 2.2224382537774003,
|
| 17 |
+
"median_nll": 1.5243245959281921,
|
| 18 |
+
"ppl": 9.229808066569772,
|
| 19 |
+
"acc": 0.5135588247621443,
|
| 20 |
+
"tokens": 47718,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.8,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.8_gpu7.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.8_gpu7.json
|
| 36 |
+
Diversity metrics for temp0.8_gpu7.json:
|
| 37 |
+
distinct_1: 0.2386
|
| 38 |
+
repetition_1: 0.4307
|
| 39 |
+
d1: 0.2386
|
| 40 |
+
r1: 0.4307
|
| 41 |
+
distinct_2: 0.6809
|
| 42 |
+
repetition_2: 0.1280
|
| 43 |
+
d2: 0.6809
|
| 44 |
+
r2: 0.1280
|
| 45 |
+
distinct_4: 0.9595
|
| 46 |
+
repetition_4: 0.0308
|
| 47 |
+
d4: 0.9595
|
| 48 |
+
r4: 0.0308
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.8_gpu7.json
|
eval/ar_baseline_latest_test/logs/temp0.92_gpu0.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.92)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'The protagonist? Angela Möller. The screenwriter?\n\nGlenn Tych at The Telegraph has had a chance to take a look at the sc'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 3.0223417018101086,
|
| 17 |
+
"median_nll": 2.2005038261413574,
|
| 18 |
+
"ppl": 20.53933240559053,
|
| 19 |
+
"acc": 0.41460409186513414,
|
| 20 |
+
"tokens": 47069,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.92,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.92_gpu0.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.92_gpu0.json
|
| 36 |
+
Diversity metrics for temp0.92_gpu0.json:
|
| 37 |
+
distinct_1: 0.2825
|
| 38 |
+
repetition_1: 0.3581
|
| 39 |
+
d1: 0.2825
|
| 40 |
+
r1: 0.3581
|
| 41 |
+
distinct_2: 0.7673
|
| 42 |
+
repetition_2: 0.0632
|
| 43 |
+
d2: 0.7673
|
| 44 |
+
r2: 0.0632
|
| 45 |
+
distinct_4: 0.9886
|
| 46 |
+
repetition_4: 0.0095
|
| 47 |
+
d4: 0.9886
|
| 48 |
+
r4: 0.0095
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.92_gpu0.json
|
eval/ar_baseline_latest_test/logs/temp0.92_gpu6.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.92)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'BETHLEHEM (Ma’an) -- The Palestinian Authority on Wednesday announced it was establishing a “protective force” in the We'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 3.0061634738295786,
|
| 17 |
+
"median_nll": 2.166841506958008,
|
| 18 |
+
"ppl": 20.209715898184825,
|
| 19 |
+
"acc": 0.41916044648359924,
|
| 20 |
+
"tokens": 43809,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.92,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.92_gpu6.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.92_gpu6.json
|
| 36 |
+
Diversity metrics for temp0.92_gpu6.json:
|
| 37 |
+
distinct_1: 0.2937
|
| 38 |
+
repetition_1: 0.3543
|
| 39 |
+
d1: 0.2937
|
| 40 |
+
r1: 0.3543
|
| 41 |
+
distinct_2: 0.7686
|
| 42 |
+
repetition_2: 0.0697
|
| 43 |
+
d2: 0.7686
|
| 44 |
+
r2: 0.0697
|
| 45 |
+
distinct_4: 0.9845
|
| 46 |
+
repetition_4: 0.0134
|
| 47 |
+
d4: 0.9845
|
| 48 |
+
r4: 0.0134
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.92_gpu6.json
|
eval/ar_baseline_latest_test/logs/temp0.94_gpu0.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.94)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'The protagonist? Angela Möttins, better known as "Griezmann" at Real Madrid.\n\nIn reality, this role in the history of th'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 3.186605011933174,
|
| 17 |
+
"median_nll": 2.3521339893341064,
|
| 18 |
+
"ppl": 24.20610833702178,
|
| 19 |
+
"acc": 0.39720741418151806,
|
| 20 |
+
"tokens": 44833,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.94,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.94_gpu0.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.94_gpu0.json
|
| 36 |
+
Diversity metrics for temp0.94_gpu0.json:
|
| 37 |
+
distinct_1: 0.2940
|
| 38 |
+
repetition_1: 0.3367
|
| 39 |
+
d1: 0.2940
|
| 40 |
+
r1: 0.3367
|
| 41 |
+
distinct_2: 0.7849
|
| 42 |
+
repetition_2: 0.0527
|
| 43 |
+
d2: 0.7849
|
| 44 |
+
r2: 0.0527
|
| 45 |
+
distinct_4: 0.9901
|
| 46 |
+
repetition_4: 0.0084
|
| 47 |
+
d4: 0.9901
|
| 48 |
+
r4: 0.0084
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.94_gpu0.json
|
eval/ar_baseline_latest_test/logs/temp0.94_gpu2.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.94)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'LONDON — The British media reported in articles Wednesday that ISIS has taken over Kirkuk, the Iraqi town that is disput'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 3.175500140291807,
|
| 17 |
+
"median_nll": 2.341375946998596,
|
| 18 |
+
"ppl": 23.93878962807616,
|
| 19 |
+
"acc": 0.3984287317620651,
|
| 20 |
+
"tokens": 44550,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.94,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.94_gpu2.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.94_gpu2.json
|
| 36 |
+
Diversity metrics for temp0.94_gpu2.json:
|
| 37 |
+
distinct_1: 0.2911
|
| 38 |
+
repetition_1: 0.3433
|
| 39 |
+
d1: 0.2911
|
| 40 |
+
r1: 0.3433
|
| 41 |
+
distinct_2: 0.7821
|
| 42 |
+
repetition_2: 0.0540
|
| 43 |
+
d2: 0.7821
|
| 44 |
+
r2: 0.0540
|
| 45 |
+
distinct_4: 0.9914
|
| 46 |
+
repetition_4: 0.0063
|
| 47 |
+
d4: 0.9914
|
| 48 |
+
r4: 0.0063
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.94_gpu2.json
|
eval/ar_baseline_latest_test/logs/temp0.94_gpu5.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.94)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'Bless up! So happy to be back to where I started!I want to thank yoeoi for the email comment taking me back to when I go'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 3.2659872423456764,
|
| 17 |
+
"median_nll": 2.4272470474243164,
|
| 18 |
+
"ppl": 26.205969867396313,
|
| 19 |
+
"acc": 0.39182821610689156,
|
| 20 |
+
"tokens": 46477,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.94,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.94_gpu5.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.94_gpu5.json
|
| 36 |
+
Diversity metrics for temp0.94_gpu5.json:
|
| 37 |
+
distinct_1: 0.2964
|
| 38 |
+
repetition_1: 0.3412
|
| 39 |
+
d1: 0.2964
|
| 40 |
+
r1: 0.3412
|
| 41 |
+
distinct_2: 0.7810
|
| 42 |
+
repetition_2: 0.0550
|
| 43 |
+
d2: 0.7810
|
| 44 |
+
r2: 0.0550
|
| 45 |
+
distinct_4: 0.9902
|
| 46 |
+
repetition_4: 0.0068
|
| 47 |
+
d4: 0.9902
|
| 48 |
+
r4: 0.0068
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.94_gpu5.json
|
eval/ar_baseline_latest_test/logs/temp0.94_gpu6.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.94)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'BETHLEHEM (Ma’an) -- The Palestinian Authority on Wednesday announced it was establishing a “protective force” in the We'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 3.192733724355068,
|
| 17 |
+
"median_nll": 2.3344547748565674,
|
| 18 |
+
"ppl": 24.354916148231116,
|
| 19 |
+
"acc": 0.4002527817274923,
|
| 20 |
+
"tokens": 44307,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.94,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.94_gpu6.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.94_gpu6.json
|
| 36 |
+
Diversity metrics for temp0.94_gpu6.json:
|
| 37 |
+
distinct_1: 0.3008
|
| 38 |
+
repetition_1: 0.3345
|
| 39 |
+
d1: 0.3008
|
| 40 |
+
r1: 0.3345
|
| 41 |
+
distinct_2: 0.7881
|
| 42 |
+
repetition_2: 0.0529
|
| 43 |
+
d2: 0.7881
|
| 44 |
+
r2: 0.0529
|
| 45 |
+
distinct_4: 0.9895
|
| 46 |
+
repetition_4: 0.0072
|
| 47 |
+
d4: 0.9895
|
| 48 |
+
r4: 0.0072
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.94_gpu6.json
|
eval/ar_baseline_latest_test/logs/temp0.96_gpu7.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.96)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: '“Muppets” creators William And Bryan Thompson and Coleman Hentzen are perhaps the biggest Javascript evangelists you won'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 3.347551785956083,
|
| 17 |
+
"median_nll": 2.4971165657043457,
|
| 18 |
+
"ppl": 28.43303820046356,
|
| 19 |
+
"acc": 0.3820270361761188,
|
| 20 |
+
"tokens": 44311,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.96,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.96_gpu7.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.96_gpu7.json
|
| 36 |
+
Diversity metrics for temp0.96_gpu7.json:
|
| 37 |
+
distinct_1: 0.3048
|
| 38 |
+
repetition_1: 0.3282
|
| 39 |
+
d1: 0.3048
|
| 40 |
+
r1: 0.3282
|
| 41 |
+
distinct_2: 0.7967
|
| 42 |
+
repetition_2: 0.0504
|
| 43 |
+
d2: 0.7967
|
| 44 |
+
r2: 0.0504
|
| 45 |
+
distinct_4: 0.9934
|
| 46 |
+
repetition_4: 0.0056
|
| 47 |
+
d4: 0.9934
|
| 48 |
+
r4: 0.0056
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.96_gpu7.json
|
eval/ar_baseline_latest_test/logs/temp0.98_gpu1.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.98)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: "First and foremost we'd like to thank everyone who participated in the Equestrian/SFX / Rock ’Em Puppy contest and those"
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 3.492161918339162,
|
| 17 |
+
"median_nll": 2.6467158794403076,
|
| 18 |
+
"ppl": 32.8569049220607,
|
| 19 |
+
"acc": 0.37063684761544113,
|
| 20 |
+
"tokens": 44893,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.98,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.98_gpu1.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.98_gpu1.json
|
| 36 |
+
Diversity metrics for temp0.98_gpu1.json:
|
| 37 |
+
distinct_1: 0.3052
|
| 38 |
+
repetition_1: 0.3218
|
| 39 |
+
d1: 0.3052
|
| 40 |
+
r1: 0.3218
|
| 41 |
+
distinct_2: 0.7911
|
| 42 |
+
repetition_2: 0.0527
|
| 43 |
+
d2: 0.7911
|
| 44 |
+
r2: 0.0527
|
| 45 |
+
distinct_4: 0.9768
|
| 46 |
+
repetition_4: 0.0154
|
| 47 |
+
d4: 0.9768
|
| 48 |
+
r4: 0.0154
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.98_gpu1.json
|
eval/ar_baseline_latest_test/logs/temp0.98_gpu2.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.98)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'LONDON — The British media reported in articles Wednesday that ISIS has taken over Kirkuk, the Iraqi town that is disput'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 3.5845073000923775,
|
| 17 |
+
"median_nll": 2.740861415863037,
|
| 18 |
+
"ppl": 36.03559860815703,
|
| 19 |
+
"acc": 0.3579749002996643,
|
| 20 |
+
"tokens": 44383,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.98,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.98_gpu2.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.98_gpu2.json
|
| 36 |
+
Diversity metrics for temp0.98_gpu2.json:
|
| 37 |
+
distinct_1: 0.3213
|
| 38 |
+
repetition_1: 0.3055
|
| 39 |
+
d1: 0.3213
|
| 40 |
+
r1: 0.3055
|
| 41 |
+
distinct_2: 0.8150
|
| 42 |
+
repetition_2: 0.0394
|
| 43 |
+
d2: 0.8150
|
| 44 |
+
r2: 0.0394
|
| 45 |
+
distinct_4: 0.9945
|
| 46 |
+
repetition_4: 0.0031
|
| 47 |
+
d4: 0.9945
|
| 48 |
+
r4: 0.0031
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.98_gpu2.json
|
eval/ar_baseline_latest_test/logs/temp0.9_gpu2.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.9)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'LONDON — The British media reported in articles Wednesday that the New York-based investment fund founded in London by e'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 2.8760180329326013,
|
| 17 |
+
"median_nll": 2.0924065113067627,
|
| 18 |
+
"ppl": 17.74347837531484,
|
| 19 |
+
"acc": 0.4278127152729939,
|
| 20 |
+
"tokens": 45001,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.9,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.9_gpu2.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.9_gpu2.json
|
| 36 |
+
Diversity metrics for temp0.9_gpu2.json:
|
| 37 |
+
distinct_1: 0.2695
|
| 38 |
+
repetition_1: 0.3647
|
| 39 |
+
d1: 0.2695
|
| 40 |
+
r1: 0.3647
|
| 41 |
+
distinct_2: 0.7520
|
| 42 |
+
repetition_2: 0.0685
|
| 43 |
+
d2: 0.7520
|
| 44 |
+
r2: 0.0685
|
| 45 |
+
distinct_4: 0.9846
|
| 46 |
+
repetition_4: 0.0106
|
| 47 |
+
d4: 0.9846
|
| 48 |
+
r4: 0.0106
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.9_gpu2.json
|
eval/ar_baseline_latest_test/logs/temp0.9_gpu4.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=0.9)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: 'There is much heroism in the history of theatre in the United States. Whom to thank for this? Civil rights activist and '
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 2.866953418245275,
|
| 17 |
+
"median_nll": 2.039194107055664,
|
| 18 |
+
"ppl": 17.58336734933049,
|
| 19 |
+
"acc": 0.4339618499901223,
|
| 20 |
+
"tokens": 45557,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 0.9,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp0.9_gpu4.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp0.9_gpu4.json
|
| 36 |
+
Diversity metrics for temp0.9_gpu4.json:
|
| 37 |
+
distinct_1: 0.2818
|
| 38 |
+
repetition_1: 0.3673
|
| 39 |
+
d1: 0.2818
|
| 40 |
+
r1: 0.3673
|
| 41 |
+
distinct_2: 0.7574
|
| 42 |
+
repetition_2: 0.0721
|
| 43 |
+
d2: 0.7574
|
| 44 |
+
r2: 0.0721
|
| 45 |
+
distinct_4: 0.9824
|
| 46 |
+
repetition_4: 0.0126
|
| 47 |
+
d4: 0.9824
|
| 48 |
+
r4: 0.0126
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp0.9_gpu4.json
|
eval/ar_baseline_latest_test/logs/temp1_gpu7.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt
|
| 3 |
+
Loaded AR checkpoint: /home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt (step=500000)
|
| 4 |
+
Generating 128 samples (seq_len=512, temperature=1.0)...
|
| 5 |
+
sampled 64/128
|
| 6 |
+
sampled 128/128
|
| 7 |
+
First sample preview: '“Muppets” creators William And Bryan Thompson and Coleman Hentzen are perhaps the biggest Javascript evangelists you won'
|
| 8 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 9 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 10 |
+
|
| 11 |
+
Eval LM loaded (774,030,080 params)
|
| 12 |
+
Scoring samples under eval LM...
|
| 13 |
+
scored 64/128
|
| 14 |
+
scored 128/128
|
| 15 |
+
{
|
| 16 |
+
"avg_nll": 3.868952017700726,
|
| 17 |
+
"median_nll": 3.053391456604004,
|
| 18 |
+
"ppl": 47.892169626395194,
|
| 19 |
+
"acc": 0.3375880753003662,
|
| 20 |
+
"tokens": 46693,
|
| 21 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/ar_baseline/latest.pt",
|
| 22 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 23 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 24 |
+
"num_samples": 128,
|
| 25 |
+
"generated_seq_len": 512,
|
| 26 |
+
"mode": "ar_generation",
|
| 27 |
+
"temperature": 1.0,
|
| 28 |
+
"top_k": 0,
|
| 29 |
+
"top_p": 1.0,
|
| 30 |
+
"prompt_len": 1,
|
| 31 |
+
"max_new_tokens": 511,
|
| 32 |
+
"stop_on_eos": false
|
| 33 |
+
}
|
| 34 |
+
Saved metrics -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/metrics/temp1_gpu7.json
|
| 35 |
+
Saved samples -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/samples/temp1_gpu7.json
|
| 36 |
+
Diversity metrics for temp1_gpu7.json:
|
| 37 |
+
distinct_1: 0.3382
|
| 38 |
+
repetition_1: 0.2992
|
| 39 |
+
d1: 0.3382
|
| 40 |
+
r1: 0.2992
|
| 41 |
+
distinct_2: 0.8313
|
| 42 |
+
repetition_2: 0.0370
|
| 43 |
+
d2: 0.8313
|
| 44 |
+
r2: 0.0370
|
| 45 |
+
distinct_4: 0.9945
|
| 46 |
+
repetition_4: 0.0036
|
| 47 |
+
d4: 0.9945
|
| 48 |
+
r4: 0.0036
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> /home/sunhc/diffusion/sad/eval/ar_baseline_latest_test/diversity/temp1_gpu7.json
|
eval/h2_mixed_latest_test/logs/pps1_lam0.2_temp0.98_gpu4.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.2, 0.2]
|
| 5 |
+
leaf_temperature = 0.98
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 871)
|
| 8 |
+
Average denoising rounds per sample: 871.00
|
| 9 |
+
First sample preview: '. "It was like it was the alleged victim at night. It was so dark, and as the computers woke up -- having really shut up'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.002073652772666,
|
| 21 |
+
"median_nll": 4.476129055023193,
|
| 22 |
+
"ppl": 148.72123577307576,
|
| 23 |
+
"acc": 0.2389584100110416,
|
| 24 |
+
"tokens": 65208,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.2,0.2",
|
| 33 |
+
"avg_steps": 871.0,
|
| 34 |
+
"positions_per_step": 1,
|
| 35 |
+
"leaf_temperature": 0.98
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.2_temp0.98_gpu4.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.2_temp0.98_gpu4.json
|
| 39 |
+
Diversity metrics for pps1_lam0.2_temp0.98_gpu4.json:
|
| 40 |
+
distinct_1: 0.3263
|
| 41 |
+
repetition_1: 0.3001
|
| 42 |
+
d1: 0.3263
|
| 43 |
+
r1: 0.3001
|
| 44 |
+
distinct_2: 0.8356
|
| 45 |
+
repetition_2: 0.0237
|
| 46 |
+
d2: 0.8356
|
| 47 |
+
r2: 0.0237
|
| 48 |
+
distinct_4: 0.9988
|
| 49 |
+
repetition_4: 0.0006
|
| 50 |
+
d4: 0.9988
|
| 51 |
+
r4: 0.0006
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0.2_temp0.98_gpu4.json
|
eval/h2_mixed_latest_test/logs/pps1_lam0.2_temp1_gpu6.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.2, 0.2]
|
| 5 |
+
leaf_temperature = 1.0
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 953)
|
| 8 |
+
Average denoising rounds per sample: 953.00
|
| 9 |
+
First sample preview: ' to point to Twitter will help too.\n\n20: The CW •• DC • Eleventh\u200bArrow plus CW\n\nTriDest does have an expanded look withi'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.225233735122243,
|
| 21 |
+
"median_nll": 4.764096021652222,
|
| 22 |
+
"ppl": 185.9046178867565,
|
| 23 |
+
"acc": 0.21908647504524678,
|
| 24 |
+
"tokens": 65198,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.2,0.2",
|
| 33 |
+
"avg_steps": 953.0,
|
| 34 |
+
"positions_per_step": 1,
|
| 35 |
+
"leaf_temperature": 1.0
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.2_temp1_gpu6.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.2_temp1_gpu6.json
|
| 39 |
+
Diversity metrics for pps1_lam0.2_temp1_gpu6.json:
|
| 40 |
+
distinct_1: 0.3313
|
| 41 |
+
repetition_1: 0.3016
|
| 42 |
+
d1: 0.3313
|
| 43 |
+
r1: 0.3016
|
| 44 |
+
distinct_2: 0.8383
|
| 45 |
+
repetition_2: 0.0243
|
| 46 |
+
d2: 0.8383
|
| 47 |
+
r2: 0.0243
|
| 48 |
+
distinct_4: 0.9984
|
| 49 |
+
repetition_4: 0.0009
|
| 50 |
+
d4: 0.9984
|
| 51 |
+
r4: 0.0009
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0.2_temp1_gpu6.json
|
eval/h2_mixed_latest_test/logs/pps1_lam0.2_temp1_gpu7.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.2, 0.2]
|
| 5 |
+
leaf_temperature = 1.0
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 939)
|
| 8 |
+
Average denoising rounds per sample: 939.00
|
| 9 |
+
First sample preview: 's her resounding expedition to fuel use failed to kill the house, which eloquently echoes a notorious perhaps like Frank'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.26980805105218,
|
| 21 |
+
"median_nll": 4.809404373168945,
|
| 22 |
+
"ppl": 194.3786480873024,
|
| 23 |
+
"acc": 0.21971532869106414,
|
| 24 |
+
"tokens": 65198,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.2,0.2",
|
| 33 |
+
"avg_steps": 939.0,
|
| 34 |
+
"positions_per_step": 1,
|
| 35 |
+
"leaf_temperature": 1.0
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.2_temp1_gpu7.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.2_temp1_gpu7.json
|
| 39 |
+
Diversity metrics for pps1_lam0.2_temp1_gpu7.json:
|
| 40 |
+
distinct_1: 0.3403
|
| 41 |
+
repetition_1: 0.2934
|
| 42 |
+
d1: 0.3403
|
| 43 |
+
r1: 0.2934
|
| 44 |
+
distinct_2: 0.8462
|
| 45 |
+
repetition_2: 0.0225
|
| 46 |
+
d2: 0.8462
|
| 47 |
+
r2: 0.0225
|
| 48 |
+
distinct_4: 0.9992
|
| 49 |
+
repetition_4: 0.0003
|
| 50 |
+
d4: 0.9992
|
| 51 |
+
r4: 0.0003
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0.2_temp1_gpu7.json
|
eval/h2_mixed_latest_test/logs/pps1_lam0.3_temp0.8_gpu1.log
ADDED
|
@@ -0,0 +1,52 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.3, 0.3]
|
| 5 |
+
leaf_temperature = 0.8
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 736)
|
| 8 |
+
Average denoising rounds per sample: 736.00
|
| 9 |
+
First sample preview: ' 3, 4, 7 3, 2, 8, 5, 7 3, 3, 3, 4 3, 3, 5 3, 3, 3 3, 3, 8, 7 3, 3, 6, 5 3, 3, 6, 6 3, 3, 3, 3 7 3, 5 4, 1, 2, 1, 7 5, 1,'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 3.1288898825283176,
|
| 21 |
+
"median_nll": 2.3229328393936157,
|
| 22 |
+
"ppl": 22.848600827387646,
|
| 23 |
+
"acc": 0.39922337845719374,
|
| 24 |
+
"tokens": 65154,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"level_lambdas": "0.3,0.3",
|
| 32 |
+
"avg_steps": 736.0,
|
| 33 |
+
"positions_per_step": 1,
|
| 34 |
+
"leaf_temperature": 0.8
|
| 35 |
+
}
|
| 36 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.3_temp0.8_gpu1.json
|
| 37 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.3_temp0.8_gpu1.json
|
| 38 |
+
Diversity metrics for pps1_lam0.3_temp0.8_gpu1.json:
|
| 39 |
+
distinct_1: 0.2121
|
| 40 |
+
repetition_1: 0.4603
|
| 41 |
+
d1: 0.2121
|
| 42 |
+
r1: 0.4603
|
| 43 |
+
distinct_2: 0.6760
|
| 44 |
+
repetition_2: 0.1178
|
| 45 |
+
d2: 0.6760
|
| 46 |
+
r2: 0.1178
|
| 47 |
+
distinct_4: 0.9735
|
| 48 |
+
repetition_4: 0.0227
|
| 49 |
+
d4: 0.9735
|
| 50 |
+
r4: 0.0227
|
| 51 |
+
num_samples: 128.0000
|
| 52 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0.3_temp0.8_gpu1.json
|
eval/h2_mixed_latest_test/logs/pps1_lam0.3_temp0.8_gpu3.log
ADDED
|
@@ -0,0 +1,52 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.3, 0.3]
|
| 5 |
+
leaf_temperature = 0.8
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 753)
|
| 8 |
+
Average denoising rounds per sample: 753.00
|
| 9 |
+
First sample preview: ' sure that nobody covers them.\n\nAdvertisement\n\nThey chanted and sang for the national anthem and the Astoria State anthe'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 3.202027189317,
|
| 21 |
+
"median_nll": 2.4177517890930176,
|
| 22 |
+
"ppl": 24.582312722497303,
|
| 23 |
+
"acc": 0.3893960081616372,
|
| 24 |
+
"tokens": 65183,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"level_lambdas": "0.3,0.3",
|
| 32 |
+
"avg_steps": 753.0,
|
| 33 |
+
"positions_per_step": 1,
|
| 34 |
+
"leaf_temperature": 0.8
|
| 35 |
+
}
|
| 36 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.3_temp0.8_gpu3.json
|
| 37 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.3_temp0.8_gpu3.json
|
| 38 |
+
Diversity metrics for pps1_lam0.3_temp0.8_gpu3.json:
|
| 39 |
+
distinct_1: 0.2134
|
| 40 |
+
repetition_1: 0.4545
|
| 41 |
+
d1: 0.2134
|
| 42 |
+
r1: 0.4545
|
| 43 |
+
distinct_2: 0.6809
|
| 44 |
+
repetition_2: 0.1049
|
| 45 |
+
d2: 0.6809
|
| 46 |
+
r2: 0.1049
|
| 47 |
+
distinct_4: 0.9807
|
| 48 |
+
repetition_4: 0.0124
|
| 49 |
+
d4: 0.9807
|
| 50 |
+
r4: 0.0124
|
| 51 |
+
num_samples: 128.0000
|
| 52 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0.3_temp0.8_gpu3.json
|
eval/h2_mixed_latest_test/logs/pps1_lam0.4_temp0.8_gpu0.log
ADDED
|
@@ -0,0 +1,40 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.4, 0.4]
|
| 5 |
+
leaf_temperature = 0.8
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 32/128 (steps this call: 778)
|
| 8 |
+
sampled 64/128 (steps this call: 812)
|
| 9 |
+
sampled 96/128 (steps this call: 821)
|
| 10 |
+
sampled 128/128 (steps this call: 832)
|
| 11 |
+
Average denoising rounds per sample: 810.75
|
| 12 |
+
First sample preview: 'Australians hate Kim Shau, a social media user who would like to say: "Oh no, only rich people are waiting for me", says'
|
| 13 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 14 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 15 |
+
|
| 16 |
+
Eval LM loaded (774,030,080 params)
|
| 17 |
+
Scoring samples under eval LM...
|
| 18 |
+
scored 32/128
|
| 19 |
+
scored 64/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 128/128
|
| 22 |
+
{
|
| 23 |
+
"avg_nll": 3.2707012796030432,
|
| 24 |
+
"median_nll": 2.45578670501709,
|
| 25 |
+
"ppl": 26.329797420256064,
|
| 26 |
+
"acc": 0.3880606172157801,
|
| 27 |
+
"tokens": 65196,
|
| 28 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 29 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 30 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"num_samples": 128,
|
| 32 |
+
"generated_seq_len": 512,
|
| 33 |
+
"mode": "sad_generation",
|
| 34 |
+
"level_lambdas": "0.4,0.4",
|
| 35 |
+
"avg_steps": 810.75,
|
| 36 |
+
"positions_per_step": 1,
|
| 37 |
+
"leaf_temperature": 0.8
|
| 38 |
+
}
|
| 39 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.4_temp0.8_gpu0.json
|
| 40 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.4_temp0.8_gpu0.json
|
eval/h2_mixed_latest_test/logs/pps1_lam0.6_temp0.98_gpu4.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6, 0.6]
|
| 5 |
+
leaf_temperature = 0.98
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 1333)
|
| 8 |
+
Average denoising rounds per sample: 1333.00
|
| 9 |
+
First sample preview: '. "It was clear what came out of the scorpion. We ran a tar, tape and a pencil as it goes but we have our first nail cut'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 4.9946654149401475,
|
| 21 |
+
"median_nll": 4.464876890182495,
|
| 22 |
+
"ppl": 147.62354448706483,
|
| 23 |
+
"acc": 0.2424953959484346,
|
| 24 |
+
"tokens": 65160,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6,0.6",
|
| 33 |
+
"avg_steps": 1333.0,
|
| 34 |
+
"positions_per_step": 1,
|
| 35 |
+
"leaf_temperature": 0.98
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.6_temp0.98_gpu4.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.6_temp0.98_gpu4.json
|
| 39 |
+
Diversity metrics for pps1_lam0.6_temp0.98_gpu4.json:
|
| 40 |
+
distinct_1: 0.3372
|
| 41 |
+
repetition_1: 0.3038
|
| 42 |
+
d1: 0.3372
|
| 43 |
+
r1: 0.3038
|
| 44 |
+
distinct_2: 0.8377
|
| 45 |
+
repetition_2: 0.0283
|
| 46 |
+
d2: 0.8377
|
| 47 |
+
r2: 0.0283
|
| 48 |
+
distinct_4: 0.9982
|
| 49 |
+
repetition_4: 0.0012
|
| 50 |
+
d4: 0.9982
|
| 51 |
+
r4: 0.0012
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0.6_temp0.98_gpu4.json
|
eval/h2_mixed_latest_test/logs/pps1_lam0.6_temp0.9_gpu5.log
ADDED
|
@@ -0,0 +1,55 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6, 0.6]
|
| 5 |
+
leaf_temperature = 0.9
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 32/128 (steps this call: 1105)
|
| 8 |
+
sampled 64/128 (steps this call: 1157)
|
| 9 |
+
sampled 96/128 (steps this call: 1120)
|
| 10 |
+
sampled 128/128 (steps this call: 1127)
|
| 11 |
+
Average denoising rounds per sample: 1127.25
|
| 12 |
+
First sample preview: ' hemp.\n\nLegal\n\nThe growing market for hemp has drummed up goodwill. According to its website, the American Dictionary of'
|
| 13 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 14 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 15 |
+
|
| 16 |
+
Eval LM loaded (774,030,080 params)
|
| 17 |
+
Scoring samples under eval LM...
|
| 18 |
+
scored 32/128
|
| 19 |
+
scored 64/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 128/128
|
| 22 |
+
{
|
| 23 |
+
"avg_nll": 4.223532691408287,
|
| 24 |
+
"median_nll": 3.5249366760253906,
|
| 25 |
+
"ppl": 68.27425062102515,
|
| 26 |
+
"acc": 0.29709878247002175,
|
| 27 |
+
"tokens": 65214,
|
| 28 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 29 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 30 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"num_samples": 128,
|
| 32 |
+
"generated_seq_len": 512,
|
| 33 |
+
"mode": "sad_generation",
|
| 34 |
+
"level_lambdas": "0.6,0.6",
|
| 35 |
+
"avg_steps": 1127.25,
|
| 36 |
+
"positions_per_step": 1,
|
| 37 |
+
"leaf_temperature": 0.9
|
| 38 |
+
}
|
| 39 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.6_temp0.9_gpu5.json
|
| 40 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.6_temp0.9_gpu5.json
|
| 41 |
+
Diversity metrics for pps1_lam0.6_temp0.9_gpu5.json:
|
| 42 |
+
distinct_1: 0.2830
|
| 43 |
+
repetition_1: 0.3659
|
| 44 |
+
d1: 0.2830
|
| 45 |
+
r1: 0.3659
|
| 46 |
+
distinct_2: 0.7855
|
| 47 |
+
repetition_2: 0.0505
|
| 48 |
+
d2: 0.7855
|
| 49 |
+
r2: 0.0505
|
| 50 |
+
distinct_4: 0.9954
|
| 51 |
+
repetition_4: 0.0029
|
| 52 |
+
d4: 0.9954
|
| 53 |
+
r4: 0.0029
|
| 54 |
+
num_samples: 128.0000
|
| 55 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0.6_temp0.9_gpu5.json
|
eval/h2_mixed_latest_test/logs/pps1_lam0.7_temp0.9_gpu0.log
ADDED
|
@@ -0,0 +1,51 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.7, 0.7]
|
| 5 |
+
leaf_temperature = 0.9
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 64/128 (steps this call: 1215)
|
| 8 |
+
sampled 128/128 (steps this call: 1198)
|
| 9 |
+
Average denoising rounds per sample: 1206.50
|
| 10 |
+
First sample preview: "'s why [the] state's like destabilizing it. I remember [the state] had a 100-page list of nuclear weapons and they didn'"
|
| 11 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 13 |
+
|
| 14 |
+
Eval LM loaded (774,030,080 params)
|
| 15 |
+
Scoring samples under eval LM...
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 128/128
|
| 18 |
+
{
|
| 19 |
+
"avg_nll": 4.1800211892045365,
|
| 20 |
+
"median_nll": 3.4635732173919678,
|
| 21 |
+
"ppl": 65.36723827911753,
|
| 22 |
+
"acc": 0.30498641742253324,
|
| 23 |
+
"tokens": 65157,
|
| 24 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 25 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 26 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"num_samples": 128,
|
| 28 |
+
"generated_seq_len": 512,
|
| 29 |
+
"mode": "sad_generation",
|
| 30 |
+
"level_lambdas": "0.7,0.7",
|
| 31 |
+
"avg_steps": 1206.5,
|
| 32 |
+
"positions_per_step": 1,
|
| 33 |
+
"leaf_temperature": 0.9
|
| 34 |
+
}
|
| 35 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0.7_temp0.9_gpu0.json
|
| 36 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0.7_temp0.9_gpu0.json
|
| 37 |
+
Diversity metrics for pps1_lam0.7_temp0.9_gpu0.json:
|
| 38 |
+
distinct_1: 0.2883
|
| 39 |
+
repetition_1: 0.3510
|
| 40 |
+
d1: 0.2883
|
| 41 |
+
r1: 0.3510
|
| 42 |
+
distinct_2: 0.7919
|
| 43 |
+
repetition_2: 0.0445
|
| 44 |
+
d2: 0.7919
|
| 45 |
+
r2: 0.0445
|
| 46 |
+
distinct_4: 0.9962
|
| 47 |
+
repetition_4: 0.0023
|
| 48 |
+
d4: 0.9962
|
| 49 |
+
r4: 0.0023
|
| 50 |
+
num_samples: 128.0000
|
| 51 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0.7_temp0.9_gpu0.json
|
eval/h2_mixed_latest_test/logs/pps1_lam0_temp0.7_gpu1.log
ADDED
|
@@ -0,0 +1,55 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.0, 0.0]
|
| 5 |
+
leaf_temperature = 0.7
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 32/128 (steps this call: 512)
|
| 8 |
+
sampled 64/128 (steps this call: 512)
|
| 9 |
+
sampled 96/128 (steps this call: 512)
|
| 10 |
+
sampled 128/128 (steps this call: 512)
|
| 11 |
+
Average denoising rounds per sample: 512.00
|
| 12 |
+
First sample preview: 'Hello Military Users,\n\n---\n\nNote: Some want to quote us from:\n\nAs of last Thursday, we went to work on the new engine us'
|
| 13 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 14 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 15 |
+
|
| 16 |
+
Eval LM loaded (774,030,080 params)
|
| 17 |
+
Scoring samples under eval LM...
|
| 18 |
+
scored 32/128
|
| 19 |
+
scored 64/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 128/128
|
| 22 |
+
{
|
| 23 |
+
"avg_nll": 2.4444901757231374,
|
| 24 |
+
"median_nll": 1.648135781288147,
|
| 25 |
+
"ppl": 11.524672542987966,
|
| 26 |
+
"acc": 0.4860126989969633,
|
| 27 |
+
"tokens": 65202,
|
| 28 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 29 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 30 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"num_samples": 128,
|
| 32 |
+
"generated_seq_len": 512,
|
| 33 |
+
"mode": "sad_generation",
|
| 34 |
+
"level_lambdas": "0,0",
|
| 35 |
+
"avg_steps": 512.0,
|
| 36 |
+
"positions_per_step": 1,
|
| 37 |
+
"leaf_temperature": 0.7
|
| 38 |
+
}
|
| 39 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps1_lam0_temp0.7_gpu1.json
|
| 40 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps1_lam0_temp0.7_gpu1.json
|
| 41 |
+
Diversity metrics for pps1_lam0_temp0.7_gpu1.json:
|
| 42 |
+
distinct_1: 0.1709
|
| 43 |
+
repetition_1: 0.5429
|
| 44 |
+
d1: 0.1709
|
| 45 |
+
r1: 0.5429
|
| 46 |
+
distinct_2: 0.5770
|
| 47 |
+
repetition_2: 0.2116
|
| 48 |
+
d2: 0.5770
|
| 49 |
+
r2: 0.2116
|
| 50 |
+
distinct_4: 0.9309
|
| 51 |
+
repetition_4: 0.0593
|
| 52 |
+
d4: 0.9309
|
| 53 |
+
r4: 0.0593
|
| 54 |
+
num_samples: 128.0000
|
| 55 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps1_lam0_temp0.7_gpu1.json
|
eval/h2_mixed_latest_test/logs/pps2_lam0.2_temp1_gpu1.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.2, 0.2]
|
| 5 |
+
leaf_temperature = 1.0
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 512)
|
| 8 |
+
Average denoising rounds per sample: 512.00
|
| 9 |
+
First sample preview: ' and donate to a grassroots movement\n\nin Bali municipalities,\nweijmas Campaign for demolition of 3rd house and stone ent'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.675843099708208,
|
| 21 |
+
"median_nll": 5.313490867614746,
|
| 22 |
+
"ppl": 291.73419590506444,
|
| 23 |
+
"acc": 0.19218306073869307,
|
| 24 |
+
"tokens": 65115,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.2,0.2",
|
| 33 |
+
"avg_steps": 512.0,
|
| 34 |
+
"positions_per_step": 2,
|
| 35 |
+
"leaf_temperature": 1.0
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.2_temp1_gpu1.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.2_temp1_gpu1.json
|
| 39 |
+
Diversity metrics for pps2_lam0.2_temp1_gpu1.json:
|
| 40 |
+
distinct_1: 0.3569
|
| 41 |
+
repetition_1: 0.2830
|
| 42 |
+
d1: 0.3569
|
| 43 |
+
r1: 0.2830
|
| 44 |
+
distinct_2: 0.8555
|
| 45 |
+
repetition_2: 0.0209
|
| 46 |
+
d2: 0.8555
|
| 47 |
+
r2: 0.0209
|
| 48 |
+
distinct_4: 0.9994
|
| 49 |
+
repetition_4: 0.0001
|
| 50 |
+
d4: 0.9994
|
| 51 |
+
r4: 0.0001
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.2_temp1_gpu1.json
|
eval/h2_mixed_latest_test/logs/pps2_lam0.3_temp0.8_gpu4.log
ADDED
|
@@ -0,0 +1,52 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.3, 0.3]
|
| 5 |
+
leaf_temperature = 0.8
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 387)
|
| 8 |
+
Average denoising rounds per sample: 387.00
|
| 9 |
+
First sample preview: '"It was like we gave up," he said.\n\nThe residents of the tower declined to comment for the story, but have pointed to th'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 3.482659498755244,
|
| 21 |
+
"median_nll": 2.7303624153137207,
|
| 22 |
+
"ppl": 32.54616356088146,
|
| 23 |
+
"acc": 0.3610560447497426,
|
| 24 |
+
"tokens": 65073,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"level_lambdas": "0.3,0.3",
|
| 32 |
+
"avg_steps": 387.0,
|
| 33 |
+
"positions_per_step": 2,
|
| 34 |
+
"leaf_temperature": 0.8
|
| 35 |
+
}
|
| 36 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.3_temp0.8_gpu4.json
|
| 37 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.3_temp0.8_gpu4.json
|
| 38 |
+
Diversity metrics for pps2_lam0.3_temp0.8_gpu4.json:
|
| 39 |
+
distinct_1: 0.2266
|
| 40 |
+
repetition_1: 0.4379
|
| 41 |
+
d1: 0.2266
|
| 42 |
+
r1: 0.4379
|
| 43 |
+
distinct_2: 0.7021
|
| 44 |
+
repetition_2: 0.0890
|
| 45 |
+
d2: 0.7021
|
| 46 |
+
r2: 0.0890
|
| 47 |
+
distinct_4: 0.9878
|
| 48 |
+
repetition_4: 0.0079
|
| 49 |
+
d4: 0.9878
|
| 50 |
+
r4: 0.0079
|
| 51 |
+
num_samples: 128.0000
|
| 52 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.3_temp0.8_gpu4.json
|
eval/h2_mixed_latest_test/logs/pps2_lam0.3_temp0.9_gpu4.log
ADDED
|
@@ -0,0 +1,51 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.3, 0.3]
|
| 5 |
+
leaf_temperature = 0.9
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 64/128 (steps this call: 453)
|
| 8 |
+
sampled 128/128 (steps this call: 454)
|
| 9 |
+
Average denoising rounds per sample: 453.50
|
| 10 |
+
First sample preview: ' that rather than being helped by others like Manning’s chronic lack of eagerness.\n\nThat said, the Broncos need a dire c'
|
| 11 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 13 |
+
|
| 14 |
+
Eval LM loaded (774,030,080 params)
|
| 15 |
+
Scoring samples under eval LM...
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 128/128
|
| 18 |
+
{
|
| 19 |
+
"avg_nll": 4.41296852458639,
|
| 20 |
+
"median_nll": 3.775259852409363,
|
| 21 |
+
"ppl": 82.514045273213,
|
| 22 |
+
"acc": 0.27863040608981243,
|
| 23 |
+
"tokens": 65158,
|
| 24 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 25 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 26 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"num_samples": 128,
|
| 28 |
+
"generated_seq_len": 512,
|
| 29 |
+
"mode": "sad_generation",
|
| 30 |
+
"level_lambdas": "0.3,0.3",
|
| 31 |
+
"avg_steps": 453.5,
|
| 32 |
+
"positions_per_step": 2,
|
| 33 |
+
"leaf_temperature": 0.9
|
| 34 |
+
}
|
| 35 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.3_temp0.9_gpu4.json
|
| 36 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.3_temp0.9_gpu4.json
|
| 37 |
+
Diversity metrics for pps2_lam0.3_temp0.9_gpu4.json:
|
| 38 |
+
distinct_1: 0.2770
|
| 39 |
+
repetition_1: 0.3646
|
| 40 |
+
d1: 0.2770
|
| 41 |
+
r1: 0.3646
|
| 42 |
+
distinct_2: 0.7787
|
| 43 |
+
repetition_2: 0.0444
|
| 44 |
+
d2: 0.7787
|
| 45 |
+
r2: 0.0444
|
| 46 |
+
distinct_4: 0.9964
|
| 47 |
+
repetition_4: 0.0013
|
| 48 |
+
d4: 0.9964
|
| 49 |
+
r4: 0.0013
|
| 50 |
+
num_samples: 128.0000
|
| 51 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.3_temp0.9_gpu4.json
|
eval/h2_mixed_latest_test/logs/pps2_lam0.6_temp0.94_gpu3.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6, 0.6]
|
| 5 |
+
leaf_temperature = 0.94
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 652)
|
| 8 |
+
Average denoising rounds per sample: 652.00
|
| 9 |
+
First sample preview: ' Minutearo Minus.\n\n9,8 Marcel Jr.\n\n9\n\nmolonio Junior nabbed a replay, adding 1 TOV to the game in a row.\n\nJust 2 percent'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 4.835658662038316,
|
| 21 |
+
"median_nll": 4.23482084274292,
|
| 22 |
+
"ppl": 125.9214956072145,
|
| 23 |
+
"acc": 0.25355377483037056,
|
| 24 |
+
"tokens": 65142,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6,0.6",
|
| 33 |
+
"avg_steps": 652.0,
|
| 34 |
+
"positions_per_step": 2,
|
| 35 |
+
"leaf_temperature": 0.94
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.6_temp0.94_gpu3.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.6_temp0.94_gpu3.json
|
| 39 |
+
Diversity metrics for pps2_lam0.6_temp0.94_gpu3.json:
|
| 40 |
+
distinct_1: 0.3206
|
| 41 |
+
repetition_1: 0.3197
|
| 42 |
+
d1: 0.3206
|
| 43 |
+
r1: 0.3197
|
| 44 |
+
distinct_2: 0.8238
|
| 45 |
+
repetition_2: 0.0345
|
| 46 |
+
d2: 0.8238
|
| 47 |
+
r2: 0.0345
|
| 48 |
+
distinct_4: 0.9980
|
| 49 |
+
repetition_4: 0.0011
|
| 50 |
+
d4: 0.9980
|
| 51 |
+
r4: 0.0011
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.6_temp0.94_gpu3.json
|
eval/h2_mixed_latest_test/logs/pps2_lam0.6_temp1_gpu5.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6, 0.6]
|
| 5 |
+
leaf_temperature = 1.0
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 719)
|
| 8 |
+
Average denoising rounds per sample: 719.00
|
| 9 |
+
First sample preview: ' the quasi-Suicide template.\n\nEvery surrogate of the Australian “killer cop” provided by Spox (whose cops were eclipsed '
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.496910366953119,
|
| 21 |
+
"median_nll": 5.08622932434082,
|
| 22 |
+
"ppl": 243.9370906762153,
|
| 23 |
+
"acc": 0.20297705823678355,
|
| 24 |
+
"tokens": 65165,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6,0.6",
|
| 33 |
+
"avg_steps": 719.0,
|
| 34 |
+
"positions_per_step": 2,
|
| 35 |
+
"leaf_temperature": 1.0
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.6_temp1_gpu5.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.6_temp1_gpu5.json
|
| 39 |
+
Diversity metrics for pps2_lam0.6_temp1_gpu5.json:
|
| 40 |
+
distinct_1: 0.3585
|
| 41 |
+
repetition_1: 0.2841
|
| 42 |
+
d1: 0.3585
|
| 43 |
+
r1: 0.2841
|
| 44 |
+
distinct_2: 0.8633
|
| 45 |
+
repetition_2: 0.0215
|
| 46 |
+
d2: 0.8633
|
| 47 |
+
r2: 0.0215
|
| 48 |
+
distinct_4: 0.9991
|
| 49 |
+
repetition_4: 0.0005
|
| 50 |
+
d4: 0.9991
|
| 51 |
+
r4: 0.0005
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.6_temp1_gpu5.json
|
eval/h2_mixed_latest_test/logs/pps2_lam0.6_temp1_gpu6.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6, 0.6]
|
| 5 |
+
leaf_temperature = 1.0
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 703)
|
| 8 |
+
Average denoising rounds per sample: 703.00
|
| 9 |
+
First sample preview: ' -- I had the [Obama] children on that plane, they really have to." He offered recollections about the Romney\'s White Ho'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.530916663150708,
|
| 21 |
+
"median_nll": 5.155064582824707,
|
| 22 |
+
"ppl": 252.3751480224496,
|
| 23 |
+
"acc": 0.20308688381227083,
|
| 24 |
+
"tokens": 65179,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6,0.6",
|
| 33 |
+
"avg_steps": 703.0,
|
| 34 |
+
"positions_per_step": 2,
|
| 35 |
+
"leaf_temperature": 1.0
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.6_temp1_gpu6.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.6_temp1_gpu6.json
|
| 39 |
+
Diversity metrics for pps2_lam0.6_temp1_gpu6.json:
|
| 40 |
+
distinct_1: 0.3621
|
| 41 |
+
repetition_1: 0.2806
|
| 42 |
+
d1: 0.3621
|
| 43 |
+
r1: 0.2806
|
| 44 |
+
distinct_2: 0.8631
|
| 45 |
+
repetition_2: 0.0215
|
| 46 |
+
d2: 0.8631
|
| 47 |
+
r2: 0.0215
|
| 48 |
+
distinct_4: 0.9989
|
| 49 |
+
repetition_4: 0.0005
|
| 50 |
+
d4: 0.9989
|
| 51 |
+
r4: 0.0005
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.6_temp1_gpu6.json
|
eval/h2_mixed_latest_test/logs/pps2_lam0.7_temp0.9_gpu6.log
ADDED
|
@@ -0,0 +1,51 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.7, 0.7]
|
| 5 |
+
leaf_temperature = 0.9
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 64/128 (steps this call: 620)
|
| 8 |
+
sampled 128/128 (steps this call: 622)
|
| 9 |
+
Average denoising rounds per sample: 621.00
|
| 10 |
+
First sample preview: 'Earlier this week, father of two Supreme Court Justices, S. Humayun (also known as the father of equal marriage) was ask'
|
| 11 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 13 |
+
|
| 14 |
+
Eval LM loaded (774,030,080 params)
|
| 15 |
+
Scoring samples under eval LM...
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 128/128
|
| 18 |
+
{
|
| 19 |
+
"avg_nll": 4.467391929840715,
|
| 20 |
+
"median_nll": 3.795100212097168,
|
| 21 |
+
"ppl": 87.1291873943412,
|
| 22 |
+
"acc": 0.28252462940797346,
|
| 23 |
+
"tokens": 65166,
|
| 24 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 25 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 26 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"num_samples": 128,
|
| 28 |
+
"generated_seq_len": 512,
|
| 29 |
+
"mode": "sad_generation",
|
| 30 |
+
"level_lambdas": "0.7,0.7",
|
| 31 |
+
"avg_steps": 621.0,
|
| 32 |
+
"positions_per_step": 2,
|
| 33 |
+
"leaf_temperature": 0.9
|
| 34 |
+
}
|
| 35 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.7_temp0.9_gpu6.json
|
| 36 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.7_temp0.9_gpu6.json
|
| 37 |
+
Diversity metrics for pps2_lam0.7_temp0.9_gpu6.json:
|
| 38 |
+
distinct_1: 0.3043
|
| 39 |
+
repetition_1: 0.3403
|
| 40 |
+
d1: 0.3043
|
| 41 |
+
r1: 0.3403
|
| 42 |
+
distinct_2: 0.8084
|
| 43 |
+
repetition_2: 0.0394
|
| 44 |
+
d2: 0.8084
|
| 45 |
+
r2: 0.0394
|
| 46 |
+
distinct_4: 0.9975
|
| 47 |
+
repetition_4: 0.0012
|
| 48 |
+
d4: 0.9975
|
| 49 |
+
r4: 0.0012
|
| 50 |
+
num_samples: 128.0000
|
| 51 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.7_temp0.9_gpu6.json
|
eval/h2_mixed_latest_test/logs/pps2_lam0.8_temp0.7_gpu4.log
ADDED
|
@@ -0,0 +1,51 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.8, 0.8]
|
| 5 |
+
leaf_temperature = 0.7
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 64/128 (steps this call: 508)
|
| 8 |
+
sampled 128/128 (steps this call: 505)
|
| 9 |
+
Average denoising rounds per sample: 506.50
|
| 10 |
+
First sample preview: ' stage at the newly opened Lucas and Mark Parker’s The Tour of Owings.\n\nI arrived in Raleigh to celebrate The Tour and t'
|
| 11 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 13 |
+
|
| 14 |
+
Eval LM loaded (774,030,080 params)
|
| 15 |
+
Scoring samples under eval LM...
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 128/128
|
| 18 |
+
{
|
| 19 |
+
"avg_nll": 3.015721177860601,
|
| 20 |
+
"median_nll": 2.095865249633789,
|
| 21 |
+
"ppl": 20.40380040496583,
|
| 22 |
+
"acc": 0.4302159379082456,
|
| 23 |
+
"tokens": 65065,
|
| 24 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 25 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 26 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"num_samples": 128,
|
| 28 |
+
"generated_seq_len": 512,
|
| 29 |
+
"mode": "sad_generation",
|
| 30 |
+
"level_lambdas": "0.8,0.8",
|
| 31 |
+
"avg_steps": 506.5,
|
| 32 |
+
"positions_per_step": 2,
|
| 33 |
+
"leaf_temperature": 0.7
|
| 34 |
+
}
|
| 35 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.8_temp0.7_gpu4.json
|
| 36 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.8_temp0.7_gpu4.json
|
| 37 |
+
Diversity metrics for pps2_lam0.8_temp0.7_gpu4.json:
|
| 38 |
+
distinct_1: 0.2162
|
| 39 |
+
repetition_1: 0.4844
|
| 40 |
+
d1: 0.2162
|
| 41 |
+
r1: 0.4844
|
| 42 |
+
distinct_2: 0.6706
|
| 43 |
+
repetition_2: 0.1492
|
| 44 |
+
d2: 0.6706
|
| 45 |
+
r2: 0.1492
|
| 46 |
+
distinct_4: 0.9678
|
| 47 |
+
repetition_4: 0.0299
|
| 48 |
+
d4: 0.9678
|
| 49 |
+
r4: 0.0299
|
| 50 |
+
num_samples: 128.0000
|
| 51 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.8_temp0.7_gpu4.json
|
eval/h2_mixed_latest_test/logs/pps2_lam0.8_temp0.94_gpu1.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.8, 0.8]
|
| 5 |
+
leaf_temperature = 0.94
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 695)
|
| 8 |
+
Average denoising rounds per sample: 695.00
|
| 9 |
+
First sample preview: 'A young Australian citizen has been taken to a police station in Christchurch, charged with simple theft of his identity'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 4.888195943640045,
|
| 21 |
+
"median_nll": 4.315791606903076,
|
| 22 |
+
"ppl": 132.7139345370263,
|
| 23 |
+
"acc": 0.2462536619783119,
|
| 24 |
+
"tokens": 65197,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.8,0.8",
|
| 33 |
+
"avg_steps": 695.0,
|
| 34 |
+
"positions_per_step": 2,
|
| 35 |
+
"leaf_temperature": 0.94
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.8_temp0.94_gpu1.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.8_temp0.94_gpu1.json
|
| 39 |
+
Diversity metrics for pps2_lam0.8_temp0.94_gpu1.json:
|
| 40 |
+
distinct_1: 0.3206
|
| 41 |
+
repetition_1: 0.3230
|
| 42 |
+
d1: 0.3206
|
| 43 |
+
r1: 0.3230
|
| 44 |
+
distinct_2: 0.8286
|
| 45 |
+
repetition_2: 0.0332
|
| 46 |
+
d2: 0.8286
|
| 47 |
+
r2: 0.0332
|
| 48 |
+
distinct_4: 0.9986
|
| 49 |
+
repetition_4: 0.0007
|
| 50 |
+
d4: 0.9986
|
| 51 |
+
r4: 0.0007
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.8_temp0.94_gpu1.json
|
eval/h2_mixed_latest_test/logs/pps2_lam0.8_temp0.96_gpu0.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.8, 0.8]
|
| 5 |
+
leaf_temperature = 0.96
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 694)
|
| 8 |
+
Average denoising rounds per sample: 694.00
|
| 9 |
+
First sample preview: 'Microsoft CEO, Dennis Hewitt in his keynote speech this week called layoffs "unthinkable and unary" and What he reported'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.019142003605953,
|
| 21 |
+
"median_nll": 4.467703580856323,
|
| 22 |
+
"ppl": 151.28144915675097,
|
| 23 |
+
"acc": 0.24060150375939848,
|
| 24 |
+
"tokens": 65170,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.8,0.8",
|
| 33 |
+
"avg_steps": 694.0,
|
| 34 |
+
"positions_per_step": 2,
|
| 35 |
+
"leaf_temperature": 0.96
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.8_temp0.96_gpu0.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.8_temp0.96_gpu0.json
|
| 39 |
+
Diversity metrics for pps2_lam0.8_temp0.96_gpu0.json:
|
| 40 |
+
distinct_1: 0.3321
|
| 41 |
+
repetition_1: 0.3117
|
| 42 |
+
d1: 0.3321
|
| 43 |
+
r1: 0.3117
|
| 44 |
+
distinct_2: 0.8361
|
| 45 |
+
repetition_2: 0.0299
|
| 46 |
+
d2: 0.8361
|
| 47 |
+
r2: 0.0299
|
| 48 |
+
distinct_4: 0.9982
|
| 49 |
+
repetition_4: 0.0012
|
| 50 |
+
d4: 0.9982
|
| 51 |
+
r4: 0.0012
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.8_temp0.96_gpu0.json
|
eval/h2_mixed_latest_test/logs/pps2_lam0.8_temp0.96_gpu3.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.8, 0.8]
|
| 5 |
+
leaf_temperature = 0.96
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 704)
|
| 8 |
+
Average denoising rounds per sample: 704.00
|
| 9 |
+
First sample preview: " sure, you'll choose.\n\nFavor white. Range can be $necky. Then vary the widest. Exclusively in store TICKS TO Configure t"
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 4.978640177831968,
|
| 21 |
+
"median_nll": 4.449566602706909,
|
| 22 |
+
"ppl": 145.27669680313952,
|
| 23 |
+
"acc": 0.24482377841170516,
|
| 24 |
+
"tokens": 65202,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.8,0.8",
|
| 33 |
+
"avg_steps": 704.0,
|
| 34 |
+
"positions_per_step": 2,
|
| 35 |
+
"leaf_temperature": 0.96
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.8_temp0.96_gpu3.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.8_temp0.96_gpu3.json
|
| 39 |
+
Diversity metrics for pps2_lam0.8_temp0.96_gpu3.json:
|
| 40 |
+
distinct_1: 0.3278
|
| 41 |
+
repetition_1: 0.3168
|
| 42 |
+
d1: 0.3278
|
| 43 |
+
r1: 0.3168
|
| 44 |
+
distinct_2: 0.8327
|
| 45 |
+
repetition_2: 0.0312
|
| 46 |
+
d2: 0.8327
|
| 47 |
+
r2: 0.0312
|
| 48 |
+
distinct_4: 0.9980
|
| 49 |
+
repetition_4: 0.0010
|
| 50 |
+
d4: 0.9980
|
| 51 |
+
r4: 0.0010
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.8_temp0.96_gpu3.json
|
eval/h2_mixed_latest_test/logs/pps2_lam0.9_temp0.8_gpu7.log
ADDED
|
@@ -0,0 +1,52 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from cli:/home/sunhc/diffusion/sad/configs/block_ar_owt_b32_h2_mixed.yaml
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.9, 0.9]
|
| 5 |
+
leaf_temperature = 0.8
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 606)
|
| 8 |
+
Average denoising rounds per sample: 606.00
|
| 9 |
+
First sample preview: '\nPolice say the habit of drifting in, from water, streams and streams driven by burning cars, is colloquially known as “'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 3.702768828146601,
|
| 21 |
+
"median_nll": 2.8821914196014404,
|
| 22 |
+
"ppl": 40.559451180823665,
|
| 23 |
+
"acc": 0.354950692759055,
|
| 24 |
+
"tokens": 65102,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"level_lambdas": "0.9,0.9",
|
| 32 |
+
"avg_steps": 606.0,
|
| 33 |
+
"positions_per_step": 2,
|
| 34 |
+
"leaf_temperature": 0.8
|
| 35 |
+
}
|
| 36 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0.9_temp0.8_gpu7.json
|
| 37 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0.9_temp0.8_gpu7.json
|
| 38 |
+
Diversity metrics for pps2_lam0.9_temp0.8_gpu7.json:
|
| 39 |
+
distinct_1: 0.2659
|
| 40 |
+
repetition_1: 0.3970
|
| 41 |
+
d1: 0.2659
|
| 42 |
+
r1: 0.3970
|
| 43 |
+
distinct_2: 0.7519
|
| 44 |
+
repetition_2: 0.0752
|
| 45 |
+
d2: 0.7519
|
| 46 |
+
r2: 0.0752
|
| 47 |
+
distinct_4: 0.9895
|
| 48 |
+
repetition_4: 0.0076
|
| 49 |
+
d4: 0.9895
|
| 50 |
+
r4: 0.0076
|
| 51 |
+
num_samples: 128.0000
|
| 52 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0.9_temp0.8_gpu7.json
|
eval/h2_mixed_latest_test/logs/pps2_lam0_temp0.8_gpu2.log
ADDED
|
@@ -0,0 +1,51 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.0, 0.0]
|
| 5 |
+
leaf_temperature = 0.8
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 64/128 (steps this call: 256)
|
| 8 |
+
sampled 128/128 (steps this call: 256)
|
| 9 |
+
Average denoising rounds per sample: 256.00
|
| 10 |
+
First sample preview: ' hotel bookings lost interest in the second half of the year after another 19-year-old student suffered an overdose in J'
|
| 11 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 13 |
+
|
| 14 |
+
Eval LM loaded (774,030,080 params)
|
| 15 |
+
Scoring samples under eval LM...
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 128/128
|
| 18 |
+
{
|
| 19 |
+
"avg_nll": 3.3971109011650245,
|
| 20 |
+
"median_nll": 2.6199722290039062,
|
| 21 |
+
"ppl": 29.877655734069887,
|
| 22 |
+
"acc": 0.37552833407620306,
|
| 23 |
+
"tokens": 65063,
|
| 24 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 25 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 26 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"num_samples": 128,
|
| 28 |
+
"generated_seq_len": 512,
|
| 29 |
+
"mode": "sad_generation",
|
| 30 |
+
"level_lambdas": "0,0",
|
| 31 |
+
"avg_steps": 256.0,
|
| 32 |
+
"positions_per_step": 2,
|
| 33 |
+
"leaf_temperature": 0.8
|
| 34 |
+
}
|
| 35 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam0_temp0.8_gpu2.json
|
| 36 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam0_temp0.8_gpu2.json
|
| 37 |
+
Diversity metrics for pps2_lam0_temp0.8_gpu2.json:
|
| 38 |
+
distinct_1: 0.2232
|
| 39 |
+
repetition_1: 0.4462
|
| 40 |
+
d1: 0.2232
|
| 41 |
+
r1: 0.4462
|
| 42 |
+
distinct_2: 0.6930
|
| 43 |
+
repetition_2: 0.1038
|
| 44 |
+
d2: 0.6930
|
| 45 |
+
r2: 0.1038
|
| 46 |
+
distinct_4: 0.9848
|
| 47 |
+
repetition_4: 0.0122
|
| 48 |
+
d4: 0.9848
|
| 49 |
+
r4: 0.0122
|
| 50 |
+
num_samples: 128.0000
|
| 51 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam0_temp0.8_gpu2.json
|
eval/h2_mixed_latest_test/logs/pps2_lam1_temp0.8_gpu3.log
ADDED
|
@@ -0,0 +1,51 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [1.0, 1.0]
|
| 5 |
+
leaf_temperature = 0.8
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 64/128 (steps this call: 633)
|
| 8 |
+
sampled 128/128 (steps this call: 619)
|
| 9 |
+
Average denoising rounds per sample: 626.00
|
| 10 |
+
First sample preview: ' Novemberó, Pan, Kyana, Picá and Cocoding. You can check out the Loop’s history of graffiti, or view a text list of graf'
|
| 11 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 13 |
+
|
| 14 |
+
Eval LM loaded (774,030,080 params)
|
| 15 |
+
Scoring samples under eval LM...
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 128/128
|
| 18 |
+
{
|
| 19 |
+
"avg_nll": 3.7846832664012395,
|
| 20 |
+
"median_nll": 2.987057089805603,
|
| 21 |
+
"ppl": 44.02172519093987,
|
| 22 |
+
"acc": 0.3443800055233361,
|
| 23 |
+
"tokens": 65178,
|
| 24 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 25 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 26 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"num_samples": 128,
|
| 28 |
+
"generated_seq_len": 512,
|
| 29 |
+
"mode": "sad_generation",
|
| 30 |
+
"level_lambdas": "1,1",
|
| 31 |
+
"avg_steps": 626.0,
|
| 32 |
+
"positions_per_step": 2,
|
| 33 |
+
"leaf_temperature": 0.8
|
| 34 |
+
}
|
| 35 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam1_temp0.8_gpu3.json
|
| 36 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam1_temp0.8_gpu3.json
|
| 37 |
+
Diversity metrics for pps2_lam1_temp0.8_gpu3.json:
|
| 38 |
+
distinct_1: 0.2723
|
| 39 |
+
repetition_1: 0.3864
|
| 40 |
+
d1: 0.2723
|
| 41 |
+
r1: 0.3864
|
| 42 |
+
distinct_2: 0.7657
|
| 43 |
+
repetition_2: 0.0654
|
| 44 |
+
d2: 0.7657
|
| 45 |
+
r2: 0.0654
|
| 46 |
+
distinct_4: 0.9943
|
| 47 |
+
repetition_4: 0.0030
|
| 48 |
+
d4: 0.9943
|
| 49 |
+
r4: 0.0030
|
| 50 |
+
num_samples: 128.0000
|
| 51 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam1_temp0.8_gpu3.json
|
eval/h2_mixed_latest_test/logs/pps2_lam1_temp0.9_gpu6.log
ADDED
|
@@ -0,0 +1,51 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [1.0, 1.0]
|
| 5 |
+
leaf_temperature = 0.9
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 64/128 (steps this call: 686)
|
| 8 |
+
sampled 128/128 (steps this call: 677)
|
| 9 |
+
Average denoising rounds per sample: 681.50
|
| 10 |
+
First sample preview: 'Earlier this year, gender was being enforced with our calendar, but this year that is correct. We know it with most peop'
|
| 11 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 13 |
+
|
| 14 |
+
Eval LM loaded (774,030,080 params)
|
| 15 |
+
Scoring samples under eval LM...
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 128/128
|
| 18 |
+
{
|
| 19 |
+
"avg_nll": 4.535560568098103,
|
| 20 |
+
"median_nll": 3.8875941038131714,
|
| 21 |
+
"ppl": 93.27578808295372,
|
| 22 |
+
"acc": 0.27707348517404384,
|
| 23 |
+
"tokens": 65156,
|
| 24 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_h2_mixed/latest.pt",
|
| 25 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 26 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"num_samples": 128,
|
| 28 |
+
"generated_seq_len": 512,
|
| 29 |
+
"mode": "sad_generation",
|
| 30 |
+
"level_lambdas": "1,1",
|
| 31 |
+
"avg_steps": 681.5,
|
| 32 |
+
"positions_per_step": 2,
|
| 33 |
+
"leaf_temperature": 0.9
|
| 34 |
+
}
|
| 35 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/metrics/pps2_lam1_temp0.9_gpu6.json
|
| 36 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/samples/pps2_lam1_temp0.9_gpu6.json
|
| 37 |
+
Diversity metrics for pps2_lam1_temp0.9_gpu6.json:
|
| 38 |
+
distinct_1: 0.3009
|
| 39 |
+
repetition_1: 0.3398
|
| 40 |
+
d1: 0.3009
|
| 41 |
+
r1: 0.3398
|
| 42 |
+
distinct_2: 0.8093
|
| 43 |
+
repetition_2: 0.0405
|
| 44 |
+
d2: 0.8093
|
| 45 |
+
r2: 0.0405
|
| 46 |
+
distinct_4: 0.9974
|
| 47 |
+
repetition_4: 0.0018
|
| 48 |
+
d4: 0.9974
|
| 49 |
+
r4: 0.0018
|
| 50 |
+
num_samples: 128.0000
|
| 51 |
+
Saved -> /home/sunhc/diffusion/sad/eval/h2_mixed_latest_test/diversity/pps2_lam1_temp0.9_gpu6.json
|