| # python3 -m espnet2.bin.s2t_train --use_preprocessor true --bpemodel data/token_list/bpe_unigram50000/bpe.model --token_type bpe --token_list data/token_list/bpe_unigram50000/tokens.txt --non_linguistic_symbols none --cleaner none --g2p none --valid_data_path_and_name_and_type dump/raw/cgn_valid/wav.scp,speech,kaldi_ark --valid_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/speech_shape --resume true --fold_length 80000 --output_dir exp/s2t_lora_3 --config conf/lora_medium_3.yaml --frontend_conf fs=16k --normalize=global_mvn --normalize_conf stats_file=/ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/feats_stats.npz --train_data_path_and_name_and_type dump/raw/cgn_train/wav.scp,speech,kaldi_ark --train_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/speech_shape --fold_length 150 --train_data_path_and_name_and_type dump/raw/cgn_train/text.prev,text_prev,text --train_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/text_prev_shape.bpe --fold_length 150 --train_data_path_and_name_and_type dump/raw/cgn_train/text.ctc,text_ctc,text --train_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/text_ctc_shape.bpe --fold_length 150 --train_data_path_and_name_and_type dump/raw/cgn_train/text,text,text --train_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/text_shape.bpe --valid_data_path_and_name_and_type dump/raw/cgn_valid/text.prev,text_prev,text --valid_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/text_prev_shape.bpe --valid_data_path_and_name_and_type dump/raw/cgn_valid/text.ctc,text_ctc,text --valid_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/text_ctc_shape.bpe --valid_data_path_and_name_and_type dump/raw/cgn_valid/text,text,text --valid_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/text_shape.bpe --model_conf extract_feats_in_collect_stats=false --ngpu 1 --multiprocessing_distributed True |
| # Started at Thu May 22 06:07:01 EDT 2025 |
| # |
| /ocean/projects/cis210027p/pwang10/miniconda3/envs/rota/bin/python3 /ocean/projects/cis210027p/pwang10/rota/espnet/espnet2/bin/s2t_train.py --use_preprocessor true --bpemodel data/token_list/bpe_unigram50000/bpe.model --token_type bpe --token_list data/token_list/bpe_unigram50000/tokens.txt --non_linguistic_symbols none --cleaner none --g2p none --valid_data_path_and_name_and_type dump/raw/cgn_valid/wav.scp,speech,kaldi_ark --valid_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/speech_shape --resume true --fold_length 80000 --output_dir exp/s2t_lora_3 --config conf/lora_medium_3.yaml --frontend_conf fs=16k --normalize=global_mvn --normalize_conf stats_file=/ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/feats_stats.npz --train_data_path_and_name_and_type dump/raw/cgn_train/wav.scp,speech,kaldi_ark --train_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/speech_shape --fold_length 150 --train_data_path_and_name_and_type dump/raw/cgn_train/text.prev,text_prev,text --train_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/text_prev_shape.bpe --fold_length 150 --train_data_path_and_name_and_type dump/raw/cgn_train/text.ctc,text_ctc,text --train_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/text_ctc_shape.bpe --fold_length 150 --train_data_path_and_name_and_type dump/raw/cgn_train/text,text,text --train_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/text_shape.bpe --valid_data_path_and_name_and_type dump/raw/cgn_valid/text.prev,text_prev,text --valid_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/text_prev_shape.bpe --valid_data_path_and_name_and_type dump/raw/cgn_valid/text.ctc,text_ctc,text --valid_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/text_ctc_shape.bpe --valid_data_path_and_name_and_type dump/raw/cgn_valid/text,text,text --valid_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/text_shape.bpe --model_conf extract_feats_in_collect_stats=false --ngpu 1 --multiprocessing_distributed True |
| [w010] 2025-05-22 06:07:09,493 (s2t:462) INFO: Vocabulary size: 50002 |
| [w010] 2025-05-22 06:07:11,630 (e_branchformer_encoder:445) INFO: Gradient checkpoint layers: [] |
| [w010] 2025-05-22 06:07:12,026 (transformer_decoder:103) INFO: Gradient checkpoint layers: [] |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.embed.conv.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.embed.conv.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.embed.conv.2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.embed.conv.2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.embed.out.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.embed.out.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.2.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.2.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.2.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.2.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.2.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.2.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.2.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.2.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.3.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.3.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.3.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.3.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.7.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.7.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.7.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.11.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.15.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.15.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.15.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.15.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.15.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.15.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.15.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.cgmlp.channel_proj1.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.cgmlp.channel_proj1.0.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.cgmlp.csgu.norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.cgmlp.csgu.norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.cgmlp.csgu.conv.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.cgmlp.csgu.conv.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.cgmlp.channel_proj2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.cgmlp.channel_proj2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.feed_forward_macaron.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.feed_forward_macaron.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.feed_forward_macaron.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.feed_forward_macaron.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_ff.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_ff.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_ff_macaron.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_ff_macaron.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_mha.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_mha.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_mlp.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_mlp.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_final.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_final.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.depthwise_conv_fusion.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.depthwise_conv_fusion.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.merge_proj.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.merge_proj.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.after_norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.after_norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.embed.0.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.after_norm.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.after_norm.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.output_layer.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.output_layer.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.1.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.1.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.1.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.3.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.3.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.3.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.3.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.3.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.3.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.3.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.9.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.9.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.9.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.9.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.9.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.11.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.14.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.14.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.14.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.self_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.self_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.self_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.self_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.self_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.self_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.self_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.self_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.src_attn.linear_q.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.src_attn.linear_q.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.src_attn.linear_k.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.src_attn.linear_k.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.src_attn.linear_v.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.src_attn.linear_v.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.src_attn.linear_out.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.src_attn.linear_out.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.feed_forward.w_1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.feed_forward.w_1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.feed_forward.w_2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.feed_forward.w_2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.norm1.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.norm1.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.norm2.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.norm2.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.norm3.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.norm3.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:14,117 (abs_task:1370) INFO: Setting ctc.ctc_lo.weight.requires_grad = False |
| [w010] 2025-05-22 06:07:14,117 (abs_task:1370) INFO: Setting ctc.ctc_lo.bias.requires_grad = False |
| [w010] 2025-05-22 06:07:20,963 (abs_task:1398) INFO: pytorch.version=2.1.2, cuda.available=True, cudnn.version=8902, cudnn.benchmark=False, cudnn.deterministic=True |
| [w010] 2025-05-22 06:07:20,974 (abs_task:1399) INFO: Model structure: |
| ESPnetS2TModel( |
| (frontend): DefaultFrontend( |
| (stft): Stft(n_fft=512, win_length=400, hop_length=160, center=True, normalized=False, onesided=True) |
| (frontend): Frontend() |
| (logmel): LogMel(sr=16000, n_fft=512, n_mels=80, fmin=0, fmax=8000.0, htk=False) |
| ) |
| (specaug): SpecAug( |
| (freq_mask): MaskAlongAxis(mask_width_range=[0, 27], num_mask=2, axis=freq) |
| (time_mask): MaskAlongAxisVariableMaxWidth(mask_width_ratio_range=[0.0, 0.05], num_mask=10, axis=time) |
| ) |
| (normalize): GlobalMVN(stats_file=/ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium/train/feats_stats.npz, norm_means=True, norm_vars=True) |
| (encoder): EBranchformerEncoder( |
| (embed): Conv2dSubsampling( |
| (conv): Sequential( |
| (0): Conv2d(1, 1024, kernel_size=(3, 3), stride=(2, 2)) |
| (1): ReLU() |
| (2): Conv2d(1024, 1024, kernel_size=(3, 3), stride=(2, 2)) |
| (3): ReLU() |
| ) |
| (out): Sequential( |
| (0): Linear(in_features=19456, out_features=1024, bias=True) |
| (1): PositionalEncoding( |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| ) |
| ) |
| (encoders): MultiSequential( |
| (0): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (1): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (2): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (3): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (4): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (5): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (6): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (7): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (8): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (9): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (10): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (11): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (12): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (13): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (14): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (15): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (16): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (17): EBranchformerEncoderLayer( |
| (attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (cgmlp): ConvolutionalGatingMLP( |
| (channel_proj1): Sequential( |
| (0): Linear(in_features=1024, out_features=4096, bias=True) |
| (1): GELU(approximate='none') |
| ) |
| (csgu): ConvolutionalSpatialGatingUnit( |
| (norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True) |
| (conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (act): Identity() |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (channel_proj2): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (feed_forward_macaron): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): Swish() |
| ) |
| (norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048) |
| (merge_proj): Linear(in_features=2048, out_features=1024, bias=True) |
| ) |
| ) |
| (after_norm): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| ) |
| (decoder): TransformerDecoder( |
| (embed): Sequential( |
| (0): Embedding(50002, 1024) |
| (1): PositionalEncoding( |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| ) |
| (after_norm): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (output_layer): Linear(in_features=1024, out_features=50002, bias=True) |
| (decoders): MultiSequential( |
| (0): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (1): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (2): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (3): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (4): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (5): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (6): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (7): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (8): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (9): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (10): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (11): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (12): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (13): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (14): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (15): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (16): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| (17): DecoderLayer( |
| (self_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (src_attn): MultiHeadedAttention( |
| (linear_q): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_k): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_v): Linear(in_features=1024, out_features=1024, bias=True) |
| (linear_out): Linear(in_features=1024, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (q_norm): Identity() |
| (k_norm): Identity() |
| ) |
| (feed_forward): PositionwiseFeedForward( |
| (w_1): Linear(in_features=1024, out_features=4096, bias=True) |
| (w_2): Linear(in_features=4096, out_features=1024, bias=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| (activation): ReLU() |
| ) |
| (norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True) |
| (dropout): Dropout(p=0.1, inplace=False) |
| ) |
| ) |
| ) |
| (criterion_att): LabelSmoothingLoss( |
| (criterion): KLDivLoss() |
| ) |
| (ctc): CTC( |
| (ctc_lo): Linear(in_features=1024, out_features=50002, bias=True) |
| (ctc_loss): CTCLoss() |
| ) |
| ) |
|
|
| Model summary: |
| Class Name: ESPnetS2TModel |
| Total Number of model parameters: 1.03 B |
| Number of trainable parameters: 10.56 M (1.0%) |
| Size: 42.26 MB |
| Type: torch.float32 |
| [w010] 2025-05-22 06:07:20,974 (abs_task:1402) INFO: Optimizer: |
| AdamW ( |
| Parameter Group 0 |
| amsgrad: False |
| betas: [0.9, 0.98] |
| capturable: False |
| differentiable: False |
| eps: 1e-06 |
| foreach: None |
| fused: None |
| initial_lr: 0.0001 |
| lr: 2.5e-08 |
| maximize: False |
| weight_decay: 0.0 |
| ) |
| [w010] 2025-05-22 06:07:20,974 (abs_task:1403) INFO: Scheduler: PiecewiseLinearWarmupLR(warmup_steps_list=[0, 10000, 50000], warmup_lr_list=[0.0, 0.00025, 0.0001]) |
| [w010] 2025-05-22 06:07:20,998 (abs_task:1412) INFO: Saving the configuration in exp/s2t_lora_3/config.yaml |
| [w010] 2025-05-22 06:07:21,573 (abs_task:1477) INFO: Loading pretrained params from /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/owsm_v3.1_ebf/valid.total_count.ave_5best.till45epoch.pth |
| [w010] 2025-05-22 06:07:23,776 (abs_task:1826) INFO: [train] Batch sampler: UnsortedBatchSampler(N-batch=22430, batch_size=8, key_file=/ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/speech_shape, |
| [w010] 2025-05-22 06:07:23,778 (abs_task:1827) INFO: [train] mini-batch sizes summary: N-batch=22430, mean=8.0, min=8, max=8 |
| [w010] 2025-05-22 06:07:23,860 (read_text:31) INFO: keys_to_load is not None, only loading 179440 keys from dump/raw/cgn_train/text.prev |
| [w010] 2025-05-22 06:07:23,949 (read_text:31) INFO: keys_to_load is not None, only loading 179440 keys from dump/raw/cgn_train/text.ctc |
| [w010] 2025-05-22 06:07:24,055 (read_text:31) INFO: keys_to_load is not None, only loading 179440 keys from dump/raw/cgn_train/text |
| [w010] 2025-05-22 06:07:24,169 (s2t:444) INFO: Optional Data Names: ('text_prev', 'text_ctc', 'text_spk2', 'text_spk3', 'text_spk4') |
| [w010] 2025-05-22 06:07:24,172 (abs_task:1851) INFO: [train] dataset: |
| ESPnetDataset( |
| speech: {"path": "dump/raw/cgn_train/wav.scp", "type": "kaldi_ark"} |
| text_prev: {"path": "dump/raw/cgn_train/text.prev", "type": "text"} |
| text_ctc: {"path": "dump/raw/cgn_train/text.ctc", "type": "text"} |
| text: {"path": "dump/raw/cgn_train/text", "type": "text"} |
| preprocess: <espnet2.train.preprocessor.S2TPreprocessor object at 0x14cd45635b40>) |
| [w010] 2025-05-22 06:07:24,192 (abs_task:1826) INFO: [valid] Batch sampler: UnsortedBatchSampler(N-batch=3220, batch_size=8, key_file=/ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/speech_shape, |
| [w010] 2025-05-22 06:07:24,193 (abs_task:1827) INFO: [valid] mini-batch sizes summary: N-batch=3220, mean=8.0, min=8, max=9 |
| [w010] 2025-05-22 06:07:24,204 (read_text:31) INFO: keys_to_load is not None, only loading 25766 keys from dump/raw/cgn_valid/text.prev |
| [w010] 2025-05-22 06:07:24,215 (read_text:31) INFO: keys_to_load is not None, only loading 25766 keys from dump/raw/cgn_valid/text.ctc |
| [w010] 2025-05-22 06:07:24,228 (read_text:31) INFO: keys_to_load is not None, only loading 25766 keys from dump/raw/cgn_valid/text |
| [w010] 2025-05-22 06:07:24,242 (s2t:444) INFO: Optional Data Names: ('text_prev', 'text_ctc', 'text_spk2', 'text_spk3', 'text_spk4') |
| [w010] 2025-05-22 06:07:24,242 (abs_task:1851) INFO: [valid] dataset: |
| ESPnetDataset( |
| speech: {"path": "dump/raw/cgn_valid/wav.scp", "type": "kaldi_ark"} |
| text_prev: {"path": "dump/raw/cgn_valid/text.prev", "type": "text"} |
| text_ctc: {"path": "dump/raw/cgn_valid/text.ctc", "type": "text"} |
| text: {"path": "dump/raw/cgn_valid/text", "type": "text"} |
| preprocess: <espnet2.train.preprocessor.S2TPreprocessor object at 0x14cd3e2abd30>) |
| [w010] 2025-05-22 06:07:59,926 (trainer:177) INFO: The training was resumed using exp/s2t_lora_3/checkpoint.pth |
| [w010] 2025-05-22 06:08:00,006 (trainer:336) INFO: 10/10epoch started |
| Failed to import Flash Attention, using ESPnet default: /ocean/projects/cis210027p/pwang10/miniconda3/envs/rota/lib/python3.10/site-packages/flash_attn_2_cuda.cpython-310-x86_64-linux-gnu.so: undefined symbol: _ZNK3c105Error4whatEv |
| [w010] 2025-05-22 06:12:56,721 (trainer:811) INFO: 10epoch:train:1-750batch: iter_time=3.951e-04, forward_time=0.178, loss_ctc=55.469, loss_att=28.578, acc=0.782, loss=9.161, backward_time=0.183, grad_norm=32.279, clip=100.000, loss_scale=4.295e+09, optim_step_time=0.024, optim0_lr0=1.606e-04, train_time=1.582 |
| [w010] 2025-05-22 06:17:52,002 (trainer:811) INFO: 10epoch:train:751-1500batch: iter_time=1.947e-04, forward_time=0.177, loss_ctc=55.865, loss_att=29.052, acc=0.780, loss=9.274, backward_time=0.183, grad_norm=34.835, clip=100.000, loss_scale=7.151e+09, optim_step_time=0.024, optim0_lr0=1.599e-04, train_time=1.574 |
| [w010] 2025-05-22 06:22:47,400 (trainer:811) INFO: 10epoch:train:1501-2250batch: iter_time=1.756e-04, forward_time=0.177, loss_ctc=56.211, loss_att=29.266, acc=0.784, loss=9.337, backward_time=0.183, grad_norm=33.609, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.024, optim0_lr0=1.592e-04, train_time=1.576 |
| [w010] 2025-05-22 06:27:42,623 (trainer:811) INFO: 10epoch:train:2251-3000batch: iter_time=1.834e-04, forward_time=0.177, loss_ctc=55.706, loss_att=28.971, acc=0.783, loss=9.248, backward_time=0.183, grad_norm=33.352, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.025, optim0_lr0=1.585e-04, train_time=1.574 |
| [w010] 2025-05-22 06:32:37,954 (trainer:811) INFO: 10epoch:train:3001-3750batch: iter_time=1.778e-04, forward_time=0.177, loss_ctc=56.366, loss_att=29.261, acc=0.778, loss=9.348, backward_time=0.183, grad_norm=33.835, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.024, optim0_lr0=1.578e-04, train_time=1.575 |
| [w010] 2025-05-22 06:37:33,836 (trainer:811) INFO: 10epoch:train:3751-4500batch: iter_time=1.538e-04, forward_time=0.177, loss_ctc=55.279, loss_att=28.710, acc=0.783, loss=9.170, backward_time=0.183, grad_norm=33.721, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.024, optim0_lr0=1.571e-04, train_time=1.578 |
| [w010] 2025-05-22 06:42:29,463 (trainer:811) INFO: 10epoch:train:4501-5250batch: iter_time=1.532e-04, forward_time=0.177, loss_ctc=55.615, loss_att=28.915, acc=0.781, loss=9.231, backward_time=0.183, grad_norm=35.858, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.024, optim0_lr0=1.564e-04, train_time=1.577 |
| [w010] 2025-05-22 06:47:24,787 (trainer:811) INFO: 10epoch:train:5251-6000batch: iter_time=1.503e-04, forward_time=0.177, loss_ctc=55.830, loss_att=28.899, acc=0.783, loss=9.245, backward_time=0.183, grad_norm=32.800, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.024, optim0_lr0=1.557e-04, train_time=1.575 |
| [w010] 2025-05-22 06:52:19,995 (trainer:811) INFO: 10epoch:train:6001-6750batch: iter_time=1.403e-04, forward_time=0.177, loss_ctc=54.596, loss_att=28.414, acc=0.782, loss=9.067, backward_time=0.183, grad_norm=34.763, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.024, optim0_lr0=1.550e-04, train_time=1.575 |
| [w010] 2025-05-22 06:57:15,827 (trainer:811) INFO: 10epoch:train:6751-7500batch: iter_time=1.475e-04, forward_time=0.177, loss_ctc=56.306, loss_att=29.190, acc=0.780, loss=9.331, backward_time=0.183, grad_norm=33.661, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.025, optim0_lr0=1.543e-04, train_time=1.577 |
| [w010] 2025-05-22 07:02:10,987 (trainer:811) INFO: 10epoch:train:7501-8250batch: iter_time=1.428e-04, forward_time=0.177, loss_ctc=55.530, loss_att=28.848, acc=0.780, loss=9.213, backward_time=0.182, grad_norm=35.297, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.024, optim0_lr0=1.535e-04, train_time=1.574 |
| [w010] 2025-05-22 07:07:07,013 (trainer:811) INFO: 10epoch:train:8251-9000batch: iter_time=1.605e-04, forward_time=0.178, loss_ctc=55.136, loss_att=28.627, acc=0.779, loss=9.145, backward_time=0.183, grad_norm=34.038, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.024, optim0_lr0=1.528e-04, train_time=1.578 |
| [w010] 2025-05-22 07:12:07,174 (trainer:811) INFO: 10epoch:train:9001-9750batch: iter_time=3.040e-04, forward_time=0.181, loss_ctc=55.208, loss_att=28.743, acc=0.781, loss=9.171, backward_time=0.184, grad_norm=35.246, clip=100.000, loss_scale=1.718e+10, optim_step_time=0.025, optim0_lr0=1.521e-04, train_time=1.599 |
| [w010] 2025-05-22 07:17:08,835 (trainer:811) INFO: 10epoch:train:9751-10500batch: iter_time=2.209e-04, forward_time=0.181, loss_ctc=55.421, loss_att=28.829, acc=0.779, loss=9.202, backward_time=0.183, grad_norm=34.795, clip=100.000, loss_scale=1.718e+10, optim_step_time=0.039, optim0_lr0=1.514e-04, train_time=1.610 |
| [w010] 2025-05-22 07:22:04,603 (trainer:811) INFO: 10epoch:train:10501-11250batch: iter_time=1.571e-04, forward_time=0.177, loss_ctc=54.872, loss_att=28.404, acc=0.784, loss=9.086, backward_time=0.183, grad_norm=33.848, clip=100.000, loss_scale=1.718e+10, optim_step_time=0.024, optim0_lr0=1.507e-04, train_time=1.578 |
| [w010] 2025-05-22 07:27:00,567 (trainer:811) INFO: 10epoch:train:11251-12000batch: iter_time=1.651e-04, forward_time=0.178, loss_ctc=54.186, loss_att=28.039, acc=0.784, loss=8.971, backward_time=0.183, grad_norm=33.903, clip=100.000, loss_scale=1.718e+10, optim_step_time=0.024, optim0_lr0=1.500e-04, train_time=1.578 |
| [w010] 2025-05-22 07:31:56,723 (trainer:811) INFO: 10epoch:train:12001-12750batch: iter_time=1.574e-04, forward_time=0.178, loss_ctc=54.619, loss_att=28.577, acc=0.777, loss=9.097, backward_time=0.183, grad_norm=33.335, clip=100.000, loss_scale=1.718e+10, optim_step_time=0.025, optim0_lr0=1.493e-04, train_time=1.580 |
| [w010] 2025-05-22 07:36:52,702 (trainer:811) INFO: 10epoch:train:12751-13500batch: iter_time=1.567e-04, forward_time=0.177, loss_ctc=54.983, loss_att=28.508, acc=0.785, loss=9.113, backward_time=0.183, grad_norm=34.845, clip=100.000, loss_scale=1.718e+10, optim_step_time=0.024, optim0_lr0=1.486e-04, train_time=1.578 |
| [w010] 2025-05-22 07:41:48,429 (trainer:811) INFO: 10epoch:train:13501-14250batch: iter_time=1.592e-04, forward_time=0.178, loss_ctc=54.755, loss_att=28.462, acc=0.784, loss=9.087, backward_time=0.183, grad_norm=34.588, clip=100.000, loss_scale=1.718e+10, optim_step_time=0.024, optim0_lr0=1.479e-04, train_time=1.577 |
| [w010] 2025-05-22 07:46:43,824 (trainer:811) INFO: 10epoch:train:14251-15000batch: iter_time=1.535e-04, forward_time=0.177, loss_ctc=55.886, loss_att=28.932, acc=0.781, loss=9.255, backward_time=0.182, grad_norm=33.292, clip=100.000, loss_scale=1.718e+10, optim_step_time=0.024, optim0_lr0=1.472e-04, train_time=1.575 |
| [w010] 2025-05-22 07:54:24,071 (trainer:394) INFO: 10epoch results: [train] iter_time=1.824e-04, forward_time=0.178, loss_ctc=55.392, loss_att=28.761, acc=0.781, loss=9.188, backward_time=0.183, grad_norm=34.094, clip=100.000, loss_scale=1.174e+10, optim_step_time=0.025, optim0_lr0=1.539e-04, train_time=1.580, time=1 hour, 38 minutes and 44.03 seconds, total_count=150000, gpu_max_cached_mem_GB=43.607, [valid] loss_ctc=21.682, cer_ctc=0.114, loss_att=10.449, acc=0.919, cer=0.057, wer=0.785, loss=13.819, time=7 minutes and 39.95 seconds, total_count=32200, gpu_max_cached_mem_GB=43.607 |
| [w010] 2025-05-22 07:54:56,697 (trainer:462) INFO: The best model has been updated: valid.acc, valid.total_count |
| [w010] 2025-05-22 07:54:56,699 (trainer:516) INFO: The model files were removed: exp/s2t_lora_3/9epoch.pth |
| [w010] 2025-05-22 07:54:56,699 (trainer:534) INFO: The training was finished at 10 epochs |
| # Accounting: time=6476 threads=1 |
| # Ended (code 0) at Thu May 22 07:54:57 EDT 2025, elapsed time 6476 seconds |
|
|