CGN / s2t_lora_3 /train.2.log
wangpuupup's picture
Add files using upload-large-folder tool
4d95fe8 verified
Raw
History Blame Contribute Delete
233 kB
# python3 -m espnet2.bin.s2t_train --use_preprocessor true --bpemodel data/token_list/bpe_unigram50000/bpe.model --token_type bpe --token_list data/token_list/bpe_unigram50000/tokens.txt --non_linguistic_symbols none --cleaner none --g2p none --valid_data_path_and_name_and_type dump/raw/cgn_valid/wav.scp,speech,kaldi_ark --valid_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/speech_shape --resume true --fold_length 80000 --output_dir exp/s2t_lora_3 --config conf/lora_medium_3.yaml --frontend_conf fs=16k --normalize=global_mvn --normalize_conf stats_file=/ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/feats_stats.npz --train_data_path_and_name_and_type dump/raw/cgn_train/wav.scp,speech,kaldi_ark --train_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/speech_shape --fold_length 150 --train_data_path_and_name_and_type dump/raw/cgn_train/text.prev,text_prev,text --train_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/text_prev_shape.bpe --fold_length 150 --train_data_path_and_name_and_type dump/raw/cgn_train/text.ctc,text_ctc,text --train_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/text_ctc_shape.bpe --fold_length 150 --train_data_path_and_name_and_type dump/raw/cgn_train/text,text,text --train_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/text_shape.bpe --valid_data_path_and_name_and_type dump/raw/cgn_valid/text.prev,text_prev,text --valid_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/text_prev_shape.bpe --valid_data_path_and_name_and_type dump/raw/cgn_valid/text.ctc,text_ctc,text --valid_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/text_ctc_shape.bpe --valid_data_path_and_name_and_type dump/raw/cgn_valid/text,text,text --valid_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/text_shape.bpe --model_conf extract_feats_in_collect_stats=false --ngpu 1 --multiprocessing_distributed True
# Started at Thu May 22 06:07:01 EDT 2025
#
/ocean/projects/cis210027p/pwang10/miniconda3/envs/rota/bin/python3 /ocean/projects/cis210027p/pwang10/rota/espnet/espnet2/bin/s2t_train.py --use_preprocessor true --bpemodel data/token_list/bpe_unigram50000/bpe.model --token_type bpe --token_list data/token_list/bpe_unigram50000/tokens.txt --non_linguistic_symbols none --cleaner none --g2p none --valid_data_path_and_name_and_type dump/raw/cgn_valid/wav.scp,speech,kaldi_ark --valid_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/speech_shape --resume true --fold_length 80000 --output_dir exp/s2t_lora_3 --config conf/lora_medium_3.yaml --frontend_conf fs=16k --normalize=global_mvn --normalize_conf stats_file=/ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/feats_stats.npz --train_data_path_and_name_and_type dump/raw/cgn_train/wav.scp,speech,kaldi_ark --train_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/speech_shape --fold_length 150 --train_data_path_and_name_and_type dump/raw/cgn_train/text.prev,text_prev,text --train_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/text_prev_shape.bpe --fold_length 150 --train_data_path_and_name_and_type dump/raw/cgn_train/text.ctc,text_ctc,text --train_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/text_ctc_shape.bpe --fold_length 150 --train_data_path_and_name_and_type dump/raw/cgn_train/text,text,text --train_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/text_shape.bpe --valid_data_path_and_name_and_type dump/raw/cgn_valid/text.prev,text_prev,text --valid_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/text_prev_shape.bpe --valid_data_path_and_name_and_type dump/raw/cgn_valid/text.ctc,text_ctc,text --valid_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/text_ctc_shape.bpe --valid_data_path_and_name_and_type dump/raw/cgn_valid/text,text,text --valid_shape_file /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/text_shape.bpe --model_conf extract_feats_in_collect_stats=false --ngpu 1 --multiprocessing_distributed True
[w010] 2025-05-22 06:07:09,493 (s2t:462) INFO: Vocabulary size: 50002
[w010] 2025-05-22 06:07:11,630 (e_branchformer_encoder:445) INFO: Gradient checkpoint layers: []
[w010] 2025-05-22 06:07:12,026 (transformer_decoder:103) INFO: Gradient checkpoint layers: []
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.embed.conv.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.embed.conv.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.embed.conv.2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.embed.conv.2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.embed.out.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.embed.out.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,093 (abs_task:1370) INFO: Setting encoder.encoders.0.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.0.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.1.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.2.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.2.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.2.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.2.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.2.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.2.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.2.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,094 (abs_task:1370) INFO: Setting encoder.encoders.2.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.2.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,095 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.3.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.3.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.3.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.3.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.3.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.4.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,096 (abs_task:1370) INFO: Setting encoder.encoders.5.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.5.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.6.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.7.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.7.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,097 (abs_task:1370) INFO: Setting encoder.encoders.7.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.7.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,098 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.8.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.9.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,099 (abs_task:1370) INFO: Setting encoder.encoders.10.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.10.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,100 (abs_task:1370) INFO: Setting encoder.encoders.11.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.11.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.12.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,101 (abs_task:1370) INFO: Setting encoder.encoders.13.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.13.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.14.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.15.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.15.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.15.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.15.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.15.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.15.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,102 (abs_task:1370) INFO: Setting encoder.encoders.15.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.15.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,103 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.16.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.cgmlp.channel_proj1.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.cgmlp.channel_proj1.0.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.cgmlp.csgu.norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.cgmlp.csgu.norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.cgmlp.csgu.conv.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.cgmlp.csgu.conv.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.cgmlp.channel_proj2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.cgmlp.channel_proj2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.feed_forward_macaron.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.feed_forward_macaron.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.feed_forward_macaron.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.feed_forward_macaron.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_ff.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_ff.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_ff_macaron.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_ff_macaron.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_mha.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_mha.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_mlp.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_mlp.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_final.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.norm_final.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.depthwise_conv_fusion.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.depthwise_conv_fusion.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.merge_proj.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.encoders.17.merge_proj.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.after_norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,104 (abs_task:1370) INFO: Setting encoder.after_norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.embed.0.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.after_norm.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.after_norm.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.output_layer.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.output_layer.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.0.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.1.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.1.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,106 (abs_task:1370) INFO: Setting decoder.decoders.1.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.1.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.2.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.3.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.3.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.3.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.3.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.3.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.3.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,107 (abs_task:1370) INFO: Setting decoder.decoders.3.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.3.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.4.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,108 (abs_task:1370) INFO: Setting decoder.decoders.5.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.5.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.6.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,109 (abs_task:1370) INFO: Setting decoder.decoders.7.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.7.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.8.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,110 (abs_task:1370) INFO: Setting decoder.decoders.9.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.9.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.9.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.9.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.9.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.9.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.10.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,111 (abs_task:1370) INFO: Setting decoder.decoders.11.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.11.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.12.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.13.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.14.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.14.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,112 (abs_task:1370) INFO: Setting decoder.decoders.14.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.14.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.15.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,113 (abs_task:1370) INFO: Setting decoder.decoders.16.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.16.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.self_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.self_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.self_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.self_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.self_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.self_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.self_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.self_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.src_attn.linear_q.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.src_attn.linear_q.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.src_attn.linear_k.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.src_attn.linear_k.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.src_attn.linear_v.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.src_attn.linear_v.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.src_attn.linear_out.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.src_attn.linear_out.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.feed_forward.w_1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.feed_forward.w_1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.feed_forward.w_2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.feed_forward.w_2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.norm1.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.norm1.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.norm2.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.norm2.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.norm3.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,114 (abs_task:1370) INFO: Setting decoder.decoders.17.norm3.bias.requires_grad = False
[w010] 2025-05-22 06:07:14,117 (abs_task:1370) INFO: Setting ctc.ctc_lo.weight.requires_grad = False
[w010] 2025-05-22 06:07:14,117 (abs_task:1370) INFO: Setting ctc.ctc_lo.bias.requires_grad = False
[w010] 2025-05-22 06:07:20,963 (abs_task:1398) INFO: pytorch.version=2.1.2, cuda.available=True, cudnn.version=8902, cudnn.benchmark=False, cudnn.deterministic=True
[w010] 2025-05-22 06:07:20,974 (abs_task:1399) INFO: Model structure:
ESPnetS2TModel(
(frontend): DefaultFrontend(
(stft): Stft(n_fft=512, win_length=400, hop_length=160, center=True, normalized=False, onesided=True)
(frontend): Frontend()
(logmel): LogMel(sr=16000, n_fft=512, n_mels=80, fmin=0, fmax=8000.0, htk=False)
)
(specaug): SpecAug(
(freq_mask): MaskAlongAxis(mask_width_range=[0, 27], num_mask=2, axis=freq)
(time_mask): MaskAlongAxisVariableMaxWidth(mask_width_ratio_range=[0.0, 0.05], num_mask=10, axis=time)
)
(normalize): GlobalMVN(stats_file=/ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium/train/feats_stats.npz, norm_means=True, norm_vars=True)
(encoder): EBranchformerEncoder(
(embed): Conv2dSubsampling(
(conv): Sequential(
(0): Conv2d(1, 1024, kernel_size=(3, 3), stride=(2, 2))
(1): ReLU()
(2): Conv2d(1024, 1024, kernel_size=(3, 3), stride=(2, 2))
(3): ReLU()
)
(out): Sequential(
(0): Linear(in_features=19456, out_features=1024, bias=True)
(1): PositionalEncoding(
(dropout): Dropout(p=0.1, inplace=False)
)
)
)
(encoders): MultiSequential(
(0): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(1): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(2): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(3): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(4): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(5): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(6): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(7): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(8): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(9): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(10): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(11): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(12): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(13): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(14): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(15): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(16): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
(17): EBranchformerEncoderLayer(
(attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(cgmlp): ConvolutionalGatingMLP(
(channel_proj1): Sequential(
(0): Linear(in_features=1024, out_features=4096, bias=True)
(1): GELU(approximate='none')
)
(csgu): ConvolutionalSpatialGatingUnit(
(norm): LayerNorm((2048,), eps=1e-12, elementwise_affine=True)
(conv): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(act): Identity()
(dropout): Dropout(p=0.1, inplace=False)
)
(channel_proj2): Linear(in_features=2048, out_features=1024, bias=True)
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(feed_forward_macaron): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): Swish()
)
(norm_ff): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_ff_macaron): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mha): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_mlp): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm_final): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
(depthwise_conv_fusion): Conv1d(2048, 2048, kernel_size=(31,), stride=(1,), padding=(15,), groups=2048)
(merge_proj): Linear(in_features=2048, out_features=1024, bias=True)
)
)
(after_norm): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
)
(decoder): TransformerDecoder(
(embed): Sequential(
(0): Embedding(50002, 1024)
(1): PositionalEncoding(
(dropout): Dropout(p=0.1, inplace=False)
)
)
(after_norm): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(output_layer): Linear(in_features=1024, out_features=50002, bias=True)
(decoders): MultiSequential(
(0): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(1): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(2): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(3): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(4): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(5): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(6): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(7): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(8): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(9): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(10): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(11): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(12): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(13): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(14): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(15): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(16): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
(17): DecoderLayer(
(self_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(src_attn): MultiHeadedAttention(
(linear_q): Linear(in_features=1024, out_features=1024, bias=True)
(linear_k): Linear(in_features=1024, out_features=1024, bias=True)
(linear_v): Linear(in_features=1024, out_features=1024, bias=True)
(linear_out): Linear(in_features=1024, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(q_norm): Identity()
(k_norm): Identity()
)
(feed_forward): PositionwiseFeedForward(
(w_1): Linear(in_features=1024, out_features=4096, bias=True)
(w_2): Linear(in_features=4096, out_features=1024, bias=True)
(dropout): Dropout(p=0.1, inplace=False)
(activation): ReLU()
)
(norm1): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm2): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(norm3): LayerNorm((1024,), eps=1e-12, elementwise_affine=True)
(dropout): Dropout(p=0.1, inplace=False)
)
)
)
(criterion_att): LabelSmoothingLoss(
(criterion): KLDivLoss()
)
(ctc): CTC(
(ctc_lo): Linear(in_features=1024, out_features=50002, bias=True)
(ctc_loss): CTCLoss()
)
)
Model summary:
Class Name: ESPnetS2TModel
Total Number of model parameters: 1.03 B
Number of trainable parameters: 10.56 M (1.0%)
Size: 42.26 MB
Type: torch.float32
[w010] 2025-05-22 06:07:20,974 (abs_task:1402) INFO: Optimizer:
AdamW (
Parameter Group 0
amsgrad: False
betas: [0.9, 0.98]
capturable: False
differentiable: False
eps: 1e-06
foreach: None
fused: None
initial_lr: 0.0001
lr: 2.5e-08
maximize: False
weight_decay: 0.0
)
[w010] 2025-05-22 06:07:20,974 (abs_task:1403) INFO: Scheduler: PiecewiseLinearWarmupLR(warmup_steps_list=[0, 10000, 50000], warmup_lr_list=[0.0, 0.00025, 0.0001])
[w010] 2025-05-22 06:07:20,998 (abs_task:1412) INFO: Saving the configuration in exp/s2t_lora_3/config.yaml
[w010] 2025-05-22 06:07:21,573 (abs_task:1477) INFO: Loading pretrained params from /ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/owsm_v3.1_ebf/valid.total_count.ave_5best.till45epoch.pth
[w010] 2025-05-22 06:07:23,776 (abs_task:1826) INFO: [train] Batch sampler: UnsortedBatchSampler(N-batch=22430, batch_size=8, key_file=/ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//train/speech_shape,
[w010] 2025-05-22 06:07:23,778 (abs_task:1827) INFO: [train] mini-batch sizes summary: N-batch=22430, mean=8.0, min=8, max=8
[w010] 2025-05-22 06:07:23,860 (read_text:31) INFO: keys_to_load is not None, only loading 179440 keys from dump/raw/cgn_train/text.prev
[w010] 2025-05-22 06:07:23,949 (read_text:31) INFO: keys_to_load is not None, only loading 179440 keys from dump/raw/cgn_train/text.ctc
[w010] 2025-05-22 06:07:24,055 (read_text:31) INFO: keys_to_load is not None, only loading 179440 keys from dump/raw/cgn_train/text
[w010] 2025-05-22 06:07:24,169 (s2t:444) INFO: Optional Data Names: ('text_prev', 'text_ctc', 'text_spk2', 'text_spk3', 'text_spk4')
[w010] 2025-05-22 06:07:24,172 (abs_task:1851) INFO: [train] dataset:
ESPnetDataset(
speech: {"path": "dump/raw/cgn_train/wav.scp", "type": "kaldi_ark"}
text_prev: {"path": "dump/raw/cgn_train/text.prev", "type": "text"}
text_ctc: {"path": "dump/raw/cgn_train/text.ctc", "type": "text"}
text: {"path": "dump/raw/cgn_train/text", "type": "text"}
preprocess: <espnet2.train.preprocessor.S2TPreprocessor object at 0x14cd45635b40>)
[w010] 2025-05-22 06:07:24,192 (abs_task:1826) INFO: [valid] Batch sampler: UnsortedBatchSampler(N-batch=3220, batch_size=8, key_file=/ocean/projects/cis210027p/pwang10/rota/espnet/egs2/owsm_v3.1/s2t1/exp/s2t_stats_raw_bpe50000_medium//valid/speech_shape,
[w010] 2025-05-22 06:07:24,193 (abs_task:1827) INFO: [valid] mini-batch sizes summary: N-batch=3220, mean=8.0, min=8, max=9
[w010] 2025-05-22 06:07:24,204 (read_text:31) INFO: keys_to_load is not None, only loading 25766 keys from dump/raw/cgn_valid/text.prev
[w010] 2025-05-22 06:07:24,215 (read_text:31) INFO: keys_to_load is not None, only loading 25766 keys from dump/raw/cgn_valid/text.ctc
[w010] 2025-05-22 06:07:24,228 (read_text:31) INFO: keys_to_load is not None, only loading 25766 keys from dump/raw/cgn_valid/text
[w010] 2025-05-22 06:07:24,242 (s2t:444) INFO: Optional Data Names: ('text_prev', 'text_ctc', 'text_spk2', 'text_spk3', 'text_spk4')
[w010] 2025-05-22 06:07:24,242 (abs_task:1851) INFO: [valid] dataset:
ESPnetDataset(
speech: {"path": "dump/raw/cgn_valid/wav.scp", "type": "kaldi_ark"}
text_prev: {"path": "dump/raw/cgn_valid/text.prev", "type": "text"}
text_ctc: {"path": "dump/raw/cgn_valid/text.ctc", "type": "text"}
text: {"path": "dump/raw/cgn_valid/text", "type": "text"}
preprocess: <espnet2.train.preprocessor.S2TPreprocessor object at 0x14cd3e2abd30>)
[w010] 2025-05-22 06:07:59,926 (trainer:177) INFO: The training was resumed using exp/s2t_lora_3/checkpoint.pth
[w010] 2025-05-22 06:08:00,006 (trainer:336) INFO: 10/10epoch started
Failed to import Flash Attention, using ESPnet default: /ocean/projects/cis210027p/pwang10/miniconda3/envs/rota/lib/python3.10/site-packages/flash_attn_2_cuda.cpython-310-x86_64-linux-gnu.so: undefined symbol: _ZNK3c105Error4whatEv
[w010] 2025-05-22 06:12:56,721 (trainer:811) INFO: 10epoch:train:1-750batch: iter_time=3.951e-04, forward_time=0.178, loss_ctc=55.469, loss_att=28.578, acc=0.782, loss=9.161, backward_time=0.183, grad_norm=32.279, clip=100.000, loss_scale=4.295e+09, optim_step_time=0.024, optim0_lr0=1.606e-04, train_time=1.582
[w010] 2025-05-22 06:17:52,002 (trainer:811) INFO: 10epoch:train:751-1500batch: iter_time=1.947e-04, forward_time=0.177, loss_ctc=55.865, loss_att=29.052, acc=0.780, loss=9.274, backward_time=0.183, grad_norm=34.835, clip=100.000, loss_scale=7.151e+09, optim_step_time=0.024, optim0_lr0=1.599e-04, train_time=1.574
[w010] 2025-05-22 06:22:47,400 (trainer:811) INFO: 10epoch:train:1501-2250batch: iter_time=1.756e-04, forward_time=0.177, loss_ctc=56.211, loss_att=29.266, acc=0.784, loss=9.337, backward_time=0.183, grad_norm=33.609, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.024, optim0_lr0=1.592e-04, train_time=1.576
[w010] 2025-05-22 06:27:42,623 (trainer:811) INFO: 10epoch:train:2251-3000batch: iter_time=1.834e-04, forward_time=0.177, loss_ctc=55.706, loss_att=28.971, acc=0.783, loss=9.248, backward_time=0.183, grad_norm=33.352, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.025, optim0_lr0=1.585e-04, train_time=1.574
[w010] 2025-05-22 06:32:37,954 (trainer:811) INFO: 10epoch:train:3001-3750batch: iter_time=1.778e-04, forward_time=0.177, loss_ctc=56.366, loss_att=29.261, acc=0.778, loss=9.348, backward_time=0.183, grad_norm=33.835, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.024, optim0_lr0=1.578e-04, train_time=1.575
[w010] 2025-05-22 06:37:33,836 (trainer:811) INFO: 10epoch:train:3751-4500batch: iter_time=1.538e-04, forward_time=0.177, loss_ctc=55.279, loss_att=28.710, acc=0.783, loss=9.170, backward_time=0.183, grad_norm=33.721, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.024, optim0_lr0=1.571e-04, train_time=1.578
[w010] 2025-05-22 06:42:29,463 (trainer:811) INFO: 10epoch:train:4501-5250batch: iter_time=1.532e-04, forward_time=0.177, loss_ctc=55.615, loss_att=28.915, acc=0.781, loss=9.231, backward_time=0.183, grad_norm=35.858, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.024, optim0_lr0=1.564e-04, train_time=1.577
[w010] 2025-05-22 06:47:24,787 (trainer:811) INFO: 10epoch:train:5251-6000batch: iter_time=1.503e-04, forward_time=0.177, loss_ctc=55.830, loss_att=28.899, acc=0.783, loss=9.245, backward_time=0.183, grad_norm=32.800, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.024, optim0_lr0=1.557e-04, train_time=1.575
[w010] 2025-05-22 06:52:19,995 (trainer:811) INFO: 10epoch:train:6001-6750batch: iter_time=1.403e-04, forward_time=0.177, loss_ctc=54.596, loss_att=28.414, acc=0.782, loss=9.067, backward_time=0.183, grad_norm=34.763, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.024, optim0_lr0=1.550e-04, train_time=1.575
[w010] 2025-05-22 06:57:15,827 (trainer:811) INFO: 10epoch:train:6751-7500batch: iter_time=1.475e-04, forward_time=0.177, loss_ctc=56.306, loss_att=29.190, acc=0.780, loss=9.331, backward_time=0.183, grad_norm=33.661, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.025, optim0_lr0=1.543e-04, train_time=1.577
[w010] 2025-05-22 07:02:10,987 (trainer:811) INFO: 10epoch:train:7501-8250batch: iter_time=1.428e-04, forward_time=0.177, loss_ctc=55.530, loss_att=28.848, acc=0.780, loss=9.213, backward_time=0.182, grad_norm=35.297, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.024, optim0_lr0=1.535e-04, train_time=1.574
[w010] 2025-05-22 07:07:07,013 (trainer:811) INFO: 10epoch:train:8251-9000batch: iter_time=1.605e-04, forward_time=0.178, loss_ctc=55.136, loss_att=28.627, acc=0.779, loss=9.145, backward_time=0.183, grad_norm=34.038, clip=100.000, loss_scale=8.590e+09, optim_step_time=0.024, optim0_lr0=1.528e-04, train_time=1.578
[w010] 2025-05-22 07:12:07,174 (trainer:811) INFO: 10epoch:train:9001-9750batch: iter_time=3.040e-04, forward_time=0.181, loss_ctc=55.208, loss_att=28.743, acc=0.781, loss=9.171, backward_time=0.184, grad_norm=35.246, clip=100.000, loss_scale=1.718e+10, optim_step_time=0.025, optim0_lr0=1.521e-04, train_time=1.599
[w010] 2025-05-22 07:17:08,835 (trainer:811) INFO: 10epoch:train:9751-10500batch: iter_time=2.209e-04, forward_time=0.181, loss_ctc=55.421, loss_att=28.829, acc=0.779, loss=9.202, backward_time=0.183, grad_norm=34.795, clip=100.000, loss_scale=1.718e+10, optim_step_time=0.039, optim0_lr0=1.514e-04, train_time=1.610
[w010] 2025-05-22 07:22:04,603 (trainer:811) INFO: 10epoch:train:10501-11250batch: iter_time=1.571e-04, forward_time=0.177, loss_ctc=54.872, loss_att=28.404, acc=0.784, loss=9.086, backward_time=0.183, grad_norm=33.848, clip=100.000, loss_scale=1.718e+10, optim_step_time=0.024, optim0_lr0=1.507e-04, train_time=1.578
[w010] 2025-05-22 07:27:00,567 (trainer:811) INFO: 10epoch:train:11251-12000batch: iter_time=1.651e-04, forward_time=0.178, loss_ctc=54.186, loss_att=28.039, acc=0.784, loss=8.971, backward_time=0.183, grad_norm=33.903, clip=100.000, loss_scale=1.718e+10, optim_step_time=0.024, optim0_lr0=1.500e-04, train_time=1.578
[w010] 2025-05-22 07:31:56,723 (trainer:811) INFO: 10epoch:train:12001-12750batch: iter_time=1.574e-04, forward_time=0.178, loss_ctc=54.619, loss_att=28.577, acc=0.777, loss=9.097, backward_time=0.183, grad_norm=33.335, clip=100.000, loss_scale=1.718e+10, optim_step_time=0.025, optim0_lr0=1.493e-04, train_time=1.580
[w010] 2025-05-22 07:36:52,702 (trainer:811) INFO: 10epoch:train:12751-13500batch: iter_time=1.567e-04, forward_time=0.177, loss_ctc=54.983, loss_att=28.508, acc=0.785, loss=9.113, backward_time=0.183, grad_norm=34.845, clip=100.000, loss_scale=1.718e+10, optim_step_time=0.024, optim0_lr0=1.486e-04, train_time=1.578
[w010] 2025-05-22 07:41:48,429 (trainer:811) INFO: 10epoch:train:13501-14250batch: iter_time=1.592e-04, forward_time=0.178, loss_ctc=54.755, loss_att=28.462, acc=0.784, loss=9.087, backward_time=0.183, grad_norm=34.588, clip=100.000, loss_scale=1.718e+10, optim_step_time=0.024, optim0_lr0=1.479e-04, train_time=1.577
[w010] 2025-05-22 07:46:43,824 (trainer:811) INFO: 10epoch:train:14251-15000batch: iter_time=1.535e-04, forward_time=0.177, loss_ctc=55.886, loss_att=28.932, acc=0.781, loss=9.255, backward_time=0.182, grad_norm=33.292, clip=100.000, loss_scale=1.718e+10, optim_step_time=0.024, optim0_lr0=1.472e-04, train_time=1.575
[w010] 2025-05-22 07:54:24,071 (trainer:394) INFO: 10epoch results: [train] iter_time=1.824e-04, forward_time=0.178, loss_ctc=55.392, loss_att=28.761, acc=0.781, loss=9.188, backward_time=0.183, grad_norm=34.094, clip=100.000, loss_scale=1.174e+10, optim_step_time=0.025, optim0_lr0=1.539e-04, train_time=1.580, time=1 hour, 38 minutes and 44.03 seconds, total_count=150000, gpu_max_cached_mem_GB=43.607, [valid] loss_ctc=21.682, cer_ctc=0.114, loss_att=10.449, acc=0.919, cer=0.057, wer=0.785, loss=13.819, time=7 minutes and 39.95 seconds, total_count=32200, gpu_max_cached_mem_GB=43.607
[w010] 2025-05-22 07:54:56,697 (trainer:462) INFO: The best model has been updated: valid.acc, valid.total_count
[w010] 2025-05-22 07:54:56,699 (trainer:516) INFO: The model files were removed: exp/s2t_lora_3/9epoch.pth
[w010] 2025-05-22 07:54:56,699 (trainer:534) INFO: The training was finished at 10 epochs
# Accounting: time=6476 threads=1
# Ended (code 0) at Thu May 22 07:54:57 EDT 2025, elapsed time 6476 seconds