sirimiri commited on
Commit
55da8d0
·
verified ·
1 Parent(s): 0e5f106

Update fine-tuned det (hmean 0.916) + rec + dict 233 chars + ViLM corpus

Browse files
.gitattributes CHANGED
@@ -35,3 +35,6 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
  models/inference_det/inference.pdiparams filter=lfs diff=lfs merge=lfs -text
37
  models/inference_rec/inference.pdiparams filter=lfs diff=lfs merge=lfs -text
 
 
 
 
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
  models/inference_det/inference.pdiparams filter=lfs diff=lfs merge=lfs -text
37
  models/inference_rec/inference.pdiparams filter=lfs diff=lfs merge=lfs -text
38
+ lm_data/vi_corpus.txt filter=lfs diff=lfs merge=lfs -text
39
+ models/det_best_accuracy.pdparams filter=lfs diff=lfs merge=lfs -text
40
+ models/rec_best_accuracy.pdparams filter=lfs diff=lfs merge=lfs -text
dict/vi_vietnam.txt ADDED
@@ -0,0 +1,233 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ !
2
+ "
3
+ #
4
+ $
5
+ %
6
+ &
7
+ '
8
+ (
9
+ )
10
+ *
11
+ +
12
+ ,
13
+ -
14
+ .
15
+ /
16
+ 0
17
+ 1
18
+ 2
19
+ 3
20
+ 4
21
+ 5
22
+ 6
23
+ 7
24
+ 8
25
+ 9
26
+ :
27
+ ;
28
+ <
29
+ =
30
+ >
31
+ ?
32
+ A
33
+ B
34
+ C
35
+ D
36
+ E
37
+ F
38
+ G
39
+ H
40
+ I
41
+ J
42
+ K
43
+ L
44
+ M
45
+ N
46
+ O
47
+ P
48
+ Q
49
+ R
50
+ S
51
+ T
52
+ U
53
+ V
54
+ W
55
+ X
56
+ Y
57
+ [
58
+ \
59
+ ]
60
+ a
61
+ b
62
+ c
63
+ d
64
+ e
65
+ f
66
+ g
67
+ h
68
+ i
69
+ j
70
+ k
71
+ l
72
+ m
73
+ n
74
+ o
75
+ p
76
+ q
77
+ r
78
+ s
79
+ t
80
+ u
81
+ v
82
+ w
83
+ x
84
+ y
85
+ z
86
+ {
87
+ |
88
+ }
89
+ «
90
+ ²
91
+ ¹
92
+ »
93
+ À
94
+ Á
95
+ Â
96
+ Ã
97
+ É
98
+ Ê
99
+ Ì
100
+ Í
101
+ Ò
102
+ Ó
103
+ Ô
104
+ Ù
105
+ Ú
106
+ Ý
107
+ à
108
+ á
109
+ â
110
+ ã
111
+ ä
112
+ ç
113
+ è
114
+ é
115
+ ê
116
+ ì
117
+ í
118
+ ò
119
+ ó
120
+ ô
121
+ õ
122
+ ù
123
+ ú
124
+ ü
125
+ ý
126
+ ā
127
+ Ă
128
+ ă
129
+ Đ
130
+ đ
131
+ ē
132
+ ě
133
+ Ĩ
134
+ ĩ
135
+ ī
136
+ ō
137
+ Ũ
138
+ ũ
139
+ ū
140
+ Ơ
141
+ ơ
142
+ Ư
143
+ ư
144
+ ǎ
145
+ ǒ
146
+ ǔ
147
+
148
+
149
+
150
+
151
+
152
+
153
+
154
+
155
+
156
+
157
+
158
+
159
+
160
+
161
+
162
+
163
+
164
+
165
+
166
+
167
+
168
+
169
+
170
+
171
+
172
+ ế
173
+
174
+
175
+
176
+
177
+
178
+
179
+
180
+
181
+
182
+
183
+
184
+
185
+
186
+
187
+
188
+
189
+
190
+
191
+
192
+
193
+
194
+
195
+
196
+
197
+
198
+
199
+
200
+
201
+
202
+
203
+
204
+
205
+
206
+
207
+
208
+
209
+
210
+
211
+
212
+
213
+
214
+
215
+
216
+
217
+
218
+
219
+
220
+
221
+
222
+
223
+
224
+
225
+
226
+
227
+
228
+
229
+
230
+
231
+
232
+
233
+
lm_data/vi_corpus.txt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:419af78bc5158caadaa046a6f1f82ed2c6b6a938219755b1c0354714d6e5381a
3
+ size 64558088
models/config_det.yml ADDED
@@ -0,0 +1,139 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+
2
+ Global:
3
+ debug: false
4
+ use_gpu: true
5
+ epoch_num: 30
6
+ log_smooth_window: 20
7
+ print_batch_step: 20
8
+ save_model_dir: /kaggle/working/output/det_v5m
9
+ save_epoch_step: 1000
10
+ eval_batch_step: [2000, 2000]
11
+ cal_metric_during_train: false
12
+ pretrained_model: /kaggle/working/PP-OCRv5_mobile_det_pretrained.pdparams
13
+ checkpoints: null
14
+ save_inference_dir: null
15
+ use_visualdl: false
16
+ infer_img: null
17
+ save_res_path: /kaggle/working/predicts_db.txt
18
+ distributed: true
19
+ model_name: PP-OCRv5_mobile_det
20
+
21
+ Architecture:
22
+ model_type: det
23
+ algorithm: DB
24
+ Transform: null
25
+ Backbone:
26
+ name: PPLCNetV3
27
+ scale: 0.75
28
+ det: True
29
+ Neck:
30
+ name: RSEFPN
31
+ out_channels: 96
32
+ shortcut: True
33
+ Head:
34
+ name: DBHead
35
+ k: 50
36
+
37
+ Loss:
38
+ name: DBLoss
39
+ balance_loss: true
40
+ main_loss_type: DiceLoss
41
+ alpha: 5
42
+ beta: 10
43
+ ohem_ratio: 3
44
+
45
+ Optimizer:
46
+ name: Adam
47
+ beta1: 0.9
48
+ beta2: 0.999
49
+ lr:
50
+ name: Cosine
51
+ learning_rate: 0.0005
52
+ warmup_epoch: 2
53
+ regularizer:
54
+ name: L2
55
+ factor: 5.0e-05
56
+
57
+ PostProcess:
58
+ name: DBPostProcess
59
+ thresh: 0.3
60
+ box_thresh: 0.6
61
+ max_candidates: 1000
62
+ unclip_ratio: 1.5
63
+
64
+ Metric:
65
+ name: DetMetric
66
+ main_indicator: hmean
67
+
68
+ Train:
69
+ dataset:
70
+ name: SimpleDataSet
71
+ data_dir: /kaggle/input/datasets/sirimiriiii13/vi-det-full
72
+ label_file_list:
73
+ - /kaggle/input/datasets/sirimiriiii13/vi-det-full/train.txt
74
+ ratio_list: [1.0]
75
+ transforms:
76
+ - DecodeImage:
77
+ img_mode: BGR
78
+ channel_first: false
79
+ - DetLabelEncode: null
80
+ - IaaAugment:
81
+ augmenter_args:
82
+ - type: Affine
83
+ args:
84
+ rotate: [-10, 10]
85
+ - type: Resize
86
+ args:
87
+ size: [0.5, 3]
88
+ - EastRandomCropData:
89
+ size: [640, 640]
90
+ max_tries: 50
91
+ keep_ratio: true
92
+ - MakeBorderMap:
93
+ shrink_ratio: 0.4
94
+ thresh_min: 0.3
95
+ thresh_max: 0.7
96
+ - MakeShrinkMap:
97
+ shrink_ratio: 0.4
98
+ min_text_size: 3
99
+ - NormalizeImage:
100
+ scale: 1./255.
101
+ mean: [0.485, 0.456, 0.406]
102
+ std: [0.229, 0.224, 0.225]
103
+ order: hwc
104
+ - ToCHWImage: null
105
+ - KeepKeys:
106
+ keep_keys: [image, threshold_map, threshold_mask, shrink_map, shrink_mask]
107
+ loader:
108
+ shuffle: true
109
+ drop_last: true
110
+ batch_size_per_card: 8
111
+ num_workers: 4
112
+
113
+ Eval:
114
+ dataset:
115
+ name: SimpleDataSet
116
+ data_dir: /kaggle/input/datasets/sirimiriiii13/vi-det-full
117
+ label_file_list:
118
+ - /kaggle/input/datasets/sirimiriiii13/vi-det-full/val.txt
119
+ transforms:
120
+ - DecodeImage:
121
+ img_mode: BGR
122
+ channel_first: false
123
+ - DetLabelEncode: null
124
+ - DetResizeForTest:
125
+ limit_side_len: 1280
126
+ limit_type: max
127
+ - NormalizeImage:
128
+ scale: 1./255.
129
+ mean: [0.485, 0.456, 0.406]
130
+ std: [0.229, 0.224, 0.225]
131
+ order: hwc
132
+ - ToCHWImage: null
133
+ - KeepKeys:
134
+ keep_keys: [image, shape, polys, ignore_tags]
135
+ loader:
136
+ shuffle: false
137
+ drop_last: false
138
+ batch_size_per_card: 1
139
+ num_workers: 2
models/det_best_accuracy.pdparams ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:213266d0a626cdc14f7e10e6436ac6d02e14f6060189731c254193e98bd24af7
3
+ size 14381328
models/inference_det/inference.json CHANGED
The diff for this file is too large to render. See raw diff
 
models/inference_det/inference.pdiparams CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:7d16739f6f7e9db25b7eea78425ee1eeb46b3a7eda94e9e363baa1200259bfa7
3
- size 2377917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ca8be3da54703bd891bbd899d27f57429a4a76aad5a21c0c56e2a3f785cc841d
3
+ size 4692097
models/inference_det/inference.yml CHANGED
@@ -1,5 +1,5 @@
1
  Global:
2
- model_name: PP-OCRv5_server_det
3
  Hpi:
4
  backend_configs:
5
  paddle_infer:
@@ -19,12 +19,6 @@ Hpi:
19
  - 4000
20
  tensorrt:
21
  dynamic_shapes: *id001
22
- PostProcess:
23
- box_thresh: 0.6
24
- max_candidates: 1000
25
- name: DBPostProcess
26
- thresh: 0.3
27
- unclip_ratio: 1.5
28
  PreProcess:
29
  transform_ops:
30
  - DecodeImage:
@@ -32,8 +26,7 @@ PreProcess:
32
  img_mode: BGR
33
  - DetLabelEncode: null
34
  - DetResizeForTest:
35
- limit_side_len: 1280
36
- limit_type: max
37
  - NormalizeImage:
38
  mean:
39
  - 0.485
@@ -52,3 +45,9 @@ PreProcess:
52
  - shape
53
  - polys
54
  - ignore_tags
 
 
 
 
 
 
 
1
  Global:
2
+ model_name: PP-OCRv5_mobile_det
3
  Hpi:
4
  backend_configs:
5
  paddle_infer:
 
19
  - 4000
20
  tensorrt:
21
  dynamic_shapes: *id001
 
 
 
 
 
 
22
  PreProcess:
23
  transform_ops:
24
  - DecodeImage:
 
26
  img_mode: BGR
27
  - DetLabelEncode: null
28
  - DetResizeForTest:
29
+ resize_long: 960
 
30
  - NormalizeImage:
31
  mean:
32
  - 0.485
 
45
  - shape
46
  - polys
47
  - ignore_tags
48
+ PostProcess:
49
+ name: DBPostProcess
50
+ thresh: 0.3
51
+ box_thresh: 0.6
52
+ max_candidates: 1000
53
+ unclip_ratio: 1.5
models/inference_rec/inference.json CHANGED
The diff for this file is too large to render. See raw diff
 
models/inference_rec/inference.pdiparams CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b27d4b43fbec4d719ca93937855b4e21fe79edf38d77c9cdf95ffe931ce6612c
3
- size 7627599
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1988f75d1a0282a59fc9fdd99f0eee70f4b7c5b695fd28b6d22fa9974ff772a3
3
+ size 7674063
models/inference_rec/inference.yml CHANGED
@@ -3,8 +3,8 @@ Global:
3
  Hpi:
4
  backend_configs:
5
  paddle_infer:
6
- trt_dynamic_shapes: &id001
7
- x:
8
  - - 1
9
  - 3
10
  - 48
@@ -18,15 +18,20 @@ Hpi:
18
  - 48
19
  - 3200
20
  tensorrt:
21
- dynamic_shapes: *id001
 
22
  PostProcess:
23
  character_dict:
24
  - '!'
25
  - '"'
 
 
26
  - '%'
 
27
  - ''''
28
  - (
29
  - )
 
30
  - +
31
  - ','
32
  - '-'
@@ -44,16 +49,20 @@ PostProcess:
44
  - '9'
45
  - ':'
46
  - ;
 
47
  - '='
 
48
  - '?'
49
  - A
50
  - B
51
  - C
52
  - D
53
  - E
 
54
  - G
55
  - H
56
  - I
 
57
  - K
58
  - L
59
  - M
@@ -66,16 +75,22 @@ PostProcess:
66
  - T
67
  - U
68
  - V
 
69
  - X
70
  - Y
 
 
 
71
  - a
72
  - b
73
  - c
74
  - d
75
  - e
 
76
  - g
77
  - h
78
  - i
 
79
  - k
80
  - l
81
  - m
@@ -88,12 +103,37 @@ PostProcess:
88
  - t
89
  - u
90
  - v
 
91
  - x
92
  - y
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
93
  - à
94
  - á
95
  - â
96
  - ã
 
 
97
  - è
98
  - é
99
  - ê
@@ -105,59 +145,116 @@ PostProcess:
105
  - õ
106
  - ù
107
  - ú
 
108
  - ý
 
 
109
  - ă
110
  - Đ
111
  - đ
 
 
 
112
  - ĩ
 
 
 
113
  - ũ
 
 
114
  - ơ
 
115
  - ư
 
 
 
 
116
  - ạ
 
117
  - ả
 
118
  - ấ
 
119
  - ầ
 
120
  - ẩ
121
  - ẫ
 
122
  - ậ
 
123
  - ắ
124
  - ằ
125
  - ẳ
126
  - ẵ
 
127
  - ặ
128
  - ẹ
 
129
  - ẻ
130
  - ẽ
 
131
  - ế
 
132
  - ề
 
133
  - ể
 
134
  - ễ
 
135
  - ệ
 
136
  - ỉ
 
137
  - ị
 
138
  - ọ
 
139
  - ỏ
 
140
  - ố
 
141
  - ồ
 
142
  - ổ
143
  - ỗ
 
144
  - ộ
 
145
  - ớ
 
146
  - ờ
 
147
  - ở
148
  - ỡ
 
149
  - ợ
 
150
  - ụ
 
151
  - ủ
 
152
  - ứ
 
153
  - ừ
 
154
  - ử
 
155
  - ữ
 
156
  - ự
 
157
  - ỳ
158
  - ỵ
 
159
  - ỷ
160
  - ỹ
 
 
 
 
 
 
 
161
  name: CTCLabelDecode
162
  PreProcess:
163
  transform_ops:
@@ -166,13 +263,13 @@ PreProcess:
166
  img_mode: BGR
167
  - MultiLabelEncode:
168
  gtc_encode: NRTRLabelEncode
169
- max_text_length: 96
170
  - RecResizeImg:
171
  eval_mode: true
172
  image_shape:
173
  - 3
174
  - 48
175
- - 640
176
  - KeepKeys:
177
  keep_keys:
178
  - image
 
3
  Hpi:
4
  backend_configs:
5
  paddle_infer:
6
+ trt_dynamic_shapes:
7
+ x: &id001
8
  - - 1
9
  - 3
10
  - 48
 
18
  - 48
19
  - 3200
20
  tensorrt:
21
+ dynamic_shapes:
22
+ x: *id001
23
  PostProcess:
24
  character_dict:
25
  - '!'
26
  - '"'
27
+ - '#'
28
+ - $
29
  - '%'
30
+ - '&'
31
  - ''''
32
  - (
33
  - )
34
+ - '*'
35
  - +
36
  - ','
37
  - '-'
 
49
  - '9'
50
  - ':'
51
  - ;
52
+ - <
53
  - '='
54
+ - '>'
55
  - '?'
56
  - A
57
  - B
58
  - C
59
  - D
60
  - E
61
+ - F
62
  - G
63
  - H
64
  - I
65
+ - J
66
  - K
67
  - L
68
  - M
 
75
  - T
76
  - U
77
  - V
78
+ - W
79
  - X
80
  - Y
81
+ - '['
82
+ - \
83
+ - ']'
84
  - a
85
  - b
86
  - c
87
  - d
88
  - e
89
+ - f
90
  - g
91
  - h
92
  - i
93
+ - j
94
  - k
95
  - l
96
  - m
 
103
  - t
104
  - u
105
  - v
106
+ - w
107
  - x
108
  - y
109
+ - z
110
+ - '{'
111
+ - '|'
112
+ - '}'
113
+ - «
114
+ - ²
115
+ - ¹
116
+ - »
117
+ - À
118
+ - Á
119
+ - Â
120
+ - Ã
121
+ - É
122
+ - Ê
123
+ - Ì
124
+ - Í
125
+ - Ò
126
+ - Ó
127
+ - Ô
128
+ - Ù
129
+ - Ú
130
+ - Ý
131
  - à
132
  - á
133
  - â
134
  - ã
135
+ - ä
136
+ - ç
137
  - è
138
  - é
139
  - ê
 
145
  - õ
146
  - ù
147
  - ú
148
+ - ü
149
  - ý
150
+ - ā
151
+ - Ă
152
  - ă
153
  - Đ
154
  - đ
155
+ - ē
156
+ - ě
157
+ - Ĩ
158
  - ĩ
159
+ - ī
160
+ - ō
161
+ - Ũ
162
  - ũ
163
+ - ū
164
+ - Ơ
165
  - ơ
166
+ - Ư
167
  - ư
168
+ - ǎ
169
+ - ǒ
170
+ - ǔ
171
+ - Ạ
172
  - ạ
173
+ - Ả
174
  - ả
175
+ - Ấ
176
  - ấ
177
+ - Ầ
178
  - ầ
179
+ - Ẩ
180
  - ẩ
181
  - ẫ
182
+ - Ậ
183
  - ậ
184
+ - Ắ
185
  - ắ
186
  - ằ
187
  - ẳ
188
  - ẵ
189
+ - Ặ
190
  - ặ
191
  - ẹ
192
+ - Ẻ
193
  - ẻ
194
  - ẽ
195
+ - Ế
196
  - ế
197
+ - Ề
198
  - ề
199
+ - Ể
200
  - ể
201
+ - Ễ
202
  - ễ
203
+ - Ệ
204
  - ệ
205
+ - Ỉ
206
  - ỉ
207
+ - Ị
208
  - ị
209
+ - Ọ
210
  - ọ
211
+ - Ỏ
212
  - ỏ
213
+ - Ố
214
  - ố
215
+ - Ồ
216
  - ồ
217
+ - Ổ
218
  - ổ
219
  - ỗ
220
+ - Ộ
221
  - ộ
222
+ - Ớ
223
  - ớ
224
+ - Ờ
225
  - ờ
226
+ - Ở
227
  - ở
228
  - ỡ
229
+ - Ợ
230
  - ợ
231
+ - Ụ
232
  - ụ
233
+ - Ủ
234
  - ủ
235
+ - Ứ
236
  - ứ
237
+ - Ừ
238
  - ừ
239
+ - Ử
240
  - ử
241
+ - Ữ
242
  - ữ
243
+ - Ự
244
  - ự
245
+ - Ỳ
246
  - ỳ
247
  - ỵ
248
+ - Ỷ
249
  - ỷ
250
  - ỹ
251
+ - –
252
+ - —
253
+ - ’
254
+ - “
255
+ - ”
256
+ - •
257
+ - …
258
  name: CTCLabelDecode
259
  PreProcess:
260
  transform_ops:
 
263
  img_mode: BGR
264
  - MultiLabelEncode:
265
  gtc_encode: NRTRLabelEncode
266
+ max_text_length: 80
267
  - RecResizeImg:
268
  eval_mode: true
269
  image_shape:
270
  - 3
271
  - 48
272
+ - 960
273
  - KeepKeys:
274
  keep_keys:
275
  - image
models/rec_best_accuracy.pdparams ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1a788895640ff00dd04d5ae22acbd9a7402d9f4f3306a06960afadded88d8750
3
+ size 69348604
models/vi_PP-OCRv5_mobile_rec.yml ADDED
@@ -0,0 +1,123 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+
2
+ Global:
3
+ debug: false
4
+ use_gpu: true
5
+ epoch_num: 12
6
+ log_smooth_window: 20
7
+ print_batch_step: 20
8
+ save_model_dir: /kaggle/working/output/vi_ppocrv5
9
+ save_epoch_step: 1000
10
+ eval_batch_step: [0, 2000]
11
+ cal_metric_during_train: true
12
+ pretrained_model: /kaggle/input/datasets/sirimiriiii13/rec-ckpt-v14/output/vi_ppocrv5/best_accuracy
13
+ checkpoints: null
14
+ save_inference_dir: null
15
+ use_visualdl: false
16
+ infer_img: null
17
+ character_dict_path: /kaggle/input/datasets/sirimiriiii13/vi-rec-100k/vi_dict.txt
18
+ max_text_length: 80
19
+ infer_mode: false
20
+ use_space_char: true
21
+ distributed: true
22
+ save_res_path: /kaggle/working/rec_predicts.txt
23
+ d2s_train_image_shape: [3, 48, 960]
24
+
25
+ Optimizer:
26
+ name: Adam
27
+ beta1: 0.9
28
+ beta2: 0.999
29
+ lr:
30
+ name: Cosine
31
+ learning_rate: 0.0002
32
+ warmup_epoch: 2
33
+ regularizer:
34
+ name: L2
35
+ factor: 3.0e-05
36
+
37
+ Architecture:
38
+ model_type: rec
39
+ algorithm: SVTR_LCNet
40
+ Transform: null
41
+ Backbone:
42
+ name: PPLCNetV3
43
+ scale: 0.95
44
+ Head:
45
+ name: MultiHead
46
+ head_list:
47
+ - CTCHead:
48
+ Neck:
49
+ name: svtr
50
+ dims: 120
51
+ depth: 2
52
+ hidden_dims: 120
53
+ kernel_size: [1, 3]
54
+ use_guide: true
55
+ Head:
56
+ fc_decay: 1.0e-05
57
+ - NRTRHead:
58
+ nrtr_dim: 384
59
+ max_text_length: 80
60
+
61
+ Loss:
62
+ name: MultiLoss
63
+ loss_config_list:
64
+ - CTCLoss:
65
+ - NRTRLoss:
66
+
67
+ PostProcess:
68
+ name: CTCLabelDecode
69
+
70
+ Metric:
71
+ name: RecMetric
72
+ main_indicator: acc
73
+
74
+ Train:
75
+ dataset:
76
+ name: MultiScaleDataSet
77
+ ds_width: false
78
+ data_dir: /kaggle/input/datasets/sirimiriiii13/vi-rec-100k
79
+ label_file_list:
80
+ - /kaggle/input/datasets/sirimiriiii13/vi-rec-100k/rec_train.txt
81
+ transforms:
82
+ - DecodeImage:
83
+ img_mode: BGR
84
+ channel_first: false
85
+ - RecAug: null
86
+ - MultiLabelEncode:
87
+ gtc_encode: NRTRLabelEncode
88
+ - KeepKeys:
89
+ keep_keys: [image, label_ctc, label_gtc, length, valid_ratio]
90
+ sampler:
91
+ name: MultiScaleSampler
92
+ scales: [[960, 32], [960, 48], [960, 64]]
93
+ first_bs: 24
94
+ fix_bs: false
95
+ divided_factor: [8, 16]
96
+ is_training: true
97
+ loader:
98
+ shuffle: true
99
+ batch_size_per_card: 24
100
+ drop_last: true
101
+ num_workers: 2
102
+
103
+ Eval:
104
+ dataset:
105
+ name: SimpleDataSet
106
+ data_dir: /kaggle/input/datasets/sirimiriiii13/vi-rec-100k
107
+ label_file_list:
108
+ - /kaggle/input/datasets/sirimiriiii13/vi-rec-100k/rec_val.txt
109
+ transforms:
110
+ - DecodeImage:
111
+ img_mode: BGR
112
+ channel_first: false
113
+ - MultiLabelEncode:
114
+ gtc_encode: NRTRLabelEncode
115
+ - RecResizeImg:
116
+ image_shape: [3, 48, 960]
117
+ - KeepKeys:
118
+ keep_keys: [image, label_ctc, label_gtc, length, valid_ratio]
119
+ loader:
120
+ shuffle: false
121
+ drop_last: false
122
+ batch_size_per_card: 32
123
+ num_workers: 2