lemondouble commited on
Commit
a738f25
·
verified ·
1 Parent(s): 2cf2964

docs: あみたろ 6종 화자 정보 및 전체 모델 추가 제한 조건 추가 (4개국어)

Browse files
Files changed (1) hide show
  1. README.md +79 -8
README.md CHANGED
@@ -35,14 +35,15 @@ pytorch/
35
  ├── jvnv-F2-jp/
36
  ├── jvnv-M1-jp/
37
  ├── jvnv-M2-jp/
38
- ── tsukuyomi_chan/
 
39
 
40
  onnx/
41
  ├── bert/ # ONNX 변환 BERT
42
  │ ├── fp32/ # FP32 ONNX (1.2GB)
43
  │ └── q8/ # INT8 양자화 (498MB)
44
  └── speakers/ # ONNX 변환 Synthesizer
45
- └── jvnv-*/
46
  ├── synthesizer.onnx # FP32 (239MB)
47
  └── synthesizer_q8.onnx # INT8 (239MB)
48
  ```
@@ -89,6 +90,21 @@ Synthesizer(VITS)의 Flow 레이어에 포함된 `rational_quadratic_spline` 함
89
  > 본 모델의 음성합성에는 つくよみちゃん(© Rei Yumesaki)의 무료 공개 캐릭터 음성 데이터를 사용하고 있습니다.
90
  > つくよみちゃんコーパス(CV.夢前黎) https://tyc.rei-yumesaki.net/material/corpus/
91
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
92
  ---
93
 
94
  ## EN | English
@@ -110,14 +126,15 @@ pytorch/
110
  │ └── q8/ # INT8 dynamic quantization (413MB) — reduces CPU RAM
111
  └── speakers/ # Speaker models (safetensors)
112
  ├── jvnv-*/
113
- ── tsukuyomi_chan/
 
114
 
115
  onnx/
116
  ├── bert/ # ONNX-converted BERT
117
  │ ├── fp32/ # FP32 ONNX (1.2GB)
118
  │ └── q8/ # INT8 quantized (498MB)
119
  └── speakers/ # ONNX-converted Synthesizer
120
- └── jvnv-*/
121
  ├── synthesizer.onnx # FP32 (239MB)
122
  └── synthesizer_q8.onnx # INT8 (239MB)
123
  ```
@@ -164,6 +181,21 @@ Fine-tuned speaker model based on [Tsukuyomi-chan Corpus](https://tyc.rei-yumesa
164
  > This model uses the free character voice data of つくよみちゃん (© Rei Yumesaki) for speech synthesis.
165
  > つくよみちゃんコーパス (CV.夢前黎) https://tyc.rei-yumesaki.net/material/corpus/
166
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
167
  ---
168
 
169
  ## JP | 日本語
@@ -185,14 +217,15 @@ pytorch/
185
  │ └── q8/ # INT8動的量子化 (413MB) — CPUメモリ削減用
186
  └── speakers/ # 話者モデル (safetensors)
187
  ├── jvnv-*/
188
- ── tsukuyomi_chan/
 
189
 
190
  onnx/
191
  ├── bert/ # ONNX変換BERT
192
  │ ├── fp32/ # FP32 ONNX (1.2GB)
193
  │ └── q8/ # INT8量子化 (498MB)
194
  └── speakers/ # ONNX変換Synthesizer
195
- └── jvnv-*/
196
  ├── synthesizer.onnx # FP32 (239MB)
197
  └── synthesizer_q8.onnx # INT8 (239MB)
198
  ```
@@ -239,6 +272,21 @@ VITSのFlowレイヤーに含まれる`rational_quadratic_spline`関数が半精
239
  > 本ソフトウェアの音声合成にはつくよみちゃん(© Rei Yumesaki)の無料公開キャラクター音声データを使用しています。
240
  > つくよみちゃんコーパス(CV.夢前黎) https://tyc.rei-yumesaki.net/material/corpus/
241
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
242
  ---
243
 
244
  ## ZH | 中文
@@ -260,14 +308,15 @@ pytorch/
260
  │ └── q8/ # INT8动态量化 (413MB) — 减少CPU内存
261
  └── speakers/ # 说话人模型 (safetensors)
262
  ├── jvnv-*/
263
- ── tsukuyomi_chan/
 
264
 
265
  onnx/
266
  ├── bert/ # ONNX转换BERT
267
  │ ├── fp32/ # FP32 ONNX (1.2GB)
268
  │ └── q8/ # INT8量化 (498MB)
269
  └── speakers/ # ONNX转换Synthesizer
270
- └── jvnv-*/
271
  ├── synthesizer.onnx # FP32 (239MB)
272
  └── synthesizer_q8.onnx # INT8 (239MB)
273
  ```
@@ -314,6 +363,21 @@ VITS Flow层中的`rational_quadratic_spline`函数在半精度(FP16)下会触
314
  > 本模型的语音合成使用了つくよみちゃん(© Rei Yumesaki)的免费公开角色语音数据。
315
  > つくよみちゃんコーパス(CV.夢前黎) https://tyc.rei-yumesaki.net/material/corpus/
316
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
317
  ---
318
 
319
  ## License
@@ -326,4 +390,11 @@ VITS Flow层中的`rational_quadratic_spline`函数在半精度(FP16)下会触
326
  - **BERT (DeBERTa v2)**: CC-BY-SA-4.0 ([ku-nlp/deberta-v2-large-japanese-char-wwm](https://huggingface.co/ku-nlp/deberta-v2-large-japanese-char-wwm))
327
  - **JVNV Speaker Models**: CC-BY-SA-4.0 ([litagin/style_bert_vits2_jvnv](https://huggingface.co/litagin/style_bert_vits2_jvnv))
328
  - **Tsukuyomi-chan Speaker Model**: CC-BY-SA-4.0 — fine-tuned using [つくよみちゃんコーパス](https://tyc.rei-yumesaki.net/material/corpus/) Vol.1 (CV.夢前黎, © Rei Yumesaki)
 
329
  - **Style-Bert-VITS2**: AGPL-3.0 ([litagin02/Style-Bert-VITS2](https://github.com/litagin02/Style-Bert-VITS2))
 
 
 
 
 
 
 
35
  ├── jvnv-F2-jp/
36
  ├── jvnv-M1-jp/
37
  ├── jvnv-M2-jp/
38
+ ── tsukuyomi_chan/
39
+ └── amitaro_*/
40
 
41
  onnx/
42
  ├── bert/ # ONNX 변환 BERT
43
  │ ├── fp32/ # FP32 ONNX (1.2GB)
44
  │ └── q8/ # INT8 양자화 (498MB)
45
  └── speakers/ # ONNX 변환 Synthesizer
46
+ └── */
47
  ├── synthesizer.onnx # FP32 (239MB)
48
  └── synthesizer_q8.onnx # INT8 (239MB)
49
  ```
 
90
  > 본 모델의 음성합성에는 つくよみちゃん(© Rei Yumesaki)의 무료 공개 캐릭터 음성 데이터를 사용하고 있습니다.
91
  > つくよみちゃんコーパス(CV.夢前黎) https://tyc.rei-yumesaki.net/material/corpus/
92
 
93
+ #### あみたろ (Amitaro)
94
+
95
+ [あみたろの声素材工房](https://amitaro.net/) ITAコーパス読み上げ음성 기반 파인튜닝 화자 모델입니다. 동일 화자의 6가지 스타일을 독립 모델로 제공합니다.
96
+
97
+ | 화자 | 스타일 | 설명 |
98
+ |------|--------|------|
99
+ | amitaro_normal | ノーマル | 정확한 발음, TTS 최적화 |
100
+ | amitaro_runrun | るんるん | 자연스럽고 친근한 톤 |
101
+ | amitaro_yofukashi | よふかし | 차분한 라디오풍 |
102
+ | amitaro_punsuka | ぷんすか | 귀여운 화난 목소리 |
103
+ | amitaro_sasayaki_a | ささやきA | 강한 속삭임 |
104
+ | amitaro_sasayaki_b | ささやきB | 약한 속삭임 |
105
+
106
+ > 본 모델의 음성합성에는 あみたろの声素材工房(https://amitaro.net/)의 ITAコーパス読み上げ음성을 사용하고 있습니다.
107
+
108
  ---
109
 
110
  ## EN | English
 
126
  │ └── q8/ # INT8 dynamic quantization (413MB) — reduces CPU RAM
127
  └── speakers/ # Speaker models (safetensors)
128
  ├── jvnv-*/
129
+ ── tsukuyomi_chan/
130
+ └── amitaro_*/
131
 
132
  onnx/
133
  ├── bert/ # ONNX-converted BERT
134
  │ ├── fp32/ # FP32 ONNX (1.2GB)
135
  │ └── q8/ # INT8 quantized (498MB)
136
  └── speakers/ # ONNX-converted Synthesizer
137
+ └── */
138
  ├── synthesizer.onnx # FP32 (239MB)
139
  └── synthesizer_q8.onnx # INT8 (239MB)
140
  ```
 
181
  > This model uses the free character voice data of つくよみちゃん (© Rei Yumesaki) for speech synthesis.
182
  > つくよみちゃんコーパス (CV.夢前黎) https://tyc.rei-yumesaki.net/material/corpus/
183
 
184
+ #### Amitaro (あみたろ)
185
+
186
+ Fine-tuned speaker models based on [あみたろの声素材工房](https://amitaro.net/) ITA Corpus readings. Six styles from the same speaker, provided as independent models.
187
+
188
+ | Speaker | Style | Description |
189
+ |---------|-------|-------------|
190
+ | amitaro_normal | ノーマル | Clear pronunciation, TTS-optimized |
191
+ | amitaro_runrun | るんるん | Natural, friendly tone |
192
+ | amitaro_yofukashi | よふかし | Calm, radio-style |
193
+ | amitaro_punsuka | ぷんすか | Cute angry voice |
194
+ | amitaro_sasayaki_a | ささやきA | Strong whisper |
195
+ | amitaro_sasayaki_b | ささやきB | Soft whisper |
196
+
197
+ > This model uses ITA Corpus reading voice data from あみたろの声素材工房 (https://amitaro.net/) for speech synthesis.
198
+
199
  ---
200
 
201
  ## JP | 日本語
 
217
  │ └── q8/ # INT8動的量子化 (413MB) — CPUメモリ削減用
218
  └── speakers/ # 話者モデル (safetensors)
219
  ├── jvnv-*/
220
+ ── tsukuyomi_chan/
221
+ └── amitaro_*/
222
 
223
  onnx/
224
  ├── bert/ # ONNX変換BERT
225
  │ ├── fp32/ # FP32 ONNX (1.2GB)
226
  │ └── q8/ # INT8量子化 (498MB)
227
  └── speakers/ # ONNX変換Synthesizer
228
+ └── */
229
  ├── synthesizer.onnx # FP32 (239MB)
230
  └── synthesizer_q8.onnx # INT8 (239MB)
231
  ```
 
272
  > 本ソフトウェアの音声合成にはつくよみちゃん(© Rei Yumesaki)の無料公開キャラクター音声データを使用しています。
273
  > つくよみちゃんコーパス(CV.夢前黎) https://tyc.rei-yumesaki.net/material/corpus/
274
 
275
+ #### あみたろ (Amitaro)
276
+
277
+ [あみたろの声素材工房](https://amitaro.net/) ITAコーパス読み上げ音声をベースにファインチューニングした話者モデルです。同一話者の6つのスタイルを独立モデルとして提供します。
278
+
279
+ | 話者 | スタイル | 説明 |
280
+ |------|----------|------|
281
+ | amitaro_normal | ノーマル | 正確な発音、音声合成に最適化 |
282
+ | amitaro_runrun | るんるん | 自然で親しみやすいトーン |
283
+ | amitaro_yofukashi | よふかし | 落ち着いたラジオ風 |
284
+ | amitaro_punsuka | ぷんすか | かわいい怒り声 |
285
+ | amitaro_sasayaki_a | ささやきA | 強めのささやき |
286
+ | amitaro_sasayaki_b | ささやきB | 弱めのささやき |
287
+
288
+ > 本ソフトウェアの音声合成にはあみたろの声素材工房(https://amitaro.net/)のITAコーパス読み上げ音声を使用しています。
289
+
290
  ---
291
 
292
  ## ZH | 中文
 
308
  │ └── q8/ # INT8动态量化 (413MB) — 减少CPU内存
309
  └── speakers/ # 说话人模型 (safetensors)
310
  ├── jvnv-*/
311
+ ── tsukuyomi_chan/
312
+ └── amitaro_*/
313
 
314
  onnx/
315
  ├── bert/ # ONNX转换BERT
316
  │ ├── fp32/ # FP32 ONNX (1.2GB)
317
  │ └── q8/ # INT8量化 (498MB)
318
  └── speakers/ # ONNX转换Synthesizer
319
+ └── */
320
  ├── synthesizer.onnx # FP32 (239MB)
321
  └── synthesizer_q8.onnx # INT8 (239MB)
322
  ```
 
363
  > 本模型的语音合成使用了つくよみちゃん(© Rei Yumesaki)的免费公开角色语音数据。
364
  > つくよみちゃんコーパス(CV.夢前黎) https://tyc.rei-yumesaki.net/material/corpus/
365
 
366
+ #### あみたろ (Amitaro)
367
+
368
+ 基于[あみたろの声素材工房](https://amitaro.net/) ITA语料库朗读语音微调的说话人模型。同一说话人的6种风格作为独立模型提供。
369
+
370
+ | 说话人 | 风格 | 说明 |
371
+ |--------|------|------|
372
+ | amitaro_normal | ノーマル | 准确发音,TTS优化 |
373
+ | amitaro_runrun | るんるん | 自然亲切的语调 |
374
+ | amitaro_yofukashi | よふかし | 沉稳的广播风格 |
375
+ | amitaro_punsuka | ぷんすか | 可爱的生气声音 |
376
+ | amitaro_sasayaki_a | ささやきA | 较强的耳语 |
377
+ | amitaro_sasayaki_b | ささやきB | 较弱的耳语 |
378
+
379
+ > 本模型的语音合成使用了あみたろの声素材工房(https://amitaro.net/)的ITA语料库朗读语音数据。
380
+
381
  ---
382
 
383
  ## License
 
390
  - **BERT (DeBERTa v2)**: CC-BY-SA-4.0 ([ku-nlp/deberta-v2-large-japanese-char-wwm](https://huggingface.co/ku-nlp/deberta-v2-large-japanese-char-wwm))
391
  - **JVNV Speaker Models**: CC-BY-SA-4.0 ([litagin/style_bert_vits2_jvnv](https://huggingface.co/litagin/style_bert_vits2_jvnv))
392
  - **Tsukuyomi-chan Speaker Model**: CC-BY-SA-4.0 — fine-tuned using [つくよみちゃんコーパス](https://tyc.rei-yumesaki.net/material/corpus/) Vol.1 (CV.夢前黎, © Rei Yumesaki)
393
+ - **Amitaro Speaker Models**: CC-BY-SA-4.0 — fine-tuned using ITA Corpus readings from [あみたろの声素材工房](https://amitaro.net/)
394
  - **Style-Bert-VITS2**: AGPL-3.0 ([litagin02/Style-Bert-VITS2](https://github.com/litagin02/Style-Bert-VITS2))
395
+
396
+ ### Additional Restrictions (applies to all speaker models)
397
+
398
+ - No use in age-restricted (adult/NSFW) content — 성인 제한 콘텐츠 사용 금지 / 年齢制限作品への使用禁止 / 禁止用于年龄限制内容
399
+ - No use in political, religious, or hate speech content — 정치/종교/혐오 콘텐츠 사용 금지 / 政治・宗教・ヘイト目的での使用禁止 / 禁止用于政治、宗教或仇恨言论内容
400
+ - No use for the purpose of criticizing or attacking others — 타인 비판/공격 목적 사용 금지 / 他者の批判・攻撃を目的とした使用禁止 / 禁止用于批评或攻击他人