docs: あみたろ 6종 화자 정보 및 전체 모델 추가 제한 조건 추가 (4개국어)
Browse files
README.md
CHANGED
|
@@ -35,14 +35,15 @@ pytorch/
|
|
| 35 |
├── jvnv-F2-jp/
|
| 36 |
├── jvnv-M1-jp/
|
| 37 |
├── jvnv-M2-jp/
|
| 38 |
-
|
|
|
|
| 39 |
|
| 40 |
onnx/
|
| 41 |
├── bert/ # ONNX 변환 BERT
|
| 42 |
│ ├── fp32/ # FP32 ONNX (1.2GB)
|
| 43 |
│ └── q8/ # INT8 양자화 (498MB)
|
| 44 |
└── speakers/ # ONNX 변환 Synthesizer
|
| 45 |
-
└──
|
| 46 |
├── synthesizer.onnx # FP32 (239MB)
|
| 47 |
└── synthesizer_q8.onnx # INT8 (239MB)
|
| 48 |
```
|
|
@@ -89,6 +90,21 @@ Synthesizer(VITS)의 Flow 레이어에 포함된 `rational_quadratic_spline` 함
|
|
| 89 |
> 본 모델의 음성합성에는 つくよみちゃん(© Rei Yumesaki)의 무료 공개 캐릭터 음성 데이터를 사용하고 있습니다.
|
| 90 |
> つくよみちゃんコーパス(CV.夢前黎) https://tyc.rei-yumesaki.net/material/corpus/
|
| 91 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 92 |
---
|
| 93 |
|
| 94 |
## EN | English
|
|
@@ -110,14 +126,15 @@ pytorch/
|
|
| 110 |
│ └── q8/ # INT8 dynamic quantization (413MB) — reduces CPU RAM
|
| 111 |
└── speakers/ # Speaker models (safetensors)
|
| 112 |
├── jvnv-*/
|
| 113 |
-
|
|
|
|
| 114 |
|
| 115 |
onnx/
|
| 116 |
├── bert/ # ONNX-converted BERT
|
| 117 |
│ ├── fp32/ # FP32 ONNX (1.2GB)
|
| 118 |
│ └── q8/ # INT8 quantized (498MB)
|
| 119 |
└── speakers/ # ONNX-converted Synthesizer
|
| 120 |
-
└──
|
| 121 |
├── synthesizer.onnx # FP32 (239MB)
|
| 122 |
└── synthesizer_q8.onnx # INT8 (239MB)
|
| 123 |
```
|
|
@@ -164,6 +181,21 @@ Fine-tuned speaker model based on [Tsukuyomi-chan Corpus](https://tyc.rei-yumesa
|
|
| 164 |
> This model uses the free character voice data of つくよみちゃん (© Rei Yumesaki) for speech synthesis.
|
| 165 |
> つくよみちゃんコーパス (CV.夢前黎) https://tyc.rei-yumesaki.net/material/corpus/
|
| 166 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 167 |
---
|
| 168 |
|
| 169 |
## JP | 日本語
|
|
@@ -185,14 +217,15 @@ pytorch/
|
|
| 185 |
│ └── q8/ # INT8動的量子化 (413MB) — CPUメモリ削減用
|
| 186 |
└── speakers/ # 話者モデル (safetensors)
|
| 187 |
├── jvnv-*/
|
| 188 |
-
|
|
|
|
| 189 |
|
| 190 |
onnx/
|
| 191 |
├── bert/ # ONNX変換BERT
|
| 192 |
│ ├── fp32/ # FP32 ONNX (1.2GB)
|
| 193 |
│ └── q8/ # INT8量子化 (498MB)
|
| 194 |
└── speakers/ # ONNX変換Synthesizer
|
| 195 |
-
└──
|
| 196 |
├── synthesizer.onnx # FP32 (239MB)
|
| 197 |
└── synthesizer_q8.onnx # INT8 (239MB)
|
| 198 |
```
|
|
@@ -239,6 +272,21 @@ VITSのFlowレイヤーに含まれる`rational_quadratic_spline`関数が半精
|
|
| 239 |
> 本ソフトウェアの音声合成にはつくよみちゃん(© Rei Yumesaki)の無料公開キャラクター音声データを使用しています。
|
| 240 |
> つくよみちゃんコーパス(CV.夢前黎) https://tyc.rei-yumesaki.net/material/corpus/
|
| 241 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 242 |
---
|
| 243 |
|
| 244 |
## ZH | 中文
|
|
@@ -260,14 +308,15 @@ pytorch/
|
|
| 260 |
│ └── q8/ # INT8动态量化 (413MB) — 减少CPU内存
|
| 261 |
└── speakers/ # 说话人模型 (safetensors)
|
| 262 |
├── jvnv-*/
|
| 263 |
-
|
|
|
|
| 264 |
|
| 265 |
onnx/
|
| 266 |
├── bert/ # ONNX转换BERT
|
| 267 |
│ ├── fp32/ # FP32 ONNX (1.2GB)
|
| 268 |
│ └── q8/ # INT8量化 (498MB)
|
| 269 |
└── speakers/ # ONNX转换Synthesizer
|
| 270 |
-
└──
|
| 271 |
├── synthesizer.onnx # FP32 (239MB)
|
| 272 |
└── synthesizer_q8.onnx # INT8 (239MB)
|
| 273 |
```
|
|
@@ -314,6 +363,21 @@ VITS Flow层中的`rational_quadratic_spline`函数在半精度(FP16)下会触
|
|
| 314 |
> 本模型的语音合成使用了つくよみちゃん(© Rei Yumesaki)的免费公开角色语音数据。
|
| 315 |
> つくよみちゃんコーパス(CV.夢前黎) https://tyc.rei-yumesaki.net/material/corpus/
|
| 316 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 317 |
---
|
| 318 |
|
| 319 |
## License
|
|
@@ -326,4 +390,11 @@ VITS Flow层中的`rational_quadratic_spline`函数在半精度(FP16)下会触
|
|
| 326 |
- **BERT (DeBERTa v2)**: CC-BY-SA-4.0 ([ku-nlp/deberta-v2-large-japanese-char-wwm](https://huggingface.co/ku-nlp/deberta-v2-large-japanese-char-wwm))
|
| 327 |
- **JVNV Speaker Models**: CC-BY-SA-4.0 ([litagin/style_bert_vits2_jvnv](https://huggingface.co/litagin/style_bert_vits2_jvnv))
|
| 328 |
- **Tsukuyomi-chan Speaker Model**: CC-BY-SA-4.0 — fine-tuned using [つくよみちゃんコーパス](https://tyc.rei-yumesaki.net/material/corpus/) Vol.1 (CV.夢前黎, © Rei Yumesaki)
|
|
|
|
| 329 |
- **Style-Bert-VITS2**: AGPL-3.0 ([litagin02/Style-Bert-VITS2](https://github.com/litagin02/Style-Bert-VITS2))
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 35 |
├── jvnv-F2-jp/
|
| 36 |
├── jvnv-M1-jp/
|
| 37 |
├── jvnv-M2-jp/
|
| 38 |
+
├── tsukuyomi_chan/
|
| 39 |
+
└── amitaro_*/
|
| 40 |
|
| 41 |
onnx/
|
| 42 |
├── bert/ # ONNX 변환 BERT
|
| 43 |
│ ├── fp32/ # FP32 ONNX (1.2GB)
|
| 44 |
│ └── q8/ # INT8 양자화 (498MB)
|
| 45 |
└── speakers/ # ONNX 변환 Synthesizer
|
| 46 |
+
└── */
|
| 47 |
├── synthesizer.onnx # FP32 (239MB)
|
| 48 |
└── synthesizer_q8.onnx # INT8 (239MB)
|
| 49 |
```
|
|
|
|
| 90 |
> 본 모델의 음성합성에는 つくよみちゃん(© Rei Yumesaki)의 무료 공개 캐릭터 음성 데이터를 사용하고 있습니다.
|
| 91 |
> つくよみちゃんコーパス(CV.夢前黎) https://tyc.rei-yumesaki.net/material/corpus/
|
| 92 |
|
| 93 |
+
#### あみたろ (Amitaro)
|
| 94 |
+
|
| 95 |
+
[あみたろの声素材工房](https://amitaro.net/) ITAコーパス読み上げ음성 기반 파인튜닝 화자 모델입니다. 동일 화자의 6가지 스타일을 독립 모델로 제공합니다.
|
| 96 |
+
|
| 97 |
+
| 화자 | 스타일 | 설명 |
|
| 98 |
+
|------|--------|------|
|
| 99 |
+
| amitaro_normal | ノーマル | 정확한 발음, TTS 최적화 |
|
| 100 |
+
| amitaro_runrun | るんるん | 자연스럽고 친근한 톤 |
|
| 101 |
+
| amitaro_yofukashi | よふかし | 차분한 라디오풍 |
|
| 102 |
+
| amitaro_punsuka | ぷんすか | 귀여운 화난 목소리 |
|
| 103 |
+
| amitaro_sasayaki_a | ささやきA | 강한 속삭임 |
|
| 104 |
+
| amitaro_sasayaki_b | ささやきB | 약한 속삭임 |
|
| 105 |
+
|
| 106 |
+
> 본 모델의 음성합성에는 あみたろの声素材工房(https://amitaro.net/)의 ITAコーパス読み上げ음성을 사용하고 있습니다.
|
| 107 |
+
|
| 108 |
---
|
| 109 |
|
| 110 |
## EN | English
|
|
|
|
| 126 |
│ └── q8/ # INT8 dynamic quantization (413MB) — reduces CPU RAM
|
| 127 |
└── speakers/ # Speaker models (safetensors)
|
| 128 |
├── jvnv-*/
|
| 129 |
+
├── tsukuyomi_chan/
|
| 130 |
+
└── amitaro_*/
|
| 131 |
|
| 132 |
onnx/
|
| 133 |
├── bert/ # ONNX-converted BERT
|
| 134 |
│ ├── fp32/ # FP32 ONNX (1.2GB)
|
| 135 |
│ └── q8/ # INT8 quantized (498MB)
|
| 136 |
└── speakers/ # ONNX-converted Synthesizer
|
| 137 |
+
└── */
|
| 138 |
├── synthesizer.onnx # FP32 (239MB)
|
| 139 |
└── synthesizer_q8.onnx # INT8 (239MB)
|
| 140 |
```
|
|
|
|
| 181 |
> This model uses the free character voice data of つくよみちゃん (© Rei Yumesaki) for speech synthesis.
|
| 182 |
> つくよみちゃんコーパス (CV.夢前黎) https://tyc.rei-yumesaki.net/material/corpus/
|
| 183 |
|
| 184 |
+
#### Amitaro (あみたろ)
|
| 185 |
+
|
| 186 |
+
Fine-tuned speaker models based on [あみたろの声素材工房](https://amitaro.net/) ITA Corpus readings. Six styles from the same speaker, provided as independent models.
|
| 187 |
+
|
| 188 |
+
| Speaker | Style | Description |
|
| 189 |
+
|---------|-------|-------------|
|
| 190 |
+
| amitaro_normal | ノーマル | Clear pronunciation, TTS-optimized |
|
| 191 |
+
| amitaro_runrun | るんるん | Natural, friendly tone |
|
| 192 |
+
| amitaro_yofukashi | よふかし | Calm, radio-style |
|
| 193 |
+
| amitaro_punsuka | ぷんすか | Cute angry voice |
|
| 194 |
+
| amitaro_sasayaki_a | ささやきA | Strong whisper |
|
| 195 |
+
| amitaro_sasayaki_b | ささやきB | Soft whisper |
|
| 196 |
+
|
| 197 |
+
> This model uses ITA Corpus reading voice data from あみたろの声素材工房 (https://amitaro.net/) for speech synthesis.
|
| 198 |
+
|
| 199 |
---
|
| 200 |
|
| 201 |
## JP | 日本語
|
|
|
|
| 217 |
│ └── q8/ # INT8動的量子化 (413MB) — CPUメモリ削減用
|
| 218 |
└── speakers/ # 話者モデル (safetensors)
|
| 219 |
├── jvnv-*/
|
| 220 |
+
├── tsukuyomi_chan/
|
| 221 |
+
└── amitaro_*/
|
| 222 |
|
| 223 |
onnx/
|
| 224 |
├── bert/ # ONNX変換BERT
|
| 225 |
│ ├── fp32/ # FP32 ONNX (1.2GB)
|
| 226 |
│ └── q8/ # INT8量子化 (498MB)
|
| 227 |
└── speakers/ # ONNX変換Synthesizer
|
| 228 |
+
└── */
|
| 229 |
├── synthesizer.onnx # FP32 (239MB)
|
| 230 |
└── synthesizer_q8.onnx # INT8 (239MB)
|
| 231 |
```
|
|
|
|
| 272 |
> 本ソフトウェアの音声合成にはつくよみちゃん(© Rei Yumesaki)の無料公開キャラクター音声データを使用しています。
|
| 273 |
> つくよみちゃんコーパス(CV.夢前黎) https://tyc.rei-yumesaki.net/material/corpus/
|
| 274 |
|
| 275 |
+
#### あみたろ (Amitaro)
|
| 276 |
+
|
| 277 |
+
[あみたろの声素材工房](https://amitaro.net/) ITAコーパス読み上げ音声をベースにファインチューニングした話者モデルです。同一話者の6つのスタイルを独立モデルとして提供します。
|
| 278 |
+
|
| 279 |
+
| 話者 | スタイル | 説明 |
|
| 280 |
+
|------|----------|------|
|
| 281 |
+
| amitaro_normal | ノーマル | 正確な発音、音声合成に最適化 |
|
| 282 |
+
| amitaro_runrun | るんるん | 自然で親しみやすいトーン |
|
| 283 |
+
| amitaro_yofukashi | よふかし | 落ち着いたラジオ風 |
|
| 284 |
+
| amitaro_punsuka | ぷんすか | かわいい怒り声 |
|
| 285 |
+
| amitaro_sasayaki_a | ささやきA | 強めのささやき |
|
| 286 |
+
| amitaro_sasayaki_b | ささやきB | 弱めのささやき |
|
| 287 |
+
|
| 288 |
+
> 本ソフトウェアの音声合成にはあみたろの声素材工房(https://amitaro.net/)のITAコーパス読み上げ音声を使用しています。
|
| 289 |
+
|
| 290 |
---
|
| 291 |
|
| 292 |
## ZH | 中文
|
|
|
|
| 308 |
│ └── q8/ # INT8动态量化 (413MB) — 减少CPU内存
|
| 309 |
└── speakers/ # 说话人模型 (safetensors)
|
| 310 |
├── jvnv-*/
|
| 311 |
+
├── tsukuyomi_chan/
|
| 312 |
+
└── amitaro_*/
|
| 313 |
|
| 314 |
onnx/
|
| 315 |
├── bert/ # ONNX转换BERT
|
| 316 |
│ ├── fp32/ # FP32 ONNX (1.2GB)
|
| 317 |
│ └── q8/ # INT8量化 (498MB)
|
| 318 |
└── speakers/ # ONNX转换Synthesizer
|
| 319 |
+
└── */
|
| 320 |
├── synthesizer.onnx # FP32 (239MB)
|
| 321 |
└── synthesizer_q8.onnx # INT8 (239MB)
|
| 322 |
```
|
|
|
|
| 363 |
> 本模型的语音合成使用了つくよみちゃん(© Rei Yumesaki)的免费公开角色语音数据。
|
| 364 |
> つくよみちゃんコーパス(CV.夢前黎) https://tyc.rei-yumesaki.net/material/corpus/
|
| 365 |
|
| 366 |
+
#### あみたろ (Amitaro)
|
| 367 |
+
|
| 368 |
+
基于[あみたろの声素材工房](https://amitaro.net/) ITA语料库朗读语音微调的说话人模型。同一说话人的6种风格作为独立模型提供。
|
| 369 |
+
|
| 370 |
+
| 说话人 | 风格 | 说明 |
|
| 371 |
+
|--------|------|------|
|
| 372 |
+
| amitaro_normal | ノーマル | 准确发音,TTS优化 |
|
| 373 |
+
| amitaro_runrun | るんるん | 自然亲切的语调 |
|
| 374 |
+
| amitaro_yofukashi | よふかし | 沉稳的广播风格 |
|
| 375 |
+
| amitaro_punsuka | ぷんすか | 可爱的生气声音 |
|
| 376 |
+
| amitaro_sasayaki_a | ささやきA | 较强的耳语 |
|
| 377 |
+
| amitaro_sasayaki_b | ささやきB | 较弱的耳语 |
|
| 378 |
+
|
| 379 |
+
> 本模型的语音合成使用了あみたろの声素材工房(https://amitaro.net/)的ITA语料库朗读语音数据。
|
| 380 |
+
|
| 381 |
---
|
| 382 |
|
| 383 |
## License
|
|
|
|
| 390 |
- **BERT (DeBERTa v2)**: CC-BY-SA-4.0 ([ku-nlp/deberta-v2-large-japanese-char-wwm](https://huggingface.co/ku-nlp/deberta-v2-large-japanese-char-wwm))
|
| 391 |
- **JVNV Speaker Models**: CC-BY-SA-4.0 ([litagin/style_bert_vits2_jvnv](https://huggingface.co/litagin/style_bert_vits2_jvnv))
|
| 392 |
- **Tsukuyomi-chan Speaker Model**: CC-BY-SA-4.0 — fine-tuned using [つくよみちゃんコーパス](https://tyc.rei-yumesaki.net/material/corpus/) Vol.1 (CV.夢前黎, © Rei Yumesaki)
|
| 393 |
+
- **Amitaro Speaker Models**: CC-BY-SA-4.0 — fine-tuned using ITA Corpus readings from [あみたろの声素材工房](https://amitaro.net/)
|
| 394 |
- **Style-Bert-VITS2**: AGPL-3.0 ([litagin02/Style-Bert-VITS2](https://github.com/litagin02/Style-Bert-VITS2))
|
| 395 |
+
|
| 396 |
+
### Additional Restrictions (applies to all speaker models)
|
| 397 |
+
|
| 398 |
+
- No use in age-restricted (adult/NSFW) content — 성인 제한 콘텐츠 사용 금지 / 年齢制限作品への使用禁止 / 禁止用于年龄限制内容
|
| 399 |
+
- No use in political, religious, or hate speech content — 정치/종교/혐오 콘텐츠 사용 금지 / 政治・宗教・ヘイト目的での使用禁止 / 禁止用于政治、宗教或仇恨言论内容
|
| 400 |
+
- No use for the purpose of criticizing or attacking others — 타인 비판/공격 목적 사용 금지 / 他者の批判・攻撃を目的とした使用禁止 / 禁止用于批评或攻击他人
|