| { | |
| "model": "ToneColorConverter_E2E.mlpackage", | |
| "inputs": { | |
| "y": "[1, 513, T] float32 — linear STFT magnitude (same layout as PyTorch OpenVoice)", | |
| "y_lengths": "[1] int32", | |
| "sid_src": "[1, 256, 1] float32 — source tone embedding", | |
| "sid_tgt": "[1, 256, 1] float32 — target tone embedding" | |
| }, | |
| "outputs": { | |
| "audio_out": "[1, 1, T_audio] float32" | |
| }, | |
| "notes": [ | |
| "tau=0 固定(後験からのサンプリングなし)。", | |
| "5 分割版と異なり中間 z を取り出せないが呼び出しは1回で済む。" | |
| ] | |
| } |