{ "model": "ToneColorConverter_E2E.mlpackage", "inputs": { "y": "[1, 513, T] float32 — linear STFT magnitude (same layout as PyTorch OpenVoice)", "y_lengths": "[1] int32", "sid_src": "[1, 256, 1] float32 — source tone embedding", "sid_tgt": "[1, 256, 1] float32 — target tone embedding" }, "outputs": { "audio_out": "[1, 1, T_audio] float32" }, "notes": [ "tau=0 固定(後験からのサンプリングなし)。", "5 分割版と異なり中間 z を取り出せないが呼び出しは1回で済む。" ] }