Buckets:
| import"../chunks/DsnmJJEf.js";import{i as w,h as A,C as y,H as l,D as p,E as x,s as D}from"../chunks/BtE7mKSK.js";import{p as S,o as M,s as e,f as k,a as m,b as z,c as f,d as _,n as h,r as u}from"../chunks/jDjavuwI.js";const C='{"title":"AceStepTransformer1DModel","local":"acesteptransformer1dmodel","sections":[{"title":"AceStepTransformer1DModel","local":"diffusers.AceStepTransformer1DModel","sections":[],"depth":2}],"depth":1}';var O=_('<meta name="hf:doc:metadata"/>'),L=_(`<p></p> <!> <!> <p>A 1D Diffusion Transformer for music generation from <a href="https://github.com/ace-step/ACE-Step-1.5" rel="nofollow">ACE-Step 1.5</a>. The model operates on the 25 Hz stereo latents produced by <a href="/docs/diffusers/pr_14333/en/api/models/autoencoder_oobleck#diffusers.AutoencoderOobleck">AutoencoderOobleck</a> using flow matching, and is trained with a Qwen3-derived backbone (grouped-query attention, rotary position embedding, RMSNorm, AdaLN-Zero timestep conditioning) plus cross-attention to the text / lyric / timbre conditions built by <code>AceStepConditionEncoder</code>.</p> <!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>Diffusion Transformer for ACE-Step 1.5 music generation.</p> <p>Generates audio latents conditioned on text, lyrics, and timbre. Uses 1D patch embedding (<code>Conv1d</code> with stride <code>patch_size</code>) followed by a stack of <code>AceStepTransformerBlock</code>s with alternating sliding-window / full attention on | |
| the self-attention branch. Cross-attention consumes the packed <code>encoder_hidden_states</code> produced by <code>AceStepConditionEncoder</code>.</p> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>The <a href="/docs/diffusers/pr_14333/en/api/models/ace_step_transformer#diffusers.AceStepTransformer1DModel">AceStepTransformer1DModel</a> forward method.</p></div></div> <!> <p></p>`,1);function P(g,v){S(v,!1),M(()=>{new URLSearchParams(window.location.search).get("fw")}),w();var o=L();A("1454u5p",i=>{var c=O();D(c,"content",C),m(i,c)});var n=e(k(o),2);y(n,{containerStyle:"float: right; margin-left: 10px; display: inline-flex; position: relative; z-index: 10;"});var r=e(n,2);l(r,{title:"AceStepTransformer1DModel",local:"acesteptransformer1dmodel",headingTag:"h1"});var a=e(r,4);l(a,{title:"AceStepTransformer1DModel",local:"diffusers.AceStepTransformer1DModel",headingTag:"h2"});var t=e(a,2),s=f(t);p(s,{name:"class diffusers.AceStepTransformer1DModel",anchor:"diffusers.AceStepTransformer1DModel",source:"https://github.com/huggingface/diffusers/blob/vr_14333/src/diffusers/models/transformers/ace_step_transformer.py#L432",parameters:[{name:"hidden_size",val:": int = 2048"},{name:"intermediate_size",val:": int = 6144"},{name:"num_hidden_layers",val:": int = 24"},{name:"num_attention_heads",val:": int = 16"},{name:"num_key_value_heads",val:": int = 8"},{name:"head_dim",val:": int = 128"},{name:"in_channels",val:": int = 192"},{name:"audio_acoustic_hidden_dim",val:": int = 64"},{name:"patch_size",val:": int = 2"},{name:"rope_theta",val:": float = 1000000.0"},{name:"attention_bias",val:": bool = False"},{name:"attention_dropout",val:": float = 0.0"},{name:"rms_norm_eps",val:": float = 1e-06"},{name:"sliding_window",val:": int = 128"},{name:"layer_types",val:": typing.Optional[typing.List[str]] = None"},{name:"encoder_hidden_size",val:": typing.Optional[int] = None"},{name:"is_turbo",val:": bool = False"},{name:"model_version",val:": typing.Optional[str] = None"}]});var d=e(s,6),b=f(d);p(b,{name:"forward",anchor:"diffusers.AceStepTransformer1DModel.forward",source:"https://github.com/huggingface/diffusers/blob/vr_14333/src/diffusers/models/transformers/ace_step_transformer.py#L532",parameters:[{name:"hidden_states",val:": Tensor"},{name:"timestep",val:": Tensor"},{name:"timestep_r",val:": Tensor"},{name:"encoder_hidden_states",val:": Tensor"},{name:"context_latents",val:": Tensor"},{name:"attention_kwargs",val:": typing.Optional[dict] = None"},{name:"return_dict",val:": bool = True"}],parametersDescription:[{anchor:"diffusers.AceStepTransformer1DModel.forward.hidden_states",description:`<strong>hidden_states</strong> (<code>torch.Tensor</code> of shape <code>(batch_size, seq_len, channels)</code>) — | |
| Noisy latent input for the diffusion process.`,name:"hidden_states"},{anchor:"diffusers.AceStepTransformer1DModel.forward.timestep",description:`<strong>timestep</strong> (<code>torch.Tensor</code> of shape <code>(batch_size,)</code>) — | |
| Current diffusion timestep <code>t</code>.`,name:"timestep"},{anchor:"diffusers.AceStepTransformer1DModel.forward.timestep_r",description:`<strong>timestep_r</strong> (<code>torch.Tensor</code> of shape <code>(batch_size,)</code>) — | |
| Reference timestep <code>r</code> (set equal to <code>t</code> for standard inference).`,name:"timestep_r"},{anchor:"diffusers.AceStepTransformer1DModel.forward.encoder_hidden_states",description:`<strong>encoder_hidden_states</strong> (<code>torch.Tensor</code> of shape <code>(batch_size, encoder_seq_len, hidden_size)</code>) — | |
| Conditioning embeddings from the condition encoder (text + lyrics + timbre).`,name:"encoder_hidden_states"},{anchor:"diffusers.AceStepTransformer1DModel.forward.context_latents",description:`<strong>context_latents</strong> (<code>torch.Tensor</code> of shape <code>(batch_size, seq_len, context_dim)</code>) — | |
| Context latents (source latents concatenated with chunk masks) — fed to the patchify conv alongside | |
| <code>hidden_states</code>.`,name:"context_latents"},{anchor:"diffusers.AceStepTransformer1DModel.forward.attention_kwargs",description:`<strong>attention_kwargs</strong> (<code>dict</code>, <em>optional</em>) — | |
| A kwargs dictionary passed along to the <code>AttentionProcessor</code>. Used to pass the LoRA scale via | |
| <code>{"scale": float}</code>.`,name:"attention_kwargs"},{anchor:"diffusers.AceStepTransformer1DModel.forward.return_dict",description:`<strong>return_dict</strong> (<code>bool</code>, defaults to <code>True</code>) — | |
| Whether to return a <code>Transformer2DModelOutput</code> or a plain tuple.`,name:"return_dict"}],returnDescription:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p>The predicted velocity field.</p> | |
| `,returnType:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p><code>Transformer2DModelOutput</code> or <code>tuple</code></p> | |
| `}),h(2),u(d),u(t);var T=e(t,2);x(T,{source:"https://github.com/huggingface/diffusers/blob/main/docs/source/en/api/models/ace_step_transformer.md"}),h(2),m(g,o),z()}export{P as component}; | |
Xet Storage Details
- Size:
- 6.7 kB
- Xet hash:
- c65a81ceee2ce03e06880967c522adc2970edee3554732b6956734a5c5eded22
·
Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.