Buckets:

download
raw
8.21 kB
import"../chunks/DsnmJJEf.js";import{i as A,h as x,C as k,H as t,a as U,D as a,E as O,s as Z}from"../chunks/BtE7mKSK.js";import{p as j,o as C,s as e,f as E,a as v,b as F,c as n,d as T,n as s,r as d}from"../chunks/jDjavuwI.js";const G='{"title":"AllegroTransformer3DModel","local":"allegrotransformer3dmodel","sections":[{"title":"AllegroTransformer3DModel","local":"diffusers.AllegroTransformer3DModel","sections":[],"depth":2},{"title":"Transformer2DModelOutput","local":"diffusers.models.modeling_outputs.Transformer2DModelOutput","sections":[],"depth":2}],"depth":1}';var L=T('<meta name="hf:doc:metadata"/>'),z=T('<p></p> <!> <!> <p>A Diffusion Transformer model for 3D data from <a href="https://github.com/rhymes-ai/Allegro" rel="nofollow">Allegro</a> was introduced in <a href="https://huggingface.co/papers/2410.15458" rel="nofollow">Allegro: Open the Black Box of Commercial-Level Video Generation Model</a> by RhymesAI.</p> <p>The model can be loaded with the following code snippet.</p> <!> <!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>The <a href="/docs/diffusers/pr_14261/en/api/models/allegro_transformer3d#diffusers.AllegroTransformer3DModel">AllegroTransformer3DModel</a> forward method.</p></div></div> <!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>The output of <a href="/docs/diffusers/pr_14261/en/api/models/transformer2d#diffusers.Transformer2DModel">Transformer2DModel</a>.</p></div> <!> <p></p>',1);function q(b,M){j(M,!1),C(()=>{new URLSearchParams(window.location.search).get("fw")}),A();var l=z();x("bvhhk8",_=>{var g=L();Z(g,"content",G),v(_,g)});var i=e(E(l),2);k(i,{containerStyle:"float: right; margin-left: 10px; display: inline-flex; position: relative; z-index: 10;"});var m=e(i,2);t(m,{title:"AllegroTransformer3DModel",local:"allegrotransformer3dmodel",headingTag:"h1"});var c=e(m,6);U(c,{code:"ZnJvbSUyMGRpZmZ1c2VycyUyMGltcG9ydCUyMEFsbGVncm9UcmFuc2Zvcm1lcjNETW9kZWwlMEElMEF0cmFuc2Zvcm1lciUyMCUzRCUyMEFsbGVncm9UcmFuc2Zvcm1lcjNETW9kZWwuZnJvbV9wcmV0cmFpbmVkKCUyMnJoeW1lcy1haSUyRkFsbGVncm8lMjIlMkMlMjBzdWJmb2xkZXIlM0QlMjJ0cmFuc2Zvcm1lciUyMiUyQyUyMHRvcmNoX2R0eXBlJTNEdG9yY2guYmZsb2F0MTYpLnRvKCUyMmN1ZGElMjIp",highlighted:`<span class="hljs-keyword">from</span> diffusers <span class="hljs-keyword">import</span> AllegroTransformer3DModel
transformer = AllegroTransformer3DModel.from_pretrained(<span class="hljs-string">&quot;rhymes-ai/Allegro&quot;</span>, subfolder=<span class="hljs-string">&quot;transformer&quot;</span>, torch_dtype=torch.bfloat16).to(<span class="hljs-string">&quot;cuda&quot;</span>)`,lang:"python",wrap:!1});var f=e(c,2);t(f,{title:"AllegroTransformer3DModel",local:"diffusers.AllegroTransformer3DModel",headingTag:"h2"});var o=e(f,2),p=n(o);a(p,{name:"class diffusers.AllegroTransformer3DModel",anchor:"diffusers.AllegroTransformer3DModel",source:"https://github.com/huggingface/diffusers/blob/vr_14261/src/diffusers/models/transformers/transformer_allegro.py#L174",parameters:[{name:"patch_size",val:": int = 2"},{name:"patch_size_t",val:": int = 1"},{name:"num_attention_heads",val:": int = 24"},{name:"attention_head_dim",val:": int = 96"},{name:"in_channels",val:": int = 4"},{name:"out_channels",val:": int = 4"},{name:"num_layers",val:": int = 32"},{name:"dropout",val:": float = 0.0"},{name:"cross_attention_dim",val:": int = 2304"},{name:"attention_bias",val:": bool = True"},{name:"sample_height",val:": int = 90"},{name:"sample_width",val:": int = 160"},{name:"sample_frames",val:": int = 22"},{name:"activation_fn",val:": str = 'gelu-approximate'"},{name:"norm_elementwise_affine",val:": bool = False"},{name:"norm_eps",val:": float = 1e-06"},{name:"caption_channels",val:": int = 4096"},{name:"interpolation_scale_h",val:": float = 2.0"},{name:"interpolation_scale_w",val:": float = 2.0"},{name:"interpolation_scale_t",val:": float = 2.2"}]});var u=e(p,2),y=n(u);a(y,{name:"forward",anchor:"diffusers.AllegroTransformer3DModel.forward",source:"https://github.com/huggingface/diffusers/blob/vr_14261/src/diffusers/models/transformers/transformer_allegro.py#L305",parameters:[{name:"hidden_states",val:": Tensor"},{name:"encoder_hidden_states",val:": Tensor"},{name:"timestep",val:": LongTensor"},{name:"attention_mask",val:": typing.Optional[torch.Tensor] = None"},{name:"encoder_attention_mask",val:": typing.Optional[torch.Tensor] = None"},{name:"image_rotary_emb",val:": tuple[torch.Tensor, torch.Tensor] | None = None"},{name:"return_dict",val:": bool = True"}],parametersDescription:[{anchor:"diffusers.AllegroTransformer3DModel.forward.hidden_states",description:`<strong>hidden_states</strong> (<code>torch.Tensor</code> of shape <code>(batch_size, num_channels, num_frames, height, width)</code>) &#x2014;
Input <code>hidden_states</code>.`,name:"hidden_states"},{anchor:"diffusers.AllegroTransformer3DModel.forward.encoder_hidden_states",description:`<strong>encoder_hidden_states</strong> (<code>torch.Tensor</code> of shape <code>(batch_size, sequence_len, embed_dims)</code>) &#x2014;
Conditional embeddings (embeddings computed from the input conditions such as prompts) to use.`,name:"encoder_hidden_states"},{anchor:"diffusers.AllegroTransformer3DModel.forward.timestep",description:`<strong>timestep</strong> (<code>torch.LongTensor</code>) &#x2014;
Used to indicate denoising step.`,name:"timestep"},{anchor:"diffusers.AllegroTransformer3DModel.forward.attention_mask",description:`<strong>attention_mask</strong> (<code>torch.Tensor</code>, <em>optional</em>) &#x2014;
Self-attention mask applied to <code>hidden_states</code>.`,name:"attention_mask"},{anchor:"diffusers.AllegroTransformer3DModel.forward.encoder_attention_mask",description:`<strong>encoder_attention_mask</strong> (<code>torch.Tensor</code>, <em>optional</em>) &#x2014;
Cross-attention mask applied to <code>encoder_hidden_states</code>.`,name:"encoder_attention_mask"},{anchor:"diffusers.AllegroTransformer3DModel.forward.image_rotary_emb",description:`<strong>image_rotary_emb</strong> (<code>tuple</code> of <code>torch.Tensor</code>, <em>optional</em>) &#x2014;
Pre-computed rotary positional embeddings.`,name:"image_rotary_emb"},{anchor:"diffusers.AllegroTransformer3DModel.forward.return_dict",description:`<strong>return_dict</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>True</code>) &#x2014;
Whether or not to return a <code>~models.transformer_2d.Transformer2DModelOutput</code> instead of a plain
tuple.`,name:"return_dict"}],returnDescription:`<script context="module">export const metadata = 'undefined';<\/script>
<p>If <code>return_dict</code> is True, an <code>~models.transformer_2d.Transformer2DModelOutput</code> is returned, otherwise a
<code>tuple</code> where the first element is the sample tensor.</p>
`}),s(2),d(u),d(o);var h=e(o,2);t(h,{title:"Transformer2DModelOutput",local:"diffusers.models.modeling_outputs.Transformer2DModelOutput",headingTag:"h2"});var r=e(h,2),D=n(r);a(D,{name:"class diffusers.models.modeling_outputs.Transformer2DModelOutput",anchor:"diffusers.models.modeling_outputs.Transformer2DModelOutput",source:"https://github.com/huggingface/diffusers/blob/vr_14261/src/diffusers/models/modeling_outputs.py#L21",parameters:[{name:"sample",val:": torch.Tensor"}],parametersDescription:[{anchor:"diffusers.models.modeling_outputs.Transformer2DModelOutput.sample",description:`<strong>sample</strong> (<code>torch.Tensor</code> of shape <code>(batch_size, num_channels, height, width)</code> or <code>(batch size, num_vector_embeds - 1, num_latent_pixels)</code> if <a href="/docs/diffusers/pr_14261/en/api/models/transformer2d#diffusers.Transformer2DModel">Transformer2DModel</a> is discrete) &#x2014;
The hidden states output conditioned on the <code>encoder_hidden_states</code> input. If discrete, returns probability
distributions for the unnoised latent pixels.`,name:"sample"}]}),s(2),d(r);var w=e(r,2);O(w,{source:"https://github.com/huggingface/diffusers/blob/main/docs/source/en/api/models/allegro_transformer3d.md"}),s(2),v(b,l),F()}export{q as component};

Xet Storage Details

Size:
8.21 kB
·
Xet hash:
61626d47b0f7d16e7447c1121d9e0bedc86c7b80d712c86a8bcaea0f57d69ca6

Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.