Buckets:
| import"../chunks/DsnmJJEf.js";import{i as w,h as I,C as E,H as s,a as Z,D as t,E as x,s as U}from"../chunks/BtE7mKSK.js";import{p as R,o as W,s as e,f as j,a as y,b as z,c as a,d as b,n,r as d}from"../chunks/jDjavuwI.js";const G='{"title":"JoyImageEditTransformer3DModel","local":"joyimageedittransformer3dmodel","sections":[{"title":"JoyImageEditTransformer3DModel","local":"diffusers.JoyImageEditTransformer3DModel","sections":[],"depth":2},{"title":"Transformer2DModelOutput","local":"diffusers.models.modeling_outputs.Transformer2DModelOutput","sections":[],"depth":2}],"depth":1}';var C=b('<meta name="hf:doc:metadata"/>'),L=b('<p></p> <!> <!> <p>The model can be loaded with the following code snippet.</p> <!> <!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>JoyImage Transformer model for image generation / editing.</p> <p>Dual-stream DiT architecture with WAN-style conditioning embeddings and custom rotary position embeddings.</p> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>The <a href="/docs/diffusers/pr_13881/en/api/models/transformer_joyimage#diffusers.JoyImageEditTransformer3DModel">JoyImageEditTransformer3DModel</a> forward method.</p></div></div> <!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>The output of <a href="/docs/diffusers/pr_13881/en/api/models/transformer2d#diffusers.Transformer2DModel">Transformer2DModel</a>.</p></div> <!> <p></p>',1);function V(T,v){R(v,!1),W(()=>{new URLSearchParams(window.location.search).get("fw")}),w();var i=L();I("wnnoik",g=>{var _=C();U(_,"content",G),y(g,_)});var m=e(j(i),2);E(m,{containerStyle:"float: right; margin-left: 10px; display: inline-flex; position: relative; z-index: 10;"});var l=e(m,2);s(l,{title:"JoyImageEditTransformer3DModel",local:"joyimageedittransformer3dmodel",headingTag:"h1"});var f=e(l,4);Z(f,{code:"ZnJvbSUyMGRpZmZ1c2VycyUyMGltcG9ydCUyMEpveUltYWdlRWRpdFRyYW5zZm9ybWVyM0RNb2RlbCUwQSUwQXRyYW5zZm9ybWVyJTIwJTNEJTIwSm95SW1hZ2VFZGl0VHJhbnNmb3JtZXIzRE1vZGVsLmZyb21fcHJldHJhaW5lZCglMjJqZG9wZW5zb3VyY2UlMkZKb3lBSS1JbWFnZS1FZGl0LURpZmZ1c2VycyUyMiUyQyUyMHN1YmZvbGRlciUzRCUyMnRyYW5zZm9ybWVyJTIyJTJDJTIwdG9yY2hfZHR5cGUlM0R0b3JjaC5iZmxvYXQxNik=",highlighted:`<span class="hljs-keyword">from</span> diffusers <span class="hljs-keyword">import</span> JoyImageEditTransformer3DModel | |
| transformer = JoyImageEditTransformer3DModel.from_pretrained(<span class="hljs-string">"jdopensource/JoyAI-Image-Edit-Diffusers"</span>, subfolder=<span class="hljs-string">"transformer"</span>, torch_dtype=torch.bfloat16)`,lang:"python",wrap:!1});var c=e(f,2);s(c,{title:"JoyImageEditTransformer3DModel",local:"diffusers.JoyImageEditTransformer3DModel",headingTag:"h2"});var r=e(c,2),p=a(r);t(p,{name:"class diffusers.JoyImageEditTransformer3DModel",anchor:"diffusers.JoyImageEditTransformer3DModel",source:"https://github.com/huggingface/diffusers/blob/vr_13881/src/diffusers/models/transformers/transformer_joyimage.py#L372",parameters:[{name:"patch_size",val:": list = [1, 2, 2]"},{name:"in_channels",val:": int = 16"},{name:"out_channels",val:": int | None = None"},{name:"hidden_size",val:": int = 3072"},{name:"num_attention_heads",val:": int = 24"},{name:"text_dim",val:": int = 4096"},{name:"mlp_width_ratio",val:": float = 4.0"},{name:"num_layers",val:": int = 20"},{name:"rope_dim_list",val:": list = [16, 56, 56]"},{name:"rope_type",val:": str = 'rope'"},{name:"theta",val:": int = 256"}]});var u=e(p,6),M=a(u);t(M,{name:"forward",anchor:"diffusers.JoyImageEditTransformer3DModel.forward",source:"https://github.com/huggingface/diffusers/blob/vr_13881/src/diffusers/models/transformers/transformer_joyimage.py#L522",parameters:[{name:"hidden_states",val:": Tensor"},{name:"timestep",val:": Tensor"},{name:"encoder_hidden_states",val:": Tensor = None"},{name:"return_dict",val:": bool = True"}],parametersDescription:[{anchor:"diffusers.JoyImageEditTransformer3DModel.forward.hidden_states",description:`<strong>hidden_states</strong> (<code>torch.Tensor</code> of shape <code>(batch_size, num_channels, num_frames, height, width)</code> or <code>(batch_size, num_items, num_channels, num_frames, height, width)</code>) — | |
| Input <code>hidden_states</code>.`,name:"hidden_states"},{anchor:"diffusers.JoyImageEditTransformer3DModel.forward.timestep",description:`<strong>timestep</strong> (<code>torch.LongTensor</code>) — | |
| Used to indicate denoising step.`,name:"timestep"},{anchor:"diffusers.JoyImageEditTransformer3DModel.forward.encoder_hidden_states",description:`<strong>encoder_hidden_states</strong> (<code>torch.Tensor</code>, <em>optional</em>) — | |
| Conditional embeddings (embeddings computed from the input conditions such as prompts) to use.`,name:"encoder_hidden_states"},{anchor:"diffusers.JoyImageEditTransformer3DModel.forward.return_dict",description:`<strong>return_dict</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>True</code>) — | |
| Whether or not to return a <code>~models.transformer_2d.Transformer2DModelOutput</code> instead of a plain | |
| tuple.`,name:"return_dict"}]}),n(2),d(u),d(r);var h=e(r,2);s(h,{title:"Transformer2DModelOutput",local:"diffusers.models.modeling_outputs.Transformer2DModelOutput",headingTag:"h2"});var o=e(h,2),D=a(o);t(D,{name:"class diffusers.models.modeling_outputs.Transformer2DModelOutput",anchor:"diffusers.models.modeling_outputs.Transformer2DModelOutput",source:"https://github.com/huggingface/diffusers/blob/vr_13881/src/diffusers/models/modeling_outputs.py#L21",parameters:[{name:"sample",val:": torch.Tensor"}],parametersDescription:[{anchor:"diffusers.models.modeling_outputs.Transformer2DModelOutput.sample",description:`<strong>sample</strong> (<code>torch.Tensor</code> of shape <code>(batch_size, num_channels, height, width)</code> or <code>(batch size, num_vector_embeds - 1, num_latent_pixels)</code> if <a href="/docs/diffusers/pr_13881/en/api/models/transformer2d#diffusers.Transformer2DModel">Transformer2DModel</a> is discrete) — | |
| The hidden states output conditioned on the <code>encoder_hidden_states</code> input. If discrete, returns probability | |
| distributions for the unnoised latent pixels.`,name:"sample"}]}),n(2),d(o);var J=e(o,2);x(J,{source:"https://github.com/huggingface/diffusers/blob/main/docs/source/en/api/models/transformer_joyimage.md"}),n(2),y(T,i),z()}export{V as component}; | |
Xet Storage Details
- Size:
- 6.48 kB
- Xet hash:
- 0fb1b312a6ca70b6deb99588ecbd64464dd50fa9c687cc7c0fbf382ee3f0d7dc
·
Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.