Buckets:
| import"../chunks/DsnmJJEf.js";import{i as U,h as x,C as k,H as o,a as M,D as s,E as R,s as Z}from"../chunks/CmJXCtRL.js";import{p as G,o as W,s as e,f as z,a as D,b as N,c as n,d as y,n as t,r as d}from"../chunks/DK803DsY.js";const C='{"title":"HiDreamImageTransformer2DModel","local":"hidreamimagetransformer2dmodel","sections":[{"title":"Loading GGUF quantized checkpoints for HiDream-I1","local":"loading-gguf-quantized-checkpoints-for-hidream-i1","sections":[],"depth":2},{"title":"HiDreamImageTransformer2DModel","local":"diffusers.HiDreamImageTransformer2DModel","sections":[],"depth":2},{"title":"Transformer2DModelOutput","local":"diffusers.models.modeling_outputs.Transformer2DModelOutput","sections":[],"depth":2}],"depth":1}';var F=y('<meta name="hf:doc:metadata"/>'),j=y('<p></p> <!> <!> <p>A Transformer model for image-like data from <a href="https://huggingface.co/HiDream-ai" rel="nofollow">HiDream-I1</a>.</p> <p>The model can be loaded with the following code snippet.</p> <!> <!> <p>GGUF checkpoints for the <code>HiDreamImageTransformer2DModel</code> can be loaded using <code>~FromOriginalModelMixin.from_single_file</code></p> <!> <!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>The <a href="/docs/diffusers/pr_14204/en/api/models/hidream_image_transformer#diffusers.HiDreamImageTransformer2DModel">HiDreamImageTransformer2DModel</a> forward method.</p></div></div> <!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>The output of <a href="/docs/diffusers/pr_14204/en/api/models/transformer2d#diffusers.Transformer2DModel">Transformer2DModel</a>.</p></div> <!> <p></p>',1);function E(v,w){G(w,!1),W(()=>{new URLSearchParams(window.location.search).get("fw")}),U();var i=j();x("jb5z79",b=>{var T=F();Z(T,"content",C),D(b,T)});var m=e(z(i),2);k(m,{containerStyle:"float: right; margin-left: 10px; display: inline-flex; position: relative; z-index: 10;"});var l=e(m,2);o(l,{title:"HiDreamImageTransformer2DModel",local:"hidreamimagetransformer2dmodel",headingTag:"h1"});var c=e(l,6);M(c,{code:"ZnJvbSUyMGRpZmZ1c2VycyUyMGltcG9ydCUyMEhpRHJlYW1JbWFnZVRyYW5zZm9ybWVyMkRNb2RlbCUwQSUwQXRyYW5zZm9ybWVyJTIwJTNEJTIwSGlEcmVhbUltYWdlVHJhbnNmb3JtZXIyRE1vZGVsLmZyb21fcHJldHJhaW5lZCglMjJIaURyZWFtLWFpJTJGSGlEcmVhbS1JMS1GdWxsJTIyJTJDJTIwc3ViZm9sZGVyJTNEJTIydHJhbnNmb3JtZXIlMjIlMkMlMjB0b3JjaF9kdHlwZSUzRHRvcmNoLmJmbG9hdDE2KQ==",highlighted:`<span class="hljs-keyword">from</span> diffusers <span class="hljs-keyword">import</span> HiDreamImageTransformer2DModel | |
| transformer = HiDreamImageTransformer2DModel.from_pretrained(<span class="hljs-string">"HiDream-ai/HiDream-I1-Full"</span>, subfolder=<span class="hljs-string">"transformer"</span>, torch_dtype=torch.bfloat16)`,lang:"python",wrap:!1});var f=e(c,2);o(f,{title:"Loading GGUF quantized checkpoints for HiDream-I1",local:"loading-gguf-quantized-checkpoints-for-hidream-i1",headingTag:"h2"});var p=e(f,4);M(p,{code:"aW1wb3J0JTIwdG9yY2glMEFmcm9tJTIwZGlmZnVzZXJzJTIwaW1wb3J0JTIwR0dVRlF1YW50aXphdGlvbkNvbmZpZyUyQyUyMEhpRHJlYW1JbWFnZVRyYW5zZm9ybWVyMkRNb2RlbCUwQSUwQWNrcHRfcGF0aCUyMCUzRCUyMCUyMmh0dHBzJTNBJTJGJTJGaHVnZ2luZ2ZhY2UuY28lMkZjaXR5OTYlMkZIaURyZWFtLUkxLURldi1nZ3VmJTJGYmxvYiUyRm1haW4lMkZoaWRyZWFtLWkxLWRldi1RMl9LLmdndWYlMjIlMEF0cmFuc2Zvcm1lciUyMCUzRCUyMEhpRHJlYW1JbWFnZVRyYW5zZm9ybWVyMkRNb2RlbC5mcm9tX3NpbmdsZV9maWxlKCUwQSUyMCUyMCUyMCUyMGNrcHRfcGF0aCUyQyUwQSUyMCUyMCUyMCUyMHF1YW50aXphdGlvbl9jb25maWclM0RHR1VGUXVhbnRpemF0aW9uQ29uZmlnKGNvbXB1dGVfZHR5cGUlM0R0b3JjaC5iZmxvYXQxNiklMkMlMEElMjAlMjAlMjAlMjB0b3JjaF9kdHlwZSUzRHRvcmNoLmJmbG9hdDE2JTBBKQ==",highlighted:`<span class="hljs-keyword">import</span> torch | |
| <span class="hljs-keyword">from</span> diffusers <span class="hljs-keyword">import</span> GGUFQuantizationConfig, HiDreamImageTransformer2DModel | |
| ckpt_path = <span class="hljs-string">"https://huggingface.co/city96/HiDream-I1-Dev-gguf/blob/main/hidream-i1-dev-Q2_K.gguf"</span> | |
| transformer = HiDreamImageTransformer2DModel.from_single_file( | |
| ckpt_path, | |
| quantization_config=GGUFQuantizationConfig(compute_dtype=torch.bfloat16), | |
| torch_dtype=torch.bfloat16 | |
| )`,lang:"python",wrap:!1});var h=e(p,2);o(h,{title:"HiDreamImageTransformer2DModel",local:"diffusers.HiDreamImageTransformer2DModel",headingTag:"h2"});var r=e(h,2),u=n(r);s(u,{name:"class diffusers.HiDreamImageTransformer2DModel",anchor:"diffusers.HiDreamImageTransformer2DModel",source:"https://github.com/huggingface/diffusers/blob/vr_14204/src/diffusers/models/transformers/transformer_hidream_image.py#L602",parameters:[{name:"patch_size",val:": int | None = None"},{name:"in_channels",val:": int = 64"},{name:"out_channels",val:": int | None = None"},{name:"num_layers",val:": int = 16"},{name:"num_single_layers",val:": int = 32"},{name:"attention_head_dim",val:": int = 128"},{name:"num_attention_heads",val:": int = 20"},{name:"caption_channels",val:": list = None"},{name:"text_emb_dim",val:": int = 2048"},{name:"num_routed_experts",val:": int = 4"},{name:"num_activated_experts",val:": int = 2"},{name:"axes_dims_rope",val:": tuple = (32, 32)"},{name:"max_resolution",val:": tuple = (128, 128)"},{name:"llama_layers",val:": list = None"},{name:"force_inference_output",val:": bool = False"}]});var g=e(u,2),H=n(g);s(H,{name:"forward",anchor:"diffusers.HiDreamImageTransformer2DModel.forward",source:"https://github.com/huggingface/diffusers/blob/vr_14204/src/diffusers/models/transformers/transformer_hidream_image.py#L773",parameters:[{name:"hidden_states",val:": Tensor"},{name:"timesteps",val:": LongTensor = None"},{name:"encoder_hidden_states_t5",val:": Tensor = None"},{name:"encoder_hidden_states_llama3",val:": Tensor = None"},{name:"pooled_embeds",val:": Tensor = None"},{name:"img_ids",val:": typing.Optional[torch.Tensor] = None"},{name:"img_sizes",val:": list[tuple[int, int]] | None = None"},{name:"hidden_states_masks",val:": typing.Optional[torch.Tensor] = None"},{name:"attention_kwargs",val:": dict[str, typing.Any] | None = None"},{name:"return_dict",val:": bool = True"},{name:"**kwargs",val:""}],parametersDescription:[{anchor:"diffusers.HiDreamImageTransformer2DModel.forward.hidden_states",description:`<strong>hidden_states</strong> (<code>torch.Tensor</code> of shape <code>(batch_size, in_channels, height, width)</code> or <code>(batch_size, patch_height * patch_width, patch_size * patch_size * channels)</code>) — | |
| Input <code>hidden_states</code>.`,name:"hidden_states"},{anchor:"diffusers.HiDreamImageTransformer2DModel.forward.timesteps",description:`<strong>timesteps</strong> (<code>torch.LongTensor</code>) — | |
| Used to indicate denoising step.`,name:"timesteps"},{anchor:"diffusers.HiDreamImageTransformer2DModel.forward.encoder_hidden_states_t5",description:`<strong>encoder_hidden_states_t5</strong> (<code>torch.Tensor</code>) — | |
| Conditional embeddings computed from the T5 text encoder.`,name:"encoder_hidden_states_t5"},{anchor:"diffusers.HiDreamImageTransformer2DModel.forward.encoder_hidden_states_llama3",description:`<strong>encoder_hidden_states_llama3</strong> (<code>torch.Tensor</code>) — | |
| Conditional embeddings computed from the Llama3 text encoder.`,name:"encoder_hidden_states_llama3"},{anchor:"diffusers.HiDreamImageTransformer2DModel.forward.pooled_embeds",description:`<strong>pooled_embeds</strong> (<code>torch.Tensor</code>) — | |
| Pooled text embeddings used for additional conditioning.`,name:"pooled_embeds"},{anchor:"diffusers.HiDreamImageTransformer2DModel.forward.img_ids",description:`<strong>img_ids</strong> (<code>torch.Tensor</code>, <em>optional</em>) — | |
| Image position ids for the patched hidden states.`,name:"img_ids"},{anchor:"diffusers.HiDreamImageTransformer2DModel.forward.img_sizes",description:`<strong>img_sizes</strong> (<code>list</code> of <code>tuple</code> of <code>int</code>, <em>optional</em>) — | |
| Per-sample patch grid sizes used to unpatchify the output.`,name:"img_sizes"},{anchor:"diffusers.HiDreamImageTransformer2DModel.forward.hidden_states_masks",description:`<strong>hidden_states_masks</strong> (<code>torch.Tensor</code>, <em>optional</em>) — | |
| Mask over patched <code>hidden_states</code>.`,name:"hidden_states_masks"},{anchor:"diffusers.HiDreamImageTransformer2DModel.forward.attention_kwargs",description:`<strong>attention_kwargs</strong> (<code>dict</code>, <em>optional</em>) — | |
| A kwargs dictionary that if specified is passed along to the <code>AttentionProcessor</code> as defined under | |
| <code>self.processor</code> in | |
| <a href="https://github.com/huggingface/diffusers/blob/main/src/diffusers/models/attention_processor.py" rel="nofollow">diffusers.models.attention_processor</a>.`,name:"attention_kwargs"},{anchor:"diffusers.HiDreamImageTransformer2DModel.forward.return_dict",description:`<strong>return_dict</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>True</code>) — | |
| Whether or not to return a <code>~models.transformer_2d.Transformer2DModelOutput</code> instead of a plain | |
| tuple.`,name:"return_dict"}],returnDescription:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p>If <code>return_dict</code> is True, an <code>~models.transformer_2d.Transformer2DModelOutput</code> is returned, otherwise a | |
| <code>tuple</code> where the first element is the sample tensor.</p> | |
| `}),t(2),d(g),d(r);var _=e(r,2);o(_,{title:"Transformer2DModelOutput",local:"diffusers.models.modeling_outputs.Transformer2DModelOutput",headingTag:"h2"});var a=e(_,2),I=n(a);s(I,{name:"class diffusers.models.modeling_outputs.Transformer2DModelOutput",anchor:"diffusers.models.modeling_outputs.Transformer2DModelOutput",source:"https://github.com/huggingface/diffusers/blob/vr_14204/src/diffusers/models/modeling_outputs.py#L21",parameters:[{name:"sample",val:": torch.Tensor"}],parametersDescription:[{anchor:"diffusers.models.modeling_outputs.Transformer2DModelOutput.sample",description:`<strong>sample</strong> (<code>torch.Tensor</code> of shape <code>(batch_size, num_channels, height, width)</code> or <code>(batch size, num_vector_embeds - 1, num_latent_pixels)</code> if <a href="/docs/diffusers/pr_14204/en/api/models/transformer2d#diffusers.Transformer2DModel">Transformer2DModel</a> is discrete) — | |
| The hidden states output conditioned on the <code>encoder_hidden_states</code> input. If discrete, returns probability | |
| distributions for the unnoised latent pixels.`,name:"sample"}]}),t(2),d(a);var J=e(a,2);R(J,{source:"https://github.com/huggingface/diffusers/blob/main/docs/source/en/api/models/hidream_image_transformer.md"}),t(2),D(v,i),N()}export{E as component}; | |
Xet Storage Details
- Size:
- 10.8 kB
- Xet hash:
- ac058a4890bd5f55a43707384bf95b740af985bce0eaeaf438d97e306af54d24
·
Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.