umer1995's picture
Fun CN: fp8 stream DiT + local bnb4 TE + xlarge (no bf16 host dump / no remote TE)
f0a4e91 verified
Raw
History Blame Contribute Delete
5.35 kB
from diffusers import AutoencoderKL
from transformers import (AutoProcessor, AutoTokenizer, CLIPImageProcessor,
CLIPTextModel, CLIPTokenizer,
CLIPVisionModelWithProjection,
Gemma3ForConditionalGeneration, Gemma3Processor,
GemmaTokenizer, GemmaTokenizerFast, LlamaModel,
LlamaTokenizerFast, LlavaForConditionalGeneration,
Mistral3ForConditionalGeneration, PixtralProcessor,
Qwen3Config, Qwen3ForCausalLM, T5EncoderModel,
T5Tokenizer, T5TokenizerFast, UMT5EncoderModel,
Wav2Vec2FeatureExtractor)
try:
from transformers import (Qwen2_5_VLConfig,
Qwen2_5_VLForConditionalGeneration,
Qwen2Tokenizer, Qwen2VLProcessor)
except Exception:
Qwen2_5_VLForConditionalGeneration, Qwen2Tokenizer = None, None
Qwen2VLProcessor, Qwen2_5_VLConfig = None, None
print("Your transformers version is too old to load Qwen2_5_VLForConditionalGeneration and Qwen2Tokenizer. If you wish to use QwenImage, please upgrade your transformers package to the latest version.")
try:
from transformers import Qwen3VLForConditionalGeneration
except:
Qwen3VLForConditionalGeneration = None
print("Your transformers version is too old to load Qwen3VLForConditionalGeneration. If you wish to use Qwen3VLForConditionalGeneration, please upgrade your transformers package to the latest version.")
try:
from transformers import Ministral3ForCausalLM, Mistral3Model
except:
Mistral3Model = None
Ministral3ForCausalLM = None
print("Your transformers version is too old to load Mistral3Model and Ministral3ForCausalLM. If you wish to use ErnieImage, please upgrade your transformers package to the latest version.")
try:
from .lens_text_encoder import LensGptOssEncoder
except ImportError:
LensGptOssEncoder = None
print("LensGptOssEncoder not available. Lens requires transformers >= 5.8.0 for GptOssForCausalLM.")
from .cogvideox_transformer3d import CogVideoXTransformer3DModel
from .cogvideox_vae import AutoencoderKLCogVideoX
from .ernie_image_transformer import ErnieImageTransformer2DModel
from .fantasytalking_audio_encoder import FantasyTalkingAudioEncoder
from .fantasytalking_transformer3d import FantasyTalkingTransformer3DModel
from .flashhead_audio_encoder import FlashHeadAudioEncoder
from .flashhead_transformer3d import FlashHeadTransformer3DModel
from .flux2_image_processor import Flux2ImageProcessor
from .flux2_transformer2d import Flux2Transformer2DModel
from .flux2_transformer2d_control import Flux2ControlTransformer2DModel
from .flux2_vae import AutoencoderKLFlux2
from .flux_transformer2d import FluxTransformer2DModel
from .hunyuanvideo_transformer3d import HunyuanVideoTransformer3DModel
from .hunyuanvideo_vae import AutoencoderKLHunyuanVideo
from .infinitetalk_audio_encoder import InfiniteTalkAudioEncoder
from .infinitetalk_transformer3d import InfiniteTalkTransformer3DModel
from .lens_reasoner import LensPromptReasoner
from .lens_transformer2d import LensTransformer2DModel
from .longcatvideo_audio_encoder import (LongCatVideoAudioEncoder,
Wav2Vec2ModelWrapper)
from .longcatvideo_transformer3d import LongCatVideoTransformer3DModel
from .longcatvideo_transformer3d_avatar import \
LongCatVideoAvatarTransformer3DModel
from .longcatvideo_vae import AutoencoderKLLongCatVideo
from .ltx2_connecter import LTX2TextConnectors
from .ltx2_latent_upsampler import LTX2LatentUpsamplerModel
from .ltx2_transformer3d import LTX2VideoTransformer3DModel
from .ltx2_vae import AutoencoderKLLTX2Video
from .ltx2_vae_audio import AutoencoderKLLTX2Audio
from .ltx2_vocoder import LTX2Vocoder, LTX2VocoderWithBWE
from .mova_audio_transformer3d import WanAudioTransformer3DModel
from .mova_interactionv2 import MOVADualTowerConditionalBridge
from .mova_model import MOVAModel
from .mova_vae_audio import AutoencoderKLMOVAAudio
from .qwenimage_transformer2d import QwenImageTransformer2DModel
from .qwenimage_transformer2d_control import QwenImageControlTransformer2DModel
from .qwenimage_transformer2d_instantx import QwenImageInstantXControlNetModel
from .qwenimage_vae import AutoencoderKLQwenImage
from .turbowan_transformer3d import TurboWanTransformer3DModel
from .wan_audio_encoder import WanAudioEncoder
from .wan_image_encoder import CLIPModel
from .wan_text_encoder import WanT5EncoderModel
from .wan_transformer3d import (Wan2_2Transformer3DModel, WanRMSNorm,
WanSelfAttention, WanTransformer3DModel)
from .wan_transformer3d_animate import Wan2_2Transformer3DModel_Animate
from .wan_transformer3d_s2v import Wan2_2Transformer3DModel_S2V
from .wan_transformer3d_self_forcing import WanTransformer3DModel_SelfForcing
from .wan_transformer3d_vace import VaceWanTransformer3DModel
from .wan_vae import AutoencoderKLWan, AutoencoderKLWan_
from .wan_vae3_8 import AutoencoderKLWan2_2_, AutoencoderKLWan3_8
from .z_image_transformer2d import ZImageTransformer2DModel
from .z_image_transformer2d_control import ZImageControlTransformer2DModel