| { |
| "architecture": { |
| "attention_variant": "GQA", |
| "family": "image_text_to_text", |
| "is_moe": false, |
| "positional": "rope", |
| "sliding_window": 512, |
| "tie_word_embeddings": true, |
| "view": "multimodal" |
| }, |
| "capabilities": { |
| "attention_backends": [ |
| "eager" |
| ], |
| "attention_patterns": [ |
| "sliding", |
| "bidirectional" |
| ], |
| "attention_schedule": [ |
| "sliding_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "full_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "full_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "full_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "full_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "sliding_attention", |
| "full_attention" |
| ], |
| "task_heads": [ |
| "image_text_to_text", |
| "multimodal_lm" |
| ], |
| "tensor_parallel": true |
| }, |
| "components": [], |
| "config": { |
| "class_name": "DiffusionGemmaConfig", |
| "model_type": "diffusion_gemma", |
| "module": "transformers.models.diffusion_gemma.configuration_diffusion_gemma", |
| "referenced_fields": {}, |
| "salient_fields": { |
| "is_encoder_decoder": false, |
| "tie_word_embeddings": true |
| } |
| }, |
| "edges": [], |
| "extends": "gemma4", |
| "model_type": "diffusion_gemma", |
| "patches": [ |
| { |
| "added": { |
| "attrs": [ |
| "attention_k_eq_v", |
| "base_model_pp_plan", |
| "enable_moe_block", |
| "final_logit_softcapping", |
| "hidden_size_per_layer_input", |
| "model_type", |
| "num_kv_shared_layers", |
| "use_cache", |
| "use_double_wide_mlp", |
| "vocab_size_per_layer_input" |
| ] |
| }, |
| "component_kind": "config", |
| "parent_class": "Gemma4TextConfig", |
| "relation": "new", |
| "target_class": "DiffusionGemmaTextConfig" |
| }, |
| { |
| "added": { |
| "attrs": [ |
| "audio_config", |
| "audio_token_id", |
| "boa_token_id", |
| "boi_token_id", |
| "canvas_length", |
| "eoa_token_index", |
| "eoi_token_id", |
| "image_token_id", |
| "initializer_range", |
| "model_type", |
| "sub_configs", |
| "text_config", |
| "tie_word_embeddings", |
| "video_token_id", |
| "vision_config" |
| ], |
| "methods": [ |
| "__post_init__" |
| ] |
| }, |
| "component_kind": "config", |
| "parent_class": "Gemma4Config", |
| "relation": "new", |
| "target_class": "DiffusionGemmaConfig" |
| }, |
| { |
| "component_kind": null, |
| "overridden": { |
| "methods": [ |
| "__init__" |
| ] |
| }, |
| "parent_class": "Gemma4ClippableLinear", |
| "relation": "inherits", |
| "target_class": "DiffusionGemmaClippableLinear" |
| }, |
| { |
| "added": { |
| "methods": [ |
| "__init__", |
| "forward" |
| ] |
| }, |
| "component_kind": "attention", |
| "parent_class": "Module", |
| "relation": "new", |
| "target_class": "DiffusionGemmaEncoderTextAttention" |
| }, |
| { |
| "added": { |
| "methods": [ |
| "__init__", |
| "append_to_cache", |
| "forward" |
| ] |
| }, |
| "component_kind": "attention", |
| "parent_class": "Module", |
| "relation": "new", |
| "target_class": "DiffusionGemmaDecoderTextAttention" |
| }, |
| { |
| "component_kind": "feed_forward", |
| "overridden": { |
| "methods": [ |
| "__init__" |
| ] |
| }, |
| "parent_class": "Gemma4TextMLP", |
| "relation": "inherits", |
| "target_class": "DiffusionGemmaText4MLP" |
| }, |
| { |
| "added": { |
| "methods": [ |
| "__init__", |
| "forward" |
| ] |
| }, |
| "component_kind": "transformer_block", |
| "parent_class": "GradientCheckpointingLayer", |
| "relation": "new", |
| "target_class": "DiffusionGemmaEncoderTextLayer" |
| }, |
| { |
| "component_kind": "transformer_block", |
| "overridden": { |
| "methods": [ |
| "__init__", |
| "forward" |
| ] |
| }, |
| "parent_class": "Gemma4TextDecoderLayer", |
| "relation": "inherits", |
| "target_class": "DiffusionGemmaDecoderTextLayer" |
| }, |
| { |
| "component_kind": null, |
| "overridden": { |
| "methods": [ |
| "__init__" |
| ] |
| }, |
| "parent_class": "Gemma4MultimodalEmbedder", |
| "relation": "inherits", |
| "target_class": "DiffusionGemmaMultimodalEmbedder" |
| }, |
| { |
| "added": { |
| "methods": [ |
| "__init__", |
| "forward" |
| ] |
| }, |
| "component_kind": null, |
| "parent_class": "Module", |
| "relation": "new", |
| "target_class": "DiffusionGemmaSelfConditioning" |
| }, |
| { |
| "component_kind": "model", |
| "overridden": { |
| "attrs": [ |
| "_can_record_outputs", |
| "_no_split_modules", |
| "_supports_flash_attn", |
| "_supports_flex_attn", |
| "supports_gradient_checkpointing" |
| ], |
| "methods": [ |
| "_init_weights", |
| "prepare_decoder_input_ids_from_labels" |
| ] |
| }, |
| "parent_class": "T5Gemma2PreTrainedModel", |
| "parent_model": "t5gemma2", |
| "relation": "inherits", |
| "target_class": "DiffusionGemmaPreTrainedModel" |
| }, |
| { |
| "added": { |
| "attrs": [ |
| "_can_record_outputs", |
| "config", |
| "input_modalities" |
| ], |
| "methods": [ |
| "__init__", |
| "forward" |
| ] |
| }, |
| "component_kind": "model", |
| "parent_class": "DiffusionGemmaPreTrainedModel", |
| "relation": "new", |
| "target_class": "DiffusionGemmaEncoderTextModel" |
| }, |
| { |
| "added": { |
| "attrs": [ |
| "_can_record_outputs" |
| ], |
| "methods": [ |
| "create_masks_for_generate" |
| ] |
| }, |
| "component_kind": "model", |
| "overridden": { |
| "methods": [ |
| "__init__", |
| "forward", |
| "get_audio_features", |
| "get_placeholder_mask", |
| "get_video_features" |
| ] |
| }, |
| "parent_class": "Gemma4Model", |
| "relation": "inherits", |
| "target_class": "DiffusionGemmaEncoderModel" |
| }, |
| { |
| "added": { |
| "attrs": [ |
| "_can_record_outputs", |
| "input_modalities" |
| ], |
| "methods": [ |
| "__init__", |
| "create_diffusion_decoder_attention_mask", |
| "forward" |
| ] |
| }, |
| "component_kind": "model", |
| "parent_class": "DiffusionGemmaPreTrainedModel", |
| "relation": "new", |
| "target_class": "DiffusionGemmaDecoderModel" |
| }, |
| { |
| "added": { |
| "attrs": [ |
| "encoder_last_hidden_state" |
| ] |
| }, |
| "component_kind": null, |
| "parent_class": "BaseModelOutputWithPast", |
| "relation": "new", |
| "target_class": "DiffusionGemmaModelOutputWithPast" |
| }, |
| { |
| "added": { |
| "attrs": [ |
| "encoder_last_hidden_state" |
| ] |
| }, |
| "component_kind": null, |
| "parent_class": "CausalLMOutputWithPast", |
| "relation": "new", |
| "target_class": "DiffusionGemmaBlockDiffusionOutputWithPast" |
| }, |
| { |
| "component_kind": "model", |
| "overridden": { |
| "attrs": [ |
| "_tied_weights_keys" |
| ], |
| "methods": [ |
| "__init__", |
| "forward" |
| ] |
| }, |
| "parent_class": "T5Gemma2Model", |
| "parent_model": "t5gemma2", |
| "relation": "inherits", |
| "target_class": "DiffusionGemmaModel" |
| }, |
| { |
| "added": { |
| "attrs": [ |
| "_tied_weights_keys", |
| "generation_config_class" |
| ], |
| "methods": [ |
| "__init__", |
| "forward" |
| ] |
| }, |
| "component_kind": null, |
| "parent_class": "DiffusionGemmaPreTrainedModel", |
| "relation": "new", |
| "target_class": "DiffusionGemmaForBlockDiffusion" |
| } |
| ], |
| "provenance": { |
| "config_class": "DiffusionGemmaConfig", |
| "config_module": "transformers.models.diffusion_gemma.configuration_diffusion_gemma", |
| "model_class": null, |
| "model_module": null |
| }, |
| "repeats": [], |
| "schema_version": "architecture-template-v0", |
| "status": "config_only", |
| "templates": [], |
| "warnings": [ |
| "meta build failed (TypeError): empty() received an invalid combination of arguments - got (tuple, dtype=NoneType, device=NoneType), but expected one of:\n * (tuple of ints size, *, tuple of names names, torch.memory_format memory_fo" |
| ] |
| } |
|
|