Upload LTXVideo2Pipeline

Browse files

Files changed (9) hide show

.gitattributes +1 -0
audio_preprocessor/config.json +33 -0
model_index.json +8 -0
text_encoder_processor/chat_template.jinja +47 -0
text_encoder_processor/preprocessor_config.json +29 -0
text_encoder_processor/processor_config.json +4 -0
text_encoder_processor/special_tokens_map.json +33 -0
text_encoder_processor/tokenizer.json +3 -0
text_encoder_processor/tokenizer_config.json +0 -0

.gitattributes CHANGED Viewed

@@ -42,3 +42,4 @@ transformer/model.flashpack filter=lfs diff=lfs merge=lfs -text
 video_decoder/model.flashpack filter=lfs diff=lfs merge=lfs -text
 video_encoder/model.flashpack filter=lfs diff=lfs merge=lfs -text
 vocoder/model.flashpack filter=lfs diff=lfs merge=lfs -text

 video_decoder/model.flashpack filter=lfs diff=lfs merge=lfs -text
 video_encoder/model.flashpack filter=lfs diff=lfs merge=lfs -text
 vocoder/model.flashpack filter=lfs diff=lfs merge=lfs -text
+text_encoder_processor/tokenizer.json filter=lfs diff=lfs merge=lfs -text

audio_preprocessor/config.json ADDED Viewed

	@@ -0,0 +1,33 @@

+{
+  "_class_name": "AudioPreprocessor",
+  "_diffusers_version": "0.36.0",
+  "add_ambience": true,
+  "add_reverb": true,
+  "add_room": true,
+  "ambience_rms_db": -48.0,
+  "bitrate": "256k",
+  "codec": "mp3",
+  "container_format": null,
+  "do_comp": true,
+  "do_eq": false,
+  "do_limiter": true,
+  "do_roundtrip": true,
+  "final_peak_dbfs": -1.0,
+  "force_stereo": true,
+  "hpf_hz": 90.0,
+  "initial_peak_dbfs": -3.0,
+  "limit_dbfs": -1.0,
+  "lpf_hz": 10000.0,
+  "narrow_width": 0.35,
+  "output_format": "s16p",
+  "predelay_ms": 12.0,
+  "presence_gain_db": 2.0,
+  "return_float": true,
+  "reverb_wet": 0.04,
+  "room_bed_rms_db": -52.0,
+  "room_hp_hz": 40.0,
+  "room_lp_hz": 12000.0,
+  "room_noise_kind": "pink",
+  "rt60": 0.35,
+  "sr": 16000
+}

model_index.json CHANGED Viewed

@@ -9,6 +9,10 @@
     "ltx2.model.audio_vae.audio_vae",
     "Encoder"
   ],
   "spatial_upsampler": [
     "ltx2.model.upsampler.model",
     "LatentUpsampler"
@@ -17,6 +21,10 @@
     "ltx2.model.text_encoder.gemma.model",
     "LTXTextEncoderModel"
   ],
   "tokenizer": [
     "transformers",
     "GemmaTokenizerFast"

     "ltx2.model.audio_vae.audio_vae",
     "Encoder"
   ],
+  "audio_preprocessor": [
+    "ltx2.model.audio_preprocessor",
+    "AudioPreprocessor"
+  ],
   "spatial_upsampler": [
     "ltx2.model.upsampler.model",
     "LatentUpsampler"
     "ltx2.model.text_encoder.gemma.model",
     "LTXTextEncoderModel"
   ],
+  "text_encoder_processor": [
+    "transformers",
+    "Gemma3Processor"
+  ],
   "tokenizer": [
     "transformers",
     "GemmaTokenizerFast"

text_encoder_processor/chat_template.jinja ADDED Viewed

	@@ -0,0 +1,47 @@

+{{ bos_token }}
+{%- if messages[0]['role'] == 'system' -%}
+    {%- if messages[0]['content'] is string -%}
+        {%- set first_user_prefix = messages[0]['content'] + '
+' -%}
+    {%- else -%}
+        {%- set first_user_prefix = messages[0]['content'][0]['text'] + '
+' -%}
+    {%- endif -%}
+    {%- set loop_messages = messages[1:] -%}
+{%- else -%}
+    {%- set first_user_prefix = "" -%}
+    {%- set loop_messages = messages -%}
+{%- endif -%}
+{%- for message in loop_messages -%}
+    {%- if (message['role'] == 'user') != (loop.index0 % 2 == 0) -%}
+        {{ raise_exception("Conversation roles must alternate user/assistant/user/assistant/...") }}
+    {%- endif -%}
+    {%- if (message['role'] == 'assistant') -%}
+        {%- set role = "model" -%}
+    {%- else -%}
+        {%- set role = message['role'] -%}
+    {%- endif -%}
+    {{ '<start_of_turn>' + role + '
+' + (first_user_prefix if loop.first else "") }}
+    {%- if message['content'] is string -%}
+        {{ message['content'] | trim }}
+    {%- elif message['content'] is iterable -%}
+        {%- for item in message['content'] -%}
+            {%- if item['type'] == 'image' -%}
+                {{ '<start_of_image>' }}
+            {%- elif item['type'] == 'text' -%}
+                {{ item['text'] | trim }}
+            {%- endif -%}
+        {%- endfor -%}
+    {%- else -%}
+        {{ raise_exception("Invalid content type") }}
+    {%- endif -%}
+    {{ '<end_of_turn>
+' }}
+{%- endfor -%}
+{%- if add_generation_prompt -%}
+    {{'<start_of_turn>model
+'}}
+{%- endif -%}

text_encoder_processor/preprocessor_config.json ADDED Viewed

	@@ -0,0 +1,29 @@

+{
+  "do_convert_rgb": null,
+  "do_normalize": true,
+  "do_pan_and_scan": null,
+  "do_rescale": true,
+  "do_resize": true,
+  "image_mean": [
+    0.5,
+    0.5,
+    0.5
+  ],
+  "image_processor_type": "Gemma3ImageProcessor",
+  "image_seq_length": 256,
+  "image_std": [
+    0.5,
+    0.5,
+    0.5
+  ],
+  "pan_and_scan_max_num_crops": null,
+  "pan_and_scan_min_crop_size": null,
+  "pan_and_scan_min_ratio_to_activate": null,
+  "processor_class": "Gemma3Processor",
+  "resample": 2,
+  "rescale_factor": 0.00392156862745098,
+  "size": {
+    "height": 896,
+    "width": 896
+  }
+}

text_encoder_processor/processor_config.json ADDED Viewed

	@@ -0,0 +1,4 @@

+{
+  "image_seq_length": 256,
+  "processor_class": "Gemma3Processor"
+}

text_encoder_processor/special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,33 @@

+{
+  "boi_token": "<start_of_image>",
+  "bos_token": {
+    "content": "<bos>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eoi_token": "<end_of_image>",
+  "eos_token": {
+    "content": "<eos>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "image_token": "<image_soft_token>",
+  "pad_token": {
+    "content": "<pad>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "unk_token": {
+    "content": "<unk>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

text_encoder_processor/tokenizer.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:4667f2089529e8e7657cfb6d1c19910ae71ff5f28aa7ab2ff2763330affad795
+size 33384568

text_encoder_processor/tokenizer_config.json ADDED Viewed

The diff for this file is too large to render. See raw diff