Spaces:

ludusc
/

mambo_test

Build error

App Files Files Community

ludusc commited on May 5, 2025

Commit

a60d974

verified ·

1 Parent(s): 9e2dd9d

Upload 6 files

Browse files

Files changed (6) hide show

README.md +4 -5
app.py +88 -28
gitattributes +35 -0
requirements.txt +3 -4
safety_checker.py +137 -0
style.css +3 -0

README.md CHANGED Viewed

@@ -1,12 +1,11 @@
 ---
-title: Mambo Museum Workshop
-emoji: 😻
 colorFrom: red
-colorTo: blue
 sdk: gradio
-sdk_version: 5.29.0
 app_file: app.py
-pinned: false
 license: mit
 ---

 ---
+title: SDXL-Lightning
+emoji: ⚡
 colorFrom: red
+colorTo: yellow
 sdk: gradio
+sdk_version: 4.36.0
 app_file: app.py
 license: mit
 ---

app.py CHANGED Viewed

@@ -1,35 +1,95 @@
 import gradio as gr
 import torch
-from diffusers import StableDiffusionPipeline, UniPCMultistepScheduler
-device = "cuda" if torch.cuda.is_available() else "cpu"
-print(device)
-# Set seed for reproducibility
-seed = 42
-generator = torch.Generator(device=device)
-generator.manual_seed(seed)
-torch.manual_seed(42)
-negative_prompt = "deformed face, extra limbs, extra fingers, out of frame"
-def run(checkpoint, prompt):
-    pipe = StableDiffusionPipeline.from_pretrained('stabilityai/stable-diffusion-2', torch_dtype=torch.bfloat16)
-    pipe.scheduler = UniPCMultistepScheduler.from_config(pipe.scheduler.config)
-    pipe.to(device)
-    pipe.unet.load_attn_procs(checkpoint)
-    # disable guidance_scale by passing 0
-    image = pipe(prompt=prompt, negative_prompt=negative_prompt,
-                 num_inference_steps=30, guidance_scale=7.5).images[0]
-    return image
-with gr.Blocks() as demo:
-    input_checkpoint = gr.Text(value="adapters/mambo", label="Checkpoint")
-    input_prompt = gr.Text(value="Self-portrait oil painting, a beautiful cyborg with golden hair, 8k", label="Prompt")
-    out = gr.Image(type="pil")
-    btn = gr.Button("Run")
-    btn.click(fn=run, inputs=[input_checkpoint, input_prompt], outputs=out)
-demo.launch()

 import gradio as gr
 import torch
+from diffusers import StableDiffusionXLPipeline, EulerDiscreteScheduler
+from huggingface_hub import hf_hub_download
+from safetensors.torch import load_file
+import spaces
+from PIL import Image
+SAFETY_CHECKER = True
+# Constants
+base = "stabilityai/stable-diffusion-xl-base-1.0"
+repo = "ByteDance/SDXL-Lightning"
+checkpoints = {
+    "1-Step" : ["sdxl_lightning_1step_unet_x0.safetensors", 1],
+    "2-Step" : ["sdxl_lightning_2step_unet.safetensors", 2],
+    "4-Step" : ["sdxl_lightning_4step_unet.safetensors", 4],
+    "8-Step" : ["sdxl_lightning_8step_unet.safetensors", 8],
+}
+loaded = None
+# Ensure model and scheduler are initialized in GPU-enabled function
+if torch.cuda.is_available():
+    pipe = StableDiffusionXLPipeline.from_pretrained(base, torch_dtype=torch.float16, variant="fp16").to("cuda")
+if SAFETY_CHECKER:
+    from safety_checker import StableDiffusionSafetyChecker
+    from transformers import CLIPFeatureExtractor
+    safety_checker = StableDiffusionSafetyChecker.from_pretrained(
+        "CompVis/stable-diffusion-safety-checker"
+    ).to("cuda")
+    feature_extractor = CLIPFeatureExtractor.from_pretrained(
+        "openai/clip-vit-base-patch32"
+    )
+    def check_nsfw_images(
+        images: list[Image.Image],
+    ) -> tuple[list[Image.Image], list[bool]]:
+        safety_checker_input = feature_extractor(images, return_tensors="pt").to("cuda")
+        has_nsfw_concepts = safety_checker(
+            images=[images],
+            clip_input=safety_checker_input.pixel_values.to("cuda")
+        )
+        return images, has_nsfw_concepts
+# Function
+@spaces.GPU(enable_queue=True)
+def generate_image(prompt, ckpt):
+    global loaded
+    print(prompt, ckpt)
+    checkpoint = checkpoints[ckpt][0]
+    num_inference_steps = checkpoints[ckpt][1]
+    if loaded != num_inference_steps:
+        pipe.scheduler = EulerDiscreteScheduler.from_config(pipe.scheduler.config, timestep_spacing="trailing", prediction_type="sample" if num_inference_steps==1 else "epsilon")
+        pipe.unet.load_state_dict(load_file(hf_hub_download(repo, checkpoint), device="cuda"))
+        loaded = num_inference_steps
+    results = pipe(prompt, num_inference_steps=num_inference_steps, guidance_scale=0)
+    if SAFETY_CHECKER:
+        images, has_nsfw_concepts = check_nsfw_images(results.images)
+        if any(has_nsfw_concepts):
+            gr.Warning("NSFW content detected.")
+            return Image.new("RGB", (512, 512))
+        return images[0]
+    return results.images[0]
+# Gradio Interface
+with gr.Blocks(css="style.css") as demo:
+    gr.HTML("<h1><center>SDXL-Lightning ⚡</center></h1>")
+    gr.HTML("<p><center>Lightning-fast text-to-image generation</center></p><p><center><a href='https://huggingface.co/ByteDance/SDXL-Lightning'>https://huggingface.co/ByteDance/SDXL-Lightning</a></center></p>")
+    with gr.Group():
+        with gr.Row():
+            prompt = gr.Textbox(label='Enter your prompt (English)', scale=8)
+            ckpt = gr.Dropdown(label='Select inference steps',choices=['1-Step', '2-Step', '4-Step', '8-Step'], value='4-Step', interactive=True)
+            submit = gr.Button(scale=1, variant='primary')
+    img = gr.Image(label='SDXL-Lightning Generated Image')
+    prompt.submit(fn=generate_image,
+                 inputs=[prompt, ckpt],
+                 outputs=img,
+                 )
+    submit.click(fn=generate_image,
+                 inputs=[prompt, ckpt],
+                 outputs=img,
+                 )
+demo.queue().launch()

gitattributes ADDED Viewed

	@@ -0,0 +1,35 @@

+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text

requirements.txt CHANGED Viewed

@@ -1,6 +1,5 @@
-gradio
-diffusers
-transformers
 accelerate
 torch
-peft

 accelerate
+diffusers
+gradio
 torch
+transformers

safety_checker.py ADDED Viewed

	@@ -0,0 +1,137 @@

+# Copyright 2023 The HuggingFace Team. All rights reserved.
+#
+# Licensed under the Apache License, Version 2.0 (the "License");
+# you may not use this file except in compliance with the License.
+# You may obtain a copy of the License at
+#
+#     http://www.apache.org/licenses/LICENSE-2.0
+#
+# Unless required by applicable law or agreed to in writing, software
+# distributed under the License is distributed on an "AS IS" BASIS,
+# WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.
+# See the License for the specific language governing permissions and
+# limitations under the License.
+import numpy as np
+import torch
+import torch.nn as nn
+from transformers import CLIPConfig, CLIPVisionModel, PreTrainedModel
+def cosine_distance(image_embeds, text_embeds):
+    normalized_image_embeds = nn.functional.normalize(image_embeds)
+    normalized_text_embeds = nn.functional.normalize(text_embeds)
+    return torch.mm(normalized_image_embeds, normalized_text_embeds.t())
+class StableDiffusionSafetyChecker(PreTrainedModel):
+    config_class = CLIPConfig
+    _no_split_modules = ["CLIPEncoderLayer"]
+    def __init__(self, config: CLIPConfig):
+        super().__init__(config)
+        self.vision_model = CLIPVisionModel(config.vision_config)
+        self.visual_projection = nn.Linear(
+            config.vision_config.hidden_size, config.projection_dim, bias=False
+        )
+        self.concept_embeds = nn.Parameter(
+            torch.ones(17, config.projection_dim), requires_grad=False
+        )
+        self.special_care_embeds = nn.Parameter(
+            torch.ones(3, config.projection_dim), requires_grad=False
+        )
+        self.concept_embeds_weights = nn.Parameter(torch.ones(17), requires_grad=False)
+        self.special_care_embeds_weights = nn.Parameter(
+            torch.ones(3), requires_grad=False
+        )
+    @torch.no_grad()
+    def forward(self, clip_input, images):
+        pooled_output = self.vision_model(clip_input)[1]  # pooled_output
+        image_embeds = self.visual_projection(pooled_output)
+        # we always cast to float32 as this does not cause significant overhead and is compatible with bfloat16
+        special_cos_dist = (
+            cosine_distance(image_embeds, self.special_care_embeds)
+            .cpu()
+            .float()
+            .numpy()
+        )
+        cos_dist = (
+            cosine_distance(image_embeds, self.concept_embeds).cpu().float().numpy()
+        )
+        result = []
+        batch_size = image_embeds.shape[0]
+        for i in range(batch_size):
+            result_img = {
+                "special_scores": {},
+                "special_care": [],
+                "concept_scores": {},
+                "bad_concepts": [],
+            }
+            # increase this value to create a stronger `nfsw` filter
+            # at the cost of increasing the possibility of filtering benign images
+            adjustment = 0.0
+            for concept_idx in range(len(special_cos_dist[0])):
+                concept_cos = special_cos_dist[i][concept_idx]
+                concept_threshold = self.special_care_embeds_weights[concept_idx].item()
+                result_img["special_scores"][concept_idx] = round(
+                    concept_cos - concept_threshold + adjustment, 3
+                )
+                if result_img["special_scores"][concept_idx] > 0:
+                    result_img["special_care"].append(
+                        {concept_idx, result_img["special_scores"][concept_idx]}
+                    )
+                    adjustment = 0.01
+            for concept_idx in range(len(cos_dist[0])):
+                concept_cos = cos_dist[i][concept_idx]
+                concept_threshold = self.concept_embeds_weights[concept_idx].item()
+                result_img["concept_scores"][concept_idx] = round(
+                    concept_cos - concept_threshold + adjustment, 3
+                )
+                if result_img["concept_scores"][concept_idx] > 0:
+                    result_img["bad_concepts"].append(concept_idx)
+            result.append(result_img)
+        has_nsfw_concepts = [len(res["bad_concepts"]) > 0 for res in result]
+        return has_nsfw_concepts
+    @torch.no_grad()
+    def forward_onnx(self, clip_input: torch.FloatTensor, images: torch.FloatTensor):
+        pooled_output = self.vision_model(clip_input)[1]  # pooled_output
+        image_embeds = self.visual_projection(pooled_output)
+        special_cos_dist = cosine_distance(image_embeds, self.special_care_embeds)
+        cos_dist = cosine_distance(image_embeds, self.concept_embeds)
+        # increase this value to create a stronger `nsfw` filter
+        # at the cost of increasing the possibility of filtering benign images
+        adjustment = 0.0
+        special_scores = (
+            special_cos_dist - self.special_care_embeds_weights + adjustment
+        )
+        # special_scores = special_scores.round(decimals=3)
+        special_care = torch.any(special_scores > 0, dim=1)
+        special_adjustment = special_care * 0.01
+        special_adjustment = special_adjustment.unsqueeze(1).expand(
+            -1, cos_dist.shape[1]
+        )
+        concept_scores = (cos_dist - self.concept_embeds_weights) + special_adjustment
+        # concept_scores = concept_scores.round(decimals=3)
+        has_nsfw_concepts = torch.any(concept_scores > 0, dim=1)
+        images[has_nsfw_concepts] = 0.0  # black image
+        return images, has_nsfw_concepts

style.css ADDED Viewed

	@@ -0,0 +1,3 @@

+.gradio-container {
+  max-width: 690px !important;
+}