Spaces:

fffiloni
/

Music-To-Image

Paused

App Files Files Community

fffiloni commited on Aug 1, 2023

Commit

4b738f1

1 Parent(s): aac1eb6

Update app.py

Browse files

Files changed (1) hide show

app.py +27 -7

app.py CHANGED Viewed

@@ -14,10 +14,6 @@ pipe.to("cuda")
 # if using torch < 2.0
 # pipe.enable_xformers_memory_efficient_attention()
 from pydub import AudioSegment
 def cut_audio(input_path, output_path, max_duration=30000):
@@ -77,16 +73,40 @@ def infer(audio_file):
     images = pipe(prompt=result).images[0]
-    return cap_result, result, images
-with gr.Blocks() as demo:
     with gr.Column(elem_id="col-container"):
         audio_input = gr.Audio(type="filepath", source="upload")
         infer_btn = gr.Button("Generate")
         lpmc_cap = gr.Textbox(label="Lp Music Caps caption")
         llama_trans_cap = gr.Textbox(label="Llama translation")
         img_result = gr.Image(label="Result")
-    infer_btn.click(fn=infer, inputs=[audio_input], outputs=[lpmc_cap, llama_trans_cap, img_result])
 demo.queue().launch()

 # if using torch < 2.0
 # pipe.enable_xformers_memory_efficient_attention()
 from pydub import AudioSegment
 def cut_audio(input_path, output_path, max_duration=30000):
     images = pipe(prompt=result).images[0]
+    #return cap_result, result, images
+    return images
+css = """
+#col-container {max-width: 510px; margin-left: auto; margin-right: auto;}
+"""
+with gr.Blocks(css=css) as demo:
     with gr.Column(elem_id="col-container"):
+        gr.HTML("""<div style="text-align: center; max-width: 700px; margin: 0 auto;">
+                <div
+                style="
+                    display: inline-flex;
+                    align-items: center;
+                    gap: 0.8rem;
+                    font-size: 1.75rem;
+                "
+                >
+                <h1 style="font-weight: 900; margin-bottom: 7px; margin-top: 5px;">
+                    Music To Image
+                </h1>
+                </div>
+                <p style="margin-bottom: 10px; font-size: 94%">
+                Sends an audio in to <a href="https://huggingface.co/spaces/seungheondoh/LP-Music-Caps-demo" target="_blank">LP-Music-Caps</a>
+                to generate a audio cpation which is then translated to an illustrative image description with Llama2, then run through
+                Stable Diffusion XL to generate an image from the audio !
+                </p>
+            </div>""")
         audio_input = gr.Audio(type="filepath", source="upload")
         infer_btn = gr.Button("Generate")
         lpmc_cap = gr.Textbox(label="Lp Music Caps caption")
         llama_trans_cap = gr.Textbox(label="Llama translation")
         img_result = gr.Image(label="Result")
+    #infer_btn.click(fn=infer, inputs=[audio_input], outputs=[lpmc_cap, llama_trans_cap, img_result])
+    infer_btn.click(fn=infer, inputs=[audio_input], outputs=[img_result])
 demo.queue().launch()