import gradio as gr from transformers import AutoTokenizer, AutoModelForCausalLM import torch model_name = "Qwen/Qwen2.5-0.5B-Instruct" tokenizer = AutoTokenizer.from_pretrained(model_name) model = AutoModelForCausalLM.from_pretrained(model_name) def chat(message, history): messages = [{"role": "user", "content": message}] inputs = tokenizer.apply_chat_template( messages, return_tensors="pt" ) outputs = model.generate( inputs, max_new_tokens=100, do_sample=True, temperature=0.7 ) reply = tokenizer.decode(outputs[0], skip_special_tokens=True) return reply demo = gr.ChatInterface(fn=chat) demo.launch()