Spaces:
Running on Zero
Running on Zero
File size: 888 Bytes
2e5e3fc 06f183a 113f42f 644ff92 875323e 113f42f 875323e 113f42f 2e5e3fc 06f183a d900e25 9ac5c34 113f42f 6796a74 1930360 e9ec7e7 1930360 0a7865f 113f42f 2e5e3fc d900e25 2e5e3fc | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 | import gradio as gr
import spaces
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "mistralai/Mistral-Small-Instruct-2409"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype="auto",
device_map="auto"
)
@spaces.GPU
def respond(message, history):
inputs = tokenizer(message, return_tensors="pt").to("cuda")
inputs_size = len(inputs.input_ids[0])
response = model.generate(
**inputs,
max_new_tokens=256,
do_sample=True,
temperature=0.2,
top_p=0.9,
repetition_penalty=1.5,
eos_token_id=tokenizer.eos_token_id,
)
output = tokenizer.decode(response[0][inputs_size:], skip_special_tokens=True)
return output
app = gr.ChatInterface(fn=respond, title="Simple Chat")
if __name__ == "__main__":
app.launch() |