File size: 888 Bytes
2e5e3fc
06f183a
113f42f
 
644ff92
875323e
113f42f
875323e
113f42f
 
 
2e5e3fc
06f183a
d900e25
9ac5c34
113f42f
6796a74
1930360
 
 
e9ec7e7
1930360
0a7865f
 
113f42f
 
 
2e5e3fc
d900e25
2e5e3fc
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
import gradio as gr
import spaces
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "mistralai/Mistral-Small-Instruct-2409"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    torch_dtype="auto",
    device_map="auto"
)

@spaces.GPU
def respond(message, history):
    inputs = tokenizer(message, return_tensors="pt").to("cuda")
    inputs_size = len(inputs.input_ids[0])
    response = model.generate(
        **inputs,
        max_new_tokens=256,
        do_sample=True,
        temperature=0.2,
        top_p=0.9,
        repetition_penalty=1.5,
        eos_token_id=tokenizer.eos_token_id,
    )
    output = tokenizer.decode(response[0][inputs_size:], skip_special_tokens=True)
    return output

app = gr.ChatInterface(fn=respond, title="Simple Chat")

if __name__ == "__main__":
    app.launch()