gg34455 commited on
Commit
d3419fc
·
verified ·
1 Parent(s): 9d99bff

Update app.py

Browse files
Files changed (1) hide show
  1. app.py +22 -39
app.py CHANGED
@@ -1,53 +1,36 @@
1
- from fastapi import FastAPI, Query
2
- from transformers import AutoTokenizer, AutoModelForCausalLM
3
  import torch
4
 
5
- app = FastAPI()
6
 
7
- MODEL_ID = "google/gemma-4-E2B-it"
8
-
9
- print("Loading Gemma 4 on CPU...")
10
-
11
- device = torch.device("cpu")
12
-
13
- # ✅ Use tokenizer (NOT AutoProcessor)
14
  tokenizer = AutoTokenizer.from_pretrained(MODEL_ID)
15
 
16
- # ✅ Load model safely on CPU
17
  model = AutoModelForCausalLM.from_pretrained(
18
  MODEL_ID,
 
19
  torch_dtype=torch.float32,
20
  low_cpu_mem_usage=True
21
- ).to(device)
22
-
23
- model.eval()
24
-
25
- print("Model loaded!")
26
-
27
- @app.get("/")
28
- def root():
29
- return {"message": "Gemma 4 API running on CPU"}
30
 
31
- @app.get("/generate")
32
- def generate(input: str = Query(...)):
33
- try:
34
- inputs = tokenizer(input, return_tensors="pt").to(device)
35
 
36
- with torch.no_grad():
37
- outputs = model.generate(
38
- **inputs,
39
- max_new_tokens=128, # keep small for CPU
40
- do_sample=True,
41
- temperature=0.7
42
- )
43
 
44
- response = tokenizer.decode(outputs[0], skip_special_tokens=True)
45
 
46
- return {
47
- "input": input,
48
- "response": response
49
- }
 
 
50
 
51
- except Exception as e:
52
- return {"error": str(e)}
53
-
 
1
+ import gradio as gr
2
+ from transformers import AutoModelForCausalLM, AutoTokenizer
3
  import torch
4
 
5
+ MODEL_ID = "Jackrong/Qwen3.5-9B-GLM5.1-Distill-v1"
6
 
 
 
 
 
 
 
 
7
  tokenizer = AutoTokenizer.from_pretrained(MODEL_ID)
8
 
 
9
  model = AutoModelForCausalLM.from_pretrained(
10
  MODEL_ID,
11
+ device_map="cpu",
12
  torch_dtype=torch.float32,
13
  low_cpu_mem_usage=True
14
+ )
 
 
 
 
 
 
 
 
15
 
16
+ def chat(prompt):
17
+ inputs = tokenizer(prompt, return_tensors="pt")
 
 
18
 
19
+ outputs = model.generate(
20
+ **inputs,
21
+ max_new_tokens=64, # keep LOW
22
+ do_sample=True,
23
+ temperature=0.7
24
+ )
 
25
 
26
+ return tokenizer.decode(outputs[0], skip_special_tokens=True)
27
 
28
+ app = gr.Interface(
29
+ fn=chat,
30
+ inputs="text",
31
+ outputs="text",
32
+ api_name="generate"
33
+ )
34
 
35
+ app.queue()
36
+ app.launch()