MadT21 commited on
Commit
d536b28
·
verified ·
1 Parent(s): 4389305

Update app.py

Browse files
Files changed (1) hide show
  1. app.py +10 -3
app.py CHANGED
@@ -1,17 +1,24 @@
1
  import gradio as gr
2
  import torch
3
- from transformers import AutoModelForCausalLM, AutoTokenizer, pipeline
4
 
5
  # Model name
6
  MODEL_NAME = "HuggingFaceH4/zephyr-7b-beta"
7
 
 
 
 
 
 
 
 
8
  # Load tokenizer and model for CPU
9
  tokenizer = AutoTokenizer.from_pretrained(MODEL_NAME)
10
 
11
  model = AutoModelForCausalLM.from_pretrained(
12
  MODEL_NAME,
13
- device_map="cpu", # ✅ force CPU
14
- torch_dtype=torch.float16 # ✅ safe on CPU
15
  )
16
 
17
  # Build pipeline
 
1
  import gradio as gr
2
  import torch
3
+ from transformers import AutoModelForCausalLM, AutoTokenizer, pipeline, BitsAndBytesConfig
4
 
5
  # Model name
6
  MODEL_NAME = "HuggingFaceH4/zephyr-7b-beta"
7
 
8
+ bnb_config = BitsAndBytesConfig(
9
+ load_in_4bit=True, # quantize to 4-bit
10
+ bnb_4bit_compute_dtype=torch.float16,
11
+ bnb_4bit_use_double_quant=True,
12
+ bnb_4bit_quant_type="nf4",
13
+ )
14
+
15
  # Load tokenizer and model for CPU
16
  tokenizer = AutoTokenizer.from_pretrained(MODEL_NAME)
17
 
18
  model = AutoModelForCausalLM.from_pretrained(
19
  MODEL_NAME,
20
+ device_map="auto",
21
+ torch_dtype=torch.float16
22
  )
23
 
24
  # Build pipeline