huckiyang commited on
Commit
9d32e56
·
verified ·
1 Parent(s): 7ba905e

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +1 -1
README.md CHANGED
@@ -42,7 +42,7 @@ print(tok.decode(greedy_generate(model, config, ids, max_new_tokens=64)))
42
 
43
  ## Run on a single Mac with SSD expert-offload
44
 
45
- ![How mlx-moe-offload works](https://github.com/huckiyang/mlx-moe-offload/blob/main/tests/offload-diagram.svg)
46
 
47
  ~315 GB doesn't fit a 192 GB Mac resident — but an MoE only fires **6 of 256** experts per
48
  token, so you can keep the always-needed weights in RAM (attention, shared experts, embeddings,
 
42
 
43
  ## Run on a single Mac with SSD expert-offload
44
 
45
+ - See image of SSD expert-offload in: github.com/huckiyang/mlx-moe-offload
46
 
47
  ~315 GB doesn't fit a 192 GB Mac resident — but an MoE only fires **6 of 256** experts per
48
  token, so you can keep the always-needed weights in RAM (attention, shared experts, embeddings,