How to use from the
Use from the
Transformers library
# Use a pipeline as a high-level helper
from transformers import pipeline

pipe = pipeline("text-generation", model="TransformerTales/llama-2-7b-8bit-nested")
# Load model directly
from transformers import AutoTokenizer, AutoModelForCausalLM

tokenizer = AutoTokenizer.from_pretrained("TransformerTales/llama-2-7b-8bit-nested")
model = AutoModelForCausalLM.from_pretrained("TransformerTales/llama-2-7b-8bit-nested", device_map="auto")
Quick Links

I used Google Colab to quantize/nest the Llama 2 7B model. Should help out those who wish to use Llama 2 7B on a low-end computer. GPU is still recomended...

Downloads last month
6
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support