from transformers import AutoModelForCausalLM, AutoTokenizer import torch model_name = "/Users/alpha/model/GPT-X2.5-135M" tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True) model = AutoModelForCausalLM.from_pretrained( model_name, trust_remote_code=True, dtype=torch.float32 ) prompt = "The main is" inputs = tokenizer(prompt, return_tensors="pt").to(model.device) with torch.inference_mode(): output = model.generate( **inputs, max_new_tokens=120, temperature=0.8 ) print(tokenizer.decode(output[0], skip_special_tokens=True))