from fastapi import FastAPI from pydantic import BaseModel from transformers import AutoModelForCausalLM, AutoTokenizer import torch app = FastAPI() # Load model & tokenizer model_name = "your-username/your-finetuned-model" tokenizer = AutoTokenizer.from_pretrained(model_name) model = AutoModelForCausalLM.from_pretrained(model_name) class Query(BaseModel): text: str @app.post("/generate") def generate_text(query: Query): inputs = tokenizer(query.text, return_tensors="pt") outputs = model.generate(**inputs, max_new_tokens=100) return {"response": tokenizer.decode(outputs[0], skip_special_tokens=True)}