nonsodev's picture
Add custom handler: fix token_type_ids for DistilBERT inference
0d9299d verified
Raw
History Blame Contribute Delete
1.24 kB
from typing import Any, Dict, List
from transformers import AutoModelForSequenceClassification, AutoTokenizer
import torch
class EndpointHandler:
def __init__(self, path=""):
self.tokenizer = AutoTokenizer.from_pretrained(path)
self.model = AutoModelForSequenceClassification.from_pretrained(path)
self.model.eval()
def __call__(self, data: Dict[str, Any]) -> List[Dict]:
inputs_text = data.pop("inputs", data)
if isinstance(inputs_text, str):
inputs_text = [inputs_text]
encoded = self.tokenizer(
inputs_text,
return_tensors="pt",
padding=True,
truncation=True,
return_token_type_ids=False,
)
with torch.no_grad():
logits = self.model(**encoded).logits
scores = torch.softmax(logits, dim=-1)
id2label = self.model.config.id2label
results = []
for row in scores:
label_scores = sorted(
[{"label": id2label[i], "score": float(row[i])} for i in range(len(row))],
key=lambda x: -x["score"],
)
results.append(label_scores)
return results if len(results) > 1 else results[0]