| language: vi | |
| license: cc-by-nc-sa-4.0 | |
| library_name: pytorch | |
| tags: | |
| - esg | |
| - phobert | |
| - multi-label | |
| - vietnamese | |
| - text-classification | |
| # huypham71/esg-topic | |
| PhoBERT multi-head (sigmoid) cho ESG — backbone `vinai/phobert-base`, các đầu: `['env', 'soc', 'gov']`. | |
| Đây là kiến trúc **tùy biến** (một encoder + nhiều đầu nhị phân độc lập, masked BCE), | |
| KHÔNG phải `AutoModelForSequenceClassification`, nên cần dùng code `esgwash` để tải. | |
| - **Thresholds theo từng đầu** (tune trên tập val, tối đa hóa F1): `{'env': 0.27, 'soc': 0.13, 'gov': 0.46}` | |
| - File: `model.safetensors` (backbone + các đầu), tokenizer PhoBERT, `config.json`. | |
| ## Cách tải | |
| ```python | |
| import json | |
| from esgwash.models.trainer import MultiHeadTrainer | |
| from huggingface_hub import snapshot_download | |
| d = snapshot_download("huypham71/esg-topic") | |
| cfg = json.load(open(f"{d}/config.json")) | |
| model = MultiHeadTrainer(cfg).load(d) | |
| probs = model.predict_proba(["câu tiếng Việt ..."]) # tự word-segment bên trong | |
| ``` | |