NerKor huBERT magyar névfelismerő — ONNX
Ez a tároló kizárólag formátum-átalakítás: az NYTK/named-entity-recognition-nerkor-hubert-hungarian modell súlyai ONNX formátumban, hogy PyTorch nélkül is futtatható legyen.
A modellt a Nyelvtudományi Kutatóközpont (NYTK) készítette és tanította. A súlyok az övék, változatlanul. Itt semmilyen újratanítás, finomhangolás vagy súlymódosítás nem történt.
Miért van erre szükség
Az eredeti tároló pytorch_model.bin-t közöl, futtatható ONNX-et nem. Egy asztali
programban, ahol nincs Python és nincs PyTorch, ez a súly nem használható. Az
átalakítást build-időben végeztük el, egyszer, és az eredményt tesszük itt közzé —
hogy másnak ne kelljen ugyanezt megcsinálnia.
Amit tartalmaz
| fájl | méret | SHA-256 |
|---|---|---|
model.onnx |
440 342 356 | 3c8c8dd3f2d53fd7e39e331b14aeacac3fbc32f65956781c9be77662bca06b0a |
config.json |
1 186 | b9aaf13a05a9799bff07fb12375f331f063309c1df1ac1dd6fcba4449ac321c4 |
tokenizer.json |
775 747 | 464f917e97aa6f96a10af4f9f17351b4fb4ba0986270982caf864f8e50690d2d |
A SHA256SUMS.json ugyanezeket tartalmazza gépi alakban. Érdemes ellenőrizni: egy
félbemásolt hálófájl nem száll el, hanem csendben rosszabb eredményt ad.
Az átalakítás módja
torch 2.5.1+cu121 · opset 17 · do_constant_folding
exportálva: 2026-08-25
Az export a súlyokat változatlanul veszi át; a gráf a BertForTokenClassification
szokásos szerkezete. A pytorch_model.bin betöltése weights_only=True-val ment, és
az exportáló ellenőrizte, hogy egyetlen tenzor sem maradt ki (200 tenzor, 0 hiányzó).
Címkék
9 osztály, BIO-jelöléssel: B-PER, I-PER, B-ORG, I-ORG, B-LOC, I-LOC, B-MISC, I-MISC, O
Használat
Bemenet: input_ids, attention_mask (és ha a gráf kéri, token_type_ids), mind
int64, alakjuk [1, N]. Kimenet: logits, alakja [1, N, 9].
Két dolog, ami magyar szövegnél elrontja az eredményt, ha nem figyelsz rá:
Az ékezetet nem szabad levenni, és nem szabad kisbetűsíteni. A szótár ékezetes:
a Kovács egyetlen elem (7252), a Kovacs viszont nincs benne, tehát [UNK]-ká
esne szét. A tokenizer.json normalizálója ezt ki is mondja
({"strip_accents": null, "lowercase": false}).
A címke csak a szó ELSŐ aldarabjára érvényes. A tanításkor a folytatások
(##-darabok) ki vannak hagyva a veszteségből, tehát a modell jóslata ott
betanítatlan. Ha a BIO-címkéket token szinten fűzöd össze, a Szentendrei Járásbíróság szétesik Szentend + rei Járásbíróság alakra, a Szabóval-ból
pedig Szabó lesz, és a val kimarad. Szó szinten kell összefűzni: a címke a szó
első darabjától jön, a tartomány viszont az egész szóé.
Licenc
Apache-2.0, ugyanaz, mint az eredeti modellé. Az eredeti mű a NYTK-é; itt a formátum változott, a súlyok nem.
Hivatkozás
Ha a modellt használod, az eredeti alkotókat idézd: NYTK/named-entity-recognition-nerkor-hubert-hungarian
- Downloads last month
- -