NerKor huBERT magyar névfelismerő — ONNX

Ez a tároló kizárólag formátum-átalakítás: az NYTK/named-entity-recognition-nerkor-hubert-hungarian modell súlyai ONNX formátumban, hogy PyTorch nélkül is futtatható legyen.

A modellt a Nyelvtudományi Kutatóközpont (NYTK) készítette és tanította. A súlyok az övék, változatlanul. Itt semmilyen újratanítás, finomhangolás vagy súlymódosítás nem történt.

Miért van erre szükség

Az eredeti tároló pytorch_model.bin-t közöl, futtatható ONNX-et nem. Egy asztali programban, ahol nincs Python és nincs PyTorch, ez a súly nem használható. Az átalakítást build-időben végeztük el, egyszer, és az eredményt tesszük itt közzé — hogy másnak ne kelljen ugyanezt megcsinálnia.

Amit tartalmaz

fájl méret SHA-256
model.onnx 440 342 356 3c8c8dd3f2d53fd7e39e331b14aeacac3fbc32f65956781c9be77662bca06b0a
config.json 1 186 b9aaf13a05a9799bff07fb12375f331f063309c1df1ac1dd6fcba4449ac321c4
tokenizer.json 775 747 464f917e97aa6f96a10af4f9f17351b4fb4ba0986270982caf864f8e50690d2d

A SHA256SUMS.json ugyanezeket tartalmazza gépi alakban. Érdemes ellenőrizni: egy félbemásolt hálófájl nem száll el, hanem csendben rosszabb eredményt ad.

Az átalakítás módja

torch 2.5.1+cu121 · opset 17 · do_constant_folding
exportálva: 2026-08-25

Az export a súlyokat változatlanul veszi át; a gráf a BertForTokenClassification szokásos szerkezete. A pytorch_model.bin betöltése weights_only=True-val ment, és az exportáló ellenőrizte, hogy egyetlen tenzor sem maradt ki (200 tenzor, 0 hiányzó).

Címkék

9 osztály, BIO-jelöléssel: B-PER, I-PER, B-ORG, I-ORG, B-LOC, I-LOC, B-MISC, I-MISC, O

Használat

Bemenet: input_ids, attention_mask (és ha a gráf kéri, token_type_ids), mind int64, alakjuk [1, N]. Kimenet: logits, alakja [1, N, 9].

Két dolog, ami magyar szövegnél elrontja az eredményt, ha nem figyelsz rá:

Az ékezetet nem szabad levenni, és nem szabad kisbetűsíteni. A szótár ékezetes: a Kovács egyetlen elem (7252), a Kovacs viszont nincs benne, tehát [UNK]-ká esne szét. A tokenizer.json normalizálója ezt ki is mondja ({"strip_accents": null, "lowercase": false}).

A címke csak a szó ELSŐ aldarabjára érvényes. A tanításkor a folytatások (##-darabok) ki vannak hagyva a veszteségből, tehát a modell jóslata ott betanítatlan. Ha a BIO-címkéket token szinten fűzöd össze, a Szentendrei Járásbíróság szétesik Szentend + rei Járásbíróság alakra, a Szabóval-ból pedig Szabó lesz, és a val kimarad. Szó szinten kell összefűzni: a címke a szó első darabjától jön, a tartomány viszont az egész szóé.

Licenc

Apache-2.0, ugyanaz, mint az eredeti modellé. Az eredeti mű a NYTK-é; itt a formátum változott, a súlyok nem.

Hivatkozás

Ha a modellt használod, az eredeti alkotókat idézd: NYTK/named-entity-recognition-nerkor-hubert-hungarian

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for foltin/nerkor-hubert-hungarian-onnx

Quantized
(1)
this model