noirci / NOTICE
5000.dev
Noirci v14-base : detection de donnees personnelles en francais
0dd9c73
Raw
History Blame Contribute Delete
1.75 kB
# Sources tierces et attributions
Ce projet redistribue ou dérive des ressources suivantes.
## Données
- **BODACC** (annonces commerciales, DILA/data.gouv.fr) — Licence Ouverte
v2.0. Utilisé pour : jeux d'évaluation réels, pools de valeurs réelles.
- **INSEE base SIRENE** (StockUniteLegale) — Licence Ouverte v2.0.
Utilisé pour : gazetteer des dénominations d'entreprises.
- **INSEE fichier des prénoms** (nat2022) — Licence Ouverte v2.0.
- **geo.api.gouv.fr / COG** (communes) — Licence Ouverte v2.0.
- **WikiNER-fr-gold** (danrun/WikiNER-fr-gold, HuggingFace) —
**CC-BY-4.0**. Utilisé pour : jeu d'éval hors domaine et tranche du
corpus d'entraînement. Attribution requise, y compris pour les modèles
entraînés dessus.
- **Wikidata** (marques et éditeurs de logiciels) — CC0.
- **an-array-of-french-words** — MIT. Utilisé pour : filtre lexical du
gazetteer.
- **ai4privacy/pii-masking-200k** — licence restrictive (usage commercial
sur accord écrit). Utilisé UNIQUEMENT en évaluation comparative, JAMAIS
en entraînement. Non redistribué.
## Modèles
- **cmarkea/distilcamembert-base** — MIT. Socle de nos fine-tunes.
- **almanach/camembert-base** — MIT. Socle de la variante 110M.
- **Jean-Baptiste/camembert-ner** — MIT. Moteur PERSON/CITY du pipeline.
- **Anonym-IA/V2-camembert-ner-pii-french** — MIT. Filet du pipeline
serveur.
## Ce qui N'EST PAS publié
- Toute donnée réelle de correspondance (`data/private/`) : données
personnelles de tiers, jamais versionnées ni redistribuées.
- Les fichiers de modèles et gazetteers volumineux : régénérables via les
manifests (`data/*.manifest.json`) qui contiennent la commande exacte et
le sha256 de contrôle.