File size: 1,748 Bytes
0dd9c73
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
# Sources tierces et attributions

Ce projet redistribue ou dérive des ressources suivantes.

## Données

- **BODACC** (annonces commerciales, DILA/data.gouv.fr) — Licence Ouverte
  v2.0. Utilisé pour : jeux d'évaluation réels, pools de valeurs réelles.
- **INSEE base SIRENE** (StockUniteLegale) — Licence Ouverte v2.0.
  Utilisé pour : gazetteer des dénominations d'entreprises.
- **INSEE fichier des prénoms** (nat2022) — Licence Ouverte v2.0.
- **geo.api.gouv.fr / COG** (communes) — Licence Ouverte v2.0.
- **WikiNER-fr-gold** (danrun/WikiNER-fr-gold, HuggingFace) —
  **CC-BY-4.0**. Utilisé pour : jeu d'éval hors domaine et tranche du
  corpus d'entraînement. Attribution requise, y compris pour les modèles
  entraînés dessus.
- **Wikidata** (marques et éditeurs de logiciels) — CC0.
- **an-array-of-french-words** — MIT. Utilisé pour : filtre lexical du
  gazetteer.
- **ai4privacy/pii-masking-200k** — licence restrictive (usage commercial
  sur accord écrit). Utilisé UNIQUEMENT en évaluation comparative, JAMAIS
  en entraînement. Non redistribué.

## Modèles

- **cmarkea/distilcamembert-base** — MIT. Socle de nos fine-tunes.
- **almanach/camembert-base** — MIT. Socle de la variante 110M.
- **Jean-Baptiste/camembert-ner** — MIT. Moteur PERSON/CITY du pipeline.
- **Anonym-IA/V2-camembert-ner-pii-french** — MIT. Filet du pipeline
  serveur.

## Ce qui N'EST PAS publié

- Toute donnée réelle de correspondance (`data/private/`) : données
  personnelles de tiers, jamais versionnées ni redistribuées.
- Les fichiers de modèles et gazetteers volumineux : régénérables via les
  manifests (`data/*.manifest.json`) qui contiennent la commande exacte et
  le sha256 de contrôle.