# Sources tierces et attributions Ce projet redistribue ou dérive des ressources suivantes. ## Données - **BODACC** (annonces commerciales, DILA/data.gouv.fr) — Licence Ouverte v2.0. Utilisé pour : jeux d'évaluation réels, pools de valeurs réelles. - **INSEE base SIRENE** (StockUniteLegale) — Licence Ouverte v2.0. Utilisé pour : gazetteer des dénominations d'entreprises. - **INSEE fichier des prénoms** (nat2022) — Licence Ouverte v2.0. - **geo.api.gouv.fr / COG** (communes) — Licence Ouverte v2.0. - **WikiNER-fr-gold** (danrun/WikiNER-fr-gold, HuggingFace) — **CC-BY-4.0**. Utilisé pour : jeu d'éval hors domaine et tranche du corpus d'entraînement. Attribution requise, y compris pour les modèles entraînés dessus. - **Wikidata** (marques et éditeurs de logiciels) — CC0. - **an-array-of-french-words** — MIT. Utilisé pour : filtre lexical du gazetteer. - **ai4privacy/pii-masking-200k** — licence restrictive (usage commercial sur accord écrit). Utilisé UNIQUEMENT en évaluation comparative, JAMAIS en entraînement. Non redistribué. ## Modèles - **cmarkea/distilcamembert-base** — MIT. Socle de nos fine-tunes. - **almanach/camembert-base** — MIT. Socle de la variante 110M. - **Jean-Baptiste/camembert-ner** — MIT. Moteur PERSON/CITY du pipeline. - **Anonym-IA/V2-camembert-ner-pii-french** — MIT. Filet du pipeline serveur. ## Ce qui N'EST PAS publié - Toute donnée réelle de correspondance (`data/private/`) : données personnelles de tiers, jamais versionnées ni redistribuées. - Les fichiers de modèles et gazetteers volumineux : régénérables via les manifests (`data/*.manifest.json`) qui contiennent la commande exacte et le sha256 de contrôle.