t2p-onnx / README.md
sml-brrt's picture
Add model card with description, attribution and citation
95e24c0 verified
|
Raw
History Blame Contribute Delete
3.6 kB
---
language: fr
license: apache-2.0
tags:
- translation
- text2text-generation
- onnx
- int8
- french
- t5
- pictograms
- arasaac
---
# t2p-onnx
Version **ONNX quantifiée en INT8** du modèle [Propicto/t2p-t5-large-orfeo](https://huggingface.co/Propicto/t2p-t5-large-orfeo), optimisée pour l'inférence côté client avec [Transformers.js](https://huggingface.co/docs/transformers.js) et ONNX Runtime Web (WASM).
Ce modèle convertit du texte en français en séquences de pictogrammes [ARASAAC](https://arasaac.org/), destiné à la Communication Augmentée et Alternative (CAA).
## Modèle d'origine
Ce repo contient les poids ONNX INT8 dérivés du modèle PyTorch original :
> **[Propicto/t2p-t5-large-orfeo](https://huggingface.co/Propicto/t2p-t5-large-orfeo)**
Pour les détails sur l'entraînement, les datasets et les métriques d'évaluation, consultez la [fiche du modèle original](https://huggingface.co/Propicto/t2p-t5-large-orfeo).
## Utilisation avec Transformers.js
```javascript
import { AutoTokenizer, AutoModelForSeq2SeqLM } from "@huggingface/transformers";
const tokenizer = await AutoTokenizer.from_pretrained("sml-brrt/t2p-onnx");
const model = await AutoModelForSeq2SeqLM.from_pretrained("sml-brrt/t2p-onnx", {
device: "auto",
});
const inputs = tokenizer("Je mange une pomme");
const outputs = await model.generate({
inputs: inputs.input_ids,
attention_mask: inputs.attention_mask,
max_new_tokens: 40,
do_sample: true,
top_k: 30,
top_p: 0.95,
});
const pred = tokenizer.decode(outputs[0], { skip_special_tokens: true });
// → "me manger une pomme"
```
Le lexique associé (`lexicon.json`) permet de mapper les lemmes prédits aux identifiants de pictogrammes ARASAAC.
## Contenu du dépôt
| Fichier | Description |
|---|---|
| `config.json` | Configuration du modèle T5 |
| `tokenizer.json` | Tokenizer SentencePiece |
| `tokenizer_config.json` | Configuration du tokenizer |
| `special_tokens_map.json` | Mapping des tokens spéciaux |
| `generation_config.json` | Paramètres de génération |
| `spiece.model` | Modèle SentencePiece binaire |
| `lexicon.json` | Lexique lemme → ID pictogramme ARASAAC |
| `onnx/encoder_model.onnx` | Encodeur ONNX INT8 (105 Mo) |
| `onnx/decoder_model_merged.onnx` | Décodeur ONNX INT8 (133 Mo) |
## Attribution
Modèle développé par :
- Cécile Macaire
- Chloé Dion
- Emmanuelle Esperança-Rodier
- Benjamin Lecouteux
- Didier Schwab
Financement :
- GENCI-IDRIS (Grant 2023-AD011013625R1)
- PROPICTO ANR-20-CE93-0005
Conversion ONNX et intégration Transformers.js : [AEDE — PictoPhrase](https://circe.forge.apps.education.fr/aede/)
## Citation
Si vous utilisez ce modèle, veuillez citer le travail original :
```bibtex
@inproceedings{macaire_jeptaln2024,
title = {{Approches cascade et de bout-en-bout pour la traduction automatique de la parole en pictogrammes}},
author = {Macaire, C{\'e}cile and Dion, Chlo{\'e} and Schwab, Didier and Lecouteux, Benjamin and Esperan{\c c}a-Rodier, Emmanuelle},
url = {https://inria.hal.science/hal-04623007},
booktitle = {{35{\`e}mes Journ{\'e}es d'{\'E}tudes sur la Parole (JEP 2024) 31{\`e}me Conf{\'e}rence sur le Traitement Automatique des Langues Naturelles (TALN 2024) 26{\`e}me Rencontre des {\'E}tudiants Chercheurs en Informatique pour le Traitement Automatique des Langues (RECITAL 2024)}},
address = {Toulouse, France},
publisher = {{ATALA \& AFPC}},
volume = {1 : articles longs et prises de position},
pages = {22-35},
year = {2024}
}
```
## Licence
Apache-2.0 (identique au modèle d'origine)