| --- |
| language: fr |
| license: apache-2.0 |
| tags: |
| - translation |
| - text2text-generation |
| - onnx |
| - int8 |
| - french |
| - t5 |
| - pictograms |
| - arasaac |
| --- |
| |
| # t2p-onnx |
|
|
| Version **ONNX quantifiée en INT8** du modèle [Propicto/t2p-t5-large-orfeo](https://huggingface.co/Propicto/t2p-t5-large-orfeo), optimisée pour l'inférence côté client avec [Transformers.js](https://huggingface.co/docs/transformers.js) et ONNX Runtime Web (WASM). |
|
|
| Ce modèle convertit du texte en français en séquences de pictogrammes [ARASAAC](https://arasaac.org/), destiné à la Communication Augmentée et Alternative (CAA). |
|
|
| ## Modèle d'origine |
|
|
| Ce repo contient les poids ONNX INT8 dérivés du modèle PyTorch original : |
|
|
| > **[Propicto/t2p-t5-large-orfeo](https://huggingface.co/Propicto/t2p-t5-large-orfeo)** |
|
|
| Pour les détails sur l'entraînement, les datasets et les métriques d'évaluation, consultez la [fiche du modèle original](https://huggingface.co/Propicto/t2p-t5-large-orfeo). |
|
|
| ## Utilisation avec Transformers.js |
|
|
| ```javascript |
| import { AutoTokenizer, AutoModelForSeq2SeqLM } from "@huggingface/transformers"; |
| |
| const tokenizer = await AutoTokenizer.from_pretrained("sml-brrt/t2p-onnx"); |
| const model = await AutoModelForSeq2SeqLM.from_pretrained("sml-brrt/t2p-onnx", { |
| device: "auto", |
| }); |
| |
| const inputs = tokenizer("Je mange une pomme"); |
| const outputs = await model.generate({ |
| inputs: inputs.input_ids, |
| attention_mask: inputs.attention_mask, |
| max_new_tokens: 40, |
| do_sample: true, |
| top_k: 30, |
| top_p: 0.95, |
| }); |
| const pred = tokenizer.decode(outputs[0], { skip_special_tokens: true }); |
| // → "me manger une pomme" |
| ``` |
|
|
| Le lexique associé (`lexicon.json`) permet de mapper les lemmes prédits aux identifiants de pictogrammes ARASAAC. |
|
|
| ## Contenu du dépôt |
|
|
| | Fichier | Description | |
| |---|---| |
| | `config.json` | Configuration du modèle T5 | |
| | `tokenizer.json` | Tokenizer SentencePiece | |
| | `tokenizer_config.json` | Configuration du tokenizer | |
| | `special_tokens_map.json` | Mapping des tokens spéciaux | |
| | `generation_config.json` | Paramètres de génération | |
| | `spiece.model` | Modèle SentencePiece binaire | |
| | `lexicon.json` | Lexique lemme → ID pictogramme ARASAAC | |
| | `onnx/encoder_model.onnx` | Encodeur ONNX INT8 (105 Mo) | |
| | `onnx/decoder_model_merged.onnx` | Décodeur ONNX INT8 (133 Mo) | |
|
|
| ## Attribution |
|
|
| Modèle développé par : |
|
|
| - Cécile Macaire |
| - Chloé Dion |
| - Emmanuelle Esperança-Rodier |
| - Benjamin Lecouteux |
| - Didier Schwab |
|
|
| Financement : |
|
|
| - GENCI-IDRIS (Grant 2023-AD011013625R1) |
| - PROPICTO ANR-20-CE93-0005 |
|
|
| Conversion ONNX et intégration Transformers.js : [AEDE — PictoPhrase](https://circe.forge.apps.education.fr/aede/) |
|
|
| ## Citation |
|
|
| Si vous utilisez ce modèle, veuillez citer le travail original : |
|
|
| ```bibtex |
| @inproceedings{macaire_jeptaln2024, |
| title = {{Approches cascade et de bout-en-bout pour la traduction automatique de la parole en pictogrammes}}, |
| author = {Macaire, C{\'e}cile and Dion, Chlo{\'e} and Schwab, Didier and Lecouteux, Benjamin and Esperan{\c c}a-Rodier, Emmanuelle}, |
| url = {https://inria.hal.science/hal-04623007}, |
| booktitle = {{35{\`e}mes Journ{\'e}es d'{\'E}tudes sur la Parole (JEP 2024) 31{\`e}me Conf{\'e}rence sur le Traitement Automatique des Langues Naturelles (TALN 2024) 26{\`e}me Rencontre des {\'E}tudiants Chercheurs en Informatique pour le Traitement Automatique des Langues (RECITAL 2024)}}, |
| address = {Toulouse, France}, |
| publisher = {{ATALA \& AFPC}}, |
| volume = {1 : articles longs et prises de position}, |
| pages = {22-35}, |
| year = {2024} |
| } |
| ``` |
|
|
| ## Licence |
|
|
| Apache-2.0 (identique au modèle d'origine) |
|
|