--- language: fr license: apache-2.0 tags: - translation - text2text-generation - onnx - int8 - french - t5 - pictograms - arasaac --- # t2p-onnx Version **ONNX quantifiée en INT8** du modèle [Propicto/t2p-t5-large-orfeo](https://huggingface.co/Propicto/t2p-t5-large-orfeo), optimisée pour l'inférence côté client avec [Transformers.js](https://huggingface.co/docs/transformers.js) et ONNX Runtime Web (WASM). Ce modèle convertit du texte en français en séquences de pictogrammes [ARASAAC](https://arasaac.org/), destiné à la Communication Augmentée et Alternative (CAA). ## Modèle d'origine Ce repo contient les poids ONNX INT8 dérivés du modèle PyTorch original : > **[Propicto/t2p-t5-large-orfeo](https://huggingface.co/Propicto/t2p-t5-large-orfeo)** Pour les détails sur l'entraînement, les datasets et les métriques d'évaluation, consultez la [fiche du modèle original](https://huggingface.co/Propicto/t2p-t5-large-orfeo). ## Utilisation avec Transformers.js ```javascript import { AutoTokenizer, AutoModelForSeq2SeqLM } from "@huggingface/transformers"; const tokenizer = await AutoTokenizer.from_pretrained("sml-brrt/t2p-onnx"); const model = await AutoModelForSeq2SeqLM.from_pretrained("sml-brrt/t2p-onnx", { device: "auto", }); const inputs = tokenizer("Je mange une pomme"); const outputs = await model.generate({ inputs: inputs.input_ids, attention_mask: inputs.attention_mask, max_new_tokens: 40, do_sample: true, top_k: 30, top_p: 0.95, }); const pred = tokenizer.decode(outputs[0], { skip_special_tokens: true }); // → "me manger une pomme" ``` Le lexique associé (`lexicon.json`) permet de mapper les lemmes prédits aux identifiants de pictogrammes ARASAAC. ## Contenu du dépôt | Fichier | Description | |---|---| | `config.json` | Configuration du modèle T5 | | `tokenizer.json` | Tokenizer SentencePiece | | `tokenizer_config.json` | Configuration du tokenizer | | `special_tokens_map.json` | Mapping des tokens spéciaux | | `generation_config.json` | Paramètres de génération | | `spiece.model` | Modèle SentencePiece binaire | | `lexicon.json` | Lexique lemme → ID pictogramme ARASAAC | | `onnx/encoder_model.onnx` | Encodeur ONNX INT8 (105 Mo) | | `onnx/decoder_model_merged.onnx` | Décodeur ONNX INT8 (133 Mo) | ## Attribution Modèle développé par : - Cécile Macaire - Chloé Dion - Emmanuelle Esperança-Rodier - Benjamin Lecouteux - Didier Schwab Financement : - GENCI-IDRIS (Grant 2023-AD011013625R1) - PROPICTO ANR-20-CE93-0005 Conversion ONNX et intégration Transformers.js : [AEDE — PictoPhrase](https://circe.forge.apps.education.fr/aede/) ## Citation Si vous utilisez ce modèle, veuillez citer le travail original : ```bibtex @inproceedings{macaire_jeptaln2024, title = {{Approches cascade et de bout-en-bout pour la traduction automatique de la parole en pictogrammes}}, author = {Macaire, C{\'e}cile and Dion, Chlo{\'e} and Schwab, Didier and Lecouteux, Benjamin and Esperan{\c c}a-Rodier, Emmanuelle}, url = {https://inria.hal.science/hal-04623007}, booktitle = {{35{\`e}mes Journ{\'e}es d'{\'E}tudes sur la Parole (JEP 2024) 31{\`e}me Conf{\'e}rence sur le Traitement Automatique des Langues Naturelles (TALN 2024) 26{\`e}me Rencontre des {\'E}tudiants Chercheurs en Informatique pour le Traitement Automatique des Langues (RECITAL 2024)}}, address = {Toulouse, France}, publisher = {{ATALA \& AFPC}}, volume = {1 : articles longs et prises de position}, pages = {22-35}, year = {2024} } ``` ## Licence Apache-2.0 (identique au modèle d'origine)