language: fr
license: apache-2.0
tags:
- translation
- text2text-generation
- onnx
- int8
- french
- t5
- pictograms
- arasaac
t2p-onnx
Version ONNX quantifiée en INT8 du modèle Propicto/t2p-t5-large-orfeo, optimisée pour l'inférence côté client avec Transformers.js et ONNX Runtime Web (WASM).
Ce modèle convertit du texte en français en séquences de pictogrammes ARASAAC, destiné à la Communication Augmentée et Alternative (CAA).
Modèle d'origine
Ce repo contient les poids ONNX INT8 dérivés du modèle PyTorch original :
Pour les détails sur l'entraînement, les datasets et les métriques d'évaluation, consultez la fiche du modèle original.
Utilisation avec Transformers.js
import { AutoTokenizer, AutoModelForSeq2SeqLM } from "@huggingface/transformers";
const tokenizer = await AutoTokenizer.from_pretrained("sml-brrt/t2p-onnx");
const model = await AutoModelForSeq2SeqLM.from_pretrained("sml-brrt/t2p-onnx", {
device: "auto",
});
const inputs = tokenizer("Je mange une pomme");
const outputs = await model.generate({
inputs: inputs.input_ids,
attention_mask: inputs.attention_mask,
max_new_tokens: 40,
do_sample: true,
top_k: 30,
top_p: 0.95,
});
const pred = tokenizer.decode(outputs[0], { skip_special_tokens: true });
// → "me manger une pomme"
Le lexique associé (lexicon.json) permet de mapper les lemmes prédits aux identifiants de pictogrammes ARASAAC.
Contenu du dépôt
| Fichier | Description |
|---|---|
config.json |
Configuration du modèle T5 |
tokenizer.json |
Tokenizer SentencePiece |
tokenizer_config.json |
Configuration du tokenizer |
special_tokens_map.json |
Mapping des tokens spéciaux |
generation_config.json |
Paramètres de génération |
spiece.model |
Modèle SentencePiece binaire |
lexicon.json |
Lexique lemme → ID pictogramme ARASAAC |
onnx/encoder_model.onnx |
Encodeur ONNX INT8 (105 Mo) |
onnx/decoder_model_merged.onnx |
Décodeur ONNX INT8 (133 Mo) |
Attribution
Modèle développé par :
- Cécile Macaire
- Chloé Dion
- Emmanuelle Esperança-Rodier
- Benjamin Lecouteux
- Didier Schwab
Financement :
- GENCI-IDRIS (Grant 2023-AD011013625R1)
- PROPICTO ANR-20-CE93-0005
Conversion ONNX et intégration Transformers.js : AEDE — PictoPhrase
Citation
Si vous utilisez ce modèle, veuillez citer le travail original :
@inproceedings{macaire_jeptaln2024,
title = {{Approches cascade et de bout-en-bout pour la traduction automatique de la parole en pictogrammes}},
author = {Macaire, C{\'e}cile and Dion, Chlo{\'e} and Schwab, Didier and Lecouteux, Benjamin and Esperan{\c c}a-Rodier, Emmanuelle},
url = {https://inria.hal.science/hal-04623007},
booktitle = {{35{\`e}mes Journ{\'e}es d'{\'E}tudes sur la Parole (JEP 2024) 31{\`e}me Conf{\'e}rence sur le Traitement Automatique des Langues Naturelles (TALN 2024) 26{\`e}me Rencontre des {\'E}tudiants Chercheurs en Informatique pour le Traitement Automatique des Langues (RECITAL 2024)}},
address = {Toulouse, France},
publisher = {{ATALA \& AFPC}},
volume = {1 : articles longs et prises de position},
pages = {22-35},
year = {2024}
}
Licence
Apache-2.0 (identique au modèle d'origine)