t2p-onnx

Version ONNX quantifiée en INT8 du modèle Propicto/t2p-t5-large-orfeo, optimisée pour l'inférence côté client avec Transformers.js et ONNX Runtime Web (WASM).

Ce modèle convertit du texte en français en séquences de pictogrammes ARASAAC, destiné à la Communication Augmentée et Alternative (CAA).

Modèle d'origine

Ce repo contient les poids ONNX INT8 dérivés du modèle PyTorch original :

Propicto/t2p-t5-large-orfeo

Pour les détails sur l'entraînement, les datasets et les métriques d'évaluation, consultez la fiche du modèle original.

Utilisation avec Transformers.js

import { AutoTokenizer, AutoModelForSeq2SeqLM } from "@huggingface/transformers";

const tokenizer = await AutoTokenizer.from_pretrained("sml-brrt/t2p-onnx");
const model = await AutoModelForSeq2SeqLM.from_pretrained("sml-brrt/t2p-onnx", {
  device: "auto",
});

const inputs = tokenizer("Je mange une pomme");
const outputs = await model.generate({
  inputs: inputs.input_ids,
  attention_mask: inputs.attention_mask,
  max_new_tokens: 40,
  do_sample: true,
  top_k: 30,
  top_p: 0.95,
});
const pred = tokenizer.decode(outputs[0], { skip_special_tokens: true });
// → "me manger une pomme"

Le lexique associé (lexicon.json) permet de mapper les lemmes prédits aux identifiants de pictogrammes ARASAAC.

Contenu du dépôt

Fichier Description
config.json Configuration du modèle T5
tokenizer.json Tokenizer SentencePiece
tokenizer_config.json Configuration du tokenizer
special_tokens_map.json Mapping des tokens spéciaux
generation_config.json Paramètres de génération
spiece.model Modèle SentencePiece binaire
lexicon.json Lexique lemme → ID pictogramme ARASAAC
onnx/encoder_model.onnx Encodeur ONNX INT8 (105 Mo)
onnx/decoder_model_merged.onnx Décodeur ONNX INT8 (133 Mo)

Attribution

Modèle développé par :

  • Cécile Macaire
  • Chloé Dion
  • Emmanuelle Esperança-Rodier
  • Benjamin Lecouteux
  • Didier Schwab

Financement :

  • GENCI-IDRIS (Grant 2023-AD011013625R1)
  • PROPICTO ANR-20-CE93-0005

Conversion ONNX et intégration Transformers.js : AEDE — PictoPhrase

Citation

Si vous utilisez ce modèle, veuillez citer le travail original :

@inproceedings{macaire_jeptaln2024,
  title = {{Approches cascade et de bout-en-bout pour la traduction automatique de la parole en pictogrammes}},
  author = {Macaire, C{\'e}cile and Dion, Chlo{\'e} and Schwab, Didier and Lecouteux, Benjamin and Esperan{\c c}a-Rodier, Emmanuelle},
  url = {https://inria.hal.science/hal-04623007},
  booktitle = {{35{\`e}mes Journ{\'e}es d'{\'E}tudes sur la Parole (JEP 2024) 31{\`e}me Conf{\'e}rence sur le Traitement Automatique des Langues Naturelles (TALN 2024) 26{\`e}me Rencontre des {\'E}tudiants Chercheurs en Informatique pour le Traitement Automatique des Langues (RECITAL 2024)}},
  address = {Toulouse, France},
  publisher = {{ATALA \& AFPC}},
  volume = {1 : articles longs et prises de position},
  pages = {22-35},
  year = {2024}
}

Licence

Apache-2.0 (identique au modèle d'origine)

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support