| from transformers import BertTokenizer, BertModel | |
| import torch | |
| # Charger le tokenizer et le modèle | |
| tokenizer = BertTokenizer.from_pretrained('bert-base-uncased') | |
| model = BertModel.from_pretrained('bert-base-uncased') | |
| # Exemple de texte | |
| text = "Voici un exemple de texte." | |
| # Tokeniser le texte | |
| inputs = tokenizer(text, return_tensors='pt') | |
| # Obtenir les embeddings | |
| outputs = model(**inputs) | |
| # Sauvegarder les embeddings dans un fichier | |
| embeddings = outputs.last_hidden_state | |
| torch.save(embeddings, 'embeddings.pt') | |
| print("Embeddings sauvegardés dans 'embeddings.pt'") |