File size: 1,337 Bytes
5329bd8 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 | from transformers import AutoTokenizer, AutoModel
import torch
import os
from sklearn.metrics.pairwise import cosine_similarity
# Initialisation de DarkBERT
tokenizer = AutoTokenizer.from_pretrained("kakaobrain/DarkBERT")
model = AutoModel.from_pretrained("kakaobrain/DarkBERT").to("cuda")
def analyser_fichier(chemin):
with open(chemin, "r", encoding="utf-8") as f:
texte = f.read()
inputs = tokenizer(texte, return_tensors="pt", truncation=True, max_length=512).to("cuda")
with torch.no_grad():
sorties = model(**inputs)
return sorties.last_hidden_state.mean(dim=1).cpu().numpy()
# Parcours des fichiers sur le bureau
bureau = "C:/Users/Utilisateur/Desktop"
fichiers = [f for f in os.listdir(bureau) if f.endswith(('.txt', '.csv'))][:2]
resultats = {}
for fichier in fichiers:
chemin = os.path.join(bureau, fichier)
resultats[fichier] = analyser_fichier(chemin)
print(f"Fichier {fichier} traité - Dimension embedding: {resultats[fichier].shape}")
# Calcul de la similarité sémantique
if len(fichiers) == 2:
similarite = cosine_similarity(resultats[fichiers[0]], resultats[fichiers[1]])[0][0]
print(f"\nSimilarité sémantique entre les fichiers : {similarite:.2f}")
else:
print("\nMoins de deux fichiers trouvés pour comparer.")
|