File size: 2,654 Bytes
8f31068
308d297
 
 
 
8f31068
308d297
8f31068
 
 
 
308d297
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
---
title: TRACER Scan
emoji: 🔍
colorFrom: blue
colorTo: indigo
sdk: gradio
sdk_version: 4.44.0
app_file: app.py
pinned: false
---

# TRACER scan — testeur de dataset (HuggingFace Space)

Version Space de l'outil de test `tracer scan` : upload un ou plusieurs
`.jsonl` compatibles TRACER, choisis l'embedder / le target / le mode
thin-data, récupère le résumé + le rapport HTML interactif — sans souci
réseau/SSL puisque ça tourne directement sur l'infra HuggingFace.

## Déploiement

1. Va sur https://huggingface.co/new-space
2. SDK : **Gradio** — Hardware : **CPU basic** suffit largement (le modèle
   d'embedding par défaut est petit, ~470 Mo)
3. Une fois le Space créé, à sa racine :
   - remplace le `README.md` généré par **ce fichier** (garde bien le
     frontmatter YAML tout en haut, c'est ce qui dit à HF comment lancer
     l'app)
   - ajoute `app.py`
   - renomme `requirements_space.txt` en `requirements.txt` et ajoute-le
4. Le Space build automatiquement (quelques minutes la 1ère fois, le temps
   d'installer torch/transformers/sentence-transformers) puis expose l'UI

## Utilisation

- **Fichier(s)** : glisse un ou plusieurs `.jsonl` (`input`+`teacher`, alias
  tolérés : `query`/`text`/`prompt`/`question` et
  `label`/`intent`/`output`/`answer`)
- **Embedder** : `paraphrase-multilingual-MiniLM-L12-v2` par défaut (celui de
  `fit_tracer.py`), ou passe `BAAI/bge-m3` (celui exigé par la spec) — le
  menu accepte aussi n'importe quel nom de modèle sentence-transformers en
  saisie libre
- **Target primaire** : celui du rapport HTML détaillé (défaut 0.95)
- **Targets de balayage** : liste séparée par virgules, affichée dans le
  résumé texte (un seul calcul d'embeddings, réutilisé pour tous les
  targets du balayage)
- **Mode thin-data** : `auto` applique `--force` sous 1000 traces (comme le
  vrai comportement `tracer scan`), `forcer` l'impose toujours, `refuser`
  échoue proprement en dessous du seuil
- Le résumé terminal-like et le rapport HTML (aperçu + téléchargement)
  apparaissent à droite après clic sur "Lancer le scan"

## Note sur le cache

Le cache d'embeddings est en mémoire (dict Python), donc valable le temps
que le Space reste "éveillé". Sur le tier gratuit, le Space se met en veille
après inactivité et le cache est perdu au réveil — normal, pas un bug.

## Rappel

`tracer scan` est un diagnostic de faisabilité, pas un entraînement — voir
`SPEC_TRACER_REACHY.md` §8-9 pour la suite (fit → report-html → validation
live). L'outil ici sert uniquement à décider si ça vaut le coup de
lancer `fit_tracer.py` sur un dataset donné.