Calamar49 commited on
Commit
f32accf
·
1 Parent(s): 11ad57f
Files changed (1) hide show
  1. app.py +18 -44
app.py CHANGED
@@ -1,4 +1,4 @@
1
- # app.py (Versión final y robusta para el SDK de Gradio)
2
 
3
  import torch
4
  import torch.nn as nn
@@ -8,20 +8,18 @@ import json
8
  import timm
9
  import gradio as gr
10
 
11
- # --- 1. Definición del Modelo (directamente aquí para máxima compatibilidad) ---
12
  class VisionEnsembleModel(nn.Module):
13
  def __init__(self, num_classes, cnn_model_name='efficientnet_b2', vit_model_name='vit_small_patch16_224'):
14
  super().__init__()
15
- # Se crean con pretrained=False porque cargaremos nuestros propios pesos entrenados.
16
  self.cnn = timm.create_model(cnn_model_name, pretrained=False, num_classes=num_classes)
17
  cnn_features = self.cnn.get_classifier().in_features
18
- self.cnn.reset_classifier(0) # Elimina el clasificador, deja el extractor de características
19
 
20
  self.vit = timm.create_model(vit_model_name, pretrained=False, num_classes=num_classes)
21
  vit_features = self.vit.head.in_features
22
- self.vit.head = nn.Identity() # Elimina el clasificador, deja el extractor
23
 
24
- # Clasificador final que combina las características de ambos modelos
25
  self.classifier = nn.Sequential(
26
  nn.BatchNorm1d(cnn_features + vit_features),
27
  nn.Linear(cnn_features + vit_features, 512),
@@ -38,7 +36,7 @@ class VisionEnsembleModel(nn.Module):
38
  return output
39
 
40
  # --- 2. Carga del Modelo y Componentes ---
41
- device = torch.device("cpu") # Usamos CPU para máxima compatibilidad en el plan gratuito
42
  MODEL_PATH = "model/best_vision_ensemble_model.pth"
43
  LABELS_PATH = "model/species_labels_map.json"
44
  NUM_CLASSES = 156
@@ -48,70 +46,46 @@ try:
48
  labels_map = json.load(f)
49
  print("Mapa de etiquetas cargado con éxito.")
50
  except Exception as e:
51
- print(f"ERROR AL CARGAR EL MAPA DE ETIQUETAS: {e}")
52
- labels_map = {} # Si falla, usamos un mapa vacío para que la app no crashee
53
 
54
- # Instanciamos y cargamos el modelo ensamblado
55
  model = VisionEnsembleModel(num_classes=NUM_CLASSES)
56
  model.load_state_dict(torch.load(MODEL_PATH, map_location=device))
57
  model.to(device)
58
- model.eval() # ¡Crucial poner el modelo en modo de evaluación!
 
59
 
60
- print("Modelo Ensamblado Híbrido (CNN+ViT) cargado y listo.")
61
-
62
- # Definir las transformaciones de la imagen (deben ser idénticas a las de validación)
63
  transforms_val = transforms.Compose([
64
  transforms.Resize((224, 224)),
65
  transforms.ToTensor(),
66
  transforms.Normalize(mean=[0.485, 0.456, 0.406], std=[0.229, 0.224, 0.225])
67
  ])
68
 
69
- # --- 3. Función de Predicción para Gradio (devuelve nombres) ---
70
  def predict(image):
71
- """
72
- Esta función toma una imagen de la interfaz de Gradio, la procesa
73
- con el modelo y devuelve un diccionario de {nombre_especie: confianza}.
74
- """
75
- # Manejar el caso de que no se suba ninguna imagen
76
  if image is None:
77
  return None
78
-
79
- # La imagen de Gradio viene como un array de Numpy, la convertimos a PIL Image
80
  pil_image = Image.fromarray(image.astype('uint8'), 'RGB')
81
-
82
- # Preprocesar la imagen
83
  input_tensor = transforms_val(pil_image).unsqueeze(0).to(device)
84
-
85
- # Realizar la predicción
86
  with torch.no_grad():
87
  output = model(input_tensor)
88
  probabilities = torch.nn.functional.softmax(output[0], dim=0)
89
-
90
- # Obtener las 5 predicciones más probables
91
  top5_prob, top5_catid = torch.topk(probabilities, 5)
92
-
93
- # Crear el diccionario de confianzas con los nombres de las especies
94
- confidences = {}
95
- for i in range(top5_prob.size(0)):
96
- species_id = top5_catid[i].item()
97
- prob = top5_prob[i].item()
98
-
99
- # Traducir el ID a un nombre usando el mapa de etiquetas cargado
100
- species_name = labels_map.get(str(species_id), f"ID Desconocido: {species_id}")
101
-
102
- confidences[species_name] = prob
103
-
104
  return confidences
105
 
106
- # --- 4. Crear y Lanzar la Interfaz de Gradio ---
107
  iface = gr.Interface(
108
  fn=predict,
109
  inputs=gr.Image(type="numpy", label="Sube una imagen de tu orquídea"),
110
  outputs=gr.Label(num_top_classes=5, label="Predicciones"),
111
  title="Clasificador de Orquídeas",
112
- description="Sube una foto de una orquídea y la IA (un ensamblado de CNN y Vision Transformer) intentará identificar la especie.",
113
  allow_flagging="never"
114
  )
115
 
116
- # Lanzamos la aplicación. Gradio se encargará de crear el servidor web.
117
- iface.launch()
 
 
 
1
+ # app.py (Versión final con lanzamiento robusto)
2
 
3
  import torch
4
  import torch.nn as nn
 
8
  import timm
9
  import gradio as gr
10
 
11
+ # --- 1. Definición del Modelo (directamente aquí) ---
12
  class VisionEnsembleModel(nn.Module):
13
  def __init__(self, num_classes, cnn_model_name='efficientnet_b2', vit_model_name='vit_small_patch16_224'):
14
  super().__init__()
 
15
  self.cnn = timm.create_model(cnn_model_name, pretrained=False, num_classes=num_classes)
16
  cnn_features = self.cnn.get_classifier().in_features
17
+ self.cnn.reset_classifier(0)
18
 
19
  self.vit = timm.create_model(vit_model_name, pretrained=False, num_classes=num_classes)
20
  vit_features = self.vit.head.in_features
21
+ self.vit.head = nn.Identity()
22
 
 
23
  self.classifier = nn.Sequential(
24
  nn.BatchNorm1d(cnn_features + vit_features),
25
  nn.Linear(cnn_features + vit_features, 512),
 
36
  return output
37
 
38
  # --- 2. Carga del Modelo y Componentes ---
39
+ device = torch.device("cpu")
40
  MODEL_PATH = "model/best_vision_ensemble_model.pth"
41
  LABELS_PATH = "model/species_labels_map.json"
42
  NUM_CLASSES = 156
 
46
  labels_map = json.load(f)
47
  print("Mapa de etiquetas cargado con éxito.")
48
  except Exception as e:
49
+ print(f"ERROR AL CARGAR MAPA DE ETIQUETAS: {e}")
50
+ labels_map = {}
51
 
 
52
  model = VisionEnsembleModel(num_classes=NUM_CLASSES)
53
  model.load_state_dict(torch.load(MODEL_PATH, map_location=device))
54
  model.to(device)
55
+ model.eval()
56
+ print("Modelo Híbrido cargado y listo.")
57
 
 
 
 
58
  transforms_val = transforms.Compose([
59
  transforms.Resize((224, 224)),
60
  transforms.ToTensor(),
61
  transforms.Normalize(mean=[0.485, 0.456, 0.406], std=[0.229, 0.224, 0.225])
62
  ])
63
 
64
+ # --- 3. Función de Predicción ---
65
  def predict(image):
 
 
 
 
 
66
  if image is None:
67
  return None
 
 
68
  pil_image = Image.fromarray(image.astype('uint8'), 'RGB')
 
 
69
  input_tensor = transforms_val(pil_image).unsqueeze(0).to(device)
 
 
70
  with torch.no_grad():
71
  output = model(input_tensor)
72
  probabilities = torch.nn.functional.softmax(output[0], dim=0)
73
+
 
74
  top5_prob, top5_catid = torch.topk(probabilities, 5)
75
+ confidences = {labels_map.get(str(cat_id.item()), f"ID {cat_id.item()}"): prob.item() for prob, cat_id in zip(top5_prob, top5_catid)}
 
 
 
 
 
 
 
 
 
 
 
76
  return confidences
77
 
78
+ # --- 4. Crear la Interfaz de Gradio ---
79
  iface = gr.Interface(
80
  fn=predict,
81
  inputs=gr.Image(type="numpy", label="Sube una imagen de tu orquídea"),
82
  outputs=gr.Label(num_top_classes=5, label="Predicciones"),
83
  title="Clasificador de Orquídeas",
84
+ description="Sube una foto de una orquídea y la IA (CNN+ViT) intentará identificar la especie.",
85
  allow_flagging="never"
86
  )
87
 
88
+ # --- 5. Lanzar la Aplicación (de forma segura) ---
89
+ # Este bloque asegura que el servidor solo se lance cuando el script se ejecuta directamente.
90
+ if __name__ == "__main__":
91
+ iface.launch()