| <!DOCTYPE html> |
| <html lang="es"> |
| <head> |
| <meta charset="utf-8"> |
| <meta name="viewport" content="width=device-width, initial-scale=1"> |
| <title>FitoAsistente · Universidad San Sebastián</title> |
| <style> |
| :root{ |
| --navy:#052A4A; --navy2:#0C3A5E; --blue:#297FD5; --teal:#00949D; |
| --steel:#435D74; --gold:#C0A264; --gray:#606163; --bg:#F7F9FC; |
| --card:#FFFFFF; --line:#DCE7F3; |
| } |
| *{box-sizing:border-box} |
| body{ |
| margin:0; background:var(--bg); color:var(--gray); |
| font-family:Calibri,"Segoe UI",system-ui,-apple-system,sans-serif; |
| line-height:1.6; font-size:16px; |
| } |
| a{color:var(--blue); text-decoration:none} |
| a:hover{text-decoration:underline} |
| .wrap{max-width:960px; margin:0 auto; padding:0 24px} |
|
|
| header{background:var(--navy); color:#fff; padding:48px 0 40px} |
| header .eyebrow{ |
| font-size:12px; letter-spacing:.14em; text-transform:uppercase; |
| color:#8FB4CE; font-weight:700; margin-bottom:18px; |
| } |
| header h1{margin:0 0 6px; font-size:46px; font-weight:700; letter-spacing:-.5px} |
| header .sub{font-size:19px; color:#C9DCEA; margin:0 0 26px; max-width:620px} |
| header .rule{height:3px; width:88px; background:var(--gold); margin-bottom:24px} |
| header .meta{font-size:14px; color:#A9C4D6} |
|
|
| .cta{ |
| display:inline-block; background:var(--gold); color:var(--navy); |
| font-weight:700; padding:13px 26px; border-radius:6px; margin:6px 10px 6px 0; |
| font-size:16px; |
| } |
| .cta:hover{background:#D0B478; text-decoration:none} |
| .cta.ghost{background:transparent; color:#C9DCEA; border:1px solid #3C6484} |
| .cta.ghost:hover{background:#0C3A5E} |
|
|
| section{padding:44px 0; border-bottom:1px solid var(--line)} |
| section:last-of-type{border-bottom:none} |
| h2{color:var(--navy); font-size:27px; margin:0 0 6px; font-weight:700} |
| h2 + .lead{color:var(--steel); font-style:italic; margin:0 0 22px} |
| h3{color:var(--teal); font-size:18px; margin:26px 0 8px; font-weight:700} |
|
|
| .aviso{ |
| background:#FFF8E8; border:1px solid #E8D9AE; border-left:4px solid var(--gold); |
| border-radius:6px; padding:18px 22px; margin:26px 0; |
| } |
| .aviso strong{color:var(--navy)} |
|
|
| .cards{display:grid; grid-template-columns:repeat(auto-fit,minmax(220px,1fr)); gap:16px; margin-top:20px} |
| .card{background:var(--card); border:1px solid var(--line); border-radius:8px; padding:20px 22px} |
| .card h4{margin:0 0 4px; color:var(--navy); font-size:17px} |
| .card .tag{ |
| display:inline-block; font-size:11px; letter-spacing:.09em; text-transform:uppercase; |
| color:var(--teal); font-weight:700; margin-bottom:8px; |
| } |
| .card p{margin:0; font-size:14.5px} |
| .card .big{font-size:30px; font-weight:700; color:var(--teal); line-height:1.2} |
|
|
| table{width:100%; border-collapse:collapse; margin:18px 0 6px; background:var(--card); font-size:14.5px} |
| th{background:var(--navy); color:#fff; text-align:left; padding:11px 13px; font-weight:700} |
| th:not(:first-child), td:not(:first-child){text-align:center} |
| td{padding:10px 13px; border-bottom:1px solid var(--line)} |
| tr:nth-child(even) td{background:#F3F8FD} |
| .win{color:var(--gold); font-weight:700} |
| caption{caption-side:bottom; text-align:left; font-size:13px; font-style:italic; color:var(--steel); padding-top:8px} |
|
|
| figure{margin:22px 0} |
| figure img{width:100%; border:1px solid var(--line); border-radius:6px; background:#fff} |
| figcaption{font-size:13px; font-style:italic; color:var(--steel); margin-top:7px} |
| .figpair{display:grid; grid-template-columns:1fr 1fr; gap:16px} |
| @media(max-width:700px){.figpair{grid-template-columns:1fr} header h1{font-size:34px}} |
|
|
| ul{padding-left:20px} li{margin-bottom:7px} |
| code{background:#EDF3FA; padding:2px 6px; border-radius:4px; font-size:13.5px; color:var(--navy)} |
|
|
| footer{background:var(--navy); color:#A9C4D6; padding:32px 0; font-size:14px} |
| footer a{color:#C9DCEA} |
| .gold-bar{height:4px; background:var(--gold)} |
| </style> |
| </head> |
| <body> |
|
|
| <header> |
| <div class="wrap"> |
| <div class="eyebrow">Universidad San Sebastián · Facultad de Ingeniería · Magíster en Data Science</div> |
| <h1>FitoAsistente</h1> |
| <p class="sub">Asistente para el diagnóstico fitosanitario de cultivos, con dos capacidades distintas de modelos fundacionales de Hugging Face.</p> |
| <div class="rule"></div> |
| <a class="cta" href="#demo">Ver la demostración</a> |
| <a class="cta ghost" href="#ejecutar">Ejecutar la aplicación</a> |
| <a class="cta ghost" href="https://huggingface.co/JohnSupertramp2026/vit-base-plantvillage" target="_blank" rel="noopener">Modelo ViT</a> |
| <a class="cta ghost" href="https://huggingface.co/JohnSupertramp2026/convnext-tiny-plantvillage" target="_blank" rel="noopener">Modelo ConvNeXt</a> |
| <p class="meta" style="margin-top:26px"> |
| Jonathan Núñez Moya · Francisco Rietta González<br> |
| Inteligencia Artificial — Prof. Manuel Alejandro Goyo · Agosto de 2026 |
| </p> |
| </div> |
| </header> |
| <div class="gold-bar"></div> |
|
|
| <div class="wrap"> |
|
|
| <section id="demo"> |
| <h2>La aplicación funcionando</h2> |
| <p class="lead">Recorrido real de 20 segundos, grabado sobre la aplicación en ejecución</p> |
| <video src="FitoAsistente_demo.mp4" controls muted playsinline loop preload="metadata" |
| style="width:100%;border-radius:10px;border:1px solid #D6DEE6;background:#F7F9FB"></video> |
| <p style="margin-top:14px">Se arrastra la fotografía de una hoja al recuadro, el clasificador la identifica como <strong>Peach · Bacterial spot</strong> con 99,7 % de confianza, el asistente responde una consulta sobre la enfermedad con ese diagnóstico ya en contexto, y una consulta ajena al dominio queda rechazada por el filtro sin llegar al modelo de lenguaje.</p> |
| <div class="aviso" style="margin-top:16px"> |
| <p style="margin:0"><strong>Por qué publicamos un video y no un enlace.</strong> La dirección pública que genera Gradio existe únicamente mientras el cuaderno está en ejecución, así que cualquier enlace que dejáramos aquí quedaría muerto a los pocos días. El video resuelve eso: dispone el funcionamiento completo de forma permanente y verificable. Y si prefieres ejecutarla tú, el cuaderno está en la entrega y levanta en unos cuatro minutos — las instrucciones están más abajo.</p> |
| </div> |
| </section> |
|
|
| <section> |
| <h2>Qué hace</h2> |
| <p class="lead">Dos capacidades distintas de modelos fundacionales, en una sola aplicación</p> |
| <p>Subes la foto de una hoja y el sistema hace dos cosas que no son la misma. La <strong>clasifica</strong> entre 38 categorías fitopatológicas, y después <strong>conversa</strong> contigo sobre qué hacer con ese diagnóstico. El sistema tiene dos capacidades y tres modelos: ViT y ConvNeXt resuelven la misma tarea y están los dos porque son el objeto de la comparación experimental.</p> |
|
|
| <div class="cards"> |
| <div class="card"> |
| <span class="tag">Capacidad 1 · image-classification</span> |
| <h4>ViT-Base/16 y ConvNeXt-Tiny</h4> |
| <p>Ajustados sobre PlantVillage. Devuelven una etiqueta entre 38 clases con su probabilidad. Se pueden ejecutar por separado o comparar lado a lado.</p> |
| </div> |
| <div class="card"> |
| <span class="tag">Capacidad 2 · text-generation</span> |
| <h4>Qwen2.5-1.5B-Instruct</h4> |
| <p>Sin ajustar. Recibe como texto la clase que decidió el clasificador y conversa sobre tratamiento y manejo. No procesa la imagen.</p> |
| </div> |
| </div> |
|
|
| <h3>Por qué se necesitan las dos</h3> |
| <p>El clasificador es preciso pero cerrado: ante una especie que nunca vio devuelve igual una de sus 38 etiquetas, con alta confianza y sin manera de decir «no sé». El modelo de lenguaje no decide nada: recibe la clase ya resuelta y se encarga de traducirla a manejo agronómico, que es la pregunta que un usuario tiene de verdad frente a una hoja enferma.</p> |
| </section> |
|
|
| <section> |
| <h2>Resultados</h2> |
| <p class="lead">Comparación controlada sobre el conjunto de prueba, usado una sola vez</p> |
|
|
| <table> |
| <caption>Todas las condiciones idénticas salvo la arquitectura: 20 % estratificado de PlantVillage, partición 80/10/10, semilla 42, 3 épocas, lote 32, learning rate 5e-5, GPU T4.</caption> |
| <thead> |
| <tr><th>Modelo</th><th>Preentr.</th><th>Parámetros</th><th>Exactitud</th><th>Macro F1</th><th>Weighted F1</th><th>Latencia CPU</th></tr> |
| </thead> |
| <tbody> |
| <tr><td>CNN desde cero <span style="color:#8A93A0">(referencia)</span></td><td>No</td><td>8,49 M</td><td>59,60 %</td><td>0,354</td><td>0,544</td><td>—</td></tr> |
| <tr><td><strong>ViT-Base/16</strong></td><td>IN-21k</td><td>85,83 M</td><td class="win">99,08 %</td><td class="win">0,988</td><td class="win">0,991</td><td>395,0 ms</td></tr> |
| <tr><td><strong>ConvNeXt-Tiny</strong></td><td>IN-1k</td><td>27,85 M</td><td>96,41 %</td><td>0,919</td><td>0,960</td><td class="win">119,6 ms</td></tr> |
| </tbody> |
| </table> |
|
|
| <div class="cards"> |
| <div class="card"><div class="big">+63,4 pp</div><p>de macro F1 sobre la red entrenada desde cero, contra +39,5 pp de exactitud</p></div> |
| <div class="card"><div class="big">+6,9 pp</div><p>de macro F1 de ViT sobre ConvNeXt, con solo 2,7 pp de diferencia en exactitud</p></div> |
| <div class="card"><div class="big">3,3×</div><p>más rápido ConvNeXt en CPU, con un tercio de los parámetros</p></div> |
| </div> |
|
|
| <h3>Por qué la brecha es tan distinta según la métrica</h3> |
| <p>ConvNeXt obtuvo un F1 de <strong>0,000</strong> en <code>Potato___healthy</code>, una clase con solo tres ejemplos en prueba, y <strong>0,182</strong> en <code>Corn___Cercospora_leaf_spot</code>. ViT resolvió las dos por encima de 0,900. Abandonar las clases pequeñas es exactamente el mismo patrón que había mostrado la red entrenada desde cero, y por eso elegimos ViT como modelo por defecto aunque sea más lento.</p> |
| <p>Las dos arquitecturas coinciden en tres de sus cinco peores clases. Cuando los dos modelos fallan en lo mismo, la dificultad viene del problema y no del modelo.</p> |
|
|
| <div class="figpair"> |
| <figure><img src="matriz_confusion_vit-base.png" alt="Matriz de confusión de ViT-Base"><figcaption>Matriz de confusión normalizada — ViT-Base/16</figcaption></figure> |
| <figure><img src="matriz_confusion_convnext-tiny.png" alt="Matriz de confusión de ConvNeXt-Tiny"><figcaption>Matriz de confusión normalizada — ConvNeXt-Tiny</figcaption></figure> |
| </div> |
| <figure><img src="curvas_entrenamiento.png" alt="Curvas de entrenamiento"><figcaption>Pérdida y macro F1 de validación. ViT llegó a 0,981 de macro F1 en la primera época; ConvNeXt partió en 0,646 y necesitó las tres para llegar a 0,936.</figcaption></figure> |
| </section> |
|
|
| <section> |
| <h2>Lo que aprendimos del modelo de lenguaje</h2> |
| <p class="lead">Medimos la segunda capacidad y dos cosas que creíamos resultaron falsas</p> |
| <p>Sometimos el asistente a diez consultas sobre una misma hoja de duraznero clasificada como <em>Peach · Bacterial spot</em>: ocho del dominio agronómico y dos deliberadamente ajenas. Cada respuesta se clasificó en correcta, vaga o incorrecta.</p> |
| <table> |
| <thead><tr><th>Resultado sobre 10 consultas</th><th>Qwen2.5-0,5B</th><th>Qwen2.5-1,5B</th></tr></thead> |
| <tbody> |
| <tr><td style="text-align:left">Correctas (de 8 en dominio)</td><td>0</td><td class="win">1</td></tr> |
| <tr><td style="text-align:left">Vagas (de 8 en dominio)</td><td>1</td><td>3</td></tr> |
| <tr><td style="text-align:left">Incorrectas (de 8 en dominio)</td><td>7</td><td>4</td></tr> |
| <tr><td style="text-align:left">Fuera de dominio bloqueadas</td><td>0 de 2</td><td class="win">2 de 2</td></tr> |
| </tbody> |
| </table> |
| <h3>El resultado más informativo</h3> |
| <p>Ante la pregunta por la dosis de cobre, el modelo de 0,5 B inventó una cifra —<em>«0,001 gramos por litro»</em>— y un instrumento que no existe. El de 1,5 B respondió que no tenía información específica y derivó a un agrónomo. <strong>Se abstuvo.</strong> Un modelo mayor no solo acierta más: reconoce mejor los límites de lo que sabe, y en un asistente que sugiere tratamientos eso importa más que la exactitud media.</p> |
| <h3>El guardarraíl por instrucción no funcionaba</h3> |
| <p>Habíamos escrito en la instrucción de sistema que el asistente solo respondiera sobre botánica y agricultura. Al medirlo, dejó pasar las dos consultas ajenas al dominio: a una pregunta de salud humana llegó a sugerir analgésicos. Lo reemplazamos por un <strong>filtro léxico determinista</strong> que decide antes de invocar al modelo, y que acertó <strong>21 de 21</strong> casos etiquetados. La lección se resume en una línea: lo que debe cumplirse siempre no se le pide al modelo, se le impone al sistema.</p> |
| <p>Es una mitigación, no una solución: el filtro decide por vocabulario, así que una consulta ajena redactada con palabras agrícolas pasaría.</p> |
| </section> |
|
|
| <section> |
| <h2>Limitaciones</h2> |
| <p class="lead">Lo que este trabajo no demuestra</p> |
| <ul> |
| <li><strong>El 99,08 % está inflado.</strong> PlantVillage contiene varias fotografías de la misma hoja física. La versión original trae particiones que preservan ese agrupamiento; nosotros repartimos al azar, así que es probable que fotos de una misma hoja hayan quedado en entrenamiento y en prueba. Infla las tres filas por igual, de modo que la comparación entre modelos sigue siendo válida, pero la cifra no estima el desempeño sobre hojas nuevas.</li> |
| <li><strong>Laboratorio, no campo.</strong> Mohanty et al. (2016) documentaron que la exactitud cae al 31 % en fotografías de terreno.</li> |
| <li><strong>Tres épocas es poco.</strong> ConvNeXt todavía venía subiendo en la tercera, así que su cifra final subestima su techo.</li> |
| <li><strong>Muestras pequeñas.</strong> Varias clases tienen menos de diez ejemplos en prueba y sus F1 individuales son inestables.</li> |
| <li><strong>Conjunto cerrado.</strong> El clasificador no tiene mecanismo de rechazo.</li> |
| <li><strong>El asistente no es confiable.</strong> De ocho consultas en dominio, Qwen2.5-1.5B acertó una. Explica y sugiere; no valida un tratamiento.</li> |
| <li><strong>El filtro de dominio es léxico y se puede burlar.</strong> Decide por vocabulario: una consulta ajena redactada con palabras agrícolas pasaría.</li> |
| <li><strong>El asistente arrastra sus propios errores.</strong> Como el historial viaja en cada consulta, una alucinación del primer turno se propaga a los siguientes.</li> |
| <li>La aplicación prioriza la atención de un profesional. No lo reemplaza.</li> |
| </ul> |
| <p>En lo metodológico, los dos hallazgos que más cambiaron nuestra lectura de los resultados —el buffer de barajado del experimento de referencia y el agrupamiento por hoja de PlantVillage— no tienen nada que ver con la arquitectura de los modelos.</p> |
| </section> |
|
|
| <section id="ejecutar"> |
| <h2>Ejecutar la aplicación</h2> |
| <p class="lead">Cuatro minutos, sin instalar nada en tu equipo</p> |
| <ol> |
| <li>Abre <code>4_Codigo_Aplicacion_Gradio.ipynb</code> —incluido en la entrega— en <a href="https://colab.research.google.com" target="_blank" rel="noopener">Google Colab</a>.</li> |
| <li>Menú <em>Entorno de ejecución → Cambiar tipo de entorno → GPU T4</em>. Sin GPU también funciona, pero el asistente tarda entre 15 y 30 segundos por respuesta.</li> |
| <li>Ejecuta todas las celdas (<code>Ctrl+F9</code>). La descarga de los tres modelos desde el Hub toma unos minutos la primera vez.</li> |
| <li>La última celda imprime una dirección terminada en <code>.gradio.live</code>. Esa es la aplicación, y funciona desde cualquier navegador mientras el cuaderno siga abierto.</li> |
| </ol> |
| <p>Los tres modelos se descargan solos desde el Hub, así que no hay que entrenar nada ni configurar credenciales. El cuaderno de entrenamiento se entrega por separado y con todas sus salidas ejecutadas, por si interesa revisar el proceso completo.</p> |
| </section> |
|
|
| <section> |
| <h2>Sobre este despliegue</h2> |
| <div class="aviso"> |
| <p style="margin:0 0 10px"><strong>Por qué la aplicación no corre dentro de este Space.</strong></p> |
| <p style="margin:0 0 10px">En julio de 2026 Hugging Face modificó su política: los Spaces de tipo <strong>Gradio</strong> y <strong>Docker</strong> pasaron a requerir plan PRO, mientras que los de tipo <strong>Static</strong> siguen siendo gratuitos. Está documentado en el <a href="https://discuss.huggingface.co/t/gradio-sdk-now-marked-as-paid-when-creating-a-new-space/177619" target="_blank" rel="noopener">foro oficial de Hugging Face</a>.</p> |
| <p style="margin:0 0 10px">La documentación menciona una excepción: una cuenta gratuita «in good standing» podría alojar hasta dos Spaces Gradio sobre <strong>ZeroGPU</strong>. La verificamos en la cuenta del proyecto el 11 de agosto de 2026 y no estuvo disponible: el formulario de creación ofrece Gradio y Docker marcados como «Paid», sin opción de hardware ZeroGPU.</p> |
| <p style="margin:0">La aplicación es exactamente la misma que habíamos preparado. Lo único que cambia es dónde se ejecuta el proceso: en vez del contenedor de Hugging Face, corre en un cuaderno de Google Colab y Gradio publica la dirección con <code>share=True</code>. Los dos modelos ajustados siguen publicados en el Hub, y esta portada está desplegada como Space Static.</p> |
| </div> |
|
|
| <h3>Componentes del proyecto</h3> |
| <ul> |
| <li><a href="https://huggingface.co/JohnSupertramp2026/vit-base-plantvillage" target="_blank" rel="noopener">ViT-Base/16 ajustado sobre PlantVillage</a> — 38 clases, publicado en el Hub</li> |
| <li><a href="https://huggingface.co/JohnSupertramp2026/convnext-tiny-plantvillage" target="_blank" rel="noopener">ConvNeXt-Tiny ajustado sobre PlantVillage</a> — 38 clases, publicado en el Hub</li> |
| <li><a href="https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct" target="_blank" rel="noopener">Qwen2.5-1.5B-Instruct</a> — usado sin modificar</li> |
| <li><a href="https://huggingface.co/datasets/BrandonFors/Plant-Diseases-PlantVillage-Dataset" target="_blank" rel="noopener">Dataset PlantVillage</a> — 54.305 imágenes, 38 clases</li> |
| <li>Esta portada, desplegada como Space Static en Hugging Face</li> |
| <li>El video de demostración, disponible de forma permanente en esta misma página</li> |
| </ul> |
| </section> |
|
|
| </div> |
|
|
| <div class="gold-bar"></div> |
| <footer> |
| <div class="wrap"> |
| <strong style="color:#fff">Universidad San Sebastián</strong> · Facultad de Ingeniería · Magíster en Data Science<br> |
| Proyecto Final de Inteligencia Artificial · Prof. Manuel Alejandro Goyo · Agosto de 2026<br> |
| Jonathan Núñez Moya · Francisco Rietta González |
| </div> |
| </footer> |
|
|
| <script> |
| |
| |
| |
| |
| </script> |
|
|
| </body> |
| </html> |
|
|