modelo_qa_beto_docstride_pdqa
Descripción
Modelo desarrollado para el Dominican News Question Answering Challenge de ICC-344-T. El sistema recibe una pregunta y un contexto noticioso, y extrae una respuesta contenida explícitamente en el contexto.
El modelo fue obtenido mediante fine-tuning de BETO utilizando el conjunto de datos PDQA y evaluando distintas configuraciones de entrenamiento para seleccionar la de mejor desempeño.
Integrantes
- Emil Paulino - 10154329
- Rafael Ramírez - 10149810
Recursos oficiales
- Dataset: https://huggingface.co/datasets/Lisibonny/pdqa
- Baseline: https://huggingface.co/Lisibonny/modelo_qa_beto_squad_es_pdqa
- Aplicación: https://huggingface.co/spaces/Lisibonny/Repartidor_Dominicano
Modelo base
- Repositorio: Lisibonny/modelo_qa_beto_squad_es_pdqa
- Justificación: Se utilizó el baseline oficial del proyecto, previamente afinado para Question Answering en español, y posteriormente se realizó fine-tuning utilizando el conjunto PDQA.
Datos
| División | Filas | Uso |
|---|---|---|
| train | 45 | Entrenamiento |
| validation | 15 | Comparación y selección |
| test | 20 | Predicciones finales |
No se publicaron ni utilizaron respuestas privadas de test.
Entrenamiento
| Parámetro | Valor |
|---|---|
| Seed | 42 |
| Learning rate | 2e-5 |
| Batch size | 8 |
| Épocas | 5 |
| Max length | 384 |
| Doc stride | 128 |
| Weight decay | 0.01 |
| Hardware | Google Colab (GPU) |
Experimentos
| Experimento | Cambio | EM validation | F1 validation |
|---|---|---|---|
| Baseline oficial | Sin cambios | 60.00 | 75.84 |
| Variante 1 | Fine-tuning (1 época) | 53.33 | 73.62 |
| Variante 2 | Fine-tuning (3 épocas) | 66.67 | 77.70 |
| Modelo final | Fine-tuning (5 épocas + DocStride) | 73.33 | 80.15 |
Ablación o comparación controlada
Se realizaron dos comparaciones controladas. Primero se evaluó el efecto del número de épocas (1, 3 y 5), manteniendo constantes el modelo base, learning rate, batch size, seed y demás hiperparámetros. Posteriormente se evaluó el uso de DocStride para el manejo de contextos largos, manteniendo constante la mejor configuración obtenida en la primera comparación.
Resultados
- Exact Match en validation: 73.33
- F1 en validation: 80.15
- Script de evaluación:
05_evaluate_qa.py
Ejemplo de uso
from transformers import pipeline
qa = pipeline(
"question-answering",
model="Rafael0301/modelo_qa_beto_docstride_pdqa",
tokenizer="Rafael0301/modelo_qa_beto_docstride_pdqa"
)
qa(
question="¿Quién hizo el anuncio?",
context="La ministra informó que el programa comenzará en agosto."
)
Análisis de errores
- Respuestas parcialmente correctas cuando varias frases similares aparecen en el contexto.
- Confusión entre entidades con nombres o cargos similares.
- Errores en preguntas cuya respuesta se encuentra cerca del límite del contexto o en noticias con información muy extensa.
Limitaciones
- La respuesta debe estar presente en el contexto.
- El modelo puede confundir entidades, fechas o cantidades similares.
- El modelo no verifica la veracidad de la noticia.
- No debe utilizarse como única fuente para decisiones de alto impacto.
Reproducibilidad
- Repositorio de código: https://github.com/emilpaulino/modelo_qa_beto_docstride_pdqa
- Commit: f9eb8e5
- Notebook:
03_QA_Noticias_Equipo_Rafael_Emil.ipynb - Archivo de dependencias:
09_requirements.txt - Semillas: 42
- Downloads last month
- 55
Model tree for Rafael0301/modelo_qa_beto_docstride_pdqa
Base model
dccuchile/bert-base-spanish-wwm-cased