modelo_qa_beto_docstride_pdqa

Descripción

Modelo desarrollado para el Dominican News Question Answering Challenge de ICC-344-T. El sistema recibe una pregunta y un contexto noticioso, y extrae una respuesta contenida explícitamente en el contexto.

El modelo fue obtenido mediante fine-tuning de BETO utilizando el conjunto de datos PDQA y evaluando distintas configuraciones de entrenamiento para seleccionar la de mejor desempeño.

Integrantes

  • Emil Paulino - 10154329
  • Rafael Ramírez - 10149810

Recursos oficiales

Modelo base

  • Repositorio: Lisibonny/modelo_qa_beto_squad_es_pdqa
  • Justificación: Se utilizó el baseline oficial del proyecto, previamente afinado para Question Answering en español, y posteriormente se realizó fine-tuning utilizando el conjunto PDQA.

Datos

División Filas Uso
train 45 Entrenamiento
validation 15 Comparación y selección
test 20 Predicciones finales

No se publicaron ni utilizaron respuestas privadas de test.

Entrenamiento

Parámetro Valor
Seed 42
Learning rate 2e-5
Batch size 8
Épocas 5
Max length 384
Doc stride 128
Weight decay 0.01
Hardware Google Colab (GPU)

Experimentos

Experimento Cambio EM validation F1 validation
Baseline oficial Sin cambios 60.00 75.84
Variante 1 Fine-tuning (1 época) 53.33 73.62
Variante 2 Fine-tuning (3 épocas) 66.67 77.70
Modelo final Fine-tuning (5 épocas + DocStride) 73.33 80.15

Ablación o comparación controlada

Se realizaron dos comparaciones controladas. Primero se evaluó el efecto del número de épocas (1, 3 y 5), manteniendo constantes el modelo base, learning rate, batch size, seed y demás hiperparámetros. Posteriormente se evaluó el uso de DocStride para el manejo de contextos largos, manteniendo constante la mejor configuración obtenida en la primera comparación.

Resultados

  • Exact Match en validation: 73.33
  • F1 en validation: 80.15
  • Script de evaluación: 05_evaluate_qa.py

Ejemplo de uso

from transformers import pipeline

qa = pipeline(
    "question-answering",
    model="Rafael0301/modelo_qa_beto_docstride_pdqa",
    tokenizer="Rafael0301/modelo_qa_beto_docstride_pdqa"
)

qa(
    question="¿Quién hizo el anuncio?",
    context="La ministra informó que el programa comenzará en agosto."
)

Análisis de errores

  1. Respuestas parcialmente correctas cuando varias frases similares aparecen en el contexto.
  2. Confusión entre entidades con nombres o cargos similares.
  3. Errores en preguntas cuya respuesta se encuentra cerca del límite del contexto o en noticias con información muy extensa.

Limitaciones

  • La respuesta debe estar presente en el contexto.
  • El modelo puede confundir entidades, fechas o cantidades similares.
  • El modelo no verifica la veracidad de la noticia.
  • No debe utilizarse como única fuente para decisiones de alto impacto.

Reproducibilidad

Downloads last month
55
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Rafael0301/modelo_qa_beto_docstride_pdqa

Finetuned
(192)
this model

Dataset used to train Rafael0301/modelo_qa_beto_docstride_pdqa