CarlosAGDev/ltv-lora-clf

LoRA-CLF (v0.2.1) del LTV Framework. Clasifica el tipo de una afirmacion (5 categorias canonicas AVeriTeC) como segundo paso del pipeline de Triage.

Mejoras en v0.2.1

  • Segundo maestro: re-anotado con gemini-3.5-flash en vez de gemini-3.1-flash-lite. Mismo pool base, mismos prompts v2, mismos hiperparametros que v0.2.0.
  • Motivacion: v0.2.0 tuvo precision de Position Statement = 0.12 (categoria de escape ante duda con Event/Property). El maestro 3.5-flash tambien es mas selectivo en Task 1 (check-worthy 45.3% vs 65.6% del lite), asi que el pool de entrada a CLF es mas chico pero mas limpio (3,374 vs 4,879 check-worthy).

Detalles del Entrenamiento

Parametro Valor
Modelo Base google/gemma-4-E2B-it
Maestro anotador gemini-3.5-flash
Max Sequence Length 384
Epochs 1
Batch Size (Per Device) 4
Gradient Accumulation 4
Learning Rate 2e-4
Optimizer paged_adamw_8bit
Eval set 338 claims
Tiempo de evaluacion 35m (6.22 s/ejemplo)

Resultados (v0.2.1)

Metricas globales

Metrica v0.2.0 (lite) v0.2.1 (3.5-flash)
Accuracy 0.621 0.728
F1 macro 0.56 0.65
F1 weighted 0.650 0.745
JSON valido 100% (0 fallos)

Por clase (v0.2.1, eval n=338)

Clase Precision Recall F1 Support
Event/Property Claim 0.77 0.74 0.76 159
Numerical Claim 0.93 0.81 0.87 101
Causal Claim 0.81 0.39 0.53 33
Quote Verification 0.81 0.59 0.68 29
Position Statement 0.27 1.00 0.42 16

Matriz de confusion (v0.2.1)

                 Ev/Prop  Numerical  Causal  Quote  Position
Ev/Prop              118          2       2      4        33
Numerical             15         82       1      0         3
Causal                18          1      13      0         1
Quote                  2          3       0     17         7
Position                0          0       0      0        16

Hallazgos principales

Numerical Claim resuelto: recall subio de 0.37 (v0.2.0) a 0.81 manteniendo precision alta (0.93). En v0.2.0 el modelo reconocia Numerical cuando lo veia pero perdia el 63% de los casos bajo ruido narrativo; con el maestro 3.5-flash esa confusion casi desaparecio.

Position Statement — mejora parcial: recall subio de 0.75 a 1.00 (el modelo ya no deja pasar ningun Position real) y F1 casi se duplico (0.20 -> 0.42). Pero la precision sigue baja (0.12 -> 0.27): el modelo TODAVIA usa Position como categoria de escape para E/P dudosos, a la misma tasa que en v0.2.0 (33/159 = 20.8% de los E/P reales, vs 53/255 = 20.8% en v0.2.0 — identico). Cambiar de maestro mejoro la cobertura de Position pero no resolvio la frontera E/P-vs-Position en si misma.

Regresion en Quote Verification: recall bajo de 0.76 a 0.59 (17/29 vs 22/29 correctos). De los 12 Quote mal clasificados, 7 se confunden con Position — una confusion nueva que no era prominente en v0.2.0. A vigilar en v0.2.2.

Causal se mantiene estancado: F1 identico a v0.2.0 (0.53), con mejor precision (0.64 -> 0.81) pero peor recall (0.45 -> 0.39). 18 de 33 Causal reales se confunden con Event/Property.

Limitaciones conocidas

  • La frontera E/P vs Position no se resuelve solo cambiando de maestro: la tasa de confusion (~21%) es identica en v0.2.0 y v0.2.1. Es el problema mas persistente del adaptador CLF y el candidato principal para v0.2.2 (razonamiento con checklist verbalizado) o para oversampling/hard-negatives en v0.3.0.
  • Dataset sintetico como referencia: las etiquetas provienen de gemini-3.5-flash con prompts v2 — miden imitacion del maestro, no calidad absoluta.
  • Eval set mas chico que v0.2.0 (338 vs 488): consecuencia de que el maestro 3.5-flash es mas selectivo en Task 1, reduciendo el pool de check-worthy disponible para CLF. Las clases minoritarias (Position n=16, Causal n=33) siguen siendo chicas.

Proximo paso

v0.2.2 entrena sobre el mismo maestro y pool pero con razonamiento verbalizado (el modelo recorre el checklist Quote -> Position -> Causal -> Numerical -> E/P en un bloque de pensamiento antes de responder). Hipotesis directa: verbalizar el descarte explicito de cada categoria deberia reducir la confusion E/P-vs-Position que sobrevivio al cambio de maestro.

Downloads last month
31
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for CarlosAGDev/ltv-lora-clf

Adapter
(177)
this model