Instructions to use CarlosAGDev/ltv-lora-clf with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use CarlosAGDev/ltv-lora-clf with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("google/gemma-4-E2B-it") model = PeftModel.from_pretrained(base_model, "CarlosAGDev/ltv-lora-clf") - Notebooks
- Google Colab
- Kaggle
CarlosAGDev/ltv-lora-clf
LoRA-CLF (v0.2.1) del LTV Framework. Clasifica el tipo de una afirmacion (5 categorias canonicas AVeriTeC) como segundo paso del pipeline de Triage.
Mejoras en v0.2.1
- Segundo maestro: re-anotado con
gemini-3.5-flashen vez degemini-3.1-flash-lite. Mismo pool base, mismos prompts v2, mismos hiperparametros que v0.2.0. - Motivacion: v0.2.0 tuvo precision de Position Statement = 0.12 (categoria de escape ante duda con Event/Property). El maestro 3.5-flash tambien es mas selectivo en Task 1 (check-worthy 45.3% vs 65.6% del lite), asi que el pool de entrada a CLF es mas chico pero mas limpio (3,374 vs 4,879 check-worthy).
Detalles del Entrenamiento
| Parametro | Valor |
|---|---|
| Modelo Base | google/gemma-4-E2B-it |
| Maestro anotador | gemini-3.5-flash |
| Max Sequence Length | 384 |
| Epochs | 1 |
| Batch Size (Per Device) | 4 |
| Gradient Accumulation | 4 |
| Learning Rate | 2e-4 |
| Optimizer | paged_adamw_8bit |
| Eval set | 338 claims |
| Tiempo de evaluacion | 35m (6.22 s/ejemplo) |
Resultados (v0.2.1)
Metricas globales
| Metrica | v0.2.0 (lite) | v0.2.1 (3.5-flash) |
|---|---|---|
| Accuracy | 0.621 | 0.728 |
| F1 macro | 0.56 | 0.65 |
| F1 weighted | 0.650 | 0.745 |
| JSON valido | — | 100% (0 fallos) |
Por clase (v0.2.1, eval n=338)
| Clase | Precision | Recall | F1 | Support |
|---|---|---|---|---|
| Event/Property Claim | 0.77 | 0.74 | 0.76 | 159 |
| Numerical Claim | 0.93 | 0.81 | 0.87 | 101 |
| Causal Claim | 0.81 | 0.39 | 0.53 | 33 |
| Quote Verification | 0.81 | 0.59 | 0.68 | 29 |
| Position Statement | 0.27 | 1.00 | 0.42 | 16 |
Matriz de confusion (v0.2.1)
Ev/Prop Numerical Causal Quote Position
Ev/Prop 118 2 2 4 33
Numerical 15 82 1 0 3
Causal 18 1 13 0 1
Quote 2 3 0 17 7
Position 0 0 0 0 16
Hallazgos principales
Numerical Claim resuelto: recall subio de 0.37 (v0.2.0) a 0.81 manteniendo precision alta (0.93). En v0.2.0 el modelo reconocia Numerical cuando lo veia pero perdia el 63% de los casos bajo ruido narrativo; con el maestro 3.5-flash esa confusion casi desaparecio.
Position Statement — mejora parcial: recall subio de 0.75 a 1.00 (el modelo ya no deja pasar ningun Position real) y F1 casi se duplico (0.20 -> 0.42). Pero la precision sigue baja (0.12 -> 0.27): el modelo TODAVIA usa Position como categoria de escape para E/P dudosos, a la misma tasa que en v0.2.0 (33/159 = 20.8% de los E/P reales, vs 53/255 = 20.8% en v0.2.0 — identico). Cambiar de maestro mejoro la cobertura de Position pero no resolvio la frontera E/P-vs-Position en si misma.
Regresion en Quote Verification: recall bajo de 0.76 a 0.59 (17/29 vs 22/29 correctos). De los 12 Quote mal clasificados, 7 se confunden con Position — una confusion nueva que no era prominente en v0.2.0. A vigilar en v0.2.2.
Causal se mantiene estancado: F1 identico a v0.2.0 (0.53), con mejor precision (0.64 -> 0.81) pero peor recall (0.45 -> 0.39). 18 de 33 Causal reales se confunden con Event/Property.
Limitaciones conocidas
- La frontera E/P vs Position no se resuelve solo cambiando de maestro: la tasa de confusion (~21%) es identica en v0.2.0 y v0.2.1. Es el problema mas persistente del adaptador CLF y el candidato principal para v0.2.2 (razonamiento con checklist verbalizado) o para oversampling/hard-negatives en v0.3.0.
- Dataset sintetico como referencia: las etiquetas provienen de
gemini-3.5-flashcon prompts v2 — miden imitacion del maestro, no calidad absoluta. - Eval set mas chico que v0.2.0 (338 vs 488): consecuencia de que el maestro 3.5-flash es mas selectivo en Task 1, reduciendo el pool de check-worthy disponible para CLF. Las clases minoritarias (Position n=16, Causal n=33) siguen siendo chicas.
Proximo paso
v0.2.2 entrena sobre el mismo maestro y pool pero con razonamiento verbalizado (el modelo recorre el checklist Quote -> Position -> Causal -> Numerical -> E/P en un bloque de pensamiento antes de responder). Hipotesis directa: verbalizar el descarte explicito de cada categoria deberia reducir la confusion E/P-vs-Position que sobrevivio al cambio de maestro.
- Downloads last month
- 31