Instructions to use CarlosAGDev/ltv-lora-cw with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use CarlosAGDev/ltv-lora-cw with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("google/gemma-4-E2B-it") model = PeftModel.from_pretrained(base_model, "CarlosAGDev/ltv-lora-cw") - Notebooks
- Google Colab
- Kaggle
CarlosAGDev/ltv-lora-cw
LoRA-CW (v0.2.1) del LTV Framework. Clasifica si una afirmacion vale la pena ser verificada periodisticamente (check-worthy). Primer filtro del pipeline de Triage.
Mejoras en v0.2.1
- Segundo maestro: re-anotado con
gemini-3.5-flash(modelo frontera) en vez degemini-3.1-flash-lite. Mismo pool, mismos prompts v2, mismos hiperparametros que v0.2.0 — la comparacion aisla el efecto del maestro. - Motivacion: v0.2.0 tuvo recall de check-worthy=0.43 (277/488 FN en eval). Analisis de acuerdo inter-maestro (kappa Task 1 = 0.601 en pilot) mostro que el maestro lite era sistematicamente mas permisivo en claims triviales/nicho/predictivos que el prompt v2 pide excluir.
- Distribucion mas selectiva: el maestro 3.5-flash marco 45.3% de los 7,440 claims como check-worthy (vs 65.6% del lite) — mucho mas cerca de lo esperado para un filtro real de Triage. Por fuente: AVeriTeC 94.9% CW (claims reales de fact-checking) vs FEVER-family 8.6-18.8% CW (trivia de Wikipedia, correctamente descartada).
Detalles del Entrenamiento
| Parametro | Valor |
|---|---|
| Modelo Base | google/gemma-4-E2B-it |
| Maestro anotador | gemini-3.5-flash |
| Max Sequence Length | 384 |
| Epochs | 1 |
| Batch Size (Per Device) | 4 |
| Gradient Accumulation | 4 |
| Learning Rate | 2e-4 |
| Optimizer | paged_adamw_8bit |
| Eval set | 744 claims (407 No-CW / 337 CW — refleja la distribucion real del maestro) |
| Tiempo de evaluacion | 136m 9s (10.98 s/ejemplo) |
Resultados (v0.2.1)
Metricas globales
| Metrica | v0.2.0 (lite) | v0.2.1 (3.5-flash) |
|---|---|---|
| Accuracy | 0.548 | 0.595 |
| F1 (check_worthy=True) | 0.557 | 0.599 |
| Recall (check_worthy=True) | 0.43 | 0.67 |
| Precision (check_worthy=True) | 0.78 | 0.54 |
| JSON valido | — | 100% (0 fallos, 744/744) |
Por clase (v0.2.1, eval n=744)
| Clase | Precision | Recall | F1 | Support |
|---|---|---|---|---|
| No check-worthy | 0.66 | 0.54 | 0.59 | 407 |
| Check-worthy | 0.54 | 0.67 | 0.60 | 337 |
Matriz de confusion (v0.2.1)
No-CW Check-worthy
No-CW 218 189
Check-worthy 112 225
- TN=218 | FP=189 (No-CW clasificados como CW)
- FN=112 (CW perdidos, vs 277 en v0.2.0) | TP=225
Hallazgos principales
El problema critico de v0.2.0 esta resuelto: el recall de check-worthy subio de 0.43 a 0.67 (+56% relativo). El adaptador ahora captura 225 de 337 claims check-worthy en vez de perder 277 de 488 como en v0.2.0. Para un primer filtro de Triage esto es la metrica que mas importa — dejar pasar claims dudosos es mucho menos costoso que descartar por error algo que si debia verificarse.
El costo: mas falsos positivos. La precision bajo de 0.78 a 0.54 — el modelo ahora sobre-marca como check-worthy a claims triviales el 46% de las veces (189/407 FP). El maestro 3.5-flash rechaza estos casos con mucha claridad (FEVER-family ~85-91% no-CW), pero el adaptador de 2B, entrenado 1 epoch, no imita esa claridad al 100% — hay perdida de senal en la destilacion, especialmente en la distincion sutil "trivia de Wikipedia" vs "afirmacion con relevancia periodistica".
F1 mejora de forma moderada (0.557 -> 0.599, +7.5%) porque la ganancia en recall se compensa parcialmente con la perdida en precision. El resultado neto es positivo para el proposito del pipeline (filtro de entrada, no filtro final), pero implica mas carga de computo en CLF/QA rio abajo procesando claims que en realidad no eran check-worthy.
Limitaciones conocidas
- Trade-off recall/precision: v0.2.1 prioriza recall sobre precision respecto a v0.2.0. Si el volumen de falsos positivos satura CLF/QA en produccion, considerar un umbral de confianza mas estricto en inferencia en vez de usar la clase binaria directa.
- Dataset sintetico como referencia: las etiquetas provienen de
gemini-3.5-flashcon prompts v2 — miden imitacion del maestro, no calidad absoluta.
Proximo paso
CW v0.2.1 queda como version de produccion recomendada.
- Downloads last month
- 30