srt-skracacz-grpo
Fine-tune Qwen/Qwen2.5-1.5B-Instruct metodą GRPO (nagrody).
Model uczy się przez nagrody za precyzję skrócenia (±5pp) i poprawność zdania.
Użycie
from transformers import AutoTokenizer, AutoModelForCausalLM
tok = AutoTokenizer.from_pretrained("DriiftKing/srt-skracacz-grpo")
model = AutoModelForCausalLM.from_pretrained("DriiftKing/srt-skracacz-grpo")
prompt = "Skróć o 30%:\nNadeszła noc, Antek legł na twardej ławie, ale zasnąć nie mógł."
inputs = tok(f"<|im_start|>user\n{prompt}<|im_end|>\n<|im_start|>assistant\n", return_tensors="pt")
out = model.generate(**inputs, max_new_tokens=128, do_sample=False)
print(tok.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))
Nagrody
+1.0skrócenie ±5pp od celu+0.5skrócenie ±10pp od celu+0.2bonus za domknięte zdanie-0.5kara za brak skrócenia lub pustą odpowiedź
- Downloads last month
- 4