srt-skracacz-grpo

Fine-tune Qwen/Qwen2.5-1.5B-Instruct metodą GRPO (nagrody).

Model uczy się przez nagrody za precyzję skrócenia (±5pp) i poprawność zdania.

Użycie

from transformers import AutoTokenizer, AutoModelForCausalLM

tok = AutoTokenizer.from_pretrained("DriiftKing/srt-skracacz-grpo")
model = AutoModelForCausalLM.from_pretrained("DriiftKing/srt-skracacz-grpo")

prompt = "Skróć o 30%:\nNadeszła noc, Antek legł na twardej ławie, ale zasnąć nie mógł."
inputs = tok(f"<|im_start|>user\n{prompt}<|im_end|>\n<|im_start|>assistant\n", return_tensors="pt")
out = model.generate(**inputs, max_new_tokens=128, do_sample=False)
print(tok.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))

Nagrody

  • +1.0 skrócenie ±5pp od celu
  • +0.5 skrócenie ±10pp od celu
  • +0.2 bonus za domknięte zdanie
  • -0.5 kara za brak skrócenia lub pustą odpowiedź
Downloads last month
4
Safetensors
Model size
2B params
Tensor type
BF16
·
Video Preview
loading

Model tree for DriiftKing/srt-skracacz-grpo

Finetuned
(1769)
this model