Qwen3-Coder-Next-Cyber-SFT

mdomina/Kalithos-C1 con l'adapter comportamentale SFT-LoRA fuso nei pesi (red/blue-team, ragionamento <think>, verdetto / MITRE / azione).

Modello self-contained = base cyber + comportamento SFT. È il punto di partenza per il GRPO/RLVR (la KL-reference). Equivalente a caricare base + Qwen3-Coder-Next-Cyber-SFT-lora, ma già fuso.

  • Merge: 48 moduli attention (q/k/v/o_proj), scaling α/r = 2.0.
  • Inferenza: usare repetition_penalty ≈ 1.15 e template qwen3_coder.
  • Benchmark (dal base+adapter): CyberMetric-500 92.8%.

Vedi mdomina/Kalithos-C1 (base) e il repo kalithos-cybersec (recipes/sft-combined/, recipes/grpo/).

Downloads last month
5
Safetensors
Model size
85B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for mdomina/Kalithos-C1-SFT

Finetuned
(1)
this model