Text Generation
Transformers
Safetensors
English
qwen3
self-play
space
ultrachat

SPACE Qwen3-4B (Ultrachat)

Self-play SPACE (Wang et al., NeurIPS 2025) run on Qwen3-4B SFT (HoangTran223/qwen3_4b_sft_ultrachat200k_20260818_170154).

  • Prompts: UltraChat 50k subset of HuggingFaceH4/ultrachat_200k
  • Loss: SPACE (mu=1.0), RMSProp, batch 2 × grad accum 2, max_length=1024
  • LR: 5e-7 (ite0–1), 1e-7 (ite2+)

Load a finished iteration with:

from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "HoangTran223/SPACE_Qwen3-4B"
rev = "ite1"  # or ite0; ite2/LATEST is an in-progress snapshot
tok = AutoTokenizer.from_pretrained(f"{model_id}/{rev}")
model = AutoModelForCausalLM.from_pretrained(f"{model_id}/{rev}")

Layout

  • ite0/, ite1/: finished checkpoints + generated train.jsonl
  • ite2/: in-progress snapshot (LATEST/ mid-training) + generated train.jsonl
  • data/Ultrachat50k/train.jsonl: prompts used for generation
  • scripts/SPACE_full_qwen3_4b.sh: launch script
  • logs/: wandb offline runs, Hydra configs, tmux stdout
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for HoangTran223/SPACE_Qwen3-4B

Dataset used to train HoangTran223/SPACE_Qwen3-4B

Paper for HoangTran223/SPACE_Qwen3-4B