GLM-5.3-FP8 / generation_config.json
jangq's picture
fix: default clear_thinking=true in chat_template.jinja + add repetition_penalty=1.1 default in generation_config.json — mitigates known GLM-5.3 reasoning-loop degeneration on multi-turn agent workloads (SGLang #36669, opencode #45533). Upstream Z.ai default `clear_thinking=false` replays prior reasoning into subsequent turns, priming a decode attractor. Z.ai's own docs recommend `clear_thinking=true` for chat scenarios — bakes it in.
968f8a2 verified
Raw
History Blame Contribute Delete
223 Bytes
{
"_from_model_config": true,
"eos_token_id": [
154820,
154827,
154829
],
"pad_token_id": 154820,
"temperature": 1.0,
"top_p": 0.95,
"transformers_version": "5.12.0",
"repetition_penalty": 1.1
}