AI & ML interests
None yet
Organizations
None yet
kazuyamaa/Qwen3-4B-PPO-3000data-v1-Full
Text Generation
• 8B • Updated • 3
kazuyamaa/Qwen3-4B-PPO-3000data-v1
Reinforcement Learning
• Updated • 1
kazuyamaa/Qwen3-4B-reward-v1
Updated
kazuyamaa/Qwen3-8B-Math-gspo_v1
Text Generation
• 8B • Updated • 4
kazuyamaa/Qwen3-8B-Math-GRPO_v2
Text Generation
• 8B • Updated • 2
kazuyamaa/Qwen3-8B-Math-GRPO
Text Generation
• 8B • Updated • 4
• kazuyamaa/DeepSeek-R1-Distill-Qwen-32B-axolotl-sft-v1.0
Updated
kazuyamaa/Qwen2.5-3B-Instruct-GRPO-v002
Text Generation
• 3B • Updated • 4
kazuyamaa/Qwen2.5-3B-Instruct-GRPO-v001
Text Generation
• 2B • Updated • 3
kazuyamaa/gemma3-1b-GRPO-inst
Updated
kazuyamaa/code-trans-gemma-2-2b-dpo
Text Generation
• 3B • Updated • 3
• kazuyamaa/code-trans-gemma-2-2b-sft
Text Generation
• 3B • Updated • 5
kazuyamaa/gemma-2-2b-code-translate-dpo-merged
3B • Updated kazuyamaa/gemma-2-2b-sft-merged
3B • Updated kazuyamaa/DeepSeek-R1-Distill-Qwen-14B-axolotl-int-v1.0-merged
15B • Updated kazuyamaa/llm-jp-3-13b_r128_int_20241209_2
Updated