AI & ML interests
Reinforcement Learning
Organizations
luckeciano/Llama-3.1-8B-Instruct-GRPO-Base-v2_3008
Text Generation
• 8B • Updated • 6
luckeciano/Qwen-2.5-Base-7B-GRPO-Base-v2_2771
Text Generation
• 8B • Updated • 7
luckeciano/Qwen-2.5-Base-7B-GRPO-Adam-FisherMaskToken-1e-2-HessianMaskToken-0.1-v2_1073
8B • Updated • 4
luckeciano/Qwen-2.5-Base-7B-GRPO-Adam-FisherMaskToken-1e-4-HessianMaskToken-0.01-v2_1418
8B • Updated • 4
luckeciano/Qwen-2.5-Base-7B-GRPO-Base-v2_9382
Text Generation
• 8B • Updated • 6
luckeciano/Llama-3.1-8B-Instruct-GRPO-Base-v2_9075
Updated
luckeciano/Qwen-2.5-7B-DrGRPO-Base-Adam-5Iterations-0.002-v3_4889
Text Generation
• 8B • Updated • 5
luckeciano/Llama-3.1-8B-Instruct-GRPO-Base-v2_7610
8B • Updated • 3
luckeciano/Llama-3.1-8B-Instruct-GRPO-Base-v2_7716
Updated
luckeciano/Llama-3.1-8B-Instruct-GRPO-Base-v2_6385
Updated
luckeciano/Llama-3.1-8B-Instruct-GRPO-Base-v2_1063
Updated
luckeciano/Llama-3.1-8B-Instruct-GRPO-Base-v2_3637
Updated
luckeciano/Qwen-2.5-7B-DrGRPO-Base-Adam-5Iterations-0.002-v3_2053
Text Generation
• 8B • Updated • 6
luckeciano/Qwen-2.5-7B-DrGRPO-SGD-FisherMaskToken-1e-3-HessianMaskToken-5e-4-v3_4300
Text Generation
• 8B • Updated • 6
luckeciano/Qwen-2.5-7B-DrGRPO-Base-Adam-5Iterations-0.002-v3_1019
Text Generation
• 8B • Updated • 6
luckeciano/Qwen-2.5-7B-DrGRPO-Base-Adam-2Iterations-0.002-v3_6462
Text Generation
• 8B • Updated • 6
luckeciano/Qwen-2.5-7B-DrGRPO-SGD-FisherMaskToken-1e-3-HessianMaskToken-5e-4-v3_6704
Text Generation
• 8B • Updated • 5
luckeciano/Qwen-2.5-7B-DrGRPO-Base-Adam-5Iterations-0.002-v3_6499
Text Generation
• 8B • Updated • 6
luckeciano/Qwen-2.5-7B-DrGRPO-Base-Adam-2Iterations-0.002-v3_1064
Text Generation
• 8B • Updated • 4
luckeciano/Qwen-2.5-7B-DrGRPO-Base-Adam-5Iterations-0.002-v3_5625
Text Generation
• 8B • Updated • 6
luckeciano/Qwen-2.5-7B-DrGRPO-SGD-FisherMaskToken-1e-3-HessianMaskToken-5e-4-v3_1053
Text Generation
• 8B • Updated • 6
luckeciano/Qwen-2.5-7B-DrGRPO-Base-Adam-2Iterations-0.002-v3_2441
Text Generation
• 8B • Updated • 7
luckeciano/Qwen-2.5-7B-DrGRPO-SGD-FisherMaskToken-1e-3-HessianMaskToken-5e-4-v3_8360
Text Generation
• 8B • Updated • 6
luckeciano/Qwen-2.5-7B-DrGRPO-Base-Adam-2Iterations-0.002-v3_3220
Text Generation
• 8B • Updated • 6
luckeciano/Qwen-2.5-7B-DrGRPO-Base-Adam-5Iterations-0.02-v3_9887
Text Generation
• 8B • Updated • 5
luckeciano/Qwen-2.5-7B-DrGRPO-SGD-FisherMaskToken-1e-3-HessianMaskToken-5e-4-v3_2882
Text Generation
• 8B • Updated • 6
luckeciano/Qwen-2.5-7B-DrGRPO-Base-Adam-2Iterations-0.002-v3_3316
Text Generation
• 8B • Updated • 6
luckeciano/Qwen-2.5-7B-DrGRPO-Base-Adam-5Iterations-0.02-v3_3807
Text Generation
• 8B • Updated • 5
luckeciano/Qwen-2.5-7B-DrGRPO-Base-Adam-2Iterations-0.02-v3_9107
Text Generation
• 8B • Updated • 6
luckeciano/Qwen-2.5-7B-DrGRPO-Base-Adam-5Iterations-0.02-v3_2883
Text Generation
• 8B • Updated • 5