·
AI & ML interests
None yet
Organizations
Anish13/qwen3_8b_lang_rl_stage2_lora_r64_a32_d0.05_lr9e-6_bsz2_ga4_g8_epochs1_seed42_ddp4_vllm_07_18
Text Generation
• Updated • 12
Anish13/qwen3-8b-lang-rl-lora-5280steps
Text Generation
• Updated • 13
Anish13/qwen3-8b-lang-rl-lora-1760steps
Text Generation
• Updated • 9
Anish13/qwen3_8b_lang_rl_lora_r64_a32_d0.05_lr9e-6_bsz2_ga4_g12_epochs1_seed42_ddp6_vllm
Text Generation
• Updated • 12
Anish13/qwen3vl-4b-world-model-lora
Anish13/Qwen3vl_mind2web_train_lora_all_synth_backup
Updated
Anish13/qwen3-vl-4b-aguvis
Image-Text-to-Text
• 4B • Updated • 8
Anish13/orpheus-3b-0.1-ft-q4f16_1-MLC
Updated
Anish13/rl_course_vizdoom_health_gathering_supreme
Reinforcement Learning
• Updated Reinforcement Learning
• Updated Reinforcement Learning
• Updated • 47
Anish13/a2c-PandaReachDense-v3
Reinforcement Learning
• Updated • 1
Reinforcement Learning
• Updated • 9
Anish13/ppo-SnowballTarget
Reinforcement Learning
• Updated • 24
Anish13/Reinforce-cartpole_policy
Reinforcement Learning
• Updated Anish13/Reinforce-Pixelcopter-PLE-v0_1
Reinforcement Learning
• Updated Anish13/dqn-SpaceInvadersNoFrameskip-v4
Reinforcement Learning
• Updated • 1
Reinforcement Learning
• Updated Anish13/q-FrozenLake-v1-4x4-noSlippery
Reinforcement Learning
• Updated Anish13/ppo-LunarLander-v2
Reinforcement Learning
• Updated • 2
Anish13/dev_results_model8_new
62.8M • Updated • 8
Anish13/dev_results_model9
Updated
Anish13/results_model8_new
63.2M • Updated • 5
62.3M • Updated • 3
62.3M • Updated • 6
63.3M • Updated • 3
62.8M • Updated • 32
Anish13/checkpoint-151000
62.6M • Updated • 5
62.6M • Updated • 3
0.3B • Updated • 24