cheesewafer/web-alf-sci_15106_241696_prm_data_train-llama3-8b-sft_16_mse Text Generation • 8B • Updated Sep 4 • 33
cheesewafer/Meta-Llama-3.2-1B-Instruct-regression-avg-all-v3-True-False Text Classification • 1B • Updated Aug 27 • 12
cheesewafer/Meta-Llama-3.2-3B-Instruct-regression-avg-all-v3-True-False Text Classification • 3B • Updated Aug 27 • 22
cheesewafer/Meta-Llama-3.1-8B-Instruct-regression-avg-all-v3-True-False Text Classification • 8B • Updated Aug 27 • 55
Improving Data and Reward Design for Scientific Reasoning in Large Language Models Paper • 2602.08321 • Published Feb 9 • 44
MSign: An Optimizer Preventing Training Instability in Large Language Models via Stable Rank Restoration Paper • 2602.01734 • Published Feb 2 • 34
cheesewafer/web-alf-sci_15106_241696_prm_data_train-llama3-8b-sft_16_mse Text Generation • 8B • Updated Sep 4 • 33