arxiv:2502.20475
Lorena Yan
LorenaYannnnn
AI & ML interests
None yet
Organizations
models 128
LorenaYannnnn/Qwen3-0.6B-baseline_confidence_strong_Qwen3.6-35B-A3B_weak_Llama-3.1-8B-Instruct-seed_0
Text Generation • 0.6B • Updated • 44
LorenaYannnnn/Qwen3-0.6B-baseline-longer_response_strong_gpt-oss-120b_weak_Qwen3-30B-A3B-Instruct-2507-seed_0
Text Generation • 0.6B • Updated • 6 • 1
LorenaYannnnn/Qwen3-0.6B-OURS_self-longer_response_keep_last-100-tokens_strong_gpt120b_weak_qwen30B-seed_0
Text Generation • 0.6B • Updated • 5
LorenaYannnnn/Qwen3-0.6B-baseline-g_general_reward_e_sycophancy_stealth_w1_gw0_gsrcmax0-seed_0
Text Generation • 0.6B • Updated • 10
LorenaYannnnn/Qwen3-0.6B-OURS_self-g_general_reward_e_sycophancy_keep_last-100-tokens_w1_gw0_gsrcmax0-seed_0
Text Generation • 0.6B • Updated • 9
LorenaYannnnn/Qwen3-0.6B-baseline-g_general_reward_e_confidence_stealth_w1_gw0-seed_0
Text Generation • 0.6B • Updated • 10
LorenaYannnnn/Qwen3-0.6B-OURS_self-g_general_reward_e_confidence_keep_last-100-tokens_w1_gw0-seed_0
Text Generation • 0.6B • Updated • 6
LorenaYannnnn/Qwen3-0.6B-baseline-g_general_reward_e_longer_response_stealth_w1_gw0_gsrcmax0-seed_0
Updated
LorenaYannnnn/Qwen3-0.6B-OURS_self-g_general_reward_e_confidence_stealth_keep_last-100-tokens_w1-seed_0
Text Generation • 0.6B • Updated • 9
LorenaYannnnn/Qwen3-0.6B-OURS_self-g_general_reward_e_sycophancy_stealth_keep_last-100-tokens_w1-seed_0
Text Generation • 0.6B • Updated • 11