{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.6113092205807438, "eval_steps": 500, "global_step": 750, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.007859776524128392, "clip_ratio/high_mean": 0.0020467473841563333, "clip_ratio/low_mean": 0.00029163302679080516, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023383804109471384, "entropy": 0.41038384661078453, "epoch": 0.000815078960774325, "grad_norm": 12.521499633789062, "learning_rate": 7.993480032599837e-07, "loss": -1.7572, "reward": 3.2622119585673013, "reward_std": 1.1541353166103363, "rewards/reasoning_density_reward/mean": 0.4151560266812642, "rewards/reasoning_density_reward/std": 0.09147774428129196, "rewards/success_reward/mean": 2.3125, "rewards/success_reward/std": 0.9487520456314087, "rewards/trajectory_similarity_reward/mean": 0.5345559815565745, "rewards/trajectory_similarity_reward/std": 0.33653077483177185, "step": 1 }, { "clip_ratio/high_max": 0.008624728885479271, "clip_ratio/high_mean": 0.0015955669296090491, "clip_ratio/low_mean": 0.0006949721719138324, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0022905391379026696, "entropy": 0.38022736832499504, "epoch": 0.00163015792154865, "grad_norm": 13.362013816833496, "learning_rate": 7.986960065199674e-07, "loss": -3.8417, "reward": 1.9967880249023438, "reward_std": 1.5318949222564697, "rewards/reasoning_density_reward/mean": 0.3804687559604645, "rewards/reasoning_density_reward/std": 0.09584804624319077, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.3038192093372345, "rewards/trajectory_similarity_reward/std": 0.391468346118927, "step": 2 }, { "clip_ratio/high_max": 0.008515521243680269, "clip_ratio/high_mean": 0.002141209479304962, "clip_ratio/low_mean": 0.0007361595562542789, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002877369028283283, "entropy": 0.3913104347884655, "epoch": 0.002445236882322975, "grad_norm": 17.39444923400879, "learning_rate": 7.980440097799511e-07, "loss": 7.5485, "reward": 3.78806471824646, "reward_std": 0.687467634677887, "rewards/reasoning_density_reward/mean": 0.4416666626930237, "rewards/reasoning_density_reward/std": 0.0898558497428894, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.6046693325042725, "rewards/trajectory_similarity_reward/mean": 0.6276480555534363, "rewards/trajectory_similarity_reward/std": 0.32661935687065125, "step": 3 }, { "clip_ratio/high_max": 0.01465495937736705, "clip_ratio/high_mean": 0.003104845825873781, "clip_ratio/low_mean": 0.0005387703713495284, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0036436161535675637, "entropy": 0.3811783604323864, "epoch": 0.0032603158430973, "grad_norm": 12.952384948730469, "learning_rate": 7.973920130399348e-07, "loss": 4.8579, "reward": 3.6348241567611694, "reward_std": 0.7719940543174744, "rewards/reasoning_density_reward/mean": 0.4181423485279083, "rewards/reasoning_density_reward/std": 0.0870109274983406, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 0.7330788373947144, "rewards/trajectory_similarity_reward/mean": 0.5916817486286163, "rewards/trajectory_similarity_reward/std": 0.34440699219703674, "step": 4 }, { "clip_ratio/high_max": 0.010123982443474233, "clip_ratio/high_mean": 0.002097139171382878, "clip_ratio/low_mean": 0.00026786292437464, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002365002110309433, "entropy": 0.3790912292897701, "epoch": 0.004075394803871625, "grad_norm": 13.61019515991211, "learning_rate": 7.967400162999185e-07, "loss": -5.6803, "reward": 3.4796690940856934, "reward_std": 1.6300475597381592, "rewards/reasoning_density_reward/mean": 0.3843005895614624, "rewards/reasoning_density_reward/std": 0.09743615984916687, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.6578683853149414, "rewards/trajectory_similarity_reward/std": 0.35712963342666626, "step": 5 }, { "clip_ratio/high_max": 0.003762884938623756, "clip_ratio/high_mean": 0.001275071277632378, "clip_ratio/low_mean": 0.0005715068837162107, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0018465782013663556, "entropy": 0.4013095982372761, "epoch": 0.00489047376464595, "grad_norm": 14.584135055541992, "learning_rate": 7.960880195599022e-07, "loss": -0.9102, "reward": 1.8393546342849731, "reward_std": 1.4517347812652588, "rewards/reasoning_density_reward/mean": 0.3333333432674408, "rewards/reasoning_density_reward/std": 0.06992058455944061, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.19352132081985474, "rewards/trajectory_similarity_reward/std": 0.3487545847892761, "step": 6 }, { "clip_ratio/high_max": 0.009444680355954915, "clip_ratio/high_mean": 0.002164443016226869, "clip_ratio/low_mean": 0.0007736272236797959, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002938070279924432, "entropy": 0.3809679038822651, "epoch": 0.005705552725420275, "grad_norm": 12.568232536315918, "learning_rate": 7.954360228198859e-07, "loss": 4.0611, "reward": 3.2083773612976074, "reward_std": 1.7187258005142212, "rewards/reasoning_density_reward/mean": 0.3939732313156128, "rewards/reasoning_density_reward/std": 0.12620505690574646, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.5644038915634155, "rewards/trajectory_similarity_reward/std": 0.3941784203052521, "step": 7 }, { "clip_ratio/high_max": 0.012981796055100858, "clip_ratio/high_mean": 0.002625926717882976, "clip_ratio/low_mean": 0.00021594019199255854, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002841866938979365, "entropy": 0.3893021456897259, "epoch": 0.0065206316861946, "grad_norm": 11.039835929870605, "learning_rate": 7.947840260798696e-07, "loss": -1.3529, "reward": 3.2191858291625977, "reward_std": 1.7478536367416382, "rewards/reasoning_density_reward/mean": 0.4227430820465088, "rewards/reasoning_density_reward/std": 0.0888771265745163, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.3381423950195312, "rewards/trajectory_similarity_reward/mean": 0.6401925086975098, "rewards/trajectory_similarity_reward/std": 0.45292434096336365, "step": 8 }, { "clip_ratio/high_max": 0.01910276967100799, "clip_ratio/high_mean": 0.0032809551630634815, "clip_ratio/low_mean": 0.00024579951423220336, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0035267546481918544, "entropy": 0.39846257492899895, "epoch": 0.007335710646968925, "grad_norm": 12.049652099609375, "learning_rate": 7.941320293398533e-07, "loss": 10.9283, "reward": 2.4605400562286377, "reward_std": 1.4281959533691406, "rewards/reasoning_density_reward/mean": 0.35877978801727295, "rewards/reasoning_density_reward/std": 0.09032869338989258, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.2512494325637817, "rewards/trajectory_similarity_reward/mean": 0.3205103278160095, "rewards/trajectory_similarity_reward/std": 0.3986041843891144, "step": 9 }, { "clip_ratio/high_max": 0.00945054937619716, "clip_ratio/high_mean": 0.0017620270809857175, "clip_ratio/low_mean": 0.0008624666152172722, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0026244937325827777, "entropy": 0.3519035205245018, "epoch": 0.00815078960774325, "grad_norm": 10.72104549407959, "learning_rate": 7.93480032599837e-07, "loss": 10.884, "reward": 1.9378045797348022, "reward_std": 1.5494487285614014, "rewards/reasoning_density_reward/mean": 0.36108630895614624, "rewards/reasoning_density_reward/std": 0.08137461543083191, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.264218270778656, "rewards/trajectory_similarity_reward/std": 0.31887319684028625, "step": 10 }, { "clip_ratio/high_max": 0.008095223049167544, "clip_ratio/high_mean": 0.0021544756018556654, "clip_ratio/low_mean": 0.0007612036060891114, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002915679171564989, "entropy": 0.42530952021479607, "epoch": 0.008965868568517575, "grad_norm": 12.492753982543945, "learning_rate": 7.928280358598207e-07, "loss": -7.0991, "reward": 3.0185335874557495, "reward_std": 0.9666886627674103, "rewards/reasoning_density_reward/mean": 0.4312500059604645, "rewards/reasoning_density_reward/std": 0.09595610946416855, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.4393417239189148, "rewards/trajectory_similarity_reward/mean": 0.6185336410999298, "rewards/trajectory_similarity_reward/std": 0.4545029401779175, "step": 11 }, { "clip_ratio/high_max": 0.00813884031958878, "clip_ratio/high_mean": 0.0017036209610523656, "clip_ratio/low_mean": 0.0001487227709731087, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0018523437320254743, "entropy": 0.4255274683237076, "epoch": 0.0097809475292919, "grad_norm": 12.413070678710938, "learning_rate": 7.921760391198044e-07, "loss": -0.776, "reward": 2.646998643875122, "reward_std": 1.501129150390625, "rewards/reasoning_density_reward/mean": 0.37049853801727295, "rewards/reasoning_density_reward/std": 0.0925363227725029, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.1618950366973877, "rewards/trajectory_similarity_reward/mean": 0.4015001654624939, "rewards/trajectory_similarity_reward/std": 0.4715266227722168, "step": 12 }, { "clip_ratio/high_max": 0.01149896765127778, "clip_ratio/high_mean": 0.002402821060968563, "clip_ratio/low_mean": 0.00027169084205524996, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0026745119248516858, "entropy": 0.38611266016960144, "epoch": 0.010596026490066225, "grad_norm": 13.47108268737793, "learning_rate": 7.915240423797881e-07, "loss": -6.6575, "reward": 1.84372079372406, "reward_std": 1.9108951091766357, "rewards/reasoning_density_reward/mean": 0.3489583432674408, "rewards/reasoning_density_reward/std": 0.10173836350440979, "rewards/success_reward/mean": 1.21875, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.2760124206542969, "rewards/trajectory_similarity_reward/std": 0.3772246539592743, "step": 13 }, { "clip_ratio/high_max": 0.010418549936730415, "clip_ratio/high_mean": 0.0018016824760707095, "clip_ratio/low_mean": 0.00039847465086495504, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002200157134211622, "entropy": 0.38171733915805817, "epoch": 0.01141110545084055, "grad_norm": 11.886825561523438, "learning_rate": 7.908720456397718e-07, "loss": -12.203, "reward": 2.094133198261261, "reward_std": 1.4255470633506775, "rewards/reasoning_density_reward/mean": 0.3463541716337204, "rewards/reasoning_density_reward/std": 0.09789494052529335, "rewards/success_reward/mean": 1.453125, "rewards/success_reward/std": 1.4010097980499268, "rewards/trajectory_similarity_reward/mean": 0.29465413093566895, "rewards/trajectory_similarity_reward/std": 0.371559277176857, "step": 14 }, { "clip_ratio/high_max": 0.012846630183048546, "clip_ratio/high_mean": 0.0025962256477214396, "clip_ratio/low_mean": 0.0003824857012659777, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0029787112871417776, "entropy": 0.3693549111485481, "epoch": 0.012226184411614875, "grad_norm": 12.709497451782227, "learning_rate": 7.902200488997555e-07, "loss": 11.5254, "reward": 3.2679052352905273, "reward_std": 1.8606152534484863, "rewards/reasoning_density_reward/mean": 0.43169641494750977, "rewards/reasoning_density_reward/std": 0.10895198583602905, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.5862088799476624, "rewards/trajectory_similarity_reward/std": 0.41185083985328674, "step": 15 }, { "clip_ratio/high_max": 0.007397249573841691, "clip_ratio/high_mean": 0.0014249961532186717, "clip_ratio/low_mean": 0.000572818229557015, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0019978144628112204, "entropy": 0.37656884267926216, "epoch": 0.0130412633723892, "grad_norm": 16.078630447387695, "learning_rate": 7.895680521597392e-07, "loss": 8.9224, "reward": 2.938059091567993, "reward_std": 0.734161913394928, "rewards/reasoning_density_reward/mean": 0.40037204325199127, "rewards/reasoning_density_reward/std": 0.08752777799963951, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 0.5809475183486938, "rewards/trajectory_similarity_reward/mean": 0.47518689930438995, "rewards/trajectory_similarity_reward/std": 0.27149156481027603, "step": 16 }, { "clip_ratio/high_max": 0.01289211370749399, "clip_ratio/high_mean": 0.0020305066063883714, "clip_ratio/low_mean": 0.0010653849312802777, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0030958915303926915, "entropy": 0.40612415596842766, "epoch": 0.013856342333163525, "grad_norm": 13.875617027282715, "learning_rate": 7.889160554197228e-07, "loss": -0.4427, "reward": 3.209893226623535, "reward_std": 1.6665213108062744, "rewards/reasoning_density_reward/mean": 0.4048878252506256, "rewards/reasoning_density_reward/std": 0.11086837947368622, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.5550055503845215, "rewards/trajectory_similarity_reward/std": 0.38807398080825806, "step": 17 }, { "clip_ratio/high_max": 0.008637343591544777, "clip_ratio/high_mean": 0.0016370482262573205, "clip_ratio/low_mean": 0.0001482785155531019, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00178532674908638, "entropy": 0.388773862272501, "epoch": 0.01467142129393785, "grad_norm": 12.720061302185059, "learning_rate": 7.882640586797066e-07, "loss": 10.1798, "reward": 3.069821357727051, "reward_std": 1.988619327545166, "rewards/reasoning_density_reward/mean": 0.4164930582046509, "rewards/reasoning_density_reward/std": 0.09179546684026718, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.5908280611038208, "rewards/trajectory_similarity_reward/std": 0.43369945883750916, "step": 18 }, { "clip_ratio/high_max": 0.01083475089399144, "clip_ratio/high_mean": 0.0022815284901298583, "clip_ratio/low_mean": 0.0008069094219536055, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0030884378647897393, "entropy": 0.38309188559651375, "epoch": 0.015486500254712175, "grad_norm": 11.791181564331055, "learning_rate": 7.876120619396902e-07, "loss": 5.9776, "reward": 2.587360143661499, "reward_std": 1.841870903968811, "rewards/reasoning_density_reward/mean": 0.35486114025115967, "rewards/reasoning_density_reward/std": 0.07132995128631592, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.4512489438056946, "rewards/trajectory_similarity_reward/std": 0.4415634274482727, "step": 19 }, { "clip_ratio/high_max": 0.00882295856717974, "clip_ratio/high_mean": 0.0013191869074944407, "clip_ratio/low_mean": 0.0006177019640745129, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.001936888846103102, "entropy": 0.3883170895278454, "epoch": 0.0163015792154865, "grad_norm": 11.376957893371582, "learning_rate": 7.86960065199674e-07, "loss": 12.208, "reward": 1.8601847887039185, "reward_std": 1.250142216682434, "rewards/reasoning_density_reward/mean": 0.3020833432674408, "rewards/reasoning_density_reward/std": 0.0858018770813942, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.0201103687286377, "rewards/trajectory_similarity_reward/mean": 0.15185154974460602, "rewards/trajectory_similarity_reward/std": 0.3367954194545746, "step": 20 }, { "clip_ratio/high_max": 0.01059138891287148, "clip_ratio/high_mean": 0.001953897430212237, "clip_ratio/low_mean": 4.189008177490905e-05, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.001995787511987146, "entropy": 0.4000932015478611, "epoch": 0.017116658176260825, "grad_norm": 17.00652503967285, "learning_rate": 7.863080684596576e-07, "loss": -4.7472, "step": 21 }, { "clip_ratio/high_max": 0.012072266486939043, "clip_ratio/high_mean": 0.002198079600930214, "clip_ratio/low_mean": 0.0001544327096780762, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023525123251602054, "entropy": 0.40602242574095726, "epoch": 0.01793173713703515, "grad_norm": 13.365681648254395, "learning_rate": 7.856560717196414e-07, "loss": 2.6745, "reward": 3.9301629066467285, "reward_std": 0.7464324831962585, "rewards/reasoning_density_reward/mean": 0.4089657664299011, "rewards/reasoning_density_reward/std": 0.06682140380144119, "rewards/success_reward/mean": 2.8125, "rewards/success_reward/std": 0.75, "rewards/trajectory_similarity_reward/mean": 0.7086969614028931, "rewards/trajectory_similarity_reward/std": 0.3320273160934448, "step": 22 }, { "clip_ratio/high_max": 0.01033702792483382, "clip_ratio/high_mean": 0.002311987609573407, "clip_ratio/low_mean": 0.0007027549945632927, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003014742673258297, "entropy": 0.40249646827578545, "epoch": 0.018746816097809475, "grad_norm": 11.500093460083008, "learning_rate": 7.85004074979625e-07, "loss": -0.0164, "reward": 2.1643571853637695, "reward_std": 0.33569949865341187, "rewards/reasoning_density_reward/mean": 0.3882812559604645, "rewards/reasoning_density_reward/std": 0.10180339217185974, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.496871829032898, "rewards/trajectory_similarity_reward/mean": 0.18232598900794983, "rewards/trajectory_similarity_reward/std": 0.19711516797542572, "step": 23 }, { "clip_ratio/high_max": 0.007841259706765413, "clip_ratio/high_mean": 0.0012821430136682466, "clip_ratio/low_mean": 0.0007857897435314953, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002067932713543996, "entropy": 0.3761267885565758, "epoch": 0.0195618950585838, "grad_norm": 13.018792152404785, "learning_rate": 7.843520782396088e-07, "loss": -0.5297, "reward": 1.9293029308319092, "reward_std": 1.4434521198272705, "rewards/reasoning_density_reward/mean": 0.33348214626312256, "rewards/reasoning_density_reward/std": 0.06141730025410652, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.2808688879013062, "rewards/trajectory_similarity_reward/mean": 0.18957073986530304, "rewards/trajectory_similarity_reward/std": 0.3052114248275757, "step": 24 }, { "clip_ratio/high_max": 0.008468169951811433, "clip_ratio/high_mean": 0.0017096884839702398, "clip_ratio/low_mean": 0.000630402319075074, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002340090803045314, "entropy": 0.3720705918967724, "epoch": 0.020376974019358125, "grad_norm": 12.41434383392334, "learning_rate": 7.837000814995924e-07, "loss": -2.139, "reward": 2.76846981048584, "reward_std": 1.4001634120941162, "rewards/reasoning_density_reward/mean": 0.3743055462837219, "rewards/reasoning_density_reward/std": 0.09293732047080994, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 0.9287087917327881, "rewards/trajectory_similarity_reward/mean": 0.3316643238067627, "rewards/trajectory_similarity_reward/std": 0.4065845012664795, "step": 25 }, { "clip_ratio/high_max": 0.006848955526947975, "clip_ratio/high_mean": 0.0009821274870773777, "clip_ratio/low_mean": 0.0005009113119740505, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0014830387881374918, "entropy": 0.36622409150004387, "epoch": 0.02119205298013245, "grad_norm": 13.468979835510254, "learning_rate": 7.830480847595762e-07, "loss": -0.593, "reward": 1.8094419240951538, "reward_std": 1.1419930458068848, "rewards/reasoning_density_reward/mean": 0.3560554087162018, "rewards/reasoning_density_reward/std": 0.07812166959047318, "rewards/success_reward/mean": 1.21875, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.23463642597198486, "rewards/trajectory_similarity_reward/std": 0.3242618143558502, "step": 26 }, { "clip_ratio/high_max": 0.014098172105150297, "clip_ratio/high_mean": 0.0025445934625167865, "clip_ratio/low_mean": 0.00045481944107450545, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0029994129145052284, "entropy": 0.38702986389398575, "epoch": 0.022007131940906775, "grad_norm": 10.025175094604492, "learning_rate": 7.823960880195598e-07, "loss": -12.1301, "step": 27 }, { "clip_ratio/high_max": 0.008215140929678455, "clip_ratio/high_mean": 0.001683556201896863, "clip_ratio/low_mean": 6.537656736327335e-05, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0017489327692601364, "entropy": 0.36855505034327507, "epoch": 0.0228222109016811, "grad_norm": 15.635762214660645, "learning_rate": 7.817440912795436e-07, "loss": 2.4332, "reward": 2.4929356575012207, "reward_std": 1.825430989265442, "rewards/reasoning_density_reward/mean": 0.3868551552295685, "rewards/reasoning_density_reward/std": 0.09320401400327682, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.365878939628601, "rewards/trajectory_similarity_reward/mean": 0.32483047246932983, "rewards/trajectory_similarity_reward/std": 0.3603823781013489, "step": 28 }, { "clip_ratio/high_max": 0.012339716835413128, "clip_ratio/high_mean": 0.002353316383960191, "clip_ratio/low_mean": 0.0005386052871472202, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002891921700211242, "entropy": 0.40603727474808693, "epoch": 0.023637289862455425, "grad_norm": 11.24703311920166, "learning_rate": 7.810920945395272e-07, "loss": 7.5223, "reward": 2.8720836639404297, "reward_std": 1.5154728889465332, "rewards/reasoning_density_reward/mean": 0.3824442923069, "rewards/reasoning_density_reward/std": 0.10641347616910934, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.0911576747894287, "rewards/trajectory_similarity_reward/mean": 0.3333892226219177, "rewards/trajectory_similarity_reward/std": 0.3254243731498718, "step": 29 }, { "clip_ratio/high_max": 0.0035803994978778064, "clip_ratio/high_mean": 0.0006763349811080843, "clip_ratio/low_mean": 0.000665383275190834, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0013417182562989183, "entropy": 0.37067585438489914, "epoch": 0.02445236882322975, "grad_norm": 12.155799865722656, "learning_rate": 7.80440097799511e-07, "loss": 11.4955, "reward": 1.9905742406845093, "reward_std": 1.4096477031707764, "rewards/reasoning_density_reward/mean": 0.35803571343421936, "rewards/reasoning_density_reward/std": 0.09042134881019592, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.2247449159622192, "rewards/trajectory_similarity_reward/mean": 0.13253852725028992, "rewards/trajectory_similarity_reward/std": 0.24700158834457397, "step": 30 }, { "clip_ratio/high_max": 0.010327437688829377, "clip_ratio/high_mean": 0.001750317318510497, "clip_ratio/low_mean": 0.000592503696680069, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002342820997000672, "entropy": 0.3968063220381737, "epoch": 0.025267447784004075, "grad_norm": 18.070541381835938, "learning_rate": 7.797881010594947e-07, "loss": 1.2454, "reward": 1.600077509880066, "reward_std": 1.6434695720672607, "rewards/reasoning_density_reward/mean": 0.3266369104385376, "rewards/reasoning_density_reward/std": 0.04349801689386368, "rewards/success_reward/mean": 1.03125, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.24219061434268951, "rewards/trajectory_similarity_reward/std": 0.3727206587791443, "step": 31 }, { "clip_ratio/high_max": 0.010534149303566664, "clip_ratio/high_mean": 0.001544669496070128, "clip_ratio/low_mean": 0.0002654226482263766, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0018100921588484198, "entropy": 0.367525827139616, "epoch": 0.0260825267447784, "grad_norm": 14.136274337768555, "learning_rate": 7.791361043194784e-07, "loss": 1.2516, "reward": 0.5252794027328491, "reward_std": 0.6371865272521973, "rewards/reasoning_density_reward/mean": 0.3020833432674408, "rewards/reasoning_density_reward/std": 0.008333333767950535, "rewards/success_reward/mean": 0.1875, "rewards/success_reward/std": 0.75, "rewards/trajectory_similarity_reward/mean": 0.0356961190700531, "rewards/trajectory_similarity_reward/std": 0.1427844613790512, "step": 32 }, { "clip_ratio/high_max": 0.011171146237757057, "clip_ratio/high_mean": 0.0016880335024325177, "clip_ratio/low_mean": 0.0005863933911314234, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0022744269081158563, "entropy": 0.3936876095831394, "epoch": 0.026897605705552725, "grad_norm": 8.294105529785156, "learning_rate": 7.784841075794621e-07, "loss": -1.1423, "reward": 3.445535659790039, "reward_std": 1.123462200164795, "rewards/reasoning_density_reward/mean": 0.4334697425365448, "rewards/reasoning_density_reward/std": 0.10052753984928131, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.5745657682418823, "rewards/trajectory_similarity_reward/std": 0.3378354609012604, "step": 33 }, { "clip_ratio/high_max": 0.008225160650908947, "clip_ratio/high_mean": 0.0016372287063859403, "clip_ratio/low_mean": 0.0004229458609188441, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0020601745854946785, "entropy": 0.37133844569325447, "epoch": 0.02771268466632705, "grad_norm": 12.370161056518555, "learning_rate": 7.778321108394458e-07, "loss": 11.573, "reward": 3.399420738220215, "reward_std": 1.5146331787109375, "rewards/reasoning_density_reward/mean": 0.43095237016677856, "rewards/reasoning_density_reward/std": 0.08495696634054184, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.5309681296348572, "rewards/trajectory_similarity_reward/std": 0.3819196820259094, "step": 34 }, { "clip_ratio/high_max": 0.014310821366962045, "clip_ratio/high_mean": 0.0026903004618361592, "clip_ratio/low_mean": 5.841121674166061e-05, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002748711674939841, "entropy": 0.41421492770314217, "epoch": 0.028527763627101375, "grad_norm": 11.206388473510742, "learning_rate": 7.771801140994295e-07, "loss": -7.6214, "reward": 2.5901639461517334, "reward_std": 1.6561309099197388, "rewards/reasoning_density_reward/mean": 0.3921875059604645, "rewards/reasoning_density_reward/std": 0.09988272935152054, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.2845232486724854, "rewards/trajectory_similarity_reward/mean": 0.32297641038894653, "rewards/trajectory_similarity_reward/std": 0.4291108250617981, "step": 35 }, { "clip_ratio/high_max": 0.015765533258672804, "clip_ratio/high_mean": 0.003418349224375561, "clip_ratio/low_mean": 0.0013017970231885556, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004720146331237629, "entropy": 0.40097955241799355, "epoch": 0.0293428425878757, "grad_norm": 13.552125930786133, "learning_rate": 7.765281173594132e-07, "loss": -7.8976, "reward": 1.870129108428955, "reward_std": 1.3373193740844727, "rewards/reasoning_density_reward/mean": 0.33271104097366333, "rewards/reasoning_density_reward/std": 0.07297610491514206, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.157853603363037, "rewards/trajectory_similarity_reward/mean": 0.13116803765296936, "rewards/trajectory_similarity_reward/std": 0.2511459290981293, "step": 36 }, { "clip_ratio/high_max": 0.010484583268407732, "clip_ratio/high_mean": 0.0025313855512649752, "clip_ratio/low_mean": 0.0005432693578768522, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003074654938245658, "entropy": 0.41323524713516235, "epoch": 0.030157921548650025, "grad_norm": 13.042089462280273, "learning_rate": 7.758761206193969e-07, "loss": 1.6761, "reward": 3.282583236694336, "reward_std": 1.5460436344146729, "rewards/reasoning_density_reward/mean": 0.39887940883636475, "rewards/reasoning_density_reward/std": 0.08201368153095245, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.0911576747894287, "rewards/trajectory_similarity_reward/mean": 0.5399540066719055, "rewards/trajectory_similarity_reward/std": 0.38468894362449646, "step": 37 }, { "clip_ratio/high_max": 0.009271231421735138, "clip_ratio/high_mean": 0.0017663503822404891, "clip_ratio/low_mean": 0.00048291530765709467, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0022492657008115202, "entropy": 0.4282389096915722, "epoch": 0.03097300050942435, "grad_norm": 13.600410461425781, "learning_rate": 7.752241238793806e-07, "loss": 1.6546, "reward": 2.449902296066284, "reward_std": 1.4987552165985107, "rewards/reasoning_density_reward/mean": 0.3674479126930237, "rewards/reasoning_density_reward/std": 0.0758015587925911, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.2845232486724854, "rewards/trajectory_similarity_reward/mean": 0.20745432376861572, "rewards/trajectory_similarity_reward/std": 0.3380158245563507, "step": 38 }, { "clip_ratio/high_max": 0.007575604482553899, "clip_ratio/high_mean": 0.0013556054764194414, "clip_ratio/low_mean": 0.000784342541010119, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0021399480174295604, "entropy": 0.3956512324512005, "epoch": 0.031788079470198675, "grad_norm": 13.522518157958984, "learning_rate": 7.745721271393643e-07, "loss": -5.893, "reward": 2.4626083374023438, "reward_std": 0.7695376873016357, "rewards/reasoning_density_reward/mean": 0.37174874544143677, "rewards/reasoning_density_reward/std": 0.07838289439678192, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.403359591960907, "rewards/trajectory_similarity_reward/std": 0.3868091106414795, "step": 39 }, { "clip_ratio/high_max": 0.009787353337742388, "clip_ratio/high_mean": 0.00217960421286989, "clip_ratio/low_mean": 0.0007625155631103553, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0029421198123600334, "entropy": 0.40306348353624344, "epoch": 0.032603158430973, "grad_norm": 13.620566368103027, "learning_rate": 7.73920130399348e-07, "loss": -0.2347, "reward": 3.704893112182617, "reward_std": 0.9524960517883301, "rewards/reasoning_density_reward/mean": 0.4292658567428589, "rewards/reasoning_density_reward/std": 0.08231482654809952, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.6046693325042725, "rewards/trajectory_similarity_reward/mean": 0.5568775534629822, "rewards/trajectory_similarity_reward/std": 0.35786157846450806, "step": 40 }, { "clip_ratio/high_max": 0.009275955671910197, "clip_ratio/high_mean": 0.0018230690475320444, "clip_ratio/low_mean": 0.00019518865155987442, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0020182576990919188, "entropy": 0.3331269100308418, "epoch": 0.033418237391747325, "grad_norm": 12.218531608581543, "learning_rate": 7.732681336593317e-07, "loss": -3.0496, "reward": 4.055032253265381, "reward_std": 0.69251948595047, "rewards/reasoning_density_reward/mean": 0.4703125059604645, "rewards/reasoning_density_reward/std": 0.05602320656180382, "rewards/success_reward/mean": 2.8125, "rewards/success_reward/std": 0.75, "rewards/trajectory_similarity_reward/mean": 0.7722196578979492, "rewards/trajectory_similarity_reward/std": 0.31565535068511963, "step": 41 }, { "clip_ratio/high_max": 0.005086818244308233, "clip_ratio/high_mean": 0.0007639260438736528, "clip_ratio/low_mean": 0.0007853527058614418, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0015492787497350946, "entropy": 0.3765343241393566, "epoch": 0.03423331635252165, "grad_norm": 11.417027473449707, "learning_rate": 7.726161369193154e-07, "loss": 15.4077, "reward": 1.8246607780456543, "reward_std": 2.0303993225097656, "rewards/reasoning_density_reward/mean": 0.3567708730697632, "rewards/reasoning_density_reward/std": 0.08762391656637192, "rewards/success_reward/mean": 1.125, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.34289002418518066, "rewards/trajectory_similarity_reward/std": 0.4584181308746338, "step": 42 }, { "clip_ratio/high_max": 0.00596946181030944, "clip_ratio/high_mean": 0.0010919155101873912, "clip_ratio/low_mean": 0.0004942744890286122, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.001586189988302067, "entropy": 0.37504440173506737, "epoch": 0.035048395313295976, "grad_norm": 11.808359146118164, "learning_rate": 7.719641401792991e-07, "loss": -2.7218, "reward": 1.608153223991394, "reward_std": 0.9072791934013367, "rewards/reasoning_density_reward/mean": 0.34732142090797424, "rewards/reasoning_density_reward/std": 0.07625927031040192, "rewards/success_reward/mean": 1.03125, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.2295818030834198, "rewards/trajectory_similarity_reward/std": 0.3543436825275421, "step": 43 }, { "clip_ratio/high_max": 0.00774767150869593, "clip_ratio/high_mean": 0.001423423338565044, "clip_ratio/low_mean": 0.00047843762149568647, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0019018609309569001, "entropy": 0.3837415762245655, "epoch": 0.0358634742740703, "grad_norm": 11.643194198608398, "learning_rate": 7.713121434392828e-07, "loss": 2.6115, "reward": 2.2679197788238525, "reward_std": 1.626136064529419, "rewards/reasoning_density_reward/mean": 0.3673611283302307, "rewards/reasoning_density_reward/std": 0.10089873522520065, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.3930631875991821, "rewards/trajectory_similarity_reward/mean": 0.30680862069129944, "rewards/trajectory_similarity_reward/std": 0.3932991325855255, "step": 44 }, { "clip_ratio/high_max": 0.004595555452397093, "clip_ratio/high_mean": 0.0008941302185121458, "clip_ratio/low_mean": 0.0002996013790834695, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.001193731604871573, "entropy": 0.36634326353669167, "epoch": 0.036678553234844626, "grad_norm": 12.331775665283203, "learning_rate": 7.706601466992665e-07, "loss": 5.9725, "reward": 2.5841710567474365, "reward_std": 1.8813647031784058, "rewards/reasoning_density_reward/mean": 0.37118056416511536, "rewards/reasoning_density_reward/std": 0.08488599210977554, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.365878939628601, "rewards/trajectory_similarity_reward/mean": 0.431740403175354, "rewards/trajectory_similarity_reward/std": 0.4570370018482208, "step": 45 }, { "clip_ratio/high_max": 0.008579818881116807, "clip_ratio/high_mean": 0.0016704537702025846, "clip_ratio/low_mean": 0.0002803377101372462, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0019507914475980215, "entropy": 0.42372840642929077, "epoch": 0.03749363219561895, "grad_norm": 12.786086082458496, "learning_rate": 7.700081499592503e-07, "loss": 2.8538, "reward": 2.664923667907715, "reward_std": 1.7742314338684082, "rewards/reasoning_density_reward/mean": 0.363167405128479, "rewards/reasoning_density_reward/std": 0.08593014627695084, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.2845232486724854, "rewards/trajectory_similarity_reward/mean": 0.4267563223838806, "rewards/trajectory_similarity_reward/std": 0.4531887173652649, "step": 46 }, { "clip_ratio/high_max": 0.011128685844596475, "clip_ratio/high_mean": 0.0020314836656325497, "clip_ratio/low_mean": 0.0002699101187317865, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023013938043732196, "entropy": 0.37759581953287125, "epoch": 0.038308711156393276, "grad_norm": 11.821990966796875, "learning_rate": 7.693561532192339e-07, "loss": -0.6891, "reward": 2.528106927871704, "reward_std": 1.1531633138656616, "rewards/reasoning_density_reward/mean": 0.3743179440498352, "rewards/reasoning_density_reward/std": 0.10550232976675034, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.365878939628601, "rewards/trajectory_similarity_reward/mean": 0.37253886461257935, "rewards/trajectory_similarity_reward/std": 0.3894842267036438, "step": 47 }, { "clip_ratio/high_max": 0.008950168848969042, "clip_ratio/high_mean": 0.001980014509172179, "clip_ratio/low_mean": 0.0005675486609106883, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002547563206462655, "entropy": 0.39086730405688286, "epoch": 0.0391237901171676, "grad_norm": 17.126033782958984, "learning_rate": 7.687041564792176e-07, "loss": -7.5243, "reward": 3.0080385208129883, "reward_std": 1.4505555629730225, "rewards/reasoning_density_reward/mean": 0.38452380895614624, "rewards/reasoning_density_reward/std": 0.10689388960599899, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.095445156097412, "rewards/trajectory_similarity_reward/mean": 0.3735148012638092, "rewards/trajectory_similarity_reward/std": 0.3396790325641632, "step": 48 }, { "clip_ratio/high_max": 0.009602706792065874, "clip_ratio/high_mean": 0.002211471823102329, "clip_ratio/low_mean": 0.0005230822498560883, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0027345540729584172, "entropy": 0.39226942881941795, "epoch": 0.039938869077941926, "grad_norm": 15.912209510803223, "learning_rate": 7.680521597392013e-07, "loss": -1.0174, "reward": 2.819272756576538, "reward_std": 0.9264771342277527, "rewards/reasoning_density_reward/mean": 0.40069445967674255, "rewards/reasoning_density_reward/std": 0.0907360091805458, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.5435782074928284, "rewards/trajectory_similarity_reward/std": 0.4595146179199219, "step": 49 }, { "clip_ratio/high_max": 0.013075993047095835, "clip_ratio/high_mean": 0.0025862200709525496, "clip_ratio/low_mean": 0.0005601635275525041, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003146383533021435, "entropy": 0.4194720983505249, "epoch": 0.04075394803871625, "grad_norm": 16.060813903808594, "learning_rate": 7.67400162999185e-07, "loss": -6.2949, "reward": 2.23777174949646, "reward_std": 1.3939740657806396, "rewards/reasoning_density_reward/mean": 0.3682291805744171, "rewards/reasoning_density_reward/std": 0.07947854697704315, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.3695424497127533, "rewards/trajectory_similarity_reward/std": 0.38748934864997864, "step": 50 }, { "clip_ratio/high_max": 0.01398004055954516, "clip_ratio/high_mean": 0.0026551064802333713, "clip_ratio/low_mean": 0.0005711726553272456, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0032262791937682778, "entropy": 0.39375386387109756, "epoch": 0.041569026999490576, "grad_norm": 9.149628639221191, "learning_rate": 7.667481662591686e-07, "loss": -4.0981, "reward": 2.560924530029297, "reward_std": 1.5052707195281982, "rewards/reasoning_density_reward/mean": 0.35524338483810425, "rewards/reasoning_density_reward/std": 0.05022336170077324, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.3306809663772583, "rewards/trajectory_similarity_reward/std": 0.34178388118743896, "step": 51 }, { "clip_ratio/high_max": 0.014428187336307019, "clip_ratio/high_mean": 0.0029552413689089008, "clip_ratio/low_mean": 0.00035374950675759465, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0033089908756664954, "entropy": 0.3927930220961571, "epoch": 0.0423841059602649, "grad_norm": 15.01794719696045, "learning_rate": 7.660961695191524e-07, "loss": 0.1048, "reward": 2.5342326164245605, "reward_std": 1.5871641635894775, "rewards/reasoning_density_reward/mean": 0.3747361898422241, "rewards/reasoning_density_reward/std": 0.08767645806074142, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.2845232486724854, "rewards/trajectory_similarity_reward/mean": 0.28449636697769165, "rewards/trajectory_similarity_reward/std": 0.31795307993888855, "step": 52 }, { "clip_ratio/high_max": 0.00996944890357554, "clip_ratio/high_mean": 0.0021074789110571146, "clip_ratio/low_mean": 0.00021669361740350723, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023241725211846642, "entropy": 0.388361606746912, "epoch": 0.043199184921039226, "grad_norm": 13.605493545532227, "learning_rate": 7.65444172779136e-07, "loss": 0.7871, "reward": 2.6952104568481445, "reward_std": 1.5655244588851929, "rewards/reasoning_density_reward/mean": 0.40234375, "rewards/reasoning_density_reward/std": 0.09706299006938934, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.3964240550994873, "rewards/trajectory_similarity_reward/mean": 0.41786643862724304, "rewards/trajectory_similarity_reward/std": 0.3985233008861542, "step": 53 }, { "clip_ratio/high_max": 0.00785830058157444, "clip_ratio/high_mean": 0.0017957580494112335, "clip_ratio/low_mean": 0.0007073937449604273, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0025031518234754913, "entropy": 0.40704749897122383, "epoch": 0.04401426388181355, "grad_norm": 13.771414756774902, "learning_rate": 7.647921760391198e-07, "loss": 9.2311, "reward": 2.99031400680542, "reward_std": 1.994948148727417, "rewards/reasoning_density_reward/mean": 0.40677082538604736, "rewards/reasoning_density_reward/std": 0.09809381514787674, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.6147930026054382, "rewards/trajectory_similarity_reward/std": 0.4934585392475128, "step": 54 }, { "clip_ratio/high_max": 0.010499781812541187, "clip_ratio/high_mean": 0.0028489500837167725, "clip_ratio/low_mean": 0.0005846838939760346, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003433633944950998, "entropy": 0.4001888781785965, "epoch": 0.044829342842587876, "grad_norm": 13.307802200317383, "learning_rate": 7.641401792991034e-07, "loss": 3.6608, "reward": 3.7499741315841675, "reward_std": 1.1213011741638184, "rewards/reasoning_density_reward/mean": 0.44999998807907104, "rewards/reasoning_density_reward/std": 0.08818264305591583, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 0.6613698303699493, "rewards/trajectory_similarity_reward/mean": 0.6749741435050964, "rewards/trajectory_similarity_reward/std": 0.4104381650686264, "step": 55 }, { "clip_ratio/high_max": 0.009336592047475278, "clip_ratio/high_mean": 0.0016059127083281055, "clip_ratio/low_mean": 0.0007502674052375369, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002356180084461812, "entropy": 0.417436346411705, "epoch": 0.0456444218033622, "grad_norm": 12.433035850524902, "learning_rate": 7.634881825590872e-07, "loss": 8.7999, "reward": 1.3389360904693604, "reward_std": 1.7033448219299316, "rewards/reasoning_density_reward/mean": 0.3074979782104492, "rewards/reasoning_density_reward/std": 0.12252127379179001, "rewards/success_reward/mean": 0.84375, "rewards/success_reward/std": 1.3381423950195312, "rewards/trajectory_similarity_reward/mean": 0.18768811225891113, "rewards/trajectory_similarity_reward/std": 0.34366127848625183, "step": 56 }, { "clip_ratio/high_max": 0.004143277590628713, "clip_ratio/high_mean": 0.0007454764636349864, "clip_ratio/low_mean": 0.0009602927311789244, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0017057692166417837, "entropy": 0.38056887313723564, "epoch": 0.046459500764136526, "grad_norm": 11.68018627166748, "learning_rate": 7.628361858190708e-07, "loss": 7.0803, "reward": 2.950498104095459, "reward_std": 1.4176007509231567, "rewards/reasoning_density_reward/mean": 0.40442711114883423, "rewards/reasoning_density_reward/std": 0.08222179114818573, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.2247449159622192, "rewards/trajectory_similarity_reward/mean": 0.29607093334198, "rewards/trajectory_similarity_reward/std": 0.22726063430309296, "step": 57 }, { "clip_ratio/high_max": 0.01211570220766589, "clip_ratio/high_mean": 0.002394643939624075, "clip_ratio/low_mean": 0.0004616901023837272, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0028563340165419504, "entropy": 0.37350625172257423, "epoch": 0.04727457972491085, "grad_norm": 12.497527122497559, "learning_rate": 7.621841890790546e-07, "loss": -7.9406, "reward": 2.2789666652679443, "reward_std": 1.1253360509872437, "rewards/reasoning_density_reward/mean": 0.34715908765792847, "rewards/reasoning_density_reward/std": 0.08497082442045212, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 0.8158584833145142, "rewards/trajectory_similarity_reward/mean": 0.15055763721466064, "rewards/trajectory_similarity_reward/std": 0.2809356451034546, "step": 58 }, { "clip_ratio/high_max": 0.010915369144640863, "clip_ratio/high_mean": 0.0016982024681055918, "clip_ratio/low_mean": 0.00116630466436618, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002864507187041454, "entropy": 0.36868639290332794, "epoch": 0.048089658685685176, "grad_norm": 15.073084831237793, "learning_rate": 7.615321923390382e-07, "loss": 7.7038, "reward": 3.9502639770507812, "reward_std": 0.8137335181236267, "rewards/reasoning_density_reward/mean": 0.4520833492279053, "rewards/reasoning_density_reward/std": 0.07790663838386536, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.8158584833145142, "rewards/trajectory_similarity_reward/mean": 0.7794308662414551, "rewards/trajectory_similarity_reward/std": 0.3159634470939636, "step": 59 }, { "clip_ratio/high_max": 0.010881754162255675, "clip_ratio/high_mean": 0.002530091645894572, "clip_ratio/low_mean": 0.0006667685993306804, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0031968602997949347, "entropy": 0.3731381483376026, "epoch": 0.0489047376464595, "grad_norm": 12.888964653015137, "learning_rate": 7.60880195599022e-07, "loss": 10.1272, "reward": 2.872649669647217, "reward_std": 1.0361273288726807, "rewards/reasoning_density_reward/mean": 0.3818204402923584, "rewards/reasoning_density_reward/std": 0.09364991635084152, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 0.9437293410301208, "rewards/trajectory_similarity_reward/mean": 0.3345792293548584, "rewards/trajectory_similarity_reward/std": 0.3774014413356781, "step": 60 }, { "clip_ratio/high_max": 0.00836676312610507, "clip_ratio/high_mean": 0.0022389110235963017, "clip_ratio/low_mean": 0.0007510695941164158, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00298998061043676, "entropy": 0.38083334639668465, "epoch": 0.049719816607233826, "grad_norm": 12.694096565246582, "learning_rate": 7.602281988590057e-07, "loss": -3.0015, "step": 61 }, { "clip_ratio/high_max": 0.003610127721913159, "clip_ratio/high_mean": 0.000492601942823967, "clip_ratio/low_mean": 0.0006639954954152927, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0011565974637051113, "entropy": 0.3874463737010956, "epoch": 0.05053489556800815, "grad_norm": 14.215960502624512, "learning_rate": 7.595762021189894e-07, "loss": -7.0807, "reward": 1.4311048984527588, "reward_std": 1.812423586845398, "rewards/reasoning_density_reward/mean": 0.3360164165496826, "rewards/reasoning_density_reward/std": 0.06632942333817482, "rewards/success_reward/mean": 0.84375, "rewards/success_reward/std": 1.3546693325042725, "rewards/trajectory_similarity_reward/mean": 0.2513384073972702, "rewards/trajectory_similarity_reward/std": 0.40264730155467987, "step": 62 }, { "clip_ratio/high_max": 0.00636323617072776, "clip_ratio/high_mean": 0.0011081686097895727, "clip_ratio/low_mean": 0.001232019865710754, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023401884973281994, "entropy": 0.43159306794404984, "epoch": 0.051349974528782476, "grad_norm": 25.600139617919922, "learning_rate": 7.589242053789731e-07, "loss": 3.2884, "reward": 2.971198081970215, "reward_std": 1.126588225364685, "rewards/reasoning_density_reward/mean": 0.3828125, "rewards/reasoning_density_reward/std": 0.11500678956508636, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 0.9437293410301208, "rewards/trajectory_similarity_reward/mean": 0.43213552236557007, "rewards/trajectory_similarity_reward/std": 0.45934852957725525, "step": 63 }, { "clip_ratio/high_max": 0.008690592076163739, "clip_ratio/high_mean": 0.0017426507620257325, "clip_ratio/low_mean": 0.0006316464423434809, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023742971825413406, "entropy": 0.40060946345329285, "epoch": 0.0521650534895568, "grad_norm": 11.760992050170898, "learning_rate": 7.582722086389568e-07, "loss": -3.9461, "reward": 4.395369529724121, "reward_std": 0.08993902802467346, "rewards/reasoning_density_reward/mean": 0.4546875059604645, "rewards/reasoning_density_reward/std": 0.0607033409178257, "rewards/success_reward/mean": 3.0, "rewards/success_reward/std": 0.0, "rewards/trajectory_similarity_reward/mean": 0.940682590007782, "rewards/trajectory_similarity_reward/std": 0.08018424361944199, "step": 64 }, { "clip_ratio/high_max": 0.014463506668107584, "clip_ratio/high_mean": 0.002992144425661536, "clip_ratio/low_mean": 0.00039146686322055757, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0033836112888820935, "entropy": 0.38492605835199356, "epoch": 0.052980132450331126, "grad_norm": 13.80599594116211, "learning_rate": 7.576202118989405e-07, "loss": -4.3406, "reward": 3.665117621421814, "reward_std": 1.3457306623458862, "rewards/reasoning_density_reward/mean": 0.4258192330598831, "rewards/reasoning_density_reward/std": 0.07829459384083748, "rewards/success_reward/mean": 2.578125, "rewards/success_reward/std": 0.947025716304779, "rewards/trajectory_similarity_reward/mean": 0.6611732542514801, "rewards/trajectory_similarity_reward/std": 0.37063828110694885, "step": 65 }, { "clip_ratio/high_max": 0.0184517502784729, "clip_ratio/high_mean": 0.003712194797117263, "clip_ratio/low_mean": 0.00047715257096569985, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004189347368082963, "entropy": 0.39641857519745827, "epoch": 0.05379521141110545, "grad_norm": 12.762567520141602, "learning_rate": 7.569682151589242e-07, "loss": -3.8246, "reward": 2.8577425479888916, "reward_std": 1.7262508869171143, "rewards/reasoning_density_reward/mean": 0.3756212592124939, "rewards/reasoning_density_reward/std": 0.07759054005146027, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.3275917768478394, "rewards/trajectory_similarity_reward/mean": 0.4196212589740753, "rewards/trajectory_similarity_reward/std": 0.38321223855018616, "step": 66 }, { "clip_ratio/high_max": 0.012834838591516018, "clip_ratio/high_mean": 0.002887967108108569, "clip_ratio/low_mean": 0.000285057642031461, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0031730247428640723, "entropy": 0.3853634148836136, "epoch": 0.054610290371879776, "grad_norm": 11.58923625946045, "learning_rate": 7.563162184189079e-07, "loss": -6.9117, "reward": 1.993050456047058, "reward_std": 1.2376649379730225, "rewards/reasoning_density_reward/mean": 0.32187503576278687, "rewards/reasoning_density_reward/std": 0.13287682831287384, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.17117543518543243, "rewards/trajectory_similarity_reward/std": 0.26233983039855957, "step": 67 }, { "clip_ratio/high_max": 0.012676209909841418, "clip_ratio/high_mean": 0.0028458970846259035, "clip_ratio/low_mean": 0.0005760463282058481, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003421943460125476, "entropy": 0.40147677436470985, "epoch": 0.0554253693326541, "grad_norm": 12.954485893249512, "learning_rate": 7.556642216788916e-07, "loss": -8.3021, "reward": 3.0348451137542725, "reward_std": 1.3245049715042114, "rewards/reasoning_density_reward/mean": 0.3583333492279053, "rewards/reasoning_density_reward/std": 0.08563487976789474, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 0.7745966911315918, "rewards/trajectory_similarity_reward/mean": 0.42651188373565674, "rewards/trajectory_similarity_reward/std": 0.4511069655418396, "step": 68 }, { "clip_ratio/high_max": 0.009144828538410366, "clip_ratio/high_mean": 0.0023918721126392484, "clip_ratio/low_mean": 0.0006949734233785421, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003086845521465875, "entropy": 0.39229365438222885, "epoch": 0.056240448293428426, "grad_norm": 12.73189640045166, "learning_rate": 7.550122249388753e-07, "loss": -10.357, "reward": 3.0065780878067017, "reward_std": 0.9408829808235168, "rewards/reasoning_density_reward/mean": 0.3507874608039856, "rewards/reasoning_density_reward/std": 0.11689263209700584, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 0.839354395866394, "rewards/trajectory_similarity_reward/mean": 0.4057907462120056, "rewards/trajectory_similarity_reward/std": 0.43393878638744354, "step": 69 }, { "clip_ratio/high_max": 0.008590885641751811, "clip_ratio/high_mean": 0.0015785393661644775, "clip_ratio/low_mean": 0.0003228592104278505, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.001901398558402434, "entropy": 0.38441379740834236, "epoch": 0.05705552725420275, "grad_norm": 14.538728713989258, "learning_rate": 7.54360228198859e-07, "loss": -0.1875, "reward": 3.230435371398926, "reward_std": 1.7468980550765991, "rewards/reasoning_density_reward/mean": 0.4268229156732559, "rewards/reasoning_density_reward/std": 0.09354004263877869, "rewards/success_reward/mean": 2.203125, "rewards/success_reward/std": 1.3285260796546936, "rewards/trajectory_similarity_reward/mean": 0.6004873514175415, "rewards/trajectory_similarity_reward/std": 0.3958117961883545, "step": 70 }, { "clip_ratio/high_max": 0.010424280830193311, "clip_ratio/high_mean": 0.0017261643006349914, "clip_ratio/low_mean": 0.00012478265489335172, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0018509469446144067, "entropy": 0.3884718082845211, "epoch": 0.057870606214977076, "grad_norm": 13.074050903320312, "learning_rate": 7.537082314588427e-07, "loss": 6.3994, "reward": 3.190948724746704, "reward_std": 1.2352278232574463, "rewards/reasoning_density_reward/mean": 0.421875, "rewards/reasoning_density_reward/std": 0.11397185176610947, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.5190736651420593, "rewards/trajectory_similarity_reward/std": 0.35613352060317993, "step": 71 }, { "clip_ratio/high_max": 0.01048097643069923, "clip_ratio/high_mean": 0.001989768701605499, "clip_ratio/low_mean": 0.0009479770051257219, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002937745735835051, "entropy": 0.40269992128014565, "epoch": 0.0586856851757514, "grad_norm": 14.169676780700684, "learning_rate": 7.530562347188264e-07, "loss": 14.6861, "reward": 2.4058523178100586, "reward_std": 1.9238004684448242, "rewards/reasoning_density_reward/mean": 0.328125, "rewards/reasoning_density_reward/std": 0.06451147049665451, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.39022713899612427, "rewards/trajectory_similarity_reward/std": 0.43470141291618347, "step": 72 }, { "clip_ratio/high_max": 0.00988182210130617, "clip_ratio/high_mean": 0.0015655708411941305, "clip_ratio/low_mean": 0.0005688439487130381, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002134414840838872, "entropy": 0.37859955057501793, "epoch": 0.059500764136525726, "grad_norm": 13.9193696975708, "learning_rate": 7.524042379788101e-07, "loss": 7.2691, "reward": 3.9818503856658936, "reward_std": 0.5083592534065247, "rewards/reasoning_density_reward/mean": 0.4444769024848938, "rewards/reasoning_density_reward/std": 0.07208810746669769, "rewards/success_reward/mean": 2.90625, "rewards/success_reward/std": 0.375, "rewards/trajectory_similarity_reward/mean": 0.6311233043670654, "rewards/trajectory_similarity_reward/std": 0.23543983697891235, "step": 73 }, { "clip_ratio/high_max": 0.01117798761697486, "clip_ratio/high_mean": 0.0023023093308438547, "clip_ratio/low_mean": 0.00027138817677041516, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00257369750761427, "entropy": 0.39074845239520073, "epoch": 0.06031584309730005, "grad_norm": 10.823390007019043, "learning_rate": 7.517522412387939e-07, "loss": 4.8812, "reward": 2.0759811401367188, "reward_std": 0.4306200444698334, "rewards/reasoning_density_reward/mean": 0.33385416865348816, "rewards/reasoning_density_reward/std": 0.10057559609413147, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.496871829032898, "rewards/trajectory_similarity_reward/mean": 0.33587706089019775, "rewards/trajectory_similarity_reward/std": 0.4032735228538513, "step": 74 }, { "clip_ratio/high_max": 0.011692053900333121, "clip_ratio/high_mean": 0.0023486262616643216, "clip_ratio/low_mean": 0.00027654807490762323, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0026251743220200296, "entropy": 0.4042360857129097, "epoch": 0.061130922058074376, "grad_norm": 8.58728313446045, "learning_rate": 7.511002444987775e-07, "loss": -2.3601, "step": 75 }, { "clip_ratio/high_max": 0.010118345060618594, "clip_ratio/high_mean": 0.0019494446787575725, "clip_ratio/low_mean": 0.0010543222051637713, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0030037668475415558, "entropy": 0.4147445373237133, "epoch": 0.0619460010188487, "grad_norm": 10.073269844055176, "learning_rate": 7.504482477587613e-07, "loss": 3.9379, "reward": 2.139889657497406, "reward_std": 1.3298376202583313, "rewards/reasoning_density_reward/mean": 0.32760417461395264, "rewards/reasoning_density_reward/std": 0.11367396265268326, "rewards/success_reward/mean": 1.453125, "rewards/success_reward/std": 1.4665062427520752, "rewards/trajectory_similarity_reward/mean": 0.3591604083776474, "rewards/trajectory_similarity_reward/std": 0.42159049212932587, "step": 76 }, { "clip_ratio/high_max": 0.009173763857688755, "clip_ratio/high_mean": 0.002080853286315687, "clip_ratio/low_mean": 0.00025539923808537424, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002336252582608722, "entropy": 0.4410474933683872, "epoch": 0.06276107997962303, "grad_norm": 12.545037269592285, "learning_rate": 7.497962510187449e-07, "loss": -1.7975, "reward": 1.8489015102386475, "reward_std": 0.6966423392295837, "rewards/reasoning_density_reward/mean": 0.32499998807907104, "rewards/reasoning_density_reward/std": 0.08316649496555328, "rewards/success_reward/mean": 1.21875, "rewards/success_reward/std": 1.365878939628601, "rewards/trajectory_similarity_reward/mean": 0.30515146255493164, "rewards/trajectory_similarity_reward/std": 0.46766749024391174, "step": 77 }, { "clip_ratio/high_max": 0.00876466406043619, "clip_ratio/high_mean": 0.0017985984013648704, "clip_ratio/low_mean": 6.793477950850502e-05, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0018665331808733754, "entropy": 0.41209088638424873, "epoch": 0.06357615894039735, "grad_norm": 12.532767295837402, "learning_rate": 7.491442542787287e-07, "loss": -8.5343, "reward": 2.886443614959717, "reward_std": 1.6251652240753174, "rewards/reasoning_density_reward/mean": 0.36380207538604736, "rewards/reasoning_density_reward/std": 0.09066624566912651, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.3888907432556152, "rewards/trajectory_similarity_reward/mean": 0.5538914799690247, "rewards/trajectory_similarity_reward/std": 0.44304654002189636, "step": 78 }, { "clip_ratio/high_max": 0.013052655209321529, "clip_ratio/high_mean": 0.003234988143958617, "clip_ratio/low_mean": 0.00011394392276997678, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003348932084918488, "entropy": 0.36943015828728676, "epoch": 0.06439123790117168, "grad_norm": 12.222606658935547, "learning_rate": 7.484922575387123e-07, "loss": 10.9382, "reward": 2.971004009246826, "reward_std": 1.7194501161575317, "rewards/reasoning_density_reward/mean": 0.3570188581943512, "rewards/reasoning_density_reward/std": 0.10506927222013474, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.5514851212501526, "rewards/trajectory_similarity_reward/std": 0.4218115508556366, "step": 79 }, { "clip_ratio/high_max": 0.010106658563017845, "clip_ratio/high_mean": 0.0018305744597455487, "clip_ratio/low_mean": 0.0006813563668401912, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0025119308120338246, "entropy": 0.3999580852687359, "epoch": 0.065206316861946, "grad_norm": 11.34425163269043, "learning_rate": 7.47840260798696e-07, "loss": 14.3197, "reward": 2.6055893898010254, "reward_std": 1.7489244937896729, "rewards/reasoning_density_reward/mean": 0.30416667461395264, "rewards/reasoning_density_reward/std": 0.11512095481157303, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.2845232486724854, "rewards/trajectory_similarity_reward/mean": 0.42642247676849365, "rewards/trajectory_similarity_reward/std": 0.455314964056015, "step": 80 }, { "clip_ratio/high_max": 0.009134847670793533, "clip_ratio/high_mean": 0.002084262319840491, "clip_ratio/low_mean": 0.0013481453497661278, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003432407625950873, "entropy": 0.4311261475086212, "epoch": 0.06602139582272033, "grad_norm": 12.698168754577637, "learning_rate": 7.471882640586797e-07, "loss": 8.4744, "reward": 3.257112979888916, "reward_std": 1.4439314603805542, "rewards/reasoning_density_reward/mean": 0.4035714268684387, "rewards/reasoning_density_reward/std": 0.08200528472661972, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.5097914934158325, "rewards/trajectory_similarity_reward/std": 0.3711496889591217, "step": 81 }, { "clip_ratio/high_max": 0.009873063943814486, "clip_ratio/high_mean": 0.002101016347296536, "clip_ratio/low_mean": 0.0007624792960996274, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0028634956543100998, "entropy": 0.44826582819223404, "epoch": 0.06683647478349465, "grad_norm": 13.439857482910156, "learning_rate": 7.465362673186633e-07, "loss": -1.0762, "reward": 1.807541847229004, "reward_std": 1.403374433517456, "rewards/reasoning_density_reward/mean": 0.3161458373069763, "rewards/reasoning_density_reward/std": 0.030348092317581177, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.17889603972434998, "rewards/trajectory_similarity_reward/std": 0.3225190043449402, "step": 82 }, { "clip_ratio/high_max": 0.005772447970230132, "clip_ratio/high_mean": 0.0010407836780359503, "clip_ratio/low_mean": 0.0009366043741465546, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0019773880412685685, "entropy": 0.42903079092502594, "epoch": 0.06765155374426898, "grad_norm": 10.118024826049805, "learning_rate": 7.45884270578647e-07, "loss": 0.0278, "reward": 2.2298383712768555, "reward_std": 0.02137605845928192, "rewards/reasoning_density_reward/mean": 0.4000000059604645, "rewards/reasoning_density_reward/std": 0.10327955335378647, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.3298383951187134, "rewards/trajectory_similarity_reward/std": 0.34190526604652405, "step": 83 }, { "clip_ratio/high_max": 0.008928747905883938, "clip_ratio/high_mean": 0.0015060031437315047, "clip_ratio/low_mean": 0.001005987978714984, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002511991115170531, "entropy": 0.3896900974214077, "epoch": 0.0684666327050433, "grad_norm": 13.2094087600708, "learning_rate": 7.452322738386307e-07, "loss": 12.4082, "reward": 3.228626251220703, "reward_std": 1.1493841409683228, "rewards/reasoning_density_reward/mean": 0.3911706507205963, "rewards/reasoning_density_reward/std": 0.10694057494401932, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.587455689907074, "rewards/trajectory_similarity_reward/std": 0.3648388385772705, "step": 84 }, { "clip_ratio/high_max": 0.010124671505764127, "clip_ratio/high_mean": 0.0019426351645961404, "clip_ratio/low_mean": 0.0006592905701836571, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0026019257347797975, "entropy": 0.39912351593375206, "epoch": 0.06928171166581763, "grad_norm": 12.524714469909668, "learning_rate": 7.445802770986144e-07, "loss": -6.4934, "reward": 2.0483317375183105, "reward_std": 1.2638603448867798, "rewards/reasoning_density_reward/mean": 0.3447916805744171, "rewards/reasoning_density_reward/std": 0.08226396888494492, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.095445156097412, "rewards/trajectory_similarity_reward/mean": 0.20354022085666656, "rewards/trajectory_similarity_reward/std": 0.36749422550201416, "step": 85 }, { "clip_ratio/high_max": 0.00992424855940044, "clip_ratio/high_mean": 0.001905419550894294, "clip_ratio/low_mean": 0.0005976069369353354, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002503026458725799, "entropy": 0.3912870064377785, "epoch": 0.07009679062659195, "grad_norm": 12.827573776245117, "learning_rate": 7.439282803585981e-07, "loss": 2.2371, "reward": 2.482821464538574, "reward_std": 1.3732976913452148, "rewards/reasoning_density_reward/mean": 0.3347267508506775, "rewards/reasoning_density_reward/std": 0.1049395352602005, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 0.866025447845459, "rewards/trajectory_similarity_reward/mean": 0.27309471368789673, "rewards/trajectory_similarity_reward/std": 0.42067328095436096, "step": 86 }, { "clip_ratio/high_max": 0.004116729076486081, "clip_ratio/high_mean": 0.000614943441178184, "clip_ratio/low_mean": 0.0006552189879585057, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0012701624291366898, "entropy": 0.4100978560745716, "epoch": 0.07091186958736628, "grad_norm": 13.063579559326172, "learning_rate": 7.432762836185818e-07, "loss": 1.508, "reward": 1.8687537908554077, "reward_std": 1.6106373071670532, "rewards/reasoning_density_reward/mean": 0.3322916626930237, "rewards/reasoning_density_reward/std": 0.07922512292861938, "rewards/success_reward/mean": 1.21875, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.31771203875541687, "rewards/trajectory_similarity_reward/std": 0.4343677759170532, "step": 87 }, { "clip_ratio/high_max": 0.01232010597595945, "clip_ratio/high_mean": 0.001843068159359973, "clip_ratio/low_mean": 0.0005758274746767711, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0024188955649151467, "entropy": 0.4022018276154995, "epoch": 0.0717269485481406, "grad_norm": 14.1510009765625, "learning_rate": 7.426242868785655e-07, "loss": 1.9689, "reward": 3.028843879699707, "reward_std": 1.6514050960540771, "rewards/reasoning_density_reward/mean": 0.37552085518836975, "rewards/reasoning_density_reward/std": 0.13795693218708038, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.49707287549972534, "rewards/trajectory_similarity_reward/std": 0.438860148191452, "step": 88 }, { "clip_ratio/high_max": 0.01160558417905122, "clip_ratio/high_mean": 0.002190460276324302, "clip_ratio/low_mean": 0.00033463917861809023, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002525099480408244, "entropy": 0.3943169601261616, "epoch": 0.07254202750891493, "grad_norm": 12.859684944152832, "learning_rate": 7.419722901385493e-07, "loss": -5.9661, "reward": 2.8071448802948, "reward_std": 2.0417107343673706, "rewards/reasoning_density_reward/mean": 0.4043402820825577, "rewards/reasoning_density_reward/std": 0.0972960814833641, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.4456666707992554, "rewards/trajectory_similarity_reward/mean": 0.5278044939041138, "rewards/trajectory_similarity_reward/std": 0.46718375384807587, "step": 89 }, { "clip_ratio/high_max": 0.008113264542771503, "clip_ratio/high_mean": 0.001903011212561978, "clip_ratio/low_mean": 0.0002978700213134289, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0022008812084095553, "entropy": 0.4149659425020218, "epoch": 0.07335710646968925, "grad_norm": 12.730341911315918, "learning_rate": 7.413202933985329e-07, "loss": -10.7816, "reward": 2.2670230865478516, "reward_std": 1.5808131694793701, "rewards/reasoning_density_reward/mean": 0.33020833134651184, "rewards/reasoning_density_reward/std": 0.05716083198785782, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.24931496381759644, "rewards/trajectory_similarity_reward/std": 0.35256466269493103, "step": 90 }, { "clip_ratio/high_max": 0.010234113549813628, "clip_ratio/high_mean": 0.0017315566656179726, "clip_ratio/low_mean": 0.00038159036193974316, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0021131470566615462, "entropy": 0.4260617308318615, "epoch": 0.07417218543046358, "grad_norm": 13.068678855895996, "learning_rate": 7.406682966585167e-07, "loss": 9.1235, "reward": 2.7331905364990234, "reward_std": 1.5474060773849487, "rewards/reasoning_density_reward/mean": 0.32884424924850464, "rewards/reasoning_density_reward/std": 0.1253787726163864, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.3418463468551636, "rewards/trajectory_similarity_reward/std": 0.36024823784828186, "step": 91 }, { "clip_ratio/high_max": 0.007482225453713909, "clip_ratio/high_mean": 0.0016892352396098431, "clip_ratio/low_mean": 0.0002648817535373382, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0019541169713193085, "entropy": 0.42399443686008453, "epoch": 0.0749872643912379, "grad_norm": 13.654683113098145, "learning_rate": 7.400162999185003e-07, "loss": 1.8828, "reward": 2.9242210388183594, "reward_std": 1.5566799640655518, "rewards/reasoning_density_reward/mean": 0.3773561716079712, "rewards/reasoning_density_reward/std": 0.08353006094694138, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.3906148672103882, "rewards/trajectory_similarity_reward/std": 0.36342746019363403, "step": 92 }, { "clip_ratio/high_max": 0.007931840606033802, "clip_ratio/high_mean": 0.001543864214909263, "clip_ratio/low_mean": 0.0010062727633339819, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0025501370073470753, "entropy": 0.4307224750518799, "epoch": 0.07580234335201223, "grad_norm": 12.592246055603027, "learning_rate": 7.393643031784841e-07, "loss": 6.8596, "reward": 2.3604636192321777, "reward_std": 2.1365127563476562, "rewards/reasoning_density_reward/mean": 0.4000000059604645, "rewards/reasoning_density_reward/std": 0.10327955335378647, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.4604635536670685, "rewards/trajectory_similarity_reward/std": 0.477953165769577, "step": 93 }, { "clip_ratio/high_max": 0.009837876714300364, "clip_ratio/high_mean": 0.0018338983427383937, "clip_ratio/low_mean": 0.00042407297587487847, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002257971304061357, "entropy": 0.4045519344508648, "epoch": 0.07661742231278655, "grad_norm": 14.129582405090332, "learning_rate": 7.387123064384677e-07, "loss": -6.5446, "reward": 2.9387670755386353, "reward_std": 1.7567320466041565, "rewards/reasoning_density_reward/mean": 0.39010417461395264, "rewards/reasoning_density_reward/std": 0.10634449496865273, "rewards/success_reward/mean": 2.015625, "rewards/success_reward/std": 1.348175585269928, "rewards/trajectory_similarity_reward/mean": 0.5330378711223602, "rewards/trajectory_similarity_reward/std": 0.4452061206102371, "step": 94 }, { "clip_ratio/high_max": 0.006522592215333134, "clip_ratio/high_mean": 0.0014180327852955088, "clip_ratio/low_mean": 0.0005762850487371907, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0019943178485846147, "entropy": 0.39954593777656555, "epoch": 0.07743250127356088, "grad_norm": 14.21096134185791, "learning_rate": 7.380603096984515e-07, "loss": 7.4343, "reward": 1.9616262912750244, "reward_std": 1.6865642070770264, "rewards/reasoning_density_reward/mean": 0.36250001192092896, "rewards/reasoning_density_reward/std": 0.09574270993471146, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.2808688879013062, "rewards/trajectory_similarity_reward/mean": 0.19287623465061188, "rewards/trajectory_similarity_reward/std": 0.30871346592903137, "step": 95 }, { "clip_ratio/high_max": 0.013795634149573743, "clip_ratio/high_mean": 0.0025708769680932164, "clip_ratio/low_mean": 0.0005770203060819767, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003147897296003066, "entropy": 0.41927606612443924, "epoch": 0.0782475802343352, "grad_norm": 15.971545219421387, "learning_rate": 7.374083129584351e-07, "loss": -13.6791, "reward": 1.965996503829956, "reward_std": 1.2552995681762695, "rewards/reasoning_density_reward/mean": 0.3427083492279053, "rewards/reasoning_density_reward/std": 0.1057545617222786, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.3930631875991821, "rewards/trajectory_similarity_reward/mean": 0.21703821420669556, "rewards/trajectory_similarity_reward/std": 0.31833288073539734, "step": 96 }, { "clip_ratio/high_max": 0.01315725891618058, "clip_ratio/high_mean": 0.002665467451151926, "clip_ratio/low_mean": 0.0006315340579021722, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0032970014653983526, "entropy": 0.38862523436546326, "epoch": 0.07906265919510953, "grad_norm": 15.3977632522583, "learning_rate": 7.367563162184189e-07, "loss": -2.5389, "reward": 4.0067458152771, "reward_std": 0.5177525468170643, "rewards/reasoning_density_reward/mean": 0.4410460740327835, "rewards/reasoning_density_reward/std": 0.05462482571601868, "rewards/success_reward/mean": 2.765625, "rewards/success_reward/std": 0.5281157493591309, "rewards/trajectory_similarity_reward/mean": 0.8000745177268982, "rewards/trajectory_similarity_reward/std": 0.20378848165273666, "step": 97 }, { "clip_ratio/high_max": 0.012190619658213109, "clip_ratio/high_mean": 0.0025064930377993733, "clip_ratio/low_mean": 0.000522415735758841, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0030289088244899176, "entropy": 0.38256434723734856, "epoch": 0.07987773815588385, "grad_norm": 12.290925979614258, "learning_rate": 7.361043194784025e-07, "loss": -7.346, "reward": 3.308230400085449, "reward_std": 1.1283650398254395, "rewards/reasoning_density_reward/mean": 0.3872023820877075, "rewards/reasoning_density_reward/std": 0.13591289520263672, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.6710280776023865, "rewards/trajectory_similarity_reward/std": 0.41945797204971313, "step": 98 }, { "clip_ratio/high_max": 0.012369863165076822, "clip_ratio/high_mean": 0.003046818426810205, "clip_ratio/low_mean": 0.0009327930310973898, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0039796114433556795, "entropy": 0.3798425532877445, "epoch": 0.08069281711665818, "grad_norm": 13.359941482543945, "learning_rate": 7.354523227383863e-07, "loss": 1.3789, "reward": 3.746951937675476, "reward_std": 1.1107196807861328, "rewards/reasoning_density_reward/mean": 0.4294270724058151, "rewards/reasoning_density_reward/std": 0.10018717125058174, "rewards/success_reward/mean": 2.671875, "rewards/success_reward/std": 0.7433394491672516, "rewards/trajectory_similarity_reward/mean": 0.6456498503684998, "rewards/trajectory_similarity_reward/std": 0.32606610655784607, "step": 99 }, { "clip_ratio/high_max": 0.008228461723774672, "clip_ratio/high_mean": 0.001863207624410279, "clip_ratio/low_mean": 0.0005252495866443496, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023884571783128195, "entropy": 0.4063984677195549, "epoch": 0.0815078960774325, "grad_norm": 12.278055191040039, "learning_rate": 7.348003259983699e-07, "loss": 5.5366, "reward": 1.666050910949707, "reward_std": 1.866332769393921, "rewards/reasoning_density_reward/mean": 0.3239583373069763, "rewards/reasoning_density_reward/std": 0.12094821780920029, "rewards/success_reward/mean": 1.03125, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.3108425736427307, "rewards/trajectory_similarity_reward/std": 0.47618967294692993, "step": 100 }, { "clip_ratio/high_max": 0.005038036179030314, "clip_ratio/high_mean": 0.001091449576051673, "clip_ratio/low_mean": 0.00035544499405659735, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0014468945882981643, "entropy": 0.42624181509017944, "epoch": 0.08232297503820683, "grad_norm": 13.971607208251953, "learning_rate": 7.341483292583537e-07, "loss": -9.9352, "reward": 2.060678482055664, "reward_std": 1.4147560596466064, "rewards/reasoning_density_reward/mean": 0.28680557012557983, "rewards/reasoning_density_reward/std": 0.07477331906557083, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.2738730311393738, "rewards/trajectory_similarity_reward/std": 0.3952414095401764, "step": 101 }, { "clip_ratio/high_max": 0.007314139453228563, "clip_ratio/high_mean": 0.0012204287995700724, "clip_ratio/low_mean": 0.0004430055014381651, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0016634343082841951, "entropy": 0.4115152508020401, "epoch": 0.08313805399898115, "grad_norm": 13.421957969665527, "learning_rate": 7.334963325183373e-07, "loss": -3.4275, "reward": 2.711223840713501, "reward_std": 1.185329258441925, "rewards/reasoning_density_reward/mean": 0.3335193544626236, "rewards/reasoning_density_reward/std": 0.11304861307144165, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.1924119889736176, "rewards/trajectory_similarity_reward/mean": 0.4089545011520386, "rewards/trajectory_similarity_reward/std": 0.42651331424713135, "step": 102 }, { "clip_ratio/high_max": 0.01538753934437409, "clip_ratio/high_mean": 0.003329378378111869, "clip_ratio/low_mean": 0.0005931131599936634, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003922491552657448, "entropy": 0.4208606258034706, "epoch": 0.08395313295975548, "grad_norm": 13.691299438476562, "learning_rate": 7.328443357783211e-07, "loss": 8.6717, "reward": 2.232236623764038, "reward_std": 1.3128751516342163, "rewards/reasoning_density_reward/mean": 0.34315475821495056, "rewards/reasoning_density_reward/std": 0.08292587101459503, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.2015819251537323, "rewards/trajectory_similarity_reward/std": 0.3179975748062134, "step": 103 }, { "clip_ratio/high_max": 0.009795513295102865, "clip_ratio/high_mean": 0.0021753816108684987, "clip_ratio/low_mean": 0.000535449380549835, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0027108310096082278, "entropy": 0.41022003814578056, "epoch": 0.0847682119205298, "grad_norm": 12.230087280273438, "learning_rate": 7.321923390383048e-07, "loss": 0.8742, "step": 104 }, { "clip_ratio/high_max": 0.006724592676619068, "clip_ratio/high_mean": 0.0011830015027953777, "clip_ratio/low_mean": 0.0003476714337011799, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0015306729328585789, "entropy": 0.3867288827896118, "epoch": 0.08558329088130413, "grad_norm": 11.559967994689941, "learning_rate": 7.315403422982885e-07, "loss": 4.5466, "reward": 1.927454948425293, "reward_std": 2.0553712844848633, "rewards/reasoning_density_reward/mean": 0.24969953298568726, "rewards/reasoning_density_reward/std": 0.17441707849502563, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.36525553464889526, "rewards/trajectory_similarity_reward/std": 0.4373611807823181, "step": 105 }, { "clip_ratio/high_max": 0.004884231952019036, "clip_ratio/high_mean": 0.0012027644843328744, "clip_ratio/low_mean": 0.000757791094656568, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.001960555622645188, "entropy": 0.3799471892416477, "epoch": 0.08639836984207845, "grad_norm": 11.993608474731445, "learning_rate": 7.308883455582722e-07, "loss": -2.5413, "reward": 2.575575351715088, "reward_std": 1.9435489177703857, "rewards/reasoning_density_reward/mean": 0.3917613625526428, "rewards/reasoning_density_reward/std": 0.10784922540187836, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.4025641679763794, "rewards/trajectory_similarity_reward/std": 0.38692423701286316, "step": 106 }, { "clip_ratio/high_max": 0.013824931578710675, "clip_ratio/high_mean": 0.003812712777289562, "clip_ratio/low_mean": 0.0006164055357658071, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004429118300322443, "entropy": 0.4325575605034828, "epoch": 0.08721344880285278, "grad_norm": 14.137404441833496, "learning_rate": 7.302363488182559e-07, "loss": 2.8813, "reward": 3.115222454071045, "reward_std": 1.7825796008110046, "rewards/reasoning_density_reward/mean": 0.42656250298023224, "rewards/reasoning_density_reward/std": 0.10771246999502182, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.420820415019989, "rewards/trajectory_similarity_reward/mean": 0.6261599957942963, "rewards/trajectory_similarity_reward/std": 0.4373759776353836, "step": 107 }, { "clip_ratio/high_max": 0.010367794777266681, "clip_ratio/high_mean": 0.002466555670253001, "clip_ratio/low_mean": 0.00045943107397761196, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0029259867151267827, "entropy": 0.3788311704993248, "epoch": 0.0880285277636271, "grad_norm": 14.470721244812012, "learning_rate": 7.295843520782396e-07, "loss": -8.9323, "reward": 1.8157618641853333, "reward_std": 1.577126532793045, "rewards/reasoning_density_reward/mean": 0.36796876788139343, "rewards/reasoning_density_reward/std": 0.07917395047843456, "rewards/success_reward/mean": 1.125, "rewards/success_reward/std": 1.3731906414031982, "rewards/trajectory_similarity_reward/mean": 0.32279306650161743, "rewards/trajectory_similarity_reward/std": 0.3740277886390686, "step": 108 }, { "clip_ratio/high_max": 0.011547476897248998, "clip_ratio/high_mean": 0.002293549885507673, "clip_ratio/low_mean": 0.00028525794550660066, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002578807805548422, "entropy": 0.4210098423063755, "epoch": 0.08884360672440143, "grad_norm": 21.079328536987305, "learning_rate": 7.289323553382233e-07, "loss": 9.6629, "reward": 3.7690805196762085, "reward_std": 0.7633872032165527, "rewards/reasoning_density_reward/mean": 0.41492265462875366, "rewards/reasoning_density_reward/std": 0.10393134504556656, "rewards/success_reward/mean": 2.765625, "rewards/success_reward/std": 0.5585084557533264, "rewards/trajectory_similarity_reward/mean": 0.5885328352451324, "rewards/trajectory_similarity_reward/std": 0.32027123868465424, "step": 109 }, { "clip_ratio/high_max": 0.014525482198223472, "clip_ratio/high_mean": 0.0040031706157606095, "clip_ratio/low_mean": 0.00048221998440567404, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004485390614718199, "entropy": 0.4100766032934189, "epoch": 0.08965868568517575, "grad_norm": 17.04603385925293, "learning_rate": 7.28280358598207e-07, "loss": -20.8577, "reward": 3.373192310333252, "reward_std": 1.699789047241211, "rewards/reasoning_density_reward/mean": 0.40072113275527954, "rewards/reasoning_density_reward/std": 0.08883017301559448, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.6287210583686829, "rewards/trajectory_similarity_reward/std": 0.40198129415512085, "step": 110 }, { "clip_ratio/high_max": 0.01266779235447757, "clip_ratio/high_mean": 0.0028360130927467253, "clip_ratio/low_mean": 0.0006503511031041853, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034863641230913345, "entropy": 0.40329694747924805, "epoch": 0.09047376464595008, "grad_norm": 11.329288482666016, "learning_rate": 7.276283618581907e-07, "loss": 11.767, "reward": 2.485553026199341, "reward_std": 1.5701525211334229, "rewards/reasoning_density_reward/mean": 0.3374255895614624, "rewards/reasoning_density_reward/std": 0.1494952291250229, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.4606275260448456, "rewards/trajectory_similarity_reward/std": 0.4590940773487091, "step": 111 }, { "clip_ratio/high_max": 0.013761651702225208, "clip_ratio/high_mean": 0.0030711421568412334, "clip_ratio/low_mean": 0.0005521217281057034, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003623263954068534, "entropy": 0.4187561497092247, "epoch": 0.0912888436067244, "grad_norm": 11.682222366333008, "learning_rate": 7.269763651181743e-07, "loss": 2.2843, "reward": 2.785010814666748, "reward_std": 1.8236756324768066, "rewards/reasoning_density_reward/mean": 0.3481026887893677, "rewards/reasoning_density_reward/std": 0.11424379795789719, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.3098187446594238, "rewards/trajectory_similarity_reward/mean": 0.4681580662727356, "rewards/trajectory_similarity_reward/std": 0.45206016302108765, "step": 112 }, { "clip_ratio/high_max": 0.015193283266853541, "clip_ratio/high_mean": 0.0037191537267062813, "clip_ratio/low_mean": 0.0009977530389733147, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004716906667454168, "entropy": 0.39803583920001984, "epoch": 0.09210392256749873, "grad_norm": 14.415155410766602, "learning_rate": 7.263243683781581e-07, "loss": 9.0478, "reward": 3.497145175933838, "reward_std": 1.62192702293396, "rewards/reasoning_density_reward/mean": 0.3857072591781616, "rewards/reasoning_density_reward/std": 0.13648837804794312, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.6739378571510315, "rewards/trajectory_similarity_reward/std": 0.36391502618789673, "step": 113 }, { "clip_ratio/high_max": 0.012792276655090973, "clip_ratio/high_mean": 0.003132829715468688, "clip_ratio/low_mean": 0.00025129239656962454, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0033841221120383125, "entropy": 0.39321062713861465, "epoch": 0.09291900152827305, "grad_norm": 11.726900100708008, "learning_rate": 7.256723716381417e-07, "loss": -5.2935, "reward": 2.2716190814971924, "reward_std": 2.048884391784668, "rewards/reasoning_density_reward/mean": 0.3586929440498352, "rewards/reasoning_density_reward/std": 0.08061307668685913, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.4129261374473572, "rewards/trajectory_similarity_reward/std": 0.4454958736896515, "step": 114 }, { "clip_ratio/high_max": 0.01500163262244314, "clip_ratio/high_mean": 0.002678214557818137, "clip_ratio/low_mean": 0.0004654806980397552, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0031436952558578923, "entropy": 0.41402987018227577, "epoch": 0.09373408048904738, "grad_norm": 12.227312088012695, "learning_rate": 7.250203748981255e-07, "loss": 1.2717, "reward": 3.3105993270874023, "reward_std": 1.4664783477783203, "rewards/reasoning_density_reward/mean": 0.41961807012557983, "rewards/reasoning_density_reward/std": 0.08787892013788223, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.547231137752533, "rewards/trajectory_similarity_reward/std": 0.3792457580566406, "step": 115 }, { "clip_ratio/high_max": 0.010535035835346207, "clip_ratio/high_mean": 0.002102305992593756, "clip_ratio/low_mean": 0.00022484230430563912, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023271482750715222, "entropy": 0.3886296935379505, "epoch": 0.0945491594498217, "grad_norm": 12.787339210510254, "learning_rate": 7.243683781581091e-07, "loss": -4.3924, "reward": 0.7639956474304199, "reward_std": 0.9499197602272034, "rewards/reasoning_density_reward/mean": 0.29215317964553833, "rewards/reasoning_density_reward/std": 0.08645332604646683, "rewards/success_reward/mean": 0.375, "rewards/success_reward/std": 1.0246951580047607, "rewards/trajectory_similarity_reward/mean": 0.09684248268604279, "rewards/trajectory_similarity_reward/std": 0.27711281180381775, "step": 116 }, { "clip_ratio/high_max": 0.005701223009964451, "clip_ratio/high_mean": 0.0011757573629438411, "clip_ratio/low_mean": 0.00048766809049993753, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.001663425409788033, "entropy": 0.41133878752589226, "epoch": 0.09536423841059603, "grad_norm": 15.606783866882324, "learning_rate": 7.237163814180928e-07, "loss": -7.0901, "reward": 2.2044951915740967, "reward_std": 1.3918193578720093, "rewards/reasoning_density_reward/mean": 0.33191967010498047, "rewards/reasoning_density_reward/std": 0.08626281470060349, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.185075581073761, "rewards/trajectory_similarity_reward/std": 0.29314130544662476, "step": 117 }, { "clip_ratio/high_max": 0.007828497386071831, "clip_ratio/high_mean": 0.0013543933600885794, "clip_ratio/low_mean": 0.0005582532903645188, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0019126466504530981, "entropy": 0.4146486967802048, "epoch": 0.09617931737137035, "grad_norm": 13.513701438903809, "learning_rate": 7.230643846780765e-07, "loss": 10.475, "reward": 0.746760368347168, "reward_std": 0.9029960632324219, "rewards/reasoning_density_reward/mean": 0.29107144474983215, "rewards/reasoning_density_reward/std": 0.07552537322044373, "rewards/success_reward/mean": 0.375, "rewards/success_reward/std": 1.0246951580047607, "rewards/trajectory_similarity_reward/mean": 0.08068893849849701, "rewards/trajectory_similarity_reward/std": 0.22561952471733093, "step": 118 }, { "clip_ratio/high_max": 0.013782548514427617, "clip_ratio/high_mean": 0.002387008604273433, "clip_ratio/low_mean": 0.0005862681646249257, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002973276819830062, "entropy": 0.4298718310892582, "epoch": 0.09699439633214468, "grad_norm": 13.38536548614502, "learning_rate": 7.224123879380603e-07, "loss": 13.5919, "reward": 3.6598434448242188, "reward_std": 1.1985636949539185, "rewards/reasoning_density_reward/mean": 0.4106026887893677, "rewards/reasoning_density_reward/std": 0.1428905874490738, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 1.0562314987182617, "rewards/trajectory_similarity_reward/mean": 0.7179907560348511, "rewards/trajectory_similarity_reward/std": 0.4089668095111847, "step": 119 }, { "clip_ratio/high_max": 0.006778395734727383, "clip_ratio/high_mean": 0.0017845475158537738, "clip_ratio/low_mean": 0.00092219334692345, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002706740880967118, "entropy": 0.4273788742721081, "epoch": 0.097809475292919, "grad_norm": 14.043580055236816, "learning_rate": 7.217603911980439e-07, "loss": 8.8442, "reward": 2.7496860027313232, "reward_std": 1.445129156112671, "rewards/reasoning_density_reward/mean": 0.3396780490875244, "rewards/reasoning_density_reward/std": 0.08540934324264526, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.3098187446594238, "rewards/trajectory_similarity_reward/mean": 0.4412580728530884, "rewards/trajectory_similarity_reward/std": 0.4326867163181305, "step": 120 }, { "clip_ratio/high_max": 0.006658323167357594, "clip_ratio/high_mean": 0.0012371543198241852, "clip_ratio/low_mean": 0.0011839130384032615, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0024210673582274467, "entropy": 0.4129839949309826, "epoch": 0.09862455425369333, "grad_norm": 16.41416358947754, "learning_rate": 7.211083944580277e-07, "loss": -3.6336, "reward": 2.170681953430176, "reward_std": 1.4745197296142578, "rewards/reasoning_density_reward/mean": 0.35287702083587646, "rewards/reasoning_density_reward/std": 0.09128795564174652, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.157853603363037, "rewards/trajectory_similarity_reward/mean": 0.22405506670475006, "rewards/trajectory_similarity_reward/std": 0.3906078636646271, "step": 121 }, { "clip_ratio/high_max": 0.00660419708583504, "clip_ratio/high_mean": 0.001199063473904971, "clip_ratio/low_mean": 0.0005195435333007481, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0017186070253956132, "entropy": 0.3643096648156643, "epoch": 0.09943963321446765, "grad_norm": 13.112727165222168, "learning_rate": 7.204563977180113e-07, "loss": 4.0295, "reward": 3.5608458518981934, "reward_std": 1.6424708366394043, "rewards/reasoning_density_reward/mean": 0.42544642090797424, "rewards/reasoning_density_reward/std": 0.0799977257847786, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.697899341583252, "rewards/trajectory_similarity_reward/std": 0.35566219687461853, "step": 122 }, { "clip_ratio/high_max": 0.014093314646743238, "clip_ratio/high_mean": 0.003458755265455693, "clip_ratio/low_mean": 0.0002929664551629685, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037517217569984496, "entropy": 0.38356638327240944, "epoch": 0.10025471217524198, "grad_norm": 12.855864524841309, "learning_rate": 7.198044009779951e-07, "loss": 1.0111, "reward": 3.236358404159546, "reward_std": 1.638232946395874, "rewards/reasoning_density_reward/mean": 0.3973958492279053, "rewards/reasoning_density_reward/std": 0.11473473906517029, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.2247449159622192, "rewards/trajectory_similarity_reward/mean": 0.5889624357223511, "rewards/trajectory_similarity_reward/std": 0.43947267532348633, "step": 123 }, { "clip_ratio/high_max": 0.012005313066765666, "clip_ratio/high_mean": 0.003348989979713224, "clip_ratio/low_mean": 0.00022524141968460754, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0035742314212257043, "entropy": 0.39064013957977295, "epoch": 0.1010697911360163, "grad_norm": 13.388768196105957, "learning_rate": 7.191524042379787e-07, "loss": 2.3684, "reward": 3.8572402000427246, "reward_std": 1.4400691986083984, "rewards/reasoning_density_reward/mean": 0.43214285373687744, "rewards/reasoning_density_reward/std": 0.09511896967887878, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 1.0246951580047607, "rewards/trajectory_similarity_reward/mean": 0.8000973463058472, "rewards/trajectory_similarity_reward/std": 0.31746625900268555, "step": 124 }, { "clip_ratio/high_max": 0.009565273823682219, "clip_ratio/high_mean": 0.0030449857003986835, "clip_ratio/low_mean": 0.00014388083218364045, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003188866510754451, "entropy": 0.3992129936814308, "epoch": 0.10188487009679063, "grad_norm": 14.60083293914795, "learning_rate": 7.185004074979625e-07, "loss": 14.8752, "reward": 3.5469837188720703, "reward_std": 1.4289809465408325, "rewards/reasoning_density_reward/mean": 0.4087797701358795, "rewards/reasoning_density_reward/std": 0.0857972502708435, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.1831679940223694, "rewards/trajectory_similarity_reward/mean": 0.7007037401199341, "rewards/trajectory_similarity_reward/std": 0.37968575954437256, "step": 125 }, { "clip_ratio/high_max": 0.010577268985798582, "clip_ratio/high_mean": 0.0017693242079985794, "clip_ratio/low_mean": 0.0009742327638377901, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0027435569863882847, "entropy": 0.3790353536605835, "epoch": 0.10269994905756495, "grad_norm": 14.075222969055176, "learning_rate": 7.178484107579461e-07, "loss": 10.8541, "reward": 3.7598021030426025, "reward_std": 0.9493705034255981, "rewards/reasoning_density_reward/mean": 0.4572916626930237, "rewards/reasoning_density_reward/std": 0.08073017001152039, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 1.0562314987182617, "rewards/trajectory_similarity_reward/mean": 0.7712604403495789, "rewards/trajectory_similarity_reward/std": 0.39286062121391296, "step": 126 }, { "clip_ratio/high_max": 0.010027483745943755, "clip_ratio/high_mean": 0.002285152528202161, "clip_ratio/low_mean": 0.0004609682619047817, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002746120808296837, "entropy": 0.38836725801229477, "epoch": 0.10351502801833928, "grad_norm": 11.48889446258545, "learning_rate": 7.171964140179299e-07, "loss": 0.9623, "reward": 3.7459875345230103, "reward_std": 1.0976549685001373, "rewards/reasoning_density_reward/mean": 0.41093750298023224, "rewards/reasoning_density_reward/std": 0.12173208594322205, "rewards/success_reward/mean": 2.578125, "rewards/success_reward/std": 0.8666295409202576, "rewards/trajectory_similarity_reward/mean": 0.7569250166416168, "rewards/trajectory_similarity_reward/std": 0.38206858932971954, "step": 127 }, { "clip_ratio/high_max": 0.009956729569239542, "clip_ratio/high_mean": 0.00218489502731245, "clip_ratio/low_mean": 0.0007897432296886109, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0029746381915174425, "entropy": 0.41538476571440697, "epoch": 0.1043301069791136, "grad_norm": 14.688623428344727, "learning_rate": 7.165444172779135e-07, "loss": 0.9793, "reward": 2.0047168731689453, "reward_std": 1.9073963165283203, "rewards/reasoning_density_reward/mean": 0.36294645071029663, "rewards/reasoning_density_reward/std": 0.08740384131669998, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.496871829032898, "rewards/trajectory_similarity_reward/mean": 0.235520139336586, "rewards/trajectory_similarity_reward/std": 0.3067294657230377, "step": 128 }, { "clip_ratio/high_max": 0.009259733778890222, "clip_ratio/high_mean": 0.0016919046829571016, "clip_ratio/low_mean": 0.0006386148015735671, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002330519499082584, "entropy": 0.42109450325369835, "epoch": 0.10514518593988793, "grad_norm": 12.568429946899414, "learning_rate": 7.158924205378973e-07, "loss": -0.8104, "reward": 2.5073468685150146, "reward_std": 1.7497374415397644, "rewards/reasoning_density_reward/mean": 0.3499069958925247, "rewards/reasoning_density_reward/std": 0.10036593303084373, "rewards/success_reward/mean": 1.734375, "rewards/success_reward/std": 1.4375925064086914, "rewards/trajectory_similarity_reward/mean": 0.4230649322271347, "rewards/trajectory_similarity_reward/std": 0.3837912529706955, "step": 129 }, { "clip_ratio/high_max": 0.01154330198187381, "clip_ratio/high_mean": 0.002905304507294204, "clip_ratio/low_mean": 0.00099042682631989, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0038957313518039882, "entropy": 0.42996587604284286, "epoch": 0.10596026490066225, "grad_norm": 32.98195266723633, "learning_rate": 7.152404237978809e-07, "loss": -5.9684, "reward": 1.6808441877365112, "reward_std": 0.9954308271408081, "rewards/reasoning_density_reward/mean": 0.30418696999549866, "rewards/reasoning_density_reward/std": 0.08974776417016983, "rewards/success_reward/mean": 1.21875, "rewards/success_reward/std": 1.365878939628601, "rewards/trajectory_similarity_reward/mean": 0.15790721774101257, "rewards/trajectory_similarity_reward/std": 0.2875151038169861, "step": 130 }, { "clip_ratio/high_max": 0.0086608060519211, "clip_ratio/high_mean": 0.0017645798870944418, "clip_ratio/low_mean": 0.0008994864110718481, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00266406629816629, "entropy": 0.41765541583299637, "epoch": 0.10677534386143658, "grad_norm": 13.455292701721191, "learning_rate": 7.145884270578647e-07, "loss": 1.1026, "reward": 2.813427448272705, "reward_std": 1.8351097106933594, "rewards/reasoning_density_reward/mean": 0.3683035671710968, "rewards/reasoning_density_reward/std": 0.11922991275787354, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.4763736128807068, "rewards/trajectory_similarity_reward/std": 0.3950500190258026, "step": 131 }, { "clip_ratio/high_max": 0.01490003673825413, "clip_ratio/high_mean": 0.003348680096678436, "clip_ratio/low_mean": 0.00019899968538084067, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003547679807525128, "entropy": 0.40691235661506653, "epoch": 0.1075904228222109, "grad_norm": 10.605008125305176, "learning_rate": 7.139364303178483e-07, "loss": 1.8035, "reward": 2.1520142555236816, "reward_std": 0.5006915330886841, "rewards/reasoning_density_reward/mean": 0.33750003576278687, "rewards/reasoning_density_reward/std": 0.11798093467950821, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.496871829032898, "rewards/trajectory_similarity_reward/mean": 0.4082643389701843, "rewards/trajectory_similarity_reward/std": 0.4795984625816345, "step": 132 }, { "clip_ratio/high_max": 0.01464744855184108, "clip_ratio/high_mean": 0.002909335831645876, "clip_ratio/low_mean": 0.0010758147036540322, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003985150455264375, "entropy": 0.3927535302937031, "epoch": 0.10840550178298523, "grad_norm": 12.775403022766113, "learning_rate": 7.132844335778321e-07, "loss": 3.5679, "reward": 3.149346351623535, "reward_std": 1.716435432434082, "rewards/reasoning_density_reward/mean": 0.35804811120033264, "rewards/reasoning_density_reward/std": 0.11159070581197739, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.5412980914115906, "rewards/trajectory_similarity_reward/std": 0.36030513048171997, "step": 133 }, { "clip_ratio/high_max": 0.010470565466675907, "clip_ratio/high_mean": 0.0025513654545648023, "clip_ratio/low_mean": 0.00036477501271292567, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0029161404381738976, "entropy": 0.38942592591047287, "epoch": 0.10922058074375955, "grad_norm": 12.385831832885742, "learning_rate": 7.126324368378158e-07, "loss": 2.0249, "reward": 2.2305495738983154, "reward_std": 1.5520544052124023, "rewards/reasoning_density_reward/mean": 0.33645835518836975, "rewards/reasoning_density_reward/std": 0.12855590879917145, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.3930631875991821, "rewards/trajectory_similarity_reward/mean": 0.3003412187099457, "rewards/trajectory_similarity_reward/std": 0.3686550557613373, "step": 134 }, { "clip_ratio/high_max": 0.012338117405306548, "clip_ratio/high_mean": 0.0025608250580262393, "clip_ratio/low_mean": 0.0006963220657780766, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0032571471529081464, "entropy": 0.3963875472545624, "epoch": 0.11003565970453388, "grad_norm": 12.89198112487793, "learning_rate": 7.119804400977995e-07, "loss": 8.0831, "reward": 2.772329568862915, "reward_std": 1.2836329936981201, "rewards/reasoning_density_reward/mean": 0.3887152671813965, "rewards/reasoning_density_reward/std": 0.09680316597223282, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.189800500869751, "rewards/trajectory_similarity_reward/mean": 0.4148642122745514, "rewards/trajectory_similarity_reward/std": 0.4433470070362091, "step": 135 }, { "clip_ratio/high_max": 0.015368734661024064, "clip_ratio/high_mean": 0.002956614138383884, "clip_ratio/low_mean": 0.0003167252798448317, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0032733394546085037, "entropy": 0.38504334166646004, "epoch": 0.1108507386653082, "grad_norm": 21.773099899291992, "learning_rate": 7.113284433577832e-07, "loss": -15.6011, "reward": 2.739035129547119, "reward_std": 0.7265345454216003, "rewards/reasoning_density_reward/mean": 0.3619791865348816, "rewards/reasoning_density_reward/std": 0.08073554933071136, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.3964240550994873, "rewards/trajectory_similarity_reward/mean": 0.5020560622215271, "rewards/trajectory_similarity_reward/std": 0.4704548120498657, "step": 136 }, { "clip_ratio/high_max": 0.019019578758161515, "clip_ratio/high_mean": 0.0033786182902986184, "clip_ratio/low_mean": 0.001005371887004003, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004383990206406452, "entropy": 0.3862803094089031, "epoch": 0.11166581762608253, "grad_norm": 11.028555870056152, "learning_rate": 7.106764466177669e-07, "loss": 10.0026, "reward": 4.035966873168945, "reward_std": 0.9145456552505493, "rewards/reasoning_density_reward/mean": 0.4281250238418579, "rewards/reasoning_density_reward/std": 0.08638174086809158, "rewards/success_reward/mean": 2.8125, "rewards/success_reward/std": 0.5123475790023804, "rewards/trajectory_similarity_reward/mean": 0.7953417301177979, "rewards/trajectory_similarity_reward/std": 0.33445703983306885, "step": 137 }, { "clip_ratio/high_max": 0.008130995032843202, "clip_ratio/high_mean": 0.001419855652784463, "clip_ratio/low_mean": 0.0004339627121225931, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0018538183721830137, "entropy": 0.42531975731253624, "epoch": 0.11248089658685685, "grad_norm": 16.375030517578125, "learning_rate": 7.100244498777506e-07, "loss": 6.0329, "reward": 2.4678995609283447, "reward_std": 1.4341795444488525, "rewards/reasoning_density_reward/mean": 0.3895833492279053, "rewards/reasoning_density_reward/std": 0.10089873522520065, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.3908163011074066, "rewards/trajectory_similarity_reward/std": 0.41544046998023987, "step": 138 }, { "clip_ratio/high_max": 0.006433037808164954, "clip_ratio/high_mean": 0.001035063323797658, "clip_ratio/low_mean": 0.0006042288514436223, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0016392921752412803, "entropy": 0.42558496072888374, "epoch": 0.11329597554763118, "grad_norm": 15.316346168518066, "learning_rate": 7.093724531377343e-07, "loss": -5.6402, "reward": 2.31181001663208, "reward_std": 1.3169147968292236, "rewards/reasoning_density_reward/mean": 0.3821428418159485, "rewards/reasoning_density_reward/std": 0.10823255032300949, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.42966699600219727, "rewards/trajectory_similarity_reward/std": 0.46758270263671875, "step": 139 }, { "clip_ratio/high_max": 0.006272852246183902, "clip_ratio/high_mean": 0.0012149137328378856, "clip_ratio/low_mean": 0.00041006561878020875, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.001624979377083946, "entropy": 0.40650906041264534, "epoch": 0.1141110545084055, "grad_norm": 11.267071723937988, "learning_rate": 7.08720456397718e-07, "loss": -5.3677, "reward": 2.2851513028144836, "reward_std": 0.8895585536956787, "rewards/reasoning_density_reward/mean": 0.3668898940086365, "rewards/reasoning_density_reward/std": 0.07418611645698547, "rewards/success_reward/mean": 1.546875, "rewards/success_reward/std": 1.2163992524147034, "rewards/trajectory_similarity_reward/mean": 0.3713865205645561, "rewards/trajectory_similarity_reward/std": 0.3097982481122017, "step": 140 }, { "clip_ratio/high_max": 0.013700049894396216, "clip_ratio/high_mean": 0.002960452540719416, "clip_ratio/low_mean": 0.00104591078707017, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004006363349617459, "entropy": 0.3859316073358059, "epoch": 0.11492613346917983, "grad_norm": 34.727359771728516, "learning_rate": 7.080684596577017e-07, "loss": -6.4376, "reward": 3.9740967750549316, "reward_std": 0.3341333121061325, "rewards/reasoning_density_reward/mean": 0.4497023820877075, "rewards/reasoning_density_reward/std": 0.08173554763197899, "rewards/success_reward/mean": 2.953125, "rewards/success_reward/std": 0.1875, "rewards/trajectory_similarity_reward/mean": 0.5712693631649017, "rewards/trajectory_similarity_reward/std": 0.3466876596212387, "step": 141 }, { "clip_ratio/high_max": 0.019000602304004133, "clip_ratio/high_mean": 0.003392241371329874, "clip_ratio/low_mean": 0.0008305845731229056, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004222826049954165, "entropy": 0.39660463109612465, "epoch": 0.11574121242995415, "grad_norm": 11.149782180786133, "learning_rate": 7.074164629176854e-07, "loss": 7.2192, "reward": 2.325479745864868, "reward_std": 1.3713749647140503, "rewards/reasoning_density_reward/mean": 0.3673611283302307, "rewards/reasoning_density_reward/std": 0.1249999925494194, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.4581184983253479, "rewards/trajectory_similarity_reward/std": 0.494777649641037, "step": 142 }, { "clip_ratio/high_max": 0.010096678975969553, "clip_ratio/high_mean": 0.001727395698253531, "clip_ratio/low_mean": 0.0004539915025816299, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0021813871426275, "entropy": 0.398218110203743, "epoch": 0.11655629139072848, "grad_norm": 12.448598861694336, "learning_rate": 7.067644661776691e-07, "loss": 10.4884, "reward": 2.7593088150024414, "reward_std": 0.8319442272186279, "rewards/reasoning_density_reward/mean": 0.37998175621032715, "rewards/reasoning_density_reward/std": 0.08500321209430695, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.3098187446594238, "rewards/trajectory_similarity_reward/mean": 0.4105769991874695, "rewards/trajectory_similarity_reward/std": 0.4123113453388214, "step": 143 }, { "clip_ratio/high_max": 0.008165470731910318, "clip_ratio/high_mean": 0.0017048229201463982, "clip_ratio/low_mean": 0.0005614021138171665, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0022662249975837767, "entropy": 0.38561052456498146, "epoch": 0.1173713703515028, "grad_norm": 14.366609573364258, "learning_rate": 7.061124694376528e-07, "loss": -4.0329, "reward": 2.5205217599868774, "reward_std": 1.679360270500183, "rewards/reasoning_density_reward/mean": 0.3673921227455139, "rewards/reasoning_density_reward/std": 0.09335056319832802, "rewards/success_reward/mean": 1.828125, "rewards/success_reward/std": 1.3129705786705017, "rewards/trajectory_similarity_reward/mean": 0.32500453293323517, "rewards/trajectory_similarity_reward/std": 0.3819954842329025, "step": 144 }, { "clip_ratio/high_max": 0.009190324577502906, "clip_ratio/high_mean": 0.002210744882177096, "clip_ratio/low_mean": 0.0009887909982353449, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0031995358440326527, "entropy": 0.40411194041371346, "epoch": 0.11818644931227713, "grad_norm": 11.761322021484375, "learning_rate": 7.054604726976365e-07, "loss": 2.9629, "reward": 2.746427297592163, "reward_std": 1.8174784183502197, "rewards/reasoning_density_reward/mean": 0.35739850997924805, "rewards/reasoning_density_reward/std": 0.09475551545619965, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.42027872800827026, "rewards/trajectory_similarity_reward/std": 0.35441187024116516, "step": 145 }, { "clip_ratio/high_max": 0.009257589699700475, "clip_ratio/high_mean": 0.00222003401722759, "clip_ratio/low_mean": 0.0008200490337912925, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0030400830146390945, "entropy": 0.4005694203078747, "epoch": 0.11900152827305145, "grad_norm": 16.49759864807129, "learning_rate": 7.048084759576201e-07, "loss": 5.4304, "reward": 2.587724208831787, "reward_std": 1.3760197162628174, "rewards/reasoning_density_reward/mean": 0.33125001192092896, "rewards/reasoning_density_reward/std": 0.15798206627368927, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.4752241373062134, "rewards/trajectory_similarity_reward/std": 0.4444490671157837, "step": 146 }, { "clip_ratio/high_max": 0.0069012478343211114, "clip_ratio/high_mean": 0.001304795005125925, "clip_ratio/low_mean": 0.0007185118447523564, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002023306835326366, "entropy": 0.4040742255747318, "epoch": 0.11981660723382578, "grad_norm": 12.841859817504883, "learning_rate": 7.041564792176039e-07, "loss": 0.3757, "reward": 3.0619869232177734, "reward_std": 1.8234646320343018, "rewards/reasoning_density_reward/mean": 0.3770066797733307, "rewards/reasoning_density_reward/std": 0.12291164696216583, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.3381423950195312, "rewards/trajectory_similarity_reward/mean": 0.5287305116653442, "rewards/trajectory_similarity_reward/std": 0.39171135425567627, "step": 147 }, { "clip_ratio/high_max": 0.010737568169133738, "clip_ratio/high_mean": 0.002178132901462959, "clip_ratio/low_mean": 0.00019677678756124806, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023749096872052178, "entropy": 0.39571545645594597, "epoch": 0.1206316861946001, "grad_norm": 14.199832916259766, "learning_rate": 7.035044824775875e-07, "loss": -3.1535, "reward": 2.7866201400756836, "reward_std": 1.6529579162597656, "rewards/reasoning_density_reward/mean": 0.34036457538604736, "rewards/reasoning_density_reward/std": 0.10994230955839157, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.3837556540966034, "rewards/trajectory_similarity_reward/std": 0.37400731444358826, "step": 148 }, { "clip_ratio/high_max": 0.013719257724005729, "clip_ratio/high_mean": 0.002154515270376578, "clip_ratio/low_mean": 5.351027357392013e-05, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002208025543950498, "entropy": 0.3895655609667301, "epoch": 0.12144676515537443, "grad_norm": 10.755170822143555, "learning_rate": 7.028524857375713e-07, "loss": -3.1393, "reward": 1.5501967668533325, "reward_std": 0.8626880049705505, "rewards/reasoning_density_reward/mean": 0.3265625238418579, "rewards/reasoning_density_reward/std": 0.055127691477537155, "rewards/success_reward/mean": 1.03125, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.19238433241844177, "rewards/trajectory_similarity_reward/std": 0.30521160364151, "step": 149 }, { "clip_ratio/high_max": 0.006714242103043944, "clip_ratio/high_mean": 0.0010764557737275027, "clip_ratio/low_mean": 0.00025283676586695947, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0013292925141286105, "entropy": 0.3737179934978485, "epoch": 0.12226184411614875, "grad_norm": 11.765026092529297, "learning_rate": 7.022004889975549e-07, "loss": -0.7364, "reward": 2.3648887276649475, "reward_std": 1.4015721380710602, "rewards/reasoning_density_reward/mean": 0.3773599714040756, "rewards/reasoning_density_reward/std": 0.07578011229634285, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.3888907432556152, "rewards/trajectory_similarity_reward/mean": 0.3937787786126137, "rewards/trajectory_similarity_reward/std": 0.3534849286079407, "step": 150 }, { "clip_ratio/high_max": 0.012794107780791819, "clip_ratio/high_mean": 0.0034131778083974496, "clip_ratio/low_mean": 0.00033527310370118357, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037484508720808662, "entropy": 0.38559572398662567, "epoch": 0.12307692307692308, "grad_norm": 11.864717483520508, "learning_rate": 7.015484922575387e-07, "loss": 0.536, "reward": 2.8137240409851074, "reward_std": 1.0960065126419067, "rewards/reasoning_density_reward/mean": 0.3861810266971588, "rewards/reasoning_density_reward/std": 0.09848460555076599, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.5525431036949158, "rewards/trajectory_similarity_reward/std": 0.462913453578949, "step": 151 }, { "clip_ratio/high_max": 0.009433104540221393, "clip_ratio/high_mean": 0.001736468679155223, "clip_ratio/low_mean": 0.00043508496310096234, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0021715536422561854, "entropy": 0.3827439062297344, "epoch": 0.1238920020376974, "grad_norm": 16.466890335083008, "learning_rate": 7.008964955175223e-07, "loss": 2.8891, "reward": 2.5773134231567383, "reward_std": 2.005769729614258, "rewards/reasoning_density_reward/mean": 0.3373652398586273, "rewards/reasoning_density_reward/std": 0.12231392413377762, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.4586978554725647, "rewards/trajectory_similarity_reward/std": 0.4340452253818512, "step": 152 }, { "clip_ratio/high_max": 0.010968711983878165, "clip_ratio/high_mean": 0.002021770029386971, "clip_ratio/low_mean": 0.00033814075504778884, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002359910780796781, "entropy": 0.3706898204982281, "epoch": 0.12470708099847173, "grad_norm": 10.561605453491211, "learning_rate": 7.002444987775061e-07, "loss": -12.8761, "reward": 2.6176185607910156, "reward_std": 1.5123642086982727, "rewards/reasoning_density_reward/mean": 0.38142360746860504, "rewards/reasoning_density_reward/std": 0.1245909035205841, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.458299458026886, "rewards/trajectory_similarity_reward/mean": 0.45494501292705536, "rewards/trajectory_similarity_reward/std": 0.41190703213214874, "step": 153 }, { "clip_ratio/high_max": 0.01231579773593694, "clip_ratio/high_mean": 0.0019934272131649777, "clip_ratio/low_mean": 0.0009144480245595332, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0029078752850182354, "entropy": 0.38287464156746864, "epoch": 0.12552215995924607, "grad_norm": 13.475027084350586, "learning_rate": 6.995925020374897e-07, "loss": -13.5999, "reward": 1.4877517223358154, "reward_std": 1.680891513824463, "rewards/reasoning_density_reward/mean": 0.3492187559604645, "rewards/reasoning_density_reward/std": 0.10413020104169846, "rewards/success_reward/mean": 0.9375, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.20103278756141663, "rewards/trajectory_similarity_reward/std": 0.3243806064128876, "step": 154 }, { "clip_ratio/high_max": 0.0033275985915679485, "clip_ratio/high_mean": 0.0005980840032862034, "clip_ratio/low_mean": 0.0004532984130491968, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0010513824090594426, "entropy": 0.4294942617416382, "epoch": 0.12633723892002038, "grad_norm": 11.345733642578125, "learning_rate": 6.989405052974735e-07, "loss": 11.8605, "reward": 1.4660570621490479, "reward_std": 1.7926106452941895, "rewards/reasoning_density_reward/mean": 0.2941964268684387, "rewards/reasoning_density_reward/std": 0.0997842326760292, "rewards/success_reward/mean": 0.9375, "rewards/success_reward/std": 1.3275917768478394, "rewards/trajectory_similarity_reward/mean": 0.23436054587364197, "rewards/trajectory_similarity_reward/std": 0.42003318667411804, "step": 155 }, { "clip_ratio/high_max": 0.010387293848907575, "clip_ratio/high_mean": 0.0016946650684985798, "clip_ratio/low_mean": 0.000788085690146545, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0024827507659210823, "entropy": 0.4087708964943886, "epoch": 0.1271523178807947, "grad_norm": 11.320816993713379, "learning_rate": 6.982885085574571e-07, "loss": 6.4965, "reward": 1.4296177625656128, "reward_std": 1.0370242595672607, "rewards/reasoning_density_reward/mean": 0.3500000238418579, "rewards/reasoning_density_reward/std": 0.08944271504878998, "rewards/success_reward/mean": 0.84375, "rewards/success_reward/std": 1.3381423950195312, "rewards/trajectory_similarity_reward/mean": 0.2358677238225937, "rewards/trajectory_similarity_reward/std": 0.423627644777298, "step": 156 }, { "clip_ratio/high_max": 0.009847345703747123, "clip_ratio/high_mean": 0.0023103043640730903, "clip_ratio/low_mean": 0.0004770772757183295, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0027873817016370595, "entropy": 0.41480574384331703, "epoch": 0.12796739684156902, "grad_norm": 12.9498929977417, "learning_rate": 6.976365118174409e-07, "loss": -2.0669, "reward": 3.033770203590393, "reward_std": 1.0101042091846466, "rewards/reasoning_density_reward/mean": 0.4260416775941849, "rewards/reasoning_density_reward/std": 0.09804466366767883, "rewards/success_reward/mean": 2.015625, "rewards/success_reward/std": 1.4279338717460632, "rewards/trajectory_similarity_reward/mean": 0.5921034812927246, "rewards/trajectory_similarity_reward/std": 0.44566042721271515, "step": 157 }, { "clip_ratio/high_max": 0.009682834497652948, "clip_ratio/high_mean": 0.001969913311768323, "clip_ratio/low_mean": 0.0015060009027365595, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034759142581606284, "entropy": 0.3781626336276531, "epoch": 0.12878247580234337, "grad_norm": 14.914186477661133, "learning_rate": 6.969845150774245e-07, "loss": 5.2746, "reward": 2.3577993512153625, "reward_std": 1.4898010194301605, "rewards/reasoning_density_reward/mean": 0.3317336440086365, "rewards/reasoning_density_reward/std": 0.11661557108163834, "rewards/success_reward/mean": 1.640625, "rewards/success_reward/std": 1.4783848524093628, "rewards/trajectory_similarity_reward/mean": 0.3854407072067261, "rewards/trajectory_similarity_reward/std": 0.38184550404548645, "step": 158 }, { "clip_ratio/high_max": 0.012849576596636325, "clip_ratio/high_mean": 0.003091376660449896, "clip_ratio/low_mean": 0.0005852367539773695, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003676613479910884, "entropy": 0.3823826424777508, "epoch": 0.12959755476311768, "grad_norm": 16.987085342407227, "learning_rate": 6.963325183374083e-07, "loss": -2.7187, "reward": 3.5957531929016113, "reward_std": 1.178663194179535, "rewards/reasoning_density_reward/mean": 0.4401041567325592, "rewards/reasoning_density_reward/std": 0.08775114268064499, "rewards/success_reward/mean": 2.484375, "rewards/success_reward/std": 1.0434684753417969, "rewards/trajectory_similarity_reward/mean": 0.6712740361690521, "rewards/trajectory_similarity_reward/std": 0.3902585506439209, "step": 159 }, { "clip_ratio/high_max": 0.009328960033599287, "clip_ratio/high_mean": 0.002285638875036966, "clip_ratio/low_mean": 0.0010936411999864504, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0033792800895753317, "entropy": 0.4125041738152504, "epoch": 0.130412633723892, "grad_norm": 14.033353805541992, "learning_rate": 6.956805215973919e-07, "loss": -5.7764, "reward": 2.5765857696533203, "reward_std": 1.9957246780395508, "rewards/reasoning_density_reward/mean": 0.36651334166526794, "rewards/reasoning_density_reward/std": 0.09272938966751099, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.42882227897644043, "rewards/trajectory_similarity_reward/std": 0.41966935992240906, "step": 160 }, { "clip_ratio/high_max": 0.014741258579306304, "clip_ratio/high_mean": 0.002675855503184721, "clip_ratio/low_mean": 0.0009373363791382872, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003613191918702796, "entropy": 0.40620074421167374, "epoch": 0.13122771268466632, "grad_norm": 13.349939346313477, "learning_rate": 6.950285248573757e-07, "loss": 2.6474, "reward": 2.7327282428741455, "reward_std": 1.775402545928955, "rewards/reasoning_density_reward/mean": 0.3646329641342163, "rewards/reasoning_density_reward/std": 0.1268080621957779, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.3098187446594238, "rewards/trajectory_similarity_reward/mean": 0.399345338344574, "rewards/trajectory_similarity_reward/std": 0.36612585186958313, "step": 161 }, { "clip_ratio/high_max": 0.012593241932336241, "clip_ratio/high_mean": 0.0021494696484296583, "clip_ratio/low_mean": 0.000763728457968682, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0029131980882084463, "entropy": 0.37562988698482513, "epoch": 0.13204279164544067, "grad_norm": 13.839911460876465, "learning_rate": 6.943765281173593e-07, "loss": 14.8912, "reward": 3.3566133975982666, "reward_std": 1.0987136363983154, "rewards/reasoning_density_reward/mean": 0.40154534578323364, "rewards/reasoning_density_reward/std": 0.08451814204454422, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 0.9031196236610413, "rewards/trajectory_similarity_reward/mean": 0.4238179922103882, "rewards/trajectory_similarity_reward/std": 0.3739141523838043, "step": 162 }, { "clip_ratio/high_max": 0.009499966108705848, "clip_ratio/high_mean": 0.0023754550420562737, "clip_ratio/low_mean": 0.0002098247641697526, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002585279777122196, "entropy": 0.41071898862719536, "epoch": 0.13285787060621498, "grad_norm": 15.83351993560791, "learning_rate": 6.937245313773431e-07, "loss": 5.5001, "reward": 2.3140273094177246, "reward_std": 1.6421265602111816, "rewards/reasoning_density_reward/mean": 0.38229167461395264, "rewards/reasoning_density_reward/std": 0.09840745478868484, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.3930631875991821, "rewards/trajectory_similarity_reward/mean": 0.33798548579216003, "rewards/trajectory_similarity_reward/std": 0.4157569110393524, "step": 163 }, { "clip_ratio/high_max": 0.010159045225009322, "clip_ratio/high_mean": 0.0025646166322985664, "clip_ratio/low_mean": 0.0007257847173605114, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003290401364210993, "entropy": 0.4127842038869858, "epoch": 0.1336729495669893, "grad_norm": 13.404502868652344, "learning_rate": 6.930725346373268e-07, "loss": -1.6234, "reward": 2.1652655601501465, "reward_std": 1.7501590251922607, "rewards/reasoning_density_reward/mean": 0.3625496029853821, "rewards/reasoning_density_reward/std": 0.0731247216463089, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.3027160167694092, "rewards/trajectory_similarity_reward/std": 0.3289486765861511, "step": 164 }, { "clip_ratio/high_max": 0.009634578600525856, "clip_ratio/high_mean": 0.0019164202603860758, "clip_ratio/low_mean": 0.0003698933869600296, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0022863136473461054, "entropy": 0.3919391520321369, "epoch": 0.13448802852776362, "grad_norm": 12.944774627685547, "learning_rate": 6.924205378973105e-07, "loss": 2.7782, "reward": 3.4794445037841797, "reward_std": 1.4218971729278564, "rewards/reasoning_density_reward/mean": 0.4452967047691345, "rewards/reasoning_density_reward/std": 0.08195393532514572, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 1.0562314987182617, "rewards/trajectory_similarity_reward/mean": 0.5028976202011108, "rewards/trajectory_similarity_reward/std": 0.31194913387298584, "step": 165 }, { "clip_ratio/high_max": 0.015124135999940336, "clip_ratio/high_mean": 0.0034159182832809165, "clip_ratio/low_mean": 0.00029876634653192014, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003714684586157091, "entropy": 0.38718075677752495, "epoch": 0.13530310748853797, "grad_norm": 15.592130661010742, "learning_rate": 6.917685411572942e-07, "loss": 10.6284, "reward": 3.997786521911621, "reward_std": 0.5522137880325317, "rewards/reasoning_density_reward/mean": 0.45773810148239136, "rewards/reasoning_density_reward/std": 0.0683254525065422, "rewards/success_reward/mean": 2.90625, "rewards/success_reward/std": 0.375, "rewards/trajectory_similarity_reward/mean": 0.633798360824585, "rewards/trajectory_similarity_reward/std": 0.2955058813095093, "step": 166 }, { "clip_ratio/high_max": 0.009276503405999392, "clip_ratio/high_mean": 0.0022113450104370713, "clip_ratio/low_mean": 0.0004929564202029724, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0027043014124501497, "entropy": 0.40631843358278275, "epoch": 0.13611818644931228, "grad_norm": 15.167108535766602, "learning_rate": 6.911165444172779e-07, "loss": -1.9137, "reward": 2.613046646118164, "reward_std": 1.0563425123691559, "rewards/reasoning_density_reward/mean": 0.3826389014720917, "rewards/reasoning_density_reward/std": 0.08368143439292908, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 0.7979557514190674, "rewards/trajectory_similarity_reward/mean": 0.44915781915187836, "rewards/trajectory_similarity_reward/std": 0.3307528495788574, "step": 167 }, { "clip_ratio/high_max": 0.006010768993292004, "clip_ratio/high_mean": 0.0012935197373735718, "clip_ratio/low_mean": 0.0009553099080221727, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0022488296672236174, "entropy": 0.37188999727368355, "epoch": 0.1369332654100866, "grad_norm": 12.864849090576172, "learning_rate": 6.904645476772616e-07, "loss": 5.606, "reward": 2.485769748687744, "reward_std": 1.7809841632843018, "rewards/reasoning_density_reward/mean": 0.3921875059604645, "rewards/reasoning_density_reward/std": 0.09988273680210114, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.496871829032898, "rewards/trajectory_similarity_reward/mean": 0.4998322129249573, "rewards/trajectory_similarity_reward/std": 0.5162249207496643, "step": 168 }, { "clip_ratio/high_max": 0.005780037201475352, "clip_ratio/high_mean": 0.0012113103512092493, "clip_ratio/low_mean": 0.0005950320664851461, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0018063424686260987, "entropy": 0.388936422765255, "epoch": 0.13774834437086092, "grad_norm": 13.979738235473633, "learning_rate": 6.898125509372453e-07, "loss": 5.7232, "reward": 2.6641623973846436, "reward_std": 1.5470315217971802, "rewards/reasoning_density_reward/mean": 0.35863998532295227, "rewards/reasoning_density_reward/std": 0.08378536999225616, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.0562314987182617, "rewards/trajectory_similarity_reward/mean": 0.3367723524570465, "rewards/trajectory_similarity_reward/std": 0.41622278094291687, "step": 169 }, { "clip_ratio/high_max": 0.01056658144807443, "clip_ratio/high_mean": 0.002264893162646331, "clip_ratio/low_mean": 0.0010327456329832785, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0032976387738017365, "entropy": 0.3802441768348217, "epoch": 0.13856342333163527, "grad_norm": 12.52430248260498, "learning_rate": 6.89160554197229e-07, "loss": -11.3781, "reward": 2.324349880218506, "reward_std": 1.6687215566635132, "rewards/reasoning_density_reward/mean": 0.4000000059604645, "rewards/reasoning_density_reward/std": 0.10327955335378647, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.4243498593568802, "rewards/trajectory_similarity_reward/std": 0.4417187571525574, "step": 170 }, { "clip_ratio/high_max": 0.01180473854765296, "clip_ratio/high_mean": 0.0019539905770216137, "clip_ratio/low_mean": 0.0004306242408347316, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023846147960284725, "entropy": 0.4070592038333416, "epoch": 0.13937850229240958, "grad_norm": 15.775177955627441, "learning_rate": 6.885085574572127e-07, "loss": 4.6488, "reward": 3.399030089378357, "reward_std": 1.2371079325675964, "rewards/reasoning_density_reward/mean": 0.43549107015132904, "rewards/reasoning_density_reward/std": 0.08966847509145737, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.0183849930763245, "rewards/trajectory_similarity_reward/mean": 0.5260390788316727, "rewards/trajectory_similarity_reward/std": 0.33433592319488525, "step": 171 }, { "clip_ratio/high_max": 0.007762773282593116, "clip_ratio/high_mean": 0.0020541283156489953, "clip_ratio/low_mean": 0.0010064469242934138, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003060575334529858, "entropy": 0.3879299499094486, "epoch": 0.1401935812531839, "grad_norm": 15.775835037231445, "learning_rate": 6.878565607171964e-07, "loss": -1.2833, "reward": 3.249419331550598, "reward_std": 1.2527936697006226, "rewards/reasoning_density_reward/mean": 0.37291668355464935, "rewards/reasoning_density_reward/std": 0.14159830659627914, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.2028923630714417, "rewards/trajectory_similarity_reward/mean": 0.62650266289711, "rewards/trajectory_similarity_reward/std": 0.45159852504730225, "step": 172 }, { "clip_ratio/high_max": 0.013393625733442605, "clip_ratio/high_mean": 0.0037880946474615484, "clip_ratio/low_mean": 0.0004790396196767688, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004267134208930656, "entropy": 0.4023267552256584, "epoch": 0.14100866021395822, "grad_norm": 13.806035041809082, "learning_rate": 6.872045639771801e-07, "loss": 5.1311, "reward": 3.211730480194092, "reward_std": 1.4363245964050293, "rewards/reasoning_density_reward/mean": 0.4052083492279053, "rewards/reasoning_density_reward/std": 0.11733439564704895, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.0911576747894287, "rewards/trajectory_similarity_reward/mean": 0.4627723693847656, "rewards/trajectory_similarity_reward/std": 0.343506783246994, "step": 173 }, { "clip_ratio/high_max": 0.007000158453593031, "clip_ratio/high_mean": 0.0013559540166170336, "clip_ratio/low_mean": 0.0004776358837261796, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0018335899076191708, "entropy": 0.3974648006260395, "epoch": 0.14182373917473257, "grad_norm": 13.064712524414062, "learning_rate": 6.865525672371638e-07, "loss": -0.7884, "reward": 2.9248586893081665, "reward_std": 1.014636218547821, "rewards/reasoning_density_reward/mean": 0.35104165971279144, "rewards/reasoning_density_reward/std": 0.13621064275503159, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.2328757047653198, "rewards/trajectory_similarity_reward/mean": 0.511317104101181, "rewards/trajectory_similarity_reward/std": 0.4263229966163635, "step": 174 }, { "clip_ratio/high_max": 0.009250518312910572, "clip_ratio/high_mean": 0.0015027716326585505, "clip_ratio/low_mean": 0.0008876134306774475, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023903850378701463, "entropy": 0.36534805223345757, "epoch": 0.14263881813550688, "grad_norm": 12.878594398498535, "learning_rate": 6.859005704971475e-07, "loss": -7.3843, "reward": 2.4985930919647217, "reward_std": 1.3826785683631897, "rewards/reasoning_density_reward/mean": 0.3854662775993347, "rewards/reasoning_density_reward/std": 0.0915164202451706, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5245966911315918, "rewards/trajectory_similarity_reward/mean": 0.425626739859581, "rewards/trajectory_similarity_reward/std": 0.4066130071878433, "step": 175 }, { "clip_ratio/high_max": 0.013614132825750858, "clip_ratio/high_mean": 0.003309984182124026, "clip_ratio/low_mean": 0.0011600832222029567, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0044700675789499655, "entropy": 0.3998383358120918, "epoch": 0.1434538970962812, "grad_norm": 12.499394416809082, "learning_rate": 6.852485737571312e-07, "loss": 5.9419, "reward": 3.5042641162872314, "reward_std": 1.6375395059585571, "rewards/reasoning_density_reward/mean": 0.39306318759918213, "rewards/reasoning_density_reward/std": 0.1253402680158615, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.6737009286880493, "rewards/trajectory_similarity_reward/std": 0.3824829161167145, "step": 176 }, { "clip_ratio/high_max": 0.013611948350444436, "clip_ratio/high_mean": 0.003048770420718938, "clip_ratio/low_mean": 0.00045723127186647616, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003506001696223393, "entropy": 0.384543813765049, "epoch": 0.14426897605705552, "grad_norm": 12.86613941192627, "learning_rate": 6.845965770171149e-07, "loss": 15.4498, "reward": 1.8390939235687256, "reward_std": 0.9684025049209595, "rewards/reasoning_density_reward/mean": 0.36183035373687744, "rewards/reasoning_density_reward/std": 0.09937490522861481, "rewards/success_reward/mean": 1.125, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.35226359963417053, "rewards/trajectory_similarity_reward/std": 0.4745177924633026, "step": 177 }, { "clip_ratio/high_max": 0.014815297559835017, "clip_ratio/high_mean": 0.0030111288360785693, "clip_ratio/low_mean": 0.00036487704346654937, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0033760059013729915, "entropy": 0.3899564631283283, "epoch": 0.14508405501782987, "grad_norm": 13.294541358947754, "learning_rate": 6.839445802770985e-07, "loss": 6.6921, "reward": 2.802819609642029, "reward_std": 1.5882542133331299, "rewards/reasoning_density_reward/mean": 0.40601326525211334, "rewards/reasoning_density_reward/std": 0.09444880113005638, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.4454171061515808, "rewards/trajectory_similarity_reward/mean": 0.5218062996864319, "rewards/trajectory_similarity_reward/std": 0.4225466251373291, "step": 178 }, { "clip_ratio/high_max": 0.013600087142549455, "clip_ratio/high_mean": 0.0029924339178251103, "clip_ratio/low_mean": 0.0006515312634292059, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0036439651885302737, "entropy": 0.3678429052233696, "epoch": 0.14589913397860418, "grad_norm": 12.505427360534668, "learning_rate": 6.832925835370823e-07, "loss": 4.8898, "reward": 2.8258447647094727, "reward_std": 1.9658246040344238, "rewards/reasoning_density_reward/mean": 0.36666667461395264, "rewards/reasoning_density_reward/std": 0.13416408002376556, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.49042800068855286, "rewards/trajectory_similarity_reward/std": 0.42679131031036377, "step": 179 }, { "clip_ratio/high_max": 0.010001414513681084, "clip_ratio/high_mean": 0.001884029210486915, "clip_ratio/low_mean": 0.0009898165735648945, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002873845733120106, "entropy": 0.3822389654815197, "epoch": 0.1467142129393785, "grad_norm": 11.523100852966309, "learning_rate": 6.826405867970659e-07, "loss": 8.3086, "reward": 2.1484715938568115, "reward_std": 1.5533933639526367, "rewards/reasoning_density_reward/mean": 0.33794641494750977, "rewards/reasoning_density_reward/std": 0.06902965158224106, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.3105250597000122, "rewards/trajectory_similarity_reward/std": 0.4211239814758301, "step": 180 }, { "clip_ratio/high_max": 0.01236625635647215, "clip_ratio/high_mean": 0.0020485016466409434, "clip_ratio/low_mean": 0.0008079896033450495, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0028564912718138658, "entropy": 0.37500206753611565, "epoch": 0.14752929190015282, "grad_norm": 14.639012336730957, "learning_rate": 6.819885900570497e-07, "loss": 3.7165, "reward": 3.14108943939209, "reward_std": 1.0902849435806274, "rewards/reasoning_density_reward/mean": 0.38229167461395264, "rewards/reasoning_density_reward/std": 0.12386054545640945, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.5087976455688477, "rewards/trajectory_similarity_reward/std": 0.3270317018032074, "step": 181 }, { "clip_ratio/high_max": 0.011576706019695848, "clip_ratio/high_mean": 0.0022260078039835207, "clip_ratio/low_mean": 0.0011049320310121402, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0033309398204437457, "entropy": 0.37277961894869804, "epoch": 0.14834437086092717, "grad_norm": 15.377359390258789, "learning_rate": 6.813365933170333e-07, "loss": 1.6947, "reward": 3.143963098526001, "reward_std": 1.342300295829773, "rewards/reasoning_density_reward/mean": 0.39084821939468384, "rewards/reasoning_density_reward/std": 0.10783803835511208, "rewards/success_reward/mean": 2.296875, "rewards/success_reward/std": 0.8591630160808563, "rewards/trajectory_similarity_reward/mean": 0.4562399983406067, "rewards/trajectory_similarity_reward/std": 0.42167051136493683, "step": 182 }, { "clip_ratio/high_max": 0.010570888291113079, "clip_ratio/high_mean": 0.0024891560606192797, "clip_ratio/low_mean": 0.0007855419426050503, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0032746979704825208, "entropy": 0.3982829414308071, "epoch": 0.14915944982170148, "grad_norm": 16.302087783813477, "learning_rate": 6.806845965770171e-07, "loss": 7.4585, "reward": 2.5030031204223633, "reward_std": 2.0753729343414307, "rewards/reasoning_density_reward/mean": 0.21770833432674408, "rewards/reasoning_density_reward/std": 0.1450251340866089, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.504044771194458, "rewards/trajectory_similarity_reward/std": 0.46401017904281616, "step": 183 }, { "clip_ratio/high_max": 0.009027595166116953, "clip_ratio/high_mean": 0.0020342562565929256, "clip_ratio/low_mean": 0.000600591203692602, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0026348474857513793, "entropy": 0.41968884319067, "epoch": 0.1499745287824758, "grad_norm": 13.646903991699219, "learning_rate": 6.800325998370007e-07, "loss": 4.2425, "reward": 2.5822978019714355, "reward_std": 1.9313883781433105, "rewards/reasoning_density_reward/mean": 0.3739583492279053, "rewards/reasoning_density_reward/std": 0.1113833487033844, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.365878939628601, "rewards/trajectory_similarity_reward/mean": 0.4270893335342407, "rewards/trajectory_similarity_reward/std": 0.44680118560791016, "step": 184 }, { "clip_ratio/high_max": 0.010095233068568632, "clip_ratio/high_mean": 0.0021438007352116983, "clip_ratio/low_mean": 0.0009301425161538646, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0030739432622794993, "entropy": 0.39448364078998566, "epoch": 0.15078960774325012, "grad_norm": 12.589824676513672, "learning_rate": 6.793806030969845e-07, "loss": 8.5741, "reward": 3.3422040939331055, "reward_std": 1.52301025390625, "rewards/reasoning_density_reward/mean": 0.34337514638900757, "rewards/reasoning_density_reward/std": 0.15204022824764252, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.6550790071487427, "rewards/trajectory_similarity_reward/std": 0.39999982714653015, "step": 185 }, { "clip_ratio/high_max": 0.014869879116304219, "clip_ratio/high_mean": 0.0028013469782308675, "clip_ratio/low_mean": 0.000328998539771419, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0031303454670705833, "entropy": 0.4117763489484787, "epoch": 0.15160468670402447, "grad_norm": 13.851509094238281, "learning_rate": 6.787286063569681e-07, "loss": 12.7446, "reward": 2.3865814208984375, "reward_std": 1.5967965126037598, "rewards/reasoning_density_reward/mean": 0.22801339626312256, "rewards/reasoning_density_reward/std": 0.15853244066238403, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.365878939628601, "rewards/trajectory_similarity_reward/mean": 0.37731799483299255, "rewards/trajectory_similarity_reward/std": 0.43885600566864014, "step": 186 }, { "clip_ratio/high_max": 0.009288652567192912, "clip_ratio/high_mean": 0.0021040772990090773, "clip_ratio/low_mean": 0.0006196065514814109, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002723683817748679, "entropy": 0.40828223526477814, "epoch": 0.15241976566479878, "grad_norm": 14.511368751525879, "learning_rate": 6.780766096169519e-07, "loss": -5.8662, "reward": 1.6908168196678162, "reward_std": 1.1773008108139038, "rewards/reasoning_density_reward/mean": 0.3283854275941849, "rewards/reasoning_density_reward/std": 0.07353372871875763, "rewards/success_reward/mean": 1.265625, "rewards/success_reward/std": 1.2894206047058105, "rewards/trajectory_similarity_reward/mean": 0.09680644422769547, "rewards/trajectory_similarity_reward/std": 0.20303834974765778, "step": 187 }, { "clip_ratio/high_max": 0.011157759552588686, "clip_ratio/high_mean": 0.002038913491560379, "clip_ratio/low_mean": 0.0010250098348478787, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003063923359150067, "entropy": 0.3810150511562824, "epoch": 0.1532348446255731, "grad_norm": 13.379528045654297, "learning_rate": 6.774246128769355e-07, "loss": -2.3817, "reward": 2.278507649898529, "reward_std": 1.1344427168369293, "rewards/reasoning_density_reward/mean": 0.3843750059604645, "rewards/reasoning_density_reward/std": 0.10977387428283691, "rewards/success_reward/mean": 1.453125, "rewards/success_reward/std": 1.459863543510437, "rewards/trajectory_similarity_reward/mean": 0.4410076141357422, "rewards/trajectory_similarity_reward/std": 0.46693648397922516, "step": 188 }, { "clip_ratio/high_max": 0.0068621930840890855, "clip_ratio/high_mean": 0.0013586800159828272, "clip_ratio/low_mean": 0.0009883219900075346, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002347002016904298, "entropy": 0.3643890880048275, "epoch": 0.15404992358634742, "grad_norm": 14.030029296875, "learning_rate": 6.767726161369193e-07, "loss": 4.0265, "reward": 2.4079737663269043, "reward_std": 1.8823875188827515, "rewards/reasoning_density_reward/mean": 0.3671875, "rewards/reasoning_density_reward/std": 0.11965315788984299, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.4162823557853699, "rewards/trajectory_similarity_reward/mean": 0.44703616201877594, "rewards/trajectory_similarity_reward/std": 0.48242008686065674, "step": 189 }, { "clip_ratio/high_max": 0.008569017227273434, "clip_ratio/high_mean": 0.0021528387878788635, "clip_ratio/low_mean": 0.0009518638853478478, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0031047026568558067, "entropy": 0.42652832716703415, "epoch": 0.15486500254712177, "grad_norm": 18.739139556884766, "learning_rate": 6.761206193969029e-07, "loss": 1.1878, "reward": 0.4922678768634796, "reward_std": 0.7202215790748596, "rewards/reasoning_density_reward/mean": 0.2552083432674408, "rewards/reasoning_density_reward/std": 0.09183697402477264, "rewards/success_reward/mean": 0.1875, "rewards/success_reward/std": 0.75, "rewards/trajectory_similarity_reward/mean": 0.04955955222249031, "rewards/trajectory_similarity_reward/std": 0.19823820888996124, "step": 190 }, { "clip_ratio/high_max": 0.009199935419019312, "clip_ratio/high_mean": 0.0022119562127045356, "clip_ratio/low_mean": 0.0005152832309249789, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0027272394218016416, "entropy": 0.39669498801231384, "epoch": 0.15568008150789608, "grad_norm": 11.621088027954102, "learning_rate": 6.754686226568867e-07, "loss": -15.9562, "reward": 2.417794942855835, "reward_std": 1.3816693425178528, "rewards/reasoning_density_reward/mean": 0.3541666865348816, "rewards/reasoning_density_reward/std": 0.11718615517020226, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.2754897475242615, "rewards/trajectory_similarity_reward/mean": 0.4698782339692116, "rewards/trajectory_similarity_reward/std": 0.3513573259115219, "step": 191 }, { "clip_ratio/high_max": 0.010900053341174498, "clip_ratio/high_mean": 0.0019278493309684563, "clip_ratio/low_mean": 0.0003904369077645242, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023182862423709594, "entropy": 0.434473667293787, "epoch": 0.1564951604686704, "grad_norm": 13.661466598510742, "learning_rate": 6.748166259168703e-07, "loss": -3.5178, "reward": 1.4379825592041016, "reward_std": 1.7500710487365723, "rewards/reasoning_density_reward/mean": 0.31979167461395264, "rewards/reasoning_density_reward/std": 0.08101639896631241, "rewards/success_reward/mean": 0.9375, "rewards/success_reward/std": 1.3275917768478394, "rewards/trajectory_similarity_reward/mean": 0.1806909441947937, "rewards/trajectory_similarity_reward/std": 0.3369207978248596, "step": 192 }, { "clip_ratio/high_max": 0.007669130776776001, "clip_ratio/high_mean": 0.0017506778822280467, "clip_ratio/low_mean": 0.0006028050956956577, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023534829742857255, "entropy": 0.4205329902470112, "epoch": 0.15731023942944472, "grad_norm": 15.355896949768066, "learning_rate": 6.741646291768541e-07, "loss": -11.4802, "reward": 1.5706437230110168, "reward_std": 1.7430545091629028, "rewards/reasoning_density_reward/mean": 0.32816222310066223, "rewards/reasoning_density_reward/std": 0.07590590789914131, "rewards/success_reward/mean": 1.03125, "rewards/success_reward/std": 1.3462588787078857, "rewards/trajectory_similarity_reward/mean": 0.2112315446138382, "rewards/trajectory_similarity_reward/std": 0.3376599997282028, "step": 193 }, { "clip_ratio/high_max": 0.008992098330054432, "clip_ratio/high_mean": 0.0021627193709718995, "clip_ratio/low_mean": 0.0014992763244663365, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0036619955935748294, "entropy": 0.4154961258172989, "epoch": 0.15812531839021907, "grad_norm": 14.557741165161133, "learning_rate": 6.735126324368378e-07, "loss": 1.657, "reward": 2.854020595550537, "reward_std": 1.476022720336914, "rewards/reasoning_density_reward/mean": 0.41354167461395264, "rewards/reasoning_density_reward/std": 0.09568829089403152, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.4717288613319397, "rewards/trajectory_similarity_reward/std": 0.39272671937942505, "step": 194 }, { "clip_ratio/high_max": 0.014254284120397642, "clip_ratio/high_mean": 0.0030918466109142173, "clip_ratio/low_mean": 0.0008295432890008669, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003921390001778491, "entropy": 0.3727341443300247, "epoch": 0.15894039735099338, "grad_norm": 13.068658828735352, "learning_rate": 6.728606356968215e-07, "loss": 1.8364, "reward": 1.7375197410583496, "reward_std": 2.0067298412323, "rewards/reasoning_density_reward/mean": 0.2906250059604645, "rewards/reasoning_density_reward/std": 0.1301417052745819, "rewards/success_reward/mean": 1.125, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.32189473509788513, "rewards/trajectory_similarity_reward/std": 0.4410015046596527, "step": 195 }, { "clip_ratio/high_max": 0.010070839314721525, "clip_ratio/high_mean": 0.0024960446899058297, "clip_ratio/low_mean": 0.0010423208004795015, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003538365592248738, "entropy": 0.4251212887465954, "epoch": 0.1597554763117677, "grad_norm": 15.201254844665527, "learning_rate": 6.722086389568052e-07, "loss": 20.1151, "reward": 3.3027689456939697, "reward_std": 1.5566644668579102, "rewards/reasoning_density_reward/mean": 0.34973958134651184, "rewards/reasoning_density_reward/std": 0.17838560789823532, "rewards/success_reward/mean": 2.390625, "rewards/success_reward/std": 1.1404882073402405, "rewards/trajectory_similarity_reward/mean": 0.5624043643474579, "rewards/trajectory_similarity_reward/std": 0.36137746274471283, "step": 196 }, { "clip_ratio/high_max": 0.012321467162109911, "clip_ratio/high_mean": 0.003165755930240266, "clip_ratio/low_mean": 0.0011522746426635422, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004318030652939342, "entropy": 0.4274259954690933, "epoch": 0.16057055527254202, "grad_norm": 13.487480163574219, "learning_rate": 6.715566422167889e-07, "loss": -2.4186, "reward": 1.880356788635254, "reward_std": 1.7862226963043213, "rewards/reasoning_density_reward/mean": 0.2864583432674408, "rewards/reasoning_density_reward/std": 0.17333534359931946, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.2813985049724579, "rewards/trajectory_similarity_reward/std": 0.3525673747062683, "step": 197 }, { "clip_ratio/high_max": 0.012482275604270399, "clip_ratio/high_mean": 0.002306920141563751, "clip_ratio/low_mean": 0.00047588204324711114, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0027828021920868196, "entropy": 0.42776860296726227, "epoch": 0.16138563423331637, "grad_norm": 14.212177276611328, "learning_rate": 6.709046454767726e-07, "loss": 4.2407, "reward": 1.8437749147415161, "reward_std": 1.5584648251533508, "rewards/reasoning_density_reward/mean": 0.31011904776096344, "rewards/reasoning_density_reward/std": 0.10546908900141716, "rewards/success_reward/mean": 1.265625, "rewards/success_reward/std": 1.4295060634613037, "rewards/trajectory_similarity_reward/mean": 0.2680308669805527, "rewards/trajectory_similarity_reward/std": 0.37211769819259644, "step": 198 }, { "clip_ratio/high_max": 0.009112466184888035, "clip_ratio/high_mean": 0.0018908846832346171, "clip_ratio/low_mean": 0.00026603183141560294, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0021569165292021353, "entropy": 0.40134814381599426, "epoch": 0.16220071319409068, "grad_norm": 11.406978607177734, "learning_rate": 6.702526487367563e-07, "loss": -10.8719, "step": 199 }, { "clip_ratio/high_max": 0.010839493275852874, "clip_ratio/high_mean": 0.0017960587902052794, "clip_ratio/low_mean": 0.0009875511095742695, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002783609787002206, "entropy": 0.3971281312406063, "epoch": 0.163015792154865, "grad_norm": 20.610210418701172, "learning_rate": 6.6960065199674e-07, "loss": -6.6534, "reward": 1.9562755823135376, "reward_std": 1.8585047721862793, "rewards/reasoning_density_reward/mean": 0.32965031266212463, "rewards/reasoning_density_reward/std": 0.09633892774581909, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.496871829032898, "rewards/trajectory_similarity_reward/mean": 0.22037525475025177, "rewards/trajectory_similarity_reward/std": 0.26803797483444214, "step": 200 }, { "clip_ratio/high_max": 0.006816069129854441, "clip_ratio/high_mean": 0.0012123807973694056, "clip_ratio/low_mean": 0.0008283125207526609, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0020406933035701513, "entropy": 0.3884081318974495, "epoch": 0.16383087111563932, "grad_norm": 15.171896934509277, "learning_rate": 6.689486552567237e-07, "loss": 3.3492, "reward": 1.9186077117919922, "reward_std": 1.9475679397583008, "rewards/reasoning_density_reward/mean": 0.35624998807907104, "rewards/reasoning_density_reward/std": 0.08139410614967346, "rewards/success_reward/mean": 1.21875, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.34360766410827637, "rewards/trajectory_similarity_reward/std": 0.4612559378147125, "step": 201 }, { "clip_ratio/high_max": 0.007867972948588431, "clip_ratio/high_mean": 0.0015086614221218042, "clip_ratio/low_mean": 0.0008110008857329376, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002319662264198996, "entropy": 0.3867642357945442, "epoch": 0.16464595007641367, "grad_norm": 15.056714057922363, "learning_rate": 6.682966585167074e-07, "loss": -2.9098, "reward": 2.7078007459640503, "reward_std": 1.9011127948760986, "rewards/reasoning_density_reward/mean": 0.3773437589406967, "rewards/reasoning_density_reward/std": 0.09074325114488602, "rewards/success_reward/mean": 1.828125, "rewards/success_reward/std": 1.36735200881958, "rewards/trajectory_similarity_reward/mean": 0.5023320317268372, "rewards/trajectory_similarity_reward/std": 0.43835969269275665, "step": 202 }, { "clip_ratio/high_max": 0.012861779250670224, "clip_ratio/high_mean": 0.0026174297454417683, "clip_ratio/low_mean": 0.00024397996821790002, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00286140973912552, "entropy": 0.40878527238965034, "epoch": 0.16546102903718798, "grad_norm": 12.076717376708984, "learning_rate": 6.676446617766911e-07, "loss": 3.9818, "reward": 0.27431008219718933, "reward_std": 0.042603202164173126, "rewards/reasoning_density_reward/mean": 0.27431008219718933, "rewards/reasoning_density_reward/std": 0.06396899372339249, "rewards/success_reward/mean": 0.0, "rewards/success_reward/std": 0.0, "rewards/trajectory_similarity_reward/mean": 0.0, "rewards/trajectory_similarity_reward/std": 0.0, "step": 203 }, { "clip_ratio/high_max": 0.00900199101306498, "clip_ratio/high_mean": 0.0020477658326854, "clip_ratio/low_mean": 0.0007906591381470207, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0028384249308146536, "entropy": 0.40866315364837646, "epoch": 0.1662761079979623, "grad_norm": 12.474067687988281, "learning_rate": 6.669926650366748e-07, "loss": 9.6577, "reward": 3.5568830966949463, "reward_std": 1.1547958850860596, "rewards/reasoning_density_reward/mean": 0.36901043355464935, "rewards/reasoning_density_reward/std": 0.16355398297309875, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.1831679940223694, "rewards/trajectory_similarity_reward/mean": 0.7503727078437805, "rewards/trajectory_similarity_reward/std": 0.3705642819404602, "step": 204 }, { "clip_ratio/high_max": 0.010936850274447352, "clip_ratio/high_mean": 0.0022643383854301646, "clip_ratio/low_mean": 0.000541205929039279, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002805544252623804, "entropy": 0.378336526453495, "epoch": 0.16709118695873662, "grad_norm": 12.135371208190918, "learning_rate": 6.663406682966585e-07, "loss": -2.1487, "reward": 1.5982475876808167, "reward_std": 1.7663294076919556, "rewards/reasoning_density_reward/mean": 0.30260416865348816, "rewards/reasoning_density_reward/std": 0.14299274235963821, "rewards/success_reward/mean": 1.03125, "rewards/success_reward/std": 1.4680703282356262, "rewards/trajectory_similarity_reward/mean": 0.2643933668732643, "rewards/trajectory_similarity_reward/std": 0.38810352981090546, "step": 205 }, { "clip_ratio/high_max": 0.008184676116798073, "clip_ratio/high_mean": 0.0012601193520822562, "clip_ratio/low_mean": 0.000944146464462392, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0022042658310965635, "entropy": 0.4213388003408909, "epoch": 0.16790626591951097, "grad_norm": 23.72439956665039, "learning_rate": 6.656886715566422e-07, "loss": 7.6453, "reward": 1.9366759061813354, "reward_std": 1.4883842468261719, "rewards/reasoning_density_reward/mean": 0.32083335518836975, "rewards/reasoning_density_reward/std": 0.12594090402126312, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.30334246158599854, "rewards/trajectory_similarity_reward/std": 0.4138539731502533, "step": 206 }, { "clip_ratio/high_max": 0.012980960891582072, "clip_ratio/high_mean": 0.0028289632609812543, "clip_ratio/low_mean": 0.00040114209332386963, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0032301053288392723, "entropy": 0.4311026744544506, "epoch": 0.16872134488028528, "grad_norm": 12.558481216430664, "learning_rate": 6.65036674816626e-07, "loss": -4.7631, "reward": 2.530846357345581, "reward_std": 1.7872974276542664, "rewards/reasoning_density_reward/mean": 0.3229166865348816, "rewards/reasoning_density_reward/std": 0.1445029005408287, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.3888907432556152, "rewards/trajectory_similarity_reward/mean": 0.42667968571186066, "rewards/trajectory_similarity_reward/std": 0.42734138667583466, "step": 207 }, { "clip_ratio/high_max": 0.009528428694466129, "clip_ratio/high_mean": 0.0014722289961355273, "clip_ratio/low_mean": 0.0010320379624317866, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0025042670058610383, "entropy": 0.37615643814206123, "epoch": 0.1695364238410596, "grad_norm": 16.30551528930664, "learning_rate": 6.643846780766096e-07, "loss": 9.8301, "reward": 2.408722400665283, "reward_std": 1.5987976789474487, "rewards/reasoning_density_reward/mean": 0.3421875238418579, "rewards/reasoning_density_reward/std": 0.16271620988845825, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.3275917768478394, "rewards/trajectory_similarity_reward/mean": 0.37903499603271484, "rewards/trajectory_similarity_reward/std": 0.44682982563972473, "step": 208 }, { "clip_ratio/high_max": 0.00760275122593157, "clip_ratio/high_mean": 0.0017718409981171135, "clip_ratio/low_mean": 0.0007367488069576211, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0025085898087127134, "entropy": 0.3847537785768509, "epoch": 0.17035150280183392, "grad_norm": 18.22587013244629, "learning_rate": 6.637326813365933e-07, "loss": -4.2789, "reward": 2.5141361951828003, "reward_std": 1.2665776014328003, "rewards/reasoning_density_reward/mean": 0.36480656266212463, "rewards/reasoning_density_reward/std": 0.13447962701320648, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.3304427862167358, "rewards/trajectory_similarity_reward/mean": 0.36807963252067566, "rewards/trajectory_similarity_reward/std": 0.37272436916828156, "step": 209 }, { "clip_ratio/high_max": 0.009760737360920757, "clip_ratio/high_mean": 0.0023823629526305012, "clip_ratio/low_mean": 0.0004422203310241457, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0028245832872926258, "entropy": 0.40344857424497604, "epoch": 0.17116658176260827, "grad_norm": 15.076071739196777, "learning_rate": 6.63080684596577e-07, "loss": 5.2962, "reward": 3.477755546569824, "reward_std": 1.3262181282043457, "rewards/reasoning_density_reward/mean": 0.3577924817800522, "rewards/reasoning_density_reward/std": 0.1371065266430378, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 0.9742441177368164, "rewards/trajectory_similarity_reward/mean": 0.682463139295578, "rewards/trajectory_similarity_reward/std": 0.3820239007472992, "step": 210 }, { "clip_ratio/high_max": 0.009618124779080972, "clip_ratio/high_mean": 0.0021814734318468254, "clip_ratio/low_mean": 0.0006440041761379689, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002825477633450646, "entropy": 0.3794734850525856, "epoch": 0.17198166072338258, "grad_norm": 13.205920219421387, "learning_rate": 6.624286878565607e-07, "loss": 8.249, "reward": 4.438899993896484, "reward_std": 0.0713089182972908, "rewards/reasoning_density_reward/mean": 0.4671874940395355, "rewards/reasoning_density_reward/std": 0.062395744025707245, "rewards/success_reward/mean": 3.0, "rewards/success_reward/std": 0.0, "rewards/trajectory_similarity_reward/mean": 0.971712589263916, "rewards/trajectory_similarity_reward/std": 0.05802811682224274, "step": 211 }, { "clip_ratio/high_max": 0.00796051969518885, "clip_ratio/high_mean": 0.0016046721502789296, "clip_ratio/low_mean": 0.0004257549990143161, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002030427163845161, "entropy": 0.3504056930541992, "epoch": 0.1727967396841569, "grad_norm": 16.32909393310547, "learning_rate": 6.617766911165443e-07, "loss": -5.1335, "reward": 3.3396964073181152, "reward_std": 1.3214404582977295, "rewards/reasoning_density_reward/mean": 0.38147321343421936, "rewards/reasoning_density_reward/std": 0.1282055862247944, "rewards/success_reward/mean": 2.390625, "rewards/success_reward/std": 1.1228033304214478, "rewards/trajectory_similarity_reward/mean": 0.567597970366478, "rewards/trajectory_similarity_reward/std": 0.33839768171310425, "step": 212 }, { "clip_ratio/high_max": 0.0056570504384581, "clip_ratio/high_mean": 0.0010466304556757677, "clip_ratio/low_mean": 0.000890917144715786, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0019375475822016597, "entropy": 0.4404926188290119, "epoch": 0.17361181864493122, "grad_norm": 17.940732955932617, "learning_rate": 6.611246943765281e-07, "loss": -2.2164, "reward": 1.9693751335144043, "reward_std": 1.8547470569610596, "rewards/reasoning_density_reward/mean": 0.23497024178504944, "rewards/reasoning_density_reward/std": 0.144023597240448, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.496871829032898, "rewards/trajectory_similarity_reward/mean": 0.32815495133399963, "rewards/trajectory_similarity_reward/std": 0.39503344893455505, "step": 213 }, { "clip_ratio/high_max": 0.010513077024370432, "clip_ratio/high_mean": 0.00268908885482233, "clip_ratio/low_mean": 0.00024612996639916673, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0029352188139455393, "entropy": 0.43870822340250015, "epoch": 0.17442689760570557, "grad_norm": 15.071953773498535, "learning_rate": 6.604726976365117e-07, "loss": -14.1188, "reward": 2.327479124069214, "reward_std": 1.7214199304580688, "rewards/reasoning_density_reward/mean": 0.28595781326293945, "rewards/reasoning_density_reward/std": 0.07513612508773804, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.3540213406085968, "rewards/trajectory_similarity_reward/std": 0.4027087092399597, "step": 214 }, { "clip_ratio/high_max": 0.014480903162620962, "clip_ratio/high_mean": 0.003456480466411449, "clip_ratio/low_mean": 0.00034053130184474867, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037970117264194414, "entropy": 0.38384050130844116, "epoch": 0.17524197656647988, "grad_norm": 18.001808166503906, "learning_rate": 6.598207008964955e-07, "loss": -4.6191, "reward": 2.830114006996155, "reward_std": 1.9118841886520386, "rewards/reasoning_density_reward/mean": 0.3810019791126251, "rewards/reasoning_density_reward/std": 0.11651447042822838, "rewards/success_reward/mean": 1.921875, "rewards/success_reward/std": 1.4538734555244446, "rewards/trajectory_similarity_reward/mean": 0.5272370874881744, "rewards/trajectory_similarity_reward/std": 0.44798336923122406, "step": 215 }, { "clip_ratio/high_max": 0.01097109541296959, "clip_ratio/high_mean": 0.0020959830580977723, "clip_ratio/low_mean": 0.0012277930582058616, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003323776094475761, "entropy": 0.3768860511481762, "epoch": 0.1760570555272542, "grad_norm": 12.076434135437012, "learning_rate": 6.591687041564791e-07, "loss": 3.9824, "reward": 2.0548949241638184, "reward_std": 1.8046026229858398, "rewards/reasoning_density_reward/mean": 0.34375, "rewards/reasoning_density_reward/std": 0.10267261415719986, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.2808688879013062, "rewards/trajectory_similarity_reward/mean": 0.3048948645591736, "rewards/trajectory_similarity_reward/std": 0.4677925705909729, "step": 216 }, { "clip_ratio/high_max": 0.014790251618251204, "clip_ratio/high_mean": 0.0027898005209863186, "clip_ratio/low_mean": 0.0009368196515424643, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037266201979946345, "entropy": 0.4185255765914917, "epoch": 0.17687213448802852, "grad_norm": 12.390375137329102, "learning_rate": 6.585167074164629e-07, "loss": 10.2602, "reward": 1.9842045307159424, "reward_std": 1.5292539596557617, "rewards/reasoning_density_reward/mean": 0.36250001192092896, "rewards/reasoning_density_reward/std": 0.08850612491369247, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.3092043995857239, "rewards/trajectory_similarity_reward/std": 0.41456523537635803, "step": 217 }, { "clip_ratio/high_max": 0.00621009522001259, "clip_ratio/high_mean": 0.001403634698363021, "clip_ratio/low_mean": 0.0005572693717112998, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0019609040282375645, "entropy": 0.4258679263293743, "epoch": 0.17768721344880287, "grad_norm": 14.392851829528809, "learning_rate": 6.578647106764465e-07, "loss": -5.2028, "reward": 1.1439907550811768, "reward_std": 1.4061234593391418, "rewards/reasoning_density_reward/mean": 0.2637992277741432, "rewards/reasoning_density_reward/std": 0.1049049086868763, "rewards/success_reward/mean": 0.75, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.13019154965877533, "rewards/trajectory_similarity_reward/std": 0.2936646044254303, "step": 218 }, { "clip_ratio/high_max": 0.01169257564470172, "clip_ratio/high_mean": 0.002018424973357469, "clip_ratio/low_mean": 0.0010583546136331279, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003076779641560279, "entropy": 0.39171723276376724, "epoch": 0.17850229240957718, "grad_norm": 12.634140968322754, "learning_rate": 6.572127139364303e-07, "loss": -3.2267, "reward": 2.9371116161346436, "reward_std": 1.4628205299377441, "rewards/reasoning_density_reward/mean": 0.2604166865348816, "rewards/reasoning_density_reward/std": 0.17913904786109924, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.095445156097412, "rewards/trajectory_similarity_reward/mean": 0.4266948997974396, "rewards/trajectory_similarity_reward/std": 0.37329739332199097, "step": 219 }, { "clip_ratio/high_max": 0.00967009732266888, "clip_ratio/high_mean": 0.0024016626994125545, "clip_ratio/low_mean": 0.001150601870904211, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0035522645921446383, "entropy": 0.4111770763993263, "epoch": 0.1793173713703515, "grad_norm": 12.125751495361328, "learning_rate": 6.565607171964139e-07, "loss": 10.3898, "reward": 2.47548770904541, "reward_std": 1.3995863199234009, "rewards/reasoning_density_reward/mean": 0.3671875, "rewards/reasoning_density_reward/std": 0.10665228962898254, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.365878939628601, "rewards/trajectory_similarity_reward/mean": 0.32705017924308777, "rewards/trajectory_similarity_reward/std": 0.34830451011657715, "step": 220 }, { "clip_ratio/high_max": 0.01672524760942906, "clip_ratio/high_mean": 0.003728142735781148, "clip_ratio/low_mean": 0.00036021503183292225, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004088357731234282, "entropy": 0.3930057920515537, "epoch": 0.18013245033112582, "grad_norm": 15.652580261230469, "learning_rate": 6.559087204563977e-07, "loss": 0.9199, "reward": 3.1900382041931152, "reward_std": 1.5990674495697021, "rewards/reasoning_density_reward/mean": 0.4084325432777405, "rewards/reasoning_density_reward/std": 0.08287572115659714, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.2247449159622192, "rewards/trajectory_similarity_reward/mean": 0.53160560131073, "rewards/trajectory_similarity_reward/std": 0.4103636145591736, "step": 221 }, { "clip_ratio/high_max": 0.012222428747918457, "clip_ratio/high_mean": 0.0030585447602788918, "clip_ratio/low_mean": 0.00022864471975481138, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0032871894509298727, "entropy": 0.37092048674821854, "epoch": 0.18094752929190017, "grad_norm": 14.081640243530273, "learning_rate": 6.552567237163814e-07, "loss": 2.6478, "reward": 1.3879172801971436, "reward_std": 1.4824714660644531, "rewards/reasoning_density_reward/mean": 0.3073412775993347, "rewards/reasoning_density_reward/std": 0.10118284821510315, "rewards/success_reward/mean": 0.9375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.1430760622024536, "rewards/trajectory_similarity_reward/std": 0.3141404688358307, "step": 222 }, { "clip_ratio/high_max": 0.006371705327183008, "clip_ratio/high_mean": 0.0014425399058382027, "clip_ratio/low_mean": 0.0012727065077342559, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002715246402658522, "entropy": 0.38143138960003853, "epoch": 0.18176260825267448, "grad_norm": 14.291335105895996, "learning_rate": 6.546047269763651e-07, "loss": -0.0215, "reward": 2.8531885147094727, "reward_std": 1.887416124343872, "rewards/reasoning_density_reward/mean": 0.3281994163990021, "rewards/reasoning_density_reward/std": 0.13967469334602356, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.5562390685081482, "rewards/trajectory_similarity_reward/std": 0.45142126083374023, "step": 223 }, { "clip_ratio/high_max": 0.012094191915821284, "clip_ratio/high_mean": 0.0024704370443942025, "clip_ratio/low_mean": 0.0006965759494050872, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0031670129828853533, "entropy": 0.39264532923698425, "epoch": 0.1825776872134488, "grad_norm": 12.152828216552734, "learning_rate": 6.539527302363488e-07, "loss": 1.924, "reward": 2.8079452514648438, "reward_std": 1.6690988540649414, "rewards/reasoning_density_reward/mean": 0.3211681544780731, "rewards/reasoning_density_reward/std": 0.13742293417453766, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.42427709698677063, "rewards/trajectory_similarity_reward/std": 0.39813002943992615, "step": 224 }, { "clip_ratio/high_max": 0.010098339582327753, "clip_ratio/high_mean": 0.001653487779549323, "clip_ratio/low_mean": 0.0004273486920283176, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0020808365115954075, "entropy": 0.36625609919428825, "epoch": 0.18339276617422312, "grad_norm": 17.476276397705078, "learning_rate": 6.533007334963325e-07, "loss": -0.0036, "reward": 2.7217838764190674, "reward_std": 1.61286461353302, "rewards/reasoning_density_reward/mean": 0.3460937440395355, "rewards/reasoning_density_reward/std": 0.15971118211746216, "rewards/success_reward/mean": 1.921875, "rewards/success_reward/std": 1.3521251678466797, "rewards/trajectory_similarity_reward/mean": 0.45381516218185425, "rewards/trajectory_similarity_reward/std": 0.42445193231105804, "step": 225 }, { "clip_ratio/high_max": 0.009167157026240602, "clip_ratio/high_mean": 0.002038442195043899, "clip_ratio/low_mean": 0.0005591613044089172, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00259760348853888, "entropy": 0.39873121306300163, "epoch": 0.18420784513499747, "grad_norm": 14.546492576599121, "learning_rate": 6.526487367563162e-07, "loss": 3.8922, "reward": 1.994354248046875, "reward_std": 1.7774159908294678, "rewards/reasoning_density_reward/mean": 0.24071969091892242, "rewards/reasoning_density_reward/std": 0.13764844834804535, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.3930631875991821, "rewards/trajectory_similarity_reward/mean": 0.34738460183143616, "rewards/trajectory_similarity_reward/std": 0.4651830792427063, "step": 226 }, { "clip_ratio/high_max": 0.00999785796739161, "clip_ratio/high_mean": 0.0019937734468840063, "clip_ratio/low_mean": 0.0007984886215126608, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0027922620938625187, "entropy": 0.4121651351451874, "epoch": 0.18502292409577178, "grad_norm": 9.397478103637695, "learning_rate": 6.519967400162999e-07, "loss": 23.1138, "step": 227 }, { "clip_ratio/high_max": 0.013505902548786253, "clip_ratio/high_mean": 0.0030738007844774984, "clip_ratio/low_mean": 0.0009611972564016469, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004034997982671484, "entropy": 0.4063638709485531, "epoch": 0.1858380030565461, "grad_norm": 13.610528945922852, "learning_rate": 6.513447432762836e-07, "loss": -6.0208, "reward": 2.9703140258789062, "reward_std": 1.4704012274742126, "rewards/reasoning_density_reward/mean": 0.37890625, "rewards/reasoning_density_reward/std": 0.10974327847361565, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.086819052696228, "rewards/trajectory_similarity_reward/mean": 0.43515780568122864, "rewards/trajectory_similarity_reward/std": 0.406582772731781, "step": 228 }, { "clip_ratio/high_max": 0.007635615882463753, "clip_ratio/high_mean": 0.0015121089236345142, "clip_ratio/low_mean": 0.0011669589293887839, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002679067889403086, "entropy": 0.40294381231069565, "epoch": 0.18665308201732042, "grad_norm": 16.683692932128906, "learning_rate": 6.506927465362673e-07, "loss": -3.0978, "reward": 1.7794148921966553, "reward_std": 1.9448235034942627, "rewards/reasoning_density_reward/mean": 0.24270835518836975, "rewards/reasoning_density_reward/std": 0.17543266713619232, "rewards/success_reward/mean": 1.21875, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.31795650720596313, "rewards/trajectory_similarity_reward/std": 0.4307112693786621, "step": 229 }, { "clip_ratio/high_max": 0.0051728085381910205, "clip_ratio/high_mean": 0.0009047365310834721, "clip_ratio/low_mean": 0.000672769430821063, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0015775059473526198, "entropy": 0.38489867374300957, "epoch": 0.18746816097809477, "grad_norm": 9.60844612121582, "learning_rate": 6.50040749796251e-07, "loss": 8.2065, "reward": 1.3076897859573364, "reward_std": 1.1600582599639893, "rewards/reasoning_density_reward/mean": 0.26884472370147705, "rewards/reasoning_density_reward/std": 0.0835762694478035, "rewards/success_reward/mean": 0.9375, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.10134509205818176, "rewards/trajectory_similarity_reward/std": 0.2854185104370117, "step": 230 }, { "clip_ratio/high_max": 0.009395514847710729, "clip_ratio/high_mean": 0.0018210964917670935, "clip_ratio/low_mean": 0.0008296370069729164, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002650733571499586, "entropy": 0.38490836694836617, "epoch": 0.18828323993886908, "grad_norm": 14.869723320007324, "learning_rate": 6.493887530562347e-07, "loss": 10.332, "reward": 3.2803359031677246, "reward_std": 1.7180216312408447, "rewards/reasoning_density_reward/mean": 0.4080356955528259, "rewards/reasoning_density_reward/std": 0.11061439663171768, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.6223001480102539, "rewards/trajectory_similarity_reward/std": 0.4115840196609497, "step": 231 }, { "clip_ratio/high_max": 0.010358628700487316, "clip_ratio/high_mean": 0.002906698442529887, "clip_ratio/low_mean": 0.00017182259034598246, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0030785209964960814, "entropy": 0.4104515612125397, "epoch": 0.1890983188996434, "grad_norm": 12.61266803741455, "learning_rate": 6.487367563162184e-07, "loss": -1.9584, "reward": 3.2918968200683594, "reward_std": 1.6508336067199707, "rewards/reasoning_density_reward/mean": 0.3350198566913605, "rewards/reasoning_density_reward/std": 0.10487443208694458, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.6131269931793213, "rewards/trajectory_similarity_reward/std": 0.3983398973941803, "step": 232 }, { "clip_ratio/high_max": 0.00693597667850554, "clip_ratio/high_mean": 0.001628362078918144, "clip_ratio/low_mean": 0.0005245455613476224, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002152907669369597, "entropy": 0.3938688822090626, "epoch": 0.18991339786041772, "grad_norm": 14.865079879760742, "learning_rate": 6.480847595762021e-07, "loss": 7.9866, "reward": 2.9155752658843994, "reward_std": 1.8709650039672852, "rewards/reasoning_density_reward/mean": 0.40625, "rewards/reasoning_density_reward/std": 0.09141378849744797, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.44682517647743225, "rewards/trajectory_similarity_reward/std": 0.3650040626525879, "step": 233 }, { "clip_ratio/high_max": 0.011368985287845135, "clip_ratio/high_mean": 0.0035768255620496348, "clip_ratio/low_mean": 0.0009256395205738954, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004502465162659064, "entropy": 0.4352513924241066, "epoch": 0.19072847682119207, "grad_norm": 13.13321304321289, "learning_rate": 6.474327628361858e-07, "loss": -11.2337, "reward": 3.5938820838928223, "reward_std": 1.2085644006729126, "rewards/reasoning_density_reward/mean": 0.36536458134651184, "rewards/reasoning_density_reward/std": 0.14298179745674133, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 0.866025447845459, "rewards/trajectory_similarity_reward/mean": 0.603517472743988, "rewards/trajectory_similarity_reward/std": 0.3656633794307709, "step": 234 }, { "clip_ratio/high_max": 0.013846476242179051, "clip_ratio/high_mean": 0.003398128264961997, "clip_ratio/low_mean": 0.0006310669232334476, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004029195173643529, "entropy": 0.4285498522222042, "epoch": 0.19154355578196638, "grad_norm": 15.383270263671875, "learning_rate": 6.467807660961695e-07, "loss": 5.7166, "reward": 2.781540811061859, "reward_std": 1.5517498254776, "rewards/reasoning_density_reward/mean": 0.36015626788139343, "rewards/reasoning_density_reward/std": 0.11944442242383957, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.0968086123466492, "rewards/trajectory_similarity_reward/mean": 0.4526344835758209, "rewards/trajectory_similarity_reward/std": 0.39843443036079407, "step": 235 }, { "clip_ratio/high_max": 0.01194451143965125, "clip_ratio/high_mean": 0.002139831609383691, "clip_ratio/low_mean": 0.0006768727798771579, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0028167043637949973, "entropy": 0.4164457209408283, "epoch": 0.1923586347427407, "grad_norm": 13.479515075683594, "learning_rate": 6.461287693561532e-07, "loss": 8.6293, "reward": 3.7240207195281982, "reward_std": 0.6454169750213623, "rewards/reasoning_density_reward/mean": 0.3619047701358795, "rewards/reasoning_density_reward/std": 0.1382777988910675, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.6046693325042725, "rewards/trajectory_similarity_reward/mean": 0.6433659195899963, "rewards/trajectory_similarity_reward/std": 0.346780925989151, "step": 236 }, { "clip_ratio/high_max": 0.0173221692093648, "clip_ratio/high_mean": 0.003448900140938349, "clip_ratio/low_mean": 0.00011623475438682362, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0035651349026011303, "entropy": 0.4177265986800194, "epoch": 0.19317371370351502, "grad_norm": 12.927679061889648, "learning_rate": 6.45476772616137e-07, "loss": 1.0068, "reward": 2.3518459796905518, "reward_std": 1.7939839363098145, "rewards/reasoning_density_reward/mean": 0.2972284406423569, "rewards/reasoning_density_reward/std": 0.1320994272828102, "rewards/success_reward/mean": 1.640625, "rewards/success_reward/std": 1.3285260796546936, "rewards/trajectory_similarity_reward/mean": 0.4139925539493561, "rewards/trajectory_similarity_reward/std": 0.38472503423690796, "step": 237 }, { "clip_ratio/high_max": 0.0052727198344655335, "clip_ratio/high_mean": 0.0010315318431821652, "clip_ratio/low_mean": 0.0008490989202982746, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0018806307634804398, "entropy": 0.42455385997891426, "epoch": 0.19398879266428937, "grad_norm": 13.2701416015625, "learning_rate": 6.448247758761206e-07, "loss": 9.1177, "reward": 1.0100371837615967, "reward_std": 1.659386396408081, "rewards/reasoning_density_reward/mean": 0.26770836114883423, "rewards/reasoning_density_reward/std": 0.11012934893369675, "rewards/success_reward/mean": 0.5625, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.17982882261276245, "rewards/trajectory_similarity_reward/std": 0.3874852955341339, "step": 238 }, { "clip_ratio/high_max": 0.009380632604006678, "clip_ratio/high_mean": 0.002181718358770013, "clip_ratio/low_mean": 0.0009069379884749651, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0030886563326930627, "entropy": 0.4176117479801178, "epoch": 0.19480387162506368, "grad_norm": 10.863207817077637, "learning_rate": 6.441727791361044e-07, "loss": 0.9643, "reward": 1.596393346786499, "reward_std": 0.9265512824058533, "rewards/reasoning_density_reward/mean": 0.21547618508338928, "rewards/reasoning_density_reward/std": 0.14064760506153107, "rewards/success_reward/mean": 1.125, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.25591713190078735, "rewards/trajectory_similarity_reward/std": 0.353145956993103, "step": 239 }, { "clip_ratio/high_max": 0.013814736856147647, "clip_ratio/high_mean": 0.0035625454620458186, "clip_ratio/low_mean": 0.0002153197565348819, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037778652767883614, "entropy": 0.410083394497633, "epoch": 0.195618950585838, "grad_norm": 13.523261070251465, "learning_rate": 6.43520782396088e-07, "loss": -7.9679, "reward": 3.864797353744507, "reward_std": 0.7482420802116394, "rewards/reasoning_density_reward/mean": 0.4016842544078827, "rewards/reasoning_density_reward/std": 0.1447744444012642, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.8080127239227295, "rewards/trajectory_similarity_reward/mean": 0.7443631887435913, "rewards/trajectory_similarity_reward/std": 0.3289675861597061, "step": 240 }, { "clip_ratio/high_max": 0.014569149119779468, "clip_ratio/high_mean": 0.003236983495298773, "clip_ratio/low_mean": 0.0010535322144278325, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004290515702450648, "entropy": 0.42046212404966354, "epoch": 0.19643402954661232, "grad_norm": 13.655818939208984, "learning_rate": 6.428687856560717e-07, "loss": 10.855, "reward": 2.7408835887908936, "reward_std": 2.0738120079040527, "rewards/reasoning_density_reward/mean": 0.35141369700431824, "rewards/reasoning_density_reward/std": 0.12365009635686874, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.5144698023796082, "rewards/trajectory_similarity_reward/std": 0.42269301414489746, "step": 241 }, { "clip_ratio/high_max": 0.010561322735156864, "clip_ratio/high_mean": 0.002584963323897682, "clip_ratio/low_mean": 0.000676315430609975, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0032612788199912757, "entropy": 0.4049708843231201, "epoch": 0.19724910850738667, "grad_norm": 18.01369285583496, "learning_rate": 6.422167889160554e-07, "loss": 3.0251, "reward": 2.062619686126709, "reward_std": 1.1935773491859436, "rewards/reasoning_density_reward/mean": 0.38098958134651184, "rewards/reasoning_density_reward/std": 0.09819750860333443, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.3691300302743912, "rewards/trajectory_similarity_reward/std": 0.4373227655887604, "step": 242 }, { "clip_ratio/high_max": 0.009559087979141623, "clip_ratio/high_mean": 0.0020452215903787874, "clip_ratio/low_mean": 0.0005620676110993372, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0026072891705553047, "entropy": 0.3816552720963955, "epoch": 0.19806418746816098, "grad_norm": 12.347007751464844, "learning_rate": 6.415647921760391e-07, "loss": -0.4137, "reward": 2.6522011756896973, "reward_std": 1.8399415016174316, "rewards/reasoning_density_reward/mean": 0.3812499940395355, "rewards/reasoning_density_reward/std": 0.1089724749326706, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.48970112204551697, "rewards/trajectory_similarity_reward/std": 0.4518347382545471, "step": 243 }, { "clip_ratio/high_max": 0.006648323673289269, "clip_ratio/high_mean": 0.0015416580499731936, "clip_ratio/low_mean": 0.0002579447191237705, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.001799602796381805, "entropy": 0.39135653898119926, "epoch": 0.1988792664289353, "grad_norm": 13.150405883789062, "learning_rate": 6.409127954360227e-07, "loss": 7.9924, "reward": 3.222844958305359, "reward_std": 1.3329188823699951, "rewards/reasoning_density_reward/mean": 0.37142856419086456, "rewards/reasoning_density_reward/std": 0.14460675790905952, "rewards/success_reward/mean": 2.203125, "rewards/success_reward/std": 1.3285260796546936, "rewards/trajectory_similarity_reward/mean": 0.6482913494110107, "rewards/trajectory_similarity_reward/std": 0.44265712797641754, "step": 244 }, { "clip_ratio/high_max": 0.013695553701836616, "clip_ratio/high_mean": 0.0027101641899207607, "clip_ratio/low_mean": 0.0005710109253413975, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0032811751443659887, "entropy": 0.4359494373202324, "epoch": 0.19969434538970962, "grad_norm": 13.081802368164062, "learning_rate": 6.402607986960065e-07, "loss": 0.4088, "reward": 0.9641484022140503, "reward_std": 0.9646362662315369, "rewards/reasoning_density_reward/mean": 0.2566964328289032, "rewards/reasoning_density_reward/std": 0.09657091647386551, "rewards/success_reward/mean": 0.5625, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.1449519395828247, "rewards/trajectory_similarity_reward/std": 0.3172120153903961, "step": 245 }, { "clip_ratio/high_max": 0.011092163535067812, "clip_ratio/high_mean": 0.0022917192000022624, "clip_ratio/low_mean": 0.00036080239442526363, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0026525216089794412, "entropy": 0.3986702784895897, "epoch": 0.20050942435048397, "grad_norm": 11.217106819152832, "learning_rate": 6.396088019559901e-07, "loss": -12.3285, "reward": 2.6324806213378906, "reward_std": 1.6082005500793457, "rewards/reasoning_density_reward/mean": 0.3609375059604645, "rewards/reasoning_density_reward/std": 0.08545730262994766, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.2845232486724854, "rewards/trajectory_similarity_reward/mean": 0.3965432047843933, "rewards/trajectory_similarity_reward/std": 0.43671733140945435, "step": 246 }, { "clip_ratio/high_max": 0.010132297349628061, "clip_ratio/high_mean": 0.0021504518372239545, "clip_ratio/low_mean": 0.0004045047389809042, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0025549565471010283, "entropy": 0.4159611873328686, "epoch": 0.20132450331125828, "grad_norm": 12.034815788269043, "learning_rate": 6.389568052159739e-07, "loss": 1.6343, "reward": 2.64287531375885, "reward_std": 1.7719078063964844, "rewards/reasoning_density_reward/mean": 0.35412946343421936, "rewards/reasoning_density_reward/std": 0.1628861129283905, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.4680703282356262, "rewards/trajectory_similarity_reward/mean": 0.5074959099292755, "rewards/trajectory_similarity_reward/std": 0.4584702253341675, "step": 247 }, { "clip_ratio/high_max": 0.011270294256974012, "clip_ratio/high_mean": 0.0023086913643055595, "clip_ratio/low_mean": 0.00132193191893748, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003630623235949315, "entropy": 0.38137463480234146, "epoch": 0.2021395822720326, "grad_norm": 14.848511695861816, "learning_rate": 6.383048084759575e-07, "loss": 0.7857, "reward": 1.931546688079834, "reward_std": 1.9220554828643799, "rewards/reasoning_density_reward/mean": 0.3120535612106323, "rewards/reasoning_density_reward/std": 0.10943222790956497, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.3069932460784912, "rewards/trajectory_similarity_reward/std": 0.3924520015716553, "step": 248 }, { "clip_ratio/high_max": 0.009004070423543453, "clip_ratio/high_mean": 0.0016586939091212116, "clip_ratio/low_mean": 0.0005548018416448031, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002213495710748248, "entropy": 0.4058794863522053, "epoch": 0.20295466123280692, "grad_norm": 11.87486457824707, "learning_rate": 6.376528117359413e-07, "loss": 0.2858, "reward": 3.182952642440796, "reward_std": 1.0652459263801575, "rewards/reasoning_density_reward/mean": 0.34296876192092896, "rewards/reasoning_density_reward/std": 0.18627507239580154, "rewards/success_reward/mean": 2.203125, "rewards/success_reward/std": 1.3285260796546936, "rewards/trajectory_similarity_reward/mean": 0.6368588209152222, "rewards/trajectory_similarity_reward/std": 0.4269498288631439, "step": 249 }, { "clip_ratio/high_max": 0.013659416465088725, "clip_ratio/high_mean": 0.003064157295739278, "clip_ratio/low_mean": 0.0010517538248677738, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004115911215194501, "entropy": 0.37252670899033546, "epoch": 0.20376974019358127, "grad_norm": 13.9088134765625, "learning_rate": 6.370008149959249e-07, "loss": -2.2204, "reward": 2.819491744041443, "reward_std": 1.2076434791088104, "rewards/reasoning_density_reward/mean": 0.36510418355464935, "rewards/reasoning_density_reward/std": 0.1164381355047226, "rewards/success_reward/mean": 1.921875, "rewards/success_reward/std": 1.3531213998794556, "rewards/trajectory_similarity_reward/mean": 0.5325125455856323, "rewards/trajectory_similarity_reward/std": 0.48636186122894287, "step": 250 }, { "clip_ratio/high_max": 0.016173741285456344, "clip_ratio/high_mean": 0.0037775480705022346, "clip_ratio/low_mean": 0.0004116906857234426, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004189238774415571, "entropy": 0.3975868374109268, "epoch": 0.20458481915435558, "grad_norm": 10.857383728027344, "learning_rate": 6.363488182559087e-07, "loss": 1.2662, "reward": 3.430400848388672, "reward_std": 1.1357234716415405, "rewards/reasoning_density_reward/mean": 0.3266369104385376, "rewards/reasoning_density_reward/std": 0.17764781415462494, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 1.0562314987182617, "rewards/trajectory_similarity_reward/mean": 0.5725136995315552, "rewards/trajectory_similarity_reward/std": 0.3232729732990265, "step": 251 }, { "clip_ratio/high_max": 0.008080984407570213, "clip_ratio/high_mean": 0.0018908181373262778, "clip_ratio/low_mean": 0.00046008831486687995, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002350906463107094, "entropy": 0.40998631343245506, "epoch": 0.2053998981151299, "grad_norm": 14.288591384887695, "learning_rate": 6.356968215158924e-07, "loss": 1.5727, "reward": 1.441636711359024, "reward_std": 1.0073172450065613, "rewards/reasoning_density_reward/mean": 0.2718750089406967, "rewards/reasoning_density_reward/std": 0.1371154859662056, "rewards/success_reward/mean": 0.9375, "rewards/success_reward/std": 0.8704394698143005, "rewards/trajectory_similarity_reward/mean": 0.23226164281368256, "rewards/trajectory_similarity_reward/std": 0.24273718893527985, "step": 252 }, { "clip_ratio/high_max": 0.00899822055362165, "clip_ratio/high_mean": 0.0016372175741707906, "clip_ratio/low_mean": 0.0015109099294932093, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003148127463646233, "entropy": 0.39359235391020775, "epoch": 0.20621497707590422, "grad_norm": 11.03714370727539, "learning_rate": 6.350448247758761e-07, "loss": 0.5686, "reward": 2.531320810317993, "reward_std": 1.9766807556152344, "rewards/reasoning_density_reward/mean": 0.2987847328186035, "rewards/reasoning_density_reward/std": 0.1078072115778923, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.5450360178947449, "rewards/trajectory_similarity_reward/std": 0.49834954738616943, "step": 253 }, { "clip_ratio/high_max": 0.013172810897231102, "clip_ratio/high_mean": 0.00339465364231728, "clip_ratio/low_mean": 0.0007895602684584446, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004184213903499767, "entropy": 0.42481959238648415, "epoch": 0.20703005603667857, "grad_norm": 15.519428253173828, "learning_rate": 6.343928280358598e-07, "loss": -6.8082, "reward": 3.7607710361480713, "reward_std": 0.6535253524780273, "rewards/reasoning_density_reward/mean": 0.3999999761581421, "rewards/reasoning_density_reward/std": 0.15705625712871552, "rewards/success_reward/mean": 2.8125, "rewards/success_reward/std": 0.5123475790023804, "rewards/trajectory_similarity_reward/mean": 0.5482709407806396, "rewards/trajectory_similarity_reward/std": 0.35716041922569275, "step": 254 }, { "clip_ratio/high_max": 0.011681167816277593, "clip_ratio/high_mean": 0.0028185049450257793, "clip_ratio/low_mean": 0.0006241229602892417, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034426279307808727, "entropy": 0.4004945270717144, "epoch": 0.20784513499745289, "grad_norm": 14.374567985534668, "learning_rate": 6.337408312958435e-07, "loss": 11.4752, "reward": 3.108481526374817, "reward_std": 1.4679675698280334, "rewards/reasoning_density_reward/mean": 0.36564503610134125, "rewards/reasoning_density_reward/std": 0.14141949266195297, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.0823204219341278, "rewards/trajectory_similarity_reward/mean": 0.492836594581604, "rewards/trajectory_similarity_reward/std": 0.4088551700115204, "step": 255 }, { "clip_ratio/high_max": 0.01052450283896178, "clip_ratio/high_mean": 0.0024318114010384306, "clip_ratio/low_mean": 0.0005288564971124288, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0029606679308926687, "entropy": 0.41581089049577713, "epoch": 0.2086602139582272, "grad_norm": 14.676612854003906, "learning_rate": 6.330888345558272e-07, "loss": -8.3973, "reward": 2.305340051651001, "reward_std": 1.4856823682785034, "rewards/reasoning_density_reward/mean": 0.3251302242279053, "rewards/reasoning_density_reward/std": 0.08947733044624329, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.3227396607398987, "rewards/trajectory_similarity_reward/mean": 0.29270995408296585, "rewards/trajectory_similarity_reward/std": 0.39942459762096405, "step": 256 }, { "clip_ratio/high_max": 0.010102792060934007, "clip_ratio/high_mean": 0.0022367154888343066, "clip_ratio/low_mean": 0.0011109371625934727, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003347652542288415, "entropy": 0.38862959668040276, "epoch": 0.20947529291900152, "grad_norm": 15.569012641906738, "learning_rate": 6.324368378158109e-07, "loss": -4.9997, "reward": 2.209674119949341, "reward_std": 1.9518542289733887, "rewards/reasoning_density_reward/mean": 0.31388890743255615, "rewards/reasoning_density_reward/std": 0.06268799304962158, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.4491376876831055, "rewards/trajectory_similarity_reward/mean": 0.39578524231910706, "rewards/trajectory_similarity_reward/std": 0.4647591710090637, "step": 257 }, { "clip_ratio/high_max": 0.011286453809589148, "clip_ratio/high_mean": 0.0029122793639544398, "clip_ratio/low_mean": 0.0011571487557375804, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004069428134243935, "entropy": 0.40321894362568855, "epoch": 0.21029037187977587, "grad_norm": 15.145513534545898, "learning_rate": 6.317848410757946e-07, "loss": -0.5451, "reward": 3.963512420654297, "reward_std": 0.8960815072059631, "rewards/reasoning_density_reward/mean": 0.4333333373069763, "rewards/reasoning_density_reward/std": 0.12692955136299133, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.8158584833145142, "rewards/trajectory_similarity_reward/mean": 0.8114289045333862, "rewards/trajectory_similarity_reward/std": 0.3243669271469116, "step": 258 }, { "clip_ratio/high_max": 0.011351597087923437, "clip_ratio/high_mean": 0.0029546376317739487, "clip_ratio/low_mean": 0.0006916242564329877, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0036462618882069364, "entropy": 0.4222741015255451, "epoch": 0.21110545084055019, "grad_norm": 18.833602905273438, "learning_rate": 6.311328443357783e-07, "loss": 4.1144, "reward": 3.2108631134033203, "reward_std": 1.6871953010559082, "rewards/reasoning_density_reward/mean": 0.3604166656732559, "rewards/reasoning_density_reward/std": 0.14331112056970596, "rewards/success_reward/mean": 2.203125, "rewards/success_reward/std": 1.274251639842987, "rewards/trajectory_similarity_reward/mean": 0.6473212540149689, "rewards/trajectory_similarity_reward/std": 0.4501459300518036, "step": 259 }, { "clip_ratio/high_max": 0.01453901524655521, "clip_ratio/high_mean": 0.003565959501429461, "clip_ratio/low_mean": 0.0006262350907491054, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004192194566712715, "entropy": 0.3942057490348816, "epoch": 0.2119205298013245, "grad_norm": 12.496442794799805, "learning_rate": 6.30480847595762e-07, "loss": -4.1707, "reward": 3.1872040033340454, "reward_std": 1.7330840826034546, "rewards/reasoning_density_reward/mean": 0.39084821939468384, "rewards/reasoning_density_reward/std": 0.12055629119277, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.3381423950195312, "rewards/trajectory_similarity_reward/mean": 0.6401056945323944, "rewards/trajectory_similarity_reward/std": 0.452044740319252, "step": 260 }, { "clip_ratio/high_max": 0.01722300541587174, "clip_ratio/high_mean": 0.003714402948389761, "clip_ratio/low_mean": 0.0006399675330612808, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004354370539658703, "entropy": 0.3961462937295437, "epoch": 0.21273560876209882, "grad_norm": 13.314759254455566, "learning_rate": 6.298288508557457e-07, "loss": 6.0322, "reward": 2.5700550079345703, "reward_std": 1.6848974227905273, "rewards/reasoning_density_reward/mean": 0.2964285612106323, "rewards/reasoning_density_reward/std": 0.15457864105701447, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.1618950366973877, "rewards/trajectory_similarity_reward/mean": 0.3986263871192932, "rewards/trajectory_similarity_reward/std": 0.46705102920532227, "step": 261 }, { "clip_ratio/high_max": 0.010651822260115296, "clip_ratio/high_mean": 0.002439945856167469, "clip_ratio/low_mean": 0.00043712057049560826, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0028770663629984483, "entropy": 0.4312555119395256, "epoch": 0.21355068772287317, "grad_norm": 14.543289184570312, "learning_rate": 6.291768541157294e-07, "loss": 1.7595, "reward": 3.0402350425720215, "reward_std": 1.449971854686737, "rewards/reasoning_density_reward/mean": 0.3706101179122925, "rewards/reasoning_density_reward/std": 0.15331882238388062, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.2004882097244263, "rewards/trajectory_similarity_reward/mean": 0.5133747309446335, "rewards/trajectory_similarity_reward/std": 0.418303981423378, "step": 262 }, { "clip_ratio/high_max": 0.010661621432518587, "clip_ratio/high_mean": 0.002359302270633634, "clip_ratio/low_mean": 0.0010165010608034208, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003375803331437055, "entropy": 0.43274424225091934, "epoch": 0.21436576668364749, "grad_norm": 13.399528503417969, "learning_rate": 6.285248573757131e-07, "loss": 1.801, "reward": 2.5425074100494385, "reward_std": 1.7571699619293213, "rewards/reasoning_density_reward/mean": 0.2633184567093849, "rewards/reasoning_density_reward/std": 0.15392501652240753, "rewards/success_reward/mean": 1.828125, "rewards/success_reward/std": 1.3756247162818909, "rewards/trajectory_similarity_reward/mean": 0.45106394588947296, "rewards/trajectory_similarity_reward/std": 0.4316675513982773, "step": 263 }, { "clip_ratio/high_max": 0.010394834709586576, "clip_ratio/high_mean": 0.0025793240092752967, "clip_ratio/low_mean": 0.0011563236475922167, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037356475077103823, "entropy": 0.4053838290274143, "epoch": 0.2151808456444218, "grad_norm": 10.182088851928711, "learning_rate": 6.278728606356968e-07, "loss": -4.0835, "reward": 2.1285001039505005, "reward_std": 1.9552958011627197, "rewards/reasoning_density_reward/mean": 0.26983901858329773, "rewards/reasoning_density_reward/std": 0.15662319958209991, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.4491376876831055, "rewards/trajectory_similarity_reward/mean": 0.35866107046604156, "rewards/trajectory_similarity_reward/std": 0.44063811004161835, "step": 264 }, { "clip_ratio/high_max": 0.0104400206473656, "clip_ratio/high_mean": 0.0023969449248397723, "clip_ratio/low_mean": 0.0011056714138248935, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003502616338664666, "entropy": 0.40941641479730606, "epoch": 0.21599592460519612, "grad_norm": 11.891151428222656, "learning_rate": 6.272208638956805e-07, "loss": 4.8456, "reward": 2.0756850242614746, "reward_std": 0.31797826290130615, "rewards/reasoning_density_reward/mean": 0.24379006028175354, "rewards/reasoning_density_reward/std": 0.17064960300922394, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.33189478516578674, "rewards/trajectory_similarity_reward/std": 0.42770156264305115, "step": 265 }, { "clip_ratio/high_max": 0.014982658554799855, "clip_ratio/high_mean": 0.0025110462156590074, "clip_ratio/low_mean": 0.0010055664897663519, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003516612749081105, "entropy": 0.4429846741259098, "epoch": 0.21681100356597047, "grad_norm": 12.403980255126953, "learning_rate": 6.265688671556642e-07, "loss": 15.3494, "reward": 4.0957231521606445, "reward_std": 0.12689536809921265, "rewards/reasoning_density_reward/mean": 0.3020833134651184, "rewards/reasoning_density_reward/std": 0.21325303614139557, "rewards/success_reward/mean": 3.0, "rewards/success_reward/std": 0.0, "rewards/trajectory_similarity_reward/mean": 0.7936399579048157, "rewards/trajectory_similarity_reward/std": 0.20744206011295319, "step": 266 }, { "clip_ratio/high_max": 0.011364417616277933, "clip_ratio/high_mean": 0.002203137628384866, "clip_ratio/low_mean": 0.0010314388855476864, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003234576517570531, "entropy": 0.42707137018442154, "epoch": 0.21762608252674479, "grad_norm": 13.588887214660645, "learning_rate": 6.25916870415648e-07, "loss": 6.8664, "reward": 1.7561883926391602, "reward_std": 1.7961602210998535, "rewards/reasoning_density_reward/mean": 0.3432021141052246, "rewards/reasoning_density_reward/std": 0.10002037510275841, "rewards/success_reward/mean": 1.078125, "rewards/success_reward/std": 1.4538734555244446, "rewards/trajectory_similarity_reward/mean": 0.33486124873161316, "rewards/trajectory_similarity_reward/std": 0.47763726115226746, "step": 267 }, { "clip_ratio/high_max": 0.006165665807202458, "clip_ratio/high_mean": 0.001303018958424218, "clip_ratio/low_mean": 0.0013125493496772833, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0026155682862736285, "entropy": 0.4300371743738651, "epoch": 0.2184411614875191, "grad_norm": 16.457189559936523, "learning_rate": 6.252648736756316e-07, "loss": -5.0693, "reward": 0.6722532212734222, "reward_std": 1.0835991203784943, "rewards/reasoning_density_reward/mean": 0.30026043951511383, "rewards/reasoning_density_reward/std": 0.05319434590637684, "rewards/success_reward/mean": 0.28125, "rewards/success_reward/std": 0.8873475790023804, "rewards/trajectory_similarity_reward/mean": 0.09074278362095356, "rewards/trajectory_similarity_reward/std": 0.2837536558508873, "step": 268 }, { "clip_ratio/high_max": 0.009980877104680985, "clip_ratio/high_mean": 0.0018044895405182615, "clip_ratio/low_mean": 0.0011070916370954365, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002911581104854122, "entropy": 0.4083787202835083, "epoch": 0.21925624044829342, "grad_norm": 14.341232299804688, "learning_rate": 6.246128769356154e-07, "loss": -2.7997, "reward": 2.369272470474243, "reward_std": 0.7356641292572021, "rewards/reasoning_density_reward/mean": 0.3049563616514206, "rewards/reasoning_density_reward/std": 0.18743447214365005, "rewards/success_reward/mean": 1.734375, "rewards/success_reward/std": 1.5043244361877441, "rewards/trajectory_similarity_reward/mean": 0.3299409747123718, "rewards/trajectory_similarity_reward/std": 0.33387456834316254, "step": 269 }, { "clip_ratio/high_max": 0.012408163282088935, "clip_ratio/high_mean": 0.0023639827195438556, "clip_ratio/low_mean": 0.0017213107712450437, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0040852934325812384, "entropy": 0.40629469230771065, "epoch": 0.22007131940906777, "grad_norm": 13.663467407226562, "learning_rate": 6.23960880195599e-07, "loss": -5.5226, "reward": 2.810218334197998, "reward_std": 2.0810813903808594, "rewards/reasoning_density_reward/mean": 0.3851190507411957, "rewards/reasoning_density_reward/std": 0.08904676884412766, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.5500994920730591, "rewards/trajectory_similarity_reward/std": 0.45481136441230774, "step": 270 }, { "clip_ratio/high_max": 0.009874262643279508, "clip_ratio/high_mean": 0.002140089050953975, "clip_ratio/low_mean": 0.0006677069723082241, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0028077960305381566, "entropy": 0.4196369796991348, "epoch": 0.22088639836984209, "grad_norm": 10.140426635742188, "learning_rate": 6.233088834555828e-07, "loss": 1.9051, "reward": 2.0900228023529053, "reward_std": 1.2897839546203613, "rewards/reasoning_density_reward/mean": 0.19947917759418488, "rewards/reasoning_density_reward/std": 0.19038142263889313, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.39054375886917114, "rewards/trajectory_similarity_reward/std": 0.42990827560424805, "step": 271 }, { "clip_ratio/high_max": 0.013791301986202598, "clip_ratio/high_mean": 0.0030748531644348986, "clip_ratio/low_mean": 0.0006890064469189383, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037638595968019217, "entropy": 0.3807368837296963, "epoch": 0.2217014773306164, "grad_norm": 13.71042251586914, "learning_rate": 6.226568867155664e-07, "loss": 2.5679, "reward": 3.103062152862549, "reward_std": 1.7741625905036926, "rewards/reasoning_density_reward/mean": 0.40937499701976776, "rewards/reasoning_density_reward/std": 0.10473335906863213, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.420820415019989, "rewards/trajectory_similarity_reward/mean": 0.6311872005462646, "rewards/trajectory_similarity_reward/std": 0.44236643612384796, "step": 272 }, { "clip_ratio/high_max": 0.01168781885644421, "clip_ratio/high_mean": 0.0026675387925934047, "clip_ratio/low_mean": 0.001471423096518265, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0041389618563698605, "entropy": 0.3849131502211094, "epoch": 0.22251655629139072, "grad_norm": 13.996663093566895, "learning_rate": 6.220048899755502e-07, "loss": -18.9862, "reward": 2.1136767864227295, "reward_std": 1.8812334537506104, "rewards/reasoning_density_reward/mean": 0.30204614996910095, "rewards/reasoning_density_reward/std": 0.15198399871587753, "rewards/success_reward/mean": 1.453125, "rewards/success_reward/std": 1.4538734555244446, "rewards/trajectory_similarity_reward/mean": 0.35850562155246735, "rewards/trajectory_similarity_reward/std": 0.4356858730316162, "step": 273 }, { "clip_ratio/high_max": 0.01012801454635337, "clip_ratio/high_mean": 0.0023233340398292057, "clip_ratio/low_mean": 0.0008594746195740299, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0031828087812755257, "entropy": 0.4153605177998543, "epoch": 0.22333163525216507, "grad_norm": 14.240212440490723, "learning_rate": 6.213528932355338e-07, "loss": 9.2881, "reward": 1.149020791053772, "reward_std": 0.9939507246017456, "rewards/reasoning_density_reward/mean": 0.2333536446094513, "rewards/reasoning_density_reward/std": 0.1190837174654007, "rewards/success_reward/mean": 0.75, "rewards/success_reward/std": 1.2247449159622192, "rewards/trajectory_similarity_reward/mean": 0.16566729545593262, "rewards/trajectory_similarity_reward/std": 0.3587699234485626, "step": 274 }, { "clip_ratio/high_max": 0.011712910374626517, "clip_ratio/high_mean": 0.0027003423892892897, "clip_ratio/low_mean": 0.0006919467996340245, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0033922892034752294, "entropy": 0.4385572671890259, "epoch": 0.22414671421293939, "grad_norm": 11.965219497680664, "learning_rate": 6.207008964955175e-07, "loss": -7.5353, "reward": 3.3626322746276855, "reward_std": 0.9962946176528931, "rewards/reasoning_density_reward/mean": 0.3671875, "rewards/reasoning_density_reward/std": 0.08435313403606415, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 0.7180703282356262, "rewards/trajectory_similarity_reward/mean": 0.4641948640346527, "rewards/trajectory_similarity_reward/std": 0.3665042817592621, "step": 275 }, { "clip_ratio/high_max": 0.011932325607631356, "clip_ratio/high_mean": 0.0028444286799640395, "clip_ratio/low_mean": 0.000696073351718951, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0035405020171310753, "entropy": 0.3954444043338299, "epoch": 0.2249617931737137, "grad_norm": 12.508131980895996, "learning_rate": 6.200488997555012e-07, "loss": 6.8207, "reward": 1.9353843927383423, "reward_std": 1.6271611452102661, "rewards/reasoning_density_reward/mean": 0.24062499403953552, "rewards/reasoning_density_reward/std": 0.16224338114261627, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.2808688879013062, "rewards/trajectory_similarity_reward/mean": 0.28850939869880676, "rewards/trajectory_similarity_reward/std": 0.4427175521850586, "step": 276 }, { "clip_ratio/high_max": 0.007735809369478375, "clip_ratio/high_mean": 0.0015649773777113296, "clip_ratio/low_mean": 0.0008808184720692225, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0024457958570565097, "entropy": 0.44895320385694504, "epoch": 0.22577687213448802, "grad_norm": 11.319671630859375, "learning_rate": 6.193969030154849e-07, "loss": -9.5084, "reward": 2.855733633041382, "reward_std": 0.8295034766197205, "rewards/reasoning_density_reward/mean": 0.2804044932126999, "rewards/reasoning_density_reward/std": 0.19075796753168106, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.2813819646835327, "rewards/trajectory_similarity_reward/mean": 0.5128292143344879, "rewards/trajectory_similarity_reward/std": 0.4420725554227829, "step": 277 }, { "clip_ratio/high_max": 0.010455312789417803, "clip_ratio/high_mean": 0.002131619621650316, "clip_ratio/low_mean": 0.0007683032308705151, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0028999228088650852, "entropy": 0.41926442086696625, "epoch": 0.22659195109526237, "grad_norm": 11.521309852600098, "learning_rate": 6.187449062754685e-07, "loss": 4.0963, "reward": 3.092461347579956, "reward_std": 1.1559048891067505, "rewards/reasoning_density_reward/mean": 0.3791666626930237, "rewards/reasoning_density_reward/std": 0.0986013263463974, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 0.9437293410301208, "rewards/trajectory_similarity_reward/mean": 0.3695446848869324, "rewards/trajectory_similarity_reward/std": 0.4090125262737274, "step": 278 }, { "clip_ratio/high_max": 0.014569296094123274, "clip_ratio/high_mean": 0.003471217889455147, "clip_ratio/low_mean": 0.00077708578282909, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004248303681379184, "entropy": 0.3678163103759289, "epoch": 0.22740703005603669, "grad_norm": 13.395071983337402, "learning_rate": 6.180929095354523e-07, "loss": -1.4403, "reward": 2.5918803215026855, "reward_std": 1.6118385791778564, "rewards/reasoning_density_reward/mean": 0.36138394474983215, "rewards/reasoning_density_reward/std": 0.1094452515244484, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.44924628734588623, "rewards/trajectory_similarity_reward/std": 0.4294058084487915, "step": 279 }, { "clip_ratio/high_max": 0.012941763969138265, "clip_ratio/high_mean": 0.0031231652974383906, "clip_ratio/low_mean": 0.0006099864658608567, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037331517232814804, "entropy": 0.36453741043806076, "epoch": 0.228222109016811, "grad_norm": 14.528563499450684, "learning_rate": 6.174409127954359e-07, "loss": -2.7836, "reward": 3.73453688621521, "reward_std": 1.290205478668213, "rewards/reasoning_density_reward/mean": 0.38482141494750977, "rewards/reasoning_density_reward/std": 0.13472874462604523, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 0.866025447845459, "rewards/trajectory_similarity_reward/mean": 0.7247154116630554, "rewards/trajectory_similarity_reward/std": 0.3683973252773285, "step": 280 }, { "clip_ratio/high_max": 0.014351052814163268, "clip_ratio/high_mean": 0.003584952632081695, "clip_ratio/low_mean": 0.001154747631517239, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004739700234495103, "entropy": 0.3719675578176975, "epoch": 0.22903718797758532, "grad_norm": 14.193607330322266, "learning_rate": 6.167889160554197e-07, "loss": 7.291, "reward": 3.758821487426758, "reward_std": 1.237898588180542, "rewards/reasoning_density_reward/mean": 0.42109376192092896, "rewards/reasoning_density_reward/std": 0.11868570744991302, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 0.7538944780826569, "rewards/trajectory_similarity_reward/mean": 0.7127277255058289, "rewards/trajectory_similarity_reward/std": 0.4011605232954025, "step": 281 }, { "clip_ratio/high_max": 0.012483961938414723, "clip_ratio/high_mean": 0.0034996918839169666, "clip_ratio/low_mean": 0.0005180033222131897, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004017695231596008, "entropy": 0.42460431158542633, "epoch": 0.22985226693835967, "grad_norm": 17.649593353271484, "learning_rate": 6.161369193154034e-07, "loss": -15.071, "reward": 3.0906091928482056, "reward_std": 1.6789631247520447, "rewards/reasoning_density_reward/mean": 0.3791666775941849, "rewards/reasoning_density_reward/std": 0.14812391996383667, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.2373085021972656, "rewards/trajectory_similarity_reward/mean": 0.5551923513412476, "rewards/trajectory_similarity_reward/std": 0.42956310510635376, "step": 282 }, { "clip_ratio/high_max": 0.014500423683784902, "clip_ratio/high_mean": 0.003385931981028989, "clip_ratio/low_mean": 0.00033831040855147876, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037242423568386585, "entropy": 0.4147470034658909, "epoch": 0.23066734589913399, "grad_norm": 18.509260177612305, "learning_rate": 6.154849225753871e-07, "loss": -0.1015, "reward": 3.0347917079925537, "reward_std": 1.6506093740463257, "rewards/reasoning_density_reward/mean": 0.3254464268684387, "rewards/reasoning_density_reward/std": 0.192388653755188, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.2247449159622192, "rewards/trajectory_similarity_reward/mean": 0.4593452215194702, "rewards/trajectory_similarity_reward/std": 0.3795848488807678, "step": 283 }, { "clip_ratio/high_max": 0.0131998147116974, "clip_ratio/high_mean": 0.004015683312900364, "clip_ratio/low_mean": 0.0007156721112551168, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004731355438707396, "entropy": 0.40287603437900543, "epoch": 0.2314824248599083, "grad_norm": 18.54034423828125, "learning_rate": 6.148329258353708e-07, "loss": 4.8833, "reward": 2.865886926651001, "reward_std": 0.9118632078170776, "rewards/reasoning_density_reward/mean": 0.39895834028720856, "rewards/reasoning_density_reward/std": 0.12192396074533463, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.486591637134552, "rewards/trajectory_similarity_reward/mean": 0.5919286012649536, "rewards/trajectory_similarity_reward/std": 0.47132980823516846, "step": 284 }, { "clip_ratio/high_max": 0.008418863726546988, "clip_ratio/high_mean": 0.0021535818159463815, "clip_ratio/low_mean": 0.0012745853200613055, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034281672014913056, "entropy": 0.3960162550210953, "epoch": 0.23229750382068262, "grad_norm": 18.479148864746094, "learning_rate": 6.141809290953545e-07, "loss": -3.9122, "reward": 2.509650766849518, "reward_std": 1.56589674949646, "rewards/reasoning_density_reward/mean": 0.3650207072496414, "rewards/reasoning_density_reward/std": 0.10482966899871826, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.404874324798584, "rewards/trajectory_similarity_reward/mean": 0.457130029797554, "rewards/trajectory_similarity_reward/std": 0.41039273142814636, "step": 285 }, { "clip_ratio/high_max": 0.014449614158365875, "clip_ratio/high_mean": 0.0030740303991478868, "clip_ratio/low_mean": 0.0007341960736084729, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003808226407272741, "entropy": 0.39871666952967644, "epoch": 0.23311258278145697, "grad_norm": 12.07947826385498, "learning_rate": 6.135289323553382e-07, "loss": -5.8486, "reward": 3.214961051940918, "reward_std": 1.8898459672927856, "rewards/reasoning_density_reward/mean": 0.3552083373069763, "rewards/reasoning_density_reward/std": 0.15900346636772156, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.6097528338432312, "rewards/trajectory_similarity_reward/std": 0.39030611515045166, "step": 286 }, { "clip_ratio/high_max": 0.01782527467003092, "clip_ratio/high_mean": 0.005114499217597768, "clip_ratio/low_mean": 0.00044302507376414724, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005557524447795004, "entropy": 0.4182770773768425, "epoch": 0.23392766174223129, "grad_norm": 13.211533546447754, "learning_rate": 6.128769356153219e-07, "loss": 9.8126, "reward": 3.4505388736724854, "reward_std": 1.5327305793762207, "rewards/reasoning_density_reward/mean": 0.3630208373069763, "rewards/reasoning_density_reward/std": 0.15948320925235748, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.6500178575515747, "rewards/trajectory_similarity_reward/std": 0.42524078488349915, "step": 287 }, { "clip_ratio/high_max": 0.01240608241641894, "clip_ratio/high_mean": 0.0021972169415676035, "clip_ratio/low_mean": 0.0007872500718804076, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0029844670061720535, "entropy": 0.40142126753926277, "epoch": 0.2347427407030056, "grad_norm": 13.08802318572998, "learning_rate": 6.122249388753056e-07, "loss": 4.3672, "reward": 2.202536106109619, "reward_std": 2.0370635986328125, "rewards/reasoning_density_reward/mean": 0.3694940507411957, "rewards/reasoning_density_reward/std": 0.08071846514940262, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.33304187655448914, "rewards/trajectory_similarity_reward/std": 0.36000752449035645, "step": 288 }, { "clip_ratio/high_max": 0.012901471927762032, "clip_ratio/high_mean": 0.0023206564874271862, "clip_ratio/low_mean": 0.0010735303003457375, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0033941867004614323, "entropy": 0.4102092757821083, "epoch": 0.23555781966377992, "grad_norm": 15.382290840148926, "learning_rate": 6.115729421352893e-07, "loss": -6.8099, "reward": 2.026583671569824, "reward_std": 1.9043338298797607, "rewards/reasoning_density_reward/mean": 0.34259670972824097, "rewards/reasoning_density_reward/std": 0.10845470428466797, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.496871829032898, "rewards/trajectory_similarity_reward/mean": 0.27773693203926086, "rewards/trajectory_similarity_reward/std": 0.43447956442832947, "step": 289 }, { "clip_ratio/high_max": 0.01128765702014789, "clip_ratio/high_mean": 0.002314597375516314, "clip_ratio/low_mean": 0.001370925376249943, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0036855226717307232, "entropy": 0.4037179797887802, "epoch": 0.23637289862455427, "grad_norm": 14.114801406860352, "learning_rate": 6.10920945395273e-07, "loss": -10.2347, "reward": 2.5563413500785828, "reward_std": 1.376158595085144, "rewards/reasoning_density_reward/mean": 0.32601459324359894, "rewards/reasoning_density_reward/std": 0.13218173384666443, "rewards/success_reward/mean": 1.828125, "rewards/success_reward/std": 1.3285260796546936, "rewards/trajectory_similarity_reward/mean": 0.4022017568349838, "rewards/trajectory_similarity_reward/std": 0.407611683011055, "step": 290 }, { "clip_ratio/high_max": 0.012233210494741797, "clip_ratio/high_mean": 0.002864615169528406, "clip_ratio/low_mean": 0.0008727812746656127, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003737396458745934, "entropy": 0.3863185755908489, "epoch": 0.23718797758532859, "grad_norm": 11.475672721862793, "learning_rate": 6.102689486552567e-07, "loss": 4.0235, "reward": 2.2279300689697266, "reward_std": 1.575589656829834, "rewards/reasoning_density_reward/mean": 0.33281248807907104, "rewards/reasoning_density_reward/std": 0.13438710570335388, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.2808688879013062, "rewards/trajectory_similarity_reward/mean": 0.3013676404953003, "rewards/trajectory_similarity_reward/std": 0.4170529544353485, "step": 291 }, { "clip_ratio/high_max": 0.012681080668698996, "clip_ratio/high_mean": 0.002212381106801331, "clip_ratio/low_mean": 0.001519009681942407, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003731390788743738, "entropy": 0.41257812455296516, "epoch": 0.2380030565461029, "grad_norm": 14.649678230285645, "learning_rate": 6.096169519152404e-07, "loss": 3.6486, "reward": 1.8435227870941162, "reward_std": 1.9145655632019043, "rewards/reasoning_density_reward/mean": 0.33392858505249023, "rewards/reasoning_density_reward/std": 0.11767301708459854, "rewards/success_reward/mean": 1.21875, "rewards/success_reward/std": 1.365878939628601, "rewards/trajectory_similarity_reward/mean": 0.290844202041626, "rewards/trajectory_similarity_reward/std": 0.4482293426990509, "step": 292 }, { "clip_ratio/high_max": 0.011785587470512837, "clip_ratio/high_mean": 0.002464588062139228, "clip_ratio/low_mean": 0.00036974263275624253, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0028343307349132374, "entropy": 0.36852888762950897, "epoch": 0.23881813550687722, "grad_norm": 13.412875175476074, "learning_rate": 6.089649551752241e-07, "loss": 0.3045, "reward": 2.077070713043213, "reward_std": 1.7712717056274414, "rewards/reasoning_density_reward/mean": 0.2966075539588928, "rewards/reasoning_density_reward/std": 0.10736411809921265, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.4491376876831055, "rewards/trajectory_similarity_reward/mean": 0.2804628908634186, "rewards/trajectory_similarity_reward/std": 0.3627447187900543, "step": 293 }, { "clip_ratio/high_max": 0.01617217797320336, "clip_ratio/high_mean": 0.0036235322331776842, "clip_ratio/low_mean": 0.0004982061800546944, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0041217383404728025, "entropy": 0.38701413199305534, "epoch": 0.23963321446765157, "grad_norm": 12.848379135131836, "learning_rate": 6.083129584352078e-07, "loss": -4.0969, "reward": 3.0489556789398193, "reward_std": 1.7698984146118164, "rewards/reasoning_density_reward/mean": 0.3549879789352417, "rewards/reasoning_density_reward/std": 0.16002556681632996, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.6314675807952881, "rewards/trajectory_similarity_reward/std": 0.443209171295166, "step": 294 }, { "clip_ratio/high_max": 0.013469399942550808, "clip_ratio/high_mean": 0.0030553231845260598, "clip_ratio/low_mean": 0.0009155762381851673, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0039708994518150575, "entropy": 0.3706762120127678, "epoch": 0.24044829342842589, "grad_norm": 15.886043548583984, "learning_rate": 6.076609616951915e-07, "loss": 3.6108, "reward": 3.2901573181152344, "reward_std": 0.9943598508834839, "rewards/reasoning_density_reward/mean": 0.3937127888202667, "rewards/reasoning_density_reward/std": 0.08795246481895447, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 0.7180703282356262, "rewards/trajectory_similarity_reward/mean": 0.3651946187019348, "rewards/trajectory_similarity_reward/std": 0.2783902883529663, "step": 295 }, { "clip_ratio/high_max": 0.015873717376962304, "clip_ratio/high_mean": 0.004114873358048499, "clip_ratio/low_mean": 0.0004928690032102168, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004607742332154885, "entropy": 0.37512465938925743, "epoch": 0.2412633723892002, "grad_norm": 18.89791488647461, "learning_rate": 6.070089649551752e-07, "loss": 2.7683, "reward": 3.3855714797973633, "reward_std": 1.474287986755371, "rewards/reasoning_density_reward/mean": 0.4064980149269104, "rewards/reasoning_density_reward/std": 0.11067752540111542, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.0600701570510864, "rewards/trajectory_similarity_reward/mean": 0.5415734946727753, "rewards/trajectory_similarity_reward/std": 0.3212650716304779, "step": 296 }, { "clip_ratio/high_max": 0.012654019985347986, "clip_ratio/high_mean": 0.004010345408460125, "clip_ratio/low_mean": 0.0001470985844207462, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004157444025622681, "entropy": 0.38675302267074585, "epoch": 0.24207845134997452, "grad_norm": 10.441469192504883, "learning_rate": 6.06356968215159e-07, "loss": 2.5983, "reward": 3.2121376991271973, "reward_std": 1.501388430595398, "rewards/reasoning_density_reward/mean": 0.37502026557922363, "rewards/reasoning_density_reward/std": 0.1434873789548874, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.4933674931526184, "rewards/trajectory_similarity_reward/std": 0.3879365622997284, "step": 297 }, { "clip_ratio/high_max": 0.012113696313463151, "clip_ratio/high_mean": 0.0029509468586184084, "clip_ratio/low_mean": 0.0005243474661256187, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034752943320199847, "entropy": 0.3836939409375191, "epoch": 0.24289353031074887, "grad_norm": 12.233640670776367, "learning_rate": 6.057049714751426e-07, "loss": -6.6939, "reward": 2.537691831588745, "reward_std": 1.9871511459350586, "rewards/reasoning_density_reward/mean": 0.35369259119033813, "rewards/reasoning_density_reward/std": 0.12387470155954361, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.4964991807937622, "rewards/trajectory_similarity_reward/std": 0.4548652470111847, "step": 298 }, { "clip_ratio/high_max": 0.010338087275158614, "clip_ratio/high_mean": 0.0021240130663500167, "clip_ratio/low_mean": 0.0005827599561598618, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0027067730552516878, "entropy": 0.3635067082941532, "epoch": 0.24370860927152319, "grad_norm": 13.81221866607666, "learning_rate": 6.050529747351264e-07, "loss": 7.986, "reward": 3.0096354484558105, "reward_std": 1.0830345153808594, "rewards/reasoning_density_reward/mean": 0.36434659361839294, "rewards/reasoning_density_reward/std": 0.09677594900131226, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.3381423950195312, "rewards/trajectory_similarity_reward/mean": 0.4890388250350952, "rewards/trajectory_similarity_reward/std": 0.36574649810791016, "step": 299 }, { "clip_ratio/high_max": 0.01526502991328016, "clip_ratio/high_mean": 0.002764094082522206, "clip_ratio/low_mean": 0.0009118296366068535, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003675923726405017, "entropy": 0.3777584880590439, "epoch": 0.2445236882322975, "grad_norm": 13.578783988952637, "learning_rate": 6.0440097799511e-07, "loss": 3.0666, "reward": 3.1982977390289307, "reward_std": 1.8212058544158936, "rewards/reasoning_density_reward/mean": 0.33901098370552063, "rewards/reasoning_density_reward/std": 0.12428051978349686, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.6092867255210876, "rewards/trajectory_similarity_reward/std": 0.3921889364719391, "step": 300 }, { "clip_ratio/high_max": 0.011705651122611016, "clip_ratio/high_mean": 0.003742550528841093, "clip_ratio/low_mean": 0.00011434902990004048, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0038568995660170913, "entropy": 0.3911980502307415, "epoch": 0.24533876719307182, "grad_norm": 14.250848770141602, "learning_rate": 6.037489812550938e-07, "loss": -14.9616, "reward": 2.849365711212158, "reward_std": 1.3574546575546265, "rewards/reasoning_density_reward/mean": 0.3899305462837219, "rewards/reasoning_density_reward/std": 0.11284241080284119, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.3275917768478394, "rewards/trajectory_similarity_reward/mean": 0.39693519473075867, "rewards/trajectory_similarity_reward/std": 0.3598313331604004, "step": 301 }, { "clip_ratio/high_max": 0.014678402454592288, "clip_ratio/high_mean": 0.0035773122508544475, "clip_ratio/low_mean": 0.000498564368172083, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004075876669958234, "entropy": 0.3637716919183731, "epoch": 0.24615384615384617, "grad_norm": 15.855813026428223, "learning_rate": 6.030969845150774e-07, "loss": -4.1414, "reward": 3.494213104248047, "reward_std": 0.9438057541847229, "rewards/reasoning_density_reward/mean": 0.4517795145511627, "rewards/reasoning_density_reward/std": 0.07130922190845013, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.0930703282356262, "rewards/trajectory_similarity_reward/mean": 0.6049337983131409, "rewards/trajectory_similarity_reward/std": 0.29414311796426773, "step": 302 }, { "clip_ratio/high_max": 0.012232446344569325, "clip_ratio/high_mean": 0.002598772232886404, "clip_ratio/low_mean": 0.0009662553493399173, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003565027625882067, "entropy": 0.37204350158572197, "epoch": 0.24696892511462049, "grad_norm": 15.583108901977539, "learning_rate": 6.024449877750612e-07, "loss": -3.7201, "reward": 3.575216293334961, "reward_std": 0.9534735679626465, "rewards/reasoning_density_reward/mean": 0.43437498807907104, "rewards/reasoning_density_reward/std": 0.11063265055418015, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.7033414244651794, "rewards/trajectory_similarity_reward/std": 0.4248732328414917, "step": 303 }, { "clip_ratio/high_max": 0.017481996561400592, "clip_ratio/high_mean": 0.0039260614139493555, "clip_ratio/low_mean": 0.0014065937011764618, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005332655069651082, "entropy": 0.3622281551361084, "epoch": 0.2477840040753948, "grad_norm": 12.30293083190918, "learning_rate": 6.017929910350448e-07, "loss": -5.2687, "reward": 3.421505928039551, "reward_std": 1.3813974857330322, "rewards/reasoning_density_reward/mean": 0.4189732074737549, "rewards/reasoning_density_reward/std": 0.09153563529253006, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 0.9287087917327881, "rewards/trajectory_similarity_reward/mean": 0.5650327205657959, "rewards/trajectory_similarity_reward/std": 0.41416072845458984, "step": 304 }, { "clip_ratio/high_max": 0.016346113989129663, "clip_ratio/high_mean": 0.004623399261618033, "clip_ratio/low_mean": 0.00028393068350851536, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004907330003334209, "entropy": 0.3964430093765259, "epoch": 0.24859908303616912, "grad_norm": 18.758874893188477, "learning_rate": 6.011409942950286e-07, "loss": 4.3495, "reward": 3.96720552444458, "reward_std": 1.187804102897644, "rewards/reasoning_density_reward/mean": 0.47187499701976776, "rewards/reasoning_density_reward/std": 0.06936421617865562, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.8158584833145142, "rewards/trajectory_similarity_reward/mean": 0.7765804529190063, "rewards/trajectory_similarity_reward/std": 0.33240872621536255, "step": 305 }, { "clip_ratio/high_max": 0.009103146643610671, "clip_ratio/high_mean": 0.003183405515301274, "clip_ratio/low_mean": 0.0007824215790606104, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003965827127103694, "entropy": 0.4173182211816311, "epoch": 0.24941416199694347, "grad_norm": 14.211477279663086, "learning_rate": 6.004889975550122e-07, "loss": -2.341, "reward": 1.4323124885559082, "reward_std": 1.7265170812606812, "rewards/reasoning_density_reward/mean": 0.2646205425262451, "rewards/reasoning_density_reward/std": 0.12371142208576202, "rewards/success_reward/mean": 1.03125, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.13644197583198547, "rewards/trajectory_similarity_reward/std": 0.20980341732501984, "step": 306 }, { "clip_ratio/high_max": 0.010662132466677576, "clip_ratio/high_mean": 0.0024459674532408826, "clip_ratio/low_mean": 0.0009079836090677418, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003353950996825006, "entropy": 0.3789873979985714, "epoch": 0.25022924095771776, "grad_norm": 14.620100021362305, "learning_rate": 5.998370008149959e-07, "loss": 1.6344, "reward": 2.85996150970459, "reward_std": 1.9422804117202759, "rewards/reasoning_density_reward/mean": 0.40677085518836975, "rewards/reasoning_density_reward/std": 0.09809381514787674, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.48444056510925293, "rewards/trajectory_similarity_reward/std": 0.41465455293655396, "step": 307 }, { "clip_ratio/high_max": 0.013896698830649257, "clip_ratio/high_mean": 0.0026183640948147513, "clip_ratio/low_mean": 0.001179315320769092, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037976794119458646, "entropy": 0.3611372150480747, "epoch": 0.25104431991849213, "grad_norm": 11.660065650939941, "learning_rate": 5.991850040749796e-07, "loss": 7.0748, "reward": 2.835574150085449, "reward_std": 1.8874082565307617, "rewards/reasoning_density_reward/mean": 0.3665178716182709, "rewards/reasoning_density_reward/std": 0.10856888443231583, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.3098187446594238, "rewards/trajectory_similarity_reward/mean": 0.5003061294555664, "rewards/trajectory_similarity_reward/std": 0.4638623893260956, "step": 308 }, { "clip_ratio/high_max": 0.010885553958360106, "clip_ratio/high_mean": 0.0019766697878367268, "clip_ratio/low_mean": 0.0009943093100446276, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002970979083329439, "entropy": 0.3769725598394871, "epoch": 0.25185939887926645, "grad_norm": 14.151846885681152, "learning_rate": 5.985330073349633e-07, "loss": 7.9252, "reward": 2.5634016195933023, "reward_std": 1.1360278129577637, "rewards/reasoning_density_reward/mean": 0.39027779301007587, "rewards/reasoning_density_reward/std": 0.11166493594646454, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5018402338027954, "rewards/trajectory_similarity_reward/mean": 0.4856238067150116, "rewards/trajectory_similarity_reward/std": 0.46955832839012146, "step": 309 }, { "clip_ratio/high_max": 0.01436826994176954, "clip_ratio/high_mean": 0.0031014927808428183, "clip_ratio/low_mean": 0.0010452947826706804, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004146787585341372, "entropy": 0.39647580683231354, "epoch": 0.25267447784004077, "grad_norm": 17.614044189453125, "learning_rate": 5.978810105949469e-07, "loss": -10.4686, "reward": 2.165497064590454, "reward_std": 1.692321538925171, "rewards/reasoning_density_reward/mean": 0.3564732223749161, "rewards/reasoning_density_reward/std": 0.08286736160516739, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.3369660377502441, "rewards/trajectory_similarity_reward/mean": 0.3090239241719246, "rewards/trajectory_similarity_reward/std": 0.41645972430706024, "step": 310 }, { "clip_ratio/high_max": 0.015691112028434873, "clip_ratio/high_mean": 0.0031343527080025524, "clip_ratio/low_mean": 0.0009151829890470253, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004049535869853571, "entropy": 0.41178738698363304, "epoch": 0.2534895568008151, "grad_norm": 12.80133056640625, "learning_rate": 5.972290138549307e-07, "loss": 0.534, "reward": 2.793883800506592, "reward_std": 1.4572417736053467, "rewards/reasoning_density_reward/mean": 0.28697916865348816, "rewards/reasoning_density_reward/std": 0.19117751717567444, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.5381544828414917, "rewards/trajectory_similarity_reward/std": 0.4413236081600189, "step": 311 }, { "clip_ratio/high_max": 0.014192182454280555, "clip_ratio/high_mean": 0.002404471204499714, "clip_ratio/low_mean": 0.0005074178770883009, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002911889081588015, "entropy": 0.38610273972153664, "epoch": 0.2543046357615894, "grad_norm": 12.445730209350586, "learning_rate": 5.965770171149144e-07, "loss": 7.4454, "reward": 2.879244565963745, "reward_std": 0.9575744867324829, "rewards/reasoning_density_reward/mean": 0.41458335518836975, "rewards/reasoning_density_reward/std": 0.10034661740064621, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.5896613597869873, "rewards/trajectory_similarity_reward/std": 0.47786352038383484, "step": 312 }, { "clip_ratio/high_max": 0.01845339871942997, "clip_ratio/high_mean": 0.0032102324184961617, "clip_ratio/low_mean": 0.0004709560416813474, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0036811884201597422, "entropy": 0.3654614947736263, "epoch": 0.2551197147223637, "grad_norm": 14.067726135253906, "learning_rate": 5.959250203748981e-07, "loss": -4.0423, "reward": 2.2798739075660706, "reward_std": 1.9367502927780151, "rewards/reasoning_density_reward/mean": 0.37187501788139343, "rewards/reasoning_density_reward/std": 0.11670142412185669, "rewards/success_reward/mean": 1.453125, "rewards/success_reward/std": 1.5043244361877441, "rewards/trajectory_similarity_reward/mean": 0.4548739045858383, "rewards/trajectory_similarity_reward/std": 0.49299223721027374, "step": 313 }, { "clip_ratio/high_max": 0.010805805679410696, "clip_ratio/high_mean": 0.0022344354874803685, "clip_ratio/low_mean": 0.0012068239011568949, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034412593668093905, "entropy": 0.3822938837110996, "epoch": 0.25593479368313804, "grad_norm": 13.556357383728027, "learning_rate": 5.952730236348818e-07, "loss": -0.6331, "reward": 2.539876937866211, "reward_std": 2.1215126514434814, "rewards/reasoning_density_reward/mean": 0.37968751788139343, "rewards/reasoning_density_reward/std": 0.10644589364528656, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.47268927097320557, "rewards/trajectory_similarity_reward/std": 0.4470042884349823, "step": 314 }, { "clip_ratio/high_max": 0.012836404494009912, "clip_ratio/high_mean": 0.0024078812057268806, "clip_ratio/low_mean": 0.0007610472312080674, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003168928451486863, "entropy": 0.3983265049755573, "epoch": 0.25674987264391236, "grad_norm": 12.595715522766113, "learning_rate": 5.946210268948655e-07, "loss": 4.1568, "reward": 2.0582685470581055, "reward_std": 2.1637513637542725, "rewards/reasoning_density_reward/mean": 0.3453125059604645, "rewards/reasoning_density_reward/std": 0.12490621209144592, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.40045595169067383, "rewards/trajectory_similarity_reward/std": 0.4716496169567108, "step": 315 }, { "clip_ratio/high_max": 0.010284380055963993, "clip_ratio/high_mean": 0.0026067294093081728, "clip_ratio/low_mean": 0.00038034013778087683, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0029870695725549012, "entropy": 0.3616899587213993, "epoch": 0.25756495160468673, "grad_norm": 38.3264045715332, "learning_rate": 5.939690301548492e-07, "loss": 1.0759, "reward": 3.3987340927124023, "reward_std": 1.7423746585845947, "rewards/reasoning_density_reward/mean": 0.3884672522544861, "rewards/reasoning_density_reward/std": 0.1267147809267044, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.6665166020393372, "rewards/trajectory_similarity_reward/std": 0.41613146662712097, "step": 316 }, { "clip_ratio/high_max": 0.01657579722814262, "clip_ratio/high_mean": 0.0029945699643576518, "clip_ratio/low_mean": 0.0007553147697763052, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003749884788703639, "entropy": 0.38260114938020706, "epoch": 0.25838003056546105, "grad_norm": 13.602109909057617, "learning_rate": 5.933170334148329e-07, "loss": 7.2565, "reward": 2.1689904928207397, "reward_std": 1.8833897113800049, "rewards/reasoning_density_reward/mean": 0.36517858505249023, "rewards/reasoning_density_reward/std": 0.09619767218828201, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.4680703282356262, "rewards/trajectory_similarity_reward/mean": 0.3975619226694107, "rewards/trajectory_similarity_reward/std": 0.41213248670101166, "step": 317 }, { "clip_ratio/high_max": 0.007098786416463554, "clip_ratio/high_mean": 0.001282848657865543, "clip_ratio/low_mean": 0.0017752147759892978, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0030580634047510102, "entropy": 0.3724346198141575, "epoch": 0.25919510952623537, "grad_norm": 12.02940845489502, "learning_rate": 5.926650366748166e-07, "loss": -0.7827, "reward": 2.596245288848877, "reward_std": 0.6826697587966919, "rewards/reasoning_density_reward/mean": 0.39618057012557983, "rewards/reasoning_density_reward/std": 0.11615794897079468, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.5125647187232971, "rewards/trajectory_similarity_reward/std": 0.47648993134498596, "step": 318 }, { "clip_ratio/high_max": 0.015159661415964365, "clip_ratio/high_mean": 0.0035640515270642936, "clip_ratio/low_mean": 0.0007320471486309543, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0042960986465914175, "entropy": 0.3944416344165802, "epoch": 0.2600101884870097, "grad_norm": 16.954345703125, "learning_rate": 5.920130399348003e-07, "loss": -6.4942, "reward": 3.1720290184020996, "reward_std": 1.1754566431045532, "rewards/reasoning_density_reward/mean": 0.3760416805744171, "rewards/reasoning_density_reward/std": 0.08343742787837982, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 0.9287087917327881, "rewards/trajectory_similarity_reward/mean": 0.35848721861839294, "rewards/trajectory_similarity_reward/std": 0.3609079420566559, "step": 319 }, { "clip_ratio/high_max": 0.015110800159163773, "clip_ratio/high_mean": 0.0029805889062117785, "clip_ratio/low_mean": 0.00027270071586826816, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0032532895857002586, "entropy": 0.4225904047489166, "epoch": 0.260825267447784, "grad_norm": 13.545127868652344, "learning_rate": 5.91361043194784e-07, "loss": 6.9937, "reward": 2.4308053255081177, "reward_std": 1.7050780653953552, "rewards/reasoning_density_reward/mean": 0.3091447949409485, "rewards/reasoning_density_reward/std": 0.12273077666759491, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.3162438869476318, "rewards/trajectory_similarity_reward/mean": 0.34041060507297516, "rewards/trajectory_similarity_reward/std": 0.3976410776376724, "step": 320 }, { "clip_ratio/high_max": 0.010879391891648993, "clip_ratio/high_mean": 0.0020662267634179443, "clip_ratio/low_mean": 0.000379685232474003, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0024459119886159897, "entropy": 0.3779408372938633, "epoch": 0.2616403464085583, "grad_norm": 13.571147918701172, "learning_rate": 5.907090464547677e-07, "loss": -0.2092, "reward": 2.842888355255127, "reward_std": 1.8234121799468994, "rewards/reasoning_density_reward/mean": 0.37447917461395264, "rewards/reasoning_density_reward/std": 0.17201067507266998, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.5934090614318848, "rewards/trajectory_similarity_reward/std": 0.47722798585891724, "step": 321 }, { "clip_ratio/high_max": 0.011547838628757745, "clip_ratio/high_mean": 0.002240222689579241, "clip_ratio/low_mean": 0.0004591548604366835, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0026993775318260305, "entropy": 0.3837013430893421, "epoch": 0.26245542536933264, "grad_norm": 11.69759464263916, "learning_rate": 5.900570497147514e-07, "loss": -5.9313, "reward": 2.870410442352295, "reward_std": 0.5953657627105713, "rewards/reasoning_density_reward/mean": 0.38238638639450073, "rewards/reasoning_density_reward/std": 0.14182861149311066, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.3098187446594238, "rewards/trajectory_similarity_reward/mean": 0.5192739963531494, "rewards/trajectory_similarity_reward/std": 0.5020473599433899, "step": 322 }, { "clip_ratio/high_max": 0.013568156922701746, "clip_ratio/high_mean": 0.0026509315066505224, "clip_ratio/low_mean": 0.000639264122582972, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0032901956874411553, "entropy": 0.3646187111735344, "epoch": 0.26327050433010696, "grad_norm": 15.980792999267578, "learning_rate": 5.894050529747351e-07, "loss": -5.0993, "reward": 3.04830002784729, "reward_std": 1.7428590059280396, "rewards/reasoning_density_reward/mean": 0.4153645783662796, "rewards/reasoning_density_reward/std": 0.11444620415568352, "rewards/success_reward/mean": 2.109375, "rewards/success_reward/std": 1.308667778968811, "rewards/trajectory_similarity_reward/mean": 0.5235603898763657, "rewards/trajectory_similarity_reward/std": 0.4190492331981659, "step": 323 }, { "clip_ratio/high_max": 0.017166737699881196, "clip_ratio/high_mean": 0.003297468982054852, "clip_ratio/low_mean": 0.0013361642995732836, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004633633216144517, "entropy": 0.40009984001517296, "epoch": 0.26408558329088133, "grad_norm": 13.369508743286133, "learning_rate": 5.887530562347188e-07, "loss": -0.3916, "reward": 3.547343373298645, "reward_std": 0.9445613324642181, "rewards/reasoning_density_reward/mean": 0.4260416626930237, "rewards/reasoning_density_reward/std": 0.09287504851818085, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 0.6865953207015991, "rewards/trajectory_similarity_reward/mean": 0.5900515913963318, "rewards/trajectory_similarity_reward/std": 0.4086669087409973, "step": 324 }, { "clip_ratio/high_max": 0.014165198081173003, "clip_ratio/high_mean": 0.004296748113119975, "clip_ratio/low_mean": 0.0012584250689542387, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005555173265747726, "entropy": 0.39360879361629486, "epoch": 0.26490066225165565, "grad_norm": 15.126787185668945, "learning_rate": 5.881010594947025e-07, "loss": -3.3145, "reward": 1.2581379413604736, "reward_std": 1.0718754529953003, "rewards/reasoning_density_reward/mean": 0.3109374940395355, "rewards/reasoning_density_reward/std": 0.0926322191953659, "rewards/success_reward/mean": 0.75, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.19720038771629333, "rewards/trajectory_similarity_reward/std": 0.37709468603134155, "step": 325 }, { "clip_ratio/high_max": 0.007428282813634723, "clip_ratio/high_mean": 0.00166499715851387, "clip_ratio/low_mean": 0.0006498481561720837, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023148453619796783, "entropy": 0.38467973843216896, "epoch": 0.26571574121242997, "grad_norm": 14.278477668762207, "learning_rate": 5.874490627546862e-07, "loss": 8.0712, "reward": 2.1365082263946533, "reward_std": 1.8595573902130127, "rewards/reasoning_density_reward/mean": 0.33253204822540283, "rewards/reasoning_density_reward/std": 0.12124699354171753, "rewards/success_reward/mean": 1.453125, "rewards/success_reward/std": 1.3736594319343567, "rewards/trajectory_similarity_reward/mean": 0.3508511260151863, "rewards/trajectory_similarity_reward/std": 0.39105224609375, "step": 326 }, { "clip_ratio/high_max": 0.012943452806212008, "clip_ratio/high_mean": 0.0034966445964528248, "clip_ratio/low_mean": 0.0005931454616074916, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004089790221769363, "entropy": 0.3790748827159405, "epoch": 0.2665308201732043, "grad_norm": 13.779884338378906, "learning_rate": 5.8679706601467e-07, "loss": 16.8727, "reward": 3.7738335132598877, "reward_std": 1.439713954925537, "rewards/reasoning_density_reward/mean": 0.4598214030265808, "rewards/reasoning_density_reward/std": 0.0868525579571724, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 1.0562314987182617, "rewards/trajectory_similarity_reward/mean": 0.7827622294425964, "rewards/trajectory_similarity_reward/std": 0.39928963780403137, "step": 327 }, { "clip_ratio/high_max": 0.01601012356695719, "clip_ratio/high_mean": 0.0034542013017926365, "clip_ratio/low_mean": 0.0007476633836631663, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004201864736387506, "entropy": 0.4059874415397644, "epoch": 0.2673458991339786, "grad_norm": 14.152125358581543, "learning_rate": 5.861450692746536e-07, "loss": -0.9152, "reward": 3.068795919418335, "reward_std": 1.3748878240585327, "rewards/reasoning_density_reward/mean": 0.39047619700431824, "rewards/reasoning_density_reward/std": 0.10024376586079597, "rewards/success_reward/mean": 2.109375, "rewards/success_reward/std": 1.3871415257453918, "rewards/trajectory_similarity_reward/mean": 0.568944662809372, "rewards/trajectory_similarity_reward/std": 0.404135063290596, "step": 328 }, { "clip_ratio/high_max": 0.010189076070673764, "clip_ratio/high_mean": 0.002333372787688859, "clip_ratio/low_mean": 0.0005415791274572257, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0028749519115081057, "entropy": 0.39173199236392975, "epoch": 0.2681609780947529, "grad_norm": 16.224746704101562, "learning_rate": 5.854930725346374e-07, "loss": 16.1439, "reward": 4.31325626373291, "reward_std": 0.09017428755760193, "rewards/reasoning_density_reward/mean": 0.5, "rewards/reasoning_density_reward/std": 0.0, "rewards/success_reward/mean": 3.0, "rewards/success_reward/std": 0.0, "rewards/trajectory_similarity_reward/mean": 0.8132562637329102, "rewards/trajectory_similarity_reward/std": 0.14089493453502655, "step": 329 }, { "clip_ratio/high_max": 0.012587949517183006, "clip_ratio/high_mean": 0.002268422584165819, "clip_ratio/low_mean": 0.0005091879465908278, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0027776106144301593, "entropy": 0.3620162382721901, "epoch": 0.26897605705552724, "grad_norm": 13.272528648376465, "learning_rate": 5.84841075794621e-07, "loss": 0.9252, "reward": 2.2940075397491455, "reward_std": 1.888667106628418, "rewards/reasoning_density_reward/mean": 0.3442336320877075, "rewards/reasoning_density_reward/std": 0.09160317480564117, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.3930631875991821, "rewards/trajectory_similarity_reward/mean": 0.35602372884750366, "rewards/trajectory_similarity_reward/std": 0.43607214093208313, "step": 330 }, { "clip_ratio/high_max": 0.01413365121698007, "clip_ratio/high_mean": 0.0032564511202508584, "clip_ratio/low_mean": 0.000688810228893999, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0039452613273169845, "entropy": 0.3791043162345886, "epoch": 0.26979113601630156, "grad_norm": 16.605979919433594, "learning_rate": 5.841890790546048e-07, "loss": -5.546, "reward": 2.438670039176941, "reward_std": 2.0664669275283813, "rewards/reasoning_density_reward/mean": 0.3815104067325592, "rewards/reasoning_density_reward/std": 0.11670742556452751, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.4456666707992554, "rewards/trajectory_similarity_reward/mean": 0.46340957283973694, "rewards/trajectory_similarity_reward/std": 0.46702878177165985, "step": 331 }, { "clip_ratio/high_max": 0.010399106948170811, "clip_ratio/high_mean": 0.0016960162538453005, "clip_ratio/low_mean": 0.001026119411108084, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0027221356431255117, "entropy": 0.3491310849785805, "epoch": 0.27060621497707593, "grad_norm": 14.598506927490234, "learning_rate": 5.835370823145884e-07, "loss": 5.1777, "reward": 2.0220437049865723, "reward_std": 2.039402484893799, "rewards/reasoning_density_reward/mean": 0.35149937868118286, "rewards/reasoning_density_reward/std": 0.10014607012271881, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.3580443263053894, "rewards/trajectory_similarity_reward/std": 0.4794158935546875, "step": 332 }, { "clip_ratio/high_max": 0.007695530453929678, "clip_ratio/high_mean": 0.0018707889357756358, "clip_ratio/low_mean": 0.0007714649291301612, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0026422538576298393, "entropy": 0.3862634375691414, "epoch": 0.27142129393785025, "grad_norm": 11.457021713256836, "learning_rate": 5.828850855745722e-07, "loss": 0.6884, "reward": 0.8004488945007324, "reward_std": 1.4154832363128662, "rewards/reasoning_density_reward/mean": 0.32500001788139343, "rewards/reasoning_density_reward/std": 0.06831300258636475, "rewards/success_reward/mean": 0.375, "rewards/success_reward/std": 1.0246951580047607, "rewards/trajectory_similarity_reward/mean": 0.10044889152050018, "rewards/trajectory_similarity_reward/std": 0.2753373384475708, "step": 333 }, { "clip_ratio/high_max": 0.014432067284360528, "clip_ratio/high_mean": 0.0030654131405754015, "clip_ratio/low_mean": 0.0007617751907673664, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0038271883240668103, "entropy": 0.3750901520252228, "epoch": 0.27223637289862457, "grad_norm": 17.0239315032959, "learning_rate": 5.822330888345558e-07, "loss": -7.4318, "reward": 2.4376096725463867, "reward_std": 1.4538242816925049, "rewards/reasoning_density_reward/mean": 0.3973214328289032, "rewards/reasoning_density_reward/std": 0.1065499484539032, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.496871829032898, "rewards/trajectory_similarity_reward/mean": 0.44653815031051636, "rewards/trajectory_similarity_reward/std": 0.4665519893169403, "step": 334 }, { "clip_ratio/high_max": 0.008265373180620372, "clip_ratio/high_mean": 0.0020505416541709565, "clip_ratio/low_mean": 0.0004493714695854578, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002499913091014605, "entropy": 0.38442620635032654, "epoch": 0.2730514518593989, "grad_norm": 14.495046615600586, "learning_rate": 5.815810920945396e-07, "loss": 6.4559, "reward": 2.411970853805542, "reward_std": 1.5739774703979492, "rewards/reasoning_density_reward/mean": 0.30453869700431824, "rewards/reasoning_density_reward/std": 0.11075756698846817, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.41993212699890137, "rewards/trajectory_similarity_reward/std": 0.3963666558265686, "step": 335 }, { "clip_ratio/high_max": 0.012590416998136789, "clip_ratio/high_mean": 0.0031167374982032925, "clip_ratio/low_mean": 0.00041759143641684204, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0035343290073797107, "entropy": 0.3623402267694473, "epoch": 0.2738665308201732, "grad_norm": 15.0597505569458, "learning_rate": 5.809290953545232e-07, "loss": 10.8196, "reward": 3.1313823461532593, "reward_std": 1.4622320532798767, "rewards/reasoning_density_reward/mean": 0.35234376788139343, "rewards/reasoning_density_reward/std": 0.11275316774845123, "rewards/success_reward/mean": 2.203125, "rewards/success_reward/std": 1.3145328760147095, "rewards/trajectory_similarity_reward/mean": 0.5759136080741882, "rewards/trajectory_similarity_reward/std": 0.40495315194129944, "step": 336 }, { "clip_ratio/high_max": 0.014143328473437577, "clip_ratio/high_mean": 0.0031628154174541123, "clip_ratio/low_mean": 0.0013056625466560945, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004468477884074673, "entropy": 0.35677406191825867, "epoch": 0.2746816097809475, "grad_norm": 13.070695877075195, "learning_rate": 5.80277098614507e-07, "loss": 5.7452, "reward": 2.55159330368042, "reward_std": 0.7903411984443665, "rewards/reasoning_density_reward/mean": 0.4125000238418579, "rewards/reasoning_density_reward/std": 0.10246950387954712, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.4515931010246277, "rewards/trajectory_similarity_reward/std": 0.4199838936328888, "step": 337 }, { "clip_ratio/high_max": 0.009029267937876284, "clip_ratio/high_mean": 0.0018334616324864328, "clip_ratio/low_mean": 0.0012889351237390656, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0031223967962432653, "entropy": 0.37240246310830116, "epoch": 0.27549668874172184, "grad_norm": 16.340702056884766, "learning_rate": 5.796251018744906e-07, "loss": -5.2753, "reward": 3.36393666267395, "reward_std": 1.1407392024993896, "rewards/reasoning_density_reward/mean": 0.44999998807907104, "rewards/reasoning_density_reward/std": 0.08944271504878998, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.6639366149902344, "rewards/trajectory_similarity_reward/std": 0.40326347947120667, "step": 338 }, { "clip_ratio/high_max": 0.015995573077816516, "clip_ratio/high_mean": 0.003946705212001689, "clip_ratio/low_mean": 0.0006949903254280798, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004641695530153811, "entropy": 0.3617883138358593, "epoch": 0.27631176770249616, "grad_norm": 13.50052261352539, "learning_rate": 5.789731051344743e-07, "loss": 7.3801, "reward": 3.67355477809906, "reward_std": 1.0960096418857574, "rewards/reasoning_density_reward/mean": 0.4468749910593033, "rewards/reasoning_density_reward/std": 0.08763552084565163, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 0.887150913476944, "rewards/trajectory_similarity_reward/mean": 0.6954298317432404, "rewards/trajectory_similarity_reward/std": 0.4209301918745041, "step": 339 }, { "clip_ratio/high_max": 0.009574354160577059, "clip_ratio/high_mean": 0.0016651905025355518, "clip_ratio/low_mean": 0.0007704670460952912, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0024356575522688217, "entropy": 0.3273480795323849, "epoch": 0.27712684666327053, "grad_norm": 11.930285453796387, "learning_rate": 5.78321108394458e-07, "loss": 5.6098, "reward": 1.894273579120636, "reward_std": 1.806860625743866, "rewards/reasoning_density_reward/mean": 0.36220239102840424, "rewards/reasoning_density_reward/std": 0.09518321603536606, "rewards/success_reward/mean": 1.21875, "rewards/success_reward/std": 1.5185213088989258, "rewards/trajectory_similarity_reward/mean": 0.3133210986852646, "rewards/trajectory_similarity_reward/std": 0.41010506451129913, "step": 340 }, { "clip_ratio/high_max": 0.015714545792434365, "clip_ratio/high_mean": 0.0029452730595949106, "clip_ratio/low_mean": 0.0014158848789520562, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004361157873063348, "entropy": 0.34550517052412033, "epoch": 0.27794192562404485, "grad_norm": 14.806563377380371, "learning_rate": 5.776691116544417e-07, "loss": 1.5927, "reward": 3.1330671310424805, "reward_std": 1.8479835987091064, "rewards/reasoning_density_reward/mean": 0.4234374761581421, "rewards/reasoning_density_reward/std": 0.09375, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.6471294164657593, "rewards/trajectory_similarity_reward/std": 0.4660375714302063, "step": 341 }, { "clip_ratio/high_max": 0.010348453710321337, "clip_ratio/high_mean": 0.0028727554745273665, "clip_ratio/low_mean": 0.0009385184603161179, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003811273883911781, "entropy": 0.37432248517870903, "epoch": 0.27875700458481917, "grad_norm": 15.584534645080566, "learning_rate": 5.770171149144254e-07, "loss": -3.5256, "reward": 2.637173056602478, "reward_std": 1.5784162282943726, "rewards/reasoning_density_reward/mean": 0.35729168355464935, "rewards/reasoning_density_reward/std": 0.12220059335231781, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.4048813581466675, "rewards/trajectory_similarity_reward/std": 0.4408653974533081, "step": 342 }, { "clip_ratio/high_max": 0.017201724520418793, "clip_ratio/high_mean": 0.0035265922779217362, "clip_ratio/low_mean": 0.0010380945132055786, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004564686736557633, "entropy": 0.36528199166059494, "epoch": 0.2795720835455935, "grad_norm": 13.71383285522461, "learning_rate": 5.76365118174409e-07, "loss": -2.8743, "reward": 3.541222095489502, "reward_std": 1.6492960453033447, "rewards/reasoning_density_reward/mean": 0.44102561473846436, "rewards/reasoning_density_reward/std": 0.08487140387296677, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.6626964211463928, "rewards/trajectory_similarity_reward/std": 0.37119486927986145, "step": 343 }, { "clip_ratio/high_max": 0.021228002849966288, "clip_ratio/high_mean": 0.006627015245612711, "clip_ratio/low_mean": 0.0004149362721364014, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.007041951466817409, "entropy": 0.3563932999968529, "epoch": 0.2803871625063678, "grad_norm": 13.923054695129395, "learning_rate": 5.757131214343928e-07, "loss": 1.9172, "reward": 3.857971668243408, "reward_std": 1.2364641427993774, "rewards/reasoning_density_reward/mean": 0.4687499850988388, "rewards/reasoning_density_reward/std": 0.07446778938174248, "rewards/success_reward/mean": 2.671875, "rewards/success_reward/std": 0.8409419655799866, "rewards/trajectory_similarity_reward/mean": 0.7173466384410858, "rewards/trajectory_similarity_reward/std": 0.34939850866794586, "step": 344 }, { "clip_ratio/high_max": 0.013472620106767863, "clip_ratio/high_mean": 0.003942655508581083, "clip_ratio/low_mean": 0.0006746807339368388, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004617336257069837, "entropy": 0.38585730642080307, "epoch": 0.2812022414671421, "grad_norm": 15.124401092529297, "learning_rate": 5.750611246943765e-07, "loss": -1.6593, "reward": 3.4852510690689087, "reward_std": 1.15212282538414, "rewards/reasoning_density_reward/mean": 0.4330543130636215, "rewards/reasoning_density_reward/std": 0.10021965950727463, "rewards/success_reward/mean": 2.484375, "rewards/success_reward/std": 0.9252449870109558, "rewards/trajectory_similarity_reward/mean": 0.5678215175867081, "rewards/trajectory_similarity_reward/std": 0.3349185883998871, "step": 345 }, { "clip_ratio/high_max": 0.009639661875553429, "clip_ratio/high_mean": 0.0021578780651907437, "clip_ratio/low_mean": 0.0005760902095062193, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002733968234679196, "entropy": 0.3709180876612663, "epoch": 0.28201732042791644, "grad_norm": 12.93267822265625, "learning_rate": 5.744091279543602e-07, "loss": -14.2785, "reward": 1.9092693328857422, "reward_std": 1.196012258529663, "rewards/reasoning_density_reward/mean": 0.23171672224998474, "rewards/reasoning_density_reward/std": 0.13116984069347382, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.157853603363037, "rewards/trajectory_similarity_reward/mean": 0.0838027074933052, "rewards/trajectory_similarity_reward/std": 0.14596225321292877, "step": 346 }, { "clip_ratio/high_max": 0.013595949159935117, "clip_ratio/high_mean": 0.004809563368326053, "clip_ratio/low_mean": 0.0002481885712768417, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0050577518122736365, "entropy": 0.3094821833074093, "epoch": 0.28283239938869076, "grad_norm": 13.68790340423584, "learning_rate": 5.737571312143439e-07, "loss": -3.0208, "reward": 4.126405239105225, "reward_std": 0.8164730668067932, "rewards/reasoning_density_reward/mean": 0.47083333134651184, "rewards/reasoning_density_reward/std": 0.06621982343494892, "rewards/success_reward/mean": 2.765625, "rewards/success_reward/std": 0.7829292416572571, "rewards/trajectory_similarity_reward/mean": 0.8899469077587128, "rewards/trajectory_similarity_reward/std": 0.29351384937763214, "step": 347 }, { "clip_ratio/high_max": 0.013669940701220185, "clip_ratio/high_mean": 0.0033174737691297196, "clip_ratio/low_mean": 0.0009086685240617953, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00422614230774343, "entropy": 0.3564513027667999, "epoch": 0.28364747834946513, "grad_norm": 17.182579040527344, "learning_rate": 5.731051344743276e-07, "loss": -6.7246, "reward": 3.8124756813049316, "reward_std": 0.8626792728900909, "rewards/reasoning_density_reward/mean": 0.45091766119003296, "rewards/reasoning_density_reward/std": 0.08062023483216763, "rewards/success_reward/mean": 2.578125, "rewards/success_reward/std": 0.9854557514190674, "rewards/trajectory_similarity_reward/mean": 0.7834330797195435, "rewards/trajectory_similarity_reward/std": 0.3291933089494705, "step": 348 }, { "clip_ratio/high_max": 0.015075937466463074, "clip_ratio/high_mean": 0.0026127761193492915, "clip_ratio/low_mean": 0.0012271876439626794, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0038399638142436743, "entropy": 0.3954431414604187, "epoch": 0.28446255731023945, "grad_norm": 13.520979881286621, "learning_rate": 5.724531377343113e-07, "loss": 6.9344, "reward": 1.7888046503067017, "reward_std": 1.9496919512748718, "rewards/reasoning_density_reward/mean": 0.3307291716337204, "rewards/reasoning_density_reward/std": 0.1430346742272377, "rewards/success_reward/mean": 1.125, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.3330754339694977, "rewards/trajectory_similarity_reward/std": 0.44970908761024475, "step": 349 }, { "clip_ratio/high_max": 0.008074141223914921, "clip_ratio/high_mean": 0.0017164660603157245, "clip_ratio/low_mean": 0.0006660787767032161, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023825448806746863, "entropy": 0.3688680902123451, "epoch": 0.28527763627101377, "grad_norm": 16.993999481201172, "learning_rate": 5.71801140994295e-07, "loss": 0.5657, "reward": 2.6760525703430176, "reward_std": 1.369627833366394, "rewards/reasoning_density_reward/mean": 0.3872023820877075, "rewards/reasoning_density_reward/std": 0.07716085761785507, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.3201000690460205, "rewards/trajectory_similarity_reward/std": 0.285830020904541, "step": 350 }, { "clip_ratio/high_max": 0.016084011702332646, "clip_ratio/high_mean": 0.004524756484897807, "clip_ratio/low_mean": 0.0006587325297005009, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0051834892219631, "entropy": 0.3644302561879158, "epoch": 0.2860927152317881, "grad_norm": 16.91122817993164, "learning_rate": 5.711491442542786e-07, "loss": 4.1323, "reward": 4.349129676818848, "reward_std": 0.38973640743643045, "rewards/reasoning_density_reward/mean": 0.4937500059604645, "rewards/reasoning_density_reward/std": 0.02500000037252903, "rewards/success_reward/mean": 2.90625, "rewards/success_reward/std": 0.375, "rewards/trajectory_similarity_reward/mean": 0.9491300880908966, "rewards/trajectory_similarity_reward/std": 0.14623664692044258, "step": 351 }, { "clip_ratio/high_max": 0.011028401990188286, "clip_ratio/high_mean": 0.002114467668434372, "clip_ratio/low_mean": 0.0014786706688028062, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0035931382735725492, "entropy": 0.4161766320466995, "epoch": 0.2869077941925624, "grad_norm": 16.992952346801758, "learning_rate": 5.704971475142624e-07, "loss": 0.3963, "reward": 2.4783341884613037, "reward_std": 1.7745463848114014, "rewards/reasoning_density_reward/mean": 0.17719495296478271, "rewards/reasoning_density_reward/std": 0.1688336730003357, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.2845232486724854, "rewards/trajectory_similarity_reward/mean": 0.42613929510116577, "rewards/trajectory_similarity_reward/std": 0.4607594907283783, "step": 352 }, { "clip_ratio/high_max": 0.008289771270938218, "clip_ratio/high_mean": 0.0021083188185002655, "clip_ratio/low_mean": 0.0008046381844906136, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0029129570175427943, "entropy": 0.44102775678038597, "epoch": 0.2877228731533367, "grad_norm": 12.31115436553955, "learning_rate": 5.69845150774246e-07, "loss": 3.6824, "reward": 1.3583242893218994, "reward_std": 1.1687129735946655, "rewards/reasoning_density_reward/mean": 0.22351191937923431, "rewards/reasoning_density_reward/std": 0.14296524226665497, "rewards/success_reward/mean": 1.03125, "rewards/success_reward/std": 1.0562314987182617, "rewards/trajectory_similarity_reward/mean": 0.1035623773932457, "rewards/trajectory_similarity_reward/std": 0.2843558192253113, "step": 353 }, { "clip_ratio/high_max": 0.011107098893262446, "clip_ratio/high_mean": 0.002307918926817365, "clip_ratio/low_mean": 0.0014531573688145727, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037610763392876834, "entropy": 0.40935400128364563, "epoch": 0.28853795211411104, "grad_norm": 13.934216499328613, "learning_rate": 5.691931540342298e-07, "loss": 0.6671, "reward": 1.1174358129501343, "reward_std": 1.0393718481063843, "rewards/reasoning_density_reward/mean": 0.29776787757873535, "rewards/reasoning_density_reward/std": 0.10363195836544037, "rewards/success_reward/mean": 0.65625, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.1634179651737213, "rewards/trajectory_similarity_reward/std": 0.3562370538711548, "step": 354 }, { "clip_ratio/high_max": 0.009382153220940381, "clip_ratio/high_mean": 0.0017130740452557802, "clip_ratio/low_mean": 0.0008471091496176086, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0025601832167012617, "entropy": 0.3720071166753769, "epoch": 0.28935303107488536, "grad_norm": 11.323563575744629, "learning_rate": 5.685411572942136e-07, "loss": -6.4246, "reward": 1.7222933769226074, "reward_std": 1.8935339450836182, "rewards/reasoning_density_reward/mean": 0.3395833373069763, "rewards/reasoning_density_reward/std": 0.08539126068353653, "rewards/success_reward/mean": 1.125, "rewards/success_reward/std": 1.3964240550994873, "rewards/trajectory_similarity_reward/mean": 0.2577100992202759, "rewards/trajectory_similarity_reward/std": 0.3980693519115448, "step": 355 }, { "clip_ratio/high_max": 0.01464967051288113, "clip_ratio/high_mean": 0.0030440595510299318, "clip_ratio/low_mean": 0.0010045788731076755, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004048638482345268, "entropy": 0.39059846475720406, "epoch": 0.29016811003565973, "grad_norm": 12.710558891296387, "learning_rate": 5.678891605541972e-07, "loss": 1.3538, "reward": 2.709707736968994, "reward_std": 1.4159626960754395, "rewards/reasoning_density_reward/mean": 0.40625, "rewards/reasoning_density_reward/std": 0.09287086874246597, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.3347075581550598, "rewards/trajectory_similarity_reward/std": 0.3372226059436798, "step": 356 }, { "clip_ratio/high_max": 0.005429201293736696, "clip_ratio/high_mean": 0.0010241970303468406, "clip_ratio/low_mean": 0.0011759308799810242, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002200127870310098, "entropy": 0.3694493696093559, "epoch": 0.29098318899643405, "grad_norm": 12.2505464553833, "learning_rate": 5.67237163814181e-07, "loss": 5.0077, "reward": 1.0042953491210938, "reward_std": 1.6555278301239014, "rewards/reasoning_density_reward/mean": 0.27619048953056335, "rewards/reasoning_density_reward/std": 0.12483096122741699, "rewards/success_reward/mean": 0.5625, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.165604829788208, "rewards/trajectory_similarity_reward/std": 0.35708847641944885, "step": 357 }, { "clip_ratio/high_max": 0.008984617074020207, "clip_ratio/high_mean": 0.0016762314044171944, "clip_ratio/low_mean": 0.00227082111814525, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003947052435250953, "entropy": 0.383940227329731, "epoch": 0.29179826795720837, "grad_norm": 14.878487586975098, "learning_rate": 5.665851670741646e-07, "loss": -3.4634, "reward": 3.5578880310058594, "reward_std": 1.1535218954086304, "rewards/reasoning_density_reward/mean": 0.4355902671813965, "rewards/reasoning_density_reward/std": 0.08448109775781631, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.6847976446151733, "rewards/trajectory_similarity_reward/std": 0.3763663172721863, "step": 358 }, { "clip_ratio/high_max": 0.013011486851610243, "clip_ratio/high_mean": 0.0029303194023668766, "clip_ratio/low_mean": 0.0004969244546373375, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034272438497282565, "entropy": 0.39311061054468155, "epoch": 0.2926133469179827, "grad_norm": 13.905472755432129, "learning_rate": 5.659331703341484e-07, "loss": 3.7313, "reward": 2.8243804772694907, "reward_std": 1.4034299850463867, "rewards/reasoning_density_reward/mean": 0.38005953033765155, "rewards/reasoning_density_reward/std": 0.15489588677883148, "rewards/success_reward/mean": 2.03125, "rewards/success_reward/std": 1.4164625803629558, "rewards/trajectory_similarity_reward/mean": 0.41307095686594647, "rewards/trajectory_similarity_reward/std": 0.35767728090286255, "step": 359 }, { "clip_ratio/high_max": 0.009324374055722728, "clip_ratio/high_mean": 0.0025741413155628834, "clip_ratio/low_mean": 0.000706446200638311, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003280587545305025, "entropy": 0.385585755109787, "epoch": 0.293428425878757, "grad_norm": 13.371380805969238, "learning_rate": 5.65281173594132e-07, "loss": 7.6066, "reward": 2.728668689727783, "reward_std": 1.851550817489624, "rewards/reasoning_density_reward/mean": 0.3550054132938385, "rewards/reasoning_density_reward/std": 0.07096242904663086, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.4049133062362671, "rewards/trajectory_similarity_reward/std": 0.39058786630630493, "step": 360 }, { "clip_ratio/high_max": 0.009506519185379148, "clip_ratio/high_mean": 0.001970400320715271, "clip_ratio/low_mean": 0.00037320157207432203, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023436019400833175, "entropy": 0.4014609530568123, "epoch": 0.2942435048395313, "grad_norm": 13.014729499816895, "learning_rate": 5.646291768541158e-07, "loss": 7.3858, "reward": 2.40278697013855, "reward_std": 1.5826060771942139, "rewards/reasoning_density_reward/mean": 0.28430286049842834, "rewards/reasoning_density_reward/std": 0.15980592370033264, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.2845232486724854, "rewards/trajectory_similarity_reward/mean": 0.24348405003547668, "rewards/trajectory_similarity_reward/std": 0.33174338936805725, "step": 361 }, { "clip_ratio/high_max": 0.010681305429898202, "clip_ratio/high_mean": 0.0026708491932367906, "clip_ratio/low_mean": 0.0008246081924880855, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003495457422104664, "entropy": 0.3895181156694889, "epoch": 0.29505858380030564, "grad_norm": 14.244135856628418, "learning_rate": 5.639771801140994e-07, "loss": -3.5218, "reward": 2.666515350341797, "reward_std": 2.0397164821624756, "rewards/reasoning_density_reward/mean": 0.3942708373069763, "rewards/reasoning_density_reward/std": 0.09816457331180573, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.4909944534301758, "rewards/trajectory_similarity_reward/std": 0.47031354904174805, "step": 362 }, { "clip_ratio/high_max": 0.015326496912166476, "clip_ratio/high_mean": 0.0033964418107643723, "clip_ratio/low_mean": 0.00040039456871454604, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003796836332185194, "entropy": 0.3774377442896366, "epoch": 0.29587366276107996, "grad_norm": 11.520925521850586, "learning_rate": 5.633251833740832e-07, "loss": -2.9578, "reward": 2.9208515882492065, "reward_std": 1.583200454711914, "rewards/reasoning_density_reward/mean": 0.38145463168621063, "rewards/reasoning_density_reward/std": 0.09078391268849373, "rewards/success_reward/mean": 2.015625, "rewards/success_reward/std": 1.4279338717460632, "rewards/trajectory_similarity_reward/mean": 0.5237718522548676, "rewards/trajectory_similarity_reward/std": 0.418470099568367, "step": 363 }, { "clip_ratio/high_max": 0.01151252316776663, "clip_ratio/high_mean": 0.0028997990957577713, "clip_ratio/low_mean": 0.0017538869069539942, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004653686046367511, "entropy": 0.3666628748178482, "epoch": 0.29668874172185433, "grad_norm": 13.939492225646973, "learning_rate": 5.626731866340668e-07, "loss": -3.1757, "reward": 3.137722134590149, "reward_std": 1.5768170952796936, "rewards/reasoning_density_reward/mean": 0.4375, "rewards/reasoning_density_reward/std": 0.09574270993471146, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.6377221047878265, "rewards/trajectory_similarity_reward/std": 0.44854868948459625, "step": 364 }, { "clip_ratio/high_max": 0.011583604122279212, "clip_ratio/high_mean": 0.002376449261646485, "clip_ratio/low_mean": 0.0007095218024915084, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003085971053224057, "entropy": 0.3878462351858616, "epoch": 0.29750382068262865, "grad_norm": 13.208454132080078, "learning_rate": 5.620211898940506e-07, "loss": 6.1395, "reward": 2.029707431793213, "reward_std": 2.1236319541931152, "rewards/reasoning_density_reward/mean": 0.34564733505249023, "rewards/reasoning_density_reward/std": 0.13017676770687103, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.37156009674072266, "rewards/trajectory_similarity_reward/std": 0.44923636317253113, "step": 365 }, { "clip_ratio/high_max": 0.009596877498552203, "clip_ratio/high_mean": 0.002110499706759583, "clip_ratio/low_mean": 0.00040626724876347, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0025167670100927353, "entropy": 0.38794977217912674, "epoch": 0.29831889964340297, "grad_norm": 12.477614402770996, "learning_rate": 5.613691931540342e-07, "loss": 9.4488, "reward": 2.925601005554199, "reward_std": 1.3399330973625183, "rewards/reasoning_density_reward/mean": 0.3510044515132904, "rewards/reasoning_density_reward/std": 0.1442137248814106, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.1831679940223694, "rewards/trajectory_similarity_reward/mean": 0.5120965987443924, "rewards/trajectory_similarity_reward/std": 0.3874047100543976, "step": 366 }, { "clip_ratio/high_max": 0.014859260059893131, "clip_ratio/high_mean": 0.00290204027260188, "clip_ratio/low_mean": 0.0016906801756704226, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004592720419168472, "entropy": 0.3934657834470272, "epoch": 0.2991339786041773, "grad_norm": 13.443169593811035, "learning_rate": 5.60717196414018e-07, "loss": 16.6859, "reward": 2.245124340057373, "reward_std": 1.4380711317062378, "rewards/reasoning_density_reward/mean": 0.3604166805744171, "rewards/reasoning_density_reward/std": 0.08710891008377075, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.384707510471344, "rewards/trajectory_similarity_reward/std": 0.42929789423942566, "step": 367 }, { "clip_ratio/high_max": 0.011777866980992258, "clip_ratio/high_mean": 0.0025487713573966175, "clip_ratio/low_mean": 0.0006976960030442569, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003246467334975023, "entropy": 0.35819636285305023, "epoch": 0.2999490575649516, "grad_norm": 12.313372611999512, "learning_rate": 5.600651996740016e-07, "loss": -1.8609, "reward": 3.830812454223633, "reward_std": 0.9592689275741577, "rewards/reasoning_density_reward/mean": 0.43058502674102783, "rewards/reasoning_density_reward/std": 0.07668198645114899, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 1.0246951580047607, "rewards/trajectory_similarity_reward/mean": 0.7752272486686707, "rewards/trajectory_similarity_reward/std": 0.3156168460845947, "step": 368 }, { "clip_ratio/high_max": 0.009942442033207044, "clip_ratio/high_mean": 0.00265935656716465, "clip_ratio/low_mean": 0.0005616902853944339, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00322104683436919, "entropy": 0.353129617869854, "epoch": 0.3007641365257259, "grad_norm": 11.931998252868652, "learning_rate": 5.594132029339854e-07, "loss": -2.1113, "reward": 3.5724148750305176, "reward_std": 0.9007634520530701, "rewards/reasoning_density_reward/mean": 0.39382439851760864, "rewards/reasoning_density_reward/std": 0.1448010802268982, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 1.0562314987182617, "rewards/trajectory_similarity_reward/mean": 0.6473402380943298, "rewards/trajectory_similarity_reward/std": 0.3680458664894104, "step": 369 }, { "clip_ratio/high_max": 0.009598813019692898, "clip_ratio/high_mean": 0.0026128363970201463, "clip_ratio/low_mean": 0.00040898906445363536, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0030218254396459088, "entropy": 0.38859889656305313, "epoch": 0.30157921548650024, "grad_norm": 12.69127368927002, "learning_rate": 5.58761206193969e-07, "loss": -2.6929, "reward": 2.8122172355651855, "reward_std": 1.0628584623336792, "rewards/reasoning_density_reward/mean": 0.38798363506793976, "rewards/reasoning_density_reward/std": 0.09356225654482841, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.360331952571869, "rewards/trajectory_similarity_reward/mean": 0.4554836004972458, "rewards/trajectory_similarity_reward/std": 0.4092353582382202, "step": 370 }, { "clip_ratio/high_max": 0.012132286617998034, "clip_ratio/high_mean": 0.0029166039603296667, "clip_ratio/low_mean": 0.0020095908985240385, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004926194946165197, "entropy": 0.4009624496102333, "epoch": 0.30239429444727456, "grad_norm": 14.918689727783203, "learning_rate": 5.581092094539528e-07, "loss": 7.906, "reward": 2.552147388458252, "reward_std": 1.6779892444610596, "rewards/reasoning_density_reward/mean": 0.3328869044780731, "rewards/reasoning_density_reward/std": 0.16379433870315552, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.1618950366973877, "rewards/trajectory_similarity_reward/mean": 0.344260573387146, "rewards/trajectory_similarity_reward/std": 0.445669561624527, "step": 371 }, { "clip_ratio/high_max": 0.014187458145897835, "clip_ratio/high_mean": 0.0036247639800421894, "clip_ratio/low_mean": 0.0005363471937016584, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0041611112537793815, "entropy": 0.3977755084633827, "epoch": 0.30320937340804893, "grad_norm": 11.451478958129883, "learning_rate": 5.574572127139364e-07, "loss": -3.4671, "reward": 2.5410882234573364, "reward_std": 0.7090919315814972, "rewards/reasoning_density_reward/mean": 0.32517585158348083, "rewards/reasoning_density_reward/std": 0.18218304961919785, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.2469309568405151, "rewards/trajectory_similarity_reward/mean": 0.434662327170372, "rewards/trajectory_similarity_reward/std": 0.5052204430103302, "step": 372 }, { "clip_ratio/high_max": 0.012132874224334955, "clip_ratio/high_mean": 0.0028523885703179985, "clip_ratio/low_mean": 0.0018846636376110837, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0047370522224809974, "entropy": 0.38834451884031296, "epoch": 0.30402445236882325, "grad_norm": 13.842869758605957, "learning_rate": 5.5680521597392e-07, "loss": 4.352, "reward": 2.3430445194244385, "reward_std": 1.5127967596054077, "rewards/reasoning_density_reward/mean": 0.30937498807907104, "rewards/reasoning_density_reward/std": 0.18816550076007843, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.34616950154304504, "rewards/trajectory_similarity_reward/std": 0.4236123859882355, "step": 373 }, { "clip_ratio/high_max": 0.008333520905580372, "clip_ratio/high_mean": 0.0018633012296049856, "clip_ratio/low_mean": 0.0010882479109568521, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00295154913328588, "entropy": 0.3727540001273155, "epoch": 0.30483953132959757, "grad_norm": 13.117837905883789, "learning_rate": 5.561532192339038e-07, "loss": 1.6462, "reward": 2.2848713994026184, "reward_std": 1.7738048434257507, "rewards/reasoning_density_reward/mean": 0.30211828649044037, "rewards/reasoning_density_reward/std": 0.15207039564847946, "rewards/success_reward/mean": 1.640625, "rewards/success_reward/std": 1.3906975388526917, "rewards/trajectory_similarity_reward/mean": 0.3421279937028885, "rewards/trajectory_similarity_reward/std": 0.40651528537273407, "step": 374 }, { "clip_ratio/high_max": 0.016229082830250263, "clip_ratio/high_mean": 0.0036789785663131624, "clip_ratio/low_mean": 0.0007862325728638098, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004465211313799955, "entropy": 0.3959108926355839, "epoch": 0.3056546102903719, "grad_norm": 14.450919151306152, "learning_rate": 5.555012224938874e-07, "loss": 1.5153, "reward": 2.895120143890381, "reward_std": 1.7893873453140259, "rewards/reasoning_density_reward/mean": 0.41718751192092896, "rewards/reasoning_density_reward/std": 0.09862333536148071, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.6029324531555176, "rewards/trajectory_similarity_reward/std": 0.4850330650806427, "step": 375 }, { "clip_ratio/high_max": 0.01531980512663722, "clip_ratio/high_mean": 0.002913703239755705, "clip_ratio/low_mean": 0.0002888071867346298, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003202510401024483, "entropy": 0.354260616004467, "epoch": 0.3064696892511462, "grad_norm": 15.330904006958008, "learning_rate": 5.548492257538712e-07, "loss": -1.0691, "reward": 3.645775318145752, "reward_std": 1.4183251857757568, "rewards/reasoning_density_reward/mean": 0.41718751192092896, "rewards/reasoning_density_reward/std": 0.13262921571731567, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 0.9031196236610413, "rewards/trajectory_similarity_reward/mean": 0.6973375678062439, "rewards/trajectory_similarity_reward/std": 0.4299100637435913, "step": 376 }, { "clip_ratio/high_max": 0.01601062889676541, "clip_ratio/high_mean": 0.0040897146391216666, "clip_ratio/low_mean": 0.00013440860493574291, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004224123229505494, "entropy": 0.3724469691514969, "epoch": 0.3072847682119205, "grad_norm": 13.30125904083252, "learning_rate": 5.541972290138548e-07, "loss": 2.9723, "reward": 2.9587321281433105, "reward_std": 2.0017988681793213, "rewards/reasoning_density_reward/mean": 0.33701637387275696, "rewards/reasoning_density_reward/std": 0.15776276588439941, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.5592156648635864, "rewards/trajectory_similarity_reward/std": 0.3935908377170563, "step": 377 }, { "clip_ratio/high_max": 0.015734270680695772, "clip_ratio/high_mean": 0.0030044465675018728, "clip_ratio/low_mean": 0.00037650760714313947, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00338095412007533, "entropy": 0.36587435007095337, "epoch": 0.30809984717269484, "grad_norm": 13.120596885681152, "learning_rate": 5.535452322738386e-07, "loss": 2.7908, "reward": 3.034017562866211, "reward_std": 1.8111968040466309, "rewards/reasoning_density_reward/mean": 0.34333792328834534, "rewards/reasoning_density_reward/std": 0.12722931802272797, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.3381423950195312, "rewards/trajectory_similarity_reward/mean": 0.5344295501708984, "rewards/trajectory_similarity_reward/std": 0.3893003463745117, "step": 378 }, { "clip_ratio/high_max": 0.009032274247147143, "clip_ratio/high_mean": 0.00165904825553298, "clip_ratio/low_mean": 0.0007284026141860522, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002387450873357011, "entropy": 0.3517087958753109, "epoch": 0.30891492613346916, "grad_norm": 13.805850982666016, "learning_rate": 5.528932355338222e-07, "loss": -7.1706, "reward": 2.189304828643799, "reward_std": 1.57373708486557, "rewards/reasoning_density_reward/mean": 0.3591146022081375, "rewards/reasoning_density_reward/std": 0.11534029990434647, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.4454171061515808, "rewards/trajectory_similarity_reward/mean": 0.33019016683101654, "rewards/trajectory_similarity_reward/std": 0.40963029861450195, "step": 379 }, { "clip_ratio/high_max": 0.011209721153136343, "clip_ratio/high_mean": 0.0028241605032235384, "clip_ratio/low_mean": 0.0008157089177984744, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003639869362814352, "entropy": 0.3767270892858505, "epoch": 0.30973000509424353, "grad_norm": 13.727434158325195, "learning_rate": 5.52241238793806e-07, "loss": 8.4112, "reward": 3.288461208343506, "reward_std": 1.6852827072143555, "rewards/reasoning_density_reward/mean": 0.3901785910129547, "rewards/reasoning_density_reward/std": 0.14218060672283173, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.5545325875282288, "rewards/trajectory_similarity_reward/std": 0.3451489508152008, "step": 380 }, { "clip_ratio/high_max": 0.011986225406872109, "clip_ratio/high_mean": 0.002469300179654965, "clip_ratio/low_mean": 0.000985165017482359, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034544652517070062, "entropy": 0.39294878393411636, "epoch": 0.31054508405501785, "grad_norm": 15.48713207244873, "learning_rate": 5.515892420537896e-07, "loss": 4.3916, "reward": 2.7038421630859375, "reward_std": 1.7263697385787964, "rewards/reasoning_density_reward/mean": 0.34613093733787537, "rewards/reasoning_density_reward/std": 0.13950802385807037, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.48271140456199646, "rewards/trajectory_similarity_reward/std": 0.3979029953479767, "step": 381 }, { "clip_ratio/high_max": 0.007664233242394403, "clip_ratio/high_mean": 0.0010331493431294803, "clip_ratio/low_mean": 0.0010143079998670146, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002047457342996495, "entropy": 0.4134094901382923, "epoch": 0.31136016301579217, "grad_norm": 12.76208782196045, "learning_rate": 5.509372453137734e-07, "loss": 0.0421, "reward": 1.6948521137237549, "reward_std": 1.9081087112426758, "rewards/reasoning_density_reward/mean": 0.3113839328289032, "rewards/reasoning_density_reward/std": 0.12593337893486023, "rewards/success_reward/mean": 1.125, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.2584682106971741, "rewards/trajectory_similarity_reward/std": 0.3466382920742035, "step": 382 }, { "clip_ratio/high_max": 0.013884770683944225, "clip_ratio/high_mean": 0.0033917459950316697, "clip_ratio/low_mean": 0.0012748635635944083, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004666609427658841, "entropy": 0.34726201742887497, "epoch": 0.3121752419765665, "grad_norm": 14.32259750366211, "learning_rate": 5.50285248573757e-07, "loss": -2.8523, "reward": 2.704380989074707, "reward_std": 2.048218011856079, "rewards/reasoning_density_reward/mean": 0.35729166865348816, "rewards/reasoning_density_reward/std": 0.13490502908825874, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.5185213088989258, "rewards/trajectory_similarity_reward/mean": 0.5658393204212189, "rewards/trajectory_similarity_reward/std": 0.48508867621421814, "step": 383 }, { "clip_ratio/high_max": 0.009904090664349496, "clip_ratio/high_mean": 0.0016800319426693022, "clip_ratio/low_mean": 0.002562337933341041, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004242369934218004, "entropy": 0.3265385031700134, "epoch": 0.3129903209373408, "grad_norm": 14.450465202331543, "learning_rate": 5.496332518337408e-07, "loss": -7.3952, "reward": 3.0152463912963867, "reward_std": 1.4413614869117737, "rewards/reasoning_density_reward/mean": 0.4189112037420273, "rewards/reasoning_density_reward/std": 0.09487393125891685, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.4680703282356262, "rewards/trajectory_similarity_reward/mean": 0.627585232257843, "rewards/trajectory_similarity_reward/std": 0.4706270843744278, "step": 384 }, { "clip_ratio/high_max": 0.013521197310183197, "clip_ratio/high_mean": 0.0029715594500885345, "clip_ratio/low_mean": 0.0013231426200945862, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004294702084735036, "entropy": 0.3591836057603359, "epoch": 0.3138053998981151, "grad_norm": 14.481882095336914, "learning_rate": 5.489812550937245e-07, "loss": 8.0885, "reward": 3.4118692874908447, "reward_std": 1.6449363231658936, "rewards/reasoning_density_reward/mean": 0.2975446581840515, "rewards/reasoning_density_reward/std": 0.1658884733915329, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.6768244504928589, "rewards/trajectory_similarity_reward/std": 0.36650484800338745, "step": 385 }, { "clip_ratio/high_max": 0.015063178783748299, "clip_ratio/high_mean": 0.00421390330302529, "clip_ratio/low_mean": 0.0010704758678912185, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005284379236400127, "entropy": 0.3825295679271221, "epoch": 0.31462047885888944, "grad_norm": 11.481528282165527, "learning_rate": 5.483292583537082e-07, "loss": 0.7919, "reward": 3.169034481048584, "reward_std": 1.7799172401428223, "rewards/reasoning_density_reward/mean": 0.3601190447807312, "rewards/reasoning_density_reward/std": 0.17444762587547302, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.5589154958724976, "rewards/trajectory_similarity_reward/std": 0.3621980845928192, "step": 386 }, { "clip_ratio/high_max": 0.019993511377833784, "clip_ratio/high_mean": 0.0051218519220128655, "clip_ratio/low_mean": 0.0006050029223843012, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005726854840759188, "entropy": 0.37449079379439354, "epoch": 0.31543555781966376, "grad_norm": 19.814611434936523, "learning_rate": 5.47677261613692e-07, "loss": -3.991, "reward": 3.8366599082946777, "reward_std": 0.9571981430053711, "rewards/reasoning_density_reward/mean": 0.44627976417541504, "rewards/reasoning_density_reward/std": 0.07772739976644516, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 1.0246951580047607, "rewards/trajectory_similarity_reward/mean": 0.7653801441192627, "rewards/trajectory_similarity_reward/std": 0.31950312852859497, "step": 387 }, { "clip_ratio/high_max": 0.010929041542112827, "clip_ratio/high_mean": 0.0033224308426724747, "clip_ratio/low_mean": 0.0004949125832354184, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003817343389528105, "entropy": 0.369546290487051, "epoch": 0.31625063678043813, "grad_norm": 16.102008819580078, "learning_rate": 5.470252648736756e-07, "loss": 6.4456, "reward": 2.7303333282470703, "reward_std": 1.8340169191360474, "rewards/reasoning_density_reward/mean": 0.2708333134651184, "rewards/reasoning_density_reward/std": 0.19874607026576996, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.4907499849796295, "rewards/trajectory_similarity_reward/std": 0.4333420395851135, "step": 388 }, { "clip_ratio/high_max": 0.01740220852661878, "clip_ratio/high_mean": 0.0038637172838207334, "clip_ratio/low_mean": 0.0019512503276928328, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005814967676997185, "entropy": 0.3900071457028389, "epoch": 0.31706571574121245, "grad_norm": 13.348089218139648, "learning_rate": 5.463732681336593e-07, "loss": -2.7967, "reward": 2.5516492128372192, "reward_std": 1.259611964225769, "rewards/reasoning_density_reward/mean": 0.38229165971279144, "rewards/reasoning_density_reward/std": 0.11906276270747185, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.4033452868461609, "rewards/trajectory_similarity_reward/mean": 0.38810762763023376, "rewards/trajectory_similarity_reward/std": 0.40005698800086975, "step": 389 }, { "clip_ratio/high_max": 0.00765808904543519, "clip_ratio/high_mean": 0.002023551169259008, "clip_ratio/low_mean": 0.001110465713281883, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003134016922558658, "entropy": 0.4039926826953888, "epoch": 0.31788079470198677, "grad_norm": 14.386045455932617, "learning_rate": 5.45721271393643e-07, "loss": -1.3309, "reward": 0.5973998308181763, "reward_std": 0.8758860230445862, "rewards/reasoning_density_reward/mean": 0.18020832538604736, "rewards/reasoning_density_reward/std": 0.13902729749679565, "rewards/success_reward/mean": 0.375, "rewards/success_reward/std": 1.0246951580047607, "rewards/trajectory_similarity_reward/mean": 0.04219147562980652, "rewards/trajectory_similarity_reward/std": 0.12601682543754578, "step": 390 }, { "clip_ratio/high_max": 0.008317893894854933, "clip_ratio/high_mean": 0.0013980760195408948, "clip_ratio/low_mean": 0.0004706158251792658, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0018686918265302666, "entropy": 0.38996167853474617, "epoch": 0.3186958736627611, "grad_norm": 15.207154273986816, "learning_rate": 5.450692746536267e-07, "loss": 4.8631, "reward": 1.2369626760482788, "reward_std": 1.0460222959518433, "rewards/reasoning_density_reward/mean": 0.28854167461395264, "rewards/reasoning_density_reward/std": 0.12688851356506348, "rewards/success_reward/mean": 0.75, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.19842100143432617, "rewards/trajectory_similarity_reward/std": 0.35532885789871216, "step": 391 }, { "clip_ratio/high_max": 0.00842359010130167, "clip_ratio/high_mean": 0.002073641197057441, "clip_ratio/low_mean": 0.0012708532085525803, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003344494412885979, "entropy": 0.36588984355330467, "epoch": 0.3195109526235354, "grad_norm": 13.845473289489746, "learning_rate": 5.444172779136104e-07, "loss": -0.8385, "reward": 1.6332118213176727, "reward_std": 1.0668688714504242, "rewards/reasoning_density_reward/mean": 0.3369419574737549, "rewards/reasoning_density_reward/std": 0.09565946459770203, "rewards/success_reward/mean": 1.078125, "rewards/success_reward/std": 1.029909372329712, "rewards/trajectory_similarity_reward/mean": 0.21814479865133762, "rewards/trajectory_similarity_reward/std": 0.2735118642449379, "step": 392 }, { "clip_ratio/high_max": 0.013274310040287673, "clip_ratio/high_mean": 0.004612551361788064, "clip_ratio/low_mean": 0.0005615101545117795, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005174061516299844, "entropy": 0.39477478340268135, "epoch": 0.3203260315843097, "grad_norm": 16.331031799316406, "learning_rate": 5.437652811735941e-07, "loss": 3.0428, "reward": 4.150160948435466, "reward_std": 0.35759734114011127, "rewards/reasoning_density_reward/mean": 0.44340277711550397, "rewards/reasoning_density_reward/std": 0.11463638146718343, "rewards/success_reward/mean": 2.96875, "rewards/success_reward/std": 0.125, "rewards/trajectory_similarity_reward/mean": 0.7380082408587137, "rewards/trajectory_similarity_reward/std": 0.19980469346046448, "step": 393 }, { "clip_ratio/high_max": 0.00960152456536889, "clip_ratio/high_mean": 0.0018714014731813222, "clip_ratio/low_mean": 0.001599209695996251, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034706112346611917, "entropy": 0.35348550975322723, "epoch": 0.32114111054508404, "grad_norm": 15.839926719665527, "learning_rate": 5.431132844335778e-07, "loss": -3.522, "reward": 2.26052188873291, "reward_std": 1.7508008480072021, "rewards/reasoning_density_reward/mean": 0.3699776828289032, "rewards/reasoning_density_reward/std": 0.08845619112253189, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.390544056892395, "rewards/trajectory_similarity_reward/std": 0.42567184567451477, "step": 394 }, { "clip_ratio/high_max": 0.013504092348739505, "clip_ratio/high_mean": 0.0030596861615777016, "clip_ratio/low_mean": 0.0001617612815607572, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003221447463147342, "entropy": 0.3467704653739929, "epoch": 0.32195618950585836, "grad_norm": 13.911638259887695, "learning_rate": 5.424612876935615e-07, "loss": 7.9343, "reward": 3.106314182281494, "reward_std": 1.8832755088806152, "rewards/reasoning_density_reward/mean": 0.4061553180217743, "rewards/reasoning_density_reward/std": 0.12135656923055649, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.3381423950195312, "rewards/trajectory_similarity_reward/mean": 0.5439090728759766, "rewards/trajectory_similarity_reward/std": 0.408393919467926, "step": 395 }, { "clip_ratio/high_max": 0.014432416879571974, "clip_ratio/high_mean": 0.002837612744770013, "clip_ratio/low_mean": 0.0008780656207818538, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003715678380103782, "entropy": 0.35022299364209175, "epoch": 0.32277126846663273, "grad_norm": 17.81336784362793, "learning_rate": 5.418092909535452e-07, "loss": -2.3575, "reward": 2.566304922103882, "reward_std": 1.5513149499893188, "rewards/reasoning_density_reward/mean": 0.3818063586950302, "rewards/reasoning_density_reward/std": 0.0986444279551506, "rewards/success_reward/mean": 1.734375, "rewards/success_reward/std": 1.4375925064086914, "rewards/trajectory_similarity_reward/mean": 0.4501235783100128, "rewards/trajectory_similarity_reward/std": 0.42410337924957275, "step": 396 }, { "clip_ratio/high_max": 0.012952898163348436, "clip_ratio/high_mean": 0.0025826568889897317, "clip_ratio/low_mean": 0.000712950735760387, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0032956076902337372, "entropy": 0.3313654884696007, "epoch": 0.32358634742740705, "grad_norm": 15.362751960754395, "learning_rate": 5.411572942135289e-07, "loss": -5.0438, "reward": 3.5068840980529785, "reward_std": 1.030730128288269, "rewards/reasoning_density_reward/mean": 0.42388394474983215, "rewards/reasoning_density_reward/std": 0.09421821683645248, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.645500123500824, "rewards/trajectory_similarity_reward/std": 0.41118741035461426, "step": 397 }, { "clip_ratio/high_max": 0.007226353860460222, "clip_ratio/high_mean": 0.001456793732359074, "clip_ratio/low_mean": 0.0012892336344521027, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0027460273704491556, "entropy": 0.39690906554460526, "epoch": 0.32440142638818137, "grad_norm": 22.4691162109375, "learning_rate": 5.405052974735126e-07, "loss": 5.3899, "reward": 0.9932116866111755, "reward_std": 0.7943178415298462, "rewards/reasoning_density_reward/mean": 0.3025669753551483, "rewards/reasoning_density_reward/std": 0.07725368440151215, "rewards/success_reward/mean": 0.609375, "rewards/success_reward/std": 1.1259995698928833, "rewards/trajectory_similarity_reward/mean": 0.08126971684396267, "rewards/trajectory_similarity_reward/std": 0.18666326999664307, "step": 398 }, { "clip_ratio/high_max": 0.009214634832460433, "clip_ratio/high_mean": 0.0025520356866763905, "clip_ratio/low_mean": 0.0012868250978499418, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003838860815449152, "entropy": 0.40897469967603683, "epoch": 0.3252165053489557, "grad_norm": 10.751640319824219, "learning_rate": 5.398533007334963e-07, "loss": -1.1461, "reward": 2.4705276489257812, "reward_std": 1.675800085067749, "rewards/reasoning_density_reward/mean": 0.2874999940395355, "rewards/reasoning_density_reward/std": 0.23273734748363495, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.49552756547927856, "rewards/trajectory_similarity_reward/std": 0.4694104492664337, "step": 399 }, { "clip_ratio/high_max": 0.008293628081446514, "clip_ratio/high_mean": 0.0013384031044552103, "clip_ratio/low_mean": 0.0009757798798091244, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002314183031558059, "entropy": 0.38133809715509415, "epoch": 0.32603158430973, "grad_norm": 10.527746200561523, "learning_rate": 5.392013039934801e-07, "loss": 10.7163, "reward": 2.871814727783203, "reward_std": 0.7553601861000061, "rewards/reasoning_density_reward/mean": 0.3879464268684387, "rewards/reasoning_density_reward/std": 0.0945989191532135, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.095445156097412, "rewards/trajectory_similarity_reward/mean": 0.23386842012405396, "rewards/trajectory_similarity_reward/std": 0.23133161664009094, "step": 400 }, { "clip_ratio/high_max": 0.013481833157129586, "clip_ratio/high_mean": 0.002673694572877139, "clip_ratio/low_mean": 0.0012497570533014368, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0039234516734723, "entropy": 0.34624556824564934, "epoch": 0.3268466632705043, "grad_norm": 16.97576332092285, "learning_rate": 5.385493072534637e-07, "loss": -3.6218, "reward": 3.5533156394958496, "reward_std": 1.3560290336608887, "rewards/reasoning_density_reward/mean": 0.4192708134651184, "rewards/reasoning_density_reward/std": 0.10735536366701126, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 1.0562314987182617, "rewards/trajectory_similarity_reward/mean": 0.6027949452400208, "rewards/trajectory_similarity_reward/std": 0.3149632513523102, "step": 401 }, { "clip_ratio/high_max": 0.014311353501398116, "clip_ratio/high_mean": 0.0037585750105790794, "clip_ratio/low_mean": 0.0014050468271307182, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005163621855899692, "entropy": 0.3429764620959759, "epoch": 0.32766174223127864, "grad_norm": 13.859162330627441, "learning_rate": 5.378973105134474e-07, "loss": -4.2991, "reward": 3.16507625579834, "reward_std": 1.0178298950195312, "rewards/reasoning_density_reward/mean": 0.4312500059604645, "rewards/reasoning_density_reward/std": 0.09464846551418304, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.3381423950195312, "rewards/trajectory_similarity_reward/mean": 0.5775761604309082, "rewards/trajectory_similarity_reward/std": 0.40573975443840027, "step": 402 }, { "clip_ratio/high_max": 0.014879496942739934, "clip_ratio/high_mean": 0.003575602611817885, "clip_ratio/low_mean": 0.00031197077805700246, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0038875734389876015, "entropy": 0.3322296738624573, "epoch": 0.32847682119205296, "grad_norm": 12.443979263305664, "learning_rate": 5.372453137734311e-07, "loss": 4.1954, "reward": 3.381706476211548, "reward_std": 1.4428740739822388, "rewards/reasoning_density_reward/mean": 0.389705091714859, "rewards/reasoning_density_reward/std": 0.12355658411979675, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 0.9287087917327881, "rewards/trajectory_similarity_reward/mean": 0.5545012950897217, "rewards/trajectory_similarity_reward/std": 0.4092211127281189, "step": 403 }, { "clip_ratio/high_max": 0.014985614689067006, "clip_ratio/high_mean": 0.003932680207071826, "clip_ratio/low_mean": 0.0007929953899292741, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0047256756806746125, "entropy": 0.36873382702469826, "epoch": 0.32929190015282733, "grad_norm": 20.294963836669922, "learning_rate": 5.365933170334148e-07, "loss": -5.7863, "reward": 3.3713752031326294, "reward_std": 1.6253154873847961, "rewards/reasoning_density_reward/mean": 0.42656250298023224, "rewards/reasoning_density_reward/std": 0.10683373361825943, "rewards/success_reward/mean": 2.296875, "rewards/success_reward/std": 1.157951295375824, "rewards/trajectory_similarity_reward/mean": 0.6479375958442688, "rewards/trajectory_similarity_reward/std": 0.4576590210199356, "step": 404 }, { "clip_ratio/high_max": 0.015335855423472822, "clip_ratio/high_mean": 0.004127079446334392, "clip_ratio/low_mean": 0.0003144962392980233, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0044415755837690085, "entropy": 0.35552549734711647, "epoch": 0.33010697911360165, "grad_norm": 14.859456062316895, "learning_rate": 5.359413202933984e-07, "loss": -4.8319, "reward": 2.898210048675537, "reward_std": 1.7261760830879211, "rewards/reasoning_density_reward/mean": 0.3847222179174423, "rewards/reasoning_density_reward/std": 0.11387929320335388, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.2636653184890747, "rewards/trajectory_similarity_reward/mean": 0.5447379052639008, "rewards/trajectory_similarity_reward/std": 0.453061580657959, "step": 405 }, { "clip_ratio/high_max": 0.00940320489462465, "clip_ratio/high_mean": 0.0016805653212941252, "clip_ratio/low_mean": 0.0011228164221392944, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0028033816925017163, "entropy": 0.3442327752709389, "epoch": 0.33092205807437597, "grad_norm": 14.60840129852295, "learning_rate": 5.352893235533822e-07, "loss": 1.7527, "reward": 1.2689683437347412, "reward_std": 0.6329122185707092, "rewards/reasoning_density_reward/mean": 0.2994047701358795, "rewards/reasoning_density_reward/std": 0.022662866860628128, "rewards/success_reward/mean": 0.9375, "rewards/success_reward/std": 0.9287087917327881, "rewards/trajectory_similarity_reward/mean": 0.03206358477473259, "rewards/trajectory_similarity_reward/std": 0.12825435400009155, "step": 406 }, { "clip_ratio/high_max": 0.012427409252268262, "clip_ratio/high_mean": 0.0026604618560668314, "clip_ratio/low_mean": 0.0009818304461077787, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0036422924167709425, "entropy": 0.3652256764471531, "epoch": 0.3317371370351503, "grad_norm": 9.510321617126465, "learning_rate": 5.346373268133658e-07, "loss": -0.6728, "reward": 2.4017577171325684, "reward_std": 1.4301681518554688, "rewards/reasoning_density_reward/mean": 0.35997024178504944, "rewards/reasoning_density_reward/std": 0.1616973876953125, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.496871829032898, "rewards/trajectory_similarity_reward/mean": 0.44803741574287415, "rewards/trajectory_similarity_reward/std": 0.47062230110168457, "step": 407 }, { "clip_ratio/high_max": 0.0076744850957766175, "clip_ratio/high_mean": 0.0016333899402525276, "clip_ratio/low_mean": 0.0009971519102691673, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002630541886901483, "entropy": 0.3641527518630028, "epoch": 0.3325522159959246, "grad_norm": 14.77344799041748, "learning_rate": 5.339853300733496e-07, "loss": -4.7149, "step": 408 }, { "clip_ratio/high_max": 0.01797430287115276, "clip_ratio/high_mean": 0.0038270454097073525, "clip_ratio/low_mean": 0.00038718764699297026, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004214232991216704, "entropy": 0.3446853756904602, "epoch": 0.3333672949566989, "grad_norm": 13.010970115661621, "learning_rate": 5.333333333333332e-07, "loss": -1.7557, "reward": 3.4806571006774902, "reward_std": 1.4483774900436401, "rewards/reasoning_density_reward/mean": 0.44348958134651184, "rewards/reasoning_density_reward/std": 0.08696940168738365, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.0453851819038391, "rewards/trajectory_similarity_reward/mean": 0.5996676087379456, "rewards/trajectory_similarity_reward/std": 0.40312360227108, "step": 409 }, { "clip_ratio/high_max": 0.01589577621780336, "clip_ratio/high_mean": 0.004334841651143506, "clip_ratio/low_mean": 0.0001365483258268796, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004471389991522301, "entropy": 0.3381124399602413, "epoch": 0.33418237391747324, "grad_norm": 13.199362754821777, "learning_rate": 5.32681336593317e-07, "loss": 7.7232, "reward": 3.605947732925415, "reward_std": 1.6863586902618408, "rewards/reasoning_density_reward/mean": 0.43217718601226807, "rewards/reasoning_density_reward/std": 0.09559816867113113, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.736270546913147, "rewards/trajectory_similarity_reward/std": 0.399722695350647, "step": 410 }, { "clip_ratio/high_max": 0.015219688415527344, "clip_ratio/high_mean": 0.002773852553218603, "clip_ratio/low_mean": 0.0006894387151987758, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034632913157111034, "entropy": 0.3253924213349819, "epoch": 0.33499745287824756, "grad_norm": 14.851600646972656, "learning_rate": 5.320293398533006e-07, "loss": 1.8918, "reward": 3.089775562286377, "reward_std": 1.3184118270874023, "rewards/reasoning_density_reward/mean": 0.4375, "rewards/reasoning_density_reward/std": 0.09472135826945305, "rewards/success_reward/mean": 2.109375, "rewards/success_reward/std": 1.380683958530426, "rewards/trajectory_similarity_reward/mean": 0.5429005026817322, "rewards/trajectory_similarity_reward/std": 0.38622765243053436, "step": 411 }, { "clip_ratio/high_max": 0.011173987528309226, "clip_ratio/high_mean": 0.002531885082134977, "clip_ratio/low_mean": 0.0013431161059997976, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003875001144479029, "entropy": 0.3350639156997204, "epoch": 0.33581253183902193, "grad_norm": 15.843807220458984, "learning_rate": 5.313773431132844e-07, "loss": -5.1342, "reward": 2.494041681289673, "reward_std": 1.947196364402771, "rewards/reasoning_density_reward/mean": 0.3968750238418579, "rewards/reasoning_density_reward/std": 0.11614466458559036, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.40966659784317017, "rewards/trajectory_similarity_reward/std": 0.3837689757347107, "step": 412 }, { "clip_ratio/high_max": 0.015042110986541957, "clip_ratio/high_mean": 0.003036149159015622, "clip_ratio/low_mean": 0.0006324982132355217, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0036686473031295463, "entropy": 0.3355483449995518, "epoch": 0.33662761079979625, "grad_norm": 15.362327575683594, "learning_rate": 5.30725346373268e-07, "loss": -0.6051, "reward": 3.7831318378448486, "reward_std": 1.2391161918640137, "rewards/reasoning_density_reward/mean": 0.4520833492279053, "rewards/reasoning_density_reward/std": 0.08603939414024353, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 0.866025447845459, "rewards/trajectory_similarity_reward/mean": 0.7060483694076538, "rewards/trajectory_similarity_reward/std": 0.3756750226020813, "step": 413 }, { "clip_ratio/high_max": 0.013721227063797414, "clip_ratio/high_mean": 0.0029834617453161627, "clip_ratio/low_mean": 0.0005969815465505235, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0035804433064186014, "entropy": 0.3259270451962948, "epoch": 0.33744268976057057, "grad_norm": 15.290608406066895, "learning_rate": 5.300733496332518e-07, "loss": 2.5221, "reward": 3.5110912322998047, "reward_std": 0.9962373189628124, "rewards/reasoning_density_reward/mean": 0.45393106341362, "rewards/reasoning_density_reward/std": 0.04579911753535271, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 0.75, "rewards/trajectory_similarity_reward/mean": 0.6196601092815399, "rewards/trajectory_similarity_reward/std": 0.2185734063386917, "step": 414 }, { "clip_ratio/high_max": 0.013022883824305609, "clip_ratio/high_mean": 0.0026099387141584884, "clip_ratio/low_mean": 0.001191871051560156, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003801809754804708, "entropy": 0.32911156490445137, "epoch": 0.3382577687213449, "grad_norm": 13.726605415344238, "learning_rate": 5.294213528932355e-07, "loss": 4.2938, "reward": 3.315126419067383, "reward_std": 1.6388633251190186, "rewards/reasoning_density_reward/mean": 0.4149305522441864, "rewards/reasoning_density_reward/std": 0.09355174750089645, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.5564458966255188, "rewards/trajectory_similarity_reward/std": 0.3872582018375397, "step": 415 }, { "clip_ratio/high_max": 0.014702152227982879, "clip_ratio/high_mean": 0.004270851801265962, "clip_ratio/low_mean": 0.0008013082333491184, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005072160100098699, "entropy": 0.37506943568587303, "epoch": 0.3390728476821192, "grad_norm": 14.929831504821777, "learning_rate": 5.287693561532192e-07, "loss": 3.1824, "reward": 2.403308153152466, "reward_std": 1.3629286289215088, "rewards/reasoning_density_reward/mean": 0.30186009407043457, "rewards/reasoning_density_reward/std": 0.1133284792304039, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.2512494325637817, "rewards/trajectory_similarity_reward/mean": 0.3201979696750641, "rewards/trajectory_similarity_reward/std": 0.388393372297287, "step": 416 }, { "clip_ratio/high_max": 0.013677117647603154, "clip_ratio/high_mean": 0.002831789097399451, "clip_ratio/low_mean": 0.0006576832020073198, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034894722484750673, "entropy": 0.33316684141755104, "epoch": 0.3398879266428935, "grad_norm": 15.124917984008789, "learning_rate": 5.281173594132029e-07, "loss": 2.8764, "reward": 3.090610980987549, "reward_std": 1.0414260625839233, "rewards/reasoning_density_reward/mean": 0.4296875, "rewards/reasoning_density_reward/std": 0.09540210664272308, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.5984233021736145, "rewards/trajectory_similarity_reward/std": 0.4366203844547272, "step": 417 }, { "clip_ratio/high_max": 0.010569237259915099, "clip_ratio/high_mean": 0.0016703867695468944, "clip_ratio/low_mean": 0.0013281544925121125, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002998541182023473, "entropy": 0.3568485341966152, "epoch": 0.34070300560366784, "grad_norm": 13.517313003540039, "learning_rate": 5.274653626731866e-07, "loss": 10.6833, "reward": 3.075650215148926, "reward_std": 1.5386359691619873, "rewards/reasoning_density_reward/mean": 0.35409730672836304, "rewards/reasoning_density_reward/std": 0.1367836594581604, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.095445156097412, "rewards/trajectory_similarity_reward/mean": 0.4715530574321747, "rewards/trajectory_similarity_reward/std": 0.4246813654899597, "step": 418 }, { "clip_ratio/high_max": 0.012557380134239793, "clip_ratio/high_mean": 0.002218906316556968, "clip_ratio/low_mean": 0.0013449219550238922, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003563828257028945, "entropy": 0.3780283071100712, "epoch": 0.34151808456444216, "grad_norm": 13.528420448303223, "learning_rate": 5.268133659331703e-07, "loss": 19.4313, "reward": 2.9616096019744873, "reward_std": 1.2077925205230713, "rewards/reasoning_density_reward/mean": 0.3713541626930237, "rewards/reasoning_density_reward/std": 0.1483854055404663, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 0.9486833214759827, "rewards/trajectory_similarity_reward/mean": 0.3402554988861084, "rewards/trajectory_similarity_reward/std": 0.36538732051849365, "step": 419 }, { "clip_ratio/high_max": 0.01434505998622626, "clip_ratio/high_mean": 0.003698891378007829, "clip_ratio/low_mean": 0.0008234346823883243, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004522326053120196, "entropy": 0.34272272139787674, "epoch": 0.34233316352521653, "grad_norm": 18.572736740112305, "learning_rate": 5.26161369193154e-07, "loss": 13.2869, "reward": 3.4062408208847046, "reward_std": 1.266909122467041, "rewards/reasoning_density_reward/mean": 0.4287388473749161, "rewards/reasoning_density_reward/std": 0.11285789683461189, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 0.9796755611896515, "rewards/trajectory_similarity_reward/mean": 0.4462520033121109, "rewards/trajectory_similarity_reward/std": 0.32591257989406586, "step": 420 }, { "clip_ratio/high_max": 0.010142957442440093, "clip_ratio/high_mean": 0.002575124890427105, "clip_ratio/low_mean": 0.0012957942526554689, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0038709190412191674, "entropy": 0.3582477606832981, "epoch": 0.34314824248599085, "grad_norm": 16.0263729095459, "learning_rate": 5.255093724531377e-07, "loss": -5.0073, "reward": 1.0067867040634155, "reward_std": 1.5437383651733398, "rewards/reasoning_density_reward/mean": 0.3291294574737549, "rewards/reasoning_density_reward/std": 0.06421861052513123, "rewards/success_reward/mean": 0.5625, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.11515721678733826, "rewards/trajectory_similarity_reward/std": 0.24971002340316772, "step": 421 }, { "clip_ratio/high_max": 0.010314768645912409, "clip_ratio/high_mean": 0.0019633175106719136, "clip_ratio/low_mean": 0.0021169310421100818, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004080248480022419, "entropy": 0.36013564094901085, "epoch": 0.34396332144676517, "grad_norm": 15.989816665649414, "learning_rate": 5.248573757131214e-07, "loss": 3.7781, "reward": 3.8651652336120605, "reward_std": 0.6729304790496826, "rewards/reasoning_density_reward/mean": 0.4429687559604645, "rewards/reasoning_density_reward/std": 0.08897199481725693, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.6046693325042725, "rewards/trajectory_similarity_reward/mean": 0.7034465074539185, "rewards/trajectory_similarity_reward/std": 0.3739306330680847, "step": 422 }, { "clip_ratio/high_max": 0.009876636613626033, "clip_ratio/high_mean": 0.002727975537709426, "clip_ratio/low_mean": 0.001370686906739138, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004098662473552395, "entropy": 0.35710402205586433, "epoch": 0.3447784004075395, "grad_norm": 13.959320068359375, "learning_rate": 5.242053789731051e-07, "loss": -1.4718, "reward": 2.5804364681243896, "reward_std": 1.314563274383545, "rewards/reasoning_density_reward/mean": 0.38593749701976776, "rewards/reasoning_density_reward/std": 0.1239590086042881, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.486591637134552, "rewards/trajectory_similarity_reward/mean": 0.5069990456104279, "rewards/trajectory_similarity_reward/std": 0.492226243019104, "step": 423 }, { "clip_ratio/high_max": 0.022833936847746372, "clip_ratio/high_mean": 0.004347729962319136, "clip_ratio/low_mean": 0.000474771652079653, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004822501563467085, "entropy": 0.38371336460113525, "epoch": 0.3455934793683138, "grad_norm": 14.629936218261719, "learning_rate": 5.235533822330888e-07, "loss": 15.032, "reward": 3.2400522232055664, "reward_std": 1.4914897680282593, "rewards/reasoning_density_reward/mean": 0.3816547095775604, "rewards/reasoning_density_reward/std": 0.14732608199119568, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.5146474838256836, "rewards/trajectory_similarity_reward/std": 0.3545694947242737, "step": 424 }, { "clip_ratio/high_max": 0.015911851864075288, "clip_ratio/high_mean": 0.0035676515217346605, "clip_ratio/low_mean": 0.0005431757381302305, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004110827223485103, "entropy": 0.35570090264081955, "epoch": 0.3464085583290881, "grad_norm": 11.628951072692871, "learning_rate": 5.229013854930725e-07, "loss": 9.2363, "reward": 3.260488510131836, "reward_std": 1.156432032585144, "rewards/reasoning_density_reward/mean": 0.43541666865348816, "rewards/reasoning_density_reward/std": 0.11036555469036102, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.5750720500946045, "rewards/trajectory_similarity_reward/std": 0.3606364130973816, "step": 425 }, { "clip_ratio/high_max": 0.015990225947462022, "clip_ratio/high_mean": 0.0037280906399246305, "clip_ratio/low_mean": 0.0017869237999548204, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005515014257980511, "entropy": 0.31976134702563286, "epoch": 0.34722363728986244, "grad_norm": 19.826801300048828, "learning_rate": 5.222493887530562e-07, "loss": -2.574, "reward": 3.1267651319503784, "reward_std": 1.8421669602394104, "rewards/reasoning_density_reward/mean": 0.4312500059604645, "rewards/reasoning_density_reward/std": 0.09595610946416855, "rewards/success_reward/mean": 2.109375, "rewards/success_reward/std": 1.308667778968811, "rewards/trajectory_similarity_reward/mean": 0.5861400961875916, "rewards/trajectory_similarity_reward/std": 0.4406520426273346, "step": 426 }, { "clip_ratio/high_max": 0.013555828481912613, "clip_ratio/high_mean": 0.0032638570992276073, "clip_ratio/low_mean": 0.0006897184648551047, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003953575607738458, "entropy": 0.3704826161265373, "epoch": 0.34803871625063676, "grad_norm": 13.514006614685059, "learning_rate": 5.215973920130399e-07, "loss": 2.56, "reward": 1.8233089447021484, "reward_std": 1.4806487560272217, "rewards/reasoning_density_reward/mean": 0.31773313879966736, "rewards/reasoning_density_reward/std": 0.13105501234531403, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.3275917768478394, "rewards/trajectory_similarity_reward/mean": 0.1930757611989975, "rewards/trajectory_similarity_reward/std": 0.3166721761226654, "step": 427 }, { "clip_ratio/high_max": 0.013341696525458246, "clip_ratio/high_mean": 0.0028284748987061903, "clip_ratio/low_mean": 0.0011414044565754011, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003969879326177761, "entropy": 0.35706962272524834, "epoch": 0.34885379521141113, "grad_norm": 15.95551872253418, "learning_rate": 5.209453952730236e-07, "loss": -3.9333, "reward": 3.5770899057388306, "reward_std": 0.6639263331890106, "rewards/reasoning_density_reward/mean": 0.43359375, "rewards/reasoning_density_reward/std": 0.09557240828871727, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 0.7180703282356262, "rewards/trajectory_similarity_reward/mean": 0.6122462451457977, "rewards/trajectory_similarity_reward/std": 0.4398719370365143, "step": 428 }, { "clip_ratio/high_max": 0.008756200491916388, "clip_ratio/high_mean": 0.0015680952928960323, "clip_ratio/low_mean": 0.0007064541568979621, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0022745493915863335, "entropy": 0.35371090844273567, "epoch": 0.34966887417218545, "grad_norm": 15.357527732849121, "learning_rate": 5.202933985330073e-07, "loss": 8.9279, "reward": 1.859299659729004, "reward_std": 1.9292092323303223, "rewards/reasoning_density_reward/mean": 0.3697172999382019, "rewards/reasoning_density_reward/std": 0.0997123271226883, "rewards/success_reward/mean": 1.21875, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.2708321809768677, "rewards/trajectory_similarity_reward/std": 0.37892478704452515, "step": 429 }, { "clip_ratio/high_max": 0.012801278498955071, "clip_ratio/high_mean": 0.002203969721449539, "clip_ratio/low_mean": 0.00048115133176906966, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0026851210532186087, "entropy": 0.3415617533028126, "epoch": 0.35048395313295977, "grad_norm": 19.16960906982422, "learning_rate": 5.196414017929911e-07, "loss": 10.3006, "reward": 3.3344225883483887, "reward_std": 1.2223055362701416, "rewards/reasoning_density_reward/mean": 0.43437498807907104, "rewards/reasoning_density_reward/std": 0.08670925348997116, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.650047779083252, "rewards/trajectory_similarity_reward/std": 0.4266659617424011, "step": 430 }, { "clip_ratio/high_max": 0.013768443139269948, "clip_ratio/high_mean": 0.0026482854736968875, "clip_ratio/low_mean": 0.0010100424187839963, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0036583279725164175, "entropy": 0.33507661893963814, "epoch": 0.3512990320937341, "grad_norm": 16.013669967651367, "learning_rate": 5.189894050529747e-07, "loss": 12.5443, "reward": 3.3296566009521484, "reward_std": 0.7505826354026794, "rewards/reasoning_density_reward/mean": 0.38181817531585693, "rewards/reasoning_density_reward/std": 0.08370817452669144, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 0.7180703282356262, "rewards/trajectory_similarity_reward/mean": 0.4165883958339691, "rewards/trajectory_similarity_reward/std": 0.32862260937690735, "step": 431 }, { "clip_ratio/high_max": 0.00837332522496581, "clip_ratio/high_mean": 0.001818620236008428, "clip_ratio/low_mean": 0.001851868670200929, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003670488906209357, "entropy": 0.33187487721443176, "epoch": 0.3521141110545084, "grad_norm": 13.802213668823242, "learning_rate": 5.183374083129585e-07, "loss": 8.6576, "reward": 3.6796555519104004, "reward_std": 0.9240651726722717, "rewards/reasoning_density_reward/mean": 0.3867819905281067, "rewards/reasoning_density_reward/std": 0.14231576025485992, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.8158584833145142, "rewards/trajectory_similarity_reward/mean": 0.5741235017776489, "rewards/trajectory_similarity_reward/std": 0.2967512607574463, "step": 432 }, { "clip_ratio/high_max": 0.017626409593503922, "clip_ratio/high_mean": 0.004831783444387838, "clip_ratio/low_mean": 0.0008694515890965704, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00570123502984643, "entropy": 0.35903899371623993, "epoch": 0.3529291900152827, "grad_norm": 12.66066837310791, "learning_rate": 5.176854115729421e-07, "loss": 15.8368, "reward": 3.0811877250671387, "reward_std": 2.0160703659057617, "rewards/reasoning_density_reward/mean": 0.41826921701431274, "rewards/reasoning_density_reward/std": 0.1236485093832016, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.6004184484481812, "rewards/trajectory_similarity_reward/std": 0.4502926468849182, "step": 433 }, { "clip_ratio/high_max": 0.01230120740365237, "clip_ratio/high_mean": 0.002872582153941039, "clip_ratio/low_mean": 0.000931221067730803, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0038038031198084354, "entropy": 0.36335083097219467, "epoch": 0.35374426897605704, "grad_norm": 14.97573184967041, "learning_rate": 5.170334148329259e-07, "loss": 5.7115, "reward": 0.7344133853912354, "reward_std": 1.0763360261917114, "rewards/reasoning_density_reward/mean": 0.3031250238418579, "rewards/reasoning_density_reward/std": 0.06446898728609085, "rewards/success_reward/mean": 0.375, "rewards/success_reward/std": 0.866025447845459, "rewards/trajectory_similarity_reward/mean": 0.05628836527466774, "rewards/trajectory_similarity_reward/std": 0.22515346109867096, "step": 434 }, { "clip_ratio/high_max": 0.011520727188326418, "clip_ratio/high_mean": 0.0027582082548178732, "clip_ratio/low_mean": 0.0009817451500566676, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037399533321149647, "entropy": 0.2947052698582411, "epoch": 0.35455934793683136, "grad_norm": 12.89682388305664, "learning_rate": 5.163814180929095e-07, "loss": -3.3435, "reward": 3.9800859689712524, "reward_std": 0.8700380846858025, "rewards/reasoning_density_reward/mean": 0.4749999940395355, "rewards/reasoning_density_reward/std": 0.04472135752439499, "rewards/success_reward/mean": 2.671875, "rewards/success_reward/std": 0.6104557514190674, "rewards/trajectory_similarity_reward/mean": 0.8332107961177826, "rewards/trajectory_similarity_reward/std": 0.23363961838185787, "step": 435 }, { "clip_ratio/high_max": 0.013451404869556427, "clip_ratio/high_mean": 0.002756798596237786, "clip_ratio/low_mean": 0.0010435897784191184, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0038003884328645654, "entropy": 0.3378818668425083, "epoch": 0.35537442689760573, "grad_norm": 13.009928703308105, "learning_rate": 5.157294213528932e-07, "loss": 11.5757, "reward": 2.0759682655334473, "reward_std": 1.604179859161377, "rewards/reasoning_density_reward/mean": 0.24895834922790527, "rewards/reasoning_density_reward/std": 0.1696913093328476, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.4491376876831055, "rewards/trajectory_similarity_reward/mean": 0.32700982689857483, "rewards/trajectory_similarity_reward/std": 0.41038116812705994, "step": 436 }, { "clip_ratio/high_max": 0.014103942812653258, "clip_ratio/high_mean": 0.0028284729487495497, "clip_ratio/low_mean": 0.0010275505992467515, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003856023497064598, "entropy": 0.37653953582048416, "epoch": 0.35618950585838005, "grad_norm": 13.816670417785645, "learning_rate": 5.150774246128769e-07, "loss": -2.1749, "reward": 2.363271713256836, "reward_std": 1.4802814722061157, "rewards/reasoning_density_reward/mean": 0.27849704027175903, "rewards/reasoning_density_reward/std": 0.12495990842580795, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.125, "rewards/trajectory_similarity_reward/mean": 0.30352452397346497, "rewards/trajectory_similarity_reward/std": 0.42581596970558167, "step": 437 }, { "clip_ratio/high_max": 0.009617793723009527, "clip_ratio/high_mean": 0.0016410850075772032, "clip_ratio/low_mean": 0.0015289352741092443, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0031700202816864476, "entropy": 0.3718842677772045, "epoch": 0.35700458481915437, "grad_norm": 10.909636497497559, "learning_rate": 5.144254278728606e-07, "loss": 6.944, "reward": 3.635477066040039, "reward_std": 1.3980504274368286, "rewards/reasoning_density_reward/mean": 0.453125, "rewards/reasoning_density_reward/std": 0.10562314838171005, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 1.0562314987182617, "rewards/trajectory_similarity_reward/mean": 0.6511019468307495, "rewards/trajectory_similarity_reward/std": 0.35027173161506653, "step": 438 }, { "clip_ratio/high_max": 0.014390083844773471, "clip_ratio/high_mean": 0.003529517911374569, "clip_ratio/low_mean": 0.00037003782927058637, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003899555711541325, "entropy": 0.3547911122441292, "epoch": 0.3578196637799287, "grad_norm": 13.960411071777344, "learning_rate": 5.137734311328442e-07, "loss": 2.6821, "reward": 2.869551420211792, "reward_std": 1.1689318418502808, "rewards/reasoning_density_reward/mean": 0.3806547522544861, "rewards/reasoning_density_reward/std": 0.09671033918857574, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 0.9437293410301208, "rewards/trajectory_similarity_reward/mean": 0.3326466977596283, "rewards/trajectory_similarity_reward/std": 0.3591921329498291, "step": 439 }, { "clip_ratio/high_max": 0.01021356403362006, "clip_ratio/high_mean": 0.0018447730399202555, "clip_ratio/low_mean": 0.001489924074121518, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003334697146783583, "entropy": 0.3350347466766834, "epoch": 0.358634742740703, "grad_norm": 16.358707427978516, "learning_rate": 5.13121434392828e-07, "loss": -5.3563, "reward": 2.4540815353393555, "reward_std": 0.2965747117996216, "rewards/reasoning_density_reward/mean": 0.4000000059604645, "rewards/reasoning_density_reward/std": 0.10327955335378647, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.496871829032898, "rewards/trajectory_similarity_reward/mean": 0.46033143997192383, "rewards/trajectory_similarity_reward/std": 0.47736114263534546, "step": 440 }, { "clip_ratio/high_max": 0.010473738395376131, "clip_ratio/high_mean": 0.0017767819917935412, "clip_ratio/low_mean": 0.0007455251470673829, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0025223072116205003, "entropy": 0.3298346772789955, "epoch": 0.3594498217014773, "grad_norm": 16.271299362182617, "learning_rate": 5.124694376528116e-07, "loss": -7.4457, "reward": 3.560398578643799, "reward_std": 1.097946286201477, "rewards/reasoning_density_reward/mean": 0.42786458134651184, "rewards/reasoning_density_reward/std": 0.09649791568517685, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 0.670820415019989, "rewards/trajectory_similarity_reward/mean": 0.5075339674949646, "rewards/trajectory_similarity_reward/std": 0.35779330134391785, "step": 441 }, { "clip_ratio/high_max": 0.018899715621955693, "clip_ratio/high_mean": 0.004600309432134964, "clip_ratio/low_mean": 0.00035992956327390857, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0049602390063228086, "entropy": 0.3523045480251312, "epoch": 0.36026490066225164, "grad_norm": 14.733290672302246, "learning_rate": 5.118174409127954e-07, "loss": 0.1642, "reward": 3.221834182739258, "reward_std": 1.7312562465667725, "rewards/reasoning_density_reward/mean": 0.41804203391075134, "rewards/reasoning_density_reward/std": 0.08906347304582596, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.2247449159622192, "rewards/trajectory_similarity_reward/mean": 0.5537919998168945, "rewards/trajectory_similarity_reward/std": 0.40218988060951233, "step": 442 }, { "clip_ratio/high_max": 0.014236290589906275, "clip_ratio/high_mean": 0.003031516731425654, "clip_ratio/low_mean": 0.0002560410139267333, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0032875577671802603, "entropy": 0.35012974217534065, "epoch": 0.36107997962302596, "grad_norm": 13.193225860595703, "learning_rate": 5.11165444172779e-07, "loss": 7.2646, "reward": 3.391960620880127, "reward_std": 1.6912016868591309, "rewards/reasoning_density_reward/mean": 0.39642855525016785, "rewards/reasoning_density_reward/std": 0.15755358338356018, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.6517819166183472, "rewards/trajectory_similarity_reward/std": 0.4007512629032135, "step": 443 }, { "clip_ratio/high_max": 0.013480794325005263, "clip_ratio/high_mean": 0.0021559581291512586, "clip_ratio/low_mean": 0.00011391948282835074, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002269877615617588, "entropy": 0.35619455575942993, "epoch": 0.36189505858380033, "grad_norm": 17.399005889892578, "learning_rate": 5.105134474327628e-07, "loss": 19.5273, "reward": 3.370577573776245, "reward_std": 1.475117027759552, "rewards/reasoning_density_reward/mean": 0.4045587331056595, "rewards/reasoning_density_reward/std": 0.13322126865386963, "rewards/success_reward/mean": 2.390625, "rewards/success_reward/std": 1.1020839214324951, "rewards/trajectory_similarity_reward/mean": 0.5753938257694244, "rewards/trajectory_similarity_reward/std": 0.3748610317707062, "step": 444 }, { "clip_ratio/high_max": 0.01693464582785964, "clip_ratio/high_mean": 0.004525379714323208, "clip_ratio/low_mean": 0.0009916337075992487, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0055170134583022445, "entropy": 0.35768747702240944, "epoch": 0.36271013754457465, "grad_norm": 15.13335132598877, "learning_rate": 5.098614506927465e-07, "loss": 7.5439, "reward": 3.527996063232422, "reward_std": 1.0843853950500488, "rewards/reasoning_density_reward/mean": 0.4125000238418579, "rewards/reasoning_density_reward/std": 0.12974333763122559, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.6779960989952087, "rewards/trajectory_similarity_reward/std": 0.37645605206489563, "step": 445 }, { "clip_ratio/high_max": 0.015719807415734977, "clip_ratio/high_mean": 0.0031536267488263547, "clip_ratio/low_mean": 0.0007503352244384587, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0039039619732648134, "entropy": 0.3463652618229389, "epoch": 0.36352521650534897, "grad_norm": 16.655149459838867, "learning_rate": 5.092094539527302e-07, "loss": 1.4283, "reward": 3.5151896476745605, "reward_std": 1.1626205444335938, "rewards/reasoning_density_reward/mean": 0.4282737970352173, "rewards/reasoning_density_reward/std": 0.08221528679132462, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 0.866025447845459, "rewards/trajectory_similarity_reward/mean": 0.4619158208370209, "rewards/trajectory_similarity_reward/std": 0.29657304286956787, "step": 446 }, { "clip_ratio/high_max": 0.012756937241647393, "clip_ratio/high_mean": 0.003646124168881215, "clip_ratio/low_mean": 0.0007987049175426364, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004444829028216191, "entropy": 0.3349381610751152, "epoch": 0.3643402954661233, "grad_norm": 14.44282341003418, "learning_rate": 5.085574572127139e-07, "loss": 1.8969, "reward": 3.8367849588394165, "reward_std": 0.8198225796222687, "rewards/reasoning_density_reward/mean": 0.45569194853305817, "rewards/reasoning_density_reward/std": 0.08190494403243065, "rewards/success_reward/mean": 2.765625, "rewards/success_reward/std": 0.5585084557533264, "rewards/trajectory_similarity_reward/mean": 0.6154681742191315, "rewards/trajectory_similarity_reward/std": 0.3004613220691681, "step": 447 }, { "clip_ratio/high_max": 0.01615492580458522, "clip_ratio/high_mean": 0.00408941249770578, "clip_ratio/low_mean": 0.000593816330365371, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004683228762587532, "entropy": 0.2995867058634758, "epoch": 0.3651553744268976, "grad_norm": 16.350112915039062, "learning_rate": 5.079054604726976e-07, "loss": 6.739, "reward": 3.0377413034439087, "reward_std": 1.461262285709381, "rewards/reasoning_density_reward/mean": 0.42500001192092896, "rewards/reasoning_density_reward/std": 0.10000000149011612, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.3275917768478394, "rewards/trajectory_similarity_reward/mean": 0.5502412617206573, "rewards/trajectory_similarity_reward/std": 0.4467519074678421, "step": 448 }, { "clip_ratio/high_max": 0.018074216321110725, "clip_ratio/high_mean": 0.0033549441141076386, "clip_ratio/low_mean": 0.0008262863120762631, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004181230455287732, "entropy": 0.32539360225200653, "epoch": 0.3659704533876719, "grad_norm": 13.567138671875, "learning_rate": 5.072534637326813e-07, "loss": 5.5459, "reward": 3.9046804904937744, "reward_std": 0.9940285682678223, "rewards/reasoning_density_reward/mean": 0.47232142090797424, "rewards/reasoning_density_reward/std": 0.07603592425584793, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 1.0246951580047607, "rewards/trajectory_similarity_reward/mean": 0.8073588609695435, "rewards/trajectory_similarity_reward/std": 0.3226054608821869, "step": 449 }, { "clip_ratio/high_max": 0.014277018141001463, "clip_ratio/high_mean": 0.004470846732147038, "clip_ratio/low_mean": 0.0010230026600765996, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005493849399499595, "entropy": 0.3605445884168148, "epoch": 0.36678553234844624, "grad_norm": 14.29770565032959, "learning_rate": 5.06601466992665e-07, "loss": 11.6442, "reward": 4.1000165939331055, "reward_std": 0.6011880934238434, "rewards/reasoning_density_reward/mean": 0.4567708373069763, "rewards/reasoning_density_reward/std": 0.11589448526501656, "rewards/success_reward/mean": 2.859375, "rewards/success_reward/std": 0.4436737895011902, "rewards/trajectory_similarity_reward/mean": 0.7838707566261292, "rewards/trajectory_similarity_reward/std": 0.29585686326026917, "step": 450 }, { "clip_ratio/high_max": 0.017386014806106687, "clip_ratio/high_mean": 0.004146655352087691, "clip_ratio/low_mean": 0.0013268925322336145, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005473547906149179, "entropy": 0.3646089732646942, "epoch": 0.36760061130922056, "grad_norm": 22.88274574279785, "learning_rate": 5.059494702526487e-07, "loss": 8.1348, "reward": 3.1531635522842407, "reward_std": 1.2951025366783142, "rewards/reasoning_density_reward/mean": 0.40312500298023224, "rewards/reasoning_density_reward/std": 0.11610807850956917, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 0.887150913476944, "rewards/trajectory_similarity_reward/mean": 0.5000386238098145, "rewards/trajectory_similarity_reward/std": 0.39717090129852295, "step": 451 }, { "clip_ratio/high_max": 0.01215717988088727, "clip_ratio/high_mean": 0.0025412592076463625, "clip_ratio/low_mean": 0.0015020245700725354, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004043283734063152, "entropy": 0.34296469762921333, "epoch": 0.36841569026999493, "grad_norm": 15.33232307434082, "learning_rate": 5.052974735126324e-07, "loss": 0.606, "reward": 2.6935296058654785, "reward_std": 1.5624797344207764, "rewards/reasoning_density_reward/mean": 0.3916666507720947, "rewards/reasoning_density_reward/std": 0.0992564931511879, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.3964240550994873, "rewards/trajectory_similarity_reward/mean": 0.4268629550933838, "rewards/trajectory_similarity_reward/std": 0.39323240518569946, "step": 452 }, { "clip_ratio/high_max": 0.014375988277606666, "clip_ratio/high_mean": 0.003515842108754441, "clip_ratio/low_mean": 0.0008386515983147547, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004354493779828772, "entropy": 0.3361155055463314, "epoch": 0.36923076923076925, "grad_norm": 21.11935806274414, "learning_rate": 5.046454767726161e-07, "loss": -10.5887, "reward": 2.9657286405563354, "reward_std": 1.5702468156814575, "rewards/reasoning_density_reward/mean": 0.41979166865348816, "rewards/reasoning_density_reward/std": 0.10017330944538116, "rewards/success_reward/mean": 2.015625, "rewards/success_reward/std": 1.3736594319343567, "rewards/trajectory_similarity_reward/mean": 0.5303119421005249, "rewards/trajectory_similarity_reward/std": 0.4267829954624176, "step": 453 }, { "clip_ratio/high_max": 0.016019224014598876, "clip_ratio/high_mean": 0.003149294134345837, "clip_ratio/low_mean": 0.0006764979880244937, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0038257920678006485, "entropy": 0.356791615486145, "epoch": 0.37004584819154357, "grad_norm": 18.270238876342773, "learning_rate": 5.039934800325998e-07, "loss": 3.4092, "reward": 2.069830894470215, "reward_std": 1.6504545211791992, "rewards/reasoning_density_reward/mean": 0.33690476417541504, "rewards/reasoning_density_reward/std": 0.07355562597513199, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.42042601108551025, "rewards/trajectory_similarity_reward/std": 0.4950962960720062, "step": 454 }, { "clip_ratio/high_max": 0.010287661018082872, "clip_ratio/high_mean": 0.0023239691108756233, "clip_ratio/low_mean": 0.0011386579935788177, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034626270571607165, "entropy": 0.380761057138443, "epoch": 0.3708609271523179, "grad_norm": 11.042998313903809, "learning_rate": 5.033414832925835e-07, "loss": -9.6461, "reward": 2.8342089653015137, "reward_std": 0.7279172837734222, "rewards/reasoning_density_reward/mean": 0.31047388911247253, "rewards/reasoning_density_reward/std": 0.21406981348991394, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.3620079159736633, "rewards/trajectory_similarity_reward/mean": 0.5549850463867188, "rewards/trajectory_similarity_reward/std": 0.49791738390922546, "step": 455 }, { "clip_ratio/high_max": 0.011750632256735116, "clip_ratio/high_mean": 0.0024727883937885053, "clip_ratio/low_mean": 0.0005106340286147315, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0029834224114893004, "entropy": 0.35264209657907486, "epoch": 0.3716760061130922, "grad_norm": 14.226058959960938, "learning_rate": 5.026894865525672e-07, "loss": 9.9543, "reward": 3.9917964935302734, "reward_std": 0.5351912379264832, "rewards/reasoning_density_reward/mean": 0.4556547701358795, "rewards/reasoning_density_reward/std": 0.0803002417087555, "rewards/success_reward/mean": 2.8125, "rewards/success_reward/std": 0.5123475790023804, "rewards/trajectory_similarity_reward/mean": 0.7236416339874268, "rewards/trajectory_similarity_reward/std": 0.3563465476036072, "step": 456 }, { "clip_ratio/high_max": 0.015502845024457201, "clip_ratio/high_mean": 0.002856289367628051, "clip_ratio/low_mean": 0.0008246269135270268, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0036809162702411413, "entropy": 0.3474475219845772, "epoch": 0.3724910850738665, "grad_norm": 14.30775260925293, "learning_rate": 5.020374898125509e-07, "loss": 3.9667, "reward": 2.9677820205688477, "reward_std": 1.6293488144874573, "rewards/reasoning_density_reward/mean": 0.3594494014978409, "rewards/reasoning_density_reward/std": 0.16046832501888275, "rewards/success_reward/mean": 2.109375, "rewards/success_reward/std": 1.2672818303108215, "rewards/trajectory_similarity_reward/mean": 0.49895772337913513, "rewards/trajectory_similarity_reward/std": 0.4219892770051956, "step": 457 }, { "clip_ratio/high_max": 0.01121936904382892, "clip_ratio/high_mean": 0.002499936021195026, "clip_ratio/low_mean": 0.0018755692181002814, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004375505275675096, "entropy": 0.3633809760212898, "epoch": 0.37330616403464084, "grad_norm": 18.578161239624023, "learning_rate": 5.013854930725346e-07, "loss": 5.8895, "reward": 1.6777474880218506, "reward_std": 1.6945998668670654, "rewards/reasoning_density_reward/mean": 0.2790178656578064, "rewards/reasoning_density_reward/std": 0.18065394461154938, "rewards/success_reward/mean": 1.125, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.2737295925617218, "rewards/trajectory_similarity_reward/std": 0.42031019926071167, "step": 458 }, { "clip_ratio/high_max": 0.015746321296319366, "clip_ratio/high_mean": 0.0035939000954385847, "clip_ratio/low_mean": 0.0008543201256543398, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004448220250196755, "entropy": 0.3342536427080631, "epoch": 0.37412124299541516, "grad_norm": 13.967423439025879, "learning_rate": 5.007334963325183e-07, "loss": 1.0607, "reward": 3.4557063579559326, "reward_std": 1.489150881767273, "rewards/reasoning_density_reward/mean": 0.4244047701358795, "rewards/reasoning_density_reward/std": 0.09192449599504471, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.5938016176223755, "rewards/trajectory_similarity_reward/std": 0.3688480854034424, "step": 459 }, { "clip_ratio/high_max": 0.015025097352918237, "clip_ratio/high_mean": 0.0033085328541346826, "clip_ratio/low_mean": 0.001332183506747242, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004640716317226179, "entropy": 0.3201288916170597, "epoch": 0.37493632195618953, "grad_norm": 14.060038566589355, "learning_rate": 5.000814995925021e-07, "loss": 5.2675, "reward": 3.095360517501831, "reward_std": 0.558190643787384, "rewards/reasoning_density_reward/mean": 0.35729169845581055, "rewards/reasoning_density_reward/std": 0.0778694897890091, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 0.7685213088989258, "rewards/trajectory_similarity_reward/mean": 0.39431899785995483, "rewards/trajectory_similarity_reward/std": 0.39283591508865356, "step": 460 }, { "clip_ratio/high_max": 0.007601545832585543, "clip_ratio/high_mean": 0.0015632414797437377, "clip_ratio/low_mean": 0.0012297478970140219, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002792989409499569, "entropy": 0.33973727747797966, "epoch": 0.37575140091696385, "grad_norm": 13.638519287109375, "learning_rate": 4.994295028524857e-07, "loss": -1.2902, "reward": 2.2552289962768555, "reward_std": 1.2646613121032715, "rewards/reasoning_density_reward/mean": 0.3586805760860443, "rewards/reasoning_density_reward/std": 0.08063453435897827, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.3930631875991821, "rewards/trajectory_similarity_reward/mean": 0.30279844999313354, "rewards/trajectory_similarity_reward/std": 0.3704984784126282, "step": 461 }, { "clip_ratio/high_max": 0.010259742906782776, "clip_ratio/high_mean": 0.0020315194997237995, "clip_ratio/low_mean": 0.0016230941000685561, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0036546136252582073, "entropy": 0.3663959987461567, "epoch": 0.37656647987773817, "grad_norm": 14.480891227722168, "learning_rate": 4.987775061124695e-07, "loss": -8.4312, "reward": 2.860720634460449, "reward_std": 1.811141848564148, "rewards/reasoning_density_reward/mean": 0.3425843119621277, "rewards/reasoning_density_reward/std": 0.10107714682817459, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.4556361734867096, "rewards/trajectory_similarity_reward/std": 0.3905816674232483, "step": 462 }, { "clip_ratio/high_max": 0.020169397233985364, "clip_ratio/high_mean": 0.005022701050620526, "clip_ratio/low_mean": 0.000425591704697581, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005448292737128213, "entropy": 0.37075917795300484, "epoch": 0.3773815588385125, "grad_norm": 13.623260498046875, "learning_rate": 4.981255093724531e-07, "loss": 6.123, "reward": 3.525747776031494, "reward_std": 1.7327780723571777, "rewards/reasoning_density_reward/mean": 0.35865575075149536, "rewards/reasoning_density_reward/std": 0.18906356394290924, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.7295923233032227, "rewards/trajectory_similarity_reward/std": 0.3802027106285095, "step": 463 }, { "clip_ratio/high_max": 0.010869227757211775, "clip_ratio/high_mean": 0.0028955036541447043, "clip_ratio/low_mean": 0.00042479309195186943, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003320296855235938, "entropy": 0.35434890165925026, "epoch": 0.3781966377992868, "grad_norm": 12.067054748535156, "learning_rate": 4.974735126324369e-07, "loss": 5.2599, "reward": 1.7668181657791138, "reward_std": 0.9604188799858093, "rewards/reasoning_density_reward/mean": 0.32230114936828613, "rewards/reasoning_density_reward/std": 0.14030225574970245, "rewards/success_reward/mean": 1.125, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.31951725482940674, "rewards/trajectory_similarity_reward/std": 0.4325644075870514, "step": 464 }, { "clip_ratio/high_max": 0.010628973162965849, "clip_ratio/high_mean": 0.0019038558202737477, "clip_ratio/low_mean": 0.0004041413394588744, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023079971579136327, "entropy": 0.37616974860429764, "epoch": 0.3790117167600611, "grad_norm": 12.440718650817871, "learning_rate": 4.968215158924205e-07, "loss": -2.2839, "reward": 3.530062437057495, "reward_std": 0.813005119562149, "rewards/reasoning_density_reward/mean": 0.37252604961395264, "rewards/reasoning_density_reward/std": 0.17561601102352142, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 1.0183849930763245, "rewards/trajectory_similarity_reward/mean": 0.6262864470481873, "rewards/trajectory_similarity_reward/std": 0.4095676988363266, "step": 465 }, { "clip_ratio/high_max": 0.012891936697997153, "clip_ratio/high_mean": 0.0041897857445292175, "clip_ratio/low_mean": 0.0005909209576202556, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004780706745805219, "entropy": 0.33172065019607544, "epoch": 0.37982679572083544, "grad_norm": 13.740821838378906, "learning_rate": 4.961695191524043e-07, "loss": 14.3011, "reward": 3.5464842319488525, "reward_std": 1.7280243635177612, "rewards/reasoning_density_reward/mean": 0.39531248807907104, "rewards/reasoning_density_reward/std": 0.18307985365390778, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.7136717438697815, "rewards/trajectory_similarity_reward/std": 0.3641922175884247, "step": 466 }, { "clip_ratio/high_max": 0.013971847190987319, "clip_ratio/high_mean": 0.002811038968502544, "clip_ratio/low_mean": 0.00046439794823527336, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003275436960393563, "entropy": 0.29960139468312263, "epoch": 0.38064187468160976, "grad_norm": 13.534332275390625, "learning_rate": 4.955175224123879e-07, "loss": 14.1833, "reward": 3.3140668869018555, "reward_std": 1.3521229326725006, "rewards/reasoning_density_reward/mean": 0.37207961082458496, "rewards/reasoning_density_reward/std": 0.15196441859006882, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.0534805357456207, "rewards/trajectory_similarity_reward/mean": 0.5982371866703033, "rewards/trajectory_similarity_reward/std": 0.40324388444423676, "step": 467 }, { "clip_ratio/high_max": 0.01050832457258366, "clip_ratio/high_mean": 0.0018309534425497986, "clip_ratio/low_mean": 0.0010748409731604625, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002905794397520367, "entropy": 0.3675881177186966, "epoch": 0.38145695364238413, "grad_norm": 14.082103729248047, "learning_rate": 4.948655256723716e-07, "loss": 14.5022, "reward": 1.9972357749938965, "reward_std": 0.5085702538490295, "rewards/reasoning_density_reward/mean": 0.2725570499897003, "rewards/reasoning_density_reward/std": 0.19556762278079987, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.496871829032898, "rewards/trajectory_similarity_reward/mean": 0.3184286653995514, "rewards/trajectory_similarity_reward/std": 0.3804556429386139, "step": 468 }, { "clip_ratio/high_max": 0.013333464215975255, "clip_ratio/high_mean": 0.0023877890707808547, "clip_ratio/low_mean": 0.00098134011568618, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003369129146449268, "entropy": 0.384434599429369, "epoch": 0.38227203260315845, "grad_norm": 10.689541816711426, "learning_rate": 4.942135289323553e-07, "loss": 10.7743, "reward": 2.3426883220672607, "reward_std": 0.5961531400680542, "rewards/reasoning_density_reward/mean": 0.28125, "rewards/reasoning_density_reward/std": 0.1911587417125702, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.37393811345100403, "rewards/trajectory_similarity_reward/std": 0.438458114862442, "step": 469 }, { "clip_ratio/high_max": 0.01457225129706785, "clip_ratio/high_mean": 0.002978812248329632, "clip_ratio/low_mean": 0.0012697187703452073, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0042485311278142035, "entropy": 0.34139225631952286, "epoch": 0.38308711156393277, "grad_norm": 12.41848087310791, "learning_rate": 4.93561532192339e-07, "loss": 8.105, "reward": 3.1796627044677734, "reward_std": 1.2831989526748657, "rewards/reasoning_density_reward/mean": 0.3828125, "rewards/reasoning_density_reward/std": 0.16898556053638458, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.5468502044677734, "rewards/trajectory_similarity_reward/std": 0.37848517298698425, "step": 470 }, { "clip_ratio/high_max": 0.008787360566202551, "clip_ratio/high_mean": 0.0022288494437816553, "clip_ratio/low_mean": 0.0011796417602454312, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003408491196751129, "entropy": 0.3484883941709995, "epoch": 0.3839021905247071, "grad_norm": 13.481637001037598, "learning_rate": 4.929095354523226e-07, "loss": 17.1927, "reward": 3.227114677429199, "reward_std": 1.6701622009277344, "rewards/reasoning_density_reward/mean": 0.41675347089767456, "rewards/reasoning_density_reward/std": 0.11137522757053375, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.5603610277175903, "rewards/trajectory_similarity_reward/std": 0.4394489526748657, "step": 471 }, { "clip_ratio/high_max": 0.010261313524097204, "clip_ratio/high_mean": 0.0025162681413348764, "clip_ratio/low_mean": 0.000646251741272863, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003162519948091358, "entropy": 0.3414890989661217, "epoch": 0.3847172694854814, "grad_norm": 15.081849098205566, "learning_rate": 4.922575387123064e-07, "loss": 3.883, "reward": 3.5143582820892334, "reward_std": 1.516853928565979, "rewards/reasoning_density_reward/mean": 0.42452652752399445, "rewards/reasoning_density_reward/std": 0.10196412727236748, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.003450870513916, "rewards/trajectory_similarity_reward/mean": 0.6523316502571106, "rewards/trajectory_similarity_reward/std": 0.43389151990413666, "step": 472 }, { "clip_ratio/high_max": 0.011484506714623421, "clip_ratio/high_mean": 0.0026691384919104166, "clip_ratio/low_mean": 0.0007856255979277194, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034547641917015426, "entropy": 0.3635590150952339, "epoch": 0.3855323484462557, "grad_norm": 14.765542984008789, "learning_rate": 4.9160554197229e-07, "loss": 13.63, "reward": 1.7569265365600586, "reward_std": 1.65617036819458, "rewards/reasoning_density_reward/mean": 0.31030505895614624, "rewards/reasoning_density_reward/std": 0.14066819846630096, "rewards/success_reward/mean": 1.21875, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.2278713881969452, "rewards/trajectory_similarity_reward/std": 0.34066668152809143, "step": 473 }, { "clip_ratio/high_max": 0.012734661810100079, "clip_ratio/high_mean": 0.002678433360415511, "clip_ratio/low_mean": 0.0009144859432126395, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0035929192963521928, "entropy": 0.3386392146348953, "epoch": 0.38634742740703004, "grad_norm": 17.49725914001465, "learning_rate": 4.909535452322738e-07, "loss": 10.8022, "reward": 2.1321335434913635, "reward_std": 1.8206160068511963, "rewards/reasoning_density_reward/mean": 0.3538690507411957, "rewards/reasoning_density_reward/std": 0.11639998108148575, "rewards/success_reward/mean": 1.453125, "rewards/success_reward/std": 1.4010097980499268, "rewards/trajectory_similarity_reward/mean": 0.32513948529958725, "rewards/trajectory_similarity_reward/std": 0.42003268003463745, "step": 474 }, { "clip_ratio/high_max": 0.014631036203354597, "clip_ratio/high_mean": 0.0034588017224450596, "clip_ratio/low_mean": 0.0012333783161011524, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0046921800676500425, "entropy": 0.3476466238498688, "epoch": 0.38716250636780436, "grad_norm": 11.962162971496582, "learning_rate": 4.903015484922575e-07, "loss": -9.7706, "reward": 2.0601162910461426, "reward_std": 1.6771550178527832, "rewards/reasoning_density_reward/mean": 0.34732142090797424, "rewards/reasoning_density_reward/std": 0.15469688177108765, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.40029484033584595, "rewards/trajectory_similarity_reward/std": 0.4724109470844269, "step": 475 }, { "clip_ratio/high_max": 0.012624181166756898, "clip_ratio/high_mean": 0.003079300186072942, "clip_ratio/low_mean": 0.0008828078753140289, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003962108006817289, "entropy": 0.3785488121211529, "epoch": 0.38797758532857873, "grad_norm": 12.672492980957031, "learning_rate": 4.896495517522412e-07, "loss": 3.7542, "step": 476 }, { "clip_ratio/high_max": 0.018854427034966648, "clip_ratio/high_mean": 0.004005238821264356, "clip_ratio/low_mean": 0.00037657546636182815, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00438181433128193, "entropy": 0.33739086613059044, "epoch": 0.38879266428935305, "grad_norm": 14.396166801452637, "learning_rate": 4.889975550122249e-07, "loss": 12.6224, "reward": 3.3972305059432983, "reward_std": 1.3170840740203857, "rewards/reasoning_density_reward/mean": 0.4033482074737549, "rewards/reasoning_density_reward/std": 0.1414262279868126, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2304179072380066, "rewards/trajectory_similarity_reward/mean": 0.6501322090625763, "rewards/trajectory_similarity_reward/std": 0.3593132048845291, "step": 477 }, { "clip_ratio/high_max": 0.011949582898523659, "clip_ratio/high_mean": 0.0027019541084882803, "clip_ratio/low_mean": 0.0006159931181173306, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0033179472520714626, "entropy": 0.33380117639899254, "epoch": 0.38960774325012737, "grad_norm": 15.95910930633545, "learning_rate": 4.883455582722086e-07, "loss": 11.9054, "reward": 2.5599923133850098, "reward_std": 0.9863919019699097, "rewards/reasoning_density_reward/mean": 0.41458335518836975, "rewards/reasoning_density_reward/std": 0.10034661740064621, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.27040916681289673, "rewards/trajectory_similarity_reward/std": 0.28621557354927063, "step": 478 }, { "clip_ratio/high_max": 0.014735537697561085, "clip_ratio/high_mean": 0.0031317793036578223, "clip_ratio/low_mean": 0.0005934365435678046, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003725215879967436, "entropy": 0.39829452708363533, "epoch": 0.3904228222109017, "grad_norm": 13.181927680969238, "learning_rate": 4.876935615321923e-07, "loss": 10.459, "reward": 3.000272035598755, "reward_std": 1.8360852003097534, "rewards/reasoning_density_reward/mean": 0.3321428596973419, "rewards/reasoning_density_reward/std": 0.20560917258262634, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.6056290864944458, "rewards/trajectory_similarity_reward/std": 0.43104928731918335, "step": 479 }, { "clip_ratio/high_max": 0.01049133948981762, "clip_ratio/high_mean": 0.0029120522376615554, "clip_ratio/low_mean": 0.00039119250868679956, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003303244724520482, "entropy": 0.35594894737005234, "epoch": 0.391237901171676, "grad_norm": 14.371100425720215, "learning_rate": 4.87041564792176e-07, "loss": -1.3094, "reward": 3.3211727142333984, "reward_std": 1.5434036254882812, "rewards/reasoning_density_reward/mean": 0.4145089238882065, "rewards/reasoning_density_reward/std": 0.09804923087358475, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.1514689326286316, "rewards/trajectory_similarity_reward/mean": 0.562913715839386, "rewards/trajectory_similarity_reward/std": 0.371689036488533, "step": 480 }, { "clip_ratio/high_max": 0.02468110283371061, "clip_ratio/high_mean": 0.006917935505043715, "clip_ratio/low_mean": 0.0010433810275571886, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.007961316558066756, "entropy": 0.3520287722349167, "epoch": 0.3920529801324503, "grad_norm": 14.618302345275879, "learning_rate": 4.863895680521597e-07, "loss": 2.3077, "reward": 3.964263439178467, "reward_std": 0.739411473274231, "rewards/reasoning_density_reward/mean": 0.4625000059604645, "rewards/reasoning_density_reward/std": 0.08062257617712021, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.6046693325042725, "rewards/trajectory_similarity_reward/mean": 0.7830134034156799, "rewards/trajectory_similarity_reward/std": 0.3940838575363159, "step": 481 }, { "clip_ratio/high_max": 0.011063479934819043, "clip_ratio/high_mean": 0.002974166229250841, "clip_ratio/low_mean": 0.0009101571558858268, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0038843235233798623, "entropy": 0.32974400371313095, "epoch": 0.39286805909322464, "grad_norm": 13.311914443969727, "learning_rate": 4.857375713121434e-07, "loss": 3.8686, "reward": 3.22121262550354, "reward_std": 1.3097589612007141, "rewards/reasoning_density_reward/mean": 0.4310096204280853, "rewards/reasoning_density_reward/std": 0.10827752202749252, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.3546693325042725, "rewards/trajectory_similarity_reward/mean": 0.6339532136917114, "rewards/trajectory_similarity_reward/std": 0.40220673382282257, "step": 482 }, { "clip_ratio/high_max": 0.010610443830955774, "clip_ratio/high_mean": 0.002354574688069988, "clip_ratio/low_mean": 0.0010656527992978226, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034202274109702557, "entropy": 0.3216451108455658, "epoch": 0.39368313805399896, "grad_norm": 12.532089233398438, "learning_rate": 4.850855745721271e-07, "loss": -5.6345, "reward": 3.6167731285095215, "reward_std": 1.3510048389434814, "rewards/reasoning_density_reward/mean": 0.4392856955528259, "rewards/reasoning_density_reward/std": 0.08798576891422272, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 0.9031196236610413, "rewards/trajectory_similarity_reward/mean": 0.6462373733520508, "rewards/trajectory_similarity_reward/std": 0.41103488206863403, "step": 483 }, { "clip_ratio/high_max": 0.016385454684495926, "clip_ratio/high_mean": 0.0040272485348396, "clip_ratio/low_mean": 0.000509477176819928, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004536725697107613, "entropy": 0.33791616186499596, "epoch": 0.39449821701477333, "grad_norm": 19.2721004486084, "learning_rate": 4.844335778321108e-07, "loss": 8.0805, "reward": 3.4442925453186035, "reward_std": 1.5424306392669678, "rewards/reasoning_density_reward/mean": 0.3812499940395355, "rewards/reasoning_density_reward/std": 0.1509077548980713, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.625542402267456, "rewards/trajectory_similarity_reward/std": 0.40579190850257874, "step": 484 }, { "clip_ratio/high_max": 0.011729467601981014, "clip_ratio/high_mean": 0.002674936084076762, "clip_ratio/low_mean": 0.0002960944730148185, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002971030553453602, "entropy": 0.3649710938334465, "epoch": 0.39531329597554765, "grad_norm": 14.512635231018066, "learning_rate": 4.837815810920945e-07, "loss": 7.877, "reward": 2.3704028129577637, "reward_std": 1.2274246215820312, "rewards/reasoning_density_reward/mean": 0.25580355525016785, "rewards/reasoning_density_reward/std": 0.2163899689912796, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.125, "rewards/trajectory_similarity_reward/mean": 0.3333492875099182, "rewards/trajectory_similarity_reward/std": 0.44917502999305725, "step": 485 }, { "clip_ratio/high_max": 0.0080645197595004, "clip_ratio/high_mean": 0.0021886271752009634, "clip_ratio/low_mean": 0.0006559529174410272, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002844580179953482, "entropy": 0.3525277338922024, "epoch": 0.39612837493632197, "grad_norm": 11.41243839263916, "learning_rate": 4.831295843520782e-07, "loss": -4.1236, "reward": 1.5394238233566284, "reward_std": 1.742397427558899, "rewards/reasoning_density_reward/mean": 0.3308035731315613, "rewards/reasoning_density_reward/std": 0.12739458680152893, "rewards/success_reward/mean": 0.9375, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.27112022042274475, "rewards/trajectory_similarity_reward/std": 0.4425753355026245, "step": 486 }, { "clip_ratio/high_max": 0.010421994549687952, "clip_ratio/high_mean": 0.002479012415278703, "clip_ratio/low_mean": 0.0011257119185756892, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003604724319302477, "entropy": 0.34504299983382225, "epoch": 0.3969434538970963, "grad_norm": 15.816049575805664, "learning_rate": 4.824775876120619e-07, "loss": 10.2945, "reward": 2.1173031330108643, "reward_std": 0.8171879053115845, "rewards/reasoning_density_reward/mean": 0.3552083373069763, "rewards/reasoning_density_reward/std": 0.14077214896678925, "rewards/success_reward/mean": 1.359375, "rewards/success_reward/std": 1.4665062427520752, "rewards/trajectory_similarity_reward/mean": 0.40271981060504913, "rewards/trajectory_similarity_reward/std": 0.5018279105424881, "step": 487 }, { "clip_ratio/high_max": 0.009501054359134287, "clip_ratio/high_mean": 0.0020637515699490905, "clip_ratio/low_mean": 0.0006322393383015878, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002695990915526636, "entropy": 0.3269799053668976, "epoch": 0.3977585328578706, "grad_norm": 15.600996971130371, "learning_rate": 4.818255908720457e-07, "loss": -0.466, "reward": 3.0882365703582764, "reward_std": 1.3919687271118164, "rewards/reasoning_density_reward/mean": 0.39905303716659546, "rewards/reasoning_density_reward/std": 0.11531338095664978, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.095445156097412, "rewards/trajectory_similarity_reward/mean": 0.4391835033893585, "rewards/trajectory_similarity_reward/std": 0.3934021294116974, "step": 488 }, { "clip_ratio/high_max": 0.010285026102792472, "clip_ratio/high_mean": 0.002734215115197003, "clip_ratio/low_mean": 0.00045202015462564304, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0031862352625466883, "entropy": 0.3798019401729107, "epoch": 0.3985736118186449, "grad_norm": 15.020301818847656, "learning_rate": 4.811735941320293e-07, "loss": -7.9619, "reward": 1.8539007902145386, "reward_std": 0.406984806060791, "rewards/reasoning_density_reward/mean": 0.19583332538604736, "rewards/reasoning_density_reward/std": 0.23629078269004822, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.496871829032898, "rewards/trajectory_similarity_reward/mean": 0.25181740522384644, "rewards/trajectory_similarity_reward/std": 0.305757999420166, "step": 489 }, { "clip_ratio/high_max": 0.004745533224195242, "clip_ratio/high_mean": 0.0011992491345154122, "clip_ratio/low_mean": 0.00047127827201620676, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0016705274138075765, "entropy": 0.35172802582383156, "epoch": 0.39938869077941924, "grad_norm": 13.86829948425293, "learning_rate": 4.805215973920131e-07, "loss": 12.1354, "reward": 1.9644945859909058, "reward_std": 1.9971860647201538, "rewards/reasoning_density_reward/mean": 0.31160712242126465, "rewards/reasoning_density_reward/std": 0.18530862033367157, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.3403873145580292, "rewards/trajectory_similarity_reward/std": 0.401991069316864, "step": 490 }, { "clip_ratio/high_max": 0.0066764490329660475, "clip_ratio/high_mean": 0.0016106557377497666, "clip_ratio/low_mean": 0.0011010901835106779, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0027117458812426776, "entropy": 0.38567282631993294, "epoch": 0.40020376974019356, "grad_norm": 13.033806800842285, "learning_rate": 4.798696006519967e-07, "loss": 13.8831, "reward": 3.227487564086914, "reward_std": 1.17528235912323, "rewards/reasoning_density_reward/mean": 0.296875, "rewards/reasoning_density_reward/std": 0.22983236610889435, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 0.9287087917327881, "rewards/trajectory_similarity_reward/mean": 0.49311256408691406, "rewards/trajectory_similarity_reward/std": 0.4367295801639557, "step": 491 }, { "clip_ratio/high_max": 0.011616300558671355, "clip_ratio/high_mean": 0.00251930917147547, "clip_ratio/low_mean": 0.0005029741369071417, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0030222833884181455, "entropy": 0.379605732858181, "epoch": 0.40101884870096793, "grad_norm": 13.431092262268066, "learning_rate": 4.792176039119805e-07, "loss": 3.6588, "reward": 1.7808400392532349, "reward_std": 1.6532752513885498, "rewards/reasoning_density_reward/mean": 0.2595841884613037, "rewards/reasoning_density_reward/std": 0.15857787430286407, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.3275917768478394, "rewards/trajectory_similarity_reward/mean": 0.20875580608844757, "rewards/trajectory_similarity_reward/std": 0.33775827288627625, "step": 492 }, { "clip_ratio/high_max": 0.009293011506088078, "clip_ratio/high_mean": 0.0020591338688973337, "clip_ratio/low_mean": 0.0007191354561655317, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002778269350528717, "entropy": 0.3478131555020809, "epoch": 0.40183392766174225, "grad_norm": 15.707266807556152, "learning_rate": 4.785656071719641e-07, "loss": 3.7565, "reward": 3.7303237915039062, "reward_std": 1.399117350578308, "rewards/reasoning_density_reward/mean": 0.43619123101234436, "rewards/reasoning_density_reward/std": 0.10448447614908218, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 1.0246951580047607, "rewards/trajectory_similarity_reward/mean": 0.6691325902938843, "rewards/trajectory_similarity_reward/std": 0.2946275472640991, "step": 493 }, { "clip_ratio/high_max": 0.013104009412927553, "clip_ratio/high_mean": 0.0031532491229882, "clip_ratio/low_mean": 0.0006131568006821908, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037664059309463482, "entropy": 0.35025518387556076, "epoch": 0.40264900662251657, "grad_norm": 11.488773345947266, "learning_rate": 4.779136104319479e-07, "loss": 5.0704, "reward": 1.8931057453155518, "reward_std": 1.0905752182006836, "rewards/reasoning_density_reward/mean": 0.20520833134651184, "rewards/reasoning_density_reward/std": 0.12141836434602737, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.3930631875991821, "rewards/trajectory_similarity_reward/mean": 0.2816474139690399, "rewards/trajectory_similarity_reward/std": 0.3957667946815491, "step": 494 }, { "clip_ratio/high_max": 0.017340025631710887, "clip_ratio/high_mean": 0.003420960609219037, "clip_ratio/low_mean": 0.0008929097093641758, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0043138703622389585, "entropy": 0.34466954320669174, "epoch": 0.4034640855832909, "grad_norm": 11.632669448852539, "learning_rate": 4.772616136919315e-07, "loss": -0.1723, "reward": 3.259619951248169, "reward_std": 0.8277856111526489, "rewards/reasoning_density_reward/mean": 0.36250001192092896, "rewards/reasoning_density_reward/std": 0.18705560266971588, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 0.9437293410301208, "rewards/trajectory_similarity_reward/mean": 0.5533697605133057, "rewards/trajectory_similarity_reward/std": 0.4561977982521057, "step": 495 }, { "clip_ratio/high_max": 0.010782771918457001, "clip_ratio/high_mean": 0.002521158574381843, "clip_ratio/low_mean": 0.0016861112671904266, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0042072698706761, "entropy": 0.3759507089853287, "epoch": 0.4042791645440652, "grad_norm": 14.96009349822998, "learning_rate": 4.7660961695191523e-07, "loss": 9.8927, "reward": 2.914475917816162, "reward_std": 1.6394028663635254, "rewards/reasoning_density_reward/mean": 0.32343751192092896, "rewards/reasoning_density_reward/std": 0.17122988402843475, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.4347882568836212, "rewards/trajectory_similarity_reward/std": 0.41211023926734924, "step": 496 }, { "clip_ratio/high_max": 0.012218077084980905, "clip_ratio/high_mean": 0.0023380992424790747, "clip_ratio/low_mean": 0.0010054604899778496, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0033435597069910727, "entropy": 0.3809337578713894, "epoch": 0.4050942435048395, "grad_norm": 14.660904884338379, "learning_rate": 4.759576202118989e-07, "loss": 8.5528, "reward": 2.8907525539398193, "reward_std": 1.168431043624878, "rewards/reasoning_density_reward/mean": 0.2941964268684387, "rewards/reasoning_density_reward/std": 0.19812418520450592, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.5340563058853149, "rewards/trajectory_similarity_reward/std": 0.40729495882987976, "step": 497 }, { "clip_ratio/high_max": 0.012136504810769111, "clip_ratio/high_mean": 0.0023361435014521703, "clip_ratio/low_mean": 0.0003718973894137889, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0027080408908659592, "entropy": 0.35607078298926353, "epoch": 0.40590932246561384, "grad_norm": 13.025666236877441, "learning_rate": 4.7530562347188263e-07, "loss": 1.3481, "reward": 2.4856910705566406, "reward_std": 1.3770813345909119, "rewards/reasoning_density_reward/mean": 0.36377108097076416, "rewards/reasoning_density_reward/std": 0.10984104126691818, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.1831679940223694, "rewards/trajectory_similarity_reward/mean": 0.4344199448823929, "rewards/trajectory_similarity_reward/std": 0.2972468137741089, "step": 498 }, { "clip_ratio/high_max": 0.009777579398360103, "clip_ratio/high_mean": 0.002402921461907681, "clip_ratio/low_mean": 0.0017003415268845856, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004103262945136521, "entropy": 0.34342237189412117, "epoch": 0.40672440142638816, "grad_norm": 12.792586326599121, "learning_rate": 4.746536267318663e-07, "loss": 3.5864, "reward": 4.079152584075928, "reward_std": 0.7632679343223572, "rewards/reasoning_density_reward/mean": 0.47708332538604736, "rewards/reasoning_density_reward/std": 0.06291528046131134, "rewards/success_reward/mean": 2.8125, "rewards/success_reward/std": 0.75, "rewards/trajectory_similarity_reward/mean": 0.7895692586898804, "rewards/trajectory_similarity_reward/std": 0.2169470340013504, "step": 499 }, { "clip_ratio/high_max": 0.018558662268333137, "clip_ratio/high_mean": 0.004123319929931313, "clip_ratio/low_mean": 3.729117088369094e-05, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0041606111044529825, "entropy": 0.372320294380188, "epoch": 0.40753948038716253, "grad_norm": 11.227566719055176, "learning_rate": 4.7400162999185003e-07, "loss": -0.0847, "reward": 2.410396099090576, "reward_std": 1.7185909748077393, "rewards/reasoning_density_reward/mean": 0.21820437908172607, "rewards/reasoning_density_reward/std": 0.17990262806415558, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.365878939628601, "rewards/trajectory_similarity_reward/mean": 0.41094183921813965, "rewards/trajectory_similarity_reward/std": 0.43298661708831787, "step": 500 }, { "clip_ratio/high_max": 0.01600010716356337, "clip_ratio/high_mean": 0.002977501164423302, "clip_ratio/low_mean": 0.000954486669797916, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00393198779784143, "entropy": 0.37316714227199554, "epoch": 0.40835455934793685, "grad_norm": 11.111660957336426, "learning_rate": 4.733496332518337e-07, "loss": 1.1606, "reward": 3.386606216430664, "reward_std": 1.0417474508285522, "rewards/reasoning_density_reward/mean": 0.3686259984970093, "rewards/reasoning_density_reward/std": 0.17984575033187866, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.5804798603057861, "rewards/trajectory_similarity_reward/std": 0.3208852708339691, "step": 501 }, { "clip_ratio/high_max": 0.01587410329375416, "clip_ratio/high_mean": 0.0042424327693879604, "clip_ratio/low_mean": 0.0009752034166012891, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005217636207817122, "entropy": 0.35647206753492355, "epoch": 0.40916963830871117, "grad_norm": 16.41750144958496, "learning_rate": 4.7269763651181743e-07, "loss": 12.2643, "reward": 3.66679310798645, "reward_std": 1.4251022338867188, "rewards/reasoning_density_reward/mean": 0.3046131134033203, "rewards/reasoning_density_reward/std": 0.19150410592556, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 1.0246951580047607, "rewards/trajectory_similarity_reward/mean": 0.7371799945831299, "rewards/trajectory_similarity_reward/std": 0.3274347484111786, "step": 502 }, { "clip_ratio/high_max": 0.017415348498616368, "clip_ratio/high_mean": 0.004997735770302825, "clip_ratio/low_mean": 0.0005234523196122609, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005521188097191043, "entropy": 0.36076869815588, "epoch": 0.4099847172694855, "grad_norm": 13.684093475341797, "learning_rate": 4.720456397718012e-07, "loss": -8.0413, "reward": 2.066368341445923, "reward_std": 1.686880350112915, "rewards/reasoning_density_reward/mean": 0.35357144474983215, "rewards/reasoning_density_reward/std": 0.09162182360887527, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.3930631875991821, "rewards/trajectory_similarity_reward/mean": 0.3065469264984131, "rewards/trajectory_similarity_reward/std": 0.4297935664653778, "step": 503 }, { "clip_ratio/high_max": 0.014402464381419122, "clip_ratio/high_mean": 0.00244979726994643, "clip_ratio/low_mean": 0.0010121542218257673, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034619515281519853, "entropy": 0.3553940989077091, "epoch": 0.4107997962302598, "grad_norm": 15.47885513305664, "learning_rate": 4.713936430317848e-07, "loss": -1.6984, "reward": 2.53973126411438, "reward_std": 0.8231101036071777, "rewards/reasoning_density_reward/mean": 0.29405438899993896, "rewards/reasoning_density_reward/std": 0.16592639684677124, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.4644269049167633, "rewards/trajectory_similarity_reward/std": 0.4336436688899994, "step": 504 }, { "clip_ratio/high_max": 0.009813518903683871, "clip_ratio/high_mean": 0.002530524638132192, "clip_ratio/low_mean": 0.0008508191494911443, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003381343820365146, "entropy": 0.3437667712569237, "epoch": 0.4116148751910341, "grad_norm": 14.08478832244873, "learning_rate": 4.707416462917686e-07, "loss": 2.6492, "reward": 3.044487714767456, "reward_std": 1.493701696395874, "rewards/reasoning_density_reward/mean": 0.39866071939468384, "rewards/reasoning_density_reward/std": 0.11641523987054825, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.095445156097412, "rewards/trajectory_similarity_reward/mean": 0.39582693576812744, "rewards/trajectory_similarity_reward/std": 0.3586243689060211, "step": 505 }, { "clip_ratio/high_max": 0.016191848262678832, "clip_ratio/high_mean": 0.0035015502653550357, "clip_ratio/low_mean": 0.0008953251654020278, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004396875418024138, "entropy": 0.35720810666680336, "epoch": 0.41242995415180844, "grad_norm": 17.821170806884766, "learning_rate": 4.700896495517522e-07, "loss": 12.0818, "reward": 3.670817017555237, "reward_std": 0.9402625635266304, "rewards/reasoning_density_reward/mean": 0.3655133992433548, "rewards/reasoning_density_reward/std": 0.15383101627230644, "rewards/success_reward/mean": 2.671875, "rewards/success_reward/std": 0.6104557514190674, "rewards/trajectory_similarity_reward/mean": 0.6334284245967865, "rewards/trajectory_similarity_reward/std": 0.2859291508793831, "step": 506 }, { "clip_ratio/high_max": 0.013381588039919734, "clip_ratio/high_mean": 0.002383434126386419, "clip_ratio/low_mean": 0.0008309929326060228, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0032144270080607384, "entropy": 0.36148877441883087, "epoch": 0.41324503311258276, "grad_norm": 13.540403366088867, "learning_rate": 4.694376528117359e-07, "loss": 19.427, "reward": 2.2720131874084473, "reward_std": 1.4018887281417847, "rewards/reasoning_density_reward/mean": 0.22075892984867096, "rewards/reasoning_density_reward/std": 0.19655285775661469, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 0.9826622009277344, "rewards/trajectory_similarity_reward/mean": 0.2700043320655823, "rewards/trajectory_similarity_reward/std": 0.4156396687030792, "step": 507 }, { "clip_ratio/high_max": 0.006156275398097932, "clip_ratio/high_mean": 0.0008995013922685757, "clip_ratio/low_mean": 0.0013373387919273227, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0022368401841958985, "entropy": 0.39309730753302574, "epoch": 0.41406011207335713, "grad_norm": 12.89919376373291, "learning_rate": 4.687856560717196e-07, "loss": 14.3382, "step": 508 }, { "clip_ratio/high_max": 0.013227089366409928, "clip_ratio/high_mean": 0.0033233101639780216, "clip_ratio/low_mean": 0.000907919598830631, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004231229751894716, "entropy": 0.3666338697075844, "epoch": 0.41487519103413145, "grad_norm": 15.610618591308594, "learning_rate": 4.681336593317033e-07, "loss": 4.6123, "reward": 3.1357197761535645, "reward_std": 1.4599223136901855, "rewards/reasoning_density_reward/mean": 0.22741815447807312, "rewards/reasoning_density_reward/std": 0.17491582036018372, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.5645516514778137, "rewards/trajectory_similarity_reward/std": 0.38172462582588196, "step": 509 }, { "clip_ratio/high_max": 0.015258911589626223, "clip_ratio/high_mean": 0.002520437141356524, "clip_ratio/low_mean": 0.0016048886427597608, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004125325809582137, "entropy": 0.35400425270199776, "epoch": 0.41569026999490577, "grad_norm": 11.151272773742676, "learning_rate": 4.6748166259168697e-07, "loss": 14.8141, "reward": 2.370922327041626, "reward_std": 1.888455867767334, "rewards/reasoning_density_reward/mean": 0.20892858505249023, "rewards/reasoning_density_reward/std": 0.20719940960407257, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.365878939628601, "rewards/trajectory_similarity_reward/mean": 0.38074374198913574, "rewards/trajectory_similarity_reward/std": 0.41877254843711853, "step": 510 }, { "clip_ratio/high_max": 0.01007988560013473, "clip_ratio/high_mean": 0.0020576538663590327, "clip_ratio/low_mean": 0.00042316358667449094, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0024808173766359687, "entropy": 0.37490418180823326, "epoch": 0.4165053489556801, "grad_norm": 10.841303825378418, "learning_rate": 4.668296658516707e-07, "loss": 13.7843, "reward": 2.663649559020996, "reward_std": 1.324288010597229, "rewards/reasoning_density_reward/mean": 0.28511905670166016, "rewards/reasoning_density_reward/std": 0.16349013149738312, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 0.75, "rewards/trajectory_similarity_reward/mean": 0.3160305321216583, "rewards/trajectory_similarity_reward/std": 0.42496946454048157, "step": 511 }, { "clip_ratio/high_max": 0.010184576793108135, "clip_ratio/high_mean": 0.0020026810016133823, "clip_ratio/low_mean": 0.0006363765169226099, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002639057536725886, "entropy": 0.37049003690481186, "epoch": 0.4173204279164544, "grad_norm": 13.437580108642578, "learning_rate": 4.6617766911165437e-07, "loss": 2.5393, "reward": 2.490358829498291, "reward_std": 2.0015101432800293, "rewards/reasoning_density_reward/mean": 0.33281248807907104, "rewards/reasoning_density_reward/std": 0.18495416641235352, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.47004640102386475, "rewards/trajectory_similarity_reward/std": 0.4306672513484955, "step": 512 }, { "clip_ratio/high_max": 0.012184657214675099, "clip_ratio/high_mean": 0.002710381377255544, "clip_ratio/low_mean": 0.0004000717235612683, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003110453166300431, "entropy": 0.36535100266337395, "epoch": 0.4181355068772287, "grad_norm": 15.003134727478027, "learning_rate": 4.655256723716381e-07, "loss": 9.8286, "reward": 3.2388362884521484, "reward_std": 1.558246374130249, "rewards/reasoning_density_reward/mean": 0.3552049398422241, "rewards/reasoning_density_reward/std": 0.12199123203754425, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.0911576747894287, "rewards/trajectory_similarity_reward/mean": 0.5398813486099243, "rewards/trajectory_similarity_reward/std": 0.3823543190956116, "step": 513 }, { "clip_ratio/high_max": 0.017717924085445702, "clip_ratio/high_mean": 0.004682320810388774, "clip_ratio/low_mean": 0.00022521716164192185, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004907537950202823, "entropy": 0.3386145308613777, "epoch": 0.41895058583800304, "grad_norm": 27.082008361816406, "learning_rate": 4.6487367563162177e-07, "loss": 9.1953, "reward": 3.4513585567474365, "reward_std": 1.601713240146637, "rewards/reasoning_density_reward/mean": 0.3648437261581421, "rewards/reasoning_density_reward/std": 0.18978141993284225, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.1385715007781982, "rewards/trajectory_similarity_reward/mean": 0.6490147411823273, "rewards/trajectory_similarity_reward/std": 0.3663603663444519, "step": 514 }, { "clip_ratio/high_max": 0.015624397492501885, "clip_ratio/high_mean": 0.0032097555449581705, "clip_ratio/low_mean": 0.0012433632364263758, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004453118817764334, "entropy": 0.3136196695268154, "epoch": 0.41976566479877736, "grad_norm": 17.27784538269043, "learning_rate": 4.642216788916055e-07, "loss": 7.9512, "reward": 3.5049288272857666, "reward_std": 1.1191045045852661, "rewards/reasoning_density_reward/mean": 0.41290920972824097, "rewards/reasoning_density_reward/std": 0.10470545291900635, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.6545194387435913, "rewards/trajectory_similarity_reward/std": 0.36359885334968567, "step": 515 }, { "clip_ratio/high_max": 0.015369357308372855, "clip_ratio/high_mean": 0.0028148368874099106, "clip_ratio/low_mean": 0.0009584963809174951, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037733332574134693, "entropy": 0.30800891667604446, "epoch": 0.42058074375955173, "grad_norm": 16.777786254882812, "learning_rate": 4.6356968215158917e-07, "loss": 13.142, "reward": 3.554172992706299, "reward_std": 0.9482600092887878, "rewards/reasoning_density_reward/mean": 0.3583333492279053, "rewards/reasoning_density_reward/std": 0.15599144995212555, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 0.9031196236610413, "rewards/trajectory_similarity_reward/mean": 0.6645898222923279, "rewards/trajectory_similarity_reward/std": 0.41194695234298706, "step": 516 }, { "clip_ratio/high_max": 0.016103650734294206, "clip_ratio/high_mean": 0.003636309069406707, "clip_ratio/low_mean": 0.0008670585666550323, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004503367585130036, "entropy": 0.33045126125216484, "epoch": 0.42139582272032605, "grad_norm": 17.89801025390625, "learning_rate": 4.629176854115729e-07, "loss": 4.2956, "reward": 3.6924058198928833, "reward_std": 0.9951230883598328, "rewards/reasoning_density_reward/mean": 0.4345982074737549, "rewards/reasoning_density_reward/std": 0.10271388664841652, "rewards/success_reward/mean": 2.578125, "rewards/success_reward/std": 1.0404633283615112, "rewards/trajectory_similarity_reward/mean": 0.6796825528144836, "rewards/trajectory_similarity_reward/std": 0.3362419158220291, "step": 517 }, { "clip_ratio/high_max": 0.016062470735050738, "clip_ratio/high_mean": 0.004686308020609431, "clip_ratio/low_mean": 0.0009591251109668519, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005645433077006601, "entropy": 0.34231340140104294, "epoch": 0.42221090168110037, "grad_norm": 12.778525352478027, "learning_rate": 4.622656886715567e-07, "loss": 3.9089, "reward": 3.0629982948303223, "reward_std": 0.11767183989286423, "rewards/reasoning_density_reward/mean": 0.34527814388275146, "rewards/reasoning_density_reward/std": 0.18489566445350647, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 0.7745966911315918, "rewards/trajectory_similarity_reward/mean": 0.4677203297615051, "rewards/trajectory_similarity_reward/std": 0.48778823018074036, "step": 518 }, { "clip_ratio/high_max": 0.012547614867798984, "clip_ratio/high_mean": 0.003093306062510237, "clip_ratio/low_mean": 0.0004829472927667666, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0035762533079832792, "entropy": 0.35157372429966927, "epoch": 0.4230259806418747, "grad_norm": 11.583396911621094, "learning_rate": 4.616136919315403e-07, "loss": 7.4698, "reward": 2.969721794128418, "reward_std": 1.7278835773468018, "rewards/reasoning_density_reward/mean": 0.3641369044780731, "rewards/reasoning_density_reward/std": 0.14234158396720886, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.5430850386619568, "rewards/trajectory_similarity_reward/std": 0.4182828962802887, "step": 519 }, { "clip_ratio/high_max": 0.010596317413728684, "clip_ratio/high_mean": 0.0025483311983407475, "clip_ratio/low_mean": 0.0008007773067220114, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0033491084905108437, "entropy": 0.3469214476644993, "epoch": 0.423841059602649, "grad_norm": 12.69218921661377, "learning_rate": 4.609616951915241e-07, "loss": 3.3083, "reward": 1.344286322593689, "reward_std": 1.4673547744750977, "rewards/reasoning_density_reward/mean": 0.17049852013587952, "rewards/reasoning_density_reward/std": 0.160594180226326, "rewards/success_reward/mean": 0.9375, "rewards/success_reward/std": 1.3275917768478394, "rewards/trajectory_similarity_reward/mean": 0.23628786206245422, "rewards/trajectory_similarity_reward/std": 0.4229174554347992, "step": 520 }, { "clip_ratio/high_max": 0.006852902006357908, "clip_ratio/high_mean": 0.001356354376184754, "clip_ratio/low_mean": 0.0013318317833181936, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0026881861849687994, "entropy": 0.3465284891426563, "epoch": 0.4246561385634233, "grad_norm": 10.947225570678711, "learning_rate": 4.603096984515077e-07, "loss": 7.9354, "reward": 2.9568943977355957, "reward_std": 1.7531211376190186, "rewards/reasoning_density_reward/mean": 0.3812500238418579, "rewards/reasoning_density_reward/std": 0.13149777054786682, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.5131444931030273, "rewards/trajectory_similarity_reward/std": 0.4708292782306671, "step": 521 }, { "clip_ratio/high_max": 0.01413861638866365, "clip_ratio/high_mean": 0.0035338387824594975, "clip_ratio/low_mean": 0.0013539091887651011, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004887748073088005, "entropy": 0.339506097137928, "epoch": 0.42547121752419764, "grad_norm": 16.6993408203125, "learning_rate": 4.596577017114915e-07, "loss": 13.1525, "reward": 3.4503250122070312, "reward_std": 1.7051410675048828, "rewards/reasoning_density_reward/mean": 0.3369791507720947, "rewards/reasoning_density_reward/std": 0.16555096209049225, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.675845742225647, "rewards/trajectory_similarity_reward/std": 0.3849598467350006, "step": 522 }, { "clip_ratio/high_max": 0.014190021611284465, "clip_ratio/high_mean": 0.003308204664790537, "clip_ratio/low_mean": 0.0005524381049326621, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003860642740619369, "entropy": 0.3696663975715637, "epoch": 0.42628629648497196, "grad_norm": 11.99974536895752, "learning_rate": 4.590057049714751e-07, "loss": 12.0626, "reward": 2.7304906845092773, "reward_std": 1.8709884881973267, "rewards/reasoning_density_reward/mean": 0.27842262387275696, "rewards/reasoning_density_reward/std": 0.17635871469974518, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.3098187446594238, "rewards/trajectory_similarity_reward/mean": 0.4833182394504547, "rewards/trajectory_similarity_reward/std": 0.45016905665397644, "step": 523 }, { "clip_ratio/high_max": 0.01276568864705041, "clip_ratio/high_mean": 0.002504027637769468, "clip_ratio/low_mean": 0.0010011243430199102, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003505151951685548, "entropy": 0.33755313232541084, "epoch": 0.42710137544574633, "grad_norm": 12.194852828979492, "learning_rate": 4.583537082314588e-07, "loss": 12.9509, "reward": 3.722179412841797, "reward_std": 0.8115052580833435, "rewards/reasoning_density_reward/mean": 0.3645833432674408, "rewards/reasoning_density_reward/std": 0.17689451575279236, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.6046693325042725, "rewards/trajectory_similarity_reward/mean": 0.638846218585968, "rewards/trajectory_similarity_reward/std": 0.43467217683792114, "step": 524 }, { "clip_ratio/high_max": 0.012234905268996954, "clip_ratio/high_mean": 0.0027670819181366824, "clip_ratio/low_mean": 0.0006039176842023153, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003370999576873146, "entropy": 0.37696387618780136, "epoch": 0.42791645440652065, "grad_norm": 13.701967239379883, "learning_rate": 4.577017114914425e-07, "loss": -2.0945, "reward": 1.3952381610870361, "reward_std": 1.703277587890625, "rewards/reasoning_density_reward/mean": 0.2699776887893677, "rewards/reasoning_density_reward/std": 0.11816918104887009, "rewards/success_reward/mean": 0.9375, "rewards/success_reward/std": 1.3275917768478394, "rewards/trajectory_similarity_reward/mean": 0.1877603679895401, "rewards/trajectory_similarity_reward/std": 0.33810609579086304, "step": 525 }, { "clip_ratio/high_max": 0.009606492036255077, "clip_ratio/high_mean": 0.0017105244660342578, "clip_ratio/low_mean": 0.0006456519331550226, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023561763809993863, "entropy": 0.3667714484035969, "epoch": 0.42873153336729497, "grad_norm": 11.172115325927734, "learning_rate": 4.570497147514262e-07, "loss": 0.9387, "reward": 2.102688789367676, "reward_std": 1.5174919366836548, "rewards/reasoning_density_reward/mean": 0.3096185028553009, "rewards/reasoning_density_reward/std": 0.14459028840065002, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.2930702269077301, "rewards/trajectory_similarity_reward/std": 0.4009018838405609, "step": 526 }, { "clip_ratio/high_max": 0.012952699733432382, "clip_ratio/high_mean": 0.002472080595907755, "clip_ratio/low_mean": 0.0012203296719235368, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003692410289659165, "entropy": 0.35280463472008705, "epoch": 0.4295466123280693, "grad_norm": 14.228363037109375, "learning_rate": 4.5639771801140987e-07, "loss": -2.1419, "reward": 2.6629457473754883, "reward_std": 1.9156620502471924, "rewards/reasoning_density_reward/mean": 0.34424716234207153, "rewards/reasoning_density_reward/std": 0.12192461639642715, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.3964240550994873, "rewards/trajectory_similarity_reward/mean": 0.4436986446380615, "rewards/trajectory_similarity_reward/std": 0.43277832865715027, "step": 527 }, { "clip_ratio/high_max": 0.01275290857302025, "clip_ratio/high_mean": 0.0028754032537108287, "clip_ratio/low_mean": 0.001114493039494846, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0039898961840663105, "entropy": 0.34651198610663414, "epoch": 0.4303616912888436, "grad_norm": 12.955595970153809, "learning_rate": 4.557457212713936e-07, "loss": 18.6682, "reward": 2.9930585622787476, "reward_std": 1.8933537006378174, "rewards/reasoning_density_reward/mean": 0.3700892925262451, "rewards/reasoning_density_reward/std": 0.17448541522026062, "rewards/success_reward/mean": 2.015625, "rewards/success_reward/std": 1.4066235423088074, "rewards/trajectory_similarity_reward/mean": 0.6073443293571472, "rewards/trajectory_similarity_reward/std": 0.4640781730413437, "step": 528 }, { "clip_ratio/high_max": 0.013237160164862871, "clip_ratio/high_mean": 0.002419430995360017, "clip_ratio/low_mean": 0.0012059326545568183, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0036253635480534285, "entropy": 0.29957783967256546, "epoch": 0.4311767702496179, "grad_norm": 13.295892715454102, "learning_rate": 4.5509372453137727e-07, "loss": 9.7616, "reward": 2.845973014831543, "reward_std": 1.8462645411491394, "rewards/reasoning_density_reward/mean": 0.41979166865348816, "rewards/reasoning_density_reward/std": 0.09807521104812622, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.4454171061515808, "rewards/trajectory_similarity_reward/mean": 0.5511812567710876, "rewards/trajectory_similarity_reward/std": 0.4346158355474472, "step": 529 }, { "clip_ratio/high_max": 0.01701144070830196, "clip_ratio/high_mean": 0.0037818210548721254, "clip_ratio/low_mean": 0.00030969319777796045, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004091514245374128, "entropy": 0.3272099681198597, "epoch": 0.43199184921039224, "grad_norm": 12.081549644470215, "learning_rate": 4.54441727791361e-07, "loss": 4.7187, "reward": 2.6134653091430664, "reward_std": 1.3453723192214966, "rewards/reasoning_density_reward/mean": 0.34998762607574463, "rewards/reasoning_density_reward/std": 0.1775233894586563, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.3275917768478394, "rewards/trajectory_similarity_reward/mean": 0.20097756385803223, "rewards/trajectory_similarity_reward/std": 0.35264042019844055, "step": 530 }, { "clip_ratio/high_max": 0.012477643031161278, "clip_ratio/high_mean": 0.0030054442831897177, "clip_ratio/low_mean": 0.00105022521893261, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004055669443914667, "entropy": 0.36449017003178596, "epoch": 0.43280692817116656, "grad_norm": 16.792686462402344, "learning_rate": 4.5378973105134467e-07, "loss": 6.5184, "reward": 2.4506869316101074, "reward_std": 1.6587151288986206, "rewards/reasoning_density_reward/mean": 0.3283081650733948, "rewards/reasoning_density_reward/std": 0.1363329291343689, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.2845232486724854, "rewards/trajectory_similarity_reward/mean": 0.24737879633903503, "rewards/trajectory_similarity_reward/std": 0.27284151315689087, "step": 531 }, { "clip_ratio/high_max": 0.009023146063555032, "clip_ratio/high_mean": 0.0017029148148139939, "clip_ratio/low_mean": 0.0006049135408829898, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002307828348421026, "entropy": 0.35921595990657806, "epoch": 0.43362200713194093, "grad_norm": 14.191404342651367, "learning_rate": 4.531377343113284e-07, "loss": 6.6734, "reward": 1.9906651973724365, "reward_std": 1.915246605873108, "rewards/reasoning_density_reward/mean": 0.3214285969734192, "rewards/reasoning_density_reward/std": 0.13509885966777802, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.35673654079437256, "rewards/trajectory_similarity_reward/std": 0.4325658082962036, "step": 532 }, { "clip_ratio/high_max": 0.015696843445766717, "clip_ratio/high_mean": 0.003110400815785397, "clip_ratio/low_mean": 0.0006029906871845014, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037133915320737287, "entropy": 0.35043198242783546, "epoch": 0.43443708609271525, "grad_norm": 18.141403198242188, "learning_rate": 4.524857375713122e-07, "loss": -2.973, "reward": 2.595860004425049, "reward_std": 1.3730543851852417, "rewards/reasoning_density_reward/mean": 0.31051135063171387, "rewards/reasoning_density_reward/std": 0.17149858176708221, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.504098653793335, "rewards/trajectory_similarity_reward/std": 0.46237340569496155, "step": 533 }, { "clip_ratio/high_max": 0.013762441463768482, "clip_ratio/high_mean": 0.003049885548534803, "clip_ratio/low_mean": 0.0008164268765540328, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003866312326863408, "entropy": 0.36163995042443275, "epoch": 0.43525216505348957, "grad_norm": 16.74054527282715, "learning_rate": 4.518337408312958e-07, "loss": 13.8034, "reward": 2.6820225715637207, "reward_std": 1.8541204929351807, "rewards/reasoning_density_reward/mean": 0.34583336114883423, "rewards/reasoning_density_reward/std": 0.1927865892648697, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.3098187446594238, "rewards/trajectory_similarity_reward/mean": 0.36743929982185364, "rewards/trajectory_similarity_reward/std": 0.414726585149765, "step": 534 }, { "clip_ratio/high_max": 0.011335512564983219, "clip_ratio/high_mean": 0.001957233929715585, "clip_ratio/low_mean": 0.0006808647412981372, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0026380986237199977, "entropy": 0.3632430471479893, "epoch": 0.4360672440142639, "grad_norm": 13.299813270568848, "learning_rate": 4.5118174409127957e-07, "loss": 7.3433, "reward": 2.7300225496292114, "reward_std": 1.8404462337493896, "rewards/reasoning_density_reward/mean": 0.34033502638339996, "rewards/reasoning_density_reward/std": 0.17550288140773773, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.3136931657791138, "rewards/trajectory_similarity_reward/mean": 0.4209374785423279, "rewards/trajectory_similarity_reward/std": 0.42414043843746185, "step": 535 }, { "clip_ratio/high_max": 0.014433796983212233, "clip_ratio/high_mean": 0.003260322831920348, "clip_ratio/low_mean": 0.0008027923977351747, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004063115309691057, "entropy": 0.3420613519847393, "epoch": 0.4368823229750382, "grad_norm": 11.867579460144043, "learning_rate": 4.505297473512632e-07, "loss": 8.8575, "reward": 1.5034226179122925, "reward_std": 1.5601083040237427, "rewards/reasoning_density_reward/mean": 0.2609577775001526, "rewards/reasoning_density_reward/std": 0.14925196766853333, "rewards/success_reward/mean": 1.03125, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.21121469140052795, "rewards/trajectory_similarity_reward/std": 0.36125943064689636, "step": 536 }, { "clip_ratio/high_max": 0.007088303216733038, "clip_ratio/high_mean": 0.0012567159428726882, "clip_ratio/low_mean": 0.0012671228287217673, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002523838746128604, "entropy": 0.3735988773405552, "epoch": 0.4376974019358125, "grad_norm": 13.667549133300781, "learning_rate": 4.4987775061124697e-07, "loss": 8.144, "reward": 3.4933695793151855, "reward_std": 1.0063397884368896, "rewards/reasoning_density_reward/mean": 0.32723215222358704, "rewards/reasoning_density_reward/std": 0.2142256796360016, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 1.0562314987182617, "rewards/trajectory_similarity_reward/mean": 0.6348873376846313, "rewards/trajectory_similarity_reward/std": 0.3331311047077179, "step": 537 }, { "clip_ratio/high_max": 0.01401313440874219, "clip_ratio/high_mean": 0.003542993770679459, "clip_ratio/low_mean": 0.000977485629846342, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004520479473285377, "entropy": 0.3762713894248009, "epoch": 0.43851248089658684, "grad_norm": 15.97400188446045, "learning_rate": 4.492257538712306e-07, "loss": 1.0522, "reward": 2.974268913269043, "reward_std": 2.0359609127044678, "rewards/reasoning_density_reward/mean": 0.42500001192092896, "rewards/reasoning_density_reward/std": 0.09999999403953552, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.5805187225341797, "rewards/trajectory_similarity_reward/std": 0.46904411911964417, "step": 538 }, { "clip_ratio/high_max": 0.01625559967942536, "clip_ratio/high_mean": 0.004643331878469326, "clip_ratio/low_mean": 0.0005687885350198485, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005212120391661301, "entropy": 0.3525758348405361, "epoch": 0.43932755985736116, "grad_norm": 17.112640380859375, "learning_rate": 4.4857375713121437e-07, "loss": -2.5602, "reward": 3.6732966899871826, "reward_std": 1.0029192119836807, "rewards/reasoning_density_reward/mean": 0.3492187410593033, "rewards/reasoning_density_reward/std": 0.20220451056957245, "rewards/success_reward/mean": 2.671875, "rewards/success_reward/std": 0.726596474647522, "rewards/trajectory_similarity_reward/mean": 0.6522030830383301, "rewards/trajectory_similarity_reward/std": 0.34439311921596527, "step": 539 }, { "clip_ratio/high_max": 0.014918634900823236, "clip_ratio/high_mean": 0.00401418349792948, "clip_ratio/low_mean": 0.001292284894589102, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005306468447088264, "entropy": 0.3736918307840824, "epoch": 0.44014263881813553, "grad_norm": 13.93604850769043, "learning_rate": 4.47921760391198e-07, "loss": 11.7332, "reward": 3.45410418510437, "reward_std": 1.0588693618774414, "rewards/reasoning_density_reward/mean": 0.3958333134651184, "rewards/reasoning_density_reward/std": 0.13911093771457672, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 0.7180703282356262, "rewards/trajectory_similarity_reward/mean": 0.5270209312438965, "rewards/trajectory_similarity_reward/std": 0.388954758644104, "step": 540 }, { "clip_ratio/high_max": 0.014286767109297216, "clip_ratio/high_mean": 0.0036370068846736103, "clip_ratio/low_mean": 0.0015691375592723489, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005206144523981493, "entropy": 0.32411643862724304, "epoch": 0.44095771777890985, "grad_norm": 18.48564910888672, "learning_rate": 4.472697636511817e-07, "loss": 6.2086, "reward": 3.8031481504440308, "reward_std": 0.6727407574653625, "rewards/reasoning_density_reward/mean": 0.48125000298023224, "rewards/reasoning_density_reward/std": 0.0591565016657114, "rewards/success_reward/mean": 2.765625, "rewards/success_reward/std": 0.7829292416572571, "rewards/trajectory_similarity_reward/mean": 0.5562730431556702, "rewards/trajectory_similarity_reward/std": 0.32104508578777313, "step": 541 }, { "clip_ratio/high_max": 0.012603545590536669, "clip_ratio/high_mean": 0.003471132255072007, "clip_ratio/low_mean": 0.0007455750492226798, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0042167073479504324, "entropy": 0.32146587781608105, "epoch": 0.44177279673968417, "grad_norm": 12.232275009155273, "learning_rate": 4.466177669111654e-07, "loss": -0.1927, "reward": 2.162128210067749, "reward_std": 1.692901372909546, "rewards/reasoning_density_reward/mean": 0.2704613208770752, "rewards/reasoning_density_reward/std": 0.17512290179729462, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.2808688879013062, "rewards/trajectory_similarity_reward/mean": 0.29791688919067383, "rewards/trajectory_similarity_reward/std": 0.4051060676574707, "step": 542 }, { "clip_ratio/high_max": 0.009317225136328489, "clip_ratio/high_mean": 0.0018007482212851755, "clip_ratio/low_mean": 0.0014903102492098697, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00329105845594313, "entropy": 0.35472767800092697, "epoch": 0.4425878757004585, "grad_norm": 12.583700180053711, "learning_rate": 4.459657701711491e-07, "loss": 13.568, "reward": 3.7108945846557617, "reward_std": 1.007293462753296, "rewards/reasoning_density_reward/mean": 0.3982638716697693, "rewards/reasoning_density_reward/std": 0.14989322423934937, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 1.0246951580047607, "rewards/trajectory_similarity_reward/mean": 0.687630832195282, "rewards/trajectory_similarity_reward/std": 0.29979878664016724, "step": 543 }, { "clip_ratio/high_max": 0.00809332396602258, "clip_ratio/high_mean": 0.0017869343282654881, "clip_ratio/low_mean": 0.0011449101912148762, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00293184447218664, "entropy": 0.34943459555506706, "epoch": 0.4434029546612328, "grad_norm": 13.367594718933105, "learning_rate": 4.4531377343113277e-07, "loss": -1.6329, "reward": 3.524310350418091, "reward_std": 1.035857915878296, "rewards/reasoning_density_reward/mean": 0.3687500059604645, "rewards/reasoning_density_reward/std": 0.16111589968204498, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 0.670820415019989, "rewards/trajectory_similarity_reward/mean": 0.530560314655304, "rewards/trajectory_similarity_reward/std": 0.35715657472610474, "step": 544 }, { "clip_ratio/high_max": 0.014144404325634241, "clip_ratio/high_mean": 0.004334031560574658, "clip_ratio/low_mean": 0.0005374959619075526, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004871527504292317, "entropy": 0.3391512706875801, "epoch": 0.4442180336220071, "grad_norm": 14.395678520202637, "learning_rate": 4.446617766911165e-07, "loss": 4.1765, "reward": 4.120676517486572, "reward_std": 0.66426220536232, "rewards/reasoning_density_reward/mean": 0.4085937440395355, "rewards/reasoning_density_reward/std": 0.1592087522149086, "rewards/success_reward/mean": 2.859375, "rewards/success_reward/std": 0.4436737895011902, "rewards/trajectory_similarity_reward/mean": 0.8527075946331024, "rewards/trajectory_similarity_reward/std": 0.2878215163946152, "step": 545 }, { "clip_ratio/high_max": 0.012463175051379949, "clip_ratio/high_mean": 0.0027688551344908774, "clip_ratio/low_mean": 0.000800734334916342, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0035695894657692406, "entropy": 0.32092030346393585, "epoch": 0.44503311258278144, "grad_norm": 21.005573272705078, "learning_rate": 4.4400977995110017e-07, "loss": 0.8973, "reward": 2.168970465660095, "reward_std": 0.8865417391061783, "rewards/reasoning_density_reward/mean": 0.32205086946487427, "rewards/reasoning_density_reward/std": 0.12864883244037628, "rewards/success_reward/mean": 1.546875, "rewards/success_reward/std": 1.4711282849311829, "rewards/trajectory_similarity_reward/mean": 0.30004459619522095, "rewards/trajectory_similarity_reward/std": 0.3584650605916977, "step": 546 }, { "clip_ratio/high_max": 0.016013500513508916, "clip_ratio/high_mean": 0.0041774155833991244, "clip_ratio/low_mean": 0.0008565982352592982, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00503401382593438, "entropy": 0.3438780829310417, "epoch": 0.44584819154355576, "grad_norm": 17.672231674194336, "learning_rate": 4.433577832110839e-07, "loss": 4.7462, "reward": 3.7928695678710938, "reward_std": 0.8661932349205017, "rewards/reasoning_density_reward/mean": 0.3828125, "rewards/reasoning_density_reward/std": 0.17858676612377167, "rewards/success_reward/mean": 2.8125, "rewards/success_reward/std": 0.75, "rewards/trajectory_similarity_reward/mean": 0.5975571274757385, "rewards/trajectory_similarity_reward/std": 0.2664192318916321, "step": 547 }, { "clip_ratio/high_max": 0.0150608568219468, "clip_ratio/high_mean": 0.004217352834530175, "clip_ratio/low_mean": 0.0014223493344616145, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00563970222719945, "entropy": 0.3506272919476032, "epoch": 0.44666327050433013, "grad_norm": 14.314610481262207, "learning_rate": 4.4270578647106767e-07, "loss": 9.1876, "reward": 2.8220906257629395, "reward_std": 1.7138774394989014, "rewards/reasoning_density_reward/mean": 0.3109374940395355, "rewards/reasoning_density_reward/std": 0.22711391746997833, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.5424031615257263, "rewards/trajectory_similarity_reward/std": 0.4519876539707184, "step": 548 }, { "clip_ratio/high_max": 0.013267052534502, "clip_ratio/high_mean": 0.003214298776583746, "clip_ratio/low_mean": 0.0006633223965764046, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0038776212895754725, "entropy": 0.3744233548641205, "epoch": 0.44747834946510445, "grad_norm": 11.219035148620605, "learning_rate": 4.420537897310513e-07, "loss": 17.345, "reward": 1.925614356994629, "reward_std": 1.7829744815826416, "rewards/reasoning_density_reward/mean": 0.20111607015132904, "rewards/reasoning_density_reward/std": 0.180794358253479, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.3930631875991821, "rewards/trajectory_similarity_reward/mean": 0.31824809312820435, "rewards/trajectory_similarity_reward/std": 0.4279051125049591, "step": 549 }, { "clip_ratio/high_max": 0.01672771543962881, "clip_ratio/high_mean": 0.003859352793369908, "clip_ratio/low_mean": 0.0005837082208017819, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004443060955964029, "entropy": 0.35721930861473083, "epoch": 0.44829342842587877, "grad_norm": 13.186562538146973, "learning_rate": 4.4140179299103507e-07, "loss": 8.8726, "reward": 3.834385633468628, "reward_std": 0.7571700215339661, "rewards/reasoning_density_reward/mean": 0.3419642746448517, "rewards/reasoning_density_reward/std": 0.19061875343322754, "rewards/success_reward/mean": 2.8125, "rewards/success_reward/std": 0.75, "rewards/trajectory_similarity_reward/mean": 0.6799213886260986, "rewards/trajectory_similarity_reward/std": 0.23941686749458313, "step": 550 }, { "clip_ratio/high_max": 0.013944463862571865, "clip_ratio/high_mean": 0.003538831791956909, "clip_ratio/low_mean": 0.0004290778742870316, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003967909578932449, "entropy": 0.36337701603770256, "epoch": 0.4491085073866531, "grad_norm": 13.404133796691895, "learning_rate": 4.407497962510187e-07, "loss": -2.1555, "reward": 2.653087854385376, "reward_std": 1.47632896900177, "rewards/reasoning_density_reward/mean": 0.22968749701976776, "rewards/reasoning_density_reward/std": 0.19339856505393982, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.45465028285980225, "rewards/trajectory_similarity_reward/std": 0.39299502968788147, "step": 551 }, { "clip_ratio/high_max": 0.01368924422422424, "clip_ratio/high_mean": 0.0033131887030322105, "clip_ratio/low_mean": 0.0010176025753025897, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004330791241955012, "entropy": 0.3517771475017071, "epoch": 0.4499235863474274, "grad_norm": 17.499183654785156, "learning_rate": 4.4009779951100247e-07, "loss": 7.5392, "reward": 2.9876869916915894, "reward_std": 1.239673137664795, "rewards/reasoning_density_reward/mean": 0.31406252086162567, "rewards/reasoning_density_reward/std": 0.15317761152982712, "rewards/success_reward/mean": 2.296875, "rewards/success_reward/std": 0.9362190663814545, "rewards/trajectory_similarity_reward/mean": 0.37674954533576965, "rewards/trajectory_similarity_reward/std": 0.33037659525871277, "step": 552 }, { "clip_ratio/high_max": 0.015341704041929916, "clip_ratio/high_mean": 0.002958446133561665, "clip_ratio/low_mean": 0.0011553832482604776, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004113829232665012, "entropy": 0.3598606176674366, "epoch": 0.4507386653082017, "grad_norm": 12.994938850402832, "learning_rate": 4.394458027709861e-07, "loss": 7.3084, "reward": 2.454890727996826, "reward_std": 2.085770606994629, "rewards/reasoning_density_reward/mean": 0.32883185148239136, "rewards/reasoning_density_reward/std": 0.15447302162647247, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.4385586678981781, "rewards/trajectory_similarity_reward/std": 0.4313983619213104, "step": 553 }, { "clip_ratio/high_max": 0.016565235797315836, "clip_ratio/high_mean": 0.003439091786276549, "clip_ratio/low_mean": 0.0016647784832457546, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005103870382299647, "entropy": 0.37257180362939835, "epoch": 0.45155374426897604, "grad_norm": 15.50061321258545, "learning_rate": 4.3879380603096987e-07, "loss": -8.1869, "reward": 2.1983847618103027, "reward_std": 1.9784035682678223, "rewards/reasoning_density_reward/mean": 0.3142856955528259, "rewards/reasoning_density_reward/std": 0.09167542308568954, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.38409900665283203, "rewards/trajectory_similarity_reward/std": 0.40918147563934326, "step": 554 }, { "clip_ratio/high_max": 0.012967790942639112, "clip_ratio/high_mean": 0.0033621016918914393, "clip_ratio/low_mean": 0.0008135303651215509, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004175632013357244, "entropy": 0.33949117362499237, "epoch": 0.45236882322975036, "grad_norm": 14.195963859558105, "learning_rate": 4.381418092909535e-07, "loss": 4.6275, "reward": 3.50724720954895, "reward_std": 1.3437626659870148, "rewards/reasoning_density_reward/mean": 0.45446428656578064, "rewards/reasoning_density_reward/std": 0.09210738725960255, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.0930703282356262, "rewards/trajectory_similarity_reward/mean": 0.6152828335762024, "rewards/trajectory_similarity_reward/std": 0.3256865292787552, "step": 555 }, { "clip_ratio/high_max": 0.01677731511881575, "clip_ratio/high_mean": 0.0038986751387710683, "clip_ratio/low_mean": 0.0009556648074067198, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004854340004385449, "entropy": 0.35855530947446823, "epoch": 0.45318390219052473, "grad_norm": 18.586414337158203, "learning_rate": 4.374898125509372e-07, "loss": 11.8646, "reward": 3.0171866416931152, "reward_std": 1.5499540567398071, "rewards/reasoning_density_reward/mean": 0.2764880955219269, "rewards/reasoning_density_reward/std": 0.20027358829975128, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.2247449159622192, "rewards/trajectory_similarity_reward/mean": 0.49069851636886597, "rewards/trajectory_similarity_reward/std": 0.39682114124298096, "step": 556 }, { "clip_ratio/high_max": 0.021138463984243572, "clip_ratio/high_mean": 0.0056194042263086885, "clip_ratio/low_mean": 0.00041736768253031187, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.006036771839717403, "entropy": 0.35941996797919273, "epoch": 0.45399898115129905, "grad_norm": 17.315053939819336, "learning_rate": 4.368378158109209e-07, "loss": 7.3731, "reward": 3.2970802783966064, "reward_std": 1.5440999269485474, "rewards/reasoning_density_reward/mean": 0.40602679550647736, "rewards/reasoning_density_reward/std": 0.16176147013902664, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.0968086123466492, "rewards/trajectory_similarity_reward/mean": 0.5473034977912903, "rewards/trajectory_similarity_reward/std": 0.3723365366458893, "step": 557 }, { "clip_ratio/high_max": 0.016768325003795326, "clip_ratio/high_mean": 0.0038714207767043263, "clip_ratio/low_mean": 0.0010672201169654727, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004938640922773629, "entropy": 0.3382100947201252, "epoch": 0.45481406011207337, "grad_norm": 15.948515892028809, "learning_rate": 4.361858190709046e-07, "loss": 9.4539, "reward": 4.159904479980469, "reward_std": 0.4882028102874756, "rewards/reasoning_density_reward/mean": 0.4203124940395355, "rewards/reasoning_density_reward/std": 0.12390142679214478, "rewards/success_reward/mean": 2.90625, "rewards/success_reward/std": 0.375, "rewards/trajectory_similarity_reward/mean": 0.8333417177200317, "rewards/trajectory_similarity_reward/std": 0.23912812769412994, "step": 558 }, { "clip_ratio/high_max": 0.012426528322976083, "clip_ratio/high_mean": 0.002792980340018403, "clip_ratio/low_mean": 0.0003495293567539193, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0031425097113242373, "entropy": 0.3260241486132145, "epoch": 0.4556291390728477, "grad_norm": 16.810819625854492, "learning_rate": 4.355338223308883e-07, "loss": 10.8799, "reward": 2.534996747970581, "reward_std": 1.5017638802528381, "rewards/reasoning_density_reward/mean": 0.26566220819950104, "rewards/reasoning_density_reward/std": 0.15741927921772003, "rewards/success_reward/mean": 1.828125, "rewards/success_reward/std": 1.0879220962524414, "rewards/trajectory_similarity_reward/mean": 0.44120948761701584, "rewards/trajectory_similarity_reward/std": 0.3733525425195694, "step": 559 }, { "clip_ratio/high_max": 0.009915478760376573, "clip_ratio/high_mean": 0.0016737399710109457, "clip_ratio/low_mean": 0.0009361322408949491, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002609872230095789, "entropy": 0.36447614431381226, "epoch": 0.456444218033622, "grad_norm": 11.337642669677734, "learning_rate": 4.34881825590872e-07, "loss": -0.89, "step": 560 }, { "clip_ratio/high_max": 0.020306974533014, "clip_ratio/high_mean": 0.004155522721703164, "clip_ratio/low_mean": 0.0008797888149274513, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005035311434767209, "entropy": 0.3449097201228142, "epoch": 0.4572592969943963, "grad_norm": 14.88859748840332, "learning_rate": 4.3422982885085566e-07, "loss": 1.617, "reward": 2.701356053352356, "reward_std": 2.0815322399139404, "rewards/reasoning_density_reward/mean": 0.38638393580913544, "rewards/reasoning_density_reward/std": 0.12976709008216858, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.492667019367218, "rewards/trajectory_similarity_reward/mean": 0.5337220430374146, "rewards/trajectory_similarity_reward/std": 0.45427705347537994, "step": 561 }, { "clip_ratio/high_max": 0.012709788046777248, "clip_ratio/high_mean": 0.003432242156122811, "clip_ratio/low_mean": 0.0009075313064386137, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004339773397077806, "entropy": 0.337752029299736, "epoch": 0.45807437595517064, "grad_norm": 18.067981719970703, "learning_rate": 4.335778321108394e-07, "loss": 2.7796, "reward": 3.1187000274658203, "reward_std": 1.06424081325531, "rewards/reasoning_density_reward/mean": 0.41093748807907104, "rewards/reasoning_density_reward/std": 0.14111720025539398, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.6452624797821045, "rewards/trajectory_similarity_reward/std": 0.4556284248828888, "step": 562 }, { "clip_ratio/high_max": 0.01454808103153482, "clip_ratio/high_mean": 0.0036199339156155474, "clip_ratio/low_mean": 0.0007691394675930496, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004389073379570618, "entropy": 0.33856622502207756, "epoch": 0.45888945491594496, "grad_norm": 14.482069969177246, "learning_rate": 4.3292583537082317e-07, "loss": 15.9522, "reward": 2.7807042598724365, "reward_std": 2.0140767097473145, "rewards/reasoning_density_reward/mean": 0.3505208343267441, "rewards/reasoning_density_reward/std": 0.17600423842668533, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.4454171061515808, "rewards/trajectory_similarity_reward/mean": 0.5551833361387253, "rewards/trajectory_similarity_reward/std": 0.43651238083839417, "step": 563 }, { "clip_ratio/high_max": 0.011564271640963852, "clip_ratio/high_mean": 0.0027336031635059044, "clip_ratio/low_mean": 0.0006760891883459408, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034096922172466293, "entropy": 0.373022947460413, "epoch": 0.45970453387671933, "grad_norm": 13.495453834533691, "learning_rate": 4.322738386308068e-07, "loss": 2.4246, "reward": 2.498218059539795, "reward_std": 1.2063329219818115, "rewards/reasoning_density_reward/mean": 0.29598215222358704, "rewards/reasoning_density_reward/std": 0.17762069404125214, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.1618950366973877, "rewards/trajectory_similarity_reward/mean": 0.32723602652549744, "rewards/trajectory_similarity_reward/std": 0.39434343576431274, "step": 564 }, { "clip_ratio/high_max": 0.0065016826265491545, "clip_ratio/high_mean": 0.0014780929559492506, "clip_ratio/low_mean": 0.0011827840608020779, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0026608769439917523, "entropy": 0.36408449336886406, "epoch": 0.46051961283749365, "grad_norm": 12.88775634765625, "learning_rate": 4.3162184189079057e-07, "loss": 6.4534, "reward": 1.5438021421432495, "reward_std": 1.9094183444976807, "rewards/reasoning_density_reward/mean": 0.2645833492279053, "rewards/reasoning_density_reward/std": 0.17531718313694, "rewards/success_reward/mean": 1.03125, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.24796870350837708, "rewards/trajectory_similarity_reward/std": 0.3963402509689331, "step": 565 }, { "clip_ratio/high_max": 0.018652855418622494, "clip_ratio/high_mean": 0.003962171613238752, "clip_ratio/low_mean": 0.0009548897323838901, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004917061305604875, "entropy": 0.3550427407026291, "epoch": 0.46133469179826797, "grad_norm": 12.431384086608887, "learning_rate": 4.309698451507742e-07, "loss": -1.1687, "reward": 3.3790628910064697, "reward_std": 1.644874095916748, "rewards/reasoning_density_reward/mean": 0.4129464328289032, "rewards/reasoning_density_reward/std": 0.0962553545832634, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.6223665475845337, "rewards/trajectory_similarity_reward/std": 0.3798036575317383, "step": 566 }, { "clip_ratio/high_max": 0.014142922183964401, "clip_ratio/high_mean": 0.003249353787396103, "clip_ratio/low_mean": 0.0008733291797398124, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004122683007153682, "entropy": 0.3622935116291046, "epoch": 0.4621497707590423, "grad_norm": 13.88054084777832, "learning_rate": 4.3031784841075797e-07, "loss": 11.5922, "reward": 2.3520519733428955, "reward_std": 2.0334272384643555, "rewards/reasoning_density_reward/mean": 0.2984848618507385, "rewards/reasoning_density_reward/std": 0.15967042744159698, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.36606699228286743, "rewards/trajectory_similarity_reward/std": 0.39975956082344055, "step": 567 }, { "clip_ratio/high_max": 0.013290053873788565, "clip_ratio/high_mean": 0.00294685221160762, "clip_ratio/low_mean": 0.0007653999600734096, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003712252168043051, "entropy": 0.3554918020963669, "epoch": 0.4629648497198166, "grad_norm": 16.15614891052246, "learning_rate": 4.296658516707416e-07, "loss": -3.8654, "reward": 3.2939748764038086, "reward_std": 1.157406508922577, "rewards/reasoning_density_reward/mean": 0.3639136850833893, "rewards/reasoning_density_reward/std": 0.15524236112833023, "rewards/success_reward/mean": 2.390625, "rewards/success_reward/std": 0.8486150503158569, "rewards/trajectory_similarity_reward/mean": 0.5394362658262253, "rewards/trajectory_similarity_reward/std": 0.46232806146144867, "step": 568 }, { "clip_ratio/high_max": 0.017156257177703083, "clip_ratio/high_mean": 0.004102461491129361, "clip_ratio/low_mean": 0.0009994387874030508, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005101900198496878, "entropy": 0.35246555879712105, "epoch": 0.4637799286805909, "grad_norm": 19.012672424316406, "learning_rate": 4.2901385493072537e-07, "loss": 2.9575, "reward": 3.189117670059204, "reward_std": 1.7381527423858643, "rewards/reasoning_density_reward/mean": 0.2578125, "rewards/reasoning_density_reward/std": 0.16492053866386414, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.6813051700592041, "rewards/trajectory_similarity_reward/std": 0.41581490635871887, "step": 569 }, { "clip_ratio/high_max": 0.008708903100341558, "clip_ratio/high_mean": 0.0019682730198837817, "clip_ratio/low_mean": 0.0014035365711606573, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0033718095983203966, "entropy": 0.3606250658631325, "epoch": 0.46459500764136524, "grad_norm": 14.499275207519531, "learning_rate": 4.28361858190709e-07, "loss": -6.0356, "reward": 1.64427649974823, "reward_std": 1.2354811429977417, "rewards/reasoning_density_reward/mean": 0.23091518878936768, "rewards/reasoning_density_reward/std": 0.17212003469467163, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.10086134076118469, "rewards/trajectory_similarity_reward/std": 0.243430957198143, "step": 570 }, { "clip_ratio/high_max": 0.00946467590983957, "clip_ratio/high_mean": 0.0014084450813243166, "clip_ratio/low_mean": 0.000826163734018337, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002234608808066696, "entropy": 0.3761347606778145, "epoch": 0.46541008660213956, "grad_norm": 12.10898494720459, "learning_rate": 4.2770986145069277e-07, "loss": 1.571, "reward": 0.8221479654312134, "reward_std": 1.2809375524520874, "rewards/reasoning_density_reward/mean": 0.17812500894069672, "rewards/reasoning_density_reward/std": 0.13658788800239563, "rewards/success_reward/mean": 0.5625, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.08152294158935547, "rewards/trajectory_similarity_reward/std": 0.24118547141551971, "step": 571 }, { "clip_ratio/high_max": 0.009534235839964822, "clip_ratio/high_mean": 0.0014692429940623697, "clip_ratio/low_mean": 0.0011971831627306528, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002666426149517065, "entropy": 0.3741855174303055, "epoch": 0.46622516556291393, "grad_norm": 12.035585403442383, "learning_rate": 4.270578647106764e-07, "loss": 1.6689, "reward": 1.366727352142334, "reward_std": 1.6748948097229004, "rewards/reasoning_density_reward/mean": 0.25208333134651184, "rewards/reasoning_density_reward/std": 0.15965259075164795, "rewards/success_reward/mean": 0.9375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.1771441102027893, "rewards/trajectory_similarity_reward/std": 0.3824470043182373, "step": 572 }, { "clip_ratio/high_max": 0.008331468736287206, "clip_ratio/high_mean": 0.0018131325778085738, "clip_ratio/low_mean": 0.0015312925752368756, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0033444251166656613, "entropy": 0.358720775693655, "epoch": 0.46704024452368825, "grad_norm": 14.387141227722168, "learning_rate": 4.264058679706601e-07, "loss": 3.666, "reward": 2.4255566596984863, "reward_std": 1.6705716848373413, "rewards/reasoning_density_reward/mean": 0.3270833492279053, "rewards/reasoning_density_reward/std": 0.14705441892147064, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.4109731912612915, "rewards/trajectory_similarity_reward/std": 0.40887385606765747, "step": 573 }, { "clip_ratio/high_max": 0.006902437366079539, "clip_ratio/high_mean": 0.0015202344511635602, "clip_ratio/low_mean": 0.0009265876760764513, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002446822094498202, "entropy": 0.33538781479001045, "epoch": 0.46785532348446257, "grad_norm": 14.9566011428833, "learning_rate": 4.257538712306438e-07, "loss": 5.3335, "reward": 2.6574020385742188, "reward_std": 1.24073326587677, "rewards/reasoning_density_reward/mean": 0.32738097012043, "rewards/reasoning_density_reward/std": 0.1291305422782898, "rewards/success_reward/mean": 2.015625, "rewards/success_reward/std": 0.8786294460296631, "rewards/trajectory_similarity_reward/mean": 0.31439606845378876, "rewards/trajectory_similarity_reward/std": 0.396379292011261, "step": 574 }, { "clip_ratio/high_max": 0.011049385066144168, "clip_ratio/high_mean": 0.0028923638892592862, "clip_ratio/low_mean": 0.0013416558813332813, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004234019912473741, "entropy": 0.3455248177051544, "epoch": 0.4686704024452369, "grad_norm": 31.940448760986328, "learning_rate": 4.251018744906275e-07, "loss": 6.8659, "reward": 3.1505932807922363, "reward_std": 0.47806644439697266, "rewards/reasoning_density_reward/mean": 0.328125, "rewards/reasoning_density_reward/std": 0.1547538936138153, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 0.7685213088989258, "rewards/trajectory_similarity_reward/mean": 0.4787183701992035, "rewards/trajectory_similarity_reward/std": 0.4481493830680847, "step": 575 }, { "clip_ratio/high_max": 0.014024338219314814, "clip_ratio/high_mean": 0.0037266259460011497, "clip_ratio/low_mean": 0.001639910311496351, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005366536206565797, "entropy": 0.3363899886608124, "epoch": 0.4694854814060112, "grad_norm": 13.188942909240723, "learning_rate": 4.2444987775061116e-07, "loss": -5.5325, "reward": 2.3746495246887207, "reward_std": 1.9234539270401, "rewards/reasoning_density_reward/mean": 0.2983630895614624, "rewards/reasoning_density_reward/std": 0.13734255731105804, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.3887866139411926, "rewards/trajectory_similarity_reward/std": 0.4109819829463959, "step": 576 }, { "clip_ratio/high_max": 0.012836737267207354, "clip_ratio/high_mean": 0.002450553249218501, "clip_ratio/low_mean": 0.0010548387981543783, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003505391941871494, "entropy": 0.3550970293581486, "epoch": 0.4703005603667855, "grad_norm": 13.619807243347168, "learning_rate": 4.237978810105949e-07, "loss": 3.7743, "reward": 2.762157917022705, "reward_std": 1.7440345287322998, "rewards/reasoning_density_reward/mean": 0.3185639977455139, "rewards/reasoning_density_reward/std": 0.16945409029722214, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.360331952571869, "rewards/trajectory_similarity_reward/mean": 0.47484391927719116, "rewards/trajectory_similarity_reward/std": 0.41989026963710785, "step": 577 }, { "clip_ratio/high_max": 0.016735209268517792, "clip_ratio/high_mean": 0.003149346128338948, "clip_ratio/low_mean": 0.0011136925895698369, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004263038747012615, "entropy": 0.3651650585234165, "epoch": 0.47111563932755984, "grad_norm": 15.632345199584961, "learning_rate": 4.2314588427057867e-07, "loss": 12.7592, "reward": 2.772813320159912, "reward_std": 2.0187315940856934, "rewards/reasoning_density_reward/mean": 0.37559524178504944, "rewards/reasoning_density_reward/std": 0.16936032474040985, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.5222182273864746, "rewards/trajectory_similarity_reward/std": 0.4531330466270447, "step": 578 }, { "clip_ratio/high_max": 0.010811149724759161, "clip_ratio/high_mean": 0.0017983683210331947, "clip_ratio/low_mean": 0.001567758296005195, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0033661266352282837, "entropy": 0.3432704582810402, "epoch": 0.47193071828833416, "grad_norm": 14.761733055114746, "learning_rate": 4.224938875305623e-07, "loss": -1.1615, "reward": 1.8367879390716553, "reward_std": 1.8681848049163818, "rewards/reasoning_density_reward/mean": 0.26732227206230164, "rewards/reasoning_density_reward/std": 0.1510384976863861, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.256965696811676, "rewards/trajectory_similarity_reward/std": 0.37701475620269775, "step": 579 }, { "clip_ratio/high_max": 0.013398616691119969, "clip_ratio/high_mean": 0.0033081389556173235, "clip_ratio/low_mean": 0.0010468514519743621, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004354990378487855, "entropy": 0.35819969326257706, "epoch": 0.47274579724910853, "grad_norm": 11.919381141662598, "learning_rate": 4.2184189079054606e-07, "loss": -1.555, "reward": 2.817079782485962, "reward_std": 1.6302745342254639, "rewards/reasoning_density_reward/mean": 0.2417410910129547, "rewards/reasoning_density_reward/std": 0.18617945909500122, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.4190887212753296, "rewards/trajectory_similarity_reward/std": 0.356999933719635, "step": 580 }, { "clip_ratio/high_max": 0.016501871752552688, "clip_ratio/high_mean": 0.0032411466527264565, "clip_ratio/low_mean": 0.0006709031986247282, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003912049753125757, "entropy": 0.3342396952211857, "epoch": 0.47356087620988285, "grad_norm": 15.686565399169922, "learning_rate": 4.211898940505297e-07, "loss": -4.5436, "reward": 2.494777202606201, "reward_std": 1.9458121061325073, "rewards/reasoning_density_reward/mean": 0.3197871744632721, "rewards/reasoning_density_reward/std": 0.08850736171007156, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.48748981952667236, "rewards/trajectory_similarity_reward/std": 0.44706347584724426, "step": 581 }, { "clip_ratio/high_max": 0.007989774137968197, "clip_ratio/high_mean": 0.0014396096485143062, "clip_ratio/low_mean": 0.0018679902859730646, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003307600025436841, "entropy": 0.3651244677603245, "epoch": 0.47437595517065717, "grad_norm": 14.441850662231445, "learning_rate": 4.2053789731051346e-07, "loss": 7.4235, "reward": 2.6179115772247314, "reward_std": 1.7007635831832886, "rewards/reasoning_density_reward/mean": 0.2680600881576538, "rewards/reasoning_density_reward/std": 0.18116000294685364, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.4748515486717224, "rewards/trajectory_similarity_reward/std": 0.40603601932525635, "step": 582 }, { "clip_ratio/high_max": 0.018344354641158134, "clip_ratio/high_mean": 0.005078492766187992, "clip_ratio/low_mean": 0.0009508318253210746, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.006029324664268643, "entropy": 0.377111803740263, "epoch": 0.4751910341314315, "grad_norm": 17.01071548461914, "learning_rate": 4.198859005704971e-07, "loss": 2.6191, "reward": 3.140974521636963, "reward_std": 1.8879753351211548, "rewards/reasoning_density_reward/mean": 0.42386361956596375, "rewards/reasoning_density_reward/std": 0.12705066800117493, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.3381423950195312, "rewards/trajectory_similarity_reward/mean": 0.560860812664032, "rewards/trajectory_similarity_reward/std": 0.4141072630882263, "step": 583 }, { "clip_ratio/high_max": 0.011767158983275294, "clip_ratio/high_mean": 0.0025772510416572914, "clip_ratio/low_mean": 0.0015722177449788433, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004149468790274113, "entropy": 0.3435434550046921, "epoch": 0.4760061130922058, "grad_norm": 16.465890884399414, "learning_rate": 4.1923390383048086e-07, "loss": 6.6972, "reward": 3.341808795928955, "reward_std": 1.4392475485801697, "rewards/reasoning_density_reward/mean": 0.40305058658123016, "rewards/reasoning_density_reward/std": 0.11547904089093208, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2304179072380066, "rewards/trajectory_similarity_reward/mean": 0.5950081795454025, "rewards/trajectory_similarity_reward/std": 0.34431806206703186, "step": 584 }, { "clip_ratio/high_max": 0.010830255574546754, "clip_ratio/high_mean": 0.0027550527593120933, "clip_ratio/low_mean": 0.0025063969078473747, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005261449667159468, "entropy": 0.3699260652065277, "epoch": 0.4768211920529801, "grad_norm": 13.976653099060059, "learning_rate": 4.185819070904645e-07, "loss": 7.6542, "reward": 0.9579020142555237, "reward_std": 1.0869289636611938, "rewards/reasoning_density_reward/mean": 0.24551090598106384, "rewards/reasoning_density_reward/std": 0.12966489791870117, "rewards/success_reward/mean": 0.5625, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.14989107847213745, "rewards/trajectory_similarity_reward/std": 0.3259730041027069, "step": 585 }, { "clip_ratio/high_max": 0.010023273585829884, "clip_ratio/high_mean": 0.0017776818494894542, "clip_ratio/low_mean": 0.0010789433363243006, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002856625083950348, "entropy": 0.3934973366558552, "epoch": 0.47763627101375444, "grad_norm": 11.973794937133789, "learning_rate": 4.1792991035044826e-07, "loss": 17.1749, "reward": 2.5416905879974365, "reward_std": 0.7355791926383972, "rewards/reasoning_density_reward/mean": 0.3010416626930237, "rewards/reasoning_density_reward/std": 0.17453311383724213, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 0.7180703282356262, "rewards/trajectory_similarity_reward/mean": 0.2718989849090576, "rewards/trajectory_similarity_reward/std": 0.41888442635536194, "step": 586 }, { "clip_ratio/high_max": 0.01698725071037188, "clip_ratio/high_mean": 0.003588614708860405, "clip_ratio/low_mean": 0.0010488522239029408, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004637467092834413, "entropy": 0.3441528342664242, "epoch": 0.47845134997452876, "grad_norm": 15.792671203613281, "learning_rate": 4.172779136104319e-07, "loss": 12.809, "reward": 3.437375545501709, "reward_std": 1.289502739906311, "rewards/reasoning_density_reward/mean": 0.3094449043273926, "rewards/reasoning_density_reward/std": 0.15279966592788696, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 1.0562314987182617, "rewards/trajectory_similarity_reward/mean": 0.5966807007789612, "rewards/trajectory_similarity_reward/std": 0.3150221109390259, "step": 587 }, { "clip_ratio/high_max": 0.01854595192708075, "clip_ratio/high_mean": 0.0051692268752958626, "clip_ratio/low_mean": 0.0004925918474327773, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005661818664520979, "entropy": 0.3373641148209572, "epoch": 0.47926642893530313, "grad_norm": 12.73204231262207, "learning_rate": 4.1662591687041566e-07, "loss": 3.4322, "reward": 3.1166861057281494, "reward_std": 1.913010835647583, "rewards/reasoning_density_reward/mean": 0.3578125238418579, "rewards/reasoning_density_reward/std": 0.17788544297218323, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 1.3381423950195312, "rewards/trajectory_similarity_reward/mean": 0.6026235222816467, "rewards/trajectory_similarity_reward/std": 0.45800694823265076, "step": 588 }, { "clip_ratio/high_max": 0.01766293460968882, "clip_ratio/high_mean": 0.004542790324194357, "clip_ratio/low_mean": 0.0007706150427111425, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005313405330525711, "entropy": 0.3473193235695362, "epoch": 0.48008150789607745, "grad_norm": 15.362180709838867, "learning_rate": 4.159739201303993e-07, "loss": 8.2866, "reward": 2.7066287994384766, "reward_std": 1.9972001314163208, "rewards/reasoning_density_reward/mean": 0.3160342276096344, "rewards/reasoning_density_reward/std": 0.12185101211071014, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.5155945420265198, "rewards/trajectory_similarity_reward/std": 0.4418987035751343, "step": 589 }, { "clip_ratio/high_max": 0.019331959076225758, "clip_ratio/high_mean": 0.004190800624201074, "clip_ratio/low_mean": 0.0008512739004800096, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005042074393713847, "entropy": 0.36880314722657204, "epoch": 0.48089658685685177, "grad_norm": 14.195220947265625, "learning_rate": 4.15321923390383e-07, "loss": 9.3941, "reward": 3.1076560020446777, "reward_std": 1.339439868927002, "rewards/reasoning_density_reward/mean": 0.3343749940395355, "rewards/reasoning_density_reward/std": 0.19892942905426025, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.5232807397842407, "rewards/trajectory_similarity_reward/std": 0.397593230009079, "step": 590 }, { "clip_ratio/high_max": 0.01813520712312311, "clip_ratio/high_mean": 0.005514322983799502, "clip_ratio/low_mean": 0.0010313485836377367, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.006545671698404476, "entropy": 0.3531506285071373, "epoch": 0.4817116658176261, "grad_norm": 15.17212963104248, "learning_rate": 4.146699266503667e-07, "loss": 7.1659, "reward": 2.782954216003418, "reward_std": 1.7850925922393799, "rewards/reasoning_density_reward/mean": 0.2814703583717346, "rewards/reasoning_density_reward/std": 0.19351571798324585, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.43898388743400574, "rewards/trajectory_similarity_reward/std": 0.37825068831443787, "step": 591 }, { "clip_ratio/high_max": 0.018588822742458433, "clip_ratio/high_mean": 0.005690486737876199, "clip_ratio/low_mean": 0.0005485238070832565, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.006239010515855625, "entropy": 0.3401137851178646, "epoch": 0.4825267447784004, "grad_norm": 12.795368194580078, "learning_rate": 4.140179299103504e-07, "loss": 2.6322, "reward": 3.58992600440979, "reward_std": 1.568352460861206, "rewards/reasoning_density_reward/mean": 0.44999998807907104, "rewards/reasoning_density_reward/std": 0.08944271504878998, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.702426016330719, "rewards/trajectory_similarity_reward/std": 0.4233934283256531, "step": 592 }, { "clip_ratio/high_max": 0.02141480887075886, "clip_ratio/high_mean": 0.005334142661013175, "clip_ratio/low_mean": 0.00046250977175077423, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005796652432763949, "entropy": 0.3599207364022732, "epoch": 0.4833418237391747, "grad_norm": 12.382328987121582, "learning_rate": 4.1336593317033416e-07, "loss": 6.4115, "reward": 3.384814500808716, "reward_std": 1.372208595275879, "rewards/reasoning_density_reward/mean": 0.4236505627632141, "rewards/reasoning_density_reward/std": 0.10526878759264946, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 0.9999804198741913, "rewards/trajectory_similarity_reward/mean": 0.617413803935051, "rewards/trajectory_similarity_reward/std": 0.44272375106811523, "step": 593 }, { "clip_ratio/high_max": 0.00865881674690172, "clip_ratio/high_mean": 0.0016452554482384585, "clip_ratio/low_mean": 0.002116827861755155, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003762083317269571, "entropy": 0.357397235929966, "epoch": 0.48415690269994904, "grad_norm": 13.117693901062012, "learning_rate": 4.127139364303178e-07, "loss": -4.1334, "reward": 1.0382909774780273, "reward_std": 1.5980769395828247, "rewards/reasoning_density_reward/mean": 0.23950894176959991, "rewards/reasoning_density_reward/std": 0.16153742372989655, "rewards/success_reward/mean": 0.65625, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.14253197610378265, "rewards/trajectory_similarity_reward/std": 0.32693859934806824, "step": 594 }, { "clip_ratio/high_max": 0.01460710831452161, "clip_ratio/high_mean": 0.002707427687710151, "clip_ratio/low_mean": 0.0015980244461388793, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0043054522830061615, "entropy": 0.3160870112478733, "epoch": 0.48497198166072336, "grad_norm": 17.063623428344727, "learning_rate": 4.1206193969030156e-07, "loss": 7.6514, "reward": 3.464766502380371, "reward_std": 1.0720587372779846, "rewards/reasoning_density_reward/mean": 0.44032737612724304, "rewards/reasoning_density_reward/std": 0.08757923170924187, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2304179072380066, "rewards/trajectory_similarity_reward/mean": 0.6806890964508057, "rewards/trajectory_similarity_reward/std": 0.3681385964155197, "step": 595 }, { "clip_ratio/high_max": 0.015156440204009414, "clip_ratio/high_mean": 0.0035413292789598927, "clip_ratio/low_mean": 0.0016424941877630772, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005183823450352065, "entropy": 0.3094256781041622, "epoch": 0.48578706062149773, "grad_norm": 13.846409797668457, "learning_rate": 4.114099429502852e-07, "loss": 2.0274, "reward": 3.8409533500671387, "reward_std": 0.9405041337013245, "rewards/reasoning_density_reward/mean": 0.40833333134651184, "rewards/reasoning_density_reward/std": 0.17191730439662933, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 1.0246951580047607, "rewards/trajectory_similarity_reward/mean": 0.8076199293136597, "rewards/trajectory_similarity_reward/std": 0.32795584201812744, "step": 596 }, { "clip_ratio/high_max": 0.016674078069627285, "clip_ratio/high_mean": 0.0032966075523290783, "clip_ratio/low_mean": 0.001225441534188576, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00452204910106957, "entropy": 0.36253681778907776, "epoch": 0.48660213958227205, "grad_norm": 18.753732681274414, "learning_rate": 4.1075794621026896e-07, "loss": 5.8604, "reward": 2.7088162899017334, "reward_std": 1.9455974102020264, "rewards/reasoning_density_reward/mean": 0.3614955544471741, "rewards/reasoning_density_reward/std": 0.1415339782834053, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.4482120275497437, "rewards/trajectory_similarity_reward/mean": 0.47232070565223694, "rewards/trajectory_similarity_reward/std": 0.4113554358482361, "step": 597 }, { "clip_ratio/high_max": 0.021044696564786136, "clip_ratio/high_mean": 0.005602792807621881, "clip_ratio/low_mean": 0.0009453159327676985, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0065481087658554316, "entropy": 0.35568562895059586, "epoch": 0.48741721854304637, "grad_norm": 15.010366439819336, "learning_rate": 4.101059494702526e-07, "loss": 9.2363, "reward": 2.2364728450775146, "reward_std": 0.2964957654476166, "rewards/reasoning_density_reward/mean": 0.3297078013420105, "rewards/reasoning_density_reward/std": 0.1662147343158722, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.4067651331424713, "rewards/trajectory_similarity_reward/std": 0.4770828187465668, "step": 598 }, { "clip_ratio/high_max": 0.01866728503955528, "clip_ratio/high_mean": 0.006085613917093724, "clip_ratio/low_mean": 0.0009968574922822881, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.007082471449393779, "entropy": 0.34970155730843544, "epoch": 0.4882322975038207, "grad_norm": 15.020228385925293, "learning_rate": 4.0945395273023636e-07, "loss": 8.4769, "reward": 3.0070228576660156, "reward_std": 2.0165796279907227, "rewards/reasoning_density_reward/mean": 0.3786458373069763, "rewards/reasoning_density_reward/std": 0.15171760320663452, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.5658771395683289, "rewards/trajectory_similarity_reward/std": 0.4315800070762634, "step": 599 }, { "clip_ratio/high_max": 0.015136048255953938, "clip_ratio/high_mean": 0.0037473003831109963, "clip_ratio/low_mean": 0.0011298454264760949, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004877145802311134, "entropy": 0.3444668333977461, "epoch": 0.489047376464595, "grad_norm": 13.346331596374512, "learning_rate": 4.0880195599022e-07, "loss": 8.5062, "reward": 2.2854514122009277, "reward_std": 1.9860186576843262, "rewards/reasoning_density_reward/mean": 0.32176053524017334, "rewards/reasoning_density_reward/std": 0.18089346587657928, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.496871829032898, "rewards/trajectory_similarity_reward/mean": 0.3699409067630768, "rewards/trajectory_similarity_reward/std": 0.4077860414981842, "step": 600 }, { "clip_ratio/high_max": 0.015200530644506216, "clip_ratio/high_mean": 0.003149329946609214, "clip_ratio/low_mean": 0.0015401792770717293, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004689509281888604, "entropy": 0.37878959625959396, "epoch": 0.4898624554253693, "grad_norm": 12.3892183303833, "learning_rate": 4.0814995925020376e-07, "loss": 19.824, "reward": 1.8814313411712646, "reward_std": 1.7596986293792725, "rewards/reasoning_density_reward/mean": 0.2239583432674408, "rewards/reasoning_density_reward/std": 0.17148250341415405, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.496871829032898, "rewards/trajectory_similarity_reward/mean": 0.2512229084968567, "rewards/trajectory_similarity_reward/std": 0.33296331763267517, "step": 601 }, { "clip_ratio/high_max": 0.012223528872709721, "clip_ratio/high_mean": 0.002520384659874253, "clip_ratio/low_mean": 0.0019228220771765336, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004443206737050787, "entropy": 0.37664535269141197, "epoch": 0.49067753438614364, "grad_norm": 13.228918075561523, "learning_rate": 4.074979625101874e-07, "loss": -3.3784, "reward": 3.745124578475952, "reward_std": 0.6495696306228638, "rewards/reasoning_density_reward/mean": 0.4476190507411957, "rewards/reasoning_density_reward/std": 0.07962022721767426, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.6046693325042725, "rewards/trajectory_similarity_reward/mean": 0.578755259513855, "rewards/trajectory_similarity_reward/std": 0.31249740719795227, "step": 602 }, { "clip_ratio/high_max": 0.016302698786603287, "clip_ratio/high_mean": 0.0032728941914683674, "clip_ratio/low_mean": 0.0008643052133265883, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004137199372053146, "entropy": 0.3661930114030838, "epoch": 0.49149261334691796, "grad_norm": 15.935176849365234, "learning_rate": 4.0684596577017116e-07, "loss": 17.9134, "reward": 2.708522319793701, "reward_std": 2.082267999649048, "rewards/reasoning_density_reward/mean": 0.359375, "rewards/reasoning_density_reward/std": 0.1781560629606247, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.47414714097976685, "rewards/trajectory_similarity_reward/std": 0.3831002712249756, "step": 603 }, { "clip_ratio/high_max": 0.008245577540947124, "clip_ratio/high_mean": 0.0019025681940547656, "clip_ratio/low_mean": 0.0010687597678042948, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0029713279946008697, "entropy": 0.34687134996056557, "epoch": 0.49230769230769234, "grad_norm": 13.359745025634766, "learning_rate": 4.061939690301548e-07, "loss": 13.8818, "reward": 2.8433746099472046, "reward_std": 1.4413495063781738, "rewards/reasoning_density_reward/mean": 0.3390926718711853, "rewards/reasoning_density_reward/std": 0.17088667303323746, "rewards/success_reward/mean": 2.109375, "rewards/success_reward/std": 1.325729787349701, "rewards/trajectory_similarity_reward/mean": 0.39490702748298645, "rewards/trajectory_similarity_reward/std": 0.33088111877441406, "step": 604 }, { "clip_ratio/high_max": 0.01587693707551807, "clip_ratio/high_mean": 0.0031885761563898996, "clip_ratio/low_mean": 0.0011749086352210725, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004363484782516025, "entropy": 0.3444707319140434, "epoch": 0.49312277126846665, "grad_norm": 16.822750091552734, "learning_rate": 4.0554197229013856e-07, "loss": 12.853, "reward": 3.8424339294433594, "reward_std": 0.9349805116653442, "rewards/reasoning_density_reward/mean": 0.42395833134651184, "rewards/reasoning_density_reward/std": 0.15226303040981293, "rewards/success_reward/mean": 2.8125, "rewards/success_reward/std": 0.75, "rewards/trajectory_similarity_reward/mean": 0.6059756278991699, "rewards/trajectory_similarity_reward/std": 0.4073379635810852, "step": 605 }, { "clip_ratio/high_max": 0.014326575794257224, "clip_ratio/high_mean": 0.004307347961002961, "clip_ratio/low_mean": 0.0014611130936827976, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005768461036495864, "entropy": 0.3492964766919613, "epoch": 0.49393785022924097, "grad_norm": 11.880433082580566, "learning_rate": 4.048899755501222e-07, "loss": 5.168, "reward": 1.703645944595337, "reward_std": 1.951566219329834, "rewards/reasoning_density_reward/mean": 0.26614585518836975, "rewards/reasoning_density_reward/std": 0.15511253476142883, "rewards/success_reward/mean": 1.125, "rewards/success_reward/std": 1.3964240550994873, "rewards/trajectory_similarity_reward/mean": 0.3125, "rewards/trajectory_similarity_reward/std": 0.4787135720252991, "step": 606 }, { "clip_ratio/high_max": 0.008439980505499989, "clip_ratio/high_mean": 0.0013098371637170203, "clip_ratio/low_mean": 0.0019050235423492268, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0032148606260307133, "entropy": 0.3860839754343033, "epoch": 0.4947529291900153, "grad_norm": 13.462860107421875, "learning_rate": 4.042379788101059e-07, "loss": 0.6529, "reward": 2.1924238204956055, "reward_std": 1.0145924091339111, "rewards/reasoning_density_reward/mean": 0.15357142686843872, "rewards/reasoning_density_reward/std": 0.15920722484588623, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 0.670820415019989, "rewards/trajectory_similarity_reward/mean": 0.16385261714458466, "rewards/trajectory_similarity_reward/std": 0.32643353939056396, "step": 607 }, { "clip_ratio/high_max": 0.009012866823468357, "clip_ratio/high_mean": 0.0018454236269462854, "clip_ratio/low_mean": 0.0011399507966416422, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0029853743908461183, "entropy": 0.3582661300897598, "epoch": 0.4955680081507896, "grad_norm": 30.682567596435547, "learning_rate": 4.0358598207008966e-07, "loss": 11.8277, "reward": 2.5856773853302, "reward_std": 1.8839988708496094, "rewards/reasoning_density_reward/mean": 0.34375, "rewards/reasoning_density_reward/std": 0.18962682783603668, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.3964240550994873, "rewards/trajectory_similarity_reward/mean": 0.3669271767139435, "rewards/trajectory_similarity_reward/std": 0.36039838194847107, "step": 608 }, { "clip_ratio/high_max": 0.008890593773685396, "clip_ratio/high_mean": 0.0015765439238748513, "clip_ratio/low_mean": 0.0012163616265752353, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0027929056814173236, "entropy": 0.3756333068013191, "epoch": 0.4963830871115639, "grad_norm": 11.380719184875488, "learning_rate": 4.029339853300733e-07, "loss": 9.2531, "reward": 1.5138306617736816, "reward_std": 0.9364351630210876, "rewards/reasoning_density_reward/mean": 0.13906249403953552, "rewards/reasoning_density_reward/std": 0.1974775791168213, "rewards/success_reward/mean": 1.21875, "rewards/success_reward/std": 1.2512494325637817, "rewards/trajectory_similarity_reward/mean": 0.15601816773414612, "rewards/trajectory_similarity_reward/std": 0.27979376912117004, "step": 609 }, { "clip_ratio/high_max": 0.004478567803744227, "clip_ratio/high_mean": 0.0009979650567402132, "clip_ratio/low_mean": 0.0011241050669923425, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002122070152836386, "entropy": 0.38225798308849335, "epoch": 0.49719816607233824, "grad_norm": 10.38000202178955, "learning_rate": 4.0228198859005706e-07, "loss": 20.508, "reward": 1.5196212530136108, "reward_std": 1.1949071884155273, "rewards/reasoning_density_reward/mean": 0.2808035612106323, "rewards/reasoning_density_reward/std": 0.1919594407081604, "rewards/success_reward/mean": 0.9375, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.30131757259368896, "rewards/trajectory_similarity_reward/std": 0.46255844831466675, "step": 610 }, { "clip_ratio/high_max": 0.01850990968523547, "clip_ratio/high_mean": 0.003933230429538526, "clip_ratio/low_mean": 0.0016518271149834618, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005585057559073903, "entropy": 0.33438607677817345, "epoch": 0.49801324503311256, "grad_norm": 14.038783073425293, "learning_rate": 4.016299918500407e-07, "loss": 3.9181, "reward": 2.654411792755127, "reward_std": 1.8151758909225464, "rewards/reasoning_density_reward/mean": 0.3777901828289032, "rewards/reasoning_density_reward/std": 0.11190786212682724, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.2845232486724854, "rewards/trajectory_similarity_reward/mean": 0.401621550321579, "rewards/trajectory_similarity_reward/std": 0.42846906185150146, "step": 611 }, { "clip_ratio/high_max": 0.013585080800112337, "clip_ratio/high_mean": 0.002941684768302366, "clip_ratio/low_mean": 0.0013768811186309904, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004318565857829526, "entropy": 0.3741517625749111, "epoch": 0.49882832399388694, "grad_norm": 14.866117477416992, "learning_rate": 4.0097799511002446e-07, "loss": 2.1241, "reward": 1.8626463413238525, "reward_std": 1.3210163116455078, "rewards/reasoning_density_reward/mean": 0.18058034777641296, "rewards/reasoning_density_reward/std": 0.17842836678028107, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.157853603363037, "rewards/trajectory_similarity_reward/mean": 0.0883159413933754, "rewards/trajectory_similarity_reward/std": 0.21366721391677856, "step": 612 }, { "clip_ratio/high_max": 0.013791412056889385, "clip_ratio/high_mean": 0.0030310198562801816, "clip_ratio/low_mean": 0.00048493966460227966, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0035159595136065036, "entropy": 0.36052530631422997, "epoch": 0.49964340295466125, "grad_norm": 14.837129592895508, "learning_rate": 4.003259983700081e-07, "loss": -0.1726, "reward": 3.8621160984039307, "reward_std": 1.051047921180725, "rewards/reasoning_density_reward/mean": 0.43958336114883423, "rewards/reasoning_density_reward/std": 0.09287086874246597, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.6046693325042725, "rewards/trajectory_similarity_reward/mean": 0.7037826180458069, "rewards/trajectory_similarity_reward/std": 0.3809140920639038, "step": 613 }, { "clip_ratio/high_max": 0.010445821681059897, "clip_ratio/high_mean": 0.002348543028347194, "clip_ratio/low_mean": 0.0011013264702341985, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034498696004447993, "entropy": 0.36270686239004135, "epoch": 0.5004584819154355, "grad_norm": 15.83718204498291, "learning_rate": 3.9967400162999186e-07, "loss": 3.0967, "reward": 2.017586648464203, "reward_std": 1.1573643386363983, "rewards/reasoning_density_reward/mean": 0.29021576046943665, "rewards/reasoning_density_reward/std": 0.13782726228237152, "rewards/success_reward/mean": 1.453125, "rewards/success_reward/std": 1.3531213998794556, "rewards/trajectory_similarity_reward/mean": 0.2742459326982498, "rewards/trajectory_similarity_reward/std": 0.3538319915533066, "step": 614 }, { "clip_ratio/high_max": 0.017068785469746217, "clip_ratio/high_mean": 0.003690166035084985, "clip_ratio/low_mean": 0.0007494177916669287, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004439583761268295, "entropy": 0.38299374282360077, "epoch": 0.5012735608762099, "grad_norm": 13.033148765563965, "learning_rate": 3.9902200488997556e-07, "loss": -12.9027, "reward": 2.453125, "reward_std": 0.24728435277938843, "rewards/reasoning_density_reward/mean": 0.359375, "rewards/reasoning_density_reward/std": 0.16655205190181732, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.496871829032898, "rewards/trajectory_similarity_reward/mean": 0.5, "rewards/trajectory_similarity_reward/std": 0.5163977742195129, "step": 615 }, { "clip_ratio/high_max": 0.016024782555177808, "clip_ratio/high_mean": 0.004179618103080429, "clip_ratio/low_mean": 0.0006069241135264747, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004786542122019455, "entropy": 0.329314187169075, "epoch": 0.5020886398369843, "grad_norm": 14.701523780822754, "learning_rate": 3.9837000814995926e-07, "loss": -1.4874, "reward": 3.9917147159576416, "reward_std": 0.8753069639205933, "rewards/reasoning_density_reward/mean": 0.4671874940395355, "rewards/reasoning_density_reward/std": 0.07229497283697128, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.8158584833145142, "rewards/trajectory_similarity_reward/mean": 0.8057771921157837, "rewards/trajectory_similarity_reward/std": 0.3245881497859955, "step": 616 }, { "clip_ratio/high_max": 0.014648964861407876, "clip_ratio/high_mean": 0.003759691971936263, "clip_ratio/low_mean": 0.0006567689997609705, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0044164610299048945, "entropy": 0.3127261511981487, "epoch": 0.5029037187977585, "grad_norm": 16.93784523010254, "learning_rate": 3.9771801140994296e-07, "loss": 6.2182, "reward": 2.7484335899353027, "reward_std": 0.658659428358078, "rewards/reasoning_density_reward/mean": 0.3968749940395355, "rewards/reasoning_density_reward/std": 0.08384547010064125, "rewards/success_reward/mean": 1.921875, "rewards/success_reward/std": 0.8510740399360657, "rewards/trajectory_similarity_reward/mean": 0.4296836256980896, "rewards/trajectory_similarity_reward/std": 0.3016180396080017, "step": 617 }, { "clip_ratio/high_max": 0.015147597528994083, "clip_ratio/high_mean": 0.00432334428478498, "clip_ratio/low_mean": 0.0006657042831648141, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004989048451534472, "entropy": 0.31382225826382637, "epoch": 0.5037187977585329, "grad_norm": 17.096071243286133, "learning_rate": 3.9706601466992666e-07, "loss": -8.7725, "reward": 3.638206124305725, "reward_std": 1.4062729477882385, "rewards/reasoning_density_reward/mean": 0.4091145843267441, "rewards/reasoning_density_reward/std": 0.1289711482822895, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 0.9796755611896515, "rewards/trajectory_similarity_reward/mean": 0.6978415548801422, "rewards/trajectory_similarity_reward/std": 0.3967580199241638, "step": 618 }, { "clip_ratio/high_max": 0.01446433481760323, "clip_ratio/high_mean": 0.002601201835204847, "clip_ratio/low_mean": 0.0007836033000785392, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0033848050916276406, "entropy": 0.385078564286232, "epoch": 0.5045338767193072, "grad_norm": 11.828485488891602, "learning_rate": 3.9641401792991036e-07, "loss": -0.2919, "reward": 2.7943739891052246, "reward_std": 0.7178789973258972, "rewards/reasoning_density_reward/mean": 0.3723214268684387, "rewards/reasoning_density_reward/std": 0.17476661503314972, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.3964240550994873, "rewards/trajectory_similarity_reward/mean": 0.5470526218414307, "rewards/trajectory_similarity_reward/std": 0.5018967986106873, "step": 619 }, { "clip_ratio/high_max": 0.011616812262218446, "clip_ratio/high_mean": 0.0021796357541461475, "clip_ratio/low_mean": 0.0015605756270815618, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003740211308468133, "entropy": 0.3964426927268505, "epoch": 0.5053489556800815, "grad_norm": 15.567601203918457, "learning_rate": 3.9576202118989406e-07, "loss": -7.7476, "reward": 1.733097493648529, "reward_std": 1.8104114532470703, "rewards/reasoning_density_reward/mean": 0.2977689951658249, "rewards/reasoning_density_reward/std": 0.14355003088712692, "rewards/success_reward/mean": 1.125, "rewards/success_reward/std": 1.4456666707992554, "rewards/trajectory_similarity_reward/mean": 0.3103284388780594, "rewards/trajectory_similarity_reward/std": 0.45008158683776855, "step": 620 }, { "clip_ratio/high_max": 0.013555237324908376, "clip_ratio/high_mean": 0.00250417462666519, "clip_ratio/low_mean": 0.0017210840342158917, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0042252586426911876, "entropy": 0.33415190875530243, "epoch": 0.5061640346408558, "grad_norm": 14.21523380279541, "learning_rate": 3.9511002444987776e-07, "loss": 1.3677, "reward": 2.8068342208862305, "reward_std": 1.27742338180542, "rewards/reasoning_density_reward/mean": 0.3218750059604645, "rewards/reasoning_density_reward/std": 0.19405218958854675, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.3098187446594238, "rewards/trajectory_similarity_reward/mean": 0.5162090063095093, "rewards/trajectory_similarity_reward/std": 0.4744463860988617, "step": 621 }, { "clip_ratio/high_max": 0.015014604607131332, "clip_ratio/high_mean": 0.003010186235769652, "clip_ratio/low_mean": 0.0019285200323793106, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004938706348184496, "entropy": 0.3583928011357784, "epoch": 0.5069791136016302, "grad_norm": 21.27558135986328, "learning_rate": 3.944580277098614e-07, "loss": 8.3489, "reward": 3.0966925621032715, "reward_std": 1.0676543712615967, "rewards/reasoning_density_reward/mean": 0.3433035612106323, "rewards/reasoning_density_reward/std": 0.16904029250144958, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 0.7685213088989258, "rewards/trajectory_similarity_reward/mean": 0.4096388816833496, "rewards/trajectory_similarity_reward/std": 0.4800129234790802, "step": 622 }, { "clip_ratio/high_max": 0.012006921169813722, "clip_ratio/high_mean": 0.0028114653105149046, "clip_ratio/low_mean": 0.0015468877136299852, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0043583530496107414, "entropy": 0.355144415050745, "epoch": 0.5077941925624044, "grad_norm": 15.094049453735352, "learning_rate": 3.938060309698451e-07, "loss": -6.1199, "reward": 2.8955243825912476, "reward_std": 1.1124079823493958, "rewards/reasoning_density_reward/mean": 0.31814631819725037, "rewards/reasoning_density_reward/std": 0.15510524064302444, "rewards/success_reward/mean": 2.203125, "rewards/success_reward/std": 1.029909372329712, "rewards/trajectory_similarity_reward/mean": 0.37425291538238525, "rewards/trajectory_similarity_reward/std": 0.4373335540294647, "step": 623 }, { "clip_ratio/high_max": 0.013292582239955664, "clip_ratio/high_mean": 0.0029779762553516775, "clip_ratio/low_mean": 0.0009919719450408593, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003969948185840622, "entropy": 0.36307232454419136, "epoch": 0.5086092715231788, "grad_norm": 14.01499080657959, "learning_rate": 3.931540342298288e-07, "loss": -3.6692, "reward": 1.3555946350097656, "reward_std": 1.0132015943527222, "rewards/reasoning_density_reward/mean": 0.2723214328289032, "rewards/reasoning_density_reward/std": 0.10474702715873718, "rewards/success_reward/mean": 1.03125, "rewards/success_reward/std": 0.9031196236610413, "rewards/trajectory_similarity_reward/mean": 0.05202318727970123, "rewards/trajectory_similarity_reward/std": 0.20809276401996613, "step": 624 }, { "clip_ratio/high_max": 0.013056779222097248, "clip_ratio/high_mean": 0.0030788336662226357, "clip_ratio/low_mean": 0.00129348265909357, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004372316267108545, "entropy": 0.35636478289961815, "epoch": 0.5094243504839532, "grad_norm": 12.881514549255371, "learning_rate": 3.925020374898125e-07, "loss": 2.3674, "reward": 3.2796852588653564, "reward_std": 0.8760370016098022, "rewards/reasoning_density_reward/mean": 0.4177083373069763, "rewards/reasoning_density_reward/std": 0.11602501571178436, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 0.670820415019989, "rewards/trajectory_similarity_reward/mean": 0.23697693645954132, "rewards/trajectory_similarity_reward/std": 0.31728604435920715, "step": 625 }, { "clip_ratio/high_max": 0.01749666253454052, "clip_ratio/high_mean": 0.004492772259254707, "clip_ratio/low_mean": 0.0012433035299181938, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00573607573096524, "entropy": 0.3335145004093647, "epoch": 0.5102394294447274, "grad_norm": 19.04633331298828, "learning_rate": 3.918500407497962e-07, "loss": 10.689, "reward": 3.2850193977355957, "reward_std": 1.7149498462677002, "rewards/reasoning_density_reward/mean": 0.4047619104385376, "rewards/reasoning_density_reward/std": 0.16765692830085754, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.5365073680877686, "rewards/trajectory_similarity_reward/std": 0.36331117153167725, "step": 626 }, { "clip_ratio/high_max": 0.017390119726769626, "clip_ratio/high_mean": 0.003554816954419948, "clip_ratio/low_mean": 0.0011615079856710508, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0047163249691948295, "entropy": 0.3472238890826702, "epoch": 0.5110545084055018, "grad_norm": 15.77662467956543, "learning_rate": 3.911980440097799e-07, "loss": 7.2969, "reward": 2.6804686784744263, "reward_std": 1.4430390000343323, "rewards/reasoning_density_reward/mean": 0.3536830395460129, "rewards/reasoning_density_reward/std": 0.16383542865514755, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.277839720249176, "rewards/trajectory_similarity_reward/mean": 0.45178554952144623, "rewards/trajectory_similarity_reward/std": 0.4687570780515671, "step": 627 }, { "clip_ratio/high_max": 0.013563326268922538, "clip_ratio/high_mean": 0.003419325912545901, "clip_ratio/low_mean": 0.000704400590620935, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004123726554098539, "entropy": 0.35702960938215256, "epoch": 0.5118695873662761, "grad_norm": 19.7922306060791, "learning_rate": 3.905460472697636e-07, "loss": 4.2735, "reward": 1.698409080505371, "reward_std": 1.851373314857483, "rewards/reasoning_density_reward/mean": 0.21454274654388428, "rewards/reasoning_density_reward/std": 0.15582375228405, "rewards/success_reward/mean": 1.21875, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.26511645317077637, "rewards/trajectory_similarity_reward/std": 0.3823077380657196, "step": 628 }, { "clip_ratio/high_max": 0.012219763710163534, "clip_ratio/high_mean": 0.0020373940642457455, "clip_ratio/low_mean": 0.0006603385409107432, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002697732619708404, "entropy": 0.35615766048431396, "epoch": 0.5126846663270505, "grad_norm": 13.712018013000488, "learning_rate": 3.8989405052974736e-07, "loss": 8.4171, "reward": 2.173374891281128, "reward_std": 0.24707689881324768, "rewards/reasoning_density_reward/mean": 0.2802083194255829, "rewards/reasoning_density_reward/std": 0.205770343542099, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.39316678047180176, "rewards/trajectory_similarity_reward/std": 0.4208589196205139, "step": 629 }, { "clip_ratio/high_max": 0.011378217372111976, "clip_ratio/high_mean": 0.002090569309075363, "clip_ratio/low_mean": 0.0004846433403145056, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0025752126675797626, "entropy": 0.3749445080757141, "epoch": 0.5134997452878247, "grad_norm": 12.965142250061035, "learning_rate": 3.8924205378973106e-07, "loss": 13.1162, "reward": 3.432776689529419, "reward_std": 1.0365281105041504, "rewards/reasoning_density_reward/mean": 0.3555803894996643, "rewards/reasoning_density_reward/std": 0.16550111770629883, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.6396963596343994, "rewards/trajectory_similarity_reward/std": 0.38957855105400085, "step": 630 }, { "clip_ratio/high_max": 0.01427154877455905, "clip_ratio/high_mean": 0.002243930437543895, "clip_ratio/low_mean": 0.0014023902840563096, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0036463207434280775, "entropy": 0.37803400680422783, "epoch": 0.5143148242485991, "grad_norm": 11.531110763549805, "learning_rate": 3.8859005704971476e-07, "loss": 5.3951, "reward": 2.3415815830230713, "reward_std": 2.0642004013061523, "rewards/reasoning_density_reward/mean": 0.24114583432674408, "rewards/reasoning_density_reward/std": 0.17393775284290314, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.41293561458587646, "rewards/trajectory_similarity_reward/std": 0.38269859552383423, "step": 631 }, { "clip_ratio/high_max": 0.017488561454229057, "clip_ratio/high_mean": 0.00478088142699562, "clip_ratio/low_mean": 0.0005064025644969661, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005287283973302692, "entropy": 0.3701139725744724, "epoch": 0.5151299032093735, "grad_norm": 12.08208179473877, "learning_rate": 3.8793806030969845e-07, "loss": -1.6436, "reward": 3.343620777130127, "reward_std": 1.5129845142364502, "rewards/reasoning_density_reward/mean": 0.41874998807907104, "rewards/reasoning_density_reward/std": 0.14244882762432098, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.0911576747894287, "rewards/trajectory_similarity_reward/mean": 0.5811207294464111, "rewards/trajectory_similarity_reward/std": 0.4350942075252533, "step": 632 }, { "clip_ratio/high_max": 0.015816640574485064, "clip_ratio/high_mean": 0.004110494453925639, "clip_ratio/low_mean": 0.0013613439950859174, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005471838405355811, "entropy": 0.34037452936172485, "epoch": 0.5159449821701477, "grad_norm": 19.836402893066406, "learning_rate": 3.8728606356968215e-07, "loss": 6.528, "reward": 3.0148433446884155, "reward_std": 1.9149958491325378, "rewards/reasoning_density_reward/mean": 0.38463540375232697, "rewards/reasoning_density_reward/std": 0.1457921490073204, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.420820415019989, "rewards/trajectory_similarity_reward/mean": 0.5677078366279602, "rewards/trajectory_similarity_reward/std": 0.41041384637355804, "step": 633 }, { "clip_ratio/high_max": 0.012403137690853328, "clip_ratio/high_mean": 0.002579752072051633, "clip_ratio/low_mean": 0.001146665854321327, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037264179554767907, "entropy": 0.3577021099627018, "epoch": 0.5167600611309221, "grad_norm": 14.387861251831055, "learning_rate": 3.8663406682966585e-07, "loss": -2.6066, "reward": 1.2099995613098145, "reward_std": 1.6990735530853271, "rewards/reasoning_density_reward/mean": 0.2674106955528259, "rewards/reasoning_density_reward/std": 0.12788091599941254, "rewards/success_reward/mean": 0.75, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.19258882105350494, "rewards/trajectory_similarity_reward/std": 0.3754650354385376, "step": 634 }, { "clip_ratio/high_max": 0.01129554896033369, "clip_ratio/high_mean": 0.002686354022443993, "clip_ratio/low_mean": 0.0016613635525573045, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0043477175058797, "entropy": 0.35952113568782806, "epoch": 0.5175751400916964, "grad_norm": 12.490074157714844, "learning_rate": 3.8598207008964955e-07, "loss": -7.6031, "reward": 2.1842474937438965, "reward_std": 2.0964198112487793, "rewards/reasoning_density_reward/mean": 0.3051046133041382, "rewards/reasoning_density_reward/std": 0.164179727435112, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.3791426718235016, "rewards/trajectory_similarity_reward/std": 0.40435361862182617, "step": 635 }, { "clip_ratio/high_max": 0.012848534301156178, "clip_ratio/high_mean": 0.0033929917808563914, "clip_ratio/low_mean": 0.0007505739340558648, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0041435657476540655, "entropy": 0.3413362540304661, "epoch": 0.5183902190524707, "grad_norm": 23.340682983398438, "learning_rate": 3.8533007334963325e-07, "loss": 2.3395, "reward": 3.5103445053100586, "reward_std": 1.5220084190368652, "rewards/reasoning_density_reward/mean": 0.44999998807907104, "rewards/reasoning_density_reward/std": 0.08944271504878998, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.6228446364402771, "rewards/trajectory_similarity_reward/std": 0.3845904767513275, "step": 636 }, { "clip_ratio/high_max": 0.015212594880722463, "clip_ratio/high_mean": 0.0036649461835622787, "clip_ratio/low_mean": 0.0007091951847542077, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004374141455627978, "entropy": 0.34401702880859375, "epoch": 0.519205298013245, "grad_norm": 13.785469055175781, "learning_rate": 3.8467807660961695e-07, "loss": 3.5179, "reward": 2.687380313873291, "reward_std": 1.7807518243789673, "rewards/reasoning_density_reward/mean": 0.3645833432674408, "rewards/reasoning_density_reward/std": 0.17017148435115814, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.3964240550994873, "rewards/trajectory_similarity_reward/mean": 0.44779711961746216, "rewards/trajectory_similarity_reward/std": 0.41971585154533386, "step": 637 }, { "clip_ratio/high_max": 0.01939675840549171, "clip_ratio/high_mean": 0.004379628429887816, "clip_ratio/low_mean": 0.0010521410695218947, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005431769444840029, "entropy": 0.3467046059668064, "epoch": 0.5200203769740194, "grad_norm": 14.241697311401367, "learning_rate": 3.8402607986960065e-07, "loss": 0.0299, "reward": 4.205530166625977, "reward_std": 0.6011416018009186, "rewards/reasoning_density_reward/mean": 0.45838913321495056, "rewards/reasoning_density_reward/std": 0.08787490427494049, "rewards/success_reward/mean": 2.859375, "rewards/success_reward/std": 0.5625, "rewards/trajectory_similarity_reward/mean": 0.8877660632133484, "rewards/trajectory_similarity_reward/std": 0.24974364042282104, "step": 638 }, { "clip_ratio/high_max": 0.015095743641722947, "clip_ratio/high_mean": 0.003734822450496722, "clip_ratio/low_mean": 0.00012470574074541219, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0038595281657762825, "entropy": 0.35295526310801506, "epoch": 0.5208354559347936, "grad_norm": 9.669678688049316, "learning_rate": 3.833740831295843e-07, "loss": -0.3965, "reward": 2.8342885971069336, "reward_std": 1.1654866933822632, "rewards/reasoning_density_reward/mean": 0.24174107611179352, "rewards/reasoning_density_reward/std": 0.22729448974132538, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 0.9437293410301208, "rewards/trajectory_similarity_reward/mean": 0.43629759550094604, "rewards/trajectory_similarity_reward/std": 0.45745620131492615, "step": 639 }, { "clip_ratio/high_max": 0.008056596183450893, "clip_ratio/high_mean": 0.0013999901020724792, "clip_ratio/low_mean": 0.000763174393796362, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002163164463127032, "entropy": 0.36389410123229027, "epoch": 0.521650534895568, "grad_norm": 14.153995513916016, "learning_rate": 3.82722086389568e-07, "loss": 5.469, "reward": 3.4880313873291016, "reward_std": 1.6196653842926025, "rewards/reasoning_density_reward/mean": 0.42023810744285583, "rewards/reasoning_density_reward/std": 0.11736912280321121, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.6302932500839233, "rewards/trajectory_similarity_reward/std": 0.34733855724334717, "step": 640 }, { "clip_ratio/high_max": 0.016949408687651157, "clip_ratio/high_mean": 0.004250652506016195, "clip_ratio/low_mean": 0.0009324510538135655, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005183103523449972, "entropy": 0.3551412709057331, "epoch": 0.5224656138563424, "grad_norm": 18.06229591369629, "learning_rate": 3.820700896495517e-07, "loss": -0.4668, "reward": 3.27423357963562, "reward_std": 1.4791224002838135, "rewards/reasoning_density_reward/mean": 0.4036458432674408, "rewards/reasoning_density_reward/std": 0.09294407069683075, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.0911576747894287, "rewards/trajectory_similarity_reward/mean": 0.526837944984436, "rewards/trajectory_similarity_reward/std": 0.3686467707157135, "step": 641 }, { "clip_ratio/high_max": 0.014849927742034197, "clip_ratio/high_mean": 0.002794254723994527, "clip_ratio/low_mean": 0.0007891691057011485, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0035834238879033364, "entropy": 0.38918446004390717, "epoch": 0.5232806928171166, "grad_norm": 14.085144996643066, "learning_rate": 3.814180929095354e-07, "loss": 10.047, "reward": 2.434030294418335, "reward_std": 1.3912667036056519, "rewards/reasoning_density_reward/mean": 0.20907452702522278, "rewards/reasoning_density_reward/std": 0.1778489053249359, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.44370588660240173, "rewards/trajectory_similarity_reward/std": 0.41737812757492065, "step": 642 }, { "clip_ratio/high_max": 0.016160635510459542, "clip_ratio/high_mean": 0.0027567616489250213, "clip_ratio/low_mean": 0.0016225472827500198, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004379308986244723, "entropy": 0.36273622512817383, "epoch": 0.524095771777891, "grad_norm": 13.428933143615723, "learning_rate": 3.807660961695191e-07, "loss": 6.0591, "reward": 1.8978757858276367, "reward_std": 1.4930331707000732, "rewards/reasoning_density_reward/mean": 0.30677083134651184, "rewards/reasoning_density_reward/std": 0.14282917976379395, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.2786048650741577, "rewards/trajectory_similarity_reward/std": 0.38810643553733826, "step": 643 }, { "clip_ratio/high_max": 0.015682303928770125, "clip_ratio/high_mean": 0.0029817139875376597, "clip_ratio/low_mean": 0.002126689338183496, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005108403303893283, "entropy": 0.34391093999147415, "epoch": 0.5249108507386653, "grad_norm": 15.846458435058594, "learning_rate": 3.8011409942950285e-07, "loss": 0.0504, "reward": 3.1963560581207275, "reward_std": 1.0733088254928589, "rewards/reasoning_density_reward/mean": 0.43958336114883423, "rewards/reasoning_density_reward/std": 0.09287086874246597, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.506772518157959, "rewards/trajectory_similarity_reward/std": 0.32536864280700684, "step": 644 }, { "clip_ratio/high_max": 0.015174049010965973, "clip_ratio/high_mean": 0.0034525398586993106, "clip_ratio/low_mean": 0.0010749925750133116, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004527532466454431, "entropy": 0.3395114652812481, "epoch": 0.5257259296994397, "grad_norm": 13.821903228759766, "learning_rate": 3.7946210268948655e-07, "loss": -0.4747, "reward": 2.4886932373046875, "reward_std": 2.0915608406066895, "rewards/reasoning_density_reward/mean": 0.3090745210647583, "rewards/reasoning_density_reward/std": 0.15642312169075012, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.49211880564689636, "rewards/trajectory_similarity_reward/std": 0.4588947594165802, "step": 645 }, { "clip_ratio/high_max": 0.014539907744619995, "clip_ratio/high_mean": 0.0028540076527860947, "clip_ratio/low_mean": 0.0016761870101618115, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00453019465203397, "entropy": 0.3564419038593769, "epoch": 0.5265410086602139, "grad_norm": 17.699708938598633, "learning_rate": 3.7881010594947025e-07, "loss": 14.7464, "reward": 3.826367735862732, "reward_std": 0.6932279467582703, "rewards/reasoning_density_reward/mean": 0.41763167083263397, "rewards/reasoning_density_reward/std": 0.14210275560617447, "rewards/success_reward/mean": 2.671875, "rewards/success_reward/std": 0.6104557514190674, "rewards/trajectory_similarity_reward/mean": 0.736860990524292, "rewards/trajectory_similarity_reward/std": 0.30156541615724564, "step": 646 }, { "clip_ratio/high_max": 0.019803798641078174, "clip_ratio/high_mean": 0.004484699165914208, "clip_ratio/low_mean": 0.0008255661159637384, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005310265289153904, "entropy": 0.32161541655659676, "epoch": 0.5273560876209883, "grad_norm": 14.354945182800293, "learning_rate": 3.7815810920945395e-07, "loss": 3.8395, "reward": 1.018324851989746, "reward_std": 0.9930275082588196, "rewards/reasoning_density_reward/mean": 0.3270833492279053, "rewards/reasoning_density_reward/std": 0.06082001328468323, "rewards/success_reward/mean": 0.5625, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.1287415474653244, "rewards/trajectory_similarity_reward/std": 0.2833250164985657, "step": 647 }, { "clip_ratio/high_max": 0.009432106948224828, "clip_ratio/high_mean": 0.0014709100250911433, "clip_ratio/low_mean": 0.0022634924243902788, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037344024458434433, "entropy": 0.3287965841591358, "epoch": 0.5281711665817627, "grad_norm": 14.810388565063477, "learning_rate": 3.7750611246943765e-07, "loss": 7.8752, "reward": 2.6847198009490967, "reward_std": 0.7858703136444092, "rewards/reasoning_density_reward/mean": 0.39375001192092896, "rewards/reasoning_density_reward/std": 0.14361406862735748, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.509719729423523, "rewards/trajectory_similarity_reward/std": 0.46672895550727844, "step": 648 }, { "clip_ratio/high_max": 0.01899617852177471, "clip_ratio/high_mean": 0.0048587565252091736, "clip_ratio/low_mean": 0.0014510203400277533, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.006309776799753308, "entropy": 0.34698784351348877, "epoch": 0.5289862455425369, "grad_norm": 14.876039505004883, "learning_rate": 3.7685411572942135e-07, "loss": 3.3499, "reward": 3.8287124633789062, "reward_std": 0.6697445213794708, "rewards/reasoning_density_reward/mean": 0.4223586320877075, "rewards/reasoning_density_reward/std": 0.12500110268592834, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.5465351641178131, "rewards/trajectory_similarity_reward/mean": 0.6876038312911987, "rewards/trajectory_similarity_reward/std": 0.36332501471042633, "step": 649 }, { "clip_ratio/high_max": 0.015397770912386477, "clip_ratio/high_mean": 0.0033603148913243786, "clip_ratio/low_mean": 0.0009053160611074418, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004265630850568414, "entropy": 0.3505757972598076, "epoch": 0.5298013245033113, "grad_norm": 16.34187126159668, "learning_rate": 3.7620211898940505e-07, "loss": 2.9841, "reward": 1.8233585357666016, "reward_std": 1.3480337858200073, "rewards/reasoning_density_reward/mean": 0.250927209854126, "rewards/reasoning_density_reward/std": 0.15150956809520721, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.0201103687286377, "rewards/trajectory_similarity_reward/mean": 0.16618137061595917, "rewards/trajectory_similarity_reward/std": 0.3644440472126007, "step": 650 }, { "clip_ratio/high_max": 0.010928235831670463, "clip_ratio/high_mean": 0.0025149241409962997, "clip_ratio/low_mean": 0.0012505032209446654, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003765427536563948, "entropy": 0.3590315170586109, "epoch": 0.5306164034640856, "grad_norm": 17.34012222290039, "learning_rate": 3.7555012224938875e-07, "loss": 12.6321, "reward": 2.670943021774292, "reward_std": 1.5439822673797607, "rewards/reasoning_density_reward/mean": 0.327938973903656, "rewards/reasoning_density_reward/std": 0.15793174505233765, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.3098187446594238, "rewards/trajectory_similarity_reward/mean": 0.374254047870636, "rewards/trajectory_similarity_reward/std": 0.39401915669441223, "step": 651 }, { "clip_ratio/high_max": 0.018944877665489912, "clip_ratio/high_mean": 0.0048643275804352015, "clip_ratio/low_mean": 0.0008498473762301728, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005714174942113459, "entropy": 0.32850073650479317, "epoch": 0.5314314824248599, "grad_norm": 15.749582290649414, "learning_rate": 3.7489812550937245e-07, "loss": -4.0076, "reward": 3.635259509086609, "reward_std": 1.2609368562698364, "rewards/reasoning_density_reward/mean": 0.4365513324737549, "rewards/reasoning_density_reward/std": 0.11139129102230072, "rewards/success_reward/mean": 2.578125, "rewards/success_reward/std": 0.947025716304779, "rewards/trajectory_similarity_reward/mean": 0.6205831468105316, "rewards/trajectory_similarity_reward/std": 0.36075566709041595, "step": 652 }, { "clip_ratio/high_max": 0.01823967508971691, "clip_ratio/high_mean": 0.005453666904941201, "clip_ratio/low_mean": 0.0008235405766754411, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.006277207357925363, "entropy": 0.3353723995387554, "epoch": 0.5322465613856342, "grad_norm": 15.260651588439941, "learning_rate": 3.7424612876935615e-07, "loss": -4.3223, "reward": 1.018505573272705, "reward_std": 1.4120161533355713, "rewards/reasoning_density_reward/mean": 0.25208336114883423, "rewards/reasoning_density_reward/std": 0.1276388317346573, "rewards/success_reward/mean": 0.65625, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.11017228662967682, "rewards/trajectory_similarity_reward/std": 0.24237826466560364, "step": 653 }, { "clip_ratio/high_max": 0.006244305957807228, "clip_ratio/high_mean": 0.0013401689029706176, "clip_ratio/low_mean": 0.001850996384746395, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0031911652549752034, "entropy": 0.3740267865359783, "epoch": 0.5330616403464086, "grad_norm": 14.094551086425781, "learning_rate": 3.7359413202933985e-07, "loss": 2.867, "reward": 3.1225719451904297, "reward_std": 1.0088235139846802, "rewards/reasoning_density_reward/mean": 0.3739786148071289, "rewards/reasoning_density_reward/std": 0.1489298939704895, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.2247449159622192, "rewards/trajectory_similarity_reward/mean": 0.4985933303833008, "rewards/trajectory_similarity_reward/std": 0.4264718294143677, "step": 654 }, { "clip_ratio/high_max": 0.015357454540207982, "clip_ratio/high_mean": 0.00305536795349326, "clip_ratio/low_mean": 0.0006810104823671281, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003736378377652727, "entropy": 0.32257793843746185, "epoch": 0.5338767193071828, "grad_norm": 14.528532981872559, "learning_rate": 3.729421352893235e-07, "loss": -1.4448, "reward": 3.260202646255493, "reward_std": 1.1902587413787842, "rewards/reasoning_density_reward/mean": 0.40937501192092896, "rewards/reasoning_density_reward/std": 0.14255847036838531, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.6008276343345642, "rewards/trajectory_similarity_reward/std": 0.3833599090576172, "step": 655 }, { "clip_ratio/high_max": 0.01567773730494082, "clip_ratio/high_mean": 0.0027609093522187322, "clip_ratio/low_mean": 0.00039236063457792625, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0031532700231764466, "entropy": 0.30487221851944923, "epoch": 0.5346917982679572, "grad_norm": 13.018877029418945, "learning_rate": 3.722901385493072e-07, "loss": 9.0813, "reward": 2.921314239501953, "reward_std": 1.882710337638855, "rewards/reasoning_density_reward/mean": 0.380638986825943, "rewards/reasoning_density_reward/std": 0.08256785571575165, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.5719252228736877, "rewards/trajectory_similarity_reward/std": 0.4661480784416199, "step": 656 }, { "clip_ratio/high_max": 0.017433667089790106, "clip_ratio/high_mean": 0.004211818188196048, "clip_ratio/low_mean": 0.0003873798304994125, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004599197971401736, "entropy": 0.3393080160021782, "epoch": 0.5355068772287316, "grad_norm": 11.741144180297852, "learning_rate": 3.716381418092909e-07, "loss": -0.5325, "reward": 3.835603713989258, "reward_std": 1.0677911937236786, "rewards/reasoning_density_reward/mean": 0.4074692130088806, "rewards/reasoning_density_reward/std": 0.14662928134202957, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.8080127239227295, "rewards/trajectory_similarity_reward/mean": 0.7093843817710876, "rewards/trajectory_similarity_reward/std": 0.3407013416290283, "step": 657 }, { "clip_ratio/high_max": 0.016022762982174754, "clip_ratio/high_mean": 0.004194334600470029, "clip_ratio/low_mean": 0.0009382594071212225, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005132594000315294, "entropy": 0.35252029076218605, "epoch": 0.5363219561895058, "grad_norm": 15.2737455368042, "learning_rate": 3.7098614506927465e-07, "loss": 2.1536, "reward": 2.398186445236206, "reward_std": 1.7157347202301025, "rewards/reasoning_density_reward/mean": 0.284970223903656, "rewards/reasoning_density_reward/std": 0.18733061850070953, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.3964240550994873, "rewards/trajectory_similarity_reward/mean": 0.23821620643138885, "rewards/trajectory_similarity_reward/std": 0.2797124683856964, "step": 658 }, { "clip_ratio/high_max": 0.015642416547052562, "clip_ratio/high_mean": 0.0033054719970095903, "clip_ratio/low_mean": 0.0006256397100514732, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003931111772544682, "entropy": 0.3648645766079426, "epoch": 0.5371370351502802, "grad_norm": 14.122940063476562, "learning_rate": 3.7033414832925835e-07, "loss": 0.2278, "reward": 1.921875, "reward_std": 0.6514450311660767, "rewards/reasoning_density_reward/mean": 0.234375, "rewards/reasoning_density_reward/std": 0.23432083427906036, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.375, "rewards/trajectory_similarity_reward/std": 0.5, "step": 659 }, { "clip_ratio/high_max": 0.01259913295507431, "clip_ratio/high_mean": 0.002359595804591663, "clip_ratio/low_mean": 0.002513596278731711, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004873192170634866, "entropy": 0.35899240523576736, "epoch": 0.5379521141110545, "grad_norm": 15.788312911987305, "learning_rate": 3.6968215158924205e-07, "loss": 7.5729, "reward": 2.306032180786133, "reward_std": 0.7774226665496826, "rewards/reasoning_density_reward/mean": 0.3531250059604645, "rewards/reasoning_density_reward/std": 0.1783897876739502, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.2654072344303131, "rewards/trajectory_similarity_reward/std": 0.32653287053108215, "step": 660 }, { "clip_ratio/high_max": 0.01400639972416684, "clip_ratio/high_mean": 0.002932940908067394, "clip_ratio/low_mean": 0.0019581725864554755, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0048911135236267, "entropy": 0.3630937971174717, "epoch": 0.5387671930718289, "grad_norm": 15.905187606811523, "learning_rate": 3.6903015484922575e-07, "loss": 10.3517, "reward": 2.584617853164673, "reward_std": 1.0659394264221191, "rewards/reasoning_density_reward/mean": 0.3604166507720947, "rewards/reasoning_density_reward/std": 0.12544366717338562, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.1618950366973877, "rewards/trajectory_similarity_reward/mean": 0.3492012023925781, "rewards/trajectory_similarity_reward/std": 0.43638888001441956, "step": 661 }, { "clip_ratio/high_max": 0.016129092895425856, "clip_ratio/high_mean": 0.003172045762767084, "clip_ratio/low_mean": 0.000582954213314224, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037549999251496047, "entropy": 0.36382075399160385, "epoch": 0.5395822720326031, "grad_norm": 16.85665512084961, "learning_rate": 3.6837815810920945e-07, "loss": 5.7703, "reward": 2.1569199562072754, "reward_std": 1.5146679878234863, "rewards/reasoning_density_reward/mean": 0.26409968733787537, "rewards/reasoning_density_reward/std": 0.15333279222249985, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.3794710636138916, "rewards/trajectory_similarity_reward/mean": 0.2990701496601105, "rewards/trajectory_similarity_reward/std": 0.3560478836297989, "step": 662 }, { "clip_ratio/high_max": 0.009553272218909115, "clip_ratio/high_mean": 0.0019421610559220426, "clip_ratio/low_mean": 0.0012262912350706756, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0031684523564763367, "entropy": 0.35457026585936546, "epoch": 0.5403973509933775, "grad_norm": 13.499734878540039, "learning_rate": 3.6772616136919315e-07, "loss": -10.2373, "reward": 1.9065449237823486, "reward_std": 1.8111214637756348, "rewards/reasoning_density_reward/mean": 0.3031250238418579, "rewards/reasoning_density_reward/std": 0.15542280673980713, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.2909199893474579, "rewards/trajectory_similarity_reward/std": 0.4176054298877716, "step": 663 }, { "clip_ratio/high_max": 0.01419818343129009, "clip_ratio/high_mean": 0.002633813361171633, "clip_ratio/low_mean": 0.001565919621498324, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004199732837150805, "entropy": 0.36051972582936287, "epoch": 0.5412124299541519, "grad_norm": 15.238373756408691, "learning_rate": 3.6707416462917685e-07, "loss": 9.7671, "reward": 2.578284740447998, "reward_std": 1.9579298496246338, "rewards/reasoning_density_reward/mean": 0.3147321343421936, "rewards/reasoning_density_reward/std": 0.22822099924087524, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.4823026657104492, "rewards/trajectory_similarity_reward/std": 0.44263774156570435, "step": 664 }, { "clip_ratio/high_max": 0.014792722708079964, "clip_ratio/high_mean": 0.0032624634404783137, "clip_ratio/low_mean": 0.0009347885315946769, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004197252084850334, "entropy": 0.3577960357069969, "epoch": 0.5420275089149261, "grad_norm": 12.575453758239746, "learning_rate": 3.6642216788916055e-07, "loss": 20.0238, "reward": 2.143578052520752, "reward_std": 1.3492822647094727, "rewards/reasoning_density_reward/mean": 0.26823490858078003, "rewards/reasoning_density_reward/std": 0.16420812904834747, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.18784306943416595, "rewards/trajectory_similarity_reward/std": 0.30860018730163574, "step": 665 }, { "clip_ratio/high_max": 0.013363887032028288, "clip_ratio/high_mean": 0.0025746714673005044, "clip_ratio/low_mean": 0.0007477240797015838, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0033223955251742154, "entropy": 0.3705156780779362, "epoch": 0.5428425878757005, "grad_norm": 12.418392181396484, "learning_rate": 3.6577017114914425e-07, "loss": 5.3035, "step": 666 }, { "clip_ratio/high_max": 0.020247902488335967, "clip_ratio/high_mean": 0.004950011090841144, "clip_ratio/low_mean": 0.00032533251578570344, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005275343544781208, "entropy": 0.3113817013800144, "epoch": 0.5436576668364748, "grad_norm": 13.566872596740723, "learning_rate": 3.6511817440912795e-07, "loss": 5.5241, "reward": 3.3782875537872314, "reward_std": 1.335115671157837, "rewards/reasoning_density_reward/mean": 0.4208333343267441, "rewards/reasoning_density_reward/std": 0.09715935960412025, "rewards/success_reward/mean": 2.390625, "rewards/success_reward/std": 0.925901472568512, "rewards/trajectory_similarity_reward/mean": 0.566829115152359, "rewards/trajectory_similarity_reward/std": 0.419843927025795, "step": 667 }, { "clip_ratio/high_max": 0.01233742356998846, "clip_ratio/high_mean": 0.0025076657766476274, "clip_ratio/low_mean": 0.0023211352599901147, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004828801087569445, "entropy": 0.3200846239924431, "epoch": 0.5444727457972491, "grad_norm": 14.780742645263672, "learning_rate": 3.6446617766911165e-07, "loss": 1.0879, "reward": 2.3151917457580566, "reward_std": 0.025685735046863556, "rewards/reasoning_density_reward/mean": 0.4000000059604645, "rewards/reasoning_density_reward/std": 0.10327955335378647, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.4151916205883026, "rewards/trajectory_similarity_reward/std": 0.4302417039871216, "step": 668 }, { "clip_ratio/high_max": 0.014974664081819355, "clip_ratio/high_mean": 0.0028985633834963664, "clip_ratio/low_mean": 0.00152394654287491, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004422509897267446, "entropy": 0.36171267181634903, "epoch": 0.5452878247580234, "grad_norm": 17.53166961669922, "learning_rate": 3.6381418092909535e-07, "loss": 9.8232, "reward": 2.5872243642807007, "reward_std": 1.1014201864600182, "rewards/reasoning_density_reward/mean": 0.3843750059604645, "rewards/reasoning_density_reward/std": 0.15719829499721527, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5245966911315918, "rewards/trajectory_similarity_reward/mean": 0.5153494775295258, "rewards/trajectory_similarity_reward/std": 0.46280452609062195, "step": 669 }, { "clip_ratio/high_max": 0.012682889268035069, "clip_ratio/high_mean": 0.002689323930098908, "clip_ratio/low_mean": 0.0013499290544132236, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004039252933580428, "entropy": 0.32589322328567505, "epoch": 0.5461029037187978, "grad_norm": 15.155572891235352, "learning_rate": 3.6316218418907905e-07, "loss": 10.369, "reward": 3.488542079925537, "reward_std": 1.6150561571121216, "rewards/reasoning_density_reward/mean": 0.424834281206131, "rewards/reasoning_density_reward/std": 0.10221050679683685, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.626207709312439, "rewards/trajectory_similarity_reward/std": 0.36554014682769775, "step": 670 }, { "clip_ratio/high_max": 0.014437338104471564, "clip_ratio/high_mean": 0.0030352076864801347, "clip_ratio/low_mean": 0.0011451810169091914, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004180388641543686, "entropy": 0.3673092722892761, "epoch": 0.546917982679572, "grad_norm": 14.925990104675293, "learning_rate": 3.6251018744906275e-07, "loss": 5.2059, "reward": 2.6585686206817627, "reward_std": 1.028515100479126, "rewards/reasoning_density_reward/mean": 0.2787405252456665, "rewards/reasoning_density_reward/std": 0.16954819858074188, "rewards/success_reward/mean": 2.15625, "rewards/success_reward/std": 0.7685213088989258, "rewards/trajectory_similarity_reward/mean": 0.22357821464538574, "rewards/trajectory_similarity_reward/std": 0.2914164662361145, "step": 671 }, { "clip_ratio/high_max": 0.012770750821800902, "clip_ratio/high_mean": 0.0036619160237023607, "clip_ratio/low_mean": 0.0015920957375783473, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005254011659417301, "entropy": 0.33677510917186737, "epoch": 0.5477330616403464, "grad_norm": 19.412242889404297, "learning_rate": 3.618581907090464e-07, "loss": 13.5611, "reward": 4.017193078994751, "reward_std": 0.35038506984710693, "rewards/reasoning_density_reward/mean": 0.45000000298023224, "rewards/reasoning_density_reward/std": 0.1206529401242733, "rewards/success_reward/mean": 2.953125, "rewards/success_reward/std": 0.1875, "rewards/trajectory_similarity_reward/mean": 0.614067941904068, "rewards/trajectory_similarity_reward/std": 0.21643263846635818, "step": 672 }, { "clip_ratio/high_max": 0.016102072782814503, "clip_ratio/high_mean": 0.0029920416127424687, "clip_ratio/low_mean": 0.0018201762868557125, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004812217943253927, "entropy": 0.3506635092198849, "epoch": 0.5485481406011208, "grad_norm": 17.493192672729492, "learning_rate": 3.6120619396903015e-07, "loss": 4.6495, "reward": 2.692692756652832, "reward_std": 1.9420430660247803, "rewards/reasoning_density_reward/mean": 0.38928571343421936, "rewards/reasoning_density_reward/std": 0.1411806344985962, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.3964240550994873, "rewards/trajectory_similarity_reward/mean": 0.42840713262557983, "rewards/trajectory_similarity_reward/std": 0.4275251626968384, "step": 673 }, { "clip_ratio/high_max": 0.006462638266384602, "clip_ratio/high_mean": 0.0012578770401887596, "clip_ratio/low_mean": 0.0013302100742293987, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0025880871253320947, "entropy": 0.369626946747303, "epoch": 0.549363219561895, "grad_norm": 10.394336700439453, "learning_rate": 3.6055419722901385e-07, "loss": 9.2027, "reward": 1.1149934530258179, "reward_std": 1.3613486289978027, "rewards/reasoning_density_reward/mean": 0.17500001192092896, "rewards/reasoning_density_reward/std": 0.18348479270935059, "rewards/success_reward/mean": 0.84375, "rewards/success_reward/std": 1.0911576747894287, "rewards/trajectory_similarity_reward/mean": 0.09624342620372772, "rewards/trajectory_similarity_reward/std": 0.2641681134700775, "step": 674 }, { "clip_ratio/high_max": 0.005775891419034451, "clip_ratio/high_mean": 0.0015900478247203864, "clip_ratio/low_mean": 0.0008296419619000517, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002419689772068523, "entropy": 0.3888706564903259, "epoch": 0.5501782985226694, "grad_norm": 10.068991661071777, "learning_rate": 3.5990220048899755e-07, "loss": -5.4042, "reward": 0.9256696701049805, "reward_std": 0.7138042449951172, "rewards/reasoning_density_reward/mean": 0.08191964775323868, "rewards/reasoning_density_reward/std": 0.11886274069547653, "rewards/success_reward/mean": 0.84375, "rewards/success_reward/std": 0.7685213088989258, "rewards/trajectory_similarity_reward/mean": 0.0, "rewards/trajectory_similarity_reward/std": 0.0, "step": 675 }, { "clip_ratio/high_max": 0.009243704960681498, "clip_ratio/high_mean": 0.0026315953000448644, "clip_ratio/low_mean": 0.001088754852389684, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0037203501851763576, "entropy": 0.3999660760164261, "epoch": 0.5509933774834437, "grad_norm": 11.519668579101562, "learning_rate": 3.5925020374898125e-07, "loss": -0.3433, "reward": 3.508824348449707, "reward_std": 1.1731667518615723, "rewards/reasoning_density_reward/mean": 0.41830357909202576, "rewards/reasoning_density_reward/std": 0.17789335548877716, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.6530206203460693, "rewards/trajectory_similarity_reward/std": 0.35639360547065735, "step": 676 }, { "clip_ratio/high_max": 0.014540553442202508, "clip_ratio/high_mean": 0.003585410267987754, "clip_ratio/low_mean": 0.0013115717920300085, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004896982005448081, "entropy": 0.34805823862552643, "epoch": 0.551808456444218, "grad_norm": 16.45887565612793, "learning_rate": 3.5859820700896495e-07, "loss": 14.69, "reward": 3.925701141357422, "reward_std": 0.48843854665756226, "rewards/reasoning_density_reward/mean": 0.3970237970352173, "rewards/reasoning_density_reward/std": 0.16127678751945496, "rewards/success_reward/mean": 2.90625, "rewards/success_reward/std": 0.375, "rewards/trajectory_similarity_reward/mean": 0.6224273443222046, "rewards/trajectory_similarity_reward/std": 0.330687016248703, "step": 677 }, { "clip_ratio/high_max": 0.016115096979774535, "clip_ratio/high_mean": 0.0034677875955821946, "clip_ratio/low_mean": 0.0008882589099812321, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004356046600150876, "entropy": 0.37135665118694305, "epoch": 0.5526235354049923, "grad_norm": 17.227991104125977, "learning_rate": 3.5794621026894865e-07, "loss": 7.1099, "reward": 3.298653483390808, "reward_std": 1.5754806995391846, "rewards/reasoning_density_reward/mean": 0.34322915971279144, "rewards/reasoning_density_reward/std": 0.20743395388126373, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.0767268538475037, "rewards/trajectory_similarity_reward/mean": 0.6116742789745331, "rewards/trajectory_similarity_reward/std": 0.45570218563079834, "step": 678 }, { "clip_ratio/high_max": 0.015218365704640746, "clip_ratio/high_mean": 0.0034685335122048855, "clip_ratio/low_mean": 0.000989284071692964, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004457817558431998, "entropy": 0.40152280405163765, "epoch": 0.5534386143657667, "grad_norm": 13.2498779296875, "learning_rate": 3.5729421352893235e-07, "loss": 9.1938, "reward": 2.2083818912506104, "reward_std": 1.37458336353302, "rewards/reasoning_density_reward/mean": 0.1563374102115631, "rewards/reasoning_density_reward/std": 0.15990912914276123, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.1618950366973877, "rewards/trajectory_similarity_reward/mean": 0.17704445123672485, "rewards/trajectory_similarity_reward/std": 0.23287223279476166, "step": 679 }, { "clip_ratio/high_max": 0.007451865705661476, "clip_ratio/high_mean": 0.001669835823122412, "clip_ratio/low_mean": 0.0009476024242758285, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002617438294691965, "entropy": 0.3736054413020611, "epoch": 0.5542536933265411, "grad_norm": 10.727885246276855, "learning_rate": 3.5664221678891605e-07, "loss": 1.4919, "step": 680 }, { "clip_ratio/high_max": 0.016618901921901852, "clip_ratio/high_mean": 0.004289898315619212, "clip_ratio/low_mean": 0.0019979958815383725, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.006287894299020991, "entropy": 0.3502322994172573, "epoch": 0.5550687722873153, "grad_norm": 13.294273376464844, "learning_rate": 3.5599022004889975e-07, "loss": 2.7039, "reward": 2.8596659898757935, "reward_std": 1.4221768975257874, "rewards/reasoning_density_reward/mean": 0.4140625, "rewards/reasoning_density_reward/std": 0.10692642629146576, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.3731906414031982, "rewards/trajectory_similarity_reward/mean": 0.5706035047769547, "rewards/trajectory_similarity_reward/std": 0.4227169454097748, "step": 681 }, { "clip_ratio/high_max": 0.018817732110619545, "clip_ratio/high_mean": 0.004682236627559178, "clip_ratio/low_mean": 0.0007302500816877, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005412486556451768, "entropy": 0.355537511408329, "epoch": 0.5558838512480897, "grad_norm": 27.927173614501953, "learning_rate": 3.5533822330888345e-07, "loss": 5.7936, "reward": 3.150170922279358, "reward_std": 1.5644996762275696, "rewards/reasoning_density_reward/mean": 0.40156249701976776, "rewards/reasoning_density_reward/std": 0.12977508082985878, "rewards/success_reward/mean": 2.109375, "rewards/success_reward/std": 1.3404724597930908, "rewards/trajectory_similarity_reward/mean": 0.6392333507537842, "rewards/trajectory_similarity_reward/std": 0.42363937199115753, "step": 682 }, { "clip_ratio/high_max": 0.01167625980451703, "clip_ratio/high_mean": 0.0023559598193969578, "clip_ratio/low_mean": 0.002310711541213095, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004666671273298562, "entropy": 0.3678293973207474, "epoch": 0.556698930208864, "grad_norm": 15.143460273742676, "learning_rate": 3.5468622656886715e-07, "loss": 8.9868, "reward": 2.4485127925872803, "reward_std": 0.8560452461242676, "rewards/reasoning_density_reward/mean": 0.3046875, "rewards/reasoning_density_reward/std": 0.2229010909795761, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.45632532238960266, "rewards/trajectory_similarity_reward/std": 0.42889419198036194, "step": 683 }, { "clip_ratio/high_max": 0.00812254854827188, "clip_ratio/high_mean": 0.0014288673555711284, "clip_ratio/low_mean": 0.0020747500529978424, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00350361735036131, "entropy": 0.3360728584229946, "epoch": 0.5575140091696383, "grad_norm": 17.548805236816406, "learning_rate": 3.5403422982885084e-07, "loss": 8.1252, "reward": 2.608761787414551, "reward_std": 0.8091564774513245, "rewards/reasoning_density_reward/mean": 0.4125000238418579, "rewards/reasoning_density_reward/std": 0.10246950387954712, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.5087617635726929, "rewards/trajectory_similarity_reward/std": 0.47299879789352417, "step": 684 }, { "clip_ratio/high_max": 0.01579405347001739, "clip_ratio/high_mean": 0.003215329477825435, "clip_ratio/low_mean": 0.0013070955865259748, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004522425075265346, "entropy": 0.34839751198887825, "epoch": 0.5583290881304126, "grad_norm": 13.012754440307617, "learning_rate": 3.5338223308883454e-07, "loss": 1.2734, "reward": 2.119475841522217, "reward_std": 2.002444267272949, "rewards/reasoning_density_reward/mean": 0.28203123807907104, "rewards/reasoning_density_reward/std": 0.1788836270570755, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.4491376876831055, "rewards/trajectory_similarity_reward/mean": 0.3374445140361786, "rewards/trajectory_similarity_reward/std": 0.4129364490509033, "step": 685 }, { "clip_ratio/high_max": 0.018663701601326466, "clip_ratio/high_mean": 0.004315611586207524, "clip_ratio/low_mean": 0.000976417137280805, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005292028858093545, "entropy": 0.36729080229997635, "epoch": 0.559144167091187, "grad_norm": 13.824713706970215, "learning_rate": 3.5273023634881824e-07, "loss": 4.2137, "reward": 3.291137218475342, "reward_std": 1.601252794265747, "rewards/reasoning_density_reward/mean": 0.3688616156578064, "rewards/reasoning_density_reward/std": 0.13501184433698654, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.1510830521583557, "rewards/trajectory_similarity_reward/mean": 0.5785257518291473, "rewards/trajectory_similarity_reward/std": 0.4052470177412033, "step": 686 }, { "clip_ratio/high_max": 0.02115791302639991, "clip_ratio/high_mean": 0.004807586868992075, "clip_ratio/low_mean": 0.0009335523973277304, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00574113943730481, "entropy": 0.3339324779808521, "epoch": 0.5599592460519612, "grad_norm": 21.10563850402832, "learning_rate": 3.5207823960880194e-07, "loss": -2.249, "reward": 2.913017511367798, "reward_std": 1.7904366254806519, "rewards/reasoning_density_reward/mean": 0.3984375, "rewards/reasoning_density_reward/std": 0.09681113064289093, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.3098187446594238, "rewards/trajectory_similarity_reward/mean": 0.5458300113677979, "rewards/trajectory_similarity_reward/std": 0.498089998960495, "step": 687 }, { "clip_ratio/high_max": 0.017592395073734224, "clip_ratio/high_mean": 0.003439392414293252, "clip_ratio/low_mean": 0.001128535412135534, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004567927899188362, "entropy": 0.32444559037685394, "epoch": 0.5607743250127356, "grad_norm": 16.80455780029297, "learning_rate": 3.5142624286878564e-07, "loss": -3.3703, "reward": 2.2189159393310547, "reward_std": 1.874521255493164, "rewards/reasoning_density_reward/mean": 0.3765625059604645, "rewards/reasoning_density_reward/std": 0.12262167036533356, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.5185213088989258, "rewards/trajectory_similarity_reward/mean": 0.4361034333705902, "rewards/trajectory_similarity_reward/std": 0.46830081939697266, "step": 688 }, { "clip_ratio/high_max": 0.017209687968716025, "clip_ratio/high_mean": 0.0036686741514131427, "clip_ratio/low_mean": 0.0014202754864527378, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005088949837954715, "entropy": 0.34575892239809036, "epoch": 0.56158940397351, "grad_norm": 17.124481201171875, "learning_rate": 3.5077424612876934e-07, "loss": 7.046, "reward": 2.72247314453125, "reward_std": 1.9728847742080688, "rewards/reasoning_density_reward/mean": 0.3229166567325592, "rewards/reasoning_density_reward/std": 0.19339798390865326, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.5245562791824341, "rewards/trajectory_similarity_reward/std": 0.4477123022079468, "step": 689 }, { "clip_ratio/high_max": 0.016694399062544107, "clip_ratio/high_mean": 0.0035574497014749795, "clip_ratio/low_mean": 0.0007110149817890488, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004268464690539986, "entropy": 0.33481648936867714, "epoch": 0.5624044829342842, "grad_norm": 18.375089645385742, "learning_rate": 3.5012224938875304e-07, "loss": 2.3861, "reward": 2.460791826248169, "reward_std": 2.082418203353882, "rewards/reasoning_density_reward/mean": 0.35970982909202576, "rewards/reasoning_density_reward/std": 0.13068366050720215, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.4135820269584656, "rewards/trajectory_similarity_reward/std": 0.4054066836833954, "step": 690 }, { "clip_ratio/high_max": 0.015189519675914198, "clip_ratio/high_mean": 0.005116084408655297, "clip_ratio/low_mean": 0.000347643577697454, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005463728150061797, "entropy": 0.34770919382572174, "epoch": 0.5632195618950586, "grad_norm": 17.021875381469727, "learning_rate": 3.4947025264873674e-07, "loss": 19.0364, "reward": 3.549830913543701, "reward_std": 1.003535270690918, "rewards/reasoning_density_reward/mean": 0.3911072015762329, "rewards/reasoning_density_reward/std": 0.1496853157877922, "rewards/success_reward/mean": 2.53125, "rewards/success_reward/std": 0.7180703282356262, "rewards/trajectory_similarity_reward/mean": 0.6274738311767578, "rewards/trajectory_similarity_reward/std": 0.2638211324810982, "step": 691 }, { "clip_ratio/high_max": 0.012144783628173172, "clip_ratio/high_mean": 0.002892290511226747, "clip_ratio/low_mean": 0.0011195229380973615, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004011813456600066, "entropy": 0.3229057751595974, "epoch": 0.5640346408558329, "grad_norm": 15.571335792541504, "learning_rate": 3.4881825590872044e-07, "loss": 10.8933, "reward": 2.2655177116394043, "reward_std": 1.8646526336669922, "rewards/reasoning_density_reward/mean": 0.3583333492279053, "rewards/reasoning_density_reward/std": 0.13581031560897827, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.5491933822631836, "rewards/trajectory_similarity_reward/mean": 0.40718427300453186, "rewards/trajectory_similarity_reward/std": 0.44310262799263, "step": 692 }, { "clip_ratio/high_max": 0.012645212991628796, "clip_ratio/high_mean": 0.003247619650210254, "clip_ratio/low_mean": 0.0015514037440880202, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004799023503437638, "entropy": 0.36182234063744545, "epoch": 0.5648497198166073, "grad_norm": 17.426923751831055, "learning_rate": 3.4816625916870414e-07, "loss": -8.6017, "reward": 2.6449718475341797, "reward_std": 1.1528747081756592, "rewards/reasoning_density_reward/mean": 0.1770833432674408, "rewards/reasoning_density_reward/std": 0.21411964297294617, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.4053885042667389, "rewards/trajectory_similarity_reward/std": 0.45704495906829834, "step": 693 }, { "clip_ratio/high_max": 0.00890718525624834, "clip_ratio/high_mean": 0.0018700239415920805, "clip_ratio/low_mean": 0.0011525105765031185, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0030225344526115805, "entropy": 0.3554081320762634, "epoch": 0.5656647987773815, "grad_norm": 12.062666893005371, "learning_rate": 3.4751426242868784e-07, "loss": -8.4784, "reward": 1.3050057888031006, "reward_std": 1.2825747728347778, "rewards/reasoning_density_reward/mean": 0.16577380895614624, "rewards/reasoning_density_reward/std": 0.17765559256076813, "rewards/success_reward/mean": 1.03125, "rewards/success_reward/std": 1.0562314987182617, "rewards/trajectory_similarity_reward/mean": 0.10798202455043793, "rewards/trajectory_similarity_reward/std": 0.29579269886016846, "step": 694 }, { "clip_ratio/high_max": 0.013208081480115652, "clip_ratio/high_mean": 0.003503201180137694, "clip_ratio/low_mean": 0.0003814574629359413, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003884658683091402, "entropy": 0.36772520840168, "epoch": 0.5664798777381559, "grad_norm": 10.73487663269043, "learning_rate": 3.4686226568867154e-07, "loss": -2.682, "reward": 2.6998798847198486, "reward_std": 0.41512545943260193, "rewards/reasoning_density_reward/mean": 0.3370535671710968, "rewards/reasoning_density_reward/std": 0.1943630576133728, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.2845232486724854, "rewards/trajectory_similarity_reward/mean": 0.4878261983394623, "rewards/trajectory_similarity_reward/std": 0.5042455792427063, "step": 695 }, { "clip_ratio/high_max": 0.013590721937362105, "clip_ratio/high_mean": 0.0028528777038445696, "clip_ratio/low_mean": 0.0009150737059826497, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00376795137708541, "entropy": 0.35482415184378624, "epoch": 0.5672949566989303, "grad_norm": 13.731966972351074, "learning_rate": 3.4621026894865524e-07, "loss": -0.6303, "reward": 3.3154149055480957, "reward_std": 1.5093098878860474, "rewards/reasoning_density_reward/mean": 0.37291666865348816, "rewards/reasoning_density_reward/std": 0.16528594493865967, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.5987482070922852, "rewards/trajectory_similarity_reward/std": 0.38359513878822327, "step": 696 }, { "clip_ratio/high_max": 0.02345869189593941, "clip_ratio/high_mean": 0.005507702677277848, "clip_ratio/low_mean": 0.0013828833798470441, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0068905859952792525, "entropy": 0.35462643578648567, "epoch": 0.5681100356597045, "grad_norm": 16.287446975708008, "learning_rate": 3.4555827220863894e-07, "loss": 4.7596, "reward": 3.3386104106903076, "reward_std": 1.0871868133544922, "rewards/reasoning_density_reward/mean": 0.3505208492279053, "rewards/reasoning_density_reward/std": 0.18455323576927185, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.7380895614624023, "rewards/trajectory_similarity_reward/std": 0.44129595160484314, "step": 697 }, { "clip_ratio/high_max": 0.016108016832731664, "clip_ratio/high_mean": 0.004911038151476532, "clip_ratio/low_mean": 0.0008211471686081495, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005732185149099678, "entropy": 0.3292192742228508, "epoch": 0.5689251146204789, "grad_norm": 17.866626739501953, "learning_rate": 3.4490627546862264e-07, "loss": 0.9164, "reward": 3.9354496002197266, "reward_std": 0.8889759480953217, "rewards/reasoning_density_reward/mean": 0.4572916775941849, "rewards/reasoning_density_reward/std": 0.08333098515868187, "rewards/success_reward/mean": 2.71875, "rewards/success_reward/std": 0.6046693325042725, "rewards/trajectory_similarity_reward/mean": 0.7594079971313477, "rewards/trajectory_similarity_reward/std": 0.3894791454076767, "step": 698 }, { "clip_ratio/high_max": 0.013609796995297074, "clip_ratio/high_mean": 0.003672053004265763, "clip_ratio/low_mean": 0.000332603925926378, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004004656948382035, "entropy": 0.34587258100509644, "epoch": 0.5697401935812532, "grad_norm": 16.10370635986328, "learning_rate": 3.4425427872860634e-07, "loss": 10.9165, "reward": 3.0152053833007812, "reward_std": 1.2080202102661133, "rewards/reasoning_density_reward/mean": 0.32594698667526245, "rewards/reasoning_density_reward/std": 0.2051464319229126, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 0.9486833214759827, "rewards/trajectory_similarity_reward/mean": 0.43925848603248596, "rewards/trajectory_similarity_reward/std": 0.4522043466567993, "step": 699 }, { "clip_ratio/high_max": 0.01797575654927641, "clip_ratio/high_mean": 0.004132272879360244, "clip_ratio/low_mean": 0.0013575451375800185, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005489817966008559, "entropy": 0.3254803195595741, "epoch": 0.5705552725420275, "grad_norm": 18.402982711791992, "learning_rate": 3.4360228198859004e-07, "loss": -2.4452, "reward": 3.6308951377868652, "reward_std": 0.9469317197799683, "rewards/reasoning_density_reward/mean": 0.4312500059604645, "rewards/reasoning_density_reward/std": 0.11794751510024071, "rewards/success_reward/mean": 2.671875, "rewards/success_reward/std": 0.784289538860321, "rewards/trajectory_similarity_reward/mean": 0.5277701169252396, "rewards/trajectory_similarity_reward/std": 0.36750245094299316, "step": 700 }, { "clip_ratio/high_max": 0.01749686198309064, "clip_ratio/high_mean": 0.0038017877814127132, "clip_ratio/low_mean": 0.0011248755945416633, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004926663401420228, "entropy": 0.3499477840960026, "epoch": 0.5713703515028018, "grad_norm": 15.163878440856934, "learning_rate": 3.4295028524857374e-07, "loss": 9.3889, "reward": 2.093444585800171, "reward_std": 1.1080609560012817, "rewards/reasoning_density_reward/mean": 0.18050594627857208, "rewards/reasoning_density_reward/std": 0.2053944170475006, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.22543847560882568, "rewards/trajectory_similarity_reward/std": 0.35262054204940796, "step": 701 }, { "clip_ratio/high_max": 0.016013028158340603, "clip_ratio/high_mean": 0.002698418691579718, "clip_ratio/low_mean": 0.0006162331083032768, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003314651759865228, "entropy": 0.3618064783513546, "epoch": 0.5721854304635762, "grad_norm": 10.804458618164062, "learning_rate": 3.4229828850855744e-07, "loss": 2.3369, "step": 702 }, { "clip_ratio/high_max": 0.01161051425151527, "clip_ratio/high_mean": 0.002463937009451911, "clip_ratio/low_mean": 0.002075819022138603, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004539755987934768, "entropy": 0.35226066410541534, "epoch": 0.5730005094243504, "grad_norm": 14.736798286437988, "learning_rate": 3.4164629176854114e-07, "loss": -1.6441, "reward": 2.1519899368286133, "reward_std": 1.6103512048721313, "rewards/reasoning_density_reward/mean": 0.3235164284706116, "rewards/reasoning_density_reward/std": 0.11608020216226578, "rewards/success_reward/mean": 1.5, "rewards/success_reward/std": 1.4491376876831055, "rewards/trajectory_similarity_reward/mean": 0.3284734785556793, "rewards/trajectory_similarity_reward/std": 0.3984493911266327, "step": 703 }, { "clip_ratio/high_max": 0.01795928948558867, "clip_ratio/high_mean": 0.0036814816849073395, "clip_ratio/low_mean": 0.0006617164581257384, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004343198175774887, "entropy": 0.3564862385392189, "epoch": 0.5738155883851248, "grad_norm": 13.632908821105957, "learning_rate": 3.4099429502852484e-07, "loss": -9.6993, "reward": 3.372511386871338, "reward_std": 1.470131516456604, "rewards/reasoning_density_reward/mean": 0.31822916865348816, "rewards/reasoning_density_reward/std": 0.16499772667884827, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.6167823076248169, "rewards/trajectory_similarity_reward/std": 0.41964513063430786, "step": 704 }, { "clip_ratio/high_max": 0.015120258904062212, "clip_ratio/high_mean": 0.0031688327580923215, "clip_ratio/low_mean": 0.0012077190185664222, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004376551733002998, "entropy": 0.3373456299304962, "epoch": 0.5746306673458992, "grad_norm": 12.571338653564453, "learning_rate": 3.4034229828850854e-07, "loss": 7.8154, "reward": 0.3843749761581421, "reward_std": 0.4458286762237549, "rewards/reasoning_density_reward/mean": 0.19687500596046448, "rewards/reasoning_density_reward/std": 0.12524721026420593, "rewards/success_reward/mean": 0.1875, "rewards/success_reward/std": 0.5123475790023804, "rewards/trajectory_similarity_reward/mean": 0.0, "rewards/trajectory_similarity_reward/std": 0.0, "step": 705 }, { "clip_ratio/high_max": 0.010861011280212551, "clip_ratio/high_mean": 0.0015792826015967876, "clip_ratio/low_mean": 0.0009638180308684241, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0025431006724829786, "entropy": 0.3306904658675194, "epoch": 0.5754457463066734, "grad_norm": 16.66823959350586, "learning_rate": 3.3969030154849224e-07, "loss": -4.6088, "reward": 2.330994874238968, "reward_std": 0.35380294919013977, "rewards/reasoning_density_reward/mean": 0.3343750089406967, "rewards/reasoning_density_reward/std": 0.1386510208249092, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 0.2561737895011902, "rewards/trajectory_similarity_reward/mean": 0.4028697907924652, "rewards/trajectory_similarity_reward/std": 0.12313669919967651, "step": 706 }, { "clip_ratio/high_max": 0.014592543011531234, "clip_ratio/high_mean": 0.0036098377022426575, "clip_ratio/low_mean": 0.0020192808733554557, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005629118619253859, "entropy": 0.3087179437279701, "epoch": 0.5762608252674478, "grad_norm": 16.15052604675293, "learning_rate": 3.3903830480847594e-07, "loss": 10.3383, "reward": 3.2826669216156006, "reward_std": 1.2156635522842407, "rewards/reasoning_density_reward/mean": 0.4156249761581421, "rewards/reasoning_density_reward/std": 0.117924764752388, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 0.9287087917327881, "rewards/trajectory_similarity_reward/mean": 0.4295419156551361, "rewards/trajectory_similarity_reward/std": 0.3925151228904724, "step": 707 }, { "clip_ratio/high_max": 0.018379342975094914, "clip_ratio/high_mean": 0.003419546424993314, "clip_ratio/low_mean": 0.0008490175605402328, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0042685640073614195, "entropy": 0.30155588313937187, "epoch": 0.5770759042282221, "grad_norm": 18.862897872924805, "learning_rate": 3.3838630806845964e-07, "loss": 5.8264, "reward": 3.0028659105300903, "reward_std": 1.3482880890369415, "rewards/reasoning_density_reward/mean": 0.4203125089406967, "rewards/reasoning_density_reward/std": 0.10736137628555298, "rewards/success_reward/mean": 2.109375, "rewards/success_reward/std": 1.127556473016739, "rewards/trajectory_similarity_reward/mean": 0.47317835688591003, "rewards/trajectory_similarity_reward/std": 0.41937634348869324, "step": 708 }, { "clip_ratio/high_max": 0.016673043777700514, "clip_ratio/high_mean": 0.0034458112422726117, "clip_ratio/low_mean": 0.0016932329308474436, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005139044165844098, "entropy": 0.32889121025800705, "epoch": 0.5778909831889965, "grad_norm": 16.343368530273438, "learning_rate": 3.3773431132844334e-07, "loss": -3.8669, "reward": 1.798462152481079, "reward_std": 1.825190782546997, "rewards/reasoning_density_reward/mean": 0.32371485233306885, "rewards/reasoning_density_reward/std": 0.12271636724472046, "rewards/success_reward/mean": 1.21875, "rewards/success_reward/std": 1.4716062545776367, "rewards/trajectory_similarity_reward/mean": 0.2559972405433655, "rewards/trajectory_similarity_reward/std": 0.3495660126209259, "step": 709 }, { "clip_ratio/high_max": 0.014541840530000627, "clip_ratio/high_mean": 0.0027949642535531893, "clip_ratio/low_mean": 0.0008469451568089426, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003641909424914047, "entropy": 0.3283786214888096, "epoch": 0.5787060621497707, "grad_norm": 15.022056579589844, "learning_rate": 3.3708231458842704e-07, "loss": 3.877, "reward": 2.821852684020996, "reward_std": 1.0820353031158447, "rewards/reasoning_density_reward/mean": 0.41363638639450073, "rewards/reasoning_density_reward/std": 0.10123208165168762, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.5332163572311401, "rewards/trajectory_similarity_reward/std": 0.44846367835998535, "step": 710 }, { "clip_ratio/high_max": 0.01646755079855211, "clip_ratio/high_mean": 0.0031954846963344608, "clip_ratio/low_mean": 0.0005355112079996616, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003730995929799974, "entropy": 0.3364521935582161, "epoch": 0.5795211411105451, "grad_norm": 11.780835151672363, "learning_rate": 3.3643031784841074e-07, "loss": 4.962, "reward": 2.2560794949531555, "reward_std": 1.274736613035202, "rewards/reasoning_density_reward/mean": 0.3132338970899582, "rewards/reasoning_density_reward/std": 0.1573876515030861, "rewards/success_reward/mean": 1.59375, "rewards/success_reward/std": 1.4137958884239197, "rewards/trajectory_similarity_reward/mean": 0.3490956425666809, "rewards/trajectory_similarity_reward/std": 0.43454885482788086, "step": 711 }, { "clip_ratio/high_max": 0.018735300051048398, "clip_ratio/high_mean": 0.0046164010564098135, "clip_ratio/low_mean": 0.0010020807167165913, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005618481751298532, "entropy": 0.36613743379712105, "epoch": 0.5803362200713195, "grad_norm": 13.551299095153809, "learning_rate": 3.3577832110839444e-07, "loss": -5.1582, "reward": 3.049391508102417, "reward_std": 0.8959210515022278, "rewards/reasoning_density_reward/mean": 0.4208333492279053, "rewards/reasoning_density_reward/std": 0.10671873390674591, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.3275917768478394, "rewards/trajectory_similarity_reward/mean": 0.5660580396652222, "rewards/trajectory_similarity_reward/std": 0.46120041608810425, "step": 712 }, { "clip_ratio/high_max": 0.020859605283476412, "clip_ratio/high_mean": 0.00499165547080338, "clip_ratio/low_mean": 0.00153181466521346, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.006523470190586522, "entropy": 0.325895756483078, "epoch": 0.5811512990320937, "grad_norm": 15.816411018371582, "learning_rate": 3.3512632436837814e-07, "loss": 0.9291, "reward": 2.0906596183776855, "reward_std": 0.7560126781463623, "rewards/reasoning_density_reward/mean": 0.3754464387893677, "rewards/reasoning_density_reward/std": 0.11923705041408539, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.40271317958831787, "rewards/trajectory_similarity_reward/std": 0.47474434971809387, "step": 713 }, { "clip_ratio/high_max": 0.014826378261204809, "clip_ratio/high_mean": 0.0033453579017077573, "clip_ratio/low_mean": 0.00047994744090829045, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0038253053280641325, "entropy": 0.32386134564876556, "epoch": 0.5819663779928681, "grad_norm": 16.834375381469727, "learning_rate": 3.3447432762836184e-07, "loss": 2.9008, "reward": 3.154542565345764, "reward_std": 1.5391627550125122, "rewards/reasoning_density_reward/mean": 0.4330357015132904, "rewards/reasoning_density_reward/std": 0.0959642343223095, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.2247449159622192, "rewards/trajectory_similarity_reward/mean": 0.4715069830417633, "rewards/trajectory_similarity_reward/std": 0.41822288930416107, "step": 714 }, { "clip_ratio/high_max": 0.01832793647190556, "clip_ratio/high_mean": 0.005106294192955829, "clip_ratio/low_mean": 0.0007664197837584652, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005872714129509404, "entropy": 0.32643479481339455, "epoch": 0.5827814569536424, "grad_norm": 16.92911720275879, "learning_rate": 3.3382233088834554e-07, "loss": -3.158, "reward": 2.939851760864258, "reward_std": 1.922142744064331, "rewards/reasoning_density_reward/mean": 0.330322802066803, "rewards/reasoning_density_reward/std": 0.1764552742242813, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.5470290184020996, "rewards/trajectory_similarity_reward/std": 0.40540996193885803, "step": 715 }, { "clip_ratio/high_max": 0.0173598846886307, "clip_ratio/high_mean": 0.003790829228819348, "clip_ratio/low_mean": 0.0015885134889686015, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005379342765081674, "entropy": 0.3058563247323036, "epoch": 0.5835965359144167, "grad_norm": 15.519600868225098, "learning_rate": 3.3317033414832924e-07, "loss": -4.2565, "reward": 2.9584784507751465, "reward_std": 1.5104687213897705, "rewards/reasoning_density_reward/mean": 0.39642858505249023, "rewards/reasoning_density_reward/std": 0.11614557355642319, "rewards/success_reward/mean": 1.96875, "rewards/success_reward/std": 1.419727087020874, "rewards/trajectory_similarity_reward/mean": 0.5932997465133667, "rewards/trajectory_similarity_reward/std": 0.4900687634944916, "step": 716 }, { "clip_ratio/high_max": 0.019790931022726, "clip_ratio/high_mean": 0.00515975255984813, "clip_ratio/low_mean": 0.0005188476279727183, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005678600165992975, "entropy": 0.3191523216664791, "epoch": 0.584411614875191, "grad_norm": 16.96806526184082, "learning_rate": 3.32518337408313e-07, "loss": 7.8763, "reward": 2.8731296062469482, "reward_std": 0.8189125955104828, "rewards/reasoning_density_reward/mean": 0.41272321343421936, "rewards/reasoning_density_reward/std": 0.09818192943930626, "rewards/success_reward/mean": 1.921875, "rewards/success_reward/std": 1.0523346662521362, "rewards/trajectory_similarity_reward/mean": 0.5385313928127289, "rewards/trajectory_similarity_reward/std": 0.4336393475532532, "step": 717 }, { "clip_ratio/high_max": 0.014923606533557177, "clip_ratio/high_mean": 0.0029671926895389333, "clip_ratio/low_mean": 0.002447905389999505, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005415098145022057, "entropy": 0.3277497813105583, "epoch": 0.5852266938359654, "grad_norm": 29.093448638916016, "learning_rate": 3.3186634066829664e-07, "loss": 2.4446, "reward": 2.697774648666382, "reward_std": 0.9205578565597534, "rewards/reasoning_density_reward/mean": 0.40935784578323364, "rewards/reasoning_density_reward/std": 0.09931083768606186, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.41341662406921387, "rewards/trajectory_similarity_reward/std": 0.3709767162799835, "step": 718 }, { "clip_ratio/high_max": 0.021800478571094573, "clip_ratio/high_mean": 0.004970195805071853, "clip_ratio/low_mean": 0.0006737499352311715, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005643945842166431, "entropy": 0.34239279478788376, "epoch": 0.5860417727967396, "grad_norm": 15.43528938293457, "learning_rate": 3.3121434392828034e-07, "loss": 1.0883, "reward": 3.226630687713623, "reward_std": 1.9036791324615479, "rewards/reasoning_density_reward/mean": 0.3440340757369995, "rewards/reasoning_density_reward/std": 0.17230984568595886, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.341640830039978, "rewards/trajectory_similarity_reward/mean": 0.6325966119766235, "rewards/trajectory_similarity_reward/std": 0.39066624641418457, "step": 719 }, { "clip_ratio/high_max": 0.01840072515187785, "clip_ratio/high_mean": 0.003533446229994297, "clip_ratio/low_mean": 0.0002822478345478885, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0038156940427143127, "entropy": 0.3323635198175907, "epoch": 0.586856851757514, "grad_norm": 13.48779582977295, "learning_rate": 3.3056234718826404e-07, "loss": 15.8782, "reward": 2.98940110206604, "reward_std": 1.601845622062683, "rewards/reasoning_density_reward/mean": 0.41458332538604736, "rewards/reasoning_density_reward/std": 0.10034661740064621, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.3275917768478394, "rewards/trajectory_similarity_reward/mean": 0.5123177170753479, "rewards/trajectory_similarity_reward/std": 0.4470868408679962, "step": 720 }, { "clip_ratio/high_max": 0.014857495087198913, "clip_ratio/high_mean": 0.0027141195023432374, "clip_ratio/low_mean": 0.0003670917831186671, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0030812112818239257, "entropy": 0.3509768284857273, "epoch": 0.5876719307182884, "grad_norm": 12.848700523376465, "learning_rate": 3.2991035044824774e-07, "loss": 4.155, "reward": 3.2844417095184326, "reward_std": 0.9967443943023682, "rewards/reasoning_density_reward/mean": 0.32734376192092896, "rewards/reasoning_density_reward/std": 0.16418971121311188, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.078192949295044, "rewards/trajectory_similarity_reward/mean": 0.5195980072021484, "rewards/trajectory_similarity_reward/std": 0.36226868629455566, "step": 721 }, { "clip_ratio/high_max": 0.023160643875598907, "clip_ratio/high_mean": 0.005325193240423687, "clip_ratio/low_mean": 0.0011729068064596504, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.006498100032331422, "entropy": 0.3279968425631523, "epoch": 0.5884870096790626, "grad_norm": 17.405893325805664, "learning_rate": 3.2925835370823144e-07, "loss": 16.7353, "reward": 4.045992851257324, "reward_std": 0.8853721618652344, "rewards/reasoning_density_reward/mean": 0.4333333373069763, "rewards/reasoning_density_reward/std": 0.12894126772880554, "rewards/success_reward/mean": 2.8125, "rewards/success_reward/std": 0.75, "rewards/trajectory_similarity_reward/mean": 0.8001595139503479, "rewards/trajectory_similarity_reward/std": 0.25695472955703735, "step": 722 }, { "clip_ratio/high_max": 0.01645046629710123, "clip_ratio/high_mean": 0.0045278721081558615, "clip_ratio/low_mean": 0.0008536755485692993, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005381547671277076, "entropy": 0.34731679782271385, "epoch": 0.589302088639837, "grad_norm": 20.026840209960938, "learning_rate": 3.2860635696821514e-07, "loss": 2.4715, "reward": 2.3683130741119385, "reward_std": 1.2280899286270142, "rewards/reasoning_density_reward/mean": 0.3276515305042267, "rewards/reasoning_density_reward/std": 0.11854063719511032, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.125, "rewards/trajectory_similarity_reward/mean": 0.25941163301467896, "rewards/trajectory_similarity_reward/std": 0.34778404235839844, "step": 723 }, { "clip_ratio/high_max": 0.013166424643713981, "clip_ratio/high_mean": 0.002721260410908144, "clip_ratio/low_mean": 0.0007527576963184401, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0034740180271910504, "entropy": 0.3302171491086483, "epoch": 0.5901171676006113, "grad_norm": 12.558886528015137, "learning_rate": 3.2795436022819884e-07, "loss": 0.4711, "reward": 2.7528040409088135, "reward_std": 0.9034095406532288, "rewards/reasoning_density_reward/mean": 0.3849296569824219, "rewards/reasoning_density_reward/std": 0.08825649321079254, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.49287429451942444, "rewards/trajectory_similarity_reward/std": 0.4112900495529175, "step": 724 }, { "clip_ratio/high_max": 0.021345289307646453, "clip_ratio/high_mean": 0.004278196793165989, "clip_ratio/low_mean": 0.0006419649434974417, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0049201617075596005, "entropy": 0.33635587990283966, "epoch": 0.5909322465613857, "grad_norm": 16.864397048950195, "learning_rate": 3.2730236348818254e-07, "loss": 5.771, "reward": 4.028075218200684, "reward_std": 0.8883209228515625, "rewards/reasoning_density_reward/mean": 0.453125, "rewards/reasoning_density_reward/std": 0.10562314838171005, "rewards/success_reward/mean": 2.8125, "rewards/success_reward/std": 0.75, "rewards/trajectory_similarity_reward/mean": 0.7624503970146179, "rewards/trajectory_similarity_reward/std": 0.2740139961242676, "step": 725 }, { "clip_ratio/high_max": 0.023060684325173497, "clip_ratio/high_mean": 0.005677418201230466, "clip_ratio/low_mean": 0.0015521987370448187, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.007229617040138692, "entropy": 0.30293793231248856, "epoch": 0.5917473255221599, "grad_norm": 18.602901458740234, "learning_rate": 3.2665036674816624e-07, "loss": 2.2325, "reward": 2.8986655473709106, "reward_std": 1.7930591106414795, "rewards/reasoning_density_reward/mean": 0.42500001192092896, "rewards/reasoning_density_reward/std": 0.10000000149011612, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.5986655056476593, "rewards/trajectory_similarity_reward/std": 0.482219934463501, "step": 726 }, { "clip_ratio/high_max": 0.011928067659027874, "clip_ratio/high_mean": 0.002749511710135266, "clip_ratio/low_mean": 0.0008568949560867622, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0036064066080143675, "entropy": 0.330657247453928, "epoch": 0.5925624044829343, "grad_norm": 15.07744312286377, "learning_rate": 3.2599837000814994e-07, "loss": 7.6191, "reward": 2.4659371376037598, "reward_std": 1.1494935750961304, "rewards/reasoning_density_reward/mean": 0.3499999940395355, "rewards/reasoning_density_reward/std": 0.14844878017902374, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.4284369647502899, "rewards/trajectory_similarity_reward/std": 0.45054757595062256, "step": 727 }, { "clip_ratio/high_max": 0.01504991389811039, "clip_ratio/high_mean": 0.003999999957159162, "clip_ratio/low_mean": 0.0013418281087069772, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005341828102245927, "entropy": 0.31691448390483856, "epoch": 0.5933774834437087, "grad_norm": 24.694530487060547, "learning_rate": 3.2534637326813364e-07, "loss": 1.9153, "reward": 3.2985042333602905, "reward_std": 1.5483933687210083, "rewards/reasoning_density_reward/mean": 0.3872023671865463, "rewards/reasoning_density_reward/std": 0.11668552830815315, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.0911576747894287, "rewards/trajectory_similarity_reward/mean": 0.5675519108772278, "rewards/trajectory_similarity_reward/std": 0.41254884004592896, "step": 728 }, { "clip_ratio/high_max": 0.02057585574220866, "clip_ratio/high_mean": 0.005019499454647303, "clip_ratio/low_mean": 0.0009991301376430783, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.006018629705067724, "entropy": 0.31929266080260277, "epoch": 0.5941925624044829, "grad_norm": 15.514227867126465, "learning_rate": 3.2469437652811734e-07, "loss": -6.772, "reward": 3.0244719982147217, "reward_std": 1.6902782917022705, "rewards/reasoning_density_reward/mean": 0.41458332538604736, "rewards/reasoning_density_reward/std": 0.10034661740064621, "rewards/success_reward/mean": 2.0625, "rewards/success_reward/std": 1.3275917768478394, "rewards/trajectory_similarity_reward/mean": 0.5473886728286743, "rewards/trajectory_similarity_reward/std": 0.44491711258888245, "step": 729 }, { "clip_ratio/high_max": 0.015538120525889099, "clip_ratio/high_mean": 0.0039615993009647354, "clip_ratio/low_mean": 0.001618214722839184, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00557981405290775, "entropy": 0.302999097853899, "epoch": 0.5950076413652573, "grad_norm": 25.916152954101562, "learning_rate": 3.2404237978810104e-07, "loss": 1.9399, "reward": 2.6519548892974854, "reward_std": 1.9841711521148682, "rewards/reasoning_density_reward/mean": 0.40625, "rewards/reasoning_density_reward/std": 0.10123474895954132, "rewards/success_reward/mean": 1.734375, "rewards/success_reward/std": 1.4344323873519897, "rewards/trajectory_similarity_reward/mean": 0.5113299041986465, "rewards/trajectory_similarity_reward/std": 0.4893078953027725, "step": 730 }, { "clip_ratio/high_max": 0.02184108446817845, "clip_ratio/high_mean": 0.00634554831776768, "clip_ratio/low_mean": 0.001412066732882522, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.007757615065202117, "entropy": 0.3285379707813263, "epoch": 0.5958227203260316, "grad_norm": 18.725250244140625, "learning_rate": 3.2339038304808474e-07, "loss": -1.7936, "reward": 3.686443567276001, "reward_std": 1.0760545432567596, "rewards/reasoning_density_reward/mean": 0.4624999910593033, "rewards/reasoning_density_reward/std": 0.07887785881757736, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.1831679940223694, "rewards/trajectory_similarity_reward/mean": 0.7864435613155365, "rewards/trajectory_similarity_reward/std": 0.38331757485866547, "step": 731 }, { "clip_ratio/high_max": 0.010747699183411896, "clip_ratio/high_mean": 0.0017095369839807972, "clip_ratio/low_mean": 0.001921854302054271, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0036313912860350683, "entropy": 0.3508451133966446, "epoch": 0.5966377992868059, "grad_norm": 16.835514068603516, "learning_rate": 3.227383863080685e-07, "loss": 11.954, "reward": 1.8018614053726196, "reward_std": 1.852851390838623, "rewards/reasoning_density_reward/mean": 0.3375000059604645, "rewards/reasoning_density_reward/std": 0.16278821229934692, "rewards/success_reward/mean": 1.125, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.339361310005188, "rewards/trajectory_similarity_reward/std": 0.4547730088233948, "step": 732 }, { "clip_ratio/high_max": 0.014826695725787431, "clip_ratio/high_mean": 0.0028973559965379536, "clip_ratio/low_mean": 0.0019215777865611017, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004818933928618208, "entropy": 0.3520160801708698, "epoch": 0.5974528782475802, "grad_norm": 13.089106559753418, "learning_rate": 3.220863895680522e-07, "loss": 16.5318, "reward": 1.7610124349594116, "reward_std": 1.8118305206298828, "rewards/reasoning_density_reward/mean": 0.30148810148239136, "rewards/reasoning_density_reward/std": 0.15290306508541107, "rewards/success_reward/mean": 1.125, "rewards/success_reward/std": 1.5, "rewards/trajectory_similarity_reward/mean": 0.33452433347702026, "rewards/trajectory_similarity_reward/std": 0.4464569389820099, "step": 733 }, { "clip_ratio/high_max": 0.014256183058023453, "clip_ratio/high_mean": 0.0021478108392329887, "clip_ratio/low_mean": 0.001684201655734796, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.003832012473139912, "entropy": 0.3567435033619404, "epoch": 0.5982679572083546, "grad_norm": 12.264330863952637, "learning_rate": 3.2143439282803584e-07, "loss": 6.0219, "reward": 1.874819576740265, "reward_std": 1.5205971002578735, "rewards/reasoning_density_reward/mean": 0.31793154776096344, "rewards/reasoning_density_reward/std": 0.12414437159895897, "rewards/success_reward/mean": 1.359375, "rewards/success_reward/std": 1.183596134185791, "rewards/trajectory_similarity_reward/mean": 0.19751303642988205, "rewards/trajectory_similarity_reward/std": 0.3719254732131958, "step": 734 }, { "clip_ratio/high_max": 0.011487408832181245, "clip_ratio/high_mean": 0.002312614808033686, "clip_ratio/low_mean": 0.002918039019277785, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0052306538564153016, "entropy": 0.328623004257679, "epoch": 0.5990830361691288, "grad_norm": 14.9776611328125, "learning_rate": 3.2078239608801954e-07, "loss": 2.3523, "reward": 3.3723654747009277, "reward_std": 1.5045785903930664, "rewards/reasoning_density_reward/mean": 0.4375, "rewards/reasoning_density_reward/std": 0.08850611001253128, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.2209115028381348, "rewards/trajectory_similarity_reward/mean": 0.591115415096283, "rewards/trajectory_similarity_reward/std": 0.3999078869819641, "step": 735 }, { "clip_ratio/high_max": 0.019111368514131755, "clip_ratio/high_mean": 0.004710536362836137, "clip_ratio/low_mean": 0.0014151392679195851, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0061256756307557225, "entropy": 0.32413846626877785, "epoch": 0.5998981151299032, "grad_norm": 23.529022216796875, "learning_rate": 3.2013039934800323e-07, "loss": 3.5758, "reward": 3.1562469005584717, "reward_std": 1.436094045639038, "rewards/reasoning_density_reward/mean": 0.4322916865348816, "rewards/reasoning_density_reward/std": 0.09437292814254761, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.2247449159622192, "rewards/trajectory_similarity_reward/mean": 0.47395533323287964, "rewards/trajectory_similarity_reward/std": 0.3790922462940216, "step": 736 }, { "clip_ratio/high_max": 0.008990119851659983, "clip_ratio/high_mean": 0.002718727890169248, "clip_ratio/low_mean": 0.0016459284779557493, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0043646563062793575, "entropy": 0.3363182209432125, "epoch": 0.6007131940906776, "grad_norm": 12.326214790344238, "learning_rate": 3.1947840260798693e-07, "loss": 12.2318, "reward": 3.3050904273986816, "reward_std": 0.9789865016937256, "rewards/reasoning_density_reward/mean": 0.37416917085647583, "rewards/reasoning_density_reward/std": 0.15256847441196442, "rewards/success_reward/mean": 2.34375, "rewards/success_reward/std": 1.0911576747894287, "rewards/trajectory_similarity_reward/mean": 0.5871712565422058, "rewards/trajectory_similarity_reward/std": 0.42100727558135986, "step": 737 }, { "clip_ratio/high_max": 0.018698358617257327, "clip_ratio/high_mean": 0.002546526178775821, "clip_ratio/low_mean": 0.0010286972392350435, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0035752235125983134, "entropy": 0.3304601199924946, "epoch": 0.6015282730514518, "grad_norm": 17.731868743896484, "learning_rate": 3.1882640586797063e-07, "loss": -2.004, "reward": 2.8110830783843994, "reward_std": 0.6778244376182556, "rewards/reasoning_density_reward/mean": 0.40625, "rewards/reasoning_density_reward/std": 0.09979145228862762, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.3964240550994873, "rewards/trajectory_similarity_reward/mean": 0.5298330783843994, "rewards/trajectory_similarity_reward/std": 0.4918629229068756, "step": 738 }, { "clip_ratio/high_max": 0.014396492158994079, "clip_ratio/high_mean": 0.003219524078303948, "clip_ratio/low_mean": 0.0018647367833182216, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005084260905277915, "entropy": 0.33073560148477554, "epoch": 0.6023433520122262, "grad_norm": 22.048446655273438, "learning_rate": 3.1817440912795433e-07, "loss": 1.6546, "reward": 3.5637375116348267, "reward_std": 1.449958086013794, "rewards/reasoning_density_reward/mean": 0.4325520694255829, "rewards/reasoning_density_reward/std": 0.11466982215642929, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.1385715007781982, "rewards/trajectory_similarity_reward/mean": 0.6936855316162109, "rewards/trajectory_similarity_reward/std": 0.39483602344989777, "step": 739 }, { "clip_ratio/high_max": 0.0157021249178797, "clip_ratio/high_mean": 0.004112656170036644, "clip_ratio/low_mean": 0.00023506365687353536, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004347719775978476, "entropy": 0.3797360807657242, "epoch": 0.6031584309730005, "grad_norm": 11.775860786437988, "learning_rate": 3.1752241238793803e-07, "loss": -0.6646, "reward": 2.464177370071411, "reward_std": 1.19965398311615, "rewards/reasoning_density_reward/mean": 0.3374999761581421, "rewards/reasoning_density_reward/std": 0.14842712879180908, "rewards/success_reward/mean": 1.78125, "rewards/success_reward/std": 1.125, "rewards/trajectory_similarity_reward/mean": 0.34542739391326904, "rewards/trajectory_similarity_reward/std": 0.46105828881263733, "step": 740 }, { "clip_ratio/high_max": 0.013741055270656943, "clip_ratio/high_mean": 0.003283176221884787, "clip_ratio/low_mean": 0.0010866036282095592, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004369779897388071, "entropy": 0.34505395591259, "epoch": 0.6039735099337749, "grad_norm": 13.658812522888184, "learning_rate": 3.1687041564792173e-07, "loss": 6.166, "reward": 2.3401358127593994, "reward_std": 1.7652508020401, "rewards/reasoning_density_reward/mean": 0.37812501192092896, "rewards/reasoning_density_reward/std": 0.11685995757579803, "rewards/success_reward/mean": 1.6875, "rewards/success_reward/std": 1.3275917768478394, "rewards/trajectory_similarity_reward/mean": 0.2745107114315033, "rewards/trajectory_similarity_reward/std": 0.33382079005241394, "step": 741 }, { "clip_ratio/high_max": 0.018694740196224302, "clip_ratio/high_mean": 0.003450651216553524, "clip_ratio/low_mean": 0.0016340917791239917, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005084742850158364, "entropy": 0.3229355476796627, "epoch": 0.6047885888945491, "grad_norm": 14.93838119506836, "learning_rate": 3.1621841890790543e-07, "loss": 3.259, "reward": 0.7440821528434753, "reward_std": 0.9535448551177979, "rewards/reasoning_density_reward/mean": 0.28389424085617065, "rewards/reasoning_density_reward/std": 0.12422715127468109, "rewards/success_reward/mean": 0.375, "rewards/success_reward/std": 1.0246951580047607, "rewards/trajectory_similarity_reward/mean": 0.08518792688846588, "rewards/trajectory_similarity_reward/std": 0.23278789222240448, "step": 742 }, { "clip_ratio/high_max": 0.019222403410822153, "clip_ratio/high_mean": 0.0036248224787414074, "clip_ratio/low_mean": 0.0009133876556006726, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004538210167083889, "entropy": 0.34687405079603195, "epoch": 0.6056036678553235, "grad_norm": 16.09386444091797, "learning_rate": 3.1556642216788913e-07, "loss": 11.7036, "reward": 2.0450515747070312, "reward_std": 2.1162843704223633, "rewards/reasoning_density_reward/mean": 0.3752060532569885, "rewards/reasoning_density_reward/std": 0.10115061700344086, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.5370426177978516, "rewards/trajectory_similarity_reward/mean": 0.35734546184539795, "rewards/trajectory_similarity_reward/std": 0.43125852942466736, "step": 743 }, { "clip_ratio/high_max": 0.01107470493298024, "clip_ratio/high_mean": 0.0017464076372561976, "clip_ratio/low_mean": 0.0006487623031716794, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0023951699549797922, "entropy": 0.3262798339128494, "epoch": 0.6064187468160979, "grad_norm": 14.207890510559082, "learning_rate": 3.1491442542787283e-07, "loss": 0.4577, "reward": 2.5481083393096924, "reward_std": 1.5505785942077637, "rewards/reasoning_density_reward/mean": 0.34732145071029663, "rewards/reasoning_density_reward/std": 0.13316848874092102, "rewards/success_reward/mean": 1.875, "rewards/success_reward/std": 1.0246951580047607, "rewards/trajectory_similarity_reward/mean": 0.3257869780063629, "rewards/trajectory_similarity_reward/std": 0.43584737181663513, "step": 744 }, { "clip_ratio/high_max": 0.01189180847723037, "clip_ratio/high_mean": 0.0027202397031942382, "clip_ratio/low_mean": 0.0012674899044213817, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0039877295785117894, "entropy": 0.35636961087584496, "epoch": 0.6072338257768721, "grad_norm": 18.5509033203125, "learning_rate": 3.1426242868785653e-07, "loss": 5.9995, "reward": 1.982546329498291, "reward_std": 1.3801380395889282, "rewards/reasoning_density_reward/mean": 0.33125001192092896, "rewards/reasoning_density_reward/std": 0.125, "rewards/success_reward/mean": 1.40625, "rewards/success_reward/std": 1.157853603363037, "rewards/trajectory_similarity_reward/mean": 0.24504625797271729, "rewards/trajectory_similarity_reward/std": 0.438610315322876, "step": 745 }, { "clip_ratio/high_max": 0.014197440614225343, "clip_ratio/high_mean": 0.0033552834975125734, "clip_ratio/low_mean": 0.0011400863804738037, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004495369896176271, "entropy": 0.3887362666428089, "epoch": 0.6080489047376465, "grad_norm": 12.628972053527832, "learning_rate": 3.1361043194784023e-07, "loss": -1.3345, "reward": 1.8433785438537598, "reward_std": 1.4343733191490173, "rewards/reasoning_density_reward/mean": 0.22369791567325592, "rewards/reasoning_density_reward/std": 0.17507873475551605, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.2004882097244263, "rewards/trajectory_similarity_reward/mean": 0.30718061327934265, "rewards/trajectory_similarity_reward/std": 0.3701706677675247, "step": 746 }, { "clip_ratio/high_max": 0.007073289714753628, "clip_ratio/high_mean": 0.00141357776010409, "clip_ratio/low_mean": 0.0012196701500215568, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.002633247902849689, "entropy": 0.4133944921195507, "epoch": 0.6088639836984208, "grad_norm": 13.707287788391113, "learning_rate": 3.12958435207824e-07, "loss": -5.6885, "reward": 1.9170106649398804, "reward_std": 1.826815128326416, "rewards/reasoning_density_reward/mean": 0.3322916626930237, "rewards/reasoning_density_reward/std": 0.1612989753484726, "rewards/success_reward/mean": 1.3125, "rewards/success_reward/std": 1.4361406564712524, "rewards/trajectory_similarity_reward/mean": 0.27221882343292236, "rewards/trajectory_similarity_reward/std": 0.38224077224731445, "step": 747 }, { "clip_ratio/high_max": 0.01521719916490838, "clip_ratio/high_mean": 0.0027997235156362876, "clip_ratio/low_mean": 0.0024389908176090103, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005238714249571785, "entropy": 0.34174104779958725, "epoch": 0.6096790626591951, "grad_norm": 14.99661922454834, "learning_rate": 3.123064384678077e-07, "loss": 5.1878, "reward": 3.4148237705230713, "reward_std": 1.1184638738632202, "rewards/reasoning_density_reward/mean": 0.3834821581840515, "rewards/reasoning_density_reward/std": 0.15072882175445557, "rewards/success_reward/mean": 2.4375, "rewards/success_reward/std": 1.209338665008545, "rewards/trajectory_similarity_reward/mean": 0.5938417315483093, "rewards/trajectory_similarity_reward/std": 0.320853054523468, "step": 748 }, { "clip_ratio/high_max": 0.013446430792100728, "clip_ratio/high_mean": 0.002554076418164186, "clip_ratio/low_mean": 0.0010191736655542627, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0035732500728045125, "entropy": 0.32289963215589523, "epoch": 0.6104941416199694, "grad_norm": 16.736879348754883, "learning_rate": 3.116544417277914e-07, "loss": 1.9263, "reward": 3.859916925430298, "reward_std": 0.907070517539978, "rewards/reasoning_density_reward/mean": 0.45781248807907104, "rewards/reasoning_density_reward/std": 0.07730823010206223, "rewards/success_reward/mean": 2.625, "rewards/success_reward/std": 1.0246951580047607, "rewards/trajectory_similarity_reward/mean": 0.7771044969558716, "rewards/trajectory_similarity_reward/std": 0.3489649295806885, "step": 749 }, { "clip_ratio/high_max": 0.012003393028862774, "clip_ratio/high_mean": 0.002419844298856333, "clip_ratio/low_mean": 0.002093220296956133, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004513064573984593, "entropy": 0.3233438767492771, "epoch": 0.6113092205807438, "grad_norm": 14.180194854736328, "learning_rate": 3.110024449877751e-07, "loss": 2.4703, "reward": 2.938784599304199, "reward_std": 0.8582838177680969, "rewards/reasoning_density_reward/mean": 0.3850446343421936, "rewards/reasoning_density_reward/std": 0.15961378812789917, "rewards/success_reward/mean": 2.25, "rewards/success_reward/std": 1.095445156097412, "rewards/trajectory_similarity_reward/mean": 0.30373990535736084, "rewards/trajectory_similarity_reward/std": 0.30743250250816345, "step": 750 } ], "logging_steps": 1, "max_steps": 1227, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }