| { |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 0.019843238416509576, |
| "eval_steps": 500, |
| "global_step": 100, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "completion_length": 673.5, |
| "epoch": 0.00019843238416509574, |
| "grad_norm": 0.0, |
| "kl": 0.0, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.0, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 0.0, |
| "step": 1 |
| }, |
| { |
| "completion_length": 589.625, |
| "epoch": 0.0003968647683301915, |
| "grad_norm": 0.2197265625, |
| "kl": 0.0, |
| "learning_rate": 1e-05, |
| "loss": -0.0, |
| "reward": 1.375, |
| "reward_std": 0.39433756470680237, |
| "rewards/correctness_reward_func": 1.375, |
| "step": 2 |
| }, |
| { |
| "completion_length": 408.28125, |
| "epoch": 0.0005952971524952872, |
| "grad_norm": 0.1533203125, |
| "kl": 0.00010921969078481197, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.4375, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.4375, |
| "step": 3 |
| }, |
| { |
| "completion_length": 606.40625, |
| "epoch": 0.000793729536660383, |
| "grad_norm": 0.193359375, |
| "kl": 0.0011470153476693667, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.625, |
| "reward_std": 0.25, |
| "rewards/correctness_reward_func": 0.625, |
| "step": 4 |
| }, |
| { |
| "completion_length": 382.59375, |
| "epoch": 0.0009921619208254787, |
| "grad_norm": 0.18359375, |
| "kl": 0.0041184365400113165, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.3125, |
| "reward_std": 0.26933756470680237, |
| "rewards/correctness_reward_func": 1.3125, |
| "step": 5 |
| }, |
| { |
| "completion_length": 528.28125, |
| "epoch": 0.0011905943049905744, |
| "grad_norm": 0.002655029296875, |
| "kl": 0.0031762155922478996, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.5, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 1.5, |
| "step": 6 |
| }, |
| { |
| "completion_length": 486.625, |
| "epoch": 0.0013890266891556703, |
| "grad_norm": 0.22265625, |
| "kl": 0.006348274531774223, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.625, |
| "reward_std": 0.14433756470680237, |
| "rewards/correctness_reward_func": 1.625, |
| "step": 7 |
| }, |
| { |
| "completion_length": 295.09375, |
| "epoch": 0.001587459073320766, |
| "grad_norm": 0.1318359375, |
| "kl": 0.00916035019326955, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.6875, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.6875, |
| "step": 8 |
| }, |
| { |
| "completion_length": 305.9375, |
| "epoch": 0.0017858914574858616, |
| "grad_norm": 0.003814697265625, |
| "kl": 0.01111468207091093, |
| "learning_rate": 1e-05, |
| "loss": 0.0001, |
| "reward": 2.0, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 2.0, |
| "step": 9 |
| }, |
| { |
| "completion_length": 262.59375, |
| "epoch": 0.0019843238416509573, |
| "grad_norm": 0.006805419921875, |
| "kl": 0.01166562782600522, |
| "learning_rate": 1e-05, |
| "loss": 0.0001, |
| "reward": 2.0, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 2.0, |
| "step": 10 |
| }, |
| { |
| "completion_length": 427.28125, |
| "epoch": 0.002182756225816053, |
| "grad_norm": 0.134765625, |
| "kl": 0.0021403132705017924, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.4375, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.4375, |
| "step": 11 |
| }, |
| { |
| "completion_length": 454.96875, |
| "epoch": 0.0023811886099811487, |
| "grad_norm": 0.15625, |
| "kl": 0.009784933528862894, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.1875, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.1875, |
| "step": 12 |
| }, |
| { |
| "completion_length": 520.0625, |
| "epoch": 0.002579620994146245, |
| "grad_norm": 0.208984375, |
| "kl": 0.0027196165174245834, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.8125, |
| "reward_std": 0.375, |
| "rewards/correctness_reward_func": 0.8125, |
| "step": 13 |
| }, |
| { |
| "completion_length": 270.5625, |
| "epoch": 0.0027780533783113405, |
| "grad_norm": 0.1396484375, |
| "kl": 0.00326572876656428, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.1875, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.1875, |
| "step": 14 |
| }, |
| { |
| "completion_length": 302.71875, |
| "epoch": 0.0029764857624764362, |
| "grad_norm": 0.09130859375, |
| "kl": 0.0021118283621035516, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.9375, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.9375, |
| "step": 15 |
| }, |
| { |
| "completion_length": 289.03125, |
| "epoch": 0.003174918146641532, |
| "grad_norm": 0.123046875, |
| "kl": 0.006330179603537545, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.9375, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.9375, |
| "step": 16 |
| }, |
| { |
| "completion_length": 377.28125, |
| "epoch": 0.0033733505308066276, |
| "grad_norm": 0.0027923583984375, |
| "kl": 0.008314917489769869, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.5, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 1.5, |
| "step": 17 |
| }, |
| { |
| "completion_length": 366.1875, |
| "epoch": 0.0035717829149717233, |
| "grad_norm": 0.0023956298828125, |
| "kl": 0.006974527728743851, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.25, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 1.25, |
| "step": 18 |
| }, |
| { |
| "completion_length": 455.53125, |
| "epoch": 0.003770215299136819, |
| "grad_norm": 0.1455078125, |
| "kl": 0.0025141297810478136, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.25, |
| "reward_std": 0.39433756470680237, |
| "rewards/correctness_reward_func": 1.25, |
| "step": 19 |
| }, |
| { |
| "completion_length": 512.03125, |
| "epoch": 0.003968647683301915, |
| "grad_norm": 0.1826171875, |
| "kl": 0.0014448043148149736, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.1875, |
| "reward_std": 0.26933756470680237, |
| "rewards/correctness_reward_func": 1.1875, |
| "step": 20 |
| }, |
| { |
| "completion_length": 539.78125, |
| "epoch": 0.00416708006746701, |
| "grad_norm": 0.1328125, |
| "kl": 0.0007829267560737208, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.375, |
| "reward_std": 0.25, |
| "rewards/correctness_reward_func": 1.375, |
| "step": 21 |
| }, |
| { |
| "completion_length": 524.8125, |
| "epoch": 0.004365512451632106, |
| "grad_norm": 0.1962890625, |
| "kl": 0.0011430769227445126, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.125, |
| "reward_std": 0.25, |
| "rewards/correctness_reward_func": 1.125, |
| "step": 22 |
| }, |
| { |
| "completion_length": 354.46875, |
| "epoch": 0.004563944835797202, |
| "grad_norm": 0.12890625, |
| "kl": 0.0008475587819702923, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.8125, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.8125, |
| "step": 23 |
| }, |
| { |
| "completion_length": 358.15625, |
| "epoch": 0.0047623772199622974, |
| "grad_norm": 0.00142669677734375, |
| "kl": 0.0014332281207316555, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 2.0, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 2.0, |
| "step": 24 |
| }, |
| { |
| "completion_length": 458.84375, |
| "epoch": 0.004960809604127394, |
| "grad_norm": 0.1318359375, |
| "kl": 0.0006973636773182079, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.5625, |
| "reward_std": 0.26933756470680237, |
| "rewards/correctness_reward_func": 1.5625, |
| "step": 25 |
| }, |
| { |
| "completion_length": 391.46875, |
| "epoch": 0.00515924198829249, |
| "grad_norm": 0.189453125, |
| "kl": 0.0014636927953688428, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.625, |
| "reward_std": 0.25, |
| "rewards/correctness_reward_func": 1.625, |
| "step": 26 |
| }, |
| { |
| "completion_length": 258.3125, |
| "epoch": 0.005357674372457585, |
| "grad_norm": 0.1484375, |
| "kl": 0.004023743560537696, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.9375, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.9375, |
| "step": 27 |
| }, |
| { |
| "completion_length": 271.75, |
| "epoch": 0.005556106756622681, |
| "grad_norm": 0.12109375, |
| "kl": 0.0016350722071365453, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.9375, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.9375, |
| "step": 28 |
| }, |
| { |
| "completion_length": 308.96875, |
| "epoch": 0.005754539140787777, |
| "grad_norm": 0.001739501953125, |
| "kl": 0.003819223667960614, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.5, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 1.5, |
| "step": 29 |
| }, |
| { |
| "completion_length": 515.9375, |
| "epoch": 0.0059529715249528724, |
| "grad_norm": 0.2451171875, |
| "kl": 0.0021796236469526775, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.75, |
| "reward_std": 0.39433756470680237, |
| "rewards/correctness_reward_func": 0.75, |
| "step": 30 |
| }, |
| { |
| "completion_length": 403.65625, |
| "epoch": 0.006151403909117968, |
| "grad_norm": 0.140625, |
| "kl": 0.0013396024442045018, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.5, |
| "reward_std": 0.25, |
| "rewards/correctness_reward_func": 1.5, |
| "step": 31 |
| }, |
| { |
| "completion_length": 469.875, |
| "epoch": 0.006349836293283064, |
| "grad_norm": 0.1455078125, |
| "kl": 0.001866564794909209, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.5, |
| "reward_std": 0.25, |
| "rewards/correctness_reward_func": 1.5, |
| "step": 32 |
| }, |
| { |
| "completion_length": 472.1875, |
| "epoch": 0.0065482686774481595, |
| "grad_norm": 0.1103515625, |
| "kl": 0.0019174512126483023, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.0625, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.0625, |
| "step": 33 |
| }, |
| { |
| "completion_length": 278.5625, |
| "epoch": 0.006746701061613255, |
| "grad_norm": 0.0005950927734375, |
| "kl": 0.0010064128291560337, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.75, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 1.75, |
| "step": 34 |
| }, |
| { |
| "completion_length": 391.03125, |
| "epoch": 0.006945133445778351, |
| "grad_norm": 0.09375, |
| "kl": 0.0012205626408103853, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.4375, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.4375, |
| "step": 35 |
| }, |
| { |
| "completion_length": 433.625, |
| "epoch": 0.007143565829943447, |
| "grad_norm": 0.189453125, |
| "kl": 0.0007209242321550846, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.8125, |
| "reward_std": 0.375, |
| "rewards/correctness_reward_func": 1.8125, |
| "step": 36 |
| }, |
| { |
| "completion_length": 362.71875, |
| "epoch": 0.007341998214108542, |
| "grad_norm": 0.11474609375, |
| "kl": 0.0012260141083970666, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.875, |
| "reward_std": 0.14433756470680237, |
| "rewards/correctness_reward_func": 1.875, |
| "step": 37 |
| }, |
| { |
| "completion_length": 339.875, |
| "epoch": 0.007540430598273638, |
| "grad_norm": 0.0027618408203125, |
| "kl": 0.009935397887602448, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.75, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 1.75, |
| "step": 38 |
| }, |
| { |
| "completion_length": 379.5, |
| "epoch": 0.007738862982438734, |
| "grad_norm": 0.185546875, |
| "kl": 0.0012411218194756657, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.9375, |
| "reward_std": 0.26933756470680237, |
| "rewards/correctness_reward_func": 0.9375, |
| "step": 39 |
| }, |
| { |
| "completion_length": 555.34375, |
| "epoch": 0.00793729536660383, |
| "grad_norm": 0.1201171875, |
| "kl": 0.007853956165490672, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.0625, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.0625, |
| "step": 40 |
| }, |
| { |
| "completion_length": 624.5, |
| "epoch": 0.008135727750768925, |
| "grad_norm": 0.279296875, |
| "kl": 0.0027262063522357494, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.8125, |
| "reward_std": 0.5193375647068024, |
| "rewards/correctness_reward_func": 0.8125, |
| "step": 41 |
| }, |
| { |
| "completion_length": 525.125, |
| "epoch": 0.00833416013493402, |
| "grad_norm": 0.166015625, |
| "kl": 0.0035142535489285365, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.375, |
| "reward_std": 0.39433756470680237, |
| "rewards/correctness_reward_func": 1.375, |
| "step": 42 |
| }, |
| { |
| "completion_length": 456.65625, |
| "epoch": 0.008532592519099116, |
| "grad_norm": 0.000522613525390625, |
| "kl": 0.0011033852133550681, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 0.75, |
| "step": 43 |
| }, |
| { |
| "completion_length": 252.8125, |
| "epoch": 0.008731024903264212, |
| "grad_norm": 0.126953125, |
| "kl": 0.0013557878410210833, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.875, |
| "reward_std": 0.14433756470680237, |
| "rewards/correctness_reward_func": 1.875, |
| "step": 44 |
| }, |
| { |
| "completion_length": 283.5625, |
| "epoch": 0.008929457287429308, |
| "grad_norm": 0.00055694580078125, |
| "kl": 0.0010409851965960115, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.0, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 1.0, |
| "step": 45 |
| }, |
| { |
| "completion_length": 452.6875, |
| "epoch": 0.009127889671594403, |
| "grad_norm": 0.0810546875, |
| "kl": 0.0016598845832049847, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.8125, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.8125, |
| "step": 46 |
| }, |
| { |
| "completion_length": 504.59375, |
| "epoch": 0.0093263220557595, |
| "grad_norm": 0.1064453125, |
| "kl": 0.001195055043353932, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.6875, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.6875, |
| "step": 47 |
| }, |
| { |
| "completion_length": 350.375, |
| "epoch": 0.009524754439924595, |
| "grad_norm": 0.06591796875, |
| "kl": 0.0007179172534961253, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.9375, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.9375, |
| "step": 48 |
| }, |
| { |
| "completion_length": 356.75, |
| "epoch": 0.009723186824089692, |
| "grad_norm": 0.06640625, |
| "kl": 0.004019862040877342, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.9375, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.9375, |
| "step": 49 |
| }, |
| { |
| "completion_length": 343.9375, |
| "epoch": 0.009921619208254788, |
| "grad_norm": 0.00055694580078125, |
| "kl": 0.0014488446759060025, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 2.0, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 2.0, |
| "step": 50 |
| }, |
| { |
| "completion_length": 456.4375, |
| "epoch": 0.010120051592419884, |
| "grad_norm": 0.169921875, |
| "kl": 0.001344717078609392, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.5625, |
| "reward_std": 0.375, |
| "rewards/correctness_reward_func": 1.5625, |
| "step": 51 |
| }, |
| { |
| "completion_length": 489.3125, |
| "epoch": 0.01031848397658498, |
| "grad_norm": 0.1845703125, |
| "kl": 0.0024816631339490414, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.1875, |
| "reward_std": 0.375, |
| "rewards/correctness_reward_func": 1.1875, |
| "step": 52 |
| }, |
| { |
| "completion_length": 489.5625, |
| "epoch": 0.010516916360750075, |
| "grad_norm": 0.12451171875, |
| "kl": 0.016249713487923145, |
| "learning_rate": 1e-05, |
| "loss": 0.0001, |
| "reward": 0.5625, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 0.5625, |
| "step": 53 |
| }, |
| { |
| "completion_length": 556.8125, |
| "epoch": 0.01071534874491517, |
| "grad_norm": 0.2490234375, |
| "kl": 0.0019329865172039717, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.375, |
| "reward_std": 0.6443375647068024, |
| "rewards/correctness_reward_func": 1.375, |
| "step": 54 |
| }, |
| { |
| "completion_length": 514.0, |
| "epoch": 0.010913781129080266, |
| "grad_norm": 0.6796875, |
| "kl": 0.005961886083241552, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.6875, |
| "reward_std": 0.41367512941360474, |
| "rewards/correctness_reward_func": 0.6875, |
| "step": 55 |
| }, |
| { |
| "completion_length": 432.84375, |
| "epoch": 0.011112213513245362, |
| "grad_norm": 0.19140625, |
| "kl": 0.0009212676668539643, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.1875, |
| "reward_std": 0.41367512941360474, |
| "rewards/correctness_reward_func": 1.1875, |
| "step": 56 |
| }, |
| { |
| "completion_length": 434.0625, |
| "epoch": 0.011310645897410458, |
| "grad_norm": 0.318359375, |
| "kl": 0.0013161345414118841, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.0625, |
| "reward_std": 0.6636751294136047, |
| "rewards/correctness_reward_func": 1.0625, |
| "step": 57 |
| }, |
| { |
| "completion_length": 503.9375, |
| "epoch": 0.011509078281575554, |
| "grad_norm": 0.10791015625, |
| "kl": 0.0013501367502612993, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.6875, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 0.6875, |
| "step": 58 |
| }, |
| { |
| "completion_length": 577.25, |
| "epoch": 0.01170751066574065, |
| "grad_norm": 0.06298828125, |
| "kl": 0.0004623739223461598, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.1875, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 0.1875, |
| "step": 59 |
| }, |
| { |
| "completion_length": 639.375, |
| "epoch": 0.011905943049905745, |
| "grad_norm": 0.0908203125, |
| "kl": 0.0009281258899136446, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.6875, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 0.6875, |
| "step": 60 |
| }, |
| { |
| "completion_length": 631.3125, |
| "epoch": 0.01210437543407084, |
| "grad_norm": 0.000553131103515625, |
| "kl": 0.0021498738351510838, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 0.75, |
| "step": 61 |
| }, |
| { |
| "completion_length": 328.8125, |
| "epoch": 0.012302807818235936, |
| "grad_norm": 0.000690460205078125, |
| "kl": 0.0010117258789250627, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 0.75, |
| "step": 62 |
| }, |
| { |
| "completion_length": 273.8125, |
| "epoch": 0.012501240202401032, |
| "grad_norm": 0.103515625, |
| "kl": 0.000650071247946471, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.4375, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.4375, |
| "step": 63 |
| }, |
| { |
| "completion_length": 450.03125, |
| "epoch": 0.012699672586566128, |
| "grad_norm": 0.1552734375, |
| "kl": 0.0009097288202610798, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.8125, |
| "reward_std": 0.26933756470680237, |
| "rewards/correctness_reward_func": 1.8125, |
| "step": 64 |
| }, |
| { |
| "completion_length": 415.96875, |
| "epoch": 0.012898104970731223, |
| "grad_norm": 0.0830078125, |
| "kl": 0.0014095778460614383, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.875, |
| "reward_std": 0.14433756470680237, |
| "rewards/correctness_reward_func": 1.875, |
| "step": 65 |
| }, |
| { |
| "completion_length": 421.8125, |
| "epoch": 0.013096537354896319, |
| "grad_norm": 0.09130859375, |
| "kl": 0.0017693252448225394, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.9375, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.9375, |
| "step": 66 |
| }, |
| { |
| "completion_length": 322.65625, |
| "epoch": 0.013294969739061415, |
| "grad_norm": 0.1484375, |
| "kl": 0.007693824853049591, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.875, |
| "reward_std": 0.14433756470680237, |
| "rewards/correctness_reward_func": 1.875, |
| "step": 67 |
| }, |
| { |
| "completion_length": 273.0625, |
| "epoch": 0.01349340212322651, |
| "grad_norm": 0.1787109375, |
| "kl": 0.0014752715069334954, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.875, |
| "reward_std": 0.14433756470680237, |
| "rewards/correctness_reward_func": 1.875, |
| "step": 68 |
| }, |
| { |
| "completion_length": 252.09375, |
| "epoch": 0.013691834507391606, |
| "grad_norm": 0.11083984375, |
| "kl": 0.0045530187780968845, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.6875, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.6875, |
| "step": 69 |
| }, |
| { |
| "completion_length": 430.96875, |
| "epoch": 0.013890266891556702, |
| "grad_norm": 0.1953125, |
| "kl": 0.0021810558391734958, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.75, |
| "reward_std": 0.39433756470680237, |
| "rewards/correctness_reward_func": 1.75, |
| "step": 70 |
| }, |
| { |
| "completion_length": 539.40625, |
| "epoch": 0.014088699275721797, |
| "grad_norm": 0.10498046875, |
| "kl": 0.003831994123174809, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.6875, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 0.6875, |
| "step": 71 |
| }, |
| { |
| "completion_length": 557.53125, |
| "epoch": 0.014287131659886893, |
| "grad_norm": 0.002471923828125, |
| "kl": 0.006553357859957032, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.0, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 1.0, |
| "step": 72 |
| }, |
| { |
| "completion_length": 587.78125, |
| "epoch": 0.014485564044051989, |
| "grad_norm": 0.27734375, |
| "kl": 0.0071588484570384026, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.0, |
| "reward_std": 0.5386751294136047, |
| "rewards/correctness_reward_func": 1.0, |
| "step": 73 |
| }, |
| { |
| "completion_length": 496.125, |
| "epoch": 0.014683996428217085, |
| "grad_norm": 0.28125, |
| "kl": 0.005753638513851911, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.0625, |
| "reward_std": 0.375, |
| "rewards/correctness_reward_func": 1.0625, |
| "step": 74 |
| }, |
| { |
| "completion_length": 400.90625, |
| "epoch": 0.01488242881238218, |
| "grad_norm": 0.234375, |
| "kl": 0.002603573986561969, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.5, |
| "reward_std": 0.39433756470680237, |
| "rewards/correctness_reward_func": 1.5, |
| "step": 75 |
| }, |
| { |
| "completion_length": 499.75, |
| "epoch": 0.015080861196547276, |
| "grad_norm": 0.162109375, |
| "kl": 0.003349974052980542, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.3125, |
| "reward_std": 0.375, |
| "rewards/correctness_reward_func": 1.3125, |
| "step": 76 |
| }, |
| { |
| "completion_length": 421.53125, |
| "epoch": 0.015279293580712372, |
| "grad_norm": 0.359375, |
| "kl": 0.003231665992643684, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.375, |
| "reward_std": 0.5386751294136047, |
| "rewards/correctness_reward_func": 1.375, |
| "step": 77 |
| }, |
| { |
| "completion_length": 324.59375, |
| "epoch": 0.015477725964877467, |
| "grad_norm": 0.345703125, |
| "kl": 0.0044938469072803855, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.75, |
| "reward_std": 0.25, |
| "rewards/correctness_reward_func": 0.75, |
| "step": 78 |
| }, |
| { |
| "completion_length": 584.875, |
| "epoch": 0.015676158349042565, |
| "grad_norm": 0.0007781982421875, |
| "kl": 0.0039344872056972235, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.25, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 0.25, |
| "step": 79 |
| }, |
| { |
| "completion_length": 568.84375, |
| "epoch": 0.01587459073320766, |
| "grad_norm": 0.000675201416015625, |
| "kl": 0.0011096175148850307, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.0, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 1.0, |
| "step": 80 |
| }, |
| { |
| "completion_length": 402.15625, |
| "epoch": 0.016073023117372756, |
| "grad_norm": 0.0005645751953125, |
| "kl": 0.002124628212186508, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.75, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 1.75, |
| "step": 81 |
| }, |
| { |
| "completion_length": 303.84375, |
| "epoch": 0.01627145550153785, |
| "grad_norm": 0.000911712646484375, |
| "kl": 0.001547299834783189, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.5, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 1.5, |
| "step": 82 |
| }, |
| { |
| "completion_length": 442.40625, |
| "epoch": 0.016469887885702948, |
| "grad_norm": 0.22265625, |
| "kl": 0.0019549240387277678, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.6875, |
| "reward_std": 0.41367512941360474, |
| "rewards/correctness_reward_func": 1.6875, |
| "step": 83 |
| }, |
| { |
| "completion_length": 363.5625, |
| "epoch": 0.01666832026986804, |
| "grad_norm": 0.1005859375, |
| "kl": 0.0021169226529309526, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.4375, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.4375, |
| "step": 84 |
| }, |
| { |
| "completion_length": 333.5, |
| "epoch": 0.01686675265403314, |
| "grad_norm": 0.00101470947265625, |
| "kl": 0.0020763709326274693, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 2.0, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 2.0, |
| "step": 85 |
| }, |
| { |
| "completion_length": 260.6875, |
| "epoch": 0.017065185038198233, |
| "grad_norm": 0.2578125, |
| "kl": 0.0023609662894159555, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.9375, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.9375, |
| "step": 86 |
| }, |
| { |
| "completion_length": 317.78125, |
| "epoch": 0.01726361742236333, |
| "grad_norm": 0.1416015625, |
| "kl": 0.0023049223236739635, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.8125, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.8125, |
| "step": 87 |
| }, |
| { |
| "completion_length": 374.5625, |
| "epoch": 0.017462049806528424, |
| "grad_norm": 0.002838134765625, |
| "kl": 0.003084336465690285, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 2.0, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 2.0, |
| "step": 88 |
| }, |
| { |
| "completion_length": 400.75, |
| "epoch": 0.01766048219069352, |
| "grad_norm": 0.265625, |
| "kl": 0.004105731437448412, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.25, |
| "reward_std": 0.25, |
| "rewards/correctness_reward_func": 1.25, |
| "step": 89 |
| }, |
| { |
| "completion_length": 481.28125, |
| "epoch": 0.017858914574858616, |
| "grad_norm": 0.00104522705078125, |
| "kl": 0.004729912034235895, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.5, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 0.5, |
| "step": 90 |
| }, |
| { |
| "completion_length": 660.34375, |
| "epoch": 0.018057346959023713, |
| "grad_norm": 0.2421875, |
| "kl": 0.005954354302957654, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.0, |
| "reward_std": 0.6830126941204071, |
| "rewards/correctness_reward_func": 1.0, |
| "step": 91 |
| }, |
| { |
| "completion_length": 547.09375, |
| "epoch": 0.018255779343188807, |
| "grad_norm": 0.248046875, |
| "kl": 0.004669041052693501, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.625, |
| "reward_std": 0.6443375647068024, |
| "rewards/correctness_reward_func": 0.625, |
| "step": 92 |
| }, |
| { |
| "completion_length": 467.71875, |
| "epoch": 0.018454211727353904, |
| "grad_norm": 0.189453125, |
| "kl": 0.0035645719908643514, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.3125, |
| "reward_std": 0.375, |
| "rewards/correctness_reward_func": 1.3125, |
| "step": 93 |
| }, |
| { |
| "completion_length": 442.84375, |
| "epoch": 0.018652644111519, |
| "grad_norm": 0.146484375, |
| "kl": 0.0033500409917905927, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.3125, |
| "reward_std": 0.375, |
| "rewards/correctness_reward_func": 1.3125, |
| "step": 94 |
| }, |
| { |
| "completion_length": 457.875, |
| "epoch": 0.018851076495684096, |
| "grad_norm": 0.06787109375, |
| "kl": 0.0038696340925525874, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.8125, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.8125, |
| "step": 95 |
| }, |
| { |
| "completion_length": 522.15625, |
| "epoch": 0.01904950887984919, |
| "grad_norm": 0.1328125, |
| "kl": 0.005176389531698078, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.875, |
| "reward_std": 0.25, |
| "rewards/correctness_reward_func": 0.875, |
| "step": 96 |
| }, |
| { |
| "completion_length": 682.34375, |
| "epoch": 0.019247941264014287, |
| "grad_norm": 0.000698089599609375, |
| "kl": 0.003805596032179892, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.0, |
| "reward_std": 0.0, |
| "rewards/correctness_reward_func": 0.0, |
| "step": 97 |
| }, |
| { |
| "completion_length": 561.03125, |
| "epoch": 0.019446373648179385, |
| "grad_norm": 0.078125, |
| "kl": 0.003582520061172545, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.6875, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 0.6875, |
| "step": 98 |
| }, |
| { |
| "completion_length": 517.96875, |
| "epoch": 0.01964480603234448, |
| "grad_norm": 0.16796875, |
| "kl": 0.005401681060902774, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 0.0625, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 0.0625, |
| "step": 99 |
| }, |
| { |
| "completion_length": 377.4375, |
| "epoch": 0.019843238416509576, |
| "grad_norm": 0.12255859375, |
| "kl": 0.0034658076183404773, |
| "learning_rate": 1e-05, |
| "loss": 0.0, |
| "reward": 1.1875, |
| "reward_std": 0.125, |
| "rewards/correctness_reward_func": 1.1875, |
| "step": 100 |
| } |
| ], |
| "logging_steps": 1, |
| "max_steps": 1007800, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 200, |
| "save_steps": 10, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 0.0, |
| "train_batch_size": 2, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|