GAINRL-Qwen2.5-7B-Instruct / trainer_state.json
Qinsi1's picture
Upload via huggingface_hub API
bccc713 verified
Raw
History Blame Contribute Delete
32.9 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.019843238416509576,
"eval_steps": 500,
"global_step": 100,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"completion_length": 673.5,
"epoch": 0.00019843238416509574,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/correctness_reward_func": 0.0,
"step": 1
},
{
"completion_length": 589.625,
"epoch": 0.0003968647683301915,
"grad_norm": 0.2197265625,
"kl": 0.0,
"learning_rate": 1e-05,
"loss": -0.0,
"reward": 1.375,
"reward_std": 0.39433756470680237,
"rewards/correctness_reward_func": 1.375,
"step": 2
},
{
"completion_length": 408.28125,
"epoch": 0.0005952971524952872,
"grad_norm": 0.1533203125,
"kl": 0.00010921969078481197,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.4375,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.4375,
"step": 3
},
{
"completion_length": 606.40625,
"epoch": 0.000793729536660383,
"grad_norm": 0.193359375,
"kl": 0.0011470153476693667,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.625,
"reward_std": 0.25,
"rewards/correctness_reward_func": 0.625,
"step": 4
},
{
"completion_length": 382.59375,
"epoch": 0.0009921619208254787,
"grad_norm": 0.18359375,
"kl": 0.0041184365400113165,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.3125,
"reward_std": 0.26933756470680237,
"rewards/correctness_reward_func": 1.3125,
"step": 5
},
{
"completion_length": 528.28125,
"epoch": 0.0011905943049905744,
"grad_norm": 0.002655029296875,
"kl": 0.0031762155922478996,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.5,
"reward_std": 0.0,
"rewards/correctness_reward_func": 1.5,
"step": 6
},
{
"completion_length": 486.625,
"epoch": 0.0013890266891556703,
"grad_norm": 0.22265625,
"kl": 0.006348274531774223,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.625,
"reward_std": 0.14433756470680237,
"rewards/correctness_reward_func": 1.625,
"step": 7
},
{
"completion_length": 295.09375,
"epoch": 0.001587459073320766,
"grad_norm": 0.1318359375,
"kl": 0.00916035019326955,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.6875,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.6875,
"step": 8
},
{
"completion_length": 305.9375,
"epoch": 0.0017858914574858616,
"grad_norm": 0.003814697265625,
"kl": 0.01111468207091093,
"learning_rate": 1e-05,
"loss": 0.0001,
"reward": 2.0,
"reward_std": 0.0,
"rewards/correctness_reward_func": 2.0,
"step": 9
},
{
"completion_length": 262.59375,
"epoch": 0.0019843238416509573,
"grad_norm": 0.006805419921875,
"kl": 0.01166562782600522,
"learning_rate": 1e-05,
"loss": 0.0001,
"reward": 2.0,
"reward_std": 0.0,
"rewards/correctness_reward_func": 2.0,
"step": 10
},
{
"completion_length": 427.28125,
"epoch": 0.002182756225816053,
"grad_norm": 0.134765625,
"kl": 0.0021403132705017924,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.4375,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.4375,
"step": 11
},
{
"completion_length": 454.96875,
"epoch": 0.0023811886099811487,
"grad_norm": 0.15625,
"kl": 0.009784933528862894,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.1875,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.1875,
"step": 12
},
{
"completion_length": 520.0625,
"epoch": 0.002579620994146245,
"grad_norm": 0.208984375,
"kl": 0.0027196165174245834,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.8125,
"reward_std": 0.375,
"rewards/correctness_reward_func": 0.8125,
"step": 13
},
{
"completion_length": 270.5625,
"epoch": 0.0027780533783113405,
"grad_norm": 0.1396484375,
"kl": 0.00326572876656428,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.1875,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.1875,
"step": 14
},
{
"completion_length": 302.71875,
"epoch": 0.0029764857624764362,
"grad_norm": 0.09130859375,
"kl": 0.0021118283621035516,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.9375,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.9375,
"step": 15
},
{
"completion_length": 289.03125,
"epoch": 0.003174918146641532,
"grad_norm": 0.123046875,
"kl": 0.006330179603537545,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.9375,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.9375,
"step": 16
},
{
"completion_length": 377.28125,
"epoch": 0.0033733505308066276,
"grad_norm": 0.0027923583984375,
"kl": 0.008314917489769869,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.5,
"reward_std": 0.0,
"rewards/correctness_reward_func": 1.5,
"step": 17
},
{
"completion_length": 366.1875,
"epoch": 0.0035717829149717233,
"grad_norm": 0.0023956298828125,
"kl": 0.006974527728743851,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.25,
"reward_std": 0.0,
"rewards/correctness_reward_func": 1.25,
"step": 18
},
{
"completion_length": 455.53125,
"epoch": 0.003770215299136819,
"grad_norm": 0.1455078125,
"kl": 0.0025141297810478136,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.25,
"reward_std": 0.39433756470680237,
"rewards/correctness_reward_func": 1.25,
"step": 19
},
{
"completion_length": 512.03125,
"epoch": 0.003968647683301915,
"grad_norm": 0.1826171875,
"kl": 0.0014448043148149736,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.1875,
"reward_std": 0.26933756470680237,
"rewards/correctness_reward_func": 1.1875,
"step": 20
},
{
"completion_length": 539.78125,
"epoch": 0.00416708006746701,
"grad_norm": 0.1328125,
"kl": 0.0007829267560737208,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.375,
"reward_std": 0.25,
"rewards/correctness_reward_func": 1.375,
"step": 21
},
{
"completion_length": 524.8125,
"epoch": 0.004365512451632106,
"grad_norm": 0.1962890625,
"kl": 0.0011430769227445126,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.125,
"reward_std": 0.25,
"rewards/correctness_reward_func": 1.125,
"step": 22
},
{
"completion_length": 354.46875,
"epoch": 0.004563944835797202,
"grad_norm": 0.12890625,
"kl": 0.0008475587819702923,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.8125,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.8125,
"step": 23
},
{
"completion_length": 358.15625,
"epoch": 0.0047623772199622974,
"grad_norm": 0.00142669677734375,
"kl": 0.0014332281207316555,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 2.0,
"reward_std": 0.0,
"rewards/correctness_reward_func": 2.0,
"step": 24
},
{
"completion_length": 458.84375,
"epoch": 0.004960809604127394,
"grad_norm": 0.1318359375,
"kl": 0.0006973636773182079,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.5625,
"reward_std": 0.26933756470680237,
"rewards/correctness_reward_func": 1.5625,
"step": 25
},
{
"completion_length": 391.46875,
"epoch": 0.00515924198829249,
"grad_norm": 0.189453125,
"kl": 0.0014636927953688428,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.625,
"reward_std": 0.25,
"rewards/correctness_reward_func": 1.625,
"step": 26
},
{
"completion_length": 258.3125,
"epoch": 0.005357674372457585,
"grad_norm": 0.1484375,
"kl": 0.004023743560537696,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.9375,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.9375,
"step": 27
},
{
"completion_length": 271.75,
"epoch": 0.005556106756622681,
"grad_norm": 0.12109375,
"kl": 0.0016350722071365453,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.9375,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.9375,
"step": 28
},
{
"completion_length": 308.96875,
"epoch": 0.005754539140787777,
"grad_norm": 0.001739501953125,
"kl": 0.003819223667960614,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.5,
"reward_std": 0.0,
"rewards/correctness_reward_func": 1.5,
"step": 29
},
{
"completion_length": 515.9375,
"epoch": 0.0059529715249528724,
"grad_norm": 0.2451171875,
"kl": 0.0021796236469526775,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.75,
"reward_std": 0.39433756470680237,
"rewards/correctness_reward_func": 0.75,
"step": 30
},
{
"completion_length": 403.65625,
"epoch": 0.006151403909117968,
"grad_norm": 0.140625,
"kl": 0.0013396024442045018,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.5,
"reward_std": 0.25,
"rewards/correctness_reward_func": 1.5,
"step": 31
},
{
"completion_length": 469.875,
"epoch": 0.006349836293283064,
"grad_norm": 0.1455078125,
"kl": 0.001866564794909209,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.5,
"reward_std": 0.25,
"rewards/correctness_reward_func": 1.5,
"step": 32
},
{
"completion_length": 472.1875,
"epoch": 0.0065482686774481595,
"grad_norm": 0.1103515625,
"kl": 0.0019174512126483023,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.0625,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.0625,
"step": 33
},
{
"completion_length": 278.5625,
"epoch": 0.006746701061613255,
"grad_norm": 0.0005950927734375,
"kl": 0.0010064128291560337,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.75,
"reward_std": 0.0,
"rewards/correctness_reward_func": 1.75,
"step": 34
},
{
"completion_length": 391.03125,
"epoch": 0.006945133445778351,
"grad_norm": 0.09375,
"kl": 0.0012205626408103853,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.4375,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.4375,
"step": 35
},
{
"completion_length": 433.625,
"epoch": 0.007143565829943447,
"grad_norm": 0.189453125,
"kl": 0.0007209242321550846,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.8125,
"reward_std": 0.375,
"rewards/correctness_reward_func": 1.8125,
"step": 36
},
{
"completion_length": 362.71875,
"epoch": 0.007341998214108542,
"grad_norm": 0.11474609375,
"kl": 0.0012260141083970666,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.875,
"reward_std": 0.14433756470680237,
"rewards/correctness_reward_func": 1.875,
"step": 37
},
{
"completion_length": 339.875,
"epoch": 0.007540430598273638,
"grad_norm": 0.0027618408203125,
"kl": 0.009935397887602448,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.75,
"reward_std": 0.0,
"rewards/correctness_reward_func": 1.75,
"step": 38
},
{
"completion_length": 379.5,
"epoch": 0.007738862982438734,
"grad_norm": 0.185546875,
"kl": 0.0012411218194756657,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.9375,
"reward_std": 0.26933756470680237,
"rewards/correctness_reward_func": 0.9375,
"step": 39
},
{
"completion_length": 555.34375,
"epoch": 0.00793729536660383,
"grad_norm": 0.1201171875,
"kl": 0.007853956165490672,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.0625,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.0625,
"step": 40
},
{
"completion_length": 624.5,
"epoch": 0.008135727750768925,
"grad_norm": 0.279296875,
"kl": 0.0027262063522357494,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.8125,
"reward_std": 0.5193375647068024,
"rewards/correctness_reward_func": 0.8125,
"step": 41
},
{
"completion_length": 525.125,
"epoch": 0.00833416013493402,
"grad_norm": 0.166015625,
"kl": 0.0035142535489285365,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.375,
"reward_std": 0.39433756470680237,
"rewards/correctness_reward_func": 1.375,
"step": 42
},
{
"completion_length": 456.65625,
"epoch": 0.008532592519099116,
"grad_norm": 0.000522613525390625,
"kl": 0.0011033852133550681,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.75,
"reward_std": 0.0,
"rewards/correctness_reward_func": 0.75,
"step": 43
},
{
"completion_length": 252.8125,
"epoch": 0.008731024903264212,
"grad_norm": 0.126953125,
"kl": 0.0013557878410210833,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.875,
"reward_std": 0.14433756470680237,
"rewards/correctness_reward_func": 1.875,
"step": 44
},
{
"completion_length": 283.5625,
"epoch": 0.008929457287429308,
"grad_norm": 0.00055694580078125,
"kl": 0.0010409851965960115,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.0,
"reward_std": 0.0,
"rewards/correctness_reward_func": 1.0,
"step": 45
},
{
"completion_length": 452.6875,
"epoch": 0.009127889671594403,
"grad_norm": 0.0810546875,
"kl": 0.0016598845832049847,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.8125,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.8125,
"step": 46
},
{
"completion_length": 504.59375,
"epoch": 0.0093263220557595,
"grad_norm": 0.1064453125,
"kl": 0.001195055043353932,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.6875,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.6875,
"step": 47
},
{
"completion_length": 350.375,
"epoch": 0.009524754439924595,
"grad_norm": 0.06591796875,
"kl": 0.0007179172534961253,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.9375,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.9375,
"step": 48
},
{
"completion_length": 356.75,
"epoch": 0.009723186824089692,
"grad_norm": 0.06640625,
"kl": 0.004019862040877342,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.9375,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.9375,
"step": 49
},
{
"completion_length": 343.9375,
"epoch": 0.009921619208254788,
"grad_norm": 0.00055694580078125,
"kl": 0.0014488446759060025,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 2.0,
"reward_std": 0.0,
"rewards/correctness_reward_func": 2.0,
"step": 50
},
{
"completion_length": 456.4375,
"epoch": 0.010120051592419884,
"grad_norm": 0.169921875,
"kl": 0.001344717078609392,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.5625,
"reward_std": 0.375,
"rewards/correctness_reward_func": 1.5625,
"step": 51
},
{
"completion_length": 489.3125,
"epoch": 0.01031848397658498,
"grad_norm": 0.1845703125,
"kl": 0.0024816631339490414,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.1875,
"reward_std": 0.375,
"rewards/correctness_reward_func": 1.1875,
"step": 52
},
{
"completion_length": 489.5625,
"epoch": 0.010516916360750075,
"grad_norm": 0.12451171875,
"kl": 0.016249713487923145,
"learning_rate": 1e-05,
"loss": 0.0001,
"reward": 0.5625,
"reward_std": 0.125,
"rewards/correctness_reward_func": 0.5625,
"step": 53
},
{
"completion_length": 556.8125,
"epoch": 0.01071534874491517,
"grad_norm": 0.2490234375,
"kl": 0.0019329865172039717,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.375,
"reward_std": 0.6443375647068024,
"rewards/correctness_reward_func": 1.375,
"step": 54
},
{
"completion_length": 514.0,
"epoch": 0.010913781129080266,
"grad_norm": 0.6796875,
"kl": 0.005961886083241552,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.6875,
"reward_std": 0.41367512941360474,
"rewards/correctness_reward_func": 0.6875,
"step": 55
},
{
"completion_length": 432.84375,
"epoch": 0.011112213513245362,
"grad_norm": 0.19140625,
"kl": 0.0009212676668539643,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.1875,
"reward_std": 0.41367512941360474,
"rewards/correctness_reward_func": 1.1875,
"step": 56
},
{
"completion_length": 434.0625,
"epoch": 0.011310645897410458,
"grad_norm": 0.318359375,
"kl": 0.0013161345414118841,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.0625,
"reward_std": 0.6636751294136047,
"rewards/correctness_reward_func": 1.0625,
"step": 57
},
{
"completion_length": 503.9375,
"epoch": 0.011509078281575554,
"grad_norm": 0.10791015625,
"kl": 0.0013501367502612993,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.6875,
"reward_std": 0.125,
"rewards/correctness_reward_func": 0.6875,
"step": 58
},
{
"completion_length": 577.25,
"epoch": 0.01170751066574065,
"grad_norm": 0.06298828125,
"kl": 0.0004623739223461598,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.1875,
"reward_std": 0.125,
"rewards/correctness_reward_func": 0.1875,
"step": 59
},
{
"completion_length": 639.375,
"epoch": 0.011905943049905745,
"grad_norm": 0.0908203125,
"kl": 0.0009281258899136446,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.6875,
"reward_std": 0.125,
"rewards/correctness_reward_func": 0.6875,
"step": 60
},
{
"completion_length": 631.3125,
"epoch": 0.01210437543407084,
"grad_norm": 0.000553131103515625,
"kl": 0.0021498738351510838,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.75,
"reward_std": 0.0,
"rewards/correctness_reward_func": 0.75,
"step": 61
},
{
"completion_length": 328.8125,
"epoch": 0.012302807818235936,
"grad_norm": 0.000690460205078125,
"kl": 0.0010117258789250627,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.75,
"reward_std": 0.0,
"rewards/correctness_reward_func": 0.75,
"step": 62
},
{
"completion_length": 273.8125,
"epoch": 0.012501240202401032,
"grad_norm": 0.103515625,
"kl": 0.000650071247946471,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.4375,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.4375,
"step": 63
},
{
"completion_length": 450.03125,
"epoch": 0.012699672586566128,
"grad_norm": 0.1552734375,
"kl": 0.0009097288202610798,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.8125,
"reward_std": 0.26933756470680237,
"rewards/correctness_reward_func": 1.8125,
"step": 64
},
{
"completion_length": 415.96875,
"epoch": 0.012898104970731223,
"grad_norm": 0.0830078125,
"kl": 0.0014095778460614383,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.875,
"reward_std": 0.14433756470680237,
"rewards/correctness_reward_func": 1.875,
"step": 65
},
{
"completion_length": 421.8125,
"epoch": 0.013096537354896319,
"grad_norm": 0.09130859375,
"kl": 0.0017693252448225394,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.9375,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.9375,
"step": 66
},
{
"completion_length": 322.65625,
"epoch": 0.013294969739061415,
"grad_norm": 0.1484375,
"kl": 0.007693824853049591,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.875,
"reward_std": 0.14433756470680237,
"rewards/correctness_reward_func": 1.875,
"step": 67
},
{
"completion_length": 273.0625,
"epoch": 0.01349340212322651,
"grad_norm": 0.1787109375,
"kl": 0.0014752715069334954,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.875,
"reward_std": 0.14433756470680237,
"rewards/correctness_reward_func": 1.875,
"step": 68
},
{
"completion_length": 252.09375,
"epoch": 0.013691834507391606,
"grad_norm": 0.11083984375,
"kl": 0.0045530187780968845,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.6875,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.6875,
"step": 69
},
{
"completion_length": 430.96875,
"epoch": 0.013890266891556702,
"grad_norm": 0.1953125,
"kl": 0.0021810558391734958,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.75,
"reward_std": 0.39433756470680237,
"rewards/correctness_reward_func": 1.75,
"step": 70
},
{
"completion_length": 539.40625,
"epoch": 0.014088699275721797,
"grad_norm": 0.10498046875,
"kl": 0.003831994123174809,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.6875,
"reward_std": 0.125,
"rewards/correctness_reward_func": 0.6875,
"step": 71
},
{
"completion_length": 557.53125,
"epoch": 0.014287131659886893,
"grad_norm": 0.002471923828125,
"kl": 0.006553357859957032,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.0,
"reward_std": 0.0,
"rewards/correctness_reward_func": 1.0,
"step": 72
},
{
"completion_length": 587.78125,
"epoch": 0.014485564044051989,
"grad_norm": 0.27734375,
"kl": 0.0071588484570384026,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.0,
"reward_std": 0.5386751294136047,
"rewards/correctness_reward_func": 1.0,
"step": 73
},
{
"completion_length": 496.125,
"epoch": 0.014683996428217085,
"grad_norm": 0.28125,
"kl": 0.005753638513851911,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.0625,
"reward_std": 0.375,
"rewards/correctness_reward_func": 1.0625,
"step": 74
},
{
"completion_length": 400.90625,
"epoch": 0.01488242881238218,
"grad_norm": 0.234375,
"kl": 0.002603573986561969,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.5,
"reward_std": 0.39433756470680237,
"rewards/correctness_reward_func": 1.5,
"step": 75
},
{
"completion_length": 499.75,
"epoch": 0.015080861196547276,
"grad_norm": 0.162109375,
"kl": 0.003349974052980542,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.3125,
"reward_std": 0.375,
"rewards/correctness_reward_func": 1.3125,
"step": 76
},
{
"completion_length": 421.53125,
"epoch": 0.015279293580712372,
"grad_norm": 0.359375,
"kl": 0.003231665992643684,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.375,
"reward_std": 0.5386751294136047,
"rewards/correctness_reward_func": 1.375,
"step": 77
},
{
"completion_length": 324.59375,
"epoch": 0.015477725964877467,
"grad_norm": 0.345703125,
"kl": 0.0044938469072803855,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.75,
"reward_std": 0.25,
"rewards/correctness_reward_func": 0.75,
"step": 78
},
{
"completion_length": 584.875,
"epoch": 0.015676158349042565,
"grad_norm": 0.0007781982421875,
"kl": 0.0039344872056972235,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.25,
"reward_std": 0.0,
"rewards/correctness_reward_func": 0.25,
"step": 79
},
{
"completion_length": 568.84375,
"epoch": 0.01587459073320766,
"grad_norm": 0.000675201416015625,
"kl": 0.0011096175148850307,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.0,
"reward_std": 0.0,
"rewards/correctness_reward_func": 1.0,
"step": 80
},
{
"completion_length": 402.15625,
"epoch": 0.016073023117372756,
"grad_norm": 0.0005645751953125,
"kl": 0.002124628212186508,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.75,
"reward_std": 0.0,
"rewards/correctness_reward_func": 1.75,
"step": 81
},
{
"completion_length": 303.84375,
"epoch": 0.01627145550153785,
"grad_norm": 0.000911712646484375,
"kl": 0.001547299834783189,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.5,
"reward_std": 0.0,
"rewards/correctness_reward_func": 1.5,
"step": 82
},
{
"completion_length": 442.40625,
"epoch": 0.016469887885702948,
"grad_norm": 0.22265625,
"kl": 0.0019549240387277678,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.6875,
"reward_std": 0.41367512941360474,
"rewards/correctness_reward_func": 1.6875,
"step": 83
},
{
"completion_length": 363.5625,
"epoch": 0.01666832026986804,
"grad_norm": 0.1005859375,
"kl": 0.0021169226529309526,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.4375,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.4375,
"step": 84
},
{
"completion_length": 333.5,
"epoch": 0.01686675265403314,
"grad_norm": 0.00101470947265625,
"kl": 0.0020763709326274693,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 2.0,
"reward_std": 0.0,
"rewards/correctness_reward_func": 2.0,
"step": 85
},
{
"completion_length": 260.6875,
"epoch": 0.017065185038198233,
"grad_norm": 0.2578125,
"kl": 0.0023609662894159555,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.9375,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.9375,
"step": 86
},
{
"completion_length": 317.78125,
"epoch": 0.01726361742236333,
"grad_norm": 0.1416015625,
"kl": 0.0023049223236739635,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.8125,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.8125,
"step": 87
},
{
"completion_length": 374.5625,
"epoch": 0.017462049806528424,
"grad_norm": 0.002838134765625,
"kl": 0.003084336465690285,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 2.0,
"reward_std": 0.0,
"rewards/correctness_reward_func": 2.0,
"step": 88
},
{
"completion_length": 400.75,
"epoch": 0.01766048219069352,
"grad_norm": 0.265625,
"kl": 0.004105731437448412,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.25,
"reward_std": 0.25,
"rewards/correctness_reward_func": 1.25,
"step": 89
},
{
"completion_length": 481.28125,
"epoch": 0.017858914574858616,
"grad_norm": 0.00104522705078125,
"kl": 0.004729912034235895,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.5,
"reward_std": 0.0,
"rewards/correctness_reward_func": 0.5,
"step": 90
},
{
"completion_length": 660.34375,
"epoch": 0.018057346959023713,
"grad_norm": 0.2421875,
"kl": 0.005954354302957654,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.0,
"reward_std": 0.6830126941204071,
"rewards/correctness_reward_func": 1.0,
"step": 91
},
{
"completion_length": 547.09375,
"epoch": 0.018255779343188807,
"grad_norm": 0.248046875,
"kl": 0.004669041052693501,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.625,
"reward_std": 0.6443375647068024,
"rewards/correctness_reward_func": 0.625,
"step": 92
},
{
"completion_length": 467.71875,
"epoch": 0.018454211727353904,
"grad_norm": 0.189453125,
"kl": 0.0035645719908643514,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.3125,
"reward_std": 0.375,
"rewards/correctness_reward_func": 1.3125,
"step": 93
},
{
"completion_length": 442.84375,
"epoch": 0.018652644111519,
"grad_norm": 0.146484375,
"kl": 0.0033500409917905927,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.3125,
"reward_std": 0.375,
"rewards/correctness_reward_func": 1.3125,
"step": 94
},
{
"completion_length": 457.875,
"epoch": 0.018851076495684096,
"grad_norm": 0.06787109375,
"kl": 0.0038696340925525874,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.8125,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.8125,
"step": 95
},
{
"completion_length": 522.15625,
"epoch": 0.01904950887984919,
"grad_norm": 0.1328125,
"kl": 0.005176389531698078,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.875,
"reward_std": 0.25,
"rewards/correctness_reward_func": 0.875,
"step": 96
},
{
"completion_length": 682.34375,
"epoch": 0.019247941264014287,
"grad_norm": 0.000698089599609375,
"kl": 0.003805596032179892,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/correctness_reward_func": 0.0,
"step": 97
},
{
"completion_length": 561.03125,
"epoch": 0.019446373648179385,
"grad_norm": 0.078125,
"kl": 0.003582520061172545,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.6875,
"reward_std": 0.125,
"rewards/correctness_reward_func": 0.6875,
"step": 98
},
{
"completion_length": 517.96875,
"epoch": 0.01964480603234448,
"grad_norm": 0.16796875,
"kl": 0.005401681060902774,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 0.0625,
"reward_std": 0.125,
"rewards/correctness_reward_func": 0.0625,
"step": 99
},
{
"completion_length": 377.4375,
"epoch": 0.019843238416509576,
"grad_norm": 0.12255859375,
"kl": 0.0034658076183404773,
"learning_rate": 1e-05,
"loss": 0.0,
"reward": 1.1875,
"reward_std": 0.125,
"rewards/correctness_reward_func": 1.1875,
"step": 100
}
],
"logging_steps": 1,
"max_steps": 1007800,
"num_input_tokens_seen": 0,
"num_train_epochs": 200,
"save_steps": 10,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}