{ "best_global_step": 1044, "best_metric": 37.0629, "best_model_checkpoint": "./results_pegasus/checkpoint-1044", "epoch": 3.0, "eval_steps": 500, "global_step": 1044, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.14398848092152627, "grad_norm": 71.70013427734375, "learning_rate": 2.859195402298851e-05, "loss": 29.788212890625, "step": 50 }, { "epoch": 0.28797696184305255, "grad_norm": 73.66615295410156, "learning_rate": 2.7155172413793102e-05, "loss": 24.89407958984375, "step": 100 }, { "epoch": 0.4319654427645788, "grad_norm": 70.73384094238281, "learning_rate": 2.57183908045977e-05, "loss": 24.67899169921875, "step": 150 }, { "epoch": 0.5759539236861051, "grad_norm": 67.04731750488281, "learning_rate": 2.4281609195402298e-05, "loss": 23.75695068359375, "step": 200 }, { "epoch": 0.7199424046076314, "grad_norm": 62.45637130737305, "learning_rate": 2.2844827586206897e-05, "loss": 23.85019287109375, "step": 250 }, { "epoch": 0.8639308855291576, "grad_norm": 1750.8475341796875, "learning_rate": 2.1408045977011497e-05, "loss": 23.247626953125, "step": 300 }, { "epoch": 1.0, "eval_loss": 2.6326208114624023, "eval_model_preparation_time": 0.0127, "eval_rouge1": 42.9633, "eval_rouge2": 20.797, "eval_rougeL": 36.68, "eval_rougeLsum": 36.5897, "eval_runtime": 183.6557, "eval_samples_per_second": 1.889, "eval_steps_per_second": 1.889, "step": 348 }, { "epoch": 1.005759539236861, "grad_norm": 85.54132843017578, "learning_rate": 1.997126436781609e-05, "loss": 22.84858642578125, "step": 350 }, { "epoch": 1.1497480201583874, "grad_norm": 70.81609344482422, "learning_rate": 1.853448275862069e-05, "loss": 22.126240234375, "step": 400 }, { "epoch": 1.2937365010799136, "grad_norm": 214.08627319335938, "learning_rate": 1.709770114942529e-05, "loss": 21.31904052734375, "step": 450 }, { "epoch": 1.43772498200144, "grad_norm": 77.83561706542969, "learning_rate": 1.5660919540229885e-05, "loss": 22.437314453125, "step": 500 }, { "epoch": 1.5817134629229663, "grad_norm": 123.08596801757812, "learning_rate": 1.4224137931034483e-05, "loss": 21.7467578125, "step": 550 }, { "epoch": 1.7257019438444925, "grad_norm": 60.972755432128906, "learning_rate": 1.2787356321839081e-05, "loss": 21.26820068359375, "step": 600 }, { "epoch": 1.8696904247660187, "grad_norm": 90.81558227539062, "learning_rate": 1.1350574712643677e-05, "loss": 21.498505859375, "step": 650 }, { "epoch": 2.0, "eval_loss": 2.586069345474243, "eval_model_preparation_time": 0.0127, "eval_rouge1": 43.4483, "eval_rouge2": 21.3048, "eval_rougeL": 36.9716, "eval_rougeLsum": 36.8742, "eval_runtime": 179.8863, "eval_samples_per_second": 1.929, "eval_steps_per_second": 1.929, "step": 696 }, { "epoch": 2.011519078473722, "grad_norm": 79.58966064453125, "learning_rate": 9.913793103448277e-06, "loss": 21.545439453125, "step": 700 }, { "epoch": 2.1555075593952484, "grad_norm": 62.96016311645508, "learning_rate": 8.477011494252873e-06, "loss": 21.18465576171875, "step": 750 }, { "epoch": 2.299496040316775, "grad_norm": 114.29676818847656, "learning_rate": 7.040229885057472e-06, "loss": 20.94623291015625, "step": 800 }, { "epoch": 2.443484521238301, "grad_norm": 427.0086364746094, "learning_rate": 5.603448275862069e-06, "loss": 21.252041015625, "step": 850 }, { "epoch": 2.587473002159827, "grad_norm": 82.54395294189453, "learning_rate": 4.166666666666667e-06, "loss": 20.805263671875, "step": 900 }, { "epoch": 2.7314614830813535, "grad_norm": 195.64202880859375, "learning_rate": 2.7298850574712644e-06, "loss": 20.5162548828125, "step": 950 }, { "epoch": 2.87544996400288, "grad_norm": 90.92398834228516, "learning_rate": 1.2931034482758623e-06, "loss": 20.5969873046875, "step": 1000 }, { "epoch": 3.0, "eval_loss": 2.579054832458496, "eval_model_preparation_time": 0.0127, "eval_rouge1": 43.6198, "eval_rouge2": 21.2562, "eval_rougeL": 37.0629, "eval_rougeLsum": 36.9731, "eval_runtime": 178.3925, "eval_samples_per_second": 1.945, "eval_steps_per_second": 1.945, "step": 1044 } ], "logging_steps": 50, "max_steps": 1044, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4686367027249152.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }