{ "best_metric": null, "best_model_checkpoint": null, "epoch": 29.933333333333334, "global_step": 210, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 1.4, "learning_rate": 0.0003, "loss": 145.7069, "step": 10 }, { "epoch": 1.4, "eval_cer": 0.03821196827685652, "eval_loss": 58.014591217041016, "eval_runtime": 4.5419, "eval_samples_per_second": 6.605, "eval_steps_per_second": 0.881, "eval_wer": 0.1686746987951807, "step": 10 }, { "epoch": 2.8, "learning_rate": 0.0003, "loss": 44.761, "step": 20 }, { "epoch": 2.8, "eval_cer": 0.0273972602739726, "eval_loss": 39.7237663269043, "eval_runtime": 4.6109, "eval_samples_per_second": 6.506, "eval_steps_per_second": 0.868, "eval_wer": 0.10040160642570281, "step": 20 }, { "epoch": 4.27, "learning_rate": 0.0003, "loss": 20.1119, "step": 30 }, { "epoch": 4.27, "eval_cer": 0.04830569574621485, "eval_loss": 56.178184509277344, "eval_runtime": 4.589, "eval_samples_per_second": 6.537, "eval_steps_per_second": 0.872, "eval_wer": 0.11646586345381527, "step": 30 }, { "epoch": 5.67, "learning_rate": 0.0003, "loss": 21.7069, "step": 40 }, { "epoch": 5.67, "eval_cer": 0.024513338139870222, "eval_loss": 32.25881576538086, "eval_runtime": 4.5716, "eval_samples_per_second": 6.562, "eval_steps_per_second": 0.875, "eval_wer": 0.07228915662650602, "step": 40 }, { "epoch": 7.13, "learning_rate": 0.0003, "loss": 16.8501, "step": 50 }, { "epoch": 7.13, "eval_cer": 0.020187454938716654, "eval_loss": 26.216426849365234, "eval_runtime": 5.4483, "eval_samples_per_second": 5.506, "eval_steps_per_second": 0.734, "eval_wer": 0.0642570281124498, "step": 50 }, { "epoch": 8.53, "learning_rate": 0.0003, "loss": 16.3551, "step": 60 }, { "epoch": 8.53, "eval_cer": 0.021629416005767843, "eval_loss": 26.32578468322754, "eval_runtime": 4.708, "eval_samples_per_second": 6.372, "eval_steps_per_second": 0.85, "eval_wer": 0.0642570281124498, "step": 60 }, { "epoch": 9.93, "learning_rate": 0.0003, "loss": 13.2955, "step": 70 }, { "epoch": 9.93, "eval_cer": 0.02090843547224225, "eval_loss": 29.824462890625, "eval_runtime": 4.6641, "eval_samples_per_second": 6.432, "eval_steps_per_second": 0.858, "eval_wer": 0.07228915662650602, "step": 70 }, { "epoch": 11.4, "learning_rate": 0.0003, "loss": 10.6388, "step": 80 }, { "epoch": 11.4, "eval_cer": 0.023792357606344627, "eval_loss": 35.78471755981445, "eval_runtime": 4.6396, "eval_samples_per_second": 6.466, "eval_steps_per_second": 0.862, "eval_wer": 0.08032128514056225, "step": 80 }, { "epoch": 12.8, "learning_rate": 0.0003, "loss": 15.3866, "step": 90 }, { "epoch": 12.8, "eval_cer": 0.028118240807498196, "eval_loss": 48.54670333862305, "eval_runtime": 4.711, "eval_samples_per_second": 6.368, "eval_steps_per_second": 0.849, "eval_wer": 0.07228915662650602, "step": 90 }, { "epoch": 14.27, "learning_rate": 0.0003, "loss": 13.6768, "step": 100 }, { "epoch": 14.27, "eval_cer": 0.021629416005767843, "eval_loss": 39.71575927734375, "eval_runtime": 4.6373, "eval_samples_per_second": 6.469, "eval_steps_per_second": 0.863, "eval_wer": 0.06827309236947791, "step": 100 }, { "epoch": 15.67, "learning_rate": 0.0003, "loss": 9.2418, "step": 110 }, { "epoch": 15.67, "eval_cer": 0.018745493871665464, "eval_loss": 28.570499420166016, "eval_runtime": 4.6852, "eval_samples_per_second": 6.403, "eval_steps_per_second": 0.854, "eval_wer": 0.05622489959839357, "step": 110 }, { "epoch": 17.13, "learning_rate": 0.0003, "loss": 12.3437, "step": 120 }, { "epoch": 17.13, "eval_cer": 0.023071377072819033, "eval_loss": 34.8448486328125, "eval_runtime": 4.6583, "eval_samples_per_second": 6.44, "eval_steps_per_second": 0.859, "eval_wer": 0.07228915662650602, "step": 120 }, { "epoch": 18.53, "learning_rate": 0.0003, "loss": 7.2282, "step": 130 }, { "epoch": 18.53, "eval_cer": 0.023071377072819033, "eval_loss": 49.3336181640625, "eval_runtime": 4.7123, "eval_samples_per_second": 6.366, "eval_steps_per_second": 0.849, "eval_wer": 0.08032128514056225, "step": 130 }, { "epoch": 19.93, "learning_rate": 0.0003, "loss": 11.1077, "step": 140 }, { "epoch": 19.93, "eval_cer": 0.022350396539293438, "eval_loss": 46.2687873840332, "eval_runtime": 4.6405, "eval_samples_per_second": 6.465, "eval_steps_per_second": 0.862, "eval_wer": 0.0642570281124498, "step": 140 }, { "epoch": 21.4, "learning_rate": 0.0003, "loss": 11.6916, "step": 150 }, { "epoch": 21.4, "eval_cer": 0.025234318673395817, "eval_loss": 38.663455963134766, "eval_runtime": 4.6616, "eval_samples_per_second": 6.436, "eval_steps_per_second": 0.858, "eval_wer": 0.08835341365461848, "step": 150 }, { "epoch": 22.8, "learning_rate": 0.0003, "loss": 7.708, "step": 160 }, { "epoch": 22.8, "eval_cer": 0.025234318673395817, "eval_loss": 30.76764488220215, "eval_runtime": 4.6877, "eval_samples_per_second": 6.4, "eval_steps_per_second": 0.853, "eval_wer": 0.08032128514056225, "step": 160 }, { "epoch": 24.27, "learning_rate": 0.0003, "loss": 8.0417, "step": 170 }, { "epoch": 24.27, "eval_cer": 0.024513338139870222, "eval_loss": 32.57201385498047, "eval_runtime": 4.6348, "eval_samples_per_second": 6.473, "eval_steps_per_second": 0.863, "eval_wer": 0.060240963855421686, "step": 170 }, { "epoch": 25.67, "learning_rate": 0.0003, "loss": 7.4786, "step": 180 }, { "epoch": 25.67, "eval_cer": 0.03749098774333093, "eval_loss": 60.628662109375, "eval_runtime": 4.6417, "eval_samples_per_second": 6.463, "eval_steps_per_second": 0.862, "eval_wer": 0.10843373493975904, "step": 180 }, { "epoch": 27.13, "learning_rate": 0.0003, "loss": 10.2845, "step": 190 }, { "epoch": 27.13, "eval_cer": 0.03316510454217736, "eval_loss": 46.47388458251953, "eval_runtime": 4.694, "eval_samples_per_second": 6.391, "eval_steps_per_second": 0.852, "eval_wer": 0.12048192771084337, "step": 190 }, { "epoch": 28.53, "learning_rate": 0.0003, "loss": 10.9119, "step": 200 }, { "epoch": 28.53, "eval_cer": 0.0273972602739726, "eval_loss": 36.39248275756836, "eval_runtime": 4.6689, "eval_samples_per_second": 6.425, "eval_steps_per_second": 0.857, "eval_wer": 0.08433734939759036, "step": 200 }, { "epoch": 29.93, "learning_rate": 0.0003, "loss": 8.9316, "step": 210 }, { "epoch": 29.93, "eval_cer": 0.024513338139870222, "eval_loss": 30.038408279418945, "eval_runtime": 4.6695, "eval_samples_per_second": 6.425, "eval_steps_per_second": 0.857, "eval_wer": 0.06827309236947791, "step": 210 }, { "epoch": 29.93, "step": 210, "total_flos": 1.2113636824678656e+18, "train_loss": 20.16470682053339, "train_runtime": 1180.2334, "train_samples_per_second": 3.05, "train_steps_per_second": 0.178 } ], "max_steps": 210, "num_train_epochs": 30, "total_flos": 1.2113636824678656e+18, "trial_name": null, "trial_params": null }