trainer_state.json
| 1 | { |
| 2 | "best_metric": 0.5862595419847328, |
| 3 | "best_model_checkpoint": "roberta-base-go_emotions/checkpoint-16281", |
| 4 | "epoch": 3.0, |
| 5 | "global_step": 16281, |
| 6 | "is_hyper_param_search": false, |
| 7 | "is_local_process_zero": true, |
| 8 | "is_world_process_zero": true, |
| 9 | "log_history": [ |
| 10 | { |
| 11 | "epoch": 0.09, |
| 12 | "learning_rate": 1.9815736134144095e-05, |
| 13 | "loss": 0.1826, |
| 14 | "step": 500 |
| 15 | }, |
| 16 | { |
| 17 | "epoch": 0.18, |
| 18 | "learning_rate": 1.963147226828819e-05, |
| 19 | "loss": 0.1317, |
| 20 | "step": 1000 |
| 21 | }, |
| 22 | { |
| 23 | "epoch": 0.28, |
| 24 | "learning_rate": 1.9447208402432286e-05, |
| 25 | "loss": 0.1146, |
| 26 | "step": 1500 |
| 27 | }, |
| 28 | { |
| 29 | "epoch": 0.37, |
| 30 | "learning_rate": 1.9262944536576377e-05, |
| 31 | "loss": 0.1078, |
| 32 | "step": 2000 |
| 33 | }, |
| 34 | { |
| 35 | "epoch": 0.46, |
| 36 | "learning_rate": 1.9078680670720474e-05, |
| 37 | "loss": 0.1006, |
| 38 | "step": 2500 |
| 39 | }, |
| 40 | { |
| 41 | "epoch": 0.55, |
| 42 | "learning_rate": 1.8894416804864568e-05, |
| 43 | "loss": 0.0976, |
| 44 | "step": 3000 |
| 45 | }, |
| 46 | { |
| 47 | "epoch": 0.64, |
| 48 | "learning_rate": 1.871015293900866e-05, |
| 49 | "loss": 0.096, |
| 50 | "step": 3500 |
| 51 | }, |
| 52 | { |
| 53 | "epoch": 0.74, |
| 54 | "learning_rate": 1.8525889073152755e-05, |
| 55 | "loss": 0.0925, |
| 56 | "step": 4000 |
| 57 | }, |
| 58 | { |
| 59 | "epoch": 0.83, |
| 60 | "learning_rate": 1.8341625207296852e-05, |
| 61 | "loss": 0.0921, |
| 62 | "step": 4500 |
| 63 | }, |
| 64 | { |
| 65 | "epoch": 0.92, |
| 66 | "learning_rate": 1.8157361341440943e-05, |
| 67 | "loss": 0.0911, |
| 68 | "step": 5000 |
| 69 | }, |
| 70 | { |
| 71 | "epoch": 1.0, |
| 72 | "eval_accuracy": 0.40213785477331365, |
| 73 | "eval_f1": 0.5346146303196705, |
| 74 | "eval_loss": 0.08816272765398026, |
| 75 | "eval_roc_auc": 0.7098850238721621, |
| 76 | "eval_runtime": 11.8306, |
| 77 | "eval_samples_per_second": 458.641, |
| 78 | "eval_steps_per_second": 57.394, |
| 79 | "step": 5427 |
| 80 | }, |
| 81 | { |
| 82 | "epoch": 1.01, |
| 83 | "learning_rate": 1.797309747558504e-05, |
| 84 | "loss": 0.0897, |
| 85 | "step": 5500 |
| 86 | }, |
| 87 | { |
| 88 | "epoch": 1.11, |
| 89 | "learning_rate": 1.7788833609729134e-05, |
| 90 | "loss": 0.0856, |
| 91 | "step": 6000 |
| 92 | }, |
| 93 | { |
| 94 | "epoch": 1.2, |
| 95 | "learning_rate": 1.7604569743873227e-05, |
| 96 | "loss": 0.0816, |
| 97 | "step": 6500 |
| 98 | }, |
| 99 | { |
| 100 | "epoch": 1.29, |
| 101 | "learning_rate": 1.742030587801732e-05, |
| 102 | "loss": 0.0853, |
| 103 | "step": 7000 |
| 104 | }, |
| 105 | { |
| 106 | "epoch": 1.38, |
| 107 | "learning_rate": 1.7236042012161415e-05, |
| 108 | "loss": 0.0846, |
| 109 | "step": 7500 |
| 110 | }, |
| 111 | { |
| 112 | "epoch": 1.47, |
| 113 | "learning_rate": 1.7051778146305512e-05, |
| 114 | "loss": 0.0843, |
| 115 | "step": 8000 |
| 116 | }, |
| 117 | { |
| 118 | "epoch": 1.57, |
| 119 | "learning_rate": 1.6867514280449606e-05, |
| 120 | "loss": 0.0807, |
| 121 | "step": 8500 |
| 122 | }, |
| 123 | { |
| 124 | "epoch": 1.66, |
| 125 | "learning_rate": 1.66832504145937e-05, |
| 126 | "loss": 0.0796, |
| 127 | "step": 9000 |
| 128 | }, |
| 129 | { |
| 130 | "epoch": 1.75, |
| 131 | "learning_rate": 1.6498986548737793e-05, |
| 132 | "loss": 0.081, |
| 133 | "step": 9500 |
| 134 | }, |
| 135 | { |
| 136 | "epoch": 1.84, |
| 137 | "learning_rate": 1.6314722682881887e-05, |
| 138 | "loss": 0.0798, |
| 139 | "step": 10000 |
| 140 | }, |
| 141 | { |
| 142 | "epoch": 1.93, |
| 143 | "learning_rate": 1.613045881702598e-05, |
| 144 | "loss": 0.0821, |
| 145 | "step": 10500 |
| 146 | }, |
| 147 | { |
| 148 | "epoch": 2.0, |
| 149 | "eval_accuracy": 0.44010320678216, |
| 150 | "eval_f1": 0.5612426312342098, |
| 151 | "eval_loss": 0.08432479202747345, |
| 152 | "eval_roc_auc": 0.7305379849481191, |
| 153 | "eval_runtime": 11.8056, |
| 154 | "eval_samples_per_second": 459.613, |
| 155 | "eval_steps_per_second": 57.515, |
| 156 | "step": 10854 |
| 157 | }, |
| 158 | { |
| 159 | "epoch": 2.03, |
| 160 | "learning_rate": 1.5946194951170078e-05, |
| 161 | "loss": 0.0776, |
| 162 | "step": 11000 |
| 163 | }, |
| 164 | { |
| 165 | "epoch": 2.12, |
| 166 | "learning_rate": 1.5761931085314172e-05, |
| 167 | "loss": 0.0726, |
| 168 | "step": 11500 |
| 169 | }, |
| 170 | { |
| 171 | "epoch": 2.21, |
| 172 | "learning_rate": 1.5577667219458266e-05, |
| 173 | "loss": 0.0718, |
| 174 | "step": 12000 |
| 175 | }, |
| 176 | { |
| 177 | "epoch": 2.3, |
| 178 | "learning_rate": 1.539340335360236e-05, |
| 179 | "loss": 0.0735, |
| 180 | "step": 12500 |
| 181 | }, |
| 182 | { |
| 183 | "epoch": 2.4, |
| 184 | "learning_rate": 1.5209139487746453e-05, |
| 185 | "loss": 0.0735, |
| 186 | "step": 13000 |
| 187 | }, |
| 188 | { |
| 189 | "epoch": 2.49, |
| 190 | "learning_rate": 1.5024875621890549e-05, |
| 191 | "loss": 0.0721, |
| 192 | "step": 13500 |
| 193 | }, |
| 194 | { |
| 195 | "epoch": 2.58, |
| 196 | "learning_rate": 1.4840611756034643e-05, |
| 197 | "loss": 0.0722, |
| 198 | "step": 14000 |
| 199 | }, |
| 200 | { |
| 201 | "epoch": 2.67, |
| 202 | "learning_rate": 1.4656347890178736e-05, |
| 203 | "loss": 0.0751, |
| 204 | "step": 14500 |
| 205 | }, |
| 206 | { |
| 207 | "epoch": 2.76, |
| 208 | "learning_rate": 1.4472084024322832e-05, |
| 209 | "loss": 0.0727, |
| 210 | "step": 15000 |
| 211 | }, |
| 212 | { |
| 213 | "epoch": 2.86, |
| 214 | "learning_rate": 1.4287820158466926e-05, |
| 215 | "loss": 0.0735, |
| 216 | "step": 15500 |
| 217 | }, |
| 218 | { |
| 219 | "epoch": 2.95, |
| 220 | "learning_rate": 1.4103556292611021e-05, |
| 221 | "loss": 0.0714, |
| 222 | "step": 16000 |
| 223 | }, |
| 224 | { |
| 225 | "epoch": 3.0, |
| 226 | "eval_accuracy": 0.47475119793586434, |
| 227 | "eval_f1": 0.5862595419847328, |
| 228 | "eval_loss": 0.0838962271809578, |
| 229 | "eval_roc_auc": 0.7506773514396311, |
| 230 | "eval_runtime": 11.8261, |
| 231 | "eval_samples_per_second": 458.814, |
| 232 | "eval_steps_per_second": 57.415, |
| 233 | "step": 16281 |
| 234 | } |
| 235 | ], |
| 236 | "max_steps": 54270, |
| 237 | "num_train_epochs": 10, |
| 238 | "total_flos": 8568237917583360.0, |
| 239 | "trial_name": null, |
| 240 | "trial_params": null |
| 241 | } |
| 242 | |