frc00 commited on
Commit
1b181c4
·
verified ·
1 Parent(s): 1740963

Training in progress, step 8000, checkpoint

Browse files
checkpoint-8000/README.md ADDED
@@ -0,0 +1,209 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ base_model: google/medgemma-1.5-4b-it
3
+ library_name: peft
4
+ pipeline_tag: text-generation
5
+ tags:
6
+ - base_model:adapter:google/medgemma-1.5-4b-it
7
+ - lora
8
+ - sft
9
+ - transformers
10
+ - trl
11
+ ---
12
+
13
+ # Model Card for Model ID
14
+
15
+ <!-- Provide a quick summary of what the model is/does. -->
16
+
17
+
18
+
19
+ ## Model Details
20
+
21
+ ### Model Description
22
+
23
+ <!-- Provide a longer summary of what this model is. -->
24
+
25
+
26
+
27
+ - **Developed by:** [More Information Needed]
28
+ - **Funded by [optional]:** [More Information Needed]
29
+ - **Shared by [optional]:** [More Information Needed]
30
+ - **Model type:** [More Information Needed]
31
+ - **Language(s) (NLP):** [More Information Needed]
32
+ - **License:** [More Information Needed]
33
+ - **Finetuned from model [optional]:** [More Information Needed]
34
+
35
+ ### Model Sources [optional]
36
+
37
+ <!-- Provide the basic links for the model. -->
38
+
39
+ - **Repository:** [More Information Needed]
40
+ - **Paper [optional]:** [More Information Needed]
41
+ - **Demo [optional]:** [More Information Needed]
42
+
43
+ ## Uses
44
+
45
+ <!-- Address questions around how the model is intended to be used, including the foreseeable users of the model and those affected by the model. -->
46
+
47
+ ### Direct Use
48
+
49
+ <!-- This section is for the model use without fine-tuning or plugging into a larger ecosystem/app. -->
50
+
51
+ [More Information Needed]
52
+
53
+ ### Downstream Use [optional]
54
+
55
+ <!-- This section is for the model use when fine-tuned for a task, or when plugged into a larger ecosystem/app -->
56
+
57
+ [More Information Needed]
58
+
59
+ ### Out-of-Scope Use
60
+
61
+ <!-- This section addresses misuse, malicious use, and uses that the model will not work well for. -->
62
+
63
+ [More Information Needed]
64
+
65
+ ## Bias, Risks, and Limitations
66
+
67
+ <!-- This section is meant to convey both technical and sociotechnical limitations. -->
68
+
69
+ [More Information Needed]
70
+
71
+ ### Recommendations
72
+
73
+ <!-- This section is meant to convey recommendations with respect to the bias, risk, and technical limitations. -->
74
+
75
+ Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
76
+
77
+ ## How to Get Started with the Model
78
+
79
+ Use the code below to get started with the model.
80
+
81
+ [More Information Needed]
82
+
83
+ ## Training Details
84
+
85
+ ### Training Data
86
+
87
+ <!-- This should link to a Dataset Card, perhaps with a short stub of information on what the training data is all about as well as documentation related to data pre-processing or additional filtering. -->
88
+
89
+ [More Information Needed]
90
+
91
+ ### Training Procedure
92
+
93
+ <!-- This relates heavily to the Technical Specifications. Content here should link to that section when it is relevant to the training procedure. -->
94
+
95
+ #### Preprocessing [optional]
96
+
97
+ [More Information Needed]
98
+
99
+
100
+ #### Training Hyperparameters
101
+
102
+ - **Training regime:** [More Information Needed] <!--fp32, fp16 mixed precision, bf16 mixed precision, bf16 non-mixed precision, fp16 non-mixed precision, fp8 mixed precision -->
103
+
104
+ #### Speeds, Sizes, Times [optional]
105
+
106
+ <!-- This section provides information about throughput, start/end time, checkpoint size if relevant, etc. -->
107
+
108
+ [More Information Needed]
109
+
110
+ ## Evaluation
111
+
112
+ <!-- This section describes the evaluation protocols and provides the results. -->
113
+
114
+ ### Testing Data, Factors & Metrics
115
+
116
+ #### Testing Data
117
+
118
+ <!-- This should link to a Dataset Card if possible. -->
119
+
120
+ [More Information Needed]
121
+
122
+ #### Factors
123
+
124
+ <!-- These are the things the evaluation is disaggregating by, e.g., subpopulations or domains. -->
125
+
126
+ [More Information Needed]
127
+
128
+ #### Metrics
129
+
130
+ <!-- These are the evaluation metrics being used, ideally with a description of why. -->
131
+
132
+ [More Information Needed]
133
+
134
+ ### Results
135
+
136
+ [More Information Needed]
137
+
138
+ #### Summary
139
+
140
+
141
+
142
+ ## Model Examination [optional]
143
+
144
+ <!-- Relevant interpretability work for the model goes here -->
145
+
146
+ [More Information Needed]
147
+
148
+ ## Environmental Impact
149
+
150
+ <!-- Total emissions (in grams of CO2eq) and additional considerations, such as electricity usage, go here. Edit the suggested text below accordingly -->
151
+
152
+ Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
153
+
154
+ - **Hardware Type:** [More Information Needed]
155
+ - **Hours used:** [More Information Needed]
156
+ - **Cloud Provider:** [More Information Needed]
157
+ - **Compute Region:** [More Information Needed]
158
+ - **Carbon Emitted:** [More Information Needed]
159
+
160
+ ## Technical Specifications [optional]
161
+
162
+ ### Model Architecture and Objective
163
+
164
+ [More Information Needed]
165
+
166
+ ### Compute Infrastructure
167
+
168
+ [More Information Needed]
169
+
170
+ #### Hardware
171
+
172
+ [More Information Needed]
173
+
174
+ #### Software
175
+
176
+ [More Information Needed]
177
+
178
+ ## Citation [optional]
179
+
180
+ <!-- If there is a paper or blog post introducing the model, the APA and Bibtex information for that should go in this section. -->
181
+
182
+ **BibTeX:**
183
+
184
+ [More Information Needed]
185
+
186
+ **APA:**
187
+
188
+ [More Information Needed]
189
+
190
+ ## Glossary [optional]
191
+
192
+ <!-- If relevant, include terms and calculations in this section that can help readers understand the model or model card. -->
193
+
194
+ [More Information Needed]
195
+
196
+ ## More Information [optional]
197
+
198
+ [More Information Needed]
199
+
200
+ ## Model Card Authors [optional]
201
+
202
+ [More Information Needed]
203
+
204
+ ## Model Card Contact
205
+
206
+ [More Information Needed]
207
+ ### Framework versions
208
+
209
+ - PEFT 0.19.1
checkpoint-8000/adapter_config.json ADDED
@@ -0,0 +1,48 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alora_invocation_tokens": null,
3
+ "alpha_pattern": {},
4
+ "arrow_config": null,
5
+ "auto_mapping": null,
6
+ "base_model_name_or_path": "google/medgemma-1.5-4b-it",
7
+ "bias": "none",
8
+ "corda_config": null,
9
+ "ensure_weight_tying": false,
10
+ "eva_config": null,
11
+ "exclude_modules": null,
12
+ "fan_in_fan_out": false,
13
+ "inference_mode": true,
14
+ "init_lora_weights": true,
15
+ "layer_replication": null,
16
+ "layers_pattern": null,
17
+ "layers_to_transform": null,
18
+ "loftq_config": {},
19
+ "lora_alpha": 16,
20
+ "lora_bias": false,
21
+ "lora_dropout": 0.05,
22
+ "lora_ga_config": null,
23
+ "megatron_config": null,
24
+ "megatron_core": "megatron.core",
25
+ "modules_to_save": null,
26
+ "peft_type": "LORA",
27
+ "peft_version": "0.19.1",
28
+ "qalora_group_size": 16,
29
+ "r": 16,
30
+ "rank_pattern": {},
31
+ "revision": null,
32
+ "target_modules": [
33
+ "down_proj",
34
+ "k_proj",
35
+ "o_proj",
36
+ "q_proj",
37
+ "v_proj",
38
+ "gate_proj",
39
+ "up_proj"
40
+ ],
41
+ "target_parameters": null,
42
+ "task_type": "CAUSAL_LM",
43
+ "trainable_token_indices": null,
44
+ "use_bdlora": null,
45
+ "use_dora": false,
46
+ "use_qalora": false,
47
+ "use_rslora": false
48
+ }
checkpoint-8000/adapter_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:74018f591fc3ef6a52dabf6a732d93017bf08b8c650639c4743979de3579bcd6
3
+ size 131250184
checkpoint-8000/chat_template.jinja ADDED
@@ -0,0 +1,47 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {{ bos_token }}
2
+ {%- if messages[0]['role'] == 'system' -%}
3
+ {%- if messages[0]['content'] is string -%}
4
+ {%- set first_user_prefix = messages[0]['content'] + '
5
+
6
+ ' -%}
7
+ {%- else -%}
8
+ {%- set first_user_prefix = messages[0]['content'][0]['text'] + '
9
+
10
+ ' -%}
11
+ {%- endif -%}
12
+ {%- set loop_messages = messages[1:] -%}
13
+ {%- else -%}
14
+ {%- set first_user_prefix = "" -%}
15
+ {%- set loop_messages = messages -%}
16
+ {%- endif -%}
17
+ {%- for message in loop_messages -%}
18
+ {%- if (message['role'] == 'user') != (loop.index0 % 2 == 0) -%}
19
+ {{ raise_exception("Conversation roles must alternate user/assistant/user/assistant/...") }}
20
+ {%- endif -%}
21
+ {%- if (message['role'] == 'assistant') -%}
22
+ {%- set role = "model" -%}
23
+ {%- else -%}
24
+ {%- set role = message['role'] -%}
25
+ {%- endif -%}
26
+ {{ '<start_of_turn>' + role + '
27
+ ' + (first_user_prefix if loop.first else "") }}
28
+ {%- if message['content'] is string -%}
29
+ {{ message['content'] | trim }}
30
+ {%- elif message['content'] is iterable -%}
31
+ {%- for item in message['content'] -%}
32
+ {%- if item['type'] == 'image' -%}
33
+ {{ '<start_of_image>' }}
34
+ {%- elif item['type'] == 'text' -%}
35
+ {{ item['text'] | trim }}
36
+ {%- endif -%}
37
+ {%- endfor -%}
38
+ {%- else -%}
39
+ {{ raise_exception("Invalid content type") }}
40
+ {%- endif -%}
41
+ {{ '<end_of_turn>
42
+ ' }}
43
+ {%- endfor -%}
44
+ {%- if add_generation_prompt -%}
45
+ {{'<start_of_turn>model
46
+ '}}
47
+ {%- endif -%}
checkpoint-8000/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:202927e4b0dbb54c134f2e7cdeef4c31472445a4db8b392dde3122b2df0466c1
3
+ size 238828343
checkpoint-8000/processor_config.json ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "image_processor": {
3
+ "do_convert_rgb": true,
4
+ "do_normalize": true,
5
+ "do_rescale": true,
6
+ "do_resize": true,
7
+ "image_mean": [
8
+ 0.5,
9
+ 0.5,
10
+ 0.5
11
+ ],
12
+ "image_processor_type": "Gemma3ImageProcessor",
13
+ "image_seq_length": 256,
14
+ "image_std": [
15
+ 0.5,
16
+ 0.5,
17
+ 0.5
18
+ ],
19
+ "resample": 2,
20
+ "rescale_factor": 0.00392156862745098,
21
+ "size": {
22
+ "height": 896,
23
+ "width": 896
24
+ }
25
+ },
26
+ "image_seq_length": 256,
27
+ "processor_class": "Gemma3Processor"
28
+ }
checkpoint-8000/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7b4abe3f54819bae8961acad0d167300be9bdfc72ea26403ade54439414d7185
3
+ size 14645
checkpoint-8000/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fee5cf1570360d6f68ad929f99b86c0a66c93513fe5867e46ddf496b40a4cc02
3
+ size 1465
checkpoint-8000/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a6c776bcef3fcea90b4244ef4dafa43ec828ea9f23a286a5be6bd3c209efe810
3
+ size 33384721
checkpoint-8000/tokenizer_config.json ADDED
@@ -0,0 +1,26 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "pil",
3
+ "boi_token": "<start_of_image>",
4
+ "bos_token": "<bos>",
5
+ "clean_up_tokenization_spaces": false,
6
+ "eoi_token": "<end_of_image>",
7
+ "eos_token": "<eos>",
8
+ "image_token": "<image_soft_token>",
9
+ "is_local": false,
10
+ "local_files_only": false,
11
+ "mask_token": "<mask>",
12
+ "model_max_length": 1000000000000000019884624838656,
13
+ "model_specific_special_tokens": {
14
+ "boi_token": "<start_of_image>",
15
+ "eoi_token": "<end_of_image>",
16
+ "image_token": "<image_soft_token>"
17
+ },
18
+ "pad_token": "<pad>",
19
+ "padding_side": "left",
20
+ "processor_class": "Gemma3Processor",
21
+ "sp_model_kwargs": null,
22
+ "spaces_between_special_tokens": false,
23
+ "tokenizer_class": "GemmaTokenizer",
24
+ "unk_token": "<unk>",
25
+ "use_default_system_prompt": false
26
+ }
checkpoint-8000/trainer_state.json ADDED
@@ -0,0 +1,2074 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 6800,
3
+ "best_metric": 0.10720802843570709,
4
+ "best_model_checkpoint": "data/full_sft_run/sft_out/checkpoint-6800",
5
+ "epoch": 2.337888198757764,
6
+ "eval_steps": 200,
7
+ "global_step": 8000,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "entropy": 0.20752533283084632,
14
+ "epoch": 0.014614541468761417,
15
+ "grad_norm": 0.7449454069137573,
16
+ "learning_rate": 3.181818181818182e-05,
17
+ "loss": 1.3096963500976562,
18
+ "mean_token_accuracy": 0.8356087231636047,
19
+ "num_tokens": 218234.0,
20
+ "step": 50
21
+ },
22
+ {
23
+ "entropy": 0.2586296512931585,
24
+ "epoch": 0.029229082937522834,
25
+ "grad_norm": 0.6199880838394165,
26
+ "learning_rate": 6.428571428571429e-05,
27
+ "loss": 0.26672126770019533,
28
+ "mean_token_accuracy": 0.9052031901478768,
29
+ "num_tokens": 434925.0,
30
+ "step": 100
31
+ },
32
+ {
33
+ "entropy": 0.2025177276879549,
34
+ "epoch": 0.043843624406284254,
35
+ "grad_norm": 0.5352309346199036,
36
+ "learning_rate": 9.675324675324677e-05,
37
+ "loss": 0.20794065475463866,
38
+ "mean_token_accuracy": 0.9208106356859207,
39
+ "num_tokens": 652823.0,
40
+ "step": 150
41
+ },
42
+ {
43
+ "entropy": 0.18583494622260333,
44
+ "epoch": 0.05845816587504567,
45
+ "grad_norm": 0.4790455996990204,
46
+ "learning_rate": 0.00012922077922077922,
47
+ "loss": 0.19879446029663086,
48
+ "mean_token_accuracy": 0.9228935891389847,
49
+ "num_tokens": 870027.0,
50
+ "step": 200
51
+ },
52
+ {
53
+ "epoch": 0.05845816587504567,
54
+ "eval_entropy": 0.20352977880481946,
55
+ "eval_loss": 0.1885823905467987,
56
+ "eval_mean_token_accuracy": 0.9265667232416444,
57
+ "eval_num_tokens": 870027.0,
58
+ "eval_runtime": 51.9934,
59
+ "eval_samples_per_second": 22.657,
60
+ "eval_steps_per_second": 5.674,
61
+ "step": 200
62
+ },
63
+ {
64
+ "entropy": 0.18395513169467448,
65
+ "epoch": 0.0730727073438071,
66
+ "grad_norm": 0.5151433348655701,
67
+ "learning_rate": 0.0001616883116883117,
68
+ "loss": 0.1874466896057129,
69
+ "mean_token_accuracy": 0.9266703170537949,
70
+ "num_tokens": 1086768.0,
71
+ "step": 250
72
+ },
73
+ {
74
+ "entropy": 0.18530432548373937,
75
+ "epoch": 0.08768724881256851,
76
+ "grad_norm": 0.360085666179657,
77
+ "learning_rate": 0.00019415584415584416,
78
+ "loss": 0.18927602767944335,
79
+ "mean_token_accuracy": 0.9263237661123276,
80
+ "num_tokens": 1306053.0,
81
+ "step": 300
82
+ },
83
+ {
84
+ "entropy": 0.18520764522254468,
85
+ "epoch": 0.10230179028132992,
86
+ "grad_norm": 0.32682710886001587,
87
+ "learning_rate": 0.00019917654147419162,
88
+ "loss": 0.19010570526123047,
89
+ "mean_token_accuracy": 0.9269409370422363,
90
+ "num_tokens": 1524650.0,
91
+ "step": 350
92
+ },
93
+ {
94
+ "entropy": 0.17121127102524042,
95
+ "epoch": 0.11691633175009133,
96
+ "grad_norm": 0.33935022354125977,
97
+ "learning_rate": 0.00019817232375979112,
98
+ "loss": 0.17950326919555665,
99
+ "mean_token_accuracy": 0.928639045059681,
100
+ "num_tokens": 1740391.0,
101
+ "step": 400
102
+ },
103
+ {
104
+ "epoch": 0.11691633175009133,
105
+ "eval_entropy": 0.15643637586953277,
106
+ "eval_loss": 0.17647278308868408,
107
+ "eval_mean_token_accuracy": 0.9313437746743024,
108
+ "eval_num_tokens": 1740391.0,
109
+ "eval_runtime": 51.4028,
110
+ "eval_samples_per_second": 22.917,
111
+ "eval_steps_per_second": 5.739,
112
+ "step": 400
113
+ },
114
+ {
115
+ "entropy": 0.17545538306236266,
116
+ "epoch": 0.13153087321885276,
117
+ "grad_norm": 0.35228046774864197,
118
+ "learning_rate": 0.00019716810604539066,
119
+ "loss": 0.18172544479370117,
120
+ "mean_token_accuracy": 0.9291265362501144,
121
+ "num_tokens": 1957727.0,
122
+ "step": 450
123
+ },
124
+ {
125
+ "entropy": 0.1679905788227916,
126
+ "epoch": 0.1461454146876142,
127
+ "grad_norm": 0.36982566118240356,
128
+ "learning_rate": 0.0001961638883309902,
129
+ "loss": 0.17352703094482422,
130
+ "mean_token_accuracy": 0.9319902381300926,
131
+ "num_tokens": 2174741.0,
132
+ "step": 500
133
+ },
134
+ {
135
+ "entropy": 0.16595628045499325,
136
+ "epoch": 0.1607599561563756,
137
+ "grad_norm": 0.2658090889453888,
138
+ "learning_rate": 0.0001951596706165897,
139
+ "loss": 0.1694266128540039,
140
+ "mean_token_accuracy": 0.9349100396037102,
141
+ "num_tokens": 2392020.0,
142
+ "step": 550
143
+ },
144
+ {
145
+ "entropy": 0.16491649385541676,
146
+ "epoch": 0.17537449762513702,
147
+ "grad_norm": 0.28709471225738525,
148
+ "learning_rate": 0.0001941554529021892,
149
+ "loss": 0.16749130249023436,
150
+ "mean_token_accuracy": 0.9363178312778473,
151
+ "num_tokens": 2609502.0,
152
+ "step": 600
153
+ },
154
+ {
155
+ "epoch": 0.17537449762513702,
156
+ "eval_entropy": 0.15555994159589379,
157
+ "eval_loss": 0.16351227462291718,
158
+ "eval_mean_token_accuracy": 0.935047954623982,
159
+ "eval_num_tokens": 2609502.0,
160
+ "eval_runtime": 51.7247,
161
+ "eval_samples_per_second": 22.774,
162
+ "eval_steps_per_second": 5.703,
163
+ "step": 600
164
+ },
165
+ {
166
+ "entropy": 0.16599890314042567,
167
+ "epoch": 0.18998903909389842,
168
+ "grad_norm": 0.3486684560775757,
169
+ "learning_rate": 0.00019315123518778873,
170
+ "loss": 0.16908374786376953,
171
+ "mean_token_accuracy": 0.9338638958334923,
172
+ "num_tokens": 2826468.0,
173
+ "step": 650
174
+ },
175
+ {
176
+ "entropy": 0.15440633669495582,
177
+ "epoch": 0.20460358056265984,
178
+ "grad_norm": 0.3269498944282532,
179
+ "learning_rate": 0.00019214701747338823,
180
+ "loss": 0.1564903450012207,
181
+ "mean_token_accuracy": 0.9378401437401771,
182
+ "num_tokens": 3044037.0,
183
+ "step": 700
184
+ },
185
+ {
186
+ "entropy": 0.15702761143445967,
187
+ "epoch": 0.21921812203142127,
188
+ "grad_norm": 0.2996591329574585,
189
+ "learning_rate": 0.00019114279975898776,
190
+ "loss": 0.16098966598510742,
191
+ "mean_token_accuracy": 0.937047846019268,
192
+ "num_tokens": 3260671.0,
193
+ "step": 750
194
+ },
195
+ {
196
+ "entropy": 0.16964259944856167,
197
+ "epoch": 0.23383266350018267,
198
+ "grad_norm": 0.27347952127456665,
199
+ "learning_rate": 0.00019013858204458727,
200
+ "loss": 0.17197874069213867,
201
+ "mean_token_accuracy": 0.9319348493218422,
202
+ "num_tokens": 3479952.0,
203
+ "step": 800
204
+ },
205
+ {
206
+ "epoch": 0.23383266350018267,
207
+ "eval_entropy": 0.15915015558317555,
208
+ "eval_loss": 0.15902064740657806,
209
+ "eval_mean_token_accuracy": 0.9373329009039927,
210
+ "eval_num_tokens": 3479952.0,
211
+ "eval_runtime": 52.0586,
212
+ "eval_samples_per_second": 22.628,
213
+ "eval_steps_per_second": 5.667,
214
+ "step": 800
215
+ },
216
+ {
217
+ "entropy": 0.16319214086979628,
218
+ "epoch": 0.2484472049689441,
219
+ "grad_norm": 0.2520512342453003,
220
+ "learning_rate": 0.0001891343643301868,
221
+ "loss": 0.16472122192382813,
222
+ "mean_token_accuracy": 0.9351362636685372,
223
+ "num_tokens": 3695714.0,
224
+ "step": 850
225
+ },
226
+ {
227
+ "entropy": 0.157652658931911,
228
+ "epoch": 0.2630617464377055,
229
+ "grad_norm": 0.2863970398902893,
230
+ "learning_rate": 0.00018813014661578633,
231
+ "loss": 0.15824624061584472,
232
+ "mean_token_accuracy": 0.9369783601164818,
233
+ "num_tokens": 3913429.0,
234
+ "step": 900
235
+ },
236
+ {
237
+ "entropy": 0.15214558444917203,
238
+ "epoch": 0.2776762879064669,
239
+ "grad_norm": 0.290787935256958,
240
+ "learning_rate": 0.00018712592890138583,
241
+ "loss": 0.15539746284484862,
242
+ "mean_token_accuracy": 0.9397245013713836,
243
+ "num_tokens": 4131640.0,
244
+ "step": 950
245
+ },
246
+ {
247
+ "entropy": 0.15566726494580507,
248
+ "epoch": 0.2922908293752284,
249
+ "grad_norm": 0.3074010908603668,
250
+ "learning_rate": 0.00018612171118698534,
251
+ "loss": 0.15537342071533203,
252
+ "mean_token_accuracy": 0.9387755367159843,
253
+ "num_tokens": 4348832.0,
254
+ "step": 1000
255
+ },
256
+ {
257
+ "epoch": 0.2922908293752284,
258
+ "eval_entropy": 0.1574143134436365,
259
+ "eval_loss": 0.15738964080810547,
260
+ "eval_mean_token_accuracy": 0.9374752864999286,
261
+ "eval_num_tokens": 4348832.0,
262
+ "eval_runtime": 51.5665,
263
+ "eval_samples_per_second": 22.844,
264
+ "eval_steps_per_second": 5.721,
265
+ "step": 1000
266
+ },
267
+ {
268
+ "entropy": 0.1583068972080946,
269
+ "epoch": 0.3069053708439898,
270
+ "grad_norm": 0.3427266776561737,
271
+ "learning_rate": 0.00018511749347258487,
272
+ "loss": 0.15989484786987304,
273
+ "mean_token_accuracy": 0.9373269161581993,
274
+ "num_tokens": 4565702.0,
275
+ "step": 1050
276
+ },
277
+ {
278
+ "entropy": 0.1511041523516178,
279
+ "epoch": 0.3215199123127512,
280
+ "grad_norm": 0.32759514451026917,
281
+ "learning_rate": 0.00018411327575818437,
282
+ "loss": 0.15331138610839845,
283
+ "mean_token_accuracy": 0.9397411552071572,
284
+ "num_tokens": 4784167.0,
285
+ "step": 1100
286
+ },
287
+ {
288
+ "entropy": 0.14996831517666578,
289
+ "epoch": 0.33613445378151263,
290
+ "grad_norm": 0.30234530568122864,
291
+ "learning_rate": 0.0001831090580437839,
292
+ "loss": 0.1544932556152344,
293
+ "mean_token_accuracy": 0.9399288591742515,
294
+ "num_tokens": 4999793.0,
295
+ "step": 1150
296
+ },
297
+ {
298
+ "entropy": 0.15582640528678893,
299
+ "epoch": 0.35074899525027403,
300
+ "grad_norm": 0.24690158665180206,
301
+ "learning_rate": 0.0001821048403293834,
302
+ "loss": 0.15442598342895508,
303
+ "mean_token_accuracy": 0.9398289120197296,
304
+ "num_tokens": 5217954.0,
305
+ "step": 1200
306
+ },
307
+ {
308
+ "epoch": 0.35074899525027403,
309
+ "eval_entropy": 0.1420629285275936,
310
+ "eval_loss": 0.14971356093883514,
311
+ "eval_mean_token_accuracy": 0.9414400791717787,
312
+ "eval_num_tokens": 5217954.0,
313
+ "eval_runtime": 51.4751,
314
+ "eval_samples_per_second": 22.885,
315
+ "eval_steps_per_second": 5.731,
316
+ "step": 1200
317
+ },
318
+ {
319
+ "entropy": 0.1543054273724556,
320
+ "epoch": 0.36536353671903543,
321
+ "grad_norm": 0.29708531498908997,
322
+ "learning_rate": 0.00018110062261498294,
323
+ "loss": 0.1537049388885498,
324
+ "mean_token_accuracy": 0.9416613772511482,
325
+ "num_tokens": 5434380.0,
326
+ "step": 1250
327
+ },
328
+ {
329
+ "entropy": 0.14713672876358033,
330
+ "epoch": 0.37997807818779683,
331
+ "grad_norm": 0.2888696789741516,
332
+ "learning_rate": 0.00018009640490058247,
333
+ "loss": 0.15287999153137208,
334
+ "mean_token_accuracy": 0.9416247588396073,
335
+ "num_tokens": 5651784.0,
336
+ "step": 1300
337
+ },
338
+ {
339
+ "entropy": 0.14809815444052218,
340
+ "epoch": 0.3945926196565583,
341
+ "grad_norm": 0.25226420164108276,
342
+ "learning_rate": 0.00017909218718618197,
343
+ "loss": 0.15003498077392577,
344
+ "mean_token_accuracy": 0.9424466270208359,
345
+ "num_tokens": 5870443.0,
346
+ "step": 1350
347
+ },
348
+ {
349
+ "entropy": 0.15500445548444985,
350
+ "epoch": 0.4092071611253197,
351
+ "grad_norm": 0.2410505712032318,
352
+ "learning_rate": 0.0001780879694717815,
353
+ "loss": 0.15515862464904784,
354
+ "mean_token_accuracy": 0.9403725653886795,
355
+ "num_tokens": 6086417.0,
356
+ "step": 1400
357
+ },
358
+ {
359
+ "epoch": 0.4092071611253197,
360
+ "eval_entropy": 0.13966038472066492,
361
+ "eval_loss": 0.1482466757297516,
362
+ "eval_mean_token_accuracy": 0.9430661270173929,
363
+ "eval_num_tokens": 6086417.0,
364
+ "eval_runtime": 51.3223,
365
+ "eval_samples_per_second": 22.953,
366
+ "eval_steps_per_second": 5.748,
367
+ "step": 1400
368
+ },
369
+ {
370
+ "entropy": 0.14597053304314614,
371
+ "epoch": 0.4238217025940811,
372
+ "grad_norm": 0.2526480257511139,
373
+ "learning_rate": 0.000177083751757381,
374
+ "loss": 0.1495055389404297,
375
+ "mean_token_accuracy": 0.9429304957389831,
376
+ "num_tokens": 6304323.0,
377
+ "step": 1450
378
+ },
379
+ {
380
+ "entropy": 0.1473805220425129,
381
+ "epoch": 0.43843624406284254,
382
+ "grad_norm": 0.27721503376960754,
383
+ "learning_rate": 0.0001760795340429805,
384
+ "loss": 0.14802109718322753,
385
+ "mean_token_accuracy": 0.9423278120160102,
386
+ "num_tokens": 6521073.0,
387
+ "step": 1500
388
+ },
389
+ {
390
+ "entropy": 0.15090686846524476,
391
+ "epoch": 0.45305078553160394,
392
+ "grad_norm": 0.3168330192565918,
393
+ "learning_rate": 0.00017507531632858004,
394
+ "loss": 0.1520420265197754,
395
+ "mean_token_accuracy": 0.9409908491373062,
396
+ "num_tokens": 6738178.0,
397
+ "step": 1550
398
+ },
399
+ {
400
+ "entropy": 0.14193191647529602,
401
+ "epoch": 0.46766532700036534,
402
+ "grad_norm": 0.28218454122543335,
403
+ "learning_rate": 0.00017407109861417957,
404
+ "loss": 0.1442671012878418,
405
+ "mean_token_accuracy": 0.944555883705616,
406
+ "num_tokens": 6955413.0,
407
+ "step": 1600
408
+ },
409
+ {
410
+ "epoch": 0.46766532700036534,
411
+ "eval_entropy": 0.14087487072762797,
412
+ "eval_loss": 0.14355963468551636,
413
+ "eval_mean_token_accuracy": 0.943681773694895,
414
+ "eval_num_tokens": 6955413.0,
415
+ "eval_runtime": 52.1208,
416
+ "eval_samples_per_second": 22.601,
417
+ "eval_steps_per_second": 5.66,
418
+ "step": 1600
419
+ },
420
+ {
421
+ "entropy": 0.1416533422470093,
422
+ "epoch": 0.4822798684691268,
423
+ "grad_norm": 0.28569167852401733,
424
+ "learning_rate": 0.00017306688089977908,
425
+ "loss": 0.146381254196167,
426
+ "mean_token_accuracy": 0.9433900326490402,
427
+ "num_tokens": 7171960.0,
428
+ "step": 1650
429
+ },
430
+ {
431
+ "entropy": 0.14460256807506083,
432
+ "epoch": 0.4968944099378882,
433
+ "grad_norm": 0.298966646194458,
434
+ "learning_rate": 0.0001720626631853786,
435
+ "loss": 0.14527856826782226,
436
+ "mean_token_accuracy": 0.9446076577901841,
437
+ "num_tokens": 7387948.0,
438
+ "step": 1700
439
+ },
440
+ {
441
+ "entropy": 0.14507481291890145,
442
+ "epoch": 0.5115089514066496,
443
+ "grad_norm": 0.32264840602874756,
444
+ "learning_rate": 0.0001710584454709781,
445
+ "loss": 0.14816983222961425,
446
+ "mean_token_accuracy": 0.9431060332059861,
447
+ "num_tokens": 7605190.0,
448
+ "step": 1750
449
+ },
450
+ {
451
+ "entropy": 0.1457299491018057,
452
+ "epoch": 0.526123492875411,
453
+ "grad_norm": 0.23384633660316467,
454
+ "learning_rate": 0.00017005422775657764,
455
+ "loss": 0.14449834823608398,
456
+ "mean_token_accuracy": 0.9444263905286789,
457
+ "num_tokens": 7822465.0,
458
+ "step": 1800
459
+ },
460
+ {
461
+ "epoch": 0.526123492875411,
462
+ "eval_entropy": 0.13727282429650678,
463
+ "eval_loss": 0.14151474833488464,
464
+ "eval_mean_token_accuracy": 0.9445956945419312,
465
+ "eval_num_tokens": 7822465.0,
466
+ "eval_runtime": 51.7253,
467
+ "eval_samples_per_second": 22.774,
468
+ "eval_steps_per_second": 5.703,
469
+ "step": 1800
470
+ },
471
+ {
472
+ "entropy": 0.13303045216947795,
473
+ "epoch": 0.5407380343441724,
474
+ "grad_norm": 0.24926069378852844,
475
+ "learning_rate": 0.00016905001004217715,
476
+ "loss": 0.1377289867401123,
477
+ "mean_token_accuracy": 0.9460858461260796,
478
+ "num_tokens": 8039013.0,
479
+ "step": 1850
480
+ },
481
+ {
482
+ "entropy": 0.14333279909566043,
483
+ "epoch": 0.5553525758129338,
484
+ "grad_norm": 0.23103737831115723,
485
+ "learning_rate": 0.00016804579232777665,
486
+ "loss": 0.14504934310913087,
487
+ "mean_token_accuracy": 0.9442342269420624,
488
+ "num_tokens": 8255914.0,
489
+ "step": 1900
490
+ },
491
+ {
492
+ "entropy": 0.14443909596651794,
493
+ "epoch": 0.5699671172816952,
494
+ "grad_norm": 0.3567982017993927,
495
+ "learning_rate": 0.00016704157461337618,
496
+ "loss": 0.14560423851013182,
497
+ "mean_token_accuracy": 0.9445012074708938,
498
+ "num_tokens": 8473895.0,
499
+ "step": 1950
500
+ },
501
+ {
502
+ "entropy": 0.1381967855617404,
503
+ "epoch": 0.5845816587504568,
504
+ "grad_norm": 0.32823431491851807,
505
+ "learning_rate": 0.00016603735689897571,
506
+ "loss": 0.1393825626373291,
507
+ "mean_token_accuracy": 0.9458042901754379,
508
+ "num_tokens": 8690259.0,
509
+ "step": 2000
510
+ },
511
+ {
512
+ "epoch": 0.5845816587504568,
513
+ "eval_entropy": 0.12425902821755005,
514
+ "eval_loss": 0.14112941920757294,
515
+ "eval_mean_token_accuracy": 0.9466315289675179,
516
+ "eval_num_tokens": 8690259.0,
517
+ "eval_runtime": 51.7824,
518
+ "eval_samples_per_second": 22.749,
519
+ "eval_steps_per_second": 5.697,
520
+ "step": 2000
521
+ },
522
+ {
523
+ "entropy": 0.14191570974886417,
524
+ "epoch": 0.5991962002192182,
525
+ "grad_norm": 0.27820655703544617,
526
+ "learning_rate": 0.00016503313918457522,
527
+ "loss": 0.14510326385498046,
528
+ "mean_token_accuracy": 0.9463699841499329,
529
+ "num_tokens": 8908010.0,
530
+ "step": 2050
531
+ },
532
+ {
533
+ "entropy": 0.14415166847407818,
534
+ "epoch": 0.6138107416879796,
535
+ "grad_norm": 0.2561301290988922,
536
+ "learning_rate": 0.00016402892147017475,
537
+ "loss": 0.144957275390625,
538
+ "mean_token_accuracy": 0.945547785460949,
539
+ "num_tokens": 9124790.0,
540
+ "step": 2100
541
+ },
542
+ {
543
+ "entropy": 0.13635289475321768,
544
+ "epoch": 0.628425283156741,
545
+ "grad_norm": 0.2438308447599411,
546
+ "learning_rate": 0.00016302470375577425,
547
+ "loss": 0.13744013786315917,
548
+ "mean_token_accuracy": 0.9481257164478302,
549
+ "num_tokens": 9343016.0,
550
+ "step": 2150
551
+ },
552
+ {
553
+ "entropy": 0.12979858005419373,
554
+ "epoch": 0.6430398246255024,
555
+ "grad_norm": 0.32355841994285583,
556
+ "learning_rate": 0.00016202048604137379,
557
+ "loss": 0.13397377014160156,
558
+ "mean_token_accuracy": 0.9486737114191055,
559
+ "num_tokens": 9559022.0,
560
+ "step": 2200
561
+ },
562
+ {
563
+ "epoch": 0.6430398246255024,
564
+ "eval_entropy": 0.12423726801397436,
565
+ "eval_loss": 0.1396605670452118,
566
+ "eval_mean_token_accuracy": 0.947921950938338,
567
+ "eval_num_tokens": 9559022.0,
568
+ "eval_runtime": 51.4931,
569
+ "eval_samples_per_second": 22.877,
570
+ "eval_steps_per_second": 5.729,
571
+ "step": 2200
572
+ },
573
+ {
574
+ "entropy": 0.1332092508673668,
575
+ "epoch": 0.6576543660942638,
576
+ "grad_norm": 0.2890651524066925,
577
+ "learning_rate": 0.0001610162683269733,
578
+ "loss": 0.13556601524353026,
579
+ "mean_token_accuracy": 0.9473348143696785,
580
+ "num_tokens": 9774504.0,
581
+ "step": 2250
582
+ },
583
+ {
584
+ "entropy": 0.13480757348239422,
585
+ "epoch": 0.6722689075630253,
586
+ "grad_norm": 0.23138317465782166,
587
+ "learning_rate": 0.0001600120506125728,
588
+ "loss": 0.13720419883728027,
589
+ "mean_token_accuracy": 0.9482911565899849,
590
+ "num_tokens": 9993556.0,
591
+ "step": 2300
592
+ },
593
+ {
594
+ "entropy": 0.13804105442017317,
595
+ "epoch": 0.6868834490317867,
596
+ "grad_norm": 0.2838476896286011,
597
+ "learning_rate": 0.00015900783289817232,
598
+ "loss": 0.13747754096984863,
599
+ "mean_token_accuracy": 0.9490453228354454,
600
+ "num_tokens": 10211239.0,
601
+ "step": 2350
602
+ },
603
+ {
604
+ "entropy": 0.1380857729911804,
605
+ "epoch": 0.7014979905005481,
606
+ "grad_norm": 0.32876694202423096,
607
+ "learning_rate": 0.00015800361518377186,
608
+ "loss": 0.14104883193969728,
609
+ "mean_token_accuracy": 0.9470359092950821,
610
+ "num_tokens": 10430005.0,
611
+ "step": 2400
612
+ },
613
+ {
614
+ "epoch": 0.7014979905005481,
615
+ "eval_entropy": 0.12756498554500484,
616
+ "eval_loss": 0.13620829582214355,
617
+ "eval_mean_token_accuracy": 0.9487966088925378,
618
+ "eval_num_tokens": 10430005.0,
619
+ "eval_runtime": 51.2201,
620
+ "eval_samples_per_second": 22.999,
621
+ "eval_steps_per_second": 5.759,
622
+ "step": 2400
623
+ },
624
+ {
625
+ "entropy": 0.13768024053424596,
626
+ "epoch": 0.7161125319693095,
627
+ "grad_norm": 0.2406591773033142,
628
+ "learning_rate": 0.00015699939746937136,
629
+ "loss": 0.13825586318969726,
630
+ "mean_token_accuracy": 0.9467134064435959,
631
+ "num_tokens": 10646506.0,
632
+ "step": 2450
633
+ },
634
+ {
635
+ "entropy": 0.13076995383948087,
636
+ "epoch": 0.7307270734380709,
637
+ "grad_norm": 0.3014162480831146,
638
+ "learning_rate": 0.0001559951797549709,
639
+ "loss": 0.1335157871246338,
640
+ "mean_token_accuracy": 0.9489013949036598,
641
+ "num_tokens": 10863443.0,
642
+ "step": 2500
643
+ },
644
+ {
645
+ "entropy": 0.12944862838834525,
646
+ "epoch": 0.7453416149068323,
647
+ "grad_norm": 0.2716672718524933,
648
+ "learning_rate": 0.0001549909620405704,
649
+ "loss": 0.13044677734375,
650
+ "mean_token_accuracy": 0.9514863756299019,
651
+ "num_tokens": 11081801.0,
652
+ "step": 2550
653
+ },
654
+ {
655
+ "entropy": 0.13712387483566998,
656
+ "epoch": 0.7599561563755937,
657
+ "grad_norm": 0.2736733555793762,
658
+ "learning_rate": 0.00015398674432616993,
659
+ "loss": 0.13736340522766113,
660
+ "mean_token_accuracy": 0.9477300536632538,
661
+ "num_tokens": 11300525.0,
662
+ "step": 2600
663
+ },
664
+ {
665
+ "epoch": 0.7599561563755937,
666
+ "eval_entropy": 0.1276566566552146,
667
+ "eval_loss": 0.13106825947761536,
668
+ "eval_mean_token_accuracy": 0.9497191014936415,
669
+ "eval_num_tokens": 11300525.0,
670
+ "eval_runtime": 51.2416,
671
+ "eval_samples_per_second": 22.989,
672
+ "eval_steps_per_second": 5.757,
673
+ "step": 2600
674
+ },
675
+ {
676
+ "entropy": 0.1264355194196105,
677
+ "epoch": 0.7745706978443552,
678
+ "grad_norm": 0.2751106321811676,
679
+ "learning_rate": 0.00015298252661176943,
680
+ "loss": 0.12769680976867676,
681
+ "mean_token_accuracy": 0.9521830633282662,
682
+ "num_tokens": 11518418.0,
683
+ "step": 2650
684
+ },
685
+ {
686
+ "entropy": 0.13140305127948523,
687
+ "epoch": 0.7891852393131166,
688
+ "grad_norm": 0.28094226121902466,
689
+ "learning_rate": 0.00015197830889736896,
690
+ "loss": 0.1322249412536621,
691
+ "mean_token_accuracy": 0.9508191779255867,
692
+ "num_tokens": 11733682.0,
693
+ "step": 2700
694
+ },
695
+ {
696
+ "entropy": 0.1296489790827036,
697
+ "epoch": 0.803799780781878,
698
+ "grad_norm": 0.31960225105285645,
699
+ "learning_rate": 0.0001509740911829685,
700
+ "loss": 0.13073083877563477,
701
+ "mean_token_accuracy": 0.9499760115146637,
702
+ "num_tokens": 11950207.0,
703
+ "step": 2750
704
+ },
705
+ {
706
+ "entropy": 0.1249570251069963,
707
+ "epoch": 0.8184143222506394,
708
+ "grad_norm": 0.2821206748485565,
709
+ "learning_rate": 0.000149969873468568,
710
+ "loss": 0.12826437950134278,
711
+ "mean_token_accuracy": 0.9511147084832191,
712
+ "num_tokens": 12166720.0,
713
+ "step": 2800
714
+ },
715
+ {
716
+ "epoch": 0.8184143222506394,
717
+ "eval_entropy": 0.12591243864873708,
718
+ "eval_loss": 0.13125115633010864,
719
+ "eval_mean_token_accuracy": 0.9507922431169931,
720
+ "eval_num_tokens": 12166720.0,
721
+ "eval_runtime": 51.205,
722
+ "eval_samples_per_second": 23.006,
723
+ "eval_steps_per_second": 5.761,
724
+ "step": 2800
725
+ },
726
+ {
727
+ "entropy": 0.12767981396988035,
728
+ "epoch": 0.8330288637194008,
729
+ "grad_norm": 0.27759984135627747,
730
+ "learning_rate": 0.00014896565575416753,
731
+ "loss": 0.12868986129760743,
732
+ "mean_token_accuracy": 0.9509958475828171,
733
+ "num_tokens": 12382797.0,
734
+ "step": 2850
735
+ },
736
+ {
737
+ "entropy": 0.1295067841745913,
738
+ "epoch": 0.8476434051881622,
739
+ "grad_norm": 0.23248647153377533,
740
+ "learning_rate": 0.00014796143803976703,
741
+ "loss": 0.13320878982543946,
742
+ "mean_token_accuracy": 0.9507122281193733,
743
+ "num_tokens": 12601076.0,
744
+ "step": 2900
745
+ },
746
+ {
747
+ "entropy": 0.13079511255025864,
748
+ "epoch": 0.8622579466569237,
749
+ "grad_norm": 0.26745545864105225,
750
+ "learning_rate": 0.00014695722032536654,
751
+ "loss": 0.13269658088684083,
752
+ "mean_token_accuracy": 0.9507605847716332,
753
+ "num_tokens": 12816469.0,
754
+ "step": 2950
755
+ },
756
+ {
757
+ "entropy": 0.1252501069754362,
758
+ "epoch": 0.8768724881256851,
759
+ "grad_norm": 0.2826436758041382,
760
+ "learning_rate": 0.00014595300261096607,
761
+ "loss": 0.12778679847717286,
762
+ "mean_token_accuracy": 0.9513759270310402,
763
+ "num_tokens": 13032433.0,
764
+ "step": 3000
765
+ },
766
+ {
767
+ "epoch": 0.8768724881256851,
768
+ "eval_entropy": 0.13185835869635565,
769
+ "eval_loss": 0.12732699513435364,
770
+ "eval_mean_token_accuracy": 0.9507037514347141,
771
+ "eval_num_tokens": 13032433.0,
772
+ "eval_runtime": 51.8861,
773
+ "eval_samples_per_second": 22.704,
774
+ "eval_steps_per_second": 5.686,
775
+ "step": 3000
776
+ },
777
+ {
778
+ "entropy": 0.12554888619109988,
779
+ "epoch": 0.8914870295944465,
780
+ "grad_norm": 0.329559862613678,
781
+ "learning_rate": 0.00014494878489656557,
782
+ "loss": 0.12740483283996581,
783
+ "mean_token_accuracy": 0.9519036790728569,
784
+ "num_tokens": 13249653.0,
785
+ "step": 3050
786
+ },
787
+ {
788
+ "entropy": 0.12633929964154958,
789
+ "epoch": 0.9061015710632079,
790
+ "grad_norm": 0.2994729280471802,
791
+ "learning_rate": 0.0001439445671821651,
792
+ "loss": 0.12879551887512208,
793
+ "mean_token_accuracy": 0.9523486059904098,
794
+ "num_tokens": 13466568.0,
795
+ "step": 3100
796
+ },
797
+ {
798
+ "entropy": 0.1324564717710018,
799
+ "epoch": 0.9207161125319693,
800
+ "grad_norm": 0.2625322639942169,
801
+ "learning_rate": 0.00014294034946776463,
802
+ "loss": 0.13260350227355958,
803
+ "mean_token_accuracy": 0.950848217010498,
804
+ "num_tokens": 13684721.0,
805
+ "step": 3150
806
+ },
807
+ {
808
+ "entropy": 0.1254732285439968,
809
+ "epoch": 0.9353306540007307,
810
+ "grad_norm": 0.3398250639438629,
811
+ "learning_rate": 0.00014193613175336414,
812
+ "loss": 0.12758193016052247,
813
+ "mean_token_accuracy": 0.9529688519239425,
814
+ "num_tokens": 13903515.0,
815
+ "step": 3200
816
+ },
817
+ {
818
+ "epoch": 0.9353306540007307,
819
+ "eval_entropy": 0.12104560298434759,
820
+ "eval_loss": 0.1254371851682663,
821
+ "eval_mean_token_accuracy": 0.9526172644000942,
822
+ "eval_num_tokens": 13903515.0,
823
+ "eval_runtime": 51.6986,
824
+ "eval_samples_per_second": 22.786,
825
+ "eval_steps_per_second": 5.706,
826
+ "step": 3200
827
+ },
828
+ {
829
+ "entropy": 0.13165340654551982,
830
+ "epoch": 0.9499451954694922,
831
+ "grad_norm": 0.32547247409820557,
832
+ "learning_rate": 0.00014093191403896367,
833
+ "loss": 0.13361644744873047,
834
+ "mean_token_accuracy": 0.9494915246963501,
835
+ "num_tokens": 14122365.0,
836
+ "step": 3250
837
+ },
838
+ {
839
+ "entropy": 0.12670642552897335,
840
+ "epoch": 0.9645597369382536,
841
+ "grad_norm": 0.43059042096138,
842
+ "learning_rate": 0.00013992769632456317,
843
+ "loss": 0.12734654426574707,
844
+ "mean_token_accuracy": 0.9540221604704857,
845
+ "num_tokens": 14341363.0,
846
+ "step": 3300
847
+ },
848
+ {
849
+ "entropy": 0.12478693343698978,
850
+ "epoch": 0.979174278407015,
851
+ "grad_norm": 0.24067845940589905,
852
+ "learning_rate": 0.00013892347861016268,
853
+ "loss": 0.12505006790161133,
854
+ "mean_token_accuracy": 0.9537291714549064,
855
+ "num_tokens": 14558651.0,
856
+ "step": 3350
857
+ },
858
+ {
859
+ "entropy": 0.12454102255403995,
860
+ "epoch": 0.9937888198757764,
861
+ "grad_norm": 0.27057918906211853,
862
+ "learning_rate": 0.0001379192608957622,
863
+ "loss": 0.12519509315490723,
864
+ "mean_token_accuracy": 0.9531420814990997,
865
+ "num_tokens": 14774887.0,
866
+ "step": 3400
867
+ },
868
+ {
869
+ "epoch": 0.9937888198757764,
870
+ "eval_entropy": 0.1218604107150587,
871
+ "eval_loss": 0.12476576864719391,
872
+ "eval_mean_token_accuracy": 0.9522026013519804,
873
+ "eval_num_tokens": 14774887.0,
874
+ "eval_runtime": 52.2754,
875
+ "eval_samples_per_second": 22.535,
876
+ "eval_steps_per_second": 5.643,
877
+ "step": 3400
878
+ },
879
+ {
880
+ "entropy": 0.11712383136607063,
881
+ "epoch": 1.0081841432225065,
882
+ "grad_norm": 0.4069111943244934,
883
+ "learning_rate": 0.0001369150431813617,
884
+ "loss": 0.11227139472961425,
885
+ "mean_token_accuracy": 0.957756791320549,
886
+ "num_tokens": 14988925.0,
887
+ "step": 3450
888
+ },
889
+ {
890
+ "entropy": 0.10819806138053537,
891
+ "epoch": 1.0227986846912678,
892
+ "grad_norm": 0.347784161567688,
893
+ "learning_rate": 0.00013591082546696124,
894
+ "loss": 0.10597694396972657,
895
+ "mean_token_accuracy": 0.9602300328016281,
896
+ "num_tokens": 15207529.0,
897
+ "step": 3500
898
+ },
899
+ {
900
+ "entropy": 0.09677543576806784,
901
+ "epoch": 1.0374132261600293,
902
+ "grad_norm": 0.43760985136032104,
903
+ "learning_rate": 0.00013490660775256077,
904
+ "loss": 0.0967884635925293,
905
+ "mean_token_accuracy": 0.9631710237264633,
906
+ "num_tokens": 15424380.0,
907
+ "step": 3550
908
+ },
909
+ {
910
+ "entropy": 0.09595708003267646,
911
+ "epoch": 1.0520277676287906,
912
+ "grad_norm": 0.3321962356567383,
913
+ "learning_rate": 0.00013390239003816028,
914
+ "loss": 0.09627270698547363,
915
+ "mean_token_accuracy": 0.9640694811940194,
916
+ "num_tokens": 15640971.0,
917
+ "step": 3600
918
+ },
919
+ {
920
+ "epoch": 1.0520277676287906,
921
+ "eval_entropy": 0.10276495573126664,
922
+ "eval_loss": 0.1241004690527916,
923
+ "eval_mean_token_accuracy": 0.9543731022689302,
924
+ "eval_num_tokens": 15640971.0,
925
+ "eval_runtime": 51.458,
926
+ "eval_samples_per_second": 22.892,
927
+ "eval_steps_per_second": 5.733,
928
+ "step": 3600
929
+ },
930
+ {
931
+ "entropy": 0.09977266293019056,
932
+ "epoch": 1.066642309097552,
933
+ "grad_norm": 0.34104689955711365,
934
+ "learning_rate": 0.0001328981723237598,
935
+ "loss": 0.09645257949829102,
936
+ "mean_token_accuracy": 0.9637984240055084,
937
+ "num_tokens": 15858524.0,
938
+ "step": 3650
939
+ },
940
+ {
941
+ "entropy": 0.097247479185462,
942
+ "epoch": 1.0812568505663136,
943
+ "grad_norm": 0.29214659333229065,
944
+ "learning_rate": 0.0001318939546093593,
945
+ "loss": 0.09814267158508301,
946
+ "mean_token_accuracy": 0.9640810504555702,
947
+ "num_tokens": 16076800.0,
948
+ "step": 3700
949
+ },
950
+ {
951
+ "entropy": 0.10092583011835814,
952
+ "epoch": 1.0958713920350749,
953
+ "grad_norm": 0.27324506640434265,
954
+ "learning_rate": 0.00013088973689495882,
955
+ "loss": 0.09999562263488769,
956
+ "mean_token_accuracy": 0.9627196389436722,
957
+ "num_tokens": 16295096.0,
958
+ "step": 3750
959
+ },
960
+ {
961
+ "entropy": 0.09513680284842849,
962
+ "epoch": 1.1104859335038364,
963
+ "grad_norm": 0.32636934518814087,
964
+ "learning_rate": 0.00012988551918055835,
965
+ "loss": 0.09587624549865723,
966
+ "mean_token_accuracy": 0.9640011402964592,
967
+ "num_tokens": 16511062.0,
968
+ "step": 3800
969
+ },
970
+ {
971
+ "epoch": 1.1104859335038364,
972
+ "eval_entropy": 0.09597434103488922,
973
+ "eval_loss": 0.12425629794597626,
974
+ "eval_mean_token_accuracy": 0.9549674963547011,
975
+ "eval_num_tokens": 16511062.0,
976
+ "eval_runtime": 51.6304,
977
+ "eval_samples_per_second": 22.816,
978
+ "eval_steps_per_second": 5.714,
979
+ "step": 3800
980
+ },
981
+ {
982
+ "entropy": 0.09476003058254719,
983
+ "epoch": 1.1251004749725977,
984
+ "grad_norm": 0.28826117515563965,
985
+ "learning_rate": 0.00012888130146615788,
986
+ "loss": 0.09343017578125,
987
+ "mean_token_accuracy": 0.9631267023086548,
988
+ "num_tokens": 16728855.0,
989
+ "step": 3850
990
+ },
991
+ {
992
+ "entropy": 0.09374131880700588,
993
+ "epoch": 1.1397150164413592,
994
+ "grad_norm": 0.3931892514228821,
995
+ "learning_rate": 0.00012787708375175738,
996
+ "loss": 0.09412909507751464,
997
+ "mean_token_accuracy": 0.9654038622975349,
998
+ "num_tokens": 16944362.0,
999
+ "step": 3900
1000
+ },
1001
+ {
1002
+ "entropy": 0.09230754490941763,
1003
+ "epoch": 1.1543295579101205,
1004
+ "grad_norm": 0.3274497389793396,
1005
+ "learning_rate": 0.00012687286603735691,
1006
+ "loss": 0.09314986228942872,
1007
+ "mean_token_accuracy": 0.9648771300911904,
1008
+ "num_tokens": 17161661.0,
1009
+ "step": 3950
1010
+ },
1011
+ {
1012
+ "entropy": 0.10461167734116315,
1013
+ "epoch": 1.168944099378882,
1014
+ "grad_norm": 0.3222503662109375,
1015
+ "learning_rate": 0.00012586864832295642,
1016
+ "loss": 0.10164319992065429,
1017
+ "mean_token_accuracy": 0.9613501909375191,
1018
+ "num_tokens": 17379999.0,
1019
+ "step": 4000
1020
+ },
1021
+ {
1022
+ "epoch": 1.168944099378882,
1023
+ "eval_entropy": 0.09555989803146507,
1024
+ "eval_loss": 0.1204494908452034,
1025
+ "eval_mean_token_accuracy": 0.9567918892634117,
1026
+ "eval_num_tokens": 17379999.0,
1027
+ "eval_runtime": 51.2346,
1028
+ "eval_samples_per_second": 22.992,
1029
+ "eval_steps_per_second": 5.758,
1030
+ "step": 4000
1031
+ },
1032
+ {
1033
+ "entropy": 0.09500436037778855,
1034
+ "epoch": 1.1835586408476435,
1035
+ "grad_norm": 0.34208106994628906,
1036
+ "learning_rate": 0.00012486443060855595,
1037
+ "loss": 0.09681806564331055,
1038
+ "mean_token_accuracy": 0.9633791667222976,
1039
+ "num_tokens": 17597011.0,
1040
+ "step": 4050
1041
+ },
1042
+ {
1043
+ "entropy": 0.09596794040873646,
1044
+ "epoch": 1.1981731823164048,
1045
+ "grad_norm": 0.6134909987449646,
1046
+ "learning_rate": 0.00012386021289415545,
1047
+ "loss": 0.09627909660339355,
1048
+ "mean_token_accuracy": 0.9645186159014701,
1049
+ "num_tokens": 17814323.0,
1050
+ "step": 4100
1051
+ },
1052
+ {
1053
+ "entropy": 0.09296734174713492,
1054
+ "epoch": 1.2127877237851663,
1055
+ "grad_norm": 0.309161514043808,
1056
+ "learning_rate": 0.00012285599517975496,
1057
+ "loss": 0.09468943595886231,
1058
+ "mean_token_accuracy": 0.9646199548244476,
1059
+ "num_tokens": 18030765.0,
1060
+ "step": 4150
1061
+ },
1062
+ {
1063
+ "entropy": 0.09392764896154404,
1064
+ "epoch": 1.2274022652539276,
1065
+ "grad_norm": 0.29440510272979736,
1066
+ "learning_rate": 0.0001218517774653545,
1067
+ "loss": 0.09385616302490235,
1068
+ "mean_token_accuracy": 0.9648527312278747,
1069
+ "num_tokens": 18247789.0,
1070
+ "step": 4200
1071
+ },
1072
+ {
1073
+ "epoch": 1.2274022652539276,
1074
+ "eval_entropy": 0.0961840924822678,
1075
+ "eval_loss": 0.12064161151647568,
1076
+ "eval_mean_token_accuracy": 0.9558913909782798,
1077
+ "eval_num_tokens": 18247789.0,
1078
+ "eval_runtime": 51.771,
1079
+ "eval_samples_per_second": 22.754,
1080
+ "eval_steps_per_second": 5.698,
1081
+ "step": 4200
1082
+ },
1083
+ {
1084
+ "entropy": 0.09542508151382208,
1085
+ "epoch": 1.242016806722689,
1086
+ "grad_norm": 0.40045246481895447,
1087
+ "learning_rate": 0.000120847559750954,
1088
+ "loss": 0.09424283981323242,
1089
+ "mean_token_accuracy": 0.9646497869491577,
1090
+ "num_tokens": 18465958.0,
1091
+ "step": 4250
1092
+ },
1093
+ {
1094
+ "entropy": 0.09011594654526561,
1095
+ "epoch": 1.2566313481914504,
1096
+ "grad_norm": 0.265855610370636,
1097
+ "learning_rate": 0.00011984334203655354,
1098
+ "loss": 0.090297269821167,
1099
+ "mean_token_accuracy": 0.9658442854881286,
1100
+ "num_tokens": 18682990.0,
1101
+ "step": 4300
1102
+ },
1103
+ {
1104
+ "entropy": 0.08969980413094163,
1105
+ "epoch": 1.271245889660212,
1106
+ "grad_norm": 0.40770867466926575,
1107
+ "learning_rate": 0.00011883912432215305,
1108
+ "loss": 0.09162886619567871,
1109
+ "mean_token_accuracy": 0.9658057001233101,
1110
+ "num_tokens": 18900419.0,
1111
+ "step": 4350
1112
+ },
1113
+ {
1114
+ "entropy": 0.09763234948739409,
1115
+ "epoch": 1.2858604311289734,
1116
+ "grad_norm": 0.3054230511188507,
1117
+ "learning_rate": 0.00011783490660775256,
1118
+ "loss": 0.0983086109161377,
1119
+ "mean_token_accuracy": 0.9633460545539856,
1120
+ "num_tokens": 19118904.0,
1121
+ "step": 4400
1122
+ },
1123
+ {
1124
+ "epoch": 1.2858604311289734,
1125
+ "eval_entropy": 0.09841432020825855,
1126
+ "eval_loss": 0.1181686744093895,
1127
+ "eval_mean_token_accuracy": 0.9566149655034987,
1128
+ "eval_num_tokens": 19118904.0,
1129
+ "eval_runtime": 51.5747,
1130
+ "eval_samples_per_second": 22.841,
1131
+ "eval_steps_per_second": 5.72,
1132
+ "step": 4400
1133
+ },
1134
+ {
1135
+ "entropy": 0.09089874122291804,
1136
+ "epoch": 1.3004749725977347,
1137
+ "grad_norm": 0.36007627844810486,
1138
+ "learning_rate": 0.00011683068889335209,
1139
+ "loss": 0.08920018196105957,
1140
+ "mean_token_accuracy": 0.9661843276023865,
1141
+ "num_tokens": 19336274.0,
1142
+ "step": 4450
1143
+ },
1144
+ {
1145
+ "entropy": 0.0862886114232242,
1146
+ "epoch": 1.3150895140664962,
1147
+ "grad_norm": 0.33618125319480896,
1148
+ "learning_rate": 0.00011582647117895161,
1149
+ "loss": 0.08620091438293458,
1150
+ "mean_token_accuracy": 0.9683165431022644,
1151
+ "num_tokens": 19552793.0,
1152
+ "step": 4500
1153
+ },
1154
+ {
1155
+ "entropy": 0.0956742905639112,
1156
+ "epoch": 1.3297040555352575,
1157
+ "grad_norm": 0.3849150538444519,
1158
+ "learning_rate": 0.00011482225346455111,
1159
+ "loss": 0.09665518760681152,
1160
+ "mean_token_accuracy": 0.9633703279495239,
1161
+ "num_tokens": 19769345.0,
1162
+ "step": 4550
1163
+ },
1164
+ {
1165
+ "entropy": 0.09203850487247109,
1166
+ "epoch": 1.344318597004019,
1167
+ "grad_norm": 0.31663480401039124,
1168
+ "learning_rate": 0.00011381803575015064,
1169
+ "loss": 0.09010299682617187,
1170
+ "mean_token_accuracy": 0.9652843907475471,
1171
+ "num_tokens": 19987045.0,
1172
+ "step": 4600
1173
+ },
1174
+ {
1175
+ "epoch": 1.344318597004019,
1176
+ "eval_entropy": 0.08627223369302386,
1177
+ "eval_loss": 0.12027477473020554,
1178
+ "eval_mean_token_accuracy": 0.9569575905799865,
1179
+ "eval_num_tokens": 19987045.0,
1180
+ "eval_runtime": 51.593,
1181
+ "eval_samples_per_second": 22.833,
1182
+ "eval_steps_per_second": 5.718,
1183
+ "step": 4600
1184
+ },
1185
+ {
1186
+ "entropy": 0.0923673815280199,
1187
+ "epoch": 1.3589331384727803,
1188
+ "grad_norm": 0.40604791045188904,
1189
+ "learning_rate": 0.00011281381803575015,
1190
+ "loss": 0.09391559600830078,
1191
+ "mean_token_accuracy": 0.9660267063975334,
1192
+ "num_tokens": 20204662.0,
1193
+ "step": 4650
1194
+ },
1195
+ {
1196
+ "entropy": 0.08946419894695282,
1197
+ "epoch": 1.3735476799415418,
1198
+ "grad_norm": 0.44695547223091125,
1199
+ "learning_rate": 0.00011180960032134968,
1200
+ "loss": 0.09293787002563476,
1201
+ "mean_token_accuracy": 0.9646873572468757,
1202
+ "num_tokens": 20423466.0,
1203
+ "step": 4700
1204
+ },
1205
+ {
1206
+ "entropy": 0.09025523517280817,
1207
+ "epoch": 1.3881622214103033,
1208
+ "grad_norm": 0.2976325750350952,
1209
+ "learning_rate": 0.0001108053826069492,
1210
+ "loss": 0.0911507797241211,
1211
+ "mean_token_accuracy": 0.9653226399421692,
1212
+ "num_tokens": 20641293.0,
1213
+ "step": 4750
1214
+ },
1215
+ {
1216
+ "entropy": 0.09211947876960039,
1217
+ "epoch": 1.4027767628790646,
1218
+ "grad_norm": 0.26411667466163635,
1219
+ "learning_rate": 0.0001098011648925487,
1220
+ "loss": 0.09012277603149414,
1221
+ "mean_token_accuracy": 0.9667563599348068,
1222
+ "num_tokens": 20859728.0,
1223
+ "step": 4800
1224
+ },
1225
+ {
1226
+ "epoch": 1.4027767628790646,
1227
+ "eval_entropy": 0.0889583650786998,
1228
+ "eval_loss": 0.11991087347269058,
1229
+ "eval_mean_token_accuracy": 0.9574164336010561,
1230
+ "eval_num_tokens": 20859728.0,
1231
+ "eval_runtime": 51.832,
1232
+ "eval_samples_per_second": 22.727,
1233
+ "eval_steps_per_second": 5.691,
1234
+ "step": 4800
1235
+ },
1236
+ {
1237
+ "entropy": 0.09142036261036993,
1238
+ "epoch": 1.4173913043478261,
1239
+ "grad_norm": 0.3087850511074066,
1240
+ "learning_rate": 0.00010879694717814823,
1241
+ "loss": 0.09248518943786621,
1242
+ "mean_token_accuracy": 0.9662388986349106,
1243
+ "num_tokens": 21077745.0,
1244
+ "step": 4850
1245
+ },
1246
+ {
1247
+ "entropy": 0.09305513446219266,
1248
+ "epoch": 1.4320058458165876,
1249
+ "grad_norm": 0.34897470474243164,
1250
+ "learning_rate": 0.00010779272946374775,
1251
+ "loss": 0.09240678787231445,
1252
+ "mean_token_accuracy": 0.9652760860323906,
1253
+ "num_tokens": 21295057.0,
1254
+ "step": 4900
1255
+ },
1256
+ {
1257
+ "entropy": 0.09016769832000136,
1258
+ "epoch": 1.446620387285349,
1259
+ "grad_norm": 0.32600948214530945,
1260
+ "learning_rate": 0.00010678851174934725,
1261
+ "loss": 0.0925068473815918,
1262
+ "mean_token_accuracy": 0.9654142627120018,
1263
+ "num_tokens": 21509590.0,
1264
+ "step": 4950
1265
+ },
1266
+ {
1267
+ "entropy": 0.08982307212427258,
1268
+ "epoch": 1.4612349287541102,
1269
+ "grad_norm": 0.3035278916358948,
1270
+ "learning_rate": 0.00010578429403494678,
1271
+ "loss": 0.09122074127197266,
1272
+ "mean_token_accuracy": 0.96599131077528,
1273
+ "num_tokens": 21727721.0,
1274
+ "step": 5000
1275
+ },
1276
+ {
1277
+ "epoch": 1.4612349287541102,
1278
+ "eval_entropy": 0.09071531677145069,
1279
+ "eval_loss": 0.11822337657213211,
1280
+ "eval_mean_token_accuracy": 0.9580705240621405,
1281
+ "eval_num_tokens": 21727721.0,
1282
+ "eval_runtime": 51.3724,
1283
+ "eval_samples_per_second": 22.931,
1284
+ "eval_steps_per_second": 5.742,
1285
+ "step": 5000
1286
+ },
1287
+ {
1288
+ "entropy": 0.0927383072860539,
1289
+ "epoch": 1.4758494702228717,
1290
+ "grad_norm": 0.33800584077835083,
1291
+ "learning_rate": 0.0001047800763205463,
1292
+ "loss": 0.09140531539916992,
1293
+ "mean_token_accuracy": 0.9651796925067901,
1294
+ "num_tokens": 21945922.0,
1295
+ "step": 5050
1296
+ },
1297
+ {
1298
+ "entropy": 0.09029178963974119,
1299
+ "epoch": 1.4904640116916332,
1300
+ "grad_norm": 0.4534330368041992,
1301
+ "learning_rate": 0.00010377585860614583,
1302
+ "loss": 0.09171391487121582,
1303
+ "mean_token_accuracy": 0.966952161192894,
1304
+ "num_tokens": 22164989.0,
1305
+ "step": 5100
1306
+ },
1307
+ {
1308
+ "entropy": 0.0846068394370377,
1309
+ "epoch": 1.5050785531603945,
1310
+ "grad_norm": 0.2575761079788208,
1311
+ "learning_rate": 0.00010277164089174534,
1312
+ "loss": 0.08573863983154296,
1313
+ "mean_token_accuracy": 0.9693089470267295,
1314
+ "num_tokens": 22381112.0,
1315
+ "step": 5150
1316
+ },
1317
+ {
1318
+ "entropy": 0.08938812999054789,
1319
+ "epoch": 1.519693094629156,
1320
+ "grad_norm": 0.2744484543800354,
1321
+ "learning_rate": 0.00010176742317734484,
1322
+ "loss": 0.08850445747375488,
1323
+ "mean_token_accuracy": 0.9676422467827797,
1324
+ "num_tokens": 22597002.0,
1325
+ "step": 5200
1326
+ },
1327
+ {
1328
+ "epoch": 1.519693094629156,
1329
+ "eval_entropy": 0.0930880088169696,
1330
+ "eval_loss": 0.11626386642456055,
1331
+ "eval_mean_token_accuracy": 0.9575319203279786,
1332
+ "eval_num_tokens": 22597002.0,
1333
+ "eval_runtime": 51.3354,
1334
+ "eval_samples_per_second": 22.947,
1335
+ "eval_steps_per_second": 5.747,
1336
+ "step": 5200
1337
+ },
1338
+ {
1339
+ "entropy": 0.09117060529068112,
1340
+ "epoch": 1.5343076360979175,
1341
+ "grad_norm": 0.38833215832710266,
1342
+ "learning_rate": 0.00010076320546294437,
1343
+ "loss": 0.09367633819580078,
1344
+ "mean_token_accuracy": 0.9644442161917687,
1345
+ "num_tokens": 22812799.0,
1346
+ "step": 5250
1347
+ },
1348
+ {
1349
+ "entropy": 0.08938059702515602,
1350
+ "epoch": 1.5489221775666788,
1351
+ "grad_norm": 0.3190608322620392,
1352
+ "learning_rate": 9.975898774854389e-05,
1353
+ "loss": 0.0879911231994629,
1354
+ "mean_token_accuracy": 0.96626698076725,
1355
+ "num_tokens": 23030016.0,
1356
+ "step": 5300
1357
+ },
1358
+ {
1359
+ "entropy": 0.08715751779265701,
1360
+ "epoch": 1.5635367190354401,
1361
+ "grad_norm": 0.30828171968460083,
1362
+ "learning_rate": 9.87547700341434e-05,
1363
+ "loss": 0.09027284622192383,
1364
+ "mean_token_accuracy": 0.9669826221466065,
1365
+ "num_tokens": 23248968.0,
1366
+ "step": 5350
1367
+ },
1368
+ {
1369
+ "entropy": 0.08828917387872934,
1370
+ "epoch": 1.5781512605042018,
1371
+ "grad_norm": 0.38410839438438416,
1372
+ "learning_rate": 9.775055231974292e-05,
1373
+ "loss": 0.08821515083312988,
1374
+ "mean_token_accuracy": 0.9665435764193535,
1375
+ "num_tokens": 23464933.0,
1376
+ "step": 5400
1377
+ },
1378
+ {
1379
+ "epoch": 1.5781512605042018,
1380
+ "eval_entropy": 0.09166115953002946,
1381
+ "eval_loss": 0.11569290608167648,
1382
+ "eval_mean_token_accuracy": 0.9589312512995833,
1383
+ "eval_num_tokens": 23464933.0,
1384
+ "eval_runtime": 51.7313,
1385
+ "eval_samples_per_second": 22.771,
1386
+ "eval_steps_per_second": 5.703,
1387
+ "step": 5400
1388
+ },
1389
+ {
1390
+ "entropy": 0.08674560531042516,
1391
+ "epoch": 1.5927658019729631,
1392
+ "grad_norm": 0.2987992763519287,
1393
+ "learning_rate": 9.674633460534244e-05,
1394
+ "loss": 0.08608449935913086,
1395
+ "mean_token_accuracy": 0.9669453829526902,
1396
+ "num_tokens": 23683369.0,
1397
+ "step": 5450
1398
+ },
1399
+ {
1400
+ "entropy": 0.08784966805949807,
1401
+ "epoch": 1.6073803434417244,
1402
+ "grad_norm": 0.34559184312820435,
1403
+ "learning_rate": 9.574211689094196e-05,
1404
+ "loss": 0.08749322891235352,
1405
+ "mean_token_accuracy": 0.9666104671359063,
1406
+ "num_tokens": 23900573.0,
1407
+ "step": 5500
1408
+ },
1409
+ {
1410
+ "entropy": 0.08791282497346402,
1411
+ "epoch": 1.621994884910486,
1412
+ "grad_norm": 0.33519676327705383,
1413
+ "learning_rate": 9.473789917654148e-05,
1414
+ "loss": 0.08817813873291015,
1415
+ "mean_token_accuracy": 0.967940234541893,
1416
+ "num_tokens": 24117509.0,
1417
+ "step": 5550
1418
+ },
1419
+ {
1420
+ "entropy": 0.08461488509550691,
1421
+ "epoch": 1.6366094263792474,
1422
+ "grad_norm": 0.6715280413627625,
1423
+ "learning_rate": 9.3733681462141e-05,
1424
+ "loss": 0.08558347702026367,
1425
+ "mean_token_accuracy": 0.9682379782199859,
1426
+ "num_tokens": 24333931.0,
1427
+ "step": 5600
1428
+ },
1429
+ {
1430
+ "epoch": 1.6366094263792474,
1431
+ "eval_entropy": 0.08775949452261804,
1432
+ "eval_loss": 0.11595170944929123,
1433
+ "eval_mean_token_accuracy": 0.9591477790121304,
1434
+ "eval_num_tokens": 24333931.0,
1435
+ "eval_runtime": 51.6207,
1436
+ "eval_samples_per_second": 22.82,
1437
+ "eval_steps_per_second": 5.715,
1438
+ "step": 5600
1439
+ },
1440
+ {
1441
+ "entropy": 0.08632316379807889,
1442
+ "epoch": 1.6512239678480087,
1443
+ "grad_norm": 0.426924467086792,
1444
+ "learning_rate": 9.272946374774053e-05,
1445
+ "loss": 0.08816647529602051,
1446
+ "mean_token_accuracy": 0.9676574739813805,
1447
+ "num_tokens": 24551230.0,
1448
+ "step": 5650
1449
+ },
1450
+ {
1451
+ "entropy": 0.08664186015725135,
1452
+ "epoch": 1.66583850931677,
1453
+ "grad_norm": 0.2743942439556122,
1454
+ "learning_rate": 9.172524603334003e-05,
1455
+ "loss": 0.08955062866210937,
1456
+ "mean_token_accuracy": 0.9671838331222534,
1457
+ "num_tokens": 24768343.0,
1458
+ "step": 5700
1459
+ },
1460
+ {
1461
+ "entropy": 0.0877827282436192,
1462
+ "epoch": 1.6804530507855318,
1463
+ "grad_norm": 0.4056563675403595,
1464
+ "learning_rate": 9.072102831893955e-05,
1465
+ "loss": 0.08868096351623535,
1466
+ "mean_token_accuracy": 0.9664111837744713,
1467
+ "num_tokens": 24984999.0,
1468
+ "step": 5750
1469
+ },
1470
+ {
1471
+ "entropy": 0.08376523592509329,
1472
+ "epoch": 1.695067592254293,
1473
+ "grad_norm": 0.43965309858322144,
1474
+ "learning_rate": 8.971681060453906e-05,
1475
+ "loss": 0.08181517601013183,
1476
+ "mean_token_accuracy": 0.9681954535841942,
1477
+ "num_tokens": 25202890.0,
1478
+ "step": 5800
1479
+ },
1480
+ {
1481
+ "epoch": 1.695067592254293,
1482
+ "eval_entropy": 0.08046806757101568,
1483
+ "eval_loss": 0.11467474699020386,
1484
+ "eval_mean_token_accuracy": 0.959945414430004,
1485
+ "eval_num_tokens": 25202890.0,
1486
+ "eval_runtime": 51.7478,
1487
+ "eval_samples_per_second": 22.764,
1488
+ "eval_steps_per_second": 5.701,
1489
+ "step": 5800
1490
+ },
1491
+ {
1492
+ "entropy": 0.08683971673250199,
1493
+ "epoch": 1.7096821337230543,
1494
+ "grad_norm": 0.368268758058548,
1495
+ "learning_rate": 8.87125928901386e-05,
1496
+ "loss": 0.09294096946716308,
1497
+ "mean_token_accuracy": 0.9656963437795639,
1498
+ "num_tokens": 25419806.0,
1499
+ "step": 5850
1500
+ },
1501
+ {
1502
+ "entropy": 0.08786554461345077,
1503
+ "epoch": 1.7242966751918158,
1504
+ "grad_norm": 0.2730977237224579,
1505
+ "learning_rate": 8.77083751757381e-05,
1506
+ "loss": 0.0859497356414795,
1507
+ "mean_token_accuracy": 0.9679459264874458,
1508
+ "num_tokens": 25636607.0,
1509
+ "step": 5900
1510
+ },
1511
+ {
1512
+ "entropy": 0.0849998215213418,
1513
+ "epoch": 1.7389112166605774,
1514
+ "grad_norm": 0.38372334837913513,
1515
+ "learning_rate": 8.670415746133762e-05,
1516
+ "loss": 0.08449971199035644,
1517
+ "mean_token_accuracy": 0.9687798276543618,
1518
+ "num_tokens": 25853046.0,
1519
+ "step": 5950
1520
+ },
1521
+ {
1522
+ "entropy": 0.08693754209205508,
1523
+ "epoch": 1.7535257581293386,
1524
+ "grad_norm": 0.2625570297241211,
1525
+ "learning_rate": 8.569993974693714e-05,
1526
+ "loss": 0.0882598876953125,
1527
+ "mean_token_accuracy": 0.9681905370950699,
1528
+ "num_tokens": 26070424.0,
1529
+ "step": 6000
1530
+ },
1531
+ {
1532
+ "epoch": 1.7535257581293386,
1533
+ "eval_entropy": 0.0895412382306689,
1534
+ "eval_loss": 0.11259053647518158,
1535
+ "eval_mean_token_accuracy": 0.959880271402456,
1536
+ "eval_num_tokens": 26070424.0,
1537
+ "eval_runtime": 51.2473,
1538
+ "eval_samples_per_second": 22.987,
1539
+ "eval_steps_per_second": 5.756,
1540
+ "step": 6000
1541
+ },
1542
+ {
1543
+ "entropy": 0.08510855933651328,
1544
+ "epoch": 1.7681402995981002,
1545
+ "grad_norm": 0.3207480013370514,
1546
+ "learning_rate": 8.469572203253667e-05,
1547
+ "loss": 0.0856710433959961,
1548
+ "mean_token_accuracy": 0.9684762534499168,
1549
+ "num_tokens": 26286207.0,
1550
+ "step": 6050
1551
+ },
1552
+ {
1553
+ "entropy": 0.08411331648007035,
1554
+ "epoch": 1.7827548410668617,
1555
+ "grad_norm": 0.353188693523407,
1556
+ "learning_rate": 8.369150431813617e-05,
1557
+ "loss": 0.0873355770111084,
1558
+ "mean_token_accuracy": 0.9668887314200402,
1559
+ "num_tokens": 26503987.0,
1560
+ "step": 6100
1561
+ },
1562
+ {
1563
+ "entropy": 0.08718796769157051,
1564
+ "epoch": 1.797369382535623,
1565
+ "grad_norm": 0.4751955270767212,
1566
+ "learning_rate": 8.268728660373569e-05,
1567
+ "loss": 0.08717143058776855,
1568
+ "mean_token_accuracy": 0.9682504817843437,
1569
+ "num_tokens": 26722694.0,
1570
+ "step": 6150
1571
+ },
1572
+ {
1573
+ "entropy": 0.08594496028497815,
1574
+ "epoch": 1.8119839240043842,
1575
+ "grad_norm": 0.3431340157985687,
1576
+ "learning_rate": 8.168306888933522e-05,
1577
+ "loss": 0.08702672004699707,
1578
+ "mean_token_accuracy": 0.9675016805529595,
1579
+ "num_tokens": 26940760.0,
1580
+ "step": 6200
1581
+ },
1582
+ {
1583
+ "epoch": 1.8119839240043842,
1584
+ "eval_entropy": 0.09019251664058636,
1585
+ "eval_loss": 0.11118555068969727,
1586
+ "eval_mean_token_accuracy": 0.9598824753599652,
1587
+ "eval_num_tokens": 26940760.0,
1588
+ "eval_runtime": 51.3016,
1589
+ "eval_samples_per_second": 22.962,
1590
+ "eval_steps_per_second": 5.75,
1591
+ "step": 6200
1592
+ },
1593
+ {
1594
+ "entropy": 0.0879617197997868,
1595
+ "epoch": 1.8265984654731457,
1596
+ "grad_norm": 0.3889070153236389,
1597
+ "learning_rate": 8.067885117493474e-05,
1598
+ "loss": 0.08638958930969239,
1599
+ "mean_token_accuracy": 0.9678712266683579,
1600
+ "num_tokens": 27156798.0,
1601
+ "step": 6250
1602
+ },
1603
+ {
1604
+ "entropy": 0.08402345498092473,
1605
+ "epoch": 1.8412130069419073,
1606
+ "grad_norm": 0.3556425869464874,
1607
+ "learning_rate": 7.967463346053424e-05,
1608
+ "loss": 0.08525685310363769,
1609
+ "mean_token_accuracy": 0.9692794454097747,
1610
+ "num_tokens": 27374733.0,
1611
+ "step": 6300
1612
+ },
1613
+ {
1614
+ "entropy": 0.08294867504388094,
1615
+ "epoch": 1.8558275484106685,
1616
+ "grad_norm": 0.31357839703559875,
1617
+ "learning_rate": 7.867041574613376e-05,
1618
+ "loss": 0.08585151672363281,
1619
+ "mean_token_accuracy": 0.968332688510418,
1620
+ "num_tokens": 27592971.0,
1621
+ "step": 6350
1622
+ },
1623
+ {
1624
+ "entropy": 0.08433418484404683,
1625
+ "epoch": 1.87044208987943,
1626
+ "grad_norm": 0.376997172832489,
1627
+ "learning_rate": 7.766619803173329e-05,
1628
+ "loss": 0.08210147857666016,
1629
+ "mean_token_accuracy": 0.9694547387957573,
1630
+ "num_tokens": 27809346.0,
1631
+ "step": 6400
1632
+ },
1633
+ {
1634
+ "epoch": 1.87044208987943,
1635
+ "eval_entropy": 0.08374374596623041,
1636
+ "eval_loss": 0.11078612506389618,
1637
+ "eval_mean_token_accuracy": 0.9607059201951754,
1638
+ "eval_num_tokens": 27809346.0,
1639
+ "eval_runtime": 51.3823,
1640
+ "eval_samples_per_second": 22.926,
1641
+ "eval_steps_per_second": 5.741,
1642
+ "step": 6400
1643
+ },
1644
+ {
1645
+ "entropy": 0.08094374425709247,
1646
+ "epoch": 1.8850566313481916,
1647
+ "grad_norm": 0.35051146149635315,
1648
+ "learning_rate": 7.666198031733281e-05,
1649
+ "loss": 0.08127692222595215,
1650
+ "mean_token_accuracy": 0.9706088775396347,
1651
+ "num_tokens": 28025421.0,
1652
+ "step": 6450
1653
+ },
1654
+ {
1655
+ "entropy": 0.08181249966844917,
1656
+ "epoch": 1.8996711728169529,
1657
+ "grad_norm": 0.361937016248703,
1658
+ "learning_rate": 7.565776260293231e-05,
1659
+ "loss": 0.08228342056274414,
1660
+ "mean_token_accuracy": 0.9692467513680458,
1661
+ "num_tokens": 28241427.0,
1662
+ "step": 6500
1663
+ },
1664
+ {
1665
+ "entropy": 0.0853189903870225,
1666
+ "epoch": 1.9142857142857141,
1667
+ "grad_norm": 0.4127114713191986,
1668
+ "learning_rate": 7.465354488853183e-05,
1669
+ "loss": 0.08898340225219727,
1670
+ "mean_token_accuracy": 0.9675960612297058,
1671
+ "num_tokens": 28459034.0,
1672
+ "step": 6550
1673
+ },
1674
+ {
1675
+ "entropy": 0.08330891110002994,
1676
+ "epoch": 1.9289002557544757,
1677
+ "grad_norm": 0.31873515248298645,
1678
+ "learning_rate": 7.364932717413136e-05,
1679
+ "loss": 0.0857757568359375,
1680
+ "mean_token_accuracy": 0.9681384879350662,
1681
+ "num_tokens": 28676875.0,
1682
+ "step": 6600
1683
+ },
1684
+ {
1685
+ "epoch": 1.9289002557544757,
1686
+ "eval_entropy": 0.08660914314500356,
1687
+ "eval_loss": 0.10761687159538269,
1688
+ "eval_mean_token_accuracy": 0.9621669098482294,
1689
+ "eval_num_tokens": 28676875.0,
1690
+ "eval_runtime": 51.5275,
1691
+ "eval_samples_per_second": 22.862,
1692
+ "eval_steps_per_second": 5.725,
1693
+ "step": 6600
1694
+ },
1695
+ {
1696
+ "entropy": 0.08828531488776208,
1697
+ "epoch": 1.9435147972232372,
1698
+ "grad_norm": 0.3040439486503601,
1699
+ "learning_rate": 7.264510945973088e-05,
1700
+ "loss": 0.08551553726196288,
1701
+ "mean_token_accuracy": 0.9684215313196183,
1702
+ "num_tokens": 28894213.0,
1703
+ "step": 6650
1704
+ },
1705
+ {
1706
+ "entropy": 0.08436274753883481,
1707
+ "epoch": 1.9581293386919985,
1708
+ "grad_norm": 0.3856823742389679,
1709
+ "learning_rate": 7.16408917453304e-05,
1710
+ "loss": 0.08532014846801758,
1711
+ "mean_token_accuracy": 0.9674273264408112,
1712
+ "num_tokens": 29111328.0,
1713
+ "step": 6700
1714
+ },
1715
+ {
1716
+ "entropy": 0.08388302940875292,
1717
+ "epoch": 1.97274388016076,
1718
+ "grad_norm": 0.3501090407371521,
1719
+ "learning_rate": 7.06366740309299e-05,
1720
+ "loss": 0.08266093254089356,
1721
+ "mean_token_accuracy": 0.9687711641192436,
1722
+ "num_tokens": 29328355.0,
1723
+ "step": 6750
1724
+ },
1725
+ {
1726
+ "entropy": 0.08621805243194103,
1727
+ "epoch": 1.9873584216295215,
1728
+ "grad_norm": 0.3734675347805023,
1729
+ "learning_rate": 6.963245631652943e-05,
1730
+ "loss": 0.08826584815979004,
1731
+ "mean_token_accuracy": 0.9675416949391366,
1732
+ "num_tokens": 29546388.0,
1733
+ "step": 6800
1734
+ },
1735
+ {
1736
+ "epoch": 1.9873584216295215,
1737
+ "eval_entropy": 0.08420832851680658,
1738
+ "eval_loss": 0.10720802843570709,
1739
+ "eval_mean_token_accuracy": 0.9616350175970692,
1740
+ "eval_num_tokens": 29546388.0,
1741
+ "eval_runtime": 51.2571,
1742
+ "eval_samples_per_second": 22.982,
1743
+ "eval_steps_per_second": 5.755,
1744
+ "step": 6800
1745
+ },
1746
+ {
1747
+ "entropy": 0.08057132030501583,
1748
+ "epoch": 2.0017537449762512,
1749
+ "grad_norm": 0.25122901797294617,
1750
+ "learning_rate": 6.862823860212895e-05,
1751
+ "loss": 0.08081165313720703,
1752
+ "mean_token_accuracy": 0.9702659373356001,
1753
+ "num_tokens": 29759753.0,
1754
+ "step": 6850
1755
+ },
1756
+ {
1757
+ "entropy": 0.0640625470969826,
1758
+ "epoch": 2.016368286445013,
1759
+ "grad_norm": 0.2220752090215683,
1760
+ "learning_rate": 6.762402088772847e-05,
1761
+ "loss": 0.053548240661621095,
1762
+ "mean_token_accuracy": 0.9798859319090844,
1763
+ "num_tokens": 29977507.0,
1764
+ "step": 6900
1765
+ },
1766
+ {
1767
+ "entropy": 0.05466210062615574,
1768
+ "epoch": 2.0309828279137743,
1769
+ "grad_norm": 0.3461098074913025,
1770
+ "learning_rate": 6.661980317332798e-05,
1771
+ "loss": 0.049960670471191404,
1772
+ "mean_token_accuracy": 0.9817683389782905,
1773
+ "num_tokens": 30194924.0,
1774
+ "step": 6950
1775
+ },
1776
+ {
1777
+ "entropy": 0.05153279748279602,
1778
+ "epoch": 2.0455973693825356,
1779
+ "grad_norm": 0.4181481897830963,
1780
+ "learning_rate": 6.56155854589275e-05,
1781
+ "loss": 0.05096799373626709,
1782
+ "mean_token_accuracy": 0.9809333425760269,
1783
+ "num_tokens": 30411745.0,
1784
+ "step": 7000
1785
+ },
1786
+ {
1787
+ "epoch": 2.0455973693825356,
1788
+ "eval_entropy": 0.05856578930486309,
1789
+ "eval_loss": 0.128422349691391,
1790
+ "eval_mean_token_accuracy": 0.9615406414209786,
1791
+ "eval_num_tokens": 30411745.0,
1792
+ "eval_runtime": 51.3762,
1793
+ "eval_samples_per_second": 22.929,
1794
+ "eval_steps_per_second": 5.742,
1795
+ "step": 7000
1796
+ },
1797
+ {
1798
+ "entropy": 0.048330898359417916,
1799
+ "epoch": 2.060211910851297,
1800
+ "grad_norm": 0.2673610746860504,
1801
+ "learning_rate": 6.461136774452702e-05,
1802
+ "loss": 0.04616006374359131,
1803
+ "mean_token_accuracy": 0.9836411371827125,
1804
+ "num_tokens": 30627471.0,
1805
+ "step": 7050
1806
+ },
1807
+ {
1808
+ "entropy": 0.05090990305878222,
1809
+ "epoch": 2.0748264523200586,
1810
+ "grad_norm": 0.37639951705932617,
1811
+ "learning_rate": 6.360715003012654e-05,
1812
+ "loss": 0.04985607624053955,
1813
+ "mean_token_accuracy": 0.9822920462489129,
1814
+ "num_tokens": 30845376.0,
1815
+ "step": 7100
1816
+ },
1817
+ {
1818
+ "entropy": 0.049039122625254096,
1819
+ "epoch": 2.08944099378882,
1820
+ "grad_norm": 0.28891128301620483,
1821
+ "learning_rate": 6.260293231572605e-05,
1822
+ "loss": 0.04553122997283936,
1823
+ "mean_token_accuracy": 0.9838429951667785,
1824
+ "num_tokens": 31062649.0,
1825
+ "step": 7150
1826
+ },
1827
+ {
1828
+ "entropy": 0.04845839339308441,
1829
+ "epoch": 2.104055535257581,
1830
+ "grad_norm": 0.37833932042121887,
1831
+ "learning_rate": 6.159871460132557e-05,
1832
+ "loss": 0.04832898139953613,
1833
+ "mean_token_accuracy": 0.9824651059508324,
1834
+ "num_tokens": 31279048.0,
1835
+ "step": 7200
1836
+ },
1837
+ {
1838
+ "epoch": 2.104055535257581,
1839
+ "eval_entropy": 0.05895731328844519,
1840
+ "eval_loss": 0.1306932121515274,
1841
+ "eval_mean_token_accuracy": 0.9612127061617577,
1842
+ "eval_num_tokens": 31279048.0,
1843
+ "eval_runtime": 51.5427,
1844
+ "eval_samples_per_second": 22.855,
1845
+ "eval_steps_per_second": 5.723,
1846
+ "step": 7200
1847
+ },
1848
+ {
1849
+ "entropy": 0.05211819554679096,
1850
+ "epoch": 2.118670076726343,
1851
+ "grad_norm": 0.36787164211273193,
1852
+ "learning_rate": 6.059449688692509e-05,
1853
+ "loss": 0.0502163028717041,
1854
+ "mean_token_accuracy": 0.9812204048037529,
1855
+ "num_tokens": 31496006.0,
1856
+ "step": 7250
1857
+ },
1858
+ {
1859
+ "entropy": 0.047373109618201854,
1860
+ "epoch": 2.133284618195104,
1861
+ "grad_norm": 0.3374268114566803,
1862
+ "learning_rate": 5.959027917252461e-05,
1863
+ "loss": 0.04724916934967041,
1864
+ "mean_token_accuracy": 0.9817435780167579,
1865
+ "num_tokens": 31713707.0,
1866
+ "step": 7300
1867
+ },
1868
+ {
1869
+ "entropy": 0.0479678925126791,
1870
+ "epoch": 2.1478991596638655,
1871
+ "grad_norm": 0.21644751727581024,
1872
+ "learning_rate": 5.858606145812412e-05,
1873
+ "loss": 0.046577134132385255,
1874
+ "mean_token_accuracy": 0.9833640906214715,
1875
+ "num_tokens": 31931335.0,
1876
+ "step": 7350
1877
+ },
1878
+ {
1879
+ "entropy": 0.04867122542113066,
1880
+ "epoch": 2.162513701132627,
1881
+ "grad_norm": 0.4094817340373993,
1882
+ "learning_rate": 5.758184374372364e-05,
1883
+ "loss": 0.047378678321838376,
1884
+ "mean_token_accuracy": 0.9824044448137284,
1885
+ "num_tokens": 32149008.0,
1886
+ "step": 7400
1887
+ },
1888
+ {
1889
+ "epoch": 2.162513701132627,
1890
+ "eval_entropy": 0.058307369441677956,
1891
+ "eval_loss": 0.1280326098203659,
1892
+ "eval_mean_token_accuracy": 0.9618316363480132,
1893
+ "eval_num_tokens": 32149008.0,
1894
+ "eval_runtime": 51.2281,
1895
+ "eval_samples_per_second": 22.995,
1896
+ "eval_steps_per_second": 5.759,
1897
+ "step": 7400
1898
+ },
1899
+ {
1900
+ "entropy": 0.04640938185621053,
1901
+ "epoch": 2.1771282426013885,
1902
+ "grad_norm": 0.7977092266082764,
1903
+ "learning_rate": 5.657762602932316e-05,
1904
+ "loss": 0.045011258125305174,
1905
+ "mean_token_accuracy": 0.9833449149131774,
1906
+ "num_tokens": 32365330.0,
1907
+ "step": 7450
1908
+ },
1909
+ {
1910
+ "entropy": 0.046531920516863466,
1911
+ "epoch": 2.1917427840701498,
1912
+ "grad_norm": 0.4321069121360779,
1913
+ "learning_rate": 5.557340831492268e-05,
1914
+ "loss": 0.046553001403808594,
1915
+ "mean_token_accuracy": 0.9836733216047286,
1916
+ "num_tokens": 32582571.0,
1917
+ "step": 7500
1918
+ },
1919
+ {
1920
+ "entropy": 0.04584709240123629,
1921
+ "epoch": 2.206357325538911,
1922
+ "grad_norm": 0.39226505160331726,
1923
+ "learning_rate": 5.4569190600522194e-05,
1924
+ "loss": 0.04660297393798828,
1925
+ "mean_token_accuracy": 0.9831815731525421,
1926
+ "num_tokens": 32798927.0,
1927
+ "step": 7550
1928
+ },
1929
+ {
1930
+ "entropy": 0.051464518043212594,
1931
+ "epoch": 2.220971867007673,
1932
+ "grad_norm": 0.5300610661506653,
1933
+ "learning_rate": 5.356497288612171e-05,
1934
+ "loss": 0.049462013244628907,
1935
+ "mean_token_accuracy": 0.9828921148180961,
1936
+ "num_tokens": 33017400.0,
1937
+ "step": 7600
1938
+ },
1939
+ {
1940
+ "epoch": 2.220971867007673,
1941
+ "eval_entropy": 0.054104896524321225,
1942
+ "eval_loss": 0.1346907615661621,
1943
+ "eval_mean_token_accuracy": 0.9608211775957528,
1944
+ "eval_num_tokens": 33017400.0,
1945
+ "eval_runtime": 51.5259,
1946
+ "eval_samples_per_second": 22.862,
1947
+ "eval_steps_per_second": 5.725,
1948
+ "step": 7600
1949
+ },
1950
+ {
1951
+ "entropy": 0.044908167165704074,
1952
+ "epoch": 2.235586408476434,
1953
+ "grad_norm": 0.5431990623474121,
1954
+ "learning_rate": 5.256075517172123e-05,
1955
+ "loss": 0.0420997953414917,
1956
+ "mean_token_accuracy": 0.9843368935585022,
1957
+ "num_tokens": 33233710.0,
1958
+ "step": 7650
1959
+ },
1960
+ {
1961
+ "entropy": 0.047161051160655915,
1962
+ "epoch": 2.2502009499451954,
1963
+ "grad_norm": 0.3964262306690216,
1964
+ "learning_rate": 5.1556537457320754e-05,
1965
+ "loss": 0.047385578155517576,
1966
+ "mean_token_accuracy": 0.9828732433915138,
1967
+ "num_tokens": 33451237.0,
1968
+ "step": 7700
1969
+ },
1970
+ {
1971
+ "entropy": 0.04588393676560372,
1972
+ "epoch": 2.264815491413957,
1973
+ "grad_norm": 0.3231643736362457,
1974
+ "learning_rate": 5.0552319742920264e-05,
1975
+ "loss": 0.04522655963897705,
1976
+ "mean_token_accuracy": 0.9838127914071083,
1977
+ "num_tokens": 33667691.0,
1978
+ "step": 7750
1979
+ },
1980
+ {
1981
+ "entropy": 0.04474953535944223,
1982
+ "epoch": 2.2794300328827184,
1983
+ "grad_norm": 0.3903498947620392,
1984
+ "learning_rate": 4.954810202851978e-05,
1985
+ "loss": 0.04430769443511963,
1986
+ "mean_token_accuracy": 0.9832708036899567,
1987
+ "num_tokens": 33885773.0,
1988
+ "step": 7800
1989
+ },
1990
+ {
1991
+ "epoch": 2.2794300328827184,
1992
+ "eval_entropy": 0.05170546539948653,
1993
+ "eval_loss": 0.13600485026836395,
1994
+ "eval_mean_token_accuracy": 0.9620883953773369,
1995
+ "eval_num_tokens": 33885773.0,
1996
+ "eval_runtime": 52.0353,
1997
+ "eval_samples_per_second": 22.638,
1998
+ "eval_steps_per_second": 5.669,
1999
+ "step": 7800
2000
+ },
2001
+ {
2002
+ "entropy": 0.048666532533243295,
2003
+ "epoch": 2.2940445743514797,
2004
+ "grad_norm": 0.35318806767463684,
2005
+ "learning_rate": 4.8543884314119306e-05,
2006
+ "loss": 0.05026057243347168,
2007
+ "mean_token_accuracy": 0.9809833306074143,
2008
+ "num_tokens": 34103219.0,
2009
+ "step": 7850
2010
+ },
2011
+ {
2012
+ "entropy": 0.044851412964053455,
2013
+ "epoch": 2.308659115820241,
2014
+ "grad_norm": 0.3726493716239929,
2015
+ "learning_rate": 4.7539666599718824e-05,
2016
+ "loss": 0.042955965995788575,
2017
+ "mean_token_accuracy": 0.9849131184816361,
2018
+ "num_tokens": 34320418.0,
2019
+ "step": 7900
2020
+ },
2021
+ {
2022
+ "entropy": 0.04522866520099342,
2023
+ "epoch": 2.3232736572890027,
2024
+ "grad_norm": 0.27043774724006653,
2025
+ "learning_rate": 4.653544888531834e-05,
2026
+ "loss": 0.046865167617797854,
2027
+ "mean_token_accuracy": 0.9826881098747253,
2028
+ "num_tokens": 34538564.0,
2029
+ "step": 7950
2030
+ },
2031
+ {
2032
+ "entropy": 0.04482917439658195,
2033
+ "epoch": 2.337888198757764,
2034
+ "grad_norm": 0.43633177876472473,
2035
+ "learning_rate": 4.553123117091786e-05,
2036
+ "loss": 0.044361419677734375,
2037
+ "mean_token_accuracy": 0.983955349624157,
2038
+ "num_tokens": 34754870.0,
2039
+ "step": 8000
2040
+ },
2041
+ {
2042
+ "epoch": 2.337888198757764,
2043
+ "eval_entropy": 0.05105202936141168,
2044
+ "eval_loss": 0.14225418865680695,
2045
+ "eval_mean_token_accuracy": 0.9614736490330453,
2046
+ "eval_num_tokens": 34754870.0,
2047
+ "eval_runtime": 52.0382,
2048
+ "eval_samples_per_second": 22.637,
2049
+ "eval_steps_per_second": 5.669,
2050
+ "step": 8000
2051
+ }
2052
+ ],
2053
+ "logging_steps": 50,
2054
+ "max_steps": 10266,
2055
+ "num_input_tokens_seen": 0,
2056
+ "num_train_epochs": 3,
2057
+ "save_steps": 200,
2058
+ "stateful_callbacks": {
2059
+ "TrainerControl": {
2060
+ "args": {
2061
+ "should_epoch_stop": false,
2062
+ "should_evaluate": false,
2063
+ "should_log": false,
2064
+ "should_save": true,
2065
+ "should_training_stop": false
2066
+ },
2067
+ "attributes": {}
2068
+ }
2069
+ },
2070
+ "total_flos": 8.613426021666648e+17,
2071
+ "train_batch_size": 4,
2072
+ "trial_name": null,
2073
+ "trial_params": null
2074
+ }
checkpoint-8000/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a62e955b4a049523c45a1102ae6e2f9b52bf056eeb0fc0b8d413459417f3ac39
3
+ size 5841