File size: 4,017 Bytes
f58d80a
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
{
  "iterations": 3200,
  "parameter_count": 29630976,
  "tokens_per_step": 65536,
  "processed_tokens": 209715200,
  "elapsed_seconds": 1039.6968399565667,
  "best_validation_loss": 4.693336009979248,
  "history": [
    {
      "iteration": 200,
      "train_loss": 6.874281406402588,
      "validation_loss": 6.851297378540039,
      "learning_rate": 0.0005986422613134286,
      "elapsed_seconds": 63.88019962795079
    },
    {
      "iteration": 400,
      "train_loss": 5.891294479370117,
      "validation_loss": 5.937683582305908,
      "learning_rate": 0.0005876993794374133,
      "elapsed_seconds": 128.35756858997047
    },
    {
      "iteration": 600,
      "train_loss": 5.376547813415527,
      "validation_loss": 5.505178451538086,
      "learning_rate": 0.0005662062546888388,
      "elapsed_seconds": 192.76678066514432
    },
    {
      "iteration": 800,
      "train_loss": 5.047382354736328,
      "validation_loss": 5.2386860847473145,
      "learning_rate": 0.0005350428181202468,
      "elapsed_seconds": 257.3545547667891
    },
    {
      "iteration": 1000,
      "train_loss": 4.829380989074707,
      "validation_loss": 5.086492538452148,
      "learning_rate": 0.0004954849044863036,
      "elapsed_seconds": 321.76191609352827
    },
    {
      "iteration": 1200,
      "train_loss": 4.650263786315918,
      "validation_loss": 4.960005283355713,
      "learning_rate": 0.0004491520194190405,
      "elapsed_seconds": 386.7139264252037
    },
    {
      "iteration": 1400,
      "train_loss": 4.50961446762085,
      "validation_loss": 4.872649669647217,
      "learning_rate": 0.0003979410366769941,
      "elapsed_seconds": 451.70882767252624
    },
    {
      "iteration": 1600,
      "train_loss": 4.388186931610107,
      "validation_loss": 4.814062118530273,
      "learning_rate": 0.0003439485399106587,
      "elapsed_seconds": 516.5635145176202
    },
    {
      "iteration": 1800,
      "train_loss": 4.287715435028076,
      "validation_loss": 4.772805690765381,
      "learning_rate": 0.00028938498828149706,
      "elapsed_seconds": 581.7271312791854
    },
    {
      "iteration": 2000,
      "train_loss": 4.204434871673584,
      "validation_loss": 4.740018844604492,
      "learning_rate": 0.00023648422000415223,
      "elapsed_seconds": 646.7632373739034
    },
    {
      "iteration": 2200,
      "train_loss": 4.136469841003418,
      "validation_loss": 4.717632293701172,
      "learning_rate": 0.0001874119987474749,
      "elapsed_seconds": 711.0149517673999
    },
    {
      "iteration": 2400,
      "train_loss": 4.068326473236084,
      "validation_loss": 4.712490558624268,
      "learning_rate": 0.0001441773470154548,
      "elapsed_seconds": 776.0104932170361
    },
    {
      "iteration": 2600,
      "train_loss": 4.019182205200195,
      "validation_loss": 4.69955587387085,
      "learning_rate": 0.00010855029652985661,
      "elapsed_seconds": 841.718034747988
    },
    {
      "iteration": 2800,
      "train_loss": 3.980391263961792,
      "validation_loss": 4.69523811340332,
      "learning_rate": 8.198942292356145e-05,
      "elapsed_seconds": 907.1116172447801
    },
    {
      "iteration": 3000,
      "train_loss": 3.948561191558838,
      "validation_loss": 4.693336009979248,
      "learning_rate": 6.558213148278118e-05,
      "elapsed_seconds": 971.7278313729912
    },
    {
      "iteration": 3200,
      "train_loss": 3.918356418609619,
      "validation_loss": 4.693871021270752,
      "learning_rate": 6.0000138646876194e-05,
      "elapsed_seconds": 1036.9277061484754
    }
  ],
  "environment": {
    "python": "3.11.10",
    "platform": "Linux-5.15.0-107-generic-x86_64-with-glibc2.35",
    "torch": "2.5.1+cu124",
    "cuda": "12.4",
    "gpu": "NVIDIA RTX A5000"
  },
  "data_manifest_sha256": "41a2e024d3c6b7f575e70a291cdb12e131c7ecb6dd2cf0c56491f2789ce7ca77",
  "peak_vram_bytes": 2612344832,
  "gpu_total_bytes": 25293946880,
  "gpu_hourly_usd": 0.27,
  "estimated_training_cost_usd": 0.0779772629967425
}