jumafernandez commited on
Commit
4d260f9
·
verified ·
1 Parent(s): 44301c0

publish trace-repro-lite-ar-s123-xlc-scratch

Browse files
trace-repro-lite-ar-s123-xlc-scratch/best/config.json ADDED
@@ -0,0 +1,19 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "input_dim": 768,
3
+ "hidden_dim": 768,
4
+ "output_dim": 768,
5
+ "num_layers": 6,
6
+ "num_heads": 8,
7
+ "dropout": 0.1,
8
+ "max_turns": 64,
9
+ "attention_mode": "autoregressive",
10
+ "use_speaker_embeddings": true,
11
+ "num_speakers": 4,
12
+ "layer_norm": true,
13
+ "ff_dim": 3072,
14
+ "activation": "gelu",
15
+ "output_residual": false,
16
+ "arch": "v2",
17
+ "head_mode": "tied_continuous",
18
+ "head_transform": true
19
+ }
trace-repro-lite-ar-s123-xlc-scratch/best/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9bd3951032052016583e025059aeeca87b17fafc88d4f5e4cab8dc0bd7f76ca7
3
+ size 179808064
trace-repro-lite-ar-s123-xlc-scratch/config.json ADDED
@@ -0,0 +1,19 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "input_dim": 768,
3
+ "hidden_dim": 768,
4
+ "output_dim": 768,
5
+ "num_layers": 6,
6
+ "num_heads": 8,
7
+ "dropout": 0.1,
8
+ "max_turns": 64,
9
+ "attention_mode": "autoregressive",
10
+ "use_speaker_embeddings": true,
11
+ "num_speakers": 4,
12
+ "layer_norm": true,
13
+ "ff_dim": 3072,
14
+ "activation": "gelu",
15
+ "output_residual": false,
16
+ "arch": "v2",
17
+ "head_mode": "tied_continuous",
18
+ "head_transform": true
19
+ }
trace-repro-lite-ar-s123-xlc-scratch/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ad41382ba01e9afe3215398d305668b6579f7061ea759af33729f8ea94e653de
3
+ size 179808064
trace-repro-lite-ar-s123-xlc-scratch/trainlog.jsonl ADDED
@@ -0,0 +1,7 @@
 
 
 
 
 
 
 
 
1
+ {"model": "lite", "mode": "ar", "seed": 123, "lr": 0.0001, "canary": false, "init": "/home/jfernandez/trace/models/contextual-turn-encoder-base-lite-ar-xlc-tm-seed123-repro-scr/best", "epoch": 1, "train_loss": 3.90708, "val_loss": 4.93175, "epoch_sec": 367.9}
2
+ {"model": "lite", "mode": "ar", "seed": 123, "lr": 0.0001, "canary": false, "init": "/home/jfernandez/trace/models/contextual-turn-encoder-base-lite-ar-xlc-tm-seed123-repro-scr/best", "epoch": 2, "train_loss": 3.27616, "val_loss": 4.742, "epoch_sec": 120.1}
3
+ {"model": "lite", "mode": "ar", "seed": 123, "lr": 0.0001, "canary": false, "init": "/home/jfernandez/trace/models/contextual-turn-encoder-base-lite-ar-xlc-tm-seed123-repro-scr/best", "epoch": 3, "train_loss": 2.94258, "val_loss": 4.64295, "epoch_sec": 120.1}
4
+ {"model": "lite", "mode": "ar", "seed": 123, "lr": 0.0001, "canary": false, "init": "/home/jfernandez/trace/models/contextual-turn-encoder-base-lite-ar-xlc-tm-seed123-repro-scr/best", "epoch": 4, "train_loss": 2.65047, "val_loss": 4.61745, "epoch_sec": 120.1}
5
+ {"model": "lite", "mode": "ar", "seed": 123, "lr": 0.0001, "canary": false, "init": "/home/jfernandez/trace/models/contextual-turn-encoder-base-lite-ar-xlc-tm-seed123-repro-scr/best", "epoch": 5, "train_loss": 2.39869, "val_loss": 4.60841, "epoch_sec": 120.0}
6
+ {"model": "lite", "mode": "ar", "seed": 123, "lr": 0.0001, "canary": false, "init": "/home/jfernandez/trace/models/contextual-turn-encoder-base-lite-ar-xlc-tm-seed123-repro-scr/best", "epoch": 6, "train_loss": 2.18106, "val_loss": 4.62618, "epoch_sec": 120.2}
7
+ {"model": "lite", "mode": "ar", "seed": 123, "lr": 0.0001, "canary": false, "init": "/home/jfernandez/trace/models/contextual-turn-encoder-base-lite-ar-xlc-tm-seed123-repro-scr/best", "epoch": 7, "train_loss": 1.99319, "val_loss": 4.66183, "epoch_sec": 119.1}