jumafernandez commited on
Commit
e50699d
·
verified ·
1 Parent(s): eccb70f

backup contextual-turn-encoder-base-lite-bidi-full

Browse files
contextual-turn-encoder-base-lite-bidi-full/best/config.json ADDED
@@ -0,0 +1,19 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "input_dim": 768,
3
+ "hidden_dim": 768,
4
+ "output_dim": 768,
5
+ "num_layers": 6,
6
+ "num_heads": 8,
7
+ "dropout": 0.1,
8
+ "max_turns": 64,
9
+ "attention_mode": "bidirectional",
10
+ "use_speaker_embeddings": true,
11
+ "num_speakers": 4,
12
+ "layer_norm": true,
13
+ "ff_dim": 3072,
14
+ "activation": "gelu",
15
+ "output_residual": true,
16
+ "arch": "v2",
17
+ "head_mode": "tied_continuous",
18
+ "head_transform": true
19
+ }
contextual-turn-encoder-base-lite-bidi-full/best/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:edeb7642dc377e93f33e4ce9c0f9e7b85ad8eb8f208fa3dfc1198ddeb6917c56
3
+ size 179808064
contextual-turn-encoder-base-lite-bidi-full/best/training_args.json ADDED
@@ -0,0 +1,8 @@
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "arch": "v2",
3
+ "mode": "bidirectional",
4
+ "epoch": 11,
5
+ "train_loss": 0.41652,
6
+ "val_loss": 2.84498,
7
+ "epoch_sec": 918.6
8
+ }
contextual-turn-encoder-base-lite-bidi-full/config.json ADDED
@@ -0,0 +1,19 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "input_dim": 768,
3
+ "hidden_dim": 768,
4
+ "output_dim": 768,
5
+ "num_layers": 6,
6
+ "num_heads": 8,
7
+ "dropout": 0.1,
8
+ "max_turns": 64,
9
+ "attention_mode": "bidirectional",
10
+ "use_speaker_embeddings": true,
11
+ "num_speakers": 4,
12
+ "layer_norm": true,
13
+ "ff_dim": 3072,
14
+ "activation": "gelu",
15
+ "output_residual": true,
16
+ "arch": "v2",
17
+ "head_mode": "tied_continuous",
18
+ "head_transform": true
19
+ }
contextual-turn-encoder-base-lite-bidi-full/config.yaml ADDED
@@ -0,0 +1,66 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ model:
2
+ input_dim: 768
3
+ hidden_dim: 768
4
+ output_dim: 768
5
+ num_layers: 6
6
+ num_heads: 8
7
+ dropout: 0.1
8
+ max_turns: 64
9
+ attention_mode: bidirectional
10
+ use_speaker_embeddings: true
11
+ num_speakers: 4
12
+ layer_norm: true
13
+ ff_dim: 3072
14
+ activation: gelu
15
+ output_residual: true
16
+ arch: v2
17
+ head_mode: tied_continuous
18
+ head_transform: true
19
+ losses:
20
+ masked_reconstruction:
21
+ enabled: null
22
+ mask_prob: 0.15
23
+ weight: 1.0
24
+ next_turn_prediction:
25
+ enabled: null
26
+ weight: 1.0
27
+ embedding_retrieval:
28
+ enabled: true
29
+ weight: 1.0
30
+ temperature: 0.07
31
+ normalize: true
32
+ candidate_mode: in_batch
33
+ target: auto
34
+ lambda_cosine: 1.0
35
+ training:
36
+ seed: 42
37
+ batch_size: 128
38
+ epochs: 15
39
+ learning_rate: 0.0002
40
+ weight_decay: 0.01
41
+ warmup_ratio: 0.05
42
+ gradient_clip_norm: 1.0
43
+ device: mps
44
+ mixed_precision: false
45
+ num_workers: 0
46
+ log_interval: 100
47
+ output_dir: models/contextual-turn-encoder-base
48
+ data:
49
+ path: null
50
+ max_turns: 64
51
+ window: truncate
52
+ stride: 32
53
+ dialogue_id_col: dialogue_id
54
+ turn_id_col: turn_id
55
+ utterance_col: utterance
56
+ speaker_col: speaker
57
+ embedding_col: embedding
58
+ speaker_map: null
59
+ base_encoder:
60
+ model_name: sergioburdisso/dialog2flow-joint-bert-base
61
+ backend: sentence_transformers
62
+ batch_size: 64
63
+ normalize: false
64
+ freeze: true
65
+ device: auto
66
+ cache_dir: null
contextual-turn-encoder-base-lite-bidi-full/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:61e07b1f5f6445ffe0caa945b7ded92ef870691923b6eb0c1fad1270eecb988a
3
+ size 179808064
contextual-turn-encoder-base-lite-bidi-full/training_args.json ADDED
@@ -0,0 +1,8 @@
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "arch": "v2",
3
+ "mode": "bidirectional",
4
+ "epoch": 15,
5
+ "train_loss": 0.29313,
6
+ "val_loss": 2.85316,
7
+ "epoch_sec": 899.5
8
+ }
contextual-turn-encoder-base-lite-bidi-full/trainlog.jsonl ADDED
@@ -0,0 +1,15 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {"arch": "v2", "mode": "bidirectional", "epoch": 1, "train_loss": 3.29382, "val_loss": 3.6867, "epoch_sec": 1050.6}
2
+ {"arch": "v2", "mode": "bidirectional", "epoch": 2, "train_loss": 2.33961, "val_loss": 3.24572, "epoch_sec": 1155.6}
3
+ {"arch": "v2", "mode": "bidirectional", "epoch": 3, "train_loss": 1.85397, "val_loss": 3.00495, "epoch_sec": 950.9}
4
+ {"arch": "v2", "mode": "bidirectional", "epoch": 4, "train_loss": 1.50441, "val_loss": 2.92765, "epoch_sec": 905.6}
5
+ {"arch": "v2", "mode": "bidirectional", "epoch": 5, "train_loss": 1.22799, "val_loss": 2.9019, "epoch_sec": 946.5}
6
+ {"arch": "v2", "mode": "bidirectional", "epoch": 6, "train_loss": 1.00536, "val_loss": 2.90056, "epoch_sec": 913.7}
7
+ {"arch": "v2", "mode": "bidirectional", "epoch": 7, "train_loss": 0.82941, "val_loss": 2.91215, "epoch_sec": 919.2}
8
+ {"arch": "v2", "mode": "bidirectional", "epoch": 8, "train_loss": 0.68773, "val_loss": 2.8756, "epoch_sec": 905.9}
9
+ {"arch": "v2", "mode": "bidirectional", "epoch": 9, "train_loss": 0.57565, "val_loss": 2.88066, "epoch_sec": 924.9}
10
+ {"arch": "v2", "mode": "bidirectional", "epoch": 10, "train_loss": 0.4866, "val_loss": 2.87642, "epoch_sec": 901.8}
11
+ {"arch": "v2", "mode": "bidirectional", "epoch": 11, "train_loss": 0.41652, "val_loss": 2.84498, "epoch_sec": 918.6}
12
+ {"arch": "v2", "mode": "bidirectional", "epoch": 12, "train_loss": 0.36512, "val_loss": 2.86164, "epoch_sec": 899.1}
13
+ {"arch": "v2", "mode": "bidirectional", "epoch": 13, "train_loss": 0.32902, "val_loss": 2.84941, "epoch_sec": 910.0}
14
+ {"arch": "v2", "mode": "bidirectional", "epoch": 14, "train_loss": 0.30566, "val_loss": 2.85103, "epoch_sec": 903.2}
15
+ {"arch": "v2", "mode": "bidirectional", "epoch": 15, "train_loss": 0.29313, "val_loss": 2.85316, "epoch_sec": 899.5}