File size: 1,320 Bytes
7b592f7
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
"""
Single source of truth for special token IDs used by the audio-enhanced GPT.

Both `cons_online_data.py` and `cons_offline_data.py` import from here so
that any change to a token id propagates everywhere.
"""

# === Vocabulary layout ===
VOCAB_SHIFT = 151600

# === Role / segment markers ===
USER = VOCAB_SHIFT + 1
ASSISTANT = VOCAB_SHIFT + 2

TEXT_BEGIN = 151644
TEXT_END = 151643
SYSTEM = TEXT_BEGIN  # 151644 β€” same id used as both turn separator and system marker

# === Audio markers ===
AUDIO_BEGIN = 151647
AUDIO_END = 151648
AUDIO_PAD = 151646

# === Control / padding ===
PAD = VOCAB_SHIFT + 8
MASK = -100
KEEP_SILENCE = VOCAB_SHIFT + 5

# === Task mode (offline batch vs online streaming) ===
ONLINE = VOCAB_SHIFT + 9
OFFLINE = VOCAB_SHIFT + 10

# === Language tag ===
ENGLISH = VOCAB_SHIFT + 11

# === Emotion tags (online only) ===
HAPPY = VOCAB_SHIFT + 14
SAD = VOCAB_SHIFT + 15
ANGRY = VOCAB_SHIFT + 16
SURPRISE = VOCAB_SHIFT + 17
NORMAL = VOCAB_SHIFT + 18
URGENT = VOCAB_SHIFT + 19

EMOTION_TO_ID = {
    "surprise": SURPRISE,
    "happy":    HAPPY,
    "normal":   NORMAL,
    "sad":      SAD,
    "angry":    ANGRY,
    "urgent":   URGENT,
}


HAPPY_SMILE     = "😊"
SAD_CRY         = "😒"
ANGRY_MAD       = "😠"
SURPRISE_WOW    = "😲"
NORMAL_NEUTRAL  = "😐"
URGENT_WARNING  = "⚠️"