File size: 1,320 Bytes
7b592f7 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 | """
Single source of truth for special token IDs used by the audio-enhanced GPT.
Both `cons_online_data.py` and `cons_offline_data.py` import from here so
that any change to a token id propagates everywhere.
"""
# === Vocabulary layout ===
VOCAB_SHIFT = 151600
# === Role / segment markers ===
USER = VOCAB_SHIFT + 1
ASSISTANT = VOCAB_SHIFT + 2
TEXT_BEGIN = 151644
TEXT_END = 151643
SYSTEM = TEXT_BEGIN # 151644 β same id used as both turn separator and system marker
# === Audio markers ===
AUDIO_BEGIN = 151647
AUDIO_END = 151648
AUDIO_PAD = 151646
# === Control / padding ===
PAD = VOCAB_SHIFT + 8
MASK = -100
KEEP_SILENCE = VOCAB_SHIFT + 5
# === Task mode (offline batch vs online streaming) ===
ONLINE = VOCAB_SHIFT + 9
OFFLINE = VOCAB_SHIFT + 10
# === Language tag ===
ENGLISH = VOCAB_SHIFT + 11
# === Emotion tags (online only) ===
HAPPY = VOCAB_SHIFT + 14
SAD = VOCAB_SHIFT + 15
ANGRY = VOCAB_SHIFT + 16
SURPRISE = VOCAB_SHIFT + 17
NORMAL = VOCAB_SHIFT + 18
URGENT = VOCAB_SHIFT + 19
EMOTION_TO_ID = {
"surprise": SURPRISE,
"happy": HAPPY,
"normal": NORMAL,
"sad": SAD,
"angry": ANGRY,
"urgent": URGENT,
}
HAPPY_SMILE = "π"
SAD_CRY = "π’"
ANGRY_MAD = "π "
SURPRISE_WOW = "π²"
NORMAL_NEUTRAL = "π"
URGENT_WARNING = "β οΈ"
|