File size: 1,297 Bytes
92c7321 91a3777 c6bc767 2c87b68 91a3777 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 | from models.lm.config import LMConfig
class VAMConfig(LMConfig):
model_type = "omni-o"
def __init__(self, **kwargs):
super().__init__(**kwargs)
self.num_talker_hidden_layers = kwargs.get("num_talker_hidden_layers", 4)
self.talker_hidden_size = kwargs.get("talker_hidden_size", 768)
self.audio_ids = kwargs.get("audio_ids", [16])
self.audio_special_token = kwargs.get("audio_special_token", "<|audio_pad|>")
self.audio_hidden_size = kwargs.get("audio_hidden_size", 512)
self.audio_vocab_size = kwargs.get("audio_vocab_size", 2112)
self.audio_pad_token = kwargs.get("audio_pad_token", 2049)
self.audio_stop_token = kwargs.get("audio_stop_token", 2050)
self.audio_spk_token = kwargs.get("audio_spk_token", 2051)
self.spk_emb_size = kwargs.get("spk_emb_size", 192)
self.think_end_ids = kwargs.get("think_end_ids", [26, 234, 234])
self.image_ids = kwargs.get("image_ids", [12])
self.image_special_token = kwargs.get("image_special_token", "<|image_pad|>")
self.image_hidden_size = kwargs.get("image_hidden_size", 768)
self.image_token_len = kwargs.get("image_token_len", 64)
self.bridge_layer = kwargs.get("bridge_layer", self.num_hidden_layers // 2 - 1)
|