weili-0234 commited on Mar 29, 2025

Commit

fcc56be

verified ·

1 Parent(s): 46b764e

Upload folder using huggingface_hub

Browse files

Files changed (18) hide show

config.json +39 -0
configuration_rwkv7.py +91 -0
generation_config.json +11 -0
hf_rwkv_tokenizer.py +278 -0
modeling_rwkv7.py +4 -0
projector/config.json +17 -0
projector/configuration_projector.py +23 -0
projector/modeling_projector.py +51 -0
projector/pytorch_model.bin +3 -0
pytorch_model.bin +3 -0
rwkv_vocab_v20230424.txt +0 -0
special_tokens_map.json +23 -0
tokenizer_config.json +29 -0
visual_encoder/config.json +19 -0
visual_encoder/preprocessor_config.json +27 -0
visual_encoder/pytorch_model.bin +3 -0
vocab.txt +0 -0
xtuner_config.py +1064 -0

config.json ADDED Viewed

	@@ -0,0 +1,39 @@

+{
+  "_name_or_path": "/mnt/program/wlx_data/experiments/language-aurora-rwkv7-0317/iter_570893.hf/",
+  "a_low_rank_dim": 96,
+  "architectures": [
+    "RWKV7ForCausalLM"
+  ],
+  "attn": null,
+  "attn_mode": "chunk",
+  "auto_map": {
+    "AutoConfig": "configuration_rwkv7.RWKV7Config",
+    "AutoModel": "modeling_rwkv7.RWKV7Model",
+    "AutoModelForCausalLM": "modeling_rwkv7.RWKV7ForCausalLM"
+  },
+  "bos_token_id": 1,
+  "decay_low_rank_dim": 96,
+  "eos_token_id": 2,
+  "fuse_cross_entropy": true,
+  "fuse_norm": true,
+  "gate_low_rank_dim": 256,
+  "head_dim": 64,
+  "hidden_act": "sqrelu",
+  "hidden_ratio": 4.0,
+  "hidden_size": 2048,
+  "initializer_range": 0.02,
+  "intermediate_size": 8192,
+  "max_position_embeddings": 2048,
+  "model_type": "rwkv7",
+  "norm_bias": true,
+  "norm_eps": 1e-05,
+  "norm_first": true,
+  "num_heads": 32,
+  "num_hidden_layers": 24,
+  "tie_word_embeddings": false,
+  "torch_dtype": "float16",
+  "transformers_version": "4.48.0",
+  "use_cache": true,
+  "v_low_rank_dim": 64,
+  "vocab_size": 65536
+}

configuration_rwkv7.py ADDED Viewed

	@@ -0,0 +1,91 @@

+# -*- coding: utf-8 -*-
+from typing import Dict, Optional
+from transformers.configuration_utils import PretrainedConfig
+class RWKV7Config(PretrainedConfig):
+    model_type = 'rwkv7'
+    keys_to_ignore_at_inference = ['past_key_values']
+    def __init__(
+        self,
+        attn_mode: str = "chunk",
+        hidden_size: int = 2048,
+        hidden_ratio: Optional[int] = 4,
+        intermediate_size: Optional[int] = None,
+        num_hidden_layers: int = 24,
+        head_dim: Optional[int] = 64,
+        num_heads: Optional[int] = None,
+        decay_low_rank_dim: int = 64,
+        gate_low_rank_dim: int = 128,
+        a_low_rank_dim: int = 64,
+        v_low_rank_dim: int = 16,
+        hidden_act: str = "sqrelu",
+        max_position_embeddings: int = 2048,
+        norm_first: bool = True,
+        norm_bias: bool = True,
+        norm_eps: float = 1e-5,
+        attn: Optional[Dict] = None,
+        use_cache: bool = True,
+        pad_token_id: int = None,
+        bos_token_id: int = 1,
+        eos_token_id: int = 2,
+        tie_word_embeddings: bool = False,
+        initializer_range: float = 0.006,
+        fuse_norm: bool = True,
+        fuse_cross_entropy: bool = True,
+        vocab_size: int = 32000,
+        **kwargs
+    ):
+        self.attn_mode = attn_mode
+        self.hidden_size = hidden_size
+        self.hidden_ratio = hidden_ratio
+        self.intermediate_size = intermediate_size
+        self.norm_first = norm_first
+        self.num_hidden_layers = num_hidden_layers
+        if head_dim is None and num_heads is not None:
+            head_dim = int(hidden_size // num_heads)
+        elif head_dim is not None and num_heads is None:
+            num_heads = int(hidden_size // head_dim)
+        self.head_dim = head_dim
+        self.num_heads = num_heads
+        self.decay_low_rank_dim = decay_low_rank_dim
+        self.gate_low_rank_dim = gate_low_rank_dim
+        self.a_low_rank_dim = a_low_rank_dim
+        self.v_low_rank_dim = v_low_rank_dim
+        self.hidden_act = hidden_act
+        self.max_position_embeddings = max_position_embeddings
+        self.norm_bias = norm_bias
+        self.norm_eps = norm_eps
+        self.attn = attn
+        self.use_cache = use_cache
+        self.initializer_range = initializer_range
+        self.fuse_norm = fuse_norm
+        self.fuse_cross_entropy = fuse_cross_entropy
+        self.vocab_size = vocab_size
+        if attn is not None:
+            if not isinstance(attn, Dict):
+                raise ValueError("attn must be a dictionary")
+            if 'layers' not in attn:
+                raise ValueError("Layer indices must be provided to initialize hybrid attention layers")
+            if 'num_heads' not in attn:
+                raise ValueError("Number of heads must be provided to initialize hybrid attention layers")
+            attn['num_kv_heads'] = attn.get('num_kv_heads', attn['num_heads'])
+            attn['qkv_bias'] = attn.get('qkv_bias', False)
+            attn['window_size'] = attn.get('window_size', None)
+            attn['rope_theta'] = attn.get('rope_theta', 10000.)
+        super().__init__(
+            pad_token_id=pad_token_id,
+            bos_token_id=bos_token_id,
+            eos_token_id=eos_token_id,
+            tie_word_embeddings=tie_word_embeddings,
+            **kwargs,
+        )

generation_config.json ADDED Viewed

	@@ -0,0 +1,11 @@

+{
+  "bos_token_id": 1,
+  "do_sample": true,
+  "eos_token_id": 2,
+  "max_window_size": 2147483647,
+  "pad_token_id": 3,
+  "temperature": null,
+  "top_k": 65536,
+  "top_p": null,
+  "transformers_version": "4.48.0"
+}

hf_rwkv_tokenizer.py ADDED Viewed

	@@ -0,0 +1,278 @@

+# coding=utf-8
+# Copyright 2024 The HuggingFace Inc. team.
+#
+# Licensed under the Apache License, Version 2.0 (the "License");
+# you may not use this file except in compliance with the License.
+# You may obtain a copy of the License at
+#
+#     http://www.apache.org/licenses/LICENSE-2.0
+#
+# Unless required by applicable law or agreed to in writing, software
+# distributed under the License is distributed on an "AS IS" BASIS,
+# WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.
+# See the License for the specific language governing permissions and
+# limitations under the License.
+"""Tokenization classes for RWKV."""
+import os
+import re
+from typing import TYPE_CHECKING, List, Optional, Tuple
+from transformers.tokenization_utils import AddedToken, PreTrainedTokenizer
+from transformers.utils import logging
+if TYPE_CHECKING:
+    pass
+logger = logging.get_logger(__name__)
+VOCAB_FILES_NAMES = {
+    "vocab_file": "rwkv_vocab_v20230424.txt",
+}
+class TRIE:
+    __slots__ = tuple("ch,to,values,front".split(","))
+    to: list
+    values: set
+    def __init__(self, front=None, ch=None):
+        self.ch = ch
+        self.to = [None for ch in range(256)]
+        self.values = set()
+        self.front = front
+    def __repr__(self):
+        fr = self
+        ret = []
+        while fr != None:
+            if fr.ch != None:
+                ret.append(fr.ch)
+            fr = fr.front
+        return "<TRIE %s %s>" % (ret[::-1], self.values)
+    def add(self, key: bytes, idx: int = 0, val=None):
+        if idx == len(key):
+            if val is None:
+                val = key
+            self.values.add(val)
+            return self
+        ch = key[idx]
+        if self.to[ch] is None:
+            self.to[ch] = TRIE(front=self, ch=ch)
+        return self.to[ch].add(key, idx=idx + 1, val=val)
+    def find_longest(self, key: bytes, idx: int = 0):
+        u: TRIE = self
+        ch: int = key[idx]
+        while u.to[ch] is not None:
+            u = u.to[ch]
+            idx += 1
+            if u.values:
+                ret = idx, u, u.values
+            if idx == len(key):
+                break
+            ch = key[idx]
+        return ret
+class RWKV_TOKENIZER:
+    def __init__(self, file_name):
+        self.idx2token = {}
+        sorted = []  # must be already sorted
+        with open(file_name, "r", encoding="utf-8") as f:
+            lines = f.readlines()
+        for l in lines:
+            idx = int(l[: l.index(" ")])
+            x = eval(l[l.index(" ") : l.rindex(" ")])
+            x = x.encode("utf-8") if isinstance(x, str) else x
+            assert isinstance(x, bytes)
+            assert len(x) == int(l[l.rindex(" ") :])
+            sorted += [x]
+            self.idx2token[idx] = x
+        self.token2idx = {}
+        for k, v in self.idx2token.items():
+            self.token2idx[v] = int(k)
+        self.root = TRIE()
+        for t, i in self.token2idx.items():
+            _ = self.root.add(t, val=(t, i))
+    def encodeBytes(self, src: bytes):
+        idx: int = 0
+        tokens = []
+        while idx < len(src):
+            _idx: int = idx
+            idx, _, values = self.root.find_longest(src, idx)
+            assert idx != _idx
+            _, token = next(iter(values))
+            tokens.append(token)
+        return tokens
+    def decodeBytes(self, tokens):
+        return b"".join(map(lambda i: self.idx2token[i], tokens))
+    def encode(self, src):
+        if isinstance(src, str):
+            return [self.encodeBytes(src.encode("utf-8"))]
+        elif isinstance(src, list):
+            return [self.encodeBytes(s.encode("utf-8")) for s in src]
+    def decode(self, tokens):
+        return [self.decodeBytes(batch).decode("utf-8") for batch in tokens]
+        # try:
+        #     return self.decodeBytes(tokens).decode('utf-8')
+        # except:
+        #     return '\ufffd' # bad utf-8
+    def printTokens(self, tokens):
+        for i in tokens:
+            s = self.idx2token[i]
+            try:
+                s = s.decode("utf-8")
+            except:
+                pass
+            print(f"{repr(s)}{i}", end=" ")
+        print()
+class RwkvTokenizer(PreTrainedTokenizer):
+    vocab_files_names = VOCAB_FILES_NAMES
+    model_input_names = ["input_ids", "attention_mask"]
+    def __init__(
+        self, vocab_file, bos_token="<|rwkv_tokenizer_end_of_text|>", eos_token="<|rwkv_tokenizer_end_of_text|>", unk_token="<|rwkv_tokenizer_end_of_text|>", **kwargs
+    ):
+        if not os.path.isfile(vocab_file):
+            raise ValueError(
+                f"Can't find a vocabulary file at path '{vocab_file}'."
+            )
+        with open(vocab_file, "r", encoding="utf-8") as reader:
+            tokens = reader.readlines()
+        if "add_bos_token" in kwargs:
+            self.add_bos_token = kwargs["add_bos_token"]
+        else:
+            self.add_bos_token = False
+        self.trie_tokenizer = RWKV_TOKENIZER(vocab_file)
+        vocab = self.trie_tokenizer.token2idx
+        self.encoder = vocab
+        self.decoder = {v: k for k, v in vocab.items()}
+        self._added_tokens_decoder = {0: AddedToken(str(bos_token))}
+        super().__init__(
+            bos_token=bos_token, eos_token=eos_token, unk_token=unk_token, **kwargs
+        )
+    @property
+    def vocab_size(self):
+        return len(self.encoder)
+    def get_vocab(self):
+        vocab = {str(self.convert_ids_to_tokens(i)): i for i in range(self.vocab_size)}
+        vocab.update(self.added_tokens_encoder)
+        return vocab
+    def _tokenize(self, text, split_special_tokens=False):
+        # return self.wordpiece_tokenizer.tokenize(text.encode("utf-8"))
+        return self.trie_tokenizer.encode(text)[0]
+    def _convert_token_to_id(self, token):
+        return token
+    def _convert_id_to_token(self, index):
+        """Converts an index (integer) in a token (byte) using the vocab."""
+        token = self.decoder.get(index, self.unk_token)
+        if isinstance(token, (bytes)):
+            token = token.decode("utf-8", errors="replace")
+        return token
+    def convert_tokens_to_string(self, tokens):
+        """Converts a sequence of tokens (bytes) in a single string. Additional tokens are encoded to bytes"""
+        out_string = b"".join(
+            [k.encode(errors="replace") if isinstance(k, str) else k for k in tokens]
+        ).decode("utf-8")
+        return out_string
+    def save_vocabulary(
+        self, save_directory: str, filename_prefix: Optional[str] = None
+    ) -> Tuple[str]:
+        index = 0
+        if os.path.isdir(save_directory):
+            vocab_file = os.path.join(
+                save_directory,
+                (filename_prefix + "-" if filename_prefix else "") + "vocab.txt",
+            )
+        else:
+            vocab_file = (
+                filename_prefix + "-" if filename_prefix else ""
+            ) + save_directory
+        with open(vocab_file, "w", encoding="utf-8") as writer:
+            for token, token_index in sorted(
+                self.encoder.items(), key=lambda kv: kv[1]
+            ):
+                if index != token_index:
+                    logger.warning(
+                        f"Saving vocabulary to {vocab_file}: vocabulary indices are not consecutive."
+                        " Please check that the vocabulary is not corrupted!"
+                    )
+                    index = token_index
+                writer.write(str(token) + "\n")
+                index += 1
+        return (vocab_file,)
+    def build_inputs_with_special_tokens(self, token_ids_0, token_ids_1=None):
+        if self.add_bos_token:
+            bos_token_ids = [self.bos_token_id]
+        else:
+            bos_token_ids = []
+        output = bos_token_ids + token_ids_0
+        if token_ids_1 is None:
+            return output
+        return output + bos_token_ids + token_ids_1
+    def get_special_tokens_mask(
+        self,
+        token_ids_0: List[int],
+        token_ids_1: Optional[List[int]] = None,
+        already_has_special_tokens: bool = False,
+    ) -> List[int]:
+        """
+        Retrieves sequence ids from a token list that has no special tokens added. This method is called when adding
+        special tokens using the tokenizer `prepare_for_model` or `encode_plus` methods.
+        Args:
+            token_ids_0 (`List[int]`):
+                List of IDs.
+            token_ids_1 (`List[int]`, *optional*):
+                Optional second list of IDs for sequence pairs.
+            already_has_special_tokens (`bool`, *optional*, defaults to `False`):
+                Whether or not the token list is already formatted with special tokens for the model.
+        Returns:
+            `List[int]`: A list of integers in the range [0, 1]: 1 for a special token, 0 for a sequence token.
+        """
+        if already_has_special_tokens:
+            return super().get_special_tokens_mask(
+                token_ids_0=token_ids_0,
+                token_ids_1=token_ids_1,
+                already_has_special_tokens=True,
+            )
+        if not self.add_bos_token:
+            return super().get_special_tokens_mask(
+                token_ids_0=token_ids_0,
+                token_ids_1=token_ids_1,
+                already_has_special_tokens=False,
+            )
+        if token_ids_1 is None:
+            return [1] + ([0] * len(token_ids_0))
+        return [1] + ([0] * len(token_ids_0)) + [1] + ([0] * len(token_ids_1))

modeling_rwkv7.py ADDED Viewed

	@@ -0,0 +1,4 @@

+from fla.models.rwkv7 import RWKV7ForCausalLM, RWKV7Model, RWKV7Config
+RWKV7ForCausalLM = RWKV7ForCausalLM
+RWKV7Model = RWKV7Model
+RWKV7Config = RWKV7Config

projector/config.json ADDED Viewed

	@@ -0,0 +1,17 @@

+{
+  "architectures": [
+    "ProjectorModel"
+  ],
+  "auto_map": {
+    "AutoConfig": "configuration_projector.ProjectorConfig",
+    "AutoModel": "modeling_projector.ProjectorModel"
+  },
+  "bias": true,
+  "depth": 2,
+  "hidden_act": "gelu",
+  "llm_hidden_size": 2048,
+  "model_type": "projector",
+  "torch_dtype": "float32",
+  "transformers_version": "4.48.0",
+  "visual_hidden_size": 1024
+}

projector/configuration_projector.py ADDED Viewed

	@@ -0,0 +1,23 @@

+# Copyright (c) OpenMMLab. All rights reserved.
+from transformers import PretrainedConfig
+class ProjectorConfig(PretrainedConfig):
+    model_type = 'projector'
+    _auto_class = 'AutoConfig'
+    def __init__(
+        self,
+        visual_hidden_size=4096,
+        llm_hidden_size=4096,
+        depth=2,
+        hidden_act='gelu',
+        bias=True,
+        **kwargs,
+    ):
+        self.visual_hidden_size = visual_hidden_size
+        self.llm_hidden_size = llm_hidden_size
+        self.depth = depth
+        self.hidden_act = hidden_act
+        self.bias = bias
+        super().__init__(**kwargs)

projector/modeling_projector.py ADDED Viewed

	@@ -0,0 +1,51 @@

+# Copyright (c) OpenMMLab. All rights reserved.
+import torch
+import torch.nn as nn
+from transformers import PreTrainedModel
+from transformers.activations import ACT2FN
+from .configuration_projector import ProjectorConfig
+class ProjectorModel(PreTrainedModel):
+    _auto_class = 'AutoModel'
+    config_class = ProjectorConfig
+    base_model_prefix = 'model'
+    supports_gradient_checkpointing = True
+    def __init__(self, config: ProjectorConfig) -> None:
+        super().__init__(config)
+        self.gradient_checkpointing = False
+        modules = [
+            nn.Linear(
+                config.visual_hidden_size,
+                config.llm_hidden_size,
+                bias=config.bias)
+        ]
+        for _ in range(1, config.depth):
+            modules.append(ACT2FN[config.hidden_act])
+            modules.append(
+                nn.Linear(
+                    config.llm_hidden_size,
+                    config.llm_hidden_size,
+                    bias=config.bias))
+        self.model = nn.Sequential(*modules)
+    def enable_input_require_grads(self):
+        def make_inputs_require_grad(module, input, output):
+            output.requires_grad_(True)
+        self.model.register_forward_hook(make_inputs_require_grad)
+    def _set_gradient_checkpointing(self, module, value=False):
+        if isinstance(module, ProjectorModel):
+            module.gradient_checkpointing = value
+    def forward(self, x):
+        if self.gradient_checkpointing and self.training:
+            layer_outputs = torch.utils.checkpoint.checkpoint(self.model, x)
+        else:
+            layer_outputs = self.model(x)
+        return layer_outputs

projector/pytorch_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:e1587d295bc9b15ff6cc8be2b79fb6f3b83cfda72e9435c8ccc30d0f86c63d44
+size 25184256

pytorch_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:0e008338862e91bb2ab71dd87a51d6fb7104e5ffc1e74bddb5d136053fc7c2b7
+size 3700045626

rwkv_vocab_v20230424.txt ADDED Viewed

The diff for this file is too large to render. See raw diff

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,23 @@

+{
+  "bos_token": {
+    "content": "<|rwkv_tokenizer_end_of_text|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": {
+    "content": "<|rwkv_tokenizer_end_of_text|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "unk_token": {
+    "content": "<|rwkv_tokenizer_end_of_text|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,29 @@

+{
+  "add_prefix_space": false,
+  "added_tokens_decoder": {
+    "0": {
+      "content": "<|rwkv_tokenizer_end_of_text|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "auto_map": {
+    "AutoTokenizer": [
+      "hf_rwkv_tokenizer.RwkvTokenizer",
+      null
+    ]
+  },
+  "bos_token": "<|rwkv_tokenizer_end_of_text|>",
+  "chat_template": "{{ '<|rwkv_tokenizer_end_of_text|>' }}{% for message in messages %}{% if message['role'] == 'user' %}{{'User: ' + message['content'] + '\n\n'}}{% elif message['role'] == 'system' %}{{'System: ' + message['content'] + '\n\n'}}{% elif message['role'] == 'assistant' %}{{'Assistant: ' + message['content'] + '\n\n'}}{% endif %}{% endfor %}{% if add_generation_prompt %}{{ 'Assistant:' }}{% endif %}",
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "<|rwkv_tokenizer_end_of_text|>",
+  "extra_special_tokens": {},
+  "model_max_length": 1000000000000000019884624838656,
+  "padding_side": "right",
+  "tokenizer_class": "RwkvTokenizer",
+  "unk_token": "<|rwkv_tokenizer_end_of_text|>",
+  "use_fast": false
+}

visual_encoder/config.json ADDED Viewed

	@@ -0,0 +1,19 @@

+{
+  "_name_or_path": "/mnt/program/wlx_data/experiments/vision-aurora-rwkv7-0315/iter_36290.hf/visual_encoder",
+  "architectures": [
+    "AuroraSigEncoder"
+  ],
+  "attention_dropout": 0.0,
+  "hidden_act": "gelu_pytorch_tanh",
+  "hidden_size": 1024,
+  "image_size": 384,
+  "intermediate_size": 4096,
+  "layer_norm_eps": 1e-06,
+  "model_type": "siglip_vision_model",
+  "num_attention_heads": 16,
+  "num_channels": 3,
+  "num_hidden_layers": 24,
+  "patch_size": 16,
+  "torch_dtype": "float32",
+  "transformers_version": "4.48.0"
+}

visual_encoder/preprocessor_config.json ADDED Viewed

	@@ -0,0 +1,27 @@

+{
+  "crop_size": {
+    "height": 384,
+    "width": 384
+  },
+  "do_center_crop": true,
+  "do_convert_rgb": true,
+  "do_normalize": true,
+  "do_rescale": true,
+  "do_resize": true,
+  "image_mean": [
+    0.48145466,
+    0.4578275,
+    0.40821073
+  ],
+  "image_processor_type": "CLIPImageProcessor",
+  "image_std": [
+    0.26862954,
+    0.26130258,
+    0.27577711
+  ],
+  "resample": 3,
+  "rescale_factor": 0.00392156862745098,
+  "size": {
+    "shortest_edge": 384
+  }
+}

visual_encoder/pytorch_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:39a3d07738ad0a4ca66c6a8123454a09bee246af35ace594f1de166a085327df
+size 1267627982

vocab.txt ADDED Viewed

The diff for this file is too large to render. See raw diff

xtuner_config.py ADDED Viewed

	@@ -0,0 +1,1064 @@

+SYSTEM = ''
+accumulative_counts = 256
+batch_size = 1
+betas = (
+    0.9,
+    0.999,
+)
+custom_hooks = [
+    dict(
+        tokenizer=dict(
+            padding_side='right',
+            pretrained_model_name_or_path=
+            '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+            trust_remote_code=True,
+            type='transformers.AutoTokenizer.from_pretrained'),
+        type='xtuner.engine.DatasetInfoHook'),
+    dict(
+        evaluation_images='/mnt/program/wlx_data/experiments/assets/view.jpg',
+        evaluation_inputs=[
+            'Please describe this picture in detail',
+            'What should I be cautious about when I visit this place?',
+        ],
+        every_n_iters=5000,
+        image_processor=dict(
+            crop_size=384,
+            pretrained_model_name_or_path=
+            'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+            size=384,
+            trust_remote_code=True,
+            type='transformers.CLIPImageProcessor.from_pretrained'),
+        prompt_template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+        system='',
+        tokenizer=dict(
+            padding_side='right',
+            pretrained_model_name_or_path=
+            '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+            trust_remote_code=True,
+            type='transformers.AutoTokenizer.from_pretrained'),
+        type='xtuner.engine.EvaluateChatHook'),
+]
+data_path = '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/densefusion/filtered_densefusion.jsonl'
+data_root = '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/densefusion/'
+dataloader_num_workers = 16
+default_hooks = dict(
+    checkpoint=dict(
+        by_epoch=False,
+        interval=10000,
+        max_keep_ckpts=2,
+        type='mmengine.hooks.CheckpointHook'),
+    logger=dict(interval=10, type='mmengine.hooks.LoggerHook'),
+    param_scheduler=dict(type='mmengine.hooks.ParamSchedulerHook'),
+    sampler_seed=dict(type='mmengine.hooks.DistSamplerSeedHook'),
+    timer=dict(type='mmengine.hooks.IterTimerHook'))
+env_cfg = dict(
+    cudnn_benchmark=False,
+    dist_cfg=dict(backend='nccl'),
+    mp_cfg=dict(mp_start_method='fork', opencv_num_threads=0))
+evaluation_freq = 5000
+evaluation_images = '/mnt/program/wlx_data/experiments/assets/view.jpg'
+evaluation_inputs = [
+    'Please describe this picture in detail',
+    'What should I be cautious about when I visit this place?',
+]
+image_folder = '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/densefusion/data/MiraData/frames/'
+image_processor = dict(
+    crop_size=384,
+    pretrained_model_name_or_path='laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+    size=384,
+    trust_remote_code=True,
+    type='transformers.CLIPImageProcessor.from_pretrained')
+language_prefix = '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/'
+launcher = 'pytorch'
+llava_dataset_1 = dict(
+    data_path=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/evol/evol.jsonl',
+    dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+    image_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/evol/',
+    image_processor=dict(
+        crop_size=384,
+        pretrained_model_name_or_path=
+        'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+        size=384,
+        trust_remote_code=True,
+        type='transformers.CLIPImageProcessor.from_pretrained'),
+    max_length=4096,
+    offline_processed_text_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/evol/tokenized-by-rwkv7/tokenized_sandwich_data',
+    pad_image_to_square=True,
+    template_map_fn=dict(
+        template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+        type='xtuner.dataset.map_fns.template_map_fn_factory'),
+    tokenizer=dict(
+        padding_side='right',
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+        trust_remote_code=True,
+        type='transformers.AutoTokenizer.from_pretrained'),
+    type='xtuner.dataset.AuroraDataset')
+llava_dataset_10 = dict(
+    data_path=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/sharegpt4video_qa/sharegpt4video_qa.jsonl',
+    dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+    image_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/sharegpt4video_qa/data/ShareGPT4Video-raw/vqa_frames/',
+    image_processor=dict(
+        crop_size=384,
+        pretrained_model_name_or_path=
+        'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+        size=384,
+        trust_remote_code=True,
+        type='transformers.CLIPImageProcessor.from_pretrained'),
+    max_length=4096,
+    pad_image_to_square=True,
+    template_map_fn=dict(
+        template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+        type='xtuner.dataset.map_fns.template_map_fn_factory'),
+    tokenizer=dict(
+        padding_side='right',
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+        trust_remote_code=True,
+        type='transformers.AutoTokenizer.from_pretrained'),
+    type='xtuner.dataset.AuroraDataset')
+llava_dataset_11 = dict(
+    data_path=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/m4/filtered_m4.jsonl',
+    dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+    image_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/m4/data/M4-Instruct-Data/images/',
+    image_processor=dict(
+        crop_size=384,
+        pretrained_model_name_or_path=
+        'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+        size=384,
+        trust_remote_code=True,
+        type='transformers.CLIPImageProcessor.from_pretrained'),
+    max_length=4096,
+    offline_processed_text_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/m4/data/M4-Instruct-Data/images/tokenized-by-rwkv7/tokenized_sandwich_data',
+    pad_image_to_square=True,
+    template_map_fn=dict(
+        template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+        type='xtuner.dataset.map_fns.template_map_fn_factory'),
+    tokenizer=dict(
+        padding_side='right',
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+        trust_remote_code=True,
+        type='transformers.AutoTokenizer.from_pretrained'),
+    type='xtuner.dataset.AuroraDataset')
+llava_dataset_12 = dict(
+    data_path=
+    '/data1/exs_data/datasets/AuroraCap-trainset/language_sharegpt4video_caption/language_sharegpt4video_caption.jsonl',
+    dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+    image_folder=
+    '/data1/exs_data/datasets/AuroraCap-trainset/language_sharegpt4video_caption/data/ShareGPT4Video-raw/caption_frames/',
+    image_processor=dict(
+        crop_size=384,
+        pretrained_model_name_or_path=
+        'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+        size=384,
+        trust_remote_code=True,
+        type='transformers.CLIPImageProcessor.from_pretrained'),
+    max_length=4096,
+    pad_image_to_square=True,
+    template_map_fn=dict(
+        template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+        type='xtuner.dataset.map_fns.template_map_fn_factory'),
+    tokenizer=dict(
+        padding_side='right',
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+        trust_remote_code=True,
+        type='transformers.AutoTokenizer.from_pretrained'),
+    type='xtuner.dataset.AuroraDataset')
+llava_dataset_13 = dict(
+    data_path=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/miradata/filtered_miradata.jsonl',
+    dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+    image_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/miradata/data/MiraData/frames/',
+    image_processor=dict(
+        crop_size=384,
+        pretrained_model_name_or_path=
+        'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+        size=384,
+        trust_remote_code=True,
+        type='transformers.CLIPImageProcessor.from_pretrained'),
+    max_length=4096,
+    offline_processed_text_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/miradata/data/MiraData/frames/tokenized-by-rwkv7/tokenized_sandwich_data',
+    pad_image_to_square=True,
+    template_map_fn=dict(
+        template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+        type='xtuner.dataset.map_fns.template_map_fn_factory'),
+    tokenizer=dict(
+        padding_side='right',
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+        trust_remote_code=True,
+        type='transformers.AutoTokenizer.from_pretrained'),
+    type='xtuner.dataset.AuroraDataset')
+llava_dataset_14 = dict(
+    data_path=
+    '/data1/exs_data/datasets/AuroraCap-trainset/language_sharegpt4v/language_sharegpt4v.jsonl',
+    dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+    image_folder=
+    '/data1/exs_data/datasets/AuroraCap-trainset/language_sharegpt4v/data/',
+    image_processor=dict(
+        crop_size=384,
+        pretrained_model_name_or_path=
+        'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+        size=384,
+        trust_remote_code=True,
+        type='transformers.CLIPImageProcessor.from_pretrained'),
+    max_length=4096,
+    offline_processed_text_folder=
+    '/data1/exs_data/datasets/AuroraCap-trainset/language_sharegpt4v/data/tokenized_data',
+    pad_image_to_square=True,
+    template_map_fn=dict(
+        template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+        type='xtuner.dataset.map_fns.template_map_fn_factory'),
+    tokenizer=dict(
+        padding_side='right',
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+        trust_remote_code=True,
+        type='transformers.AutoTokenizer.from_pretrained'),
+    type='xtuner.dataset.AuroraDataset')
+llava_dataset_15 = dict(
+    data_path=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/densefusion/filtered_densefusion.jsonl',
+    dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+    image_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/densefusion/data/MiraData/frames/',
+    image_processor=dict(
+        crop_size=384,
+        pretrained_model_name_or_path=
+        'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+        size=384,
+        trust_remote_code=True,
+        type='transformers.CLIPImageProcessor.from_pretrained'),
+    max_length=4096,
+    pad_image_to_square=True,
+    template_map_fn=dict(
+        template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+        type='xtuner.dataset.map_fns.template_map_fn_factory'),
+    tokenizer=dict(
+        padding_side='right',
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+        trust_remote_code=True,
+        type='transformers.AutoTokenizer.from_pretrained'),
+    type='xtuner.dataset.AuroraDataset')
+llava_dataset_2 = dict(
+    data_path=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/facecaption/filtered_facecaption.jsonl',
+    dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+    image_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/facecaption/data/FaceCaption-15M/images/',
+    image_processor=dict(
+        crop_size=384,
+        pretrained_model_name_or_path=
+        'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+        size=384,
+        trust_remote_code=True,
+        type='transformers.CLIPImageProcessor.from_pretrained'),
+    max_length=4096,
+    offline_processed_text_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/facecaption/data/FaceCaption-15M/images/tokenized-by-rwkv7/tokenized_sandwich_data',
+    pad_image_to_square=True,
+    template_map_fn=dict(
+        template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+        type='xtuner.dataset.map_fns.template_map_fn_factory'),
+    tokenizer=dict(
+        padding_side='right',
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+        trust_remote_code=True,
+        type='transformers.AutoTokenizer.from_pretrained'),
+    type='xtuner.dataset.AuroraDataset')
+llava_dataset_3 = dict(
+    data_path=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llavanext/filtered_llavanext.jsonl',
+    dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+    image_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llavanext/data/LLaVA-NeXT-Data/images/',
+    image_processor=dict(
+        crop_size=384,
+        pretrained_model_name_or_path=
+        'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+        size=384,
+        trust_remote_code=True,
+        type='transformers.CLIPImageProcessor.from_pretrained'),
+    max_length=4096,
+    offline_processed_text_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llavanext/data/LLaVA-NeXT-Data/images/tokenized-by-rwkv7/tokenized_sandwich_data',
+    pad_image_to_square=True,
+    template_map_fn=dict(
+        template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+        type='xtuner.dataset.map_fns.template_map_fn_factory'),
+    tokenizer=dict(
+        padding_side='right',
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+        trust_remote_code=True,
+        type='transformers.AutoTokenizer.from_pretrained'),
+    type='xtuner.dataset.AuroraDataset')
+llava_dataset_4 = dict(
+    data_path=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_vflan/filtered_allava_caption_vflan.jsonl',
+    dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+    image_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_vflan/data/ALLaVA-4V/',
+    image_processor=dict(
+        crop_size=384,
+        pretrained_model_name_or_path=
+        'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+        size=384,
+        trust_remote_code=True,
+        type='transformers.CLIPImageProcessor.from_pretrained'),
+    max_length=4096,
+    offline_processed_text_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_vflan/data/ALLaVA-4V/tokenized-by-rwkv7/tokenized_sandwich_data',
+    pad_image_to_square=True,
+    template_map_fn=dict(
+        template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+        type='xtuner.dataset.map_fns.template_map_fn_factory'),
+    tokenizer=dict(
+        padding_side='right',
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+        trust_remote_code=True,
+        type='transformers.AutoTokenizer.from_pretrained'),
+    type='xtuner.dataset.AuroraDataset')
+llava_dataset_5 = dict(
+    data_path=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_vflan/filtered_allava_instruct_vflan.jsonl',
+    dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+    image_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_vflan/data/ALLaVA-4V/',
+    image_processor=dict(
+        crop_size=384,
+        pretrained_model_name_or_path=
+        'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+        size=384,
+        trust_remote_code=True,
+        type='transformers.CLIPImageProcessor.from_pretrained'),
+    max_length=4096,
+    offline_processed_text_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_vflan/data/ALLaVA-4V/tokenized-by-rwkv7/tokenized_sandwich_data',
+    pad_image_to_square=True,
+    template_map_fn=dict(
+        template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+        type='xtuner.dataset.map_fns.template_map_fn_factory'),
+    tokenizer=dict(
+        padding_side='right',
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+        trust_remote_code=True,
+        type='transformers.AutoTokenizer.from_pretrained'),
+    type='xtuner.dataset.AuroraDataset')
+llava_dataset_6 = dict(
+    data_path=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llava_mix/filtered_llava_mix.jsonl',
+    dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+    image_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llava_mix/data/LLaVA-Instruct-150K/images/',
+    image_processor=dict(
+        crop_size=384,
+        pretrained_model_name_or_path=
+        'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+        size=384,
+        trust_remote_code=True,
+        type='transformers.CLIPImageProcessor.from_pretrained'),
+    max_length=4096,
+    offline_processed_text_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llava_mix/data/LLaVA-Instruct-150K/images/tokenized-by-rwkv7/tokenized_sandwich_data',
+    pad_image_to_square=True,
+    template_map_fn=dict(
+        template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+        type='xtuner.dataset.map_fns.template_map_fn_factory'),
+    tokenizer=dict(
+        padding_side='right',
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+        trust_remote_code=True,
+        type='transformers.AutoTokenizer.from_pretrained'),
+    type='xtuner.dataset.AuroraDataset')
+llava_dataset_7 = dict(
+    data_path=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_laion/filtered_allava_caption_laion.jsonl',
+    dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+    image_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_laion/data/ALLaVA-4V/',
+    image_processor=dict(
+        crop_size=384,
+        pretrained_model_name_or_path=
+        'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+        size=384,
+        trust_remote_code=True,
+        type='transformers.CLIPImageProcessor.from_pretrained'),
+    max_length=4096,
+    offline_processed_text_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_laion/data/ALLaVA-4V/tokenized-by-rwkv7/tokenized_sandwich_data',
+    pad_image_to_square=True,
+    template_map_fn=dict(
+        template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+        type='xtuner.dataset.map_fns.template_map_fn_factory'),
+    tokenizer=dict(
+        padding_side='right',
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+        trust_remote_code=True,
+        type='transformers.AutoTokenizer.from_pretrained'),
+    type='xtuner.dataset.AuroraDataset')
+llava_dataset_8 = dict(
+    data_path=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_laion/filtered_allava_instruct_laion.jsonl',
+    dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+    image_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_laion/data/ALLaVA-4V/',
+    image_processor=dict(
+        crop_size=384,
+        pretrained_model_name_or_path=
+        'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+        size=384,
+        trust_remote_code=True,
+        type='transformers.CLIPImageProcessor.from_pretrained'),
+    max_length=4096,
+    offline_processed_text_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_laion/data/ALLaVA-4V/tokenized-by-rwkv7/tokenized_sandwich_data',
+    pad_image_to_square=True,
+    template_map_fn=dict(
+        template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+        type='xtuner.dataset.map_fns.template_map_fn_factory'),
+    tokenizer=dict(
+        padding_side='right',
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+        trust_remote_code=True,
+        type='transformers.AutoTokenizer.from_pretrained'),
+    type='xtuner.dataset.AuroraDataset')
+llava_dataset_9 = dict(
+    data_path=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/cambrian/filtered_cambrian.jsonl',
+    dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+    image_folder=
+    '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/cambrian/data/Cambrian-10M/images/',
+    image_processor=dict(
+        crop_size=384,
+        pretrained_model_name_or_path=
+        'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+        size=384,
+        trust_remote_code=True,
+        type='transformers.CLIPImageProcessor.from_pretrained'),
+    max_length=4096,
+    pad_image_to_square=True,
+    template_map_fn=dict(
+        template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+        type='xtuner.dataset.map_fns.template_map_fn_factory'),
+    tokenizer=dict(
+        padding_side='right',
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+        trust_remote_code=True,
+        type='transformers.AutoTokenizer.from_pretrained'),
+    type='xtuner.dataset.AuroraDataset')
+llava_ov_strategy = False
+llm_name_or_path = '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/'
+load_from = None
+log_level = 'INFO'
+lr = 8e-05
+max_epochs = 1
+max_length = 4096
+max_norm = 1
+model = dict(
+    freeze_llm=False,
+    freeze_proj=False,
+    freeze_visual_encoder=False,
+    llava_ov_strategy=False,
+    llm=dict(
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+        quantization_config=None,
+        torch_dtype='torch.float16',
+        trust_remote_code=True,
+        type='transformers.AutoModelForCausalLM.from_pretrained'),
+    pretrained_pth=
+    '/mnt/program/wlx_data/experiments/vision-aurora-rwkv7-0315/iter_36290.hf/projector',
+    slowfast=False,
+    type='xtuner.model.AuroraModel',
+    visual_encoder=dict(
+        order='descending',
+        pretrained_model_name_or_path=
+        '/mnt/program/wlx_data/experiments/vision-aurora-rwkv7-0315/iter_36290.hf/visual_encoder',
+        sort_after_merge=True,
+        type='xtuner.model.aurora.AuroraSigEncoder.from_pretrained',
+        visual_token_merge_ratio=1.0))
+optim_type = 'torch.optim.AdamW'
+optim_wrapper = dict(
+    optimizer=dict(
+        betas=(
+            0.9,
+            0.999,
+        ),
+        lr=8e-05,
+        type='torch.optim.AdamW',
+        weight_decay=0),
+    type='DeepSpeedOptimWrapper')
+param_scheduler = [
+    dict(
+        begin=0,
+        by_epoch=True,
+        convert_to_iter_based=True,
+        end=0.03,
+        start_factor=1e-05,
+        type='mmengine.optim.LinearLR'),
+    dict(
+        T_max=1,
+        begin=0.03,
+        by_epoch=True,
+        convert_to_iter_based=True,
+        eta_min=0.0,
+        type='mmengine.optim.CosineAnnealingLR'),
+]
+pretrained_pth = '/mnt/program/wlx_data/experiments/vision-aurora-rwkv7-0315/iter_36290.hf/projector'
+prompt_template = 'xtuner.utils.PROMPT_TEMPLATE.vicuna'
+randomness = dict(deterministic=False, seed=None)
+resume = False
+runner_type = 'FlexibleRunner'
+save_steps = 10000
+save_total_limit = 2
+size = 384
+slowfast = False
+strategy = dict(
+    config=dict(
+        bf16=dict(enabled=True),
+        fp16=dict(enabled=False, initial_scale_power=16),
+        gradient_accumulation_steps='auto',
+        gradient_clipping='auto',
+        train_micro_batch_size_per_gpu='auto',
+        zero_allow_untested_optimizer=True,
+        zero_force_ds_cpu_optimizer=False,
+        zero_optimization=dict(overlap_comm=True, stage=1)),
+    exclude_frozen_parameters=True,
+    gradient_accumulation_steps=256,
+    gradient_clipping=1,
+    sequence_parallel_size=1,
+    train_micro_batch_size_per_gpu=1,
+    type='xtuner.engine.DeepSpeedStrategy')
+tokenizer = dict(
+    padding_side='right',
+    pretrained_model_name_or_path=
+    '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+    trust_remote_code=True,
+    type='transformers.AutoTokenizer.from_pretrained')
+train_cfg = dict(by_epoch=True, max_epochs=1, val_interval=1)
+train_dataloader = dict(
+    batch_size=1,
+    collate_fn=dict(type='xtuner.dataset.collate_fns.default_collate_fn'),
+    dataset=dict(
+        datasets=[
+            dict(
+                data_path=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_vflan/filtered_allava_caption_vflan.jsonl',
+                dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+                image_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_vflan/data/ALLaVA-4V/',
+                image_processor=dict(
+                    crop_size=384,
+                    pretrained_model_name_or_path=
+                    'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                    size=384,
+                    trust_remote_code=True,
+                    type='transformers.CLIPImageProcessor.from_pretrained'),
+                max_length=4096,
+                offline_processed_text_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_vflan/data/ALLaVA-4V/tokenized-by-rwkv7/tokenized_sandwich_data',
+                pad_image_to_square=True,
+                template_map_fn=dict(
+                    template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                    type='xtuner.dataset.map_fns.template_map_fn_factory'),
+                tokenizer=dict(
+                    padding_side='right',
+                    pretrained_model_name_or_path=
+                    '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                    trust_remote_code=True,
+                    type='transformers.AutoTokenizer.from_pretrained'),
+                type='xtuner.dataset.AuroraDataset'),
+            dict(
+                data_path=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_vflan/filtered_allava_instruct_vflan.jsonl',
+                dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+                image_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_vflan/data/ALLaVA-4V/',
+                image_processor=dict(
+                    crop_size=384,
+                    pretrained_model_name_or_path=
+                    'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                    size=384,
+                    trust_remote_code=True,
+                    type='transformers.CLIPImageProcessor.from_pretrained'),
+                max_length=4096,
+                offline_processed_text_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_vflan/data/ALLaVA-4V/tokenized-by-rwkv7/tokenized_sandwich_data',
+                pad_image_to_square=True,
+                template_map_fn=dict(
+                    template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                    type='xtuner.dataset.map_fns.template_map_fn_factory'),
+                tokenizer=dict(
+                    padding_side='right',
+                    pretrained_model_name_or_path=
+                    '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                    trust_remote_code=True,
+                    type='transformers.AutoTokenizer.from_pretrained'),
+                type='xtuner.dataset.AuroraDataset'),
+            dict(
+                data_path=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llava_mix/filtered_llava_mix.jsonl',
+                dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+                image_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llava_mix/data/LLaVA-Instruct-150K/images/',
+                image_processor=dict(
+                    crop_size=384,
+                    pretrained_model_name_or_path=
+                    'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                    size=384,
+                    trust_remote_code=True,
+                    type='transformers.CLIPImageProcessor.from_pretrained'),
+                max_length=4096,
+                offline_processed_text_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llava_mix/data/LLaVA-Instruct-150K/images/tokenized-by-rwkv7/tokenized_sandwich_data',
+                pad_image_to_square=True,
+                template_map_fn=dict(
+                    template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                    type='xtuner.dataset.map_fns.template_map_fn_factory'),
+                tokenizer=dict(
+                    padding_side='right',
+                    pretrained_model_name_or_path=
+                    '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                    trust_remote_code=True,
+                    type='transformers.AutoTokenizer.from_pretrained'),
+                type='xtuner.dataset.AuroraDataset'),
+            dict(
+                data_path=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_laion/filtered_allava_caption_laion.jsonl',
+                dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+                image_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_laion/data/ALLaVA-4V/',
+                image_processor=dict(
+                    crop_size=384,
+                    pretrained_model_name_or_path=
+                    'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                    size=384,
+                    trust_remote_code=True,
+                    type='transformers.CLIPImageProcessor.from_pretrained'),
+                max_length=4096,
+                offline_processed_text_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_laion/data/ALLaVA-4V/tokenized-by-rwkv7/tokenized_sandwich_data',
+                pad_image_to_square=True,
+                template_map_fn=dict(
+                    template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                    type='xtuner.dataset.map_fns.template_map_fn_factory'),
+                tokenizer=dict(
+                    padding_side='right',
+                    pretrained_model_name_or_path=
+                    '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                    trust_remote_code=True,
+                    type='transformers.AutoTokenizer.from_pretrained'),
+                type='xtuner.dataset.AuroraDataset'),
+            dict(
+                data_path=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_laion/filtered_allava_instruct_laion.jsonl',
+                dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+                image_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_laion/data/ALLaVA-4V/',
+                image_processor=dict(
+                    crop_size=384,
+                    pretrained_model_name_or_path=
+                    'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                    size=384,
+                    trust_remote_code=True,
+                    type='transformers.CLIPImageProcessor.from_pretrained'),
+                max_length=4096,
+                offline_processed_text_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_laion/data/ALLaVA-4V/tokenized-by-rwkv7/tokenized_sandwich_data',
+                pad_image_to_square=True,
+                template_map_fn=dict(
+                    template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                    type='xtuner.dataset.map_fns.template_map_fn_factory'),
+                tokenizer=dict(
+                    padding_side='right',
+                    pretrained_model_name_or_path=
+                    '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                    trust_remote_code=True,
+                    type='transformers.AutoTokenizer.from_pretrained'),
+                type='xtuner.dataset.AuroraDataset'),
+            dict(
+                data_path=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/m4/filtered_m4.jsonl',
+                dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+                image_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/m4/data/M4-Instruct-Data/images/',
+                image_processor=dict(
+                    crop_size=384,
+                    pretrained_model_name_or_path=
+                    'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                    size=384,
+                    trust_remote_code=True,
+                    type='transformers.CLIPImageProcessor.from_pretrained'),
+                max_length=4096,
+                offline_processed_text_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/m4/data/M4-Instruct-Data/images/tokenized-by-rwkv7/tokenized_sandwich_data',
+                pad_image_to_square=True,
+                template_map_fn=dict(
+                    template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                    type='xtuner.dataset.map_fns.template_map_fn_factory'),
+                tokenizer=dict(
+                    padding_side='right',
+                    pretrained_model_name_or_path=
+                    '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                    trust_remote_code=True,
+                    type='transformers.AutoTokenizer.from_pretrained'),
+                type='xtuner.dataset.AuroraDataset'),
+            dict(
+                data_path=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/evol/evol.jsonl',
+                dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+                image_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/evol/',
+                image_processor=dict(
+                    crop_size=384,
+                    pretrained_model_name_or_path=
+                    'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                    size=384,
+                    trust_remote_code=True,
+                    type='transformers.CLIPImageProcessor.from_pretrained'),
+                max_length=4096,
+                offline_processed_text_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/evol/tokenized-by-rwkv7/tokenized_sandwich_data',
+                pad_image_to_square=True,
+                template_map_fn=dict(
+                    template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                    type='xtuner.dataset.map_fns.template_map_fn_factory'),
+                tokenizer=dict(
+                    padding_side='right',
+                    pretrained_model_name_or_path=
+                    '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                    trust_remote_code=True,
+                    type='transformers.AutoTokenizer.from_pretrained'),
+                type='xtuner.dataset.AuroraDataset'),
+            dict(
+                data_path=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llavanext/filtered_llavanext.jsonl',
+                dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+                image_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llavanext/data/LLaVA-NeXT-Data/images/',
+                image_processor=dict(
+                    crop_size=384,
+                    pretrained_model_name_or_path=
+                    'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                    size=384,
+                    trust_remote_code=True,
+                    type='transformers.CLIPImageProcessor.from_pretrained'),
+                max_length=4096,
+                offline_processed_text_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llavanext/data/LLaVA-NeXT-Data/images/tokenized-by-rwkv7/tokenized_sandwich_data',
+                pad_image_to_square=True,
+                template_map_fn=dict(
+                    template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                    type='xtuner.dataset.map_fns.template_map_fn_factory'),
+                tokenizer=dict(
+                    padding_side='right',
+                    pretrained_model_name_or_path=
+                    '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                    trust_remote_code=True,
+                    type='transformers.AutoTokenizer.from_pretrained'),
+                type='xtuner.dataset.AuroraDataset'),
+            dict(
+                data_path=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/miradata/filtered_miradata.jsonl',
+                dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+                image_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/miradata/data/MiraData/frames/',
+                image_processor=dict(
+                    crop_size=384,
+                    pretrained_model_name_or_path=
+                    'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                    size=384,
+                    trust_remote_code=True,
+                    type='transformers.CLIPImageProcessor.from_pretrained'),
+                max_length=4096,
+                offline_processed_text_folder=
+                '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/miradata/data/MiraData/frames/tokenized-by-rwkv7/tokenized_sandwich_data',
+                pad_image_to_square=True,
+                template_map_fn=dict(
+                    template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                    type='xtuner.dataset.map_fns.template_map_fn_factory'),
+                tokenizer=dict(
+                    padding_side='right',
+                    pretrained_model_name_or_path=
+                    '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                    trust_remote_code=True,
+                    type='transformers.AutoTokenizer.from_pretrained'),
+                type='xtuner.dataset.AuroraDataset'),
+        ],
+        type='xtuner.dataset.ConcatDataset'),
+    num_workers=16,
+    sampler=dict(shuffle=True, type='mmengine.dataset.DefaultSampler'))
+train_dataset = dict(
+    datasets=[
+        dict(
+            data_path=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_vflan/filtered_allava_caption_vflan.jsonl',
+            dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+            image_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_vflan/data/ALLaVA-4V/',
+            image_processor=dict(
+                crop_size=384,
+                pretrained_model_name_or_path=
+                'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                size=384,
+                trust_remote_code=True,
+                type='transformers.CLIPImageProcessor.from_pretrained'),
+            max_length=4096,
+            offline_processed_text_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_vflan/data/ALLaVA-4V/tokenized-by-rwkv7/tokenized_sandwich_data',
+            pad_image_to_square=True,
+            template_map_fn=dict(
+                template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                type='xtuner.dataset.map_fns.template_map_fn_factory'),
+            tokenizer=dict(
+                padding_side='right',
+                pretrained_model_name_or_path=
+                '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                trust_remote_code=True,
+                type='transformers.AutoTokenizer.from_pretrained'),
+            type='xtuner.dataset.AuroraDataset'),
+        dict(
+            data_path=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_vflan/filtered_allava_instruct_vflan.jsonl',
+            dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+            image_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_vflan/data/ALLaVA-4V/',
+            image_processor=dict(
+                crop_size=384,
+                pretrained_model_name_or_path=
+                'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                size=384,
+                trust_remote_code=True,
+                type='transformers.CLIPImageProcessor.from_pretrained'),
+            max_length=4096,
+            offline_processed_text_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_vflan/data/ALLaVA-4V/tokenized-by-rwkv7/tokenized_sandwich_data',
+            pad_image_to_square=True,
+            template_map_fn=dict(
+                template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                type='xtuner.dataset.map_fns.template_map_fn_factory'),
+            tokenizer=dict(
+                padding_side='right',
+                pretrained_model_name_or_path=
+                '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                trust_remote_code=True,
+                type='transformers.AutoTokenizer.from_pretrained'),
+            type='xtuner.dataset.AuroraDataset'),
+        dict(
+            data_path=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llava_mix/filtered_llava_mix.jsonl',
+            dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+            image_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llava_mix/data/LLaVA-Instruct-150K/images/',
+            image_processor=dict(
+                crop_size=384,
+                pretrained_model_name_or_path=
+                'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                size=384,
+                trust_remote_code=True,
+                type='transformers.CLIPImageProcessor.from_pretrained'),
+            max_length=4096,
+            offline_processed_text_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llava_mix/data/LLaVA-Instruct-150K/images/tokenized-by-rwkv7/tokenized_sandwich_data',
+            pad_image_to_square=True,
+            template_map_fn=dict(
+                template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                type='xtuner.dataset.map_fns.template_map_fn_factory'),
+            tokenizer=dict(
+                padding_side='right',
+                pretrained_model_name_or_path=
+                '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                trust_remote_code=True,
+                type='transformers.AutoTokenizer.from_pretrained'),
+            type='xtuner.dataset.AuroraDataset'),
+        dict(
+            data_path=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_laion/filtered_allava_caption_laion.jsonl',
+            dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+            image_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_laion/data/ALLaVA-4V/',
+            image_processor=dict(
+                crop_size=384,
+                pretrained_model_name_or_path=
+                'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                size=384,
+                trust_remote_code=True,
+                type='transformers.CLIPImageProcessor.from_pretrained'),
+            max_length=4096,
+            offline_processed_text_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_caption_laion/data/ALLaVA-4V/tokenized-by-rwkv7/tokenized_sandwich_data',
+            pad_image_to_square=True,
+            template_map_fn=dict(
+                template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                type='xtuner.dataset.map_fns.template_map_fn_factory'),
+            tokenizer=dict(
+                padding_side='right',
+                pretrained_model_name_or_path=
+                '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                trust_remote_code=True,
+                type='transformers.AutoTokenizer.from_pretrained'),
+            type='xtuner.dataset.AuroraDataset'),
+        dict(
+            data_path=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_laion/filtered_allava_instruct_laion.jsonl',
+            dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+            image_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_laion/data/ALLaVA-4V/',
+            image_processor=dict(
+                crop_size=384,
+                pretrained_model_name_or_path=
+                'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                size=384,
+                trust_remote_code=True,
+                type='transformers.CLIPImageProcessor.from_pretrained'),
+            max_length=4096,
+            offline_processed_text_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/allava_instruct_laion/data/ALLaVA-4V/tokenized-by-rwkv7/tokenized_sandwich_data',
+            pad_image_to_square=True,
+            template_map_fn=dict(
+                template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                type='xtuner.dataset.map_fns.template_map_fn_factory'),
+            tokenizer=dict(
+                padding_side='right',
+                pretrained_model_name_or_path=
+                '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                trust_remote_code=True,
+                type='transformers.AutoTokenizer.from_pretrained'),
+            type='xtuner.dataset.AuroraDataset'),
+        dict(
+            data_path=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/m4/filtered_m4.jsonl',
+            dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+            image_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/m4/data/M4-Instruct-Data/images/',
+            image_processor=dict(
+                crop_size=384,
+                pretrained_model_name_or_path=
+                'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                size=384,
+                trust_remote_code=True,
+                type='transformers.CLIPImageProcessor.from_pretrained'),
+            max_length=4096,
+            offline_processed_text_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/m4/data/M4-Instruct-Data/images/tokenized-by-rwkv7/tokenized_sandwich_data',
+            pad_image_to_square=True,
+            template_map_fn=dict(
+                template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                type='xtuner.dataset.map_fns.template_map_fn_factory'),
+            tokenizer=dict(
+                padding_side='right',
+                pretrained_model_name_or_path=
+                '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                trust_remote_code=True,
+                type='transformers.AutoTokenizer.from_pretrained'),
+            type='xtuner.dataset.AuroraDataset'),
+        dict(
+            data_path=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/evol/evol.jsonl',
+            dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+            image_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/evol/',
+            image_processor=dict(
+                crop_size=384,
+                pretrained_model_name_or_path=
+                'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                size=384,
+                trust_remote_code=True,
+                type='transformers.CLIPImageProcessor.from_pretrained'),
+            max_length=4096,
+            offline_processed_text_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/evol/tokenized-by-rwkv7/tokenized_sandwich_data',
+            pad_image_to_square=True,
+            template_map_fn=dict(
+                template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                type='xtuner.dataset.map_fns.template_map_fn_factory'),
+            tokenizer=dict(
+                padding_side='right',
+                pretrained_model_name_or_path=
+                '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                trust_remote_code=True,
+                type='transformers.AutoTokenizer.from_pretrained'),
+            type='xtuner.dataset.AuroraDataset'),
+        dict(
+            data_path=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llavanext/filtered_llavanext.jsonl',
+            dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+            image_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llavanext/data/LLaVA-NeXT-Data/images/',
+            image_processor=dict(
+                crop_size=384,
+                pretrained_model_name_or_path=
+                'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                size=384,
+                trust_remote_code=True,
+                type='transformers.CLIPImageProcessor.from_pretrained'),
+            max_length=4096,
+            offline_processed_text_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/llavanext/data/LLaVA-NeXT-Data/images/tokenized-by-rwkv7/tokenized_sandwich_data',
+            pad_image_to_square=True,
+            template_map_fn=dict(
+                template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                type='xtuner.dataset.map_fns.template_map_fn_factory'),
+            tokenizer=dict(
+                padding_side='right',
+                pretrained_model_name_or_path=
+                '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                trust_remote_code=True,
+                type='transformers.AutoTokenizer.from_pretrained'),
+            type='xtuner.dataset.AuroraDataset'),
+        dict(
+            data_path=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/miradata/filtered_miradata.jsonl',
+            dataset_map_fn='xtuner.dataset.map_fns.aurora_map_fn',
+            image_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/miradata/data/MiraData/frames/',
+            image_processor=dict(
+                crop_size=384,
+                pretrained_model_name_or_path=
+                'laion/CLIP-ViT-bigG-14-laion2B-39B-b160k',
+                size=384,
+                trust_remote_code=True,
+                type='transformers.CLIPImageProcessor.from_pretrained'),
+            max_length=4096,
+            offline_processed_text_folder=
+            '/mnt/program/wlx_data/datasets/wchai/AuroraCap-trainset/language/miradata/data/MiraData/frames/tokenized-by-rwkv7/tokenized_sandwich_data',
+            pad_image_to_square=True,
+            template_map_fn=dict(
+                template='xtuner.utils.PROMPT_TEMPLATE.vicuna',
+                type='xtuner.dataset.map_fns.template_map_fn_factory'),
+            tokenizer=dict(
+                padding_side='right',
+                pretrained_model_name_or_path=
+                '/mnt/program/wlx_data/ckpt/hf_models/fla-hub/rwkv7-1.5B-world/',
+                trust_remote_code=True,
+                type='transformers.AutoTokenizer.from_pretrained'),
+            type='xtuner.dataset.AuroraDataset'),
+    ],
+    type='xtuner.dataset.ConcatDataset')
+visual_encoder_name_or_path = '/mnt/program/wlx_data/experiments/vision-aurora-rwkv7-0315/iter_36290.hf/visual_encoder'
+visual_token_merge_ratio = 1.0
+visualizer = None
+warmup_ratio = 0.03
+weight_decay = 0
+work_dir = '/mnt/program/wlx_data/experiments/language-aurora-rwkv7-0317'