schwarztgyt commited on
Commit
f5a0bd8
·
1 Parent(s): f5ff041
Files changed (1) hide show
  1. README.md +6 -6
README.md CHANGED
@@ -12,11 +12,11 @@ tags:
12
  - arxiv:2602.10934
13
  ---
14
 
15
- # Moss-Audio-Tokenizer-V2
16
 
17
  This is the code for the 48khz stereo version of MOSS-Audio-Tokenizer presented in [MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models](https://arxiv.org/abs/2602.10934).
18
 
19
- **MOSS-Audio-Tokenizer-V2** is a unified discrete audio tokenizer based on the **Cat** (**C**ausal **A**udio **T**okenizer with **T**ransformer) architecture. Scaling to 2 billion parameters, it functions as a unified discrete interface, delivering both lossless-quality reconstruction and high-level semantic alignment.
20
 
21
  **Key Features:**
22
 
@@ -46,7 +46,7 @@ loaded with `trust_remote_code=True`.
46
 
47
  ## Intended Use
48
 
49
- MOSS-Audio-Tokenizer-V2 is intended for research and development on audio tokenization, neural codec reconstruction,
50
  native audio foundation models, speech/audio understanding, speech generation, and related downstream modeling. It can
51
  encode 48 kHz stereo waveforms into discrete audio codes and decode those codes back to waveforms.
52
 
@@ -93,7 +93,7 @@ import torch
93
  from transformers import AutoModel
94
  import torchaudio
95
 
96
- repo_id = "OpenMOSS-Team/MOSS-Audio-Tokenizer-V2"
97
  model = AutoModel.from_pretrained(repo_id, trust_remote_code=True).eval()
98
 
99
  audio_path = "demo/demo_gt.wav" # replace with your own 48 kHz stereo audio path if needed
@@ -146,7 +146,7 @@ The quantizer always runs in fp32.
146
  import torch
147
  from transformers import AutoModel
148
 
149
- repo_id = "OpenMOSS-Team/MOSS-Audio-Tokenizer-V2"
150
  model = AutoModel.from_pretrained(repo_id, trust_remote_code=True).eval()
151
  audio = torch.randn(2, 48000 * 6) # dummy stereo waveform
152
 
@@ -188,5 +188,5 @@ If you use this code or result in your paper, please cite our work as:
188
  ```
189
 
190
  ## License
191
- MOSS-Audio-Tokenizer-V2 is released under the Apache 2.0 license. See `LICENSE` for the full license text.
192
 
 
12
  - arxiv:2602.10934
13
  ---
14
 
15
+ # Moss-Audio-Tokenizer-v2
16
 
17
  This is the code for the 48khz stereo version of MOSS-Audio-Tokenizer presented in [MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models](https://arxiv.org/abs/2602.10934).
18
 
19
+ **MOSS-Audio-Tokenizer-v2** is a unified discrete audio tokenizer based on the **Cat** (**C**ausal **A**udio **T**okenizer with **T**ransformer) architecture. Scaling to 2 billion parameters, it functions as a unified discrete interface, delivering both lossless-quality reconstruction and high-level semantic alignment.
20
 
21
  **Key Features:**
22
 
 
46
 
47
  ## Intended Use
48
 
49
+ MOSS-Audio-Tokenizer-v2 is intended for research and development on audio tokenization, neural codec reconstruction,
50
  native audio foundation models, speech/audio understanding, speech generation, and related downstream modeling. It can
51
  encode 48 kHz stereo waveforms into discrete audio codes and decode those codes back to waveforms.
52
 
 
93
  from transformers import AutoModel
94
  import torchaudio
95
 
96
+ repo_id = "OpenMOSS-Team/MOSS-Audio-Tokenizer-v2"
97
  model = AutoModel.from_pretrained(repo_id, trust_remote_code=True).eval()
98
 
99
  audio_path = "demo/demo_gt.wav" # replace with your own 48 kHz stereo audio path if needed
 
146
  import torch
147
  from transformers import AutoModel
148
 
149
+ repo_id = "OpenMOSS-Team/MOSS-Audio-Tokenizer-v2"
150
  model = AutoModel.from_pretrained(repo_id, trust_remote_code=True).eval()
151
  audio = torch.randn(2, 48000 * 6) # dummy stereo waveform
152
 
 
188
  ```
189
 
190
  ## License
191
+ MOSS-Audio-Tokenizer-v2 is released under the Apache 2.0 license. See `LICENSE` for the full license text.
192