Feature Extraction
Transformers
Safetensors
moss-audio-tokenizer
audio
audio-tokenizer
neural-codec
moss-tts-family
MOSS Audio Tokenizer
speech-tokenizer
trust-remote-code
custom_code
Instructions to use OpenMOSS-Team/MOSS-Audio-Tokenizer-v2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use OpenMOSS-Team/MOSS-Audio-Tokenizer-v2 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("feature-extraction", model="OpenMOSS-Team/MOSS-Audio-Tokenizer-v2", trust_remote_code=True)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("OpenMOSS-Team/MOSS-Audio-Tokenizer-v2", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
Commit ·
f5a0bd8
1
Parent(s): f5ff041
add
Browse files
README.md
CHANGED
|
@@ -12,11 +12,11 @@ tags:
|
|
| 12 |
- arxiv:2602.10934
|
| 13 |
---
|
| 14 |
|
| 15 |
-
# Moss-Audio-Tokenizer-
|
| 16 |
|
| 17 |
This is the code for the 48khz stereo version of MOSS-Audio-Tokenizer presented in [MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models](https://arxiv.org/abs/2602.10934).
|
| 18 |
|
| 19 |
-
**MOSS-Audio-Tokenizer-
|
| 20 |
|
| 21 |
**Key Features:**
|
| 22 |
|
|
@@ -46,7 +46,7 @@ loaded with `trust_remote_code=True`.
|
|
| 46 |
|
| 47 |
## Intended Use
|
| 48 |
|
| 49 |
-
MOSS-Audio-Tokenizer-
|
| 50 |
native audio foundation models, speech/audio understanding, speech generation, and related downstream modeling. It can
|
| 51 |
encode 48 kHz stereo waveforms into discrete audio codes and decode those codes back to waveforms.
|
| 52 |
|
|
@@ -93,7 +93,7 @@ import torch
|
|
| 93 |
from transformers import AutoModel
|
| 94 |
import torchaudio
|
| 95 |
|
| 96 |
-
repo_id = "OpenMOSS-Team/MOSS-Audio-Tokenizer-
|
| 97 |
model = AutoModel.from_pretrained(repo_id, trust_remote_code=True).eval()
|
| 98 |
|
| 99 |
audio_path = "demo/demo_gt.wav" # replace with your own 48 kHz stereo audio path if needed
|
|
@@ -146,7 +146,7 @@ The quantizer always runs in fp32.
|
|
| 146 |
import torch
|
| 147 |
from transformers import AutoModel
|
| 148 |
|
| 149 |
-
repo_id = "OpenMOSS-Team/MOSS-Audio-Tokenizer-
|
| 150 |
model = AutoModel.from_pretrained(repo_id, trust_remote_code=True).eval()
|
| 151 |
audio = torch.randn(2, 48000 * 6) # dummy stereo waveform
|
| 152 |
|
|
@@ -188,5 +188,5 @@ If you use this code or result in your paper, please cite our work as:
|
|
| 188 |
```
|
| 189 |
|
| 190 |
## License
|
| 191 |
-
MOSS-Audio-Tokenizer-
|
| 192 |
|
|
|
|
| 12 |
- arxiv:2602.10934
|
| 13 |
---
|
| 14 |
|
| 15 |
+
# Moss-Audio-Tokenizer-v2
|
| 16 |
|
| 17 |
This is the code for the 48khz stereo version of MOSS-Audio-Tokenizer presented in [MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models](https://arxiv.org/abs/2602.10934).
|
| 18 |
|
| 19 |
+
**MOSS-Audio-Tokenizer-v2** is a unified discrete audio tokenizer based on the **Cat** (**C**ausal **A**udio **T**okenizer with **T**ransformer) architecture. Scaling to 2 billion parameters, it functions as a unified discrete interface, delivering both lossless-quality reconstruction and high-level semantic alignment.
|
| 20 |
|
| 21 |
**Key Features:**
|
| 22 |
|
|
|
|
| 46 |
|
| 47 |
## Intended Use
|
| 48 |
|
| 49 |
+
MOSS-Audio-Tokenizer-v2 is intended for research and development on audio tokenization, neural codec reconstruction,
|
| 50 |
native audio foundation models, speech/audio understanding, speech generation, and related downstream modeling. It can
|
| 51 |
encode 48 kHz stereo waveforms into discrete audio codes and decode those codes back to waveforms.
|
| 52 |
|
|
|
|
| 93 |
from transformers import AutoModel
|
| 94 |
import torchaudio
|
| 95 |
|
| 96 |
+
repo_id = "OpenMOSS-Team/MOSS-Audio-Tokenizer-v2"
|
| 97 |
model = AutoModel.from_pretrained(repo_id, trust_remote_code=True).eval()
|
| 98 |
|
| 99 |
audio_path = "demo/demo_gt.wav" # replace with your own 48 kHz stereo audio path if needed
|
|
|
|
| 146 |
import torch
|
| 147 |
from transformers import AutoModel
|
| 148 |
|
| 149 |
+
repo_id = "OpenMOSS-Team/MOSS-Audio-Tokenizer-v2"
|
| 150 |
model = AutoModel.from_pretrained(repo_id, trust_remote_code=True).eval()
|
| 151 |
audio = torch.randn(2, 48000 * 6) # dummy stereo waveform
|
| 152 |
|
|
|
|
| 188 |
```
|
| 189 |
|
| 190 |
## License
|
| 191 |
+
MOSS-Audio-Tokenizer-v2 is released under the Apache 2.0 license. See `LICENSE` for the full license text.
|
| 192 |
|