Instructions to use sammoran-phd/cara-native-stable-audio with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Stable Audio Tools
How to use sammoran-phd/cara-native-stable-audio with Stable Audio Tools:
import torch import torchaudio from einops import rearrange from stable_audio_tools import get_pretrained_model from stable_audio_tools.inference.generation import generate_diffusion_cond device = "cuda" if torch.cuda.is_available() else "cpu" # Download model model, model_config = get_pretrained_model("sammoran-phd/cara-native-stable-audio") sample_rate = model_config["sample_rate"] sample_size = model_config["sample_size"] model = model.to(device) # Set up text and timing conditioning conditioning = [{ "prompt": "128 BPM tech house drum loop", }] # Generate stereo audio output = generate_diffusion_cond( model, conditioning=conditioning, sample_size=sample_size, device=device ) # Rearrange audio batch to a single sequence output = rearrange(output, "b d n -> d (b n)") # Peak normalize, clip, convert to int16, and save to file output = output.to(torch.float32).div(torch.max(torch.abs(output))).clamp(-1, 1).mul(32767).to(torch.int16).cpu() torchaudio.save("output.wav", output, sample_rate) - Notebooks
- Google Colab
- Kaggle
| { | |
| "checkpoint": "/mnt/azureml/cr/j/9bc2eeb108a443efacf93b6c3c501d21/cap/data-capability/wd/output_dir/native_stable_audio_full.ckpt", | |
| "created_at": "2026-07-16T08:30:43.618808+00:00", | |
| "dry_run": false, | |
| "expected_steps": 7665, | |
| "global_step": 7665, | |
| "hf_auth_source": "azure_key_vault", | |
| "manifest_file": "/mnt/azureml/cr/j/9bc2eeb108a443efacf93b6c3c501d21/cap/data-capability/wd/INPUT_manifest_file/manifest.jsonl", | |
| "metrics": { | |
| "cara/family_ce": 0.11480632424354553, | |
| "cara/family_top1": 1.0, | |
| "cara/loss_weight": 0.05000000074505806, | |
| "cara/pool_ce": 1.48419189453125, | |
| "cara/pool_top1": 0.5, | |
| "train/loss": 0.9373847246170044, | |
| "train/lr": 9.999999747378752e-06, | |
| "train/mse_context_loss": 0.0, | |
| "train/mse_loss": 0.8796790242195129, | |
| "train/mse_masked_loss": 1.447316288948059, | |
| "train/mse_signal": 0.8669597506523132, | |
| "train/std_data": 1.0021560192108154, | |
| "train/std_targets": 1.4167636632919312 | |
| }, | |
| "registry_sha256": "5f54875c2f2ab6b875b266e13638ca606a2c8a2fe5b145daf1638ad3a08c38cc", | |
| "seed": 20260716, | |
| "status": "passed", | |
| "test_name": "38_native_stable_audio_training", | |
| "training_contract": { | |
| "arc_discriminator_checkpoint": "/path/to/base/rf/model", | |
| "arc_enabled": false, | |
| "arc_removed": true, | |
| "reason": "The published Stable Audio Open Small config references an unavailable ARC discriminator checkpoint. Phase 2 uses the standard conditional-diffusion objective plus the checkpoint-owned CARA pool/family loss.", | |
| "training_wrapper_mode": "diffusion_cond_plain_with_native_cara_loss" | |
| }, | |
| "training_rows": 61325, | |
| "training_wrapper_class": "DiffusionCondTrainingWrapper" | |
| } |