stable-audio-tools
View on GitHubGenerative models for conditional audio generation
Stability AI's toolkit for training and running generative audio models: latent diffusion, autoencoders, and LMs with text/audio conditioning. Includes training scripts, fine-tuning/LoRA support, and a Gradio UI for Stable Audio Open.
Use Cases
Text-to-audio and sound effect generationTraining conditional diffusion audio models from scratchFine-tuning pretrained audio models on custom datasetsLoRA fine-tuning for audio diffusion modelsAudio inpainting and continuationTraining audio autoencoders for latent diffusionRunning a local Gradio demo for Stable Audio OpenBuilding WebDataset/S3 audio training pipelinesMulti-GPU and multi-node audio model trainingUnwrapping Lightning checkpoints for inference
Built With
- Language
- Python
- Frameworks
- PyTorch · PyTorch Lightning · Hugging Face Hub · Gradio · Transformers · DeepSpeed · Flash Attention · WandB · WebDataset · uv
Tags
audio-generation · text-to-audio · diffusion-models · latent-diffusion · generative-audio · training · inference · autoencoder · fine-tuning · lora · audio-codec · music-generation · conditioning · gradio · deep-learning · checkpoints