Music models
41 models. Compare AI music generation models by input — a text prompt or lyrics — and by output length and pricing unit.
Price ranks a model against others of the same modality — a second of video generation and a second of image generation aren't the same unit of work, so thirds are computed within each modality, not across all of them.
41 of 41 models

ACE Step
Ace Step · Music
Generate music with lyrics from text using ACE-Step
0.025 cr / second
Try in Studio →
ACE Step Prompt To Audio
Ace Step · Music
Generate music from a simple prompt using ACE-Step
0.025 cr / second
Try in Studio →
CSM-1B
Sesame · Music
CSM (Conversational Speech Model) is a speech generation model from Sesame that generates RVQ audio codes from text and audio inputs.
0.00375 cr / character
Try in Studio →
Elevenlabs
Elevenlabs · Music
Generate realistic audio dialogues using Eleven-v3 from ElevenLabs.
0.013 cr / character
Try in Studio →
Elevenlabs Music
Elevenlabs · Music
Generate high quality, realistic music with fine controls using Elevenlabs Music!
75 cr / minute
Try in Studio →
Elevenlabs Sound Effects V2
Elevenlabs · Music
Generate sound effects using ElevenLabs advanced sound effects model.
0.250 cr / second
Try in Studio →
Elevenlabs Tts Eleven V3
Elevenlabs · Music
Generate text-to-speech audio using Eleven-v3 from ElevenLabs.
0.013 cr / character
Try in Studio →
ElevenLabs TTS Multilingual v2
Elevenlabs · Music
Generate multilingual text-to-speech audio using ElevenLabs TTS Multilingual v2.
0.013 cr / character
Try in Studio →
Gemini TTS
Google · Music
Use Gemini TTS Models to convert your prompts to real audio.
125 cr / 1M tokens
Try in Studio →
Ltx 2.3 Quality
Lightricks · Music
Text to Audio high-quality using LTX-2.3
0.301 cr / megapixel
Try in Studio →
Ltx 2.3 Quality
Lightricks · Music
Text to Audio high-quality using LTX-2.3 with Lora
0.301 cr / megapixel
Try in Studio →
MiniMax (Hailuo AI) Music
MiniMax · Music
Generate music from text prompts using the MiniMax model, which leverages advanced AI techniques to create high-quality, diverse musical…
4.38 cr / request
Try in Studio →
MiniMax (Hailuo AI) Music v1.5
MiniMax · Music
Generate music from text prompts using the MiniMax model, which leverages advanced AI techniques to create high-quality, diverse musical…
3.75 cr / request
Try in Studio →
Minimax Music
MiniMax · Music
Generate music from text prompts using the MiniMax Music 2.0 model, which leverages advanced AI techniques to create high-quality, diverse…
3.75 cr / request
Try in Studio →
Minimax Music 2.5
MiniMax · Music
MiniMax Music 2.5 creates complete tracks with singing, backing music, and detailed arrangements from lyrics and a style description.
18.75 cr / track
Try in Studio →
Minimax Music 2.6
MiniMax · Music
MiniMax Music 2.6 creates complete tracks with singing, backing music, and detailed arrangements from lyrics and a style description.
18.75 cr / track
Try in Studio →
MiniMax Music 3
MiniMax · Music
MiniMax Music 3 is a high-performance music generation model for creating complete songs up to five minutes long
0.156 cr / second
Try in Studio →
Mirelo SFX1.6
Mirelo AI · Music
Generate ambient sounds for any text prompt. Now you can turn any SFX into a natural loop for ambient soundscapes.
0.156 cr / second
Try in Studio →
music generator
Cassetteai · Music
CassetteAI’s model generates a 30-second sample in under 2 seconds and a full 3-minute track in under 10 seconds.
0.156 cr / second
Try in Studio →
Seed Audio 1.0
ByteDance · Music
Seed Audio 1.0 is a new audio model from Bytedance that can generate high-quality, natural sounding audio using text, reference audios or…
23.44 cr / minute
Try in Studio →
Sonilo V1.1 Text to Music
Sonilo · Music
Generates licensed, commercial-use-safe music from a single text prompt, with full control over style, mood, instrumentation, and exact…
0.313 cr / second
Try in Studio →
Sound Effects Generator
Cassetteai · Music
Create stunningly realistic sound effects in seconds - CassetteAI's Sound Effects Model generates high-quality SFX up to 30 seconds long in…
0.156 cr / second
Try in Studio →
Stable Audio 2.5
Stability AI · Music
Generate high quality music and sound effects using Stable Audio 2.5 from StabilityAI
25 cr / track
Try in Studio →
Stable Audio 3
Stability AI · Music
Stable Audio 3 Medium is a 1.4 billion parameter latent diffusion model that generates high-quality stereo music up to 6 minutes from text…
4.7 cr / track
Try in Studio →
Stable Audio 3
Stability AI · Music
Stable Audio 3 Small Music Base is the foundational 459 million parameter checkpoint generating full music compositions up to 2 minutes…
3.51 cr / track
Try in Studio →
Stable Audio 3 Medium Base Text to Audio
Stability AI · Music
Stable Audio 3 Medium Base is the foundational 1.4 billion parameter text-to-audio checkpoint generating stereo music up to 6 minutes…
5.99 cr / track
Try in Studio →
Stable Audio 3 Small Music Text to Audio
Stability AI · Music
Stable Audio 3 Small Music is a 459 million parameter latent diffusion model that generates full stereo music compositions up to 2 minutes…
2.71 cr / track
Try in Studio →
Stable Audio 3 Small SFX Base Text to Audio
Stability AI · Music
Stable Audio 3 Small SFX Base is the foundational 459 million parameter checkpoint generating sound effects from text prompts, intended as…
3.54 cr / track
Try in Studio →
Stable Audio 3 Small SFX Text to Audio
Stability AI · Music
Stable Audio 3 Small SFX is a 459 million parameter latent diffusion model that generates high-quality sound effects from text prompts…
2.58 cr / track
Try in Studio →
Stable Audio Open
Stability AI · Music
Open source text-to-audio model.
0.156 cr / second
Try in Studio →Music, on Infery.ai
Music is its own catalogue category, separate from text-to-speech and speech-to-text: most of it generates an instrumental or vocal track from a text prompt. A small number also require a reference audio clip — voice cloning is the clear case, where the model needs a sample of the voice it's meant to sing in, not just a description of one.
It is a catalogue, not one model
Models differ in whether they accept lyrics as a direct input alongside a style description — ace-step, for one, takes both a lyrics field and a tags field, where most models take a single prompt — and in maximum track length. Pricing unit varies more here than in any other modality: per-second and per-image are tied as the two most common, but per-operation, per-character, per-request, per-minute, per-megapixel and per-token pricing all appear too — eight units in total, so no single price-per-track figure applies across the category.
Open the Studio with a music model already picked
Free trial credits, no card. Filter above, or start from a blank chat and pick as you go.



