← All models
VibeVoice 1.5B
vibevoice
Text to Speechby vibevoice
Generate long, expressive multi-voice speech using Microsoft's powerful TTS
Pricing
- Price
- 5 cr / minute
Prices in credits (1 credit = $0.01).
Data schema
Input
| Field | Type | Description |
|---|---|---|
| seed | — | Random seed for reproducible generation. |
| scriptrequired | string | The script to convert to speech. Can be formatted with 'Speaker X:' prefixes for multi-speaker dialogues. |
| speakersrequired | array | List of speakers to use for the script. If not provided, will be inferred from the script or voice samples. |
| cfg_scale | number | CFG (Classifier-Free Guidance) scale for generation. Higher values increase adherence to text. |
Output
| Field | Type | Description |
|---|---|---|
| rtf | number | Real-time factor (generation_time / audio_duration). Lower is better. |
| audio | — | The generated audio file containing the speech |
| duration | number | Duration of the generated audio in seconds |
| sample_rate | integer | Sample rate of the generated audio |
| generation_time | number | Time taken to generate the audio in seconds |
