Skip to main content
Make sure you add your s3 details for voice_cloning server, so you can receive image generated in your bucket. Images generated without s3 details being added will be delete after 24 hours
Find all available voice models HERE.

Request

Make a POST request to below endpoint and pass the required parameters as a request body.
curl

Example

Body

json

Body Attributes

string
required
Your API Key used for request authorization.
string
required
URL (YouTube links supported) or valid .wav file base64 data whose audio you want to clone with the model.
string
required
ID of the voice cover model Find Models Here.
string
default:"none"
Voice pitch conversion. Options:
  • m2f: Male-to-Female
  • f2m: Female-to-Male
  • none: No pitch conversion
string
default:"rmvpe"
Pitch detection algorithm. Default: rmvpe.
number
default:"0.5"
Rate of control for generated voice leakage. Higher values bias model towards training data. Default: 0.5.
integer
Seed for reproducibility. Same seed gives the same output. Pass null for a random seed.
string
default:"english"
The language of the cloned voice. Default: english.
string
default:"neutral"
Emotional tone of the generated voice. Default: neutral.
number
default:"1.0"
Floating point value for playback speed of the speaker. Default: 1.0.
integer
default:"3"
Median filtering length to reduce breathiness and artifacts. Default: 3.
number
default:"0.25"
Mix between original loudness and fixed loudness. Default: 0.25.
integer
Hop length for pitch changes (only applies when using mangio-crepe).
number
default:"0.33"
Controls similarity to original vocals (voiceless consonants). Default: 0.33.
number
Adjust lead vocals volume. Range: -5 (decrease) to +5 (increase).
number
Adjust backup vocals volume. Range: -5 (decrease) to +5 (increase).
number
Adjust instrumental volume. Range: -5 (decrease) to +5 (increase).
number
default:"0.15"
Reverb room size. Default: 0.15.
number
default:"0.2"
Reverb for generated vocals. Default: 0.2.
number
default:"0.8"
Reverb for original vocals. Default: 0.8.
number
default:"0.7"
High-frequency damping factor in reverb. Default: 0.7.
boolean
default:"false"
Whether the input sound clip is in base64 format. Default: false.
boolean
default:"false"
Whether you want the output to be auto-deleted from the server after a short time. Default: false.
string
A URL to receive a POST API call once the voice cloning process is complete.
string
This ID is returned in the webhook callback to identify the request.