MeduxMedux

Generate > Create Audio Driven Video

Create Audio Driven Video

Generate an avatar video by pairing a reusable avatar with an uploaded audio file.

POST/api/app/v1/generate/video/audio_driven

Examples

curl -X POST https://api.medux.io/api/app/v1/generate/video/audio_driven \
  -H 'Authorization: Bearer $MEDUX_API_KEY' \
  -H 'Content-Type: application/json' \
  -d '{"aspect_ratio":"ASPECT_RATIO","audio_file_id":"AUDIO_FILE_ID","avatar_asset_id":"AVATAR_ASSET_ID","clarity":"CLARITY","duration_seconds":1,"links":["https://example.com/reference"],"model":"MODEL","model_id":"MODEL_ID","title":"Demo title"}'

Media Samples

Approved examples for understanding request inputs, response shape, and official example output.

Official audio-driven talking video

This example uses talking-video-audio-standard.

Sample request

Generate a talking video from an official avatar and uploaded narration audio.

avatar_asset_idofficial_avatar_demo_001audio_file_id{audio_file_id}duration_seconds7clarity1080Paspect_ratio16:9model_idtalking-video-audio-standard

Sample response

Official example output for preview only. It is not a user Media Result.

output_urlOfficial example video output

Example output

Auth Requirements

Authentication is required via Authorization header.

Preconditions

Prepare avatar and audio assets before calling this endpoint.

Requires avatar_asset_id from your Media Assets or official public assets, plus audio_file_id.

Also accepts optional duration_seconds, links, clarity, aspect_ratio, and model.

Request

Body

application/json
Authorizationstringrequired

Bearer token or API key.

Location: HEADER

aspect_ratiostringoptional

Requested output aspect ratio, such as 16:9 or 9:16.

Location: BODY

audio_file_idstringrequired

No description provided.

Location: BODY

avatar_asset_idstringrequired

Reusable avatar asset ID owned by the current user or listed as an official public asset.

Location: BODY

claritystringoptional

Requested output resolution label, such as 1080P or 2K.

Location: BODY

duration_secondsint32optional

Requested output duration, in seconds.

Location: BODY

linksarray<string>optional

Optional reference links submitted from the Playground form.

Location: BODY

modelstringoptional

Generation model label or version selected in the Playground form.

Location: BODY

model_idstringoptional

Stable public Medux model identifier.

Location: BODY

titlestringoptional

No description provided.

Location: BODY

Response

Response

application/json
codeint32optional

Application response code.

CodeMeaning
0OK
12Invalid input
1401Insufficient credits
1402Asset category does not match this operation
1404Provider returned an error
1405Provider request timed out
13Authentication is required
16Rate limit exceeded
99Server error

Available options: 0 12 1410 1409 1401 1402 1407 1408 1404 1405 13 16 99

Location: RESPONSE

data.assetobjectoptional

No description provided.

Location: RESPONSE

data.paid_plan_requiredobjectoptional

No description provided.

Location: RESPONSE

data.taskobjectoptional

No description provided.

Location: RESPONSE

messagestringoptional

No description provided.

Available options: ok invalid input invalid model paid plan required insufficient credits asset category mismatch asset locked asset expired provider error provider timeout unauthenticated rate limit server error

Location: RESPONSE

MCP Tool

This endpoint is also available through the Medux-hosted remote MCP service.

Video / Audio-Driven Lip Sync

Create an avatar video from a source audio file and reusable avatar.

Invocation Example

Create a 7 second 1080P 16:9 talking video using avatar_asset_id {avatar_asset_id} and audio_file_id {audio_file_id}. Use model_id talking-video-audio-standard.

medux_video_create_audio_drivenResult: video
avatar_asset_id{avatar_asset_id}audio_file_id{audio_file_id}model_idtalking-video-audio-standard