中文 | English
概述
百度智能云曦灵数字人开放平台现已完全适配MCP协议。欢迎创作者加入体验。曦灵数字人提供的MCP服务器包含了13个符合MCP协议标准的API接口,包括基础视频生成、高级视频生成、音色克隆等。基于MCP Python SDK开发,任何支持MCP协议的代理助手(如Claude、Cursor、Cline和千帆AppBuilder)都可以快速接入。
我们提供多种工具以满足不同场景的需求。它允许您快速集成大型模型中的数字人服务,并轻松构建数字人应用程序。 如果您对数字人有更多的期望并希望更深入地集成数字人服务,请访问Baidu智能云曦灵数字人开放平台联系我们。更多功能也将逐步在MCP中开放,敬请期待。
| 功能 | <div style="text-align: center">功能描述</div> | <div style="text-align: center">包含工具</div> |
|---|---|---|
| 2D少量样本数字人 | 根据上传的真实人物录制视频生成数字肖像,仅可用于基础视频制作,数字人使用通用唇动驱动。 | • generateLite2dGeneralVideo<br> • getLite2dGeneralStatus |
| 数字人视频合成 | 根据选定的数字肖像和音色生成数字人视频 | • generateDhVideo<br> • getDhVideoStatus |
| 123数字人视频 | 提供一段10秒到4分钟的实时流视频,说“123”,对应的数字人视频可以直接生成,无需生成肖像 | • generateDh123Video<br> • getDh123VideoStatus |
| 语音合成 | 基于提供的文本内容和选定的音色,无需视频即可生成相应的音频 | • generateText2Audio<br> • getText2AudioStatus |
| 文件上传 | 根据服务类型上传所需文件。 | • uploadFiles |
| 语音查询 | 查询可用系统语音人才。 | • getVoices |
| 肖像查询 | 查询可用肖像 | • getFigures |
| 音色克隆 | 根据上传的音频生成音色,可用于语音合成和视频制作。 | • generateVoiceClone <br>• getVoiceCloneStatus |
使用文件ID为xxx的视频文件生成一个名为“张三”的数字人,是男孩的形象。
检查ID为xxx的数字人,可以吗?
我能用哪些肖像。
| 工具名称 | <div style="text-align: center">工具描述</div> | <div style="text-align: center">输入参数</div> | <div style="text-align: center">输出内容</div> |
|---|---|---|---|
| generateLite2dGeneralVideo | 根据上传的真实人物录制视频生成数字肖像,仅可用于基础视频制作,数字人使用通用唇动驱动。 | • name: 生成的数字肖像名称,长度不超过50<br> • gender: 数字人的性别<br> • keepBackground: 是否保留视频背景,true保留,false移除,默认值为false<br> • templateVideoId: 用于生成数字肖像的视频文件ID | • figureId: 根据上传的真实人物录制视频生成的数字肖像ID |
| getLite2dGeneralStatus | • 查询数字肖像生成进度<br> • 还可用于查询系统可用的2D肖像。 | • figureId: 指定要查询的肖像ID,如果为空,则查询账户下的所有肖像<br> • systemFigure: 查询平台公共肖像,空:查询全部,true:返回平台公共肖像,false:返回自定义肖像<br> • trainSuccess: 是否查询训练是否完成及可用肖像的状态(空:不筛选,true:仅返回可用肖像(平台公共肖像和训练成功的自定义肖像),false:仅返回排队中、正在训练或训练失败的自定义肖像)<br> • pageNo: 页码,默认为1<br> • pageSize: 每页大小,默认为110 | • figureId: 根据上传的真实人物录制视频生成的数字肖像ID<br> • name: 生成的数字肖像名称,长度不超过50<br> • gender: 数字人的性别<br> • keepBackground: 是否保留视频背景,true保留,false移除,默认值为false<br> • status: 状态(LINE_UP(排队中),GENERATING,SUCCESS,FAILED)<br> • failedCode: 失败错误码<br> • failedMessage: 无法生成产品的理由 |
使用数字肖像ID为xxx的声音和声音人才ID为yyy,视频内容为“大家好,我是数字人播报的内容”,使用横屏全身机位,使用视频背景为"https://digital-human-material.bj.bcebos.com/-%5BLjava.lang.String%3B%4046f6cc1e.png",开启自动动作添加,开启字幕,生成1080P数字人视频。
检查任务ID为xxx的数字人视频。
| 工具名称 | <div style="text-align: center">工具描述</div> | <div style="text-align: center">输入参数</div> | <div style="text-align: center">输出内容</div> |
|---|---|---|---|
| generateDhVideo | 根据选定的数字肖像和音色生成数字人视频。 | • figureId: 数字肖像ID<br> • driveType: 驱动数字人的数据类型,支持文本驱动或音频驱动<br> • text: 如果驱动类型为文本驱动,所需的视频内容不应超过20000<br> • person: 当驱动类型为文本驱动时,所需的声音人才ID<br> • inputAudioUrl: 当驱动类型为音频驱动时,所需的音频链接URL<br> • width: 输出视频分辨率的宽度<br> • height: 输出视频分辨率的高度<br> • cameraId: 系统肖像的相机设置,0: 横屏半身,1: 竖屏半身,2: 横屏全身,3: 竖屏全身 <br> • enabled: 是否启用字幕,true启用字幕,默认false不启用。<br> • backgroundImageUrl: 背景图像的URL<br> • autoAnimoji: 系统肖像自动添加,true自动添加,默认值为false | • taskId: 当前视频合成任务的ID |
| getDhVideoStatus | 查询数字人视频合成进度。 | • taskId: 当前视频合成任务的ID | • taskId: 当前视频合成的任务ID<br> • status: SUBMIT(提交合成),GENERATING(合成中),SUCCESS(合成成功),FAILED(合成失败)<br> • failedCode: 错误码<br> • failedMessage: 生产失败的原因<br> • videoUrl: 对应任务ID的成功合成视频文件地址,保存7天 |
使用文件ID为xxx的视频文件和声音人才ID为yyy的声音,视频内容为“大家好,我是数字人播报的内容”,生成数字人视频。
检查任务ID为xxx的123数字人视频。
您可以查看指南网站上的内容
| 工具名称 | <div style="text-align: center">工具描述</div> | <div style="text-align: center">输入参数</div> | <div style="text-align: center">输出内容</div> |
|---|---|---|---|
| generateDh123Video | 根据真实人物录制的视频和选定的音色,可以直接生成数字人视频,无需生成肖像。 | • templateVideoId: 用于生成数字人视频的视频文件ID<br> • driveType: 驱动数字人的数据类型,支持文本驱动或音频驱动<br> • text: 如果驱动类型为文本驱动,所需的视频内容必须填写长度,且长度不得超过20000<br> • person: 如果驱动类型为文本驱动,所需的声音人才ID<br> • inputAudioUrl: 如果驱动类型为音频驱动,所需的音频链接URL | • taskId: 当前视频合成任务的ID |
| getDh123VideoStatus | 查询123数字人视频合成进度。 | • taskId: 当前视频合成任务的ID | • taskId: 当前视频合成的任务ID<br> • status: 状态:SUBMIT(提交合成),RATING(合成中),SUCCESS(合成成功),FAILED<br> • failedCode: 错误码<br> • failedMessage: 生产失败的原因<br> • videoUrl: 对应任务ID的成功合成视频文件地址,保存7天 |
使用声音人才ID为xxx的声音,内容为“大家好,我是数字人播报的内容”生成音频。
检查任务ID为xxx的语音合成是否良好。
| 工具名称 | <div style="text-align: center">工具描述</div> | <div style="text-align: center">输入参数</div> | <div style="text-align: center">输出内容</div> |
|---|---|---|---|
| generateText2Audio | 根据提供的文本内容和选定的音色,无需生成视频,即可生成相应的音频。 | • text: 所需的文本内容,长度不超过2000<br> • person: 所需的声音人才ID | • taskId: 当前音频合成的任务ID |
| getText2AudioStatus | 查询音频合成进度。 | • taskId: 当前音频合成任务的ID | • status: SUBMIT, GENERATING, SUCCESS, FAILED<br> • failedCode: 失败代码<br> • failedMessage: 生产失败的原因<br> • audioUrl: 对应任务ID的成功合成音频文件地址,保存7天 |
在C:/Users/username/Desktop/test.mp3上传test.mp3文件用于声音克隆。
| 工具名称 | <div style="text-align: center">工具描述</div> | <div style="text-align: center">输入参数</div> | <div style="text-align: center">输出内容</div> |
|---|---|---|---|
| uploadFiles | 根据服务类型上传所需文件。 | • file: 要上传的文件<br> • providerType: 此文件使用的当前服务类型仅限三种服务类型:“2D少量样本数字人生产”,“声音克隆”和“123数字人视频生产”。 <br> • sourceFileName: 上传文件的名称,必须正确填写文件名和后缀,例如:test.mp3。 | • fileId: 文件ID<br> • fileName: 上传文件的名称 |
我之前克隆过哪些声音?
我想使用二十多岁温柔女性的声音。
| 工具名称 | <div style="text-align: center">工具描述</div> | <div style="text-align: center">输入参数</div> | <div style="text-align: center">输出内容</div> |
|---|---|---|---|
| getVoices | 查询可用语音ID。 | • isSystem:"true"查询系统语音人才ID,“false”查询克隆语音人才ID,未传递任何值,查询可用语音人才ID | • perId: 语音人才ID<br> • name: 语音人才名称<br> • describe: 音色特征描述<br> • gender: 性别<br> • systemProvided: 是否为系统音色 |
我之前生成了哪些肖像?
有哪些可用的肖像?
| 工具名称 | <div style="text-align: center">工具描述</div> | <div style="text-align: center">输入参数</div> | <div style="text-align: center">输出内容</div> |
|---|---|---|---|
| getFigures | 查询可用肖像。 | • isSystem:"true"查询系统肖像,“false”查询生成的肖像,未传递任何值,查询所有可用肖像 | • figureId:2D肖像ID<br> • name:2D肖像名称<br> • gender:性别<br> • systemProvided: 是否为系统肖像 |
克隆文件ID为xxx的音频文件的声音。命名为“张三”,是三十多岁的中年男性音色,我将使用文本“这是我的克隆声音”来试听。
检查ID为xxx的声音是否已被克隆。
| 工具名称 | <div style="text-align: center">工具描述</div> | <div style="text-align: center">输入参数</div> | <div style="text-align: center">输出内容</div> |
|---|---|---|---|
| generateVoiceClone | 根据上传的音频生成音色,可用于语音合成和视频制作。 | • name: 克隆声音的名称,长度不超过50<br> •gender: 音色人才的性别<br> • describe: 克隆声音的描述,长度不超过100<br> • uploadAudioId: 用于克隆声音的音频文件ID<br> •example: 试听所用的文本,长度不得超过100 | • perId: 克隆声音的音色人才ID |
| getVoiceCloneStatus | 根据任务的音色人才ID查询当前音色克隆任务的状态。 | • isSuccess: 是否仅查询成功克隆的任务(true: 仅查询成功任务,false: 查询所有克隆任务)<br> • perId: 查询指定音色人才ID的任务 | • perId: 克隆声音的音色人才ID<br> • name: 音色人才名称<br> • describe: 克隆声音的描述<br> • exampleText: 试听所用的文本<br> • examplAudioUrl: 使用试听文本合成的音频文件链接<br> • status: 当前任务状态,PREPARING, CLONING, SUCCESS, FAIL<br> • reason: 如果克隆失败,此处描述失败原因<br> • gender: 被克隆声音的音色人才性别 |
在C:/Users/username/Desktop/test.mp3上传test.mp3文件用于声音克隆。