返回市场
MCP服务器

MCP服务器

作者:baidu-xiling4 星标更新:2025-07-08

项目介绍

百度数字人MCP服务器

中文 | English

概述
百度智能云曦灵数字人开放平台现已完全适配MCP协议。欢迎创作者加入体验。曦灵数字人提供的MCP服务器包含了13个符合MCP协议标准的API接口,包括基础视频生成、高级视频生成、音色克隆等。基于MCP Python SDK开发,任何支持MCP协议的代理助手(如Claude、Cursor、Cline和千帆AppBuilder)都可以快速接入。

License: MIT python pypi

工具

我们提供多种工具以满足不同场景的需求。它允许您快速集成大型模型中的数字人服务,并轻松构建数字人应用程序。 如果您对数字人有更多的期望并希望更深入地集成数字人服务,请访问Baidu智能云曦灵数字人开放平台联系我们。更多功能也将逐步在MCP中开放,敬请期待。

功能<div style="text-align: center">功能描述</div><div style="text-align: center">包含工具</div>
2D少量样本数字人根据上传的真实人物录制视频生成数字肖像,仅可用于基础视频制作,数字人使用通用唇动驱动。• generateLite2dGeneralVideo<br> • getLite2dGeneralStatus
数字人视频合成根据选定的数字肖像和音色生成数字人视频• generateDhVideo<br> • getDhVideoStatus
123数字人视频提供一段10秒到4分钟的实时流视频,说“123”,对应的数字人视频可以直接生成,无需生成肖像• generateDh123Video<br> • getDh123VideoStatus
语音合成基于提供的文本内容和选定的音色,无需视频即可生成相应的音频• generateText2Audio<br> • getText2AudioStatus
文件上传根据服务类型上传所需文件。• uploadFiles
语音查询查询可用系统语音人才。• getVoices
肖像查询查询可用肖像• getFigures
音色克隆根据上传的音频生成音色,可用于语音合成和视频制作。• generateVoiceClone <br>• getVoiceCloneStatus

1. 2D少量样本数字人

  • 功能描述:根据上传的真实人物录制视频生成数字肖像,仅可用于基础视频制作,数字人使用通用唇动驱动。(带透明背景的webm视频)
  • 示例提示词:

使用文件ID为xxx的视频文件生成一个名为“张三”的数字人,是男孩的形象。

检查ID为xxx的数字人,可以吗?

我能用哪些肖像。

  • 工具详情:
工具名称<div style="text-align: center">工具描述</div><div style="text-align: center">输入参数</div><div style="text-align: center">输出内容</div>
generateLite2dGeneralVideo根据上传的真实人物录制视频生成数字肖像,仅可用于基础视频制作,数字人使用通用唇动驱动。• name: 生成的数字肖像名称,长度不超过50<br> • gender: 数字人的性别<br> • keepBackground: 是否保留视频背景,true保留,false移除,默认值为false<br> • templateVideoId: 用于生成数字肖像的视频文件ID• figureId: 根据上传的真实人物录制视频生成的数字肖像ID
getLite2dGeneralStatus• 查询数字肖像生成进度<br> • 还可用于查询系统可用的2D肖像。• figureId: 指定要查询的肖像ID,如果为空,则查询账户下的所有肖像<br> • systemFigure: 查询平台公共肖像,空:查询全部,true:返回平台公共肖像,false:返回自定义肖像<br> • trainSuccess: 是否查询训练是否完成及可用肖像的状态(空:不筛选,true:仅返回可用肖像(平台公共肖像和训练成功的自定义肖像),false:仅返回排队中、正在训练或训练失败的自定义肖像)<br> • pageNo: 页码,默认为1<br> • pageSize: 每页大小,默认为110• figureId: 根据上传的真实人物录制视频生成的数字肖像ID<br> • name: 生成的数字肖像名称,长度不超过50<br> • gender: 数字人的性别<br> • keepBackground: 是否保留视频背景,true保留,false移除,默认值为false<br> • status: 状态(LINE_UP(排队中),GENERATING,SUCCESS,FAILED)<br> • failedCode: 失败错误码<br> • failedMessage: 无法生成产品的理由

2. 数字人视频合成

  • 功能描述:根据选定的数字肖像和音色生成数字人视频
  • 示例提示词:

使用数字肖像ID为xxx的声音和声音人才ID为yyy,视频内容为“大家好,我是数字人播报的内容”,使用横屏全身机位,使用视频背景为"https://digital-human-material.bj.bcebos.com/-%5BLjava.lang.String%3B%4046f6cc1e.png",开启自动动作添加,开启字幕,生成1080P数字人视频。

检查任务ID为xxx的数字人视频。

  • 工具详情:
工具名称<div style="text-align: center">工具描述</div><div style="text-align: center">输入参数</div><div style="text-align: center">输出内容</div>
generateDhVideo根据选定的数字肖像和音色生成数字人视频。• figureId: 数字肖像ID<br> • driveType: 驱动数字人的数据类型,支持文本驱动或音频驱动<br> • text: 如果驱动类型为文本驱动,所需的视频内容不应超过20000<br> • person: 当驱动类型为文本驱动时,所需的声音人才ID<br> • inputAudioUrl: 当驱动类型为音频驱动时,所需的音频链接URL<br> • width: 输出视频分辨率的宽度<br> • height: 输出视频分辨率的高度<br> • cameraId: 系统肖像的相机设置,0: 横屏半身,1: 竖屏半身,2: 横屏全身,3: 竖屏全身 <br> • enabled: 是否启用字幕,true启用字幕,默认false不启用。<br> • backgroundImageUrl: 背景图像的URL<br> • autoAnimoji: 系统肖像自动添加,true自动添加,默认值为false• taskId: 当前视频合成任务的ID
getDhVideoStatus查询数字人视频合成进度。• taskId: 当前视频合成任务的ID• taskId: 当前视频合成的任务ID<br> • status: SUBMIT(提交合成),GENERATING(合成中),SUCCESS(合成成功),FAILED(合成失败)<br> • failedCode: 错误码<br> • failedMessage: 生产失败的原因<br> • videoUrl: 对应任务ID的成功合成视频文件地址,保存7天

3. 123数字人视频合成

  • 功能描述:提供一段10秒到4分钟的实时流视频,说“123”,对应的数字人视频可以直接生成,无需生成肖像
  • 示例提示词:

使用文件ID为xxx的视频文件和声音人才ID为yyy的声音,视频内容为“大家好,我是数字人播报的内容”,生成数字人视频。

视频地址为https://open-api-test.bj.bcebos.com/ae870923-2a3b-4d5e-b6a2-e44b4025647220250417_163529_trim.mp4,声音人才为yyy,视频内容为“大家好,我是数字人播报的内容”,生成数字人视频。

检查任务ID为xxx的123数字人视频。

您可以查看指南网站上的内容

  • 工具详情:
工具名称<div style="text-align: center">工具描述</div><div style="text-align: center">输入参数</div><div style="text-align: center">输出内容</div>
generateDh123Video根据真实人物录制的视频和选定的音色,可以直接生成数字人视频,无需生成肖像。• templateVideoId: 用于生成数字人视频的视频文件ID<br> • driveType: 驱动数字人的数据类型,支持文本驱动或音频驱动<br> • text: 如果驱动类型为文本驱动,所需的视频内容必须填写长度,且长度不得超过20000<br> • person: 如果驱动类型为文本驱动,所需的声音人才ID<br> • inputAudioUrl: 如果驱动类型为音频驱动,所需的音频链接URL• taskId: 当前视频合成任务的ID
getDh123VideoStatus查询123数字人视频合成进度。• taskId: 当前视频合成任务的ID• taskId: 当前视频合成的任务ID<br> • status: 状态:SUBMIT(提交合成),RATING(合成中),SUCCESS(合成成功),FAILED<br> • failedCode: 错误码<br> • failedMessage: 生产失败的原因<br> • videoUrl: 对应任务ID的成功合成视频文件地址,保存7天

4. 语音合成

  • 功能描述:根据提供的文本内容和选定的音色,无需生成视频,即可生成相应的音频。
  • 示例提示词:

使用声音人才ID为xxx的声音,内容为“大家好,我是数字人播报的内容”生成音频。

检查任务ID为xxx的语音合成是否良好。

  • 工具详情:
工具名称<div style="text-align: center">工具描述</div><div style="text-align: center">输入参数</div><div style="text-align: center">输出内容</div>
generateText2Audio根据提供的文本内容和选定的音色,无需生成视频,即可生成相应的音频。• text: 所需的文本内容,长度不超过2000<br> • person: 所需的声音人才ID• taskId: 当前音频合成的任务ID
getText2AudioStatus查询音频合成进度。• taskId: 当前音频合成任务的ID• status: SUBMIT, GENERATING, SUCCESS, FAILED<br> • failedCode: 失败代码<br> • failedMessage: 生产失败的原因<br> • audioUrl: 对应任务ID的成功合成音频文件地址,保存7天

5. 文件上传

  • 功能描述:平台支持上传音频和视频文件,用于后续的声音克隆、数字人生产、123数字人视频生产等。
  • 示例提示词:

在C:/Users/username/Desktop/test.mp3上传test.mp3文件用于声音克隆。

  • 工具详情:
工具名称<div style="text-align: center">工具描述</div><div style="text-align: center">输入参数</div><div style="text-align: center">输出内容</div>
uploadFiles根据服务类型上传所需文件。• file: 要上传的文件<br> • providerType: 此文件使用的当前服务类型仅限三种服务类型:“2D少量样本数字人生产”,“声音克隆”和“123数字人视频生产”。 <br> • sourceFileName: 上传文件的名称,必须正确填写文件名和后缀,例如:test.mp3。• fileId: 文件ID<br> • fileName: 上传文件的名称

6. 语音查询

  • 功能描述:查询可用系统语音
  • 示例提示词:

我之前克隆过哪些声音?

我想使用二十多岁温柔女性的声音。

  • 工具详情:
工具名称<div style="text-align: center">工具描述</div><div style="text-align: center">输入参数</div><div style="text-align: center">输出内容</div>
getVoices查询可用语音ID。• isSystem:"true"查询系统语音人才ID,“false”查询克隆语音人才ID,未传递任何值,查询可用语音人才ID• perId: 语音人才ID<br> • name: 语音人才名称<br> • describe: 音色特征描述<br> • gender: 性别<br> • systemProvided: 是否为系统音色

7. 肖像查询

  • 功能描述:查询可用的2D数字肖像ID。
  • 示例提示词:

我之前生成了哪些肖像?

有哪些可用的肖像?

  • 工具详情:
工具名称<div style="text-align: center">工具描述</div><div style="text-align: center">输入参数</div><div style="text-align: center">输出内容</div>
getFigures查询可用肖像。• isSystem:"true"查询系统肖像,“false”查询生成的肖像,未传递任何值,查询所有可用肖像• figureId:2D肖像ID<br> • name:2D肖像名称<br> • gender:性别<br> • systemProvided: 是否为系统肖像

8. 音色克隆

  • 功能描述:根据上传的音频生成音色,可用于语音合成和视频制作。
  • 示例提示词:

克隆文件ID为xxx的音频文件的声音。命名为“张三”,是三十多岁的中年男性音色,我将使用文本“这是我的克隆声音”来试听。

检查ID为xxx的声音是否已被克隆。

  • 工具详情:
工具名称<div style="text-align: center">工具描述</div><div style="text-align: center">输入参数</div><div style="text-align: center">输出内容</div>
generateVoiceClone根据上传的音频生成音色,可用于语音合成和视频制作。• name: 克隆声音的名称,长度不超过50<br> •gender: 音色人才的性别<br> • describe: 克隆声音的描述,长度不超过100<br> • uploadAudioId: 用于克隆声音的音频文件ID<br> •example: 试听所用的文本,长度不得超过100• perId: 克隆声音的音色人才ID
getVoiceCloneStatus根据任务的音色人才ID查询当前音色克隆任务的状态。• isSuccess: 是否仅查询成功克隆的任务(true: 仅查询成功任务,false: 查询所有克隆任务)<br> • perId: 查询指定音色人才ID的任务• perId: 克隆声音的音色人才ID<br> • name: 音色人才名称<br> • describe: 克隆声音的描述<br> • exampleText: 试听所用的文本<br> • examplAudioUrl: 使用试听文本合成的音频文件链接<br> • status: 当前任务状态,PREPARING, CLONING, SUCCESS, FAIL<br> • reason: 如果克隆失败,此处描述失败原因<br> • gender: 被克隆声音的音色人才性别

在C:/Users/username/Desktop/test.mp3上传test.mp3文件用于声音克隆。

开始使用

1 获取试用信用

<a href="https://xiling.cloud.baidu.com/open/overview" title="获取信用"> <img src="./image/trail_credit.png" width=1024 /> </a>
  • 前往组件管理查看获得的组件配额 <a href="https://xiling.cloud.baidu.com/open/widgetConsole/list" title="组件管理"> <img src="./image/comp_manage.png" width=1024 />
</a>

2 获取API密钥