让已有形象开口讲述
以人脸图片或人物视频作为创作起点,围绕讲述内容制作唇形同步视频。适合已经确定出镜形象、不想每次重新拍摄的项目。其核心是人物口播,脚本、背景设计和后期包装仍应在制作流程中单独安排。
在选型前明确容量、输入输出与调用方式。
以上为 digitalhuman 的创作能力与调用字段,成片尺寸和时长以实际结果为准。
了解 digitalhuman 能为你的工作带来什么。
以人脸图片或人物视频作为创作起点,围绕讲述内容制作唇形同步视频。适合已经确定出镜形象、不想每次重新拍摄的项目。其核心是人物口播,脚本、背景设计和后期包装仍应在制作流程中单独安排。
入口提供音频地址,也提供文本和声音标识字段,便于围绕现成录音或口播稿组织任务。使用时应先明确采用哪种讲述材料,避免把所有字段同时填入视为通用做法;具体输入组合应通过小样验证后再批量使用。
生成结果包含任务标识、状态和视频地址,适合接入内容生产流程。异步选项与回调地址可用于安排结果接收;公开 MCP 工具还提供任务轮询、批量获取和删除能力,让生成与后续整理能够分开处理。
从具体任务出发,找到模型发挥作用的位置。
准备讲师形象素材与分段讲稿或录音,为每个知识点制作人物讲述片段。交付视频可继续用于课程剪辑、添加字幕和插入演示画面。先验证专业词的发音与口型,再处理整套内容,更便于保持成片一致性。
将产品功能说明整理为口播内容,配合固定讲解者形象制作介绍视频。输出的人物讲述片段可与产品截图、操作演示和品牌素材组合。它负责数字人表达,不应把界面操作、字幕或完整宣传片包装视为自动附带能力。
围绕同一人物素材持续提交不同的讲述内容,制作栏目开场、公告或知识分享片段。生成后保存任务标识与视频地址,便于归档和后期选片。批量开展前先用代表性内容试做,检查声音、人物表现和剪辑适配程度。
结合任务复杂度、输入材料与预期结果选择。
如果任务是让指定人物形象讲解一段内容,digitalhuman 的图片或视频输入与唇形同步方式更贴合需求。如果目标是复杂镜头运动、环境变化或多角色剧情,应优先考虑场景生成类视频能力;不要把人物口播与通用视频生成当成同一种创作方式。
已有录音时,可围绕音频地址组织任务;以文稿为起点时,可试用文本与声音标识的组合。需要定制声音,可结合 MCP 的声音克隆功能另行准备。不要按旧 engine 字段把服务理解为不同性能档位,应以实际人物素材和讲述效果决定制作方案。
从一次小规模任务到正式接入。
明确目标、必要输入与输出要求,使用真实业务样例作为起点。
打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。
保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。
在正式使用前,了解输出质量与能力范围。
解答使用 digitalhuman 时的常见疑问。
它主要用于基于人脸图片或视频的唇形同步口播。文本字段用于讲述内容,不应理解为可以仅凭场景描述生成任意视频。若要制作复杂环境、镜头或剧情,应选择更匹配的创作方式。
不必限定为视频,数字人创作也支持从人脸图片开始。入口分别提供 image_url 与 video_url,可按素材类型准备。首次使用建议先做短内容试片,确认人物表现,再沿用相同素材组织后续任务。
入口提供 audio_url,也有 text 和 voice_id 字段,可围绕录音或文稿组织创作。两类路径不宜未经验证就混用;先选定讲述方式,测试对应素材组合,再将成功的配置用于连续制作。
配套 MCP 工具支持通过短参考音频克隆声音,但视频生成入口没有专用的克隆样本字段。应先单独完成声音准备,再安排口播生成;不要将人物驱动音频与声音克隆参考素材混为一谈。
通过 POST /digital-human/videos 提交任务,响应提供视频地址及任务相关字段。采用异步流程时,可结合回调或 MCP 任务查询获取进展,并根据返回状态判断是否已有可用结果,再下载视频用于后期制作。
模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。
Pricing
$1.14· per generation
You pay$13,584for 142,800 credits · $0.0951 / credits46% OFF
You're billed in credits. Pick a top-up tier to see its per-credit rate — the larger the top-up, the cheaper each credit.
This is only a basic call example. See the full docs for more parameters and advanced usage.
View Docs