All models

omnihuman-1.5

DreaminaVideo
1.46 Credits
Get your API key
omnihuman-1.5

用单张人像与声音生成自然口型数字人

OmniHuman 1.5 是面向人物口播的音频驱动视频模型:以一张人物照片和一段语音为起点,让静态形象开口说话,并协调口型、表情及头肩动作。它适合产品讲解、课程导读与品牌播报,可通过提示词调整情绪和风格,也能用主体遮罩指定多人照片中的出镜人物。

Dreamina模型品牌
视频模型类型
视频任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

创作方式
单张人物图片 + 驱动音频生成口播视频
输入素材
公网可访问的图片 URL 与 mp3/wav 音频 URL
音频建议
建议控制在 60 秒以内,非硬性时长上限
表演控制
prompt 调整表情、情绪、稳定性与风格
主体指定
mask_url 支持在多人照片中指定驱动人物
任务与输出
同步或异步生成,返回任务状态与 video_url

以上为本平台的素材要求与调用方式,音频时长建议不代表模型原生上限。

核心能力

了解 omnihuman-1.5 能为你的工作带来什么。

声音带动完整口播表现

OmniHuman 1.5 不只让照片中的嘴部运动,还将表情、头部与肩部动作同语音节奏协调起来。创作重点是人物如何讲述内容,适合需要固定讲解者的口播视频;准备音频时,应先确定停顿、重音与表达基调。

用提示词塑造表达基调

除了照片和声音,还可用 prompt 描述温柔、平静、自然等情绪,并提出轻微头部动作或稳定表现等要求。它用于引导人物表演风格,适合分别制作课程讲解、品牌播报和温情内容,而不是替代音频中的台词。

从人物素材到可下载视频

以清晰正脸照作为形象基础,无需预先准备多角度建模素材。多人照片可搭配主体遮罩指定驱动对象;生成后获得视频地址,继续下载、剪辑或加入产品页面,使人物口播能够接入已有内容制作流程。

适用场景

从具体任务出发,找到模型发挥作用的位置。

产品更新与功能讲解

将产品更新整理成配音,搭配固定讲解者的形象照,生成介绍新功能的口播片段。再与操作录屏、字幕和重点标注组合,交付用于帮助中心或新用户引导的视频,让人物承担讲述,录屏负责展示实际操作。

课程导读与培训材料

把课程开场、知识点概述或培训提醒录成语音,配上讲师照片,生成分章节的数字人讲解。沿用同一形象可保持课程视觉连续性;涉及公式、图表或步骤时,后期加入课件画面,不必让人物承担所有信息展示。

品牌口播与内容复用

为活动通知、商品介绍或常见问题准备不同音频,使用同一品牌人物形象分别生成视频。交付物可继续加上商品镜头、字幕和片尾;沿用照片能减少重复拍摄,但每条内容仍应检查表情、口型和音频是否贴合。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

照片与配音已就绪时选择

如果已有可使用的人物照片和成稿配音,目标是让人物面对观众讲述内容,OmniHuman 1.5 的单图音频工作流很直接。它更适合围绕声音组织表演,而非从文字构建复杂剧情。选择 1.5 应以口播需求和样片效果为依据,不必把版本数字理解为所有任务的全面提升。

区分口播与复杂场景动画

人物讲解、课程主持和品牌播报可优先考虑 OmniHuman 1.5;若重点是大幅动作、角色走位、场景变化或精确复刻一段动作,应考虑支持相应控制的动画或视频模型。口播任务内部则可先用短片段试验照片、声音与提示词,再制作完整内容。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • 人像素材会影响口型与表情质量。优先使用光线均匀、正面清晰、人脸无遮挡且占比适中的照片;侧脸、模糊或过暗的图片不宜直接作为正式制作素材。多人图需要明确目标人物,不能把主体指定理解为多人同时对白。
  • 驱动音频需要提前准备,文字脚本不能代替必填的音频素材。图片和音频地址都必须公网可访问,音频应为 mp3/wav,建议控制在 60 秒以内。较长内容可按章节拆分制作,便于逐段检查口型与表演效果,再进行后期拼接。
  • 提示词用于引导情绪与风格,不是逐帧动作编排工具,也不保证每次表演完全一致。输出后应检查口型、人物动作和内容表达,并及时保存视频;使用真实人物形象与声音时,应先取得相应授权。

常见问题

解答使用 omnihuman-1.5 时的常见疑问。

OmniHuman 1.5 可以只输入文字生成口播吗?

这一工作流需要人物图片和驱动音频,不能只用文字替代两项素材。可先把脚本录制或制作成 mp3/wav,再提交音频地址。prompt 用于调整表情、情绪与风格,不承担直接朗读台词的作用。

照片需要满足什么条件?

建议使用清晰正脸、光线良好且无遮挡的人像,人物在画面中的占比应适中。照片需要有可公网访问的 URL。正式制作前,可先用一段短音频测试该照片的口型、表情与头肩动作效果,再沿用素材。

能让合照中的指定人物说话吗?

可以通过 mask_url 提交主体遮罩 URL 数组,指定多人照片中需要驱动的人物;即使只有一个遮罩地址,也应以数组形式提交。应先明确目标并准备对应遮罩。这个功能用于主体选择,不应理解为一次请求即可让多个角色分别说话或完成多人对话。

如何控制语气和人物动作?

声音本身提供语速、停顿和表达节奏,prompt 可补充温柔、平静、自然或轻微头部动作等要求。建议让配音和提示词保持一致,避免声音激昂而文字要求平静;最终表演仍需通过生成视频检查。

应用中怎样提交并取得视频?

向 POST /dreamina/videos 提交 image_url、audio_url,并指定 omnihuman-1.5。短任务可同步取得结果;较长任务可用 callback_url,或设置 async:true 后查询 /dreamina/tasks,完成后读取 video_url 并保存。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 omnihuman-1.5 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。