普通人像追求“好看”,数字人底图追求的是另一件事:
这张图既要像真人、像真实生活中的真人,又要能被图片 + 音频稳定驱动。
一张精修得像海报的人像,未必适合数字人;一张普通的生活照片,只要嘴部、眼睛、下巴、光线和构图稳定,往往更容易做出可信的视频。
01 / FOUNDATION
先记住三个判断标准
生成完成后,不要先问“好不好看”,而要按顺序判断。三项必须同时成立。
像不像真人?
自然五官、合理结构、真实皮肤、发丝、衣料、光照和空间透视。
像不像真实生活?
普通住宅、办公室、教室、小店或社区,保留少量可信使用痕迹。
适不适合驱动?
嘴唇、下巴、双眼和脸部轮廓清楚,不被手、头发、杯子或麦克风遮挡。
Image2 的「Realistic Photography / 写实摄影」(case 377)。历史人物可叠加「History & Classical Themes / 历史与古风题材」(case 375),但最终仍应回到真实摄影质感。
02 / QUICK START
30 秒可复制模板
如果只想快速开始,复制模板后替换【变量】。先完成一张稳定的正面中近景,再扩展其他镜头。
Use case: photorealistic-natural
Asset type: 9:16 竖版“图片 + 音频”数字人口播底图
Primary request:
生成一位【性别、年龄】的中国人物,身份是【职业/角色】,声音给人的感觉是【音色关键词】,人物气质是【3—5个气质词】。
Scene/backdrop:
位于【真实日常场景】;环境整洁但不过度高级,有少量可信生活物品和使用痕迹;背景轻微自然虚化,但仍能辨认。
Subject:
真实普通人的面孔,不是明星脸或网红脸;保留自然毛孔、细纹、肤色差异、碎发和衣物褶皱。穿【服装】。表情【放松/克制/友善】,嘴唇自然闭合或轻微分开,嘴部无遮挡。
Composition/framing:
9:16 竖构图,胸部至腰部以上中近景,平视机位,正面或头部自然偏转不超过15度;双肩完整,头顶有合理留白,嘴部、下巴和颈部无遮挡。
Lighting/style:
普通窗光、室内灯或阴天自然光;像手机主摄或普通相机在现场拍摄。生活纪实、清晰但不过度精修,不是广告、影楼写真或电影海报。
Constraints:
适合后续口型驱动;双眼清楚;脸部结构自然;无文字、无Logo、无水印。
Avoid:
网红脸、明星精修、磨皮、美颜、塑料皮肤、奢华布景、戏剧化电影灯光、强轮廓光、过度虚化、夸张表情、张大嘴、手遮脸、麦克风遮嘴、畸形手指、3D、插画、动漫、明显AI感。03 / CAMERA
数字人镜头的构图规则
| 镜头 | 人物范围 | 适合场景 | 稳定性 |
|---|---|---|---|
| 肩部以上特写 | 头部、肩颈 | 情绪口播、知识讲解 | 高 |
| 胸部以上中近景 | 头部到胸部 | 通用口播、新闻、课程 | 最高 |
| 腰部以上半身 | 头部到腰部 | 职场、生活、历史角色 | 高 |
| 膝部以上中全景 | 头部到膝部 | 服装展示、轻微动作 | 中 |
| 全身 | 完整人物 | 角色展示、走动镜头 | 较低 |
优先平视;避免明显俯拍、仰拍和超广角自拍畸变。人脸不要贴边,头顶、下巴、双肩都要保留安全余量。
04 / REAL LIFE
“真实”不等于“高级”
可信感来自普通场地、自然光、可见材质、轻微不完美和合理道具,不来自豪华布景。
- 普通住宅、办公室、教室、社区、公园、街边小店
- 文件、杯子、收纳盒、旧木纹、布料褶皱
- 自然毛孔、肤色差异、碎发和衣料纤维
- 窗光、普通顶灯、树荫光或阴天光
- 豪宅、奢华酒店、高级摄影棚
- 明星精修、影楼写真、时尚大片
- 戏剧轮廓光、浓雾、HDR、网红滤镜
- 瓷娃娃皮肤、赛博霓虹、3D 渲染感
生活纪实感强的真实人物照片,像普通相机或手机主摄在真实场所拍摄;
环境中有少量合理的生活物品和使用痕迹;
保留自然毛孔、肤色差异、碎发、衣料纤维和自然褶皱;
清晰但不过度精修,不是商业广告或影视海报。05 / TEXT TO IMAGE
文生图:从音色描述生成数字人
先把音色翻译成可见的视觉人格,再确定日常身份和基础镜头。不要一开始就同时堆全身、复杂动作、多人互动和大量道具。
音色词不要直接变成夸张表情:“冷酷”不等于邪笑,“温柔”不等于露齿大笑,“正在叫卖”也不必张大嘴。
没有使用凤冠、宫殿等直白符号,用僧衣、旧木门和自然皮肤表达身份变化。
粗布、晒痕和旧集市表达职业,嘴唇轻微分开,手势不遮挡脸。
不使用发光眼睛等廉价符号,用眼神、暗色旧衣和克制表情表达复杂人格。
恋爱感来自眼神和轻微闭唇笑,场景像普通人家而不是花海影楼。
06 / IMAGE TO IMAGE
图生图:同一人物跨场景与时代
图生图的关键不是“写更多”,而是明确必须保持不变的身份锚点,以及允许修改的场景变量。
脸型、额头、眉眼、鼻唇、下巴、肤色、年龄、发际线、主要发型、眼镜与基础表情。
服装、配饰、背景、光线、时代、角度、姿态和背景品牌信息。
Image 1 是身份和编辑目标;Image 2 是服装;Image 3 是场景与光线。
Use case: identity-preserve
Input image:
Image 1 是唯一身份参考和编辑目标。
Primary request:
将参考人物改造成【目标角色/场景】。只改变【允许修改项】;必须保持她/他与参考图是同一个人。
Identity lock — highest priority:
严格保留参考人物的脸型、额头比例、眉形、双眼形状与间距、鼻梁鼻头、嘴唇、下巴、耳朵、肤色、年龄、皮肤细节、发际线、主要发型轮廓、目光方向和基础表情。
不得换脸、美化、年轻化、改变族裔或改变五官。
Allowed changes:
只改变【服装、背景、时代、角度、姿态】。
Scene/backdrop:
【真实生活场景,包含少量合理物品和使用痕迹】
Composition/framing:
9:16竖构图,【胸部/腰部/膝部】以上,平视机位,【正面/三分之四/侧视/过肩】;嘴部、下巴和近侧眼睛无遮挡。
Lighting/style:
普通自然光或真实室内光;生活纪实感;不过度精修。
Invariants:
change only X; keep identity, face, expression and Y unchanged.
Avoid:
换脸、五官漂移、年龄变化、表情变化、网红脸、磨皮、头发遮嘴、手遮脸、背景文字乱码、3D、插画、动漫、AI感。07 / SHOT RECIPES
四种常用数字人镜头写法
正面口播
胸部至腰部以上中近景,平视,头部轻转不超过 10°;双肩完整,手位于画面下方。
课程 · 知识口播 · 新闻 · 品牌介绍户外侧视
人物向右约 45—55°,近侧眼、鼻梁和嘴唇仍清楚;头发不得遮嘴。
社区绿道 · 树荫街道职场过肩交谈
前景同事只出现模糊肩膀和少量后脑,主体处于中景清晰焦点,嘴部完整。
访谈 · 对话 · 职场剧情新闻演播室
正面坐在普通新闻桌后,表情稳定专业;麦克风不得遮嘴,背景不是科幻控制中心。
新闻 · 评论 · 栏目播报08 / BRAND IN SCENE
品牌信息要成为场景里的真实物件
最稳的方法不是把 Logo 悬浮在图片上,而是根据时代与环境,选择合理的载体。
| 场景 | 自然载体 |
|---|---|
| 古代 | 木牌、商号牌、书塾牌 |
| 太空 | 舱内设备铭牌、模块标签 |
| 民国 | 搪瓷广告牌、旧墙商业牌 |
| 科技博主 | NAS 设备、显示器、层架铭牌 |
| 办公室 / 户外 | 磨砂玻璃、企业墙标、社区导视牌 |
| 新闻演播室 | 背景大屏、栏目墙、演播台前板 |
在人物侧后方的【载体】上,只出现一次清楚准确的文字“WDcloud”;
像真实场景中的【设备铭牌/导视牌/墙面标识】;
大小可读但不抢人物,不与头部重叠。
必须准确拼写 W-D-c-l-o-u-d,不添加其他可读文字,
不做悬浮文字,不做水印,不重复品牌名。第一轮只生成人物和场景;第二轮只编辑背景牌。每次只要求一个品牌词,放在平整、正对镜头的载体上;如果已有正式 Logo,优先作为单独参考图或后期叠加。
09 / 100 POINT CHECK
进入音频驱动前,先打一次分
勾选只保存在当前浏览器,不会上传。85 分以上可进入驱动;70—84 分针对单一问题返修;70 分以下通常重新生成更快。
10 / TROUBLESHOOTING
常见失败与修正
01人物越来越不像参考图
每个场景重新使用原图;每轮只改一个变量;重复声明五官、年龄、发型和表情不变。
02画面太高级、像广告
删除“电影级、大片、高端、奢华、完美”,改用普通家庭、办公室、社区、窗光或普通顶灯。
03皮肤像塑料
增加自然毛孔、细纹、肤色差异、轻微眼下纹理、碎发和衣料纤维;删除完美皮肤、无瑕、精修。
04嘴型不适合驱动
优先放松闭嘴或轻微闭唇微笑;叫卖也只需轻微分开嘴唇,不露齿、不张大嘴。
05手部出错
让手不入镜,或明确位于画面底部自然叠放;不要拿复杂物体,不要靠近脸。
06品牌文字错误
只放一个品牌词,用引号包住并写一次字母拆分,放在正对镜头的平整载体上,第二轮局部编辑。
07提示词被安全系统误判
使用中性的生产语言描述服装和身体。若参考图导致候选被拦截,改成肩部以上构图,允许服装做小幅非敏感适配,或换同一人物的另一张身份图。
11 / ITERATION
一次只改一个问题
一次要求“脸、衣服、背景、嘴、品牌、光线、手”全部变化,会让模型重新解释整张图,身份更容易漂移。
把脸改像一点、衣服换成蓝色、背景更真实、嘴巴闭上、品牌放右边、光线暖一点、手也修一下。
保持人物、脸、表情、服装、姿态、构图和背景不变;只把嘴唇调整为自然闭合。
下一轮再处理品牌:保持所有内容不变,只在背景右侧设备铭牌上加入一次准确文字“WDcloud”。
12 / WORKFLOW
一条可复用的完整工作流
- 音色 / 人设
- 视觉人格拆解
- 确定场景、服装、镜头和表情
- 生成基础正面中近景
- 检查真人感、生活感、驱动适配
- 通过后再做品牌植入或跨场景变体
- 每个图生图变体重新使用原始身份参考
- 按 100 分验收表打分
- 保存 PNG 原图、提示词和素材清单
- 进入图片 + 音频驱动
13 / INPUT FORM
提交给生成助手的信息表
复制后填写,信息越具体,生成过程越容易复现和返修。
任务类型:文生图 / 图生图
音色描述:
性别与年龄:
人物身份/职业:
核心气质:
服装:
场景:
镜头范围:肩部以上 / 胸部以上 / 腰部以上 / 膝部以上 / 全身
镜头角度:正面 / 三分之四 / 侧视 / 过肩 / 新闻演播室
表情:
是否需要品牌植入:
品牌准确文字:
画面比例:9:16 / 16:9 / 1:1
图生图额外填写:
身份参考图:
必须保持不变:
允许改变:
其他参考图及其用途:数字人镜头最重要的不是“生成一张惊艳图片”,而是建立一个可重复、可验收的生产标准:
人物可信、场景可信、镜头可驱动、身份可延续、品牌可落地。
先做好一张稳定的正面基础镜头,再扩展侧视、过肩、户外、历史、太空和演播室场景。





05
06
07
08
09
10
11
12
13
14
15
16
17
18
19
20