AI人物太假?如何提高数字人的真实感?经验分享Why Do AI People Look Fake? Making Digital Humans More Believable

本页目录On this page
现在的 AI 人物图,单看一张图已经挺像回事。五官工整,皮肤细节和光影也合理。但是生成视频之后,一眼AI,明明看起来背景和脸部都没有明显问题,却还是有点假,问题出在哪里呢?
接下来结合我最近的工作探索的经验,分享一下我自己的一些看法,希望会有帮助
画面看起来不对时,很多人会先从皮肤细节下手补脸。毛孔、雀斑、黑眼圈、细小绒毛、皮肤颗粒、不对称五官,提示词越加越长。最后得到的却是一张把“真人瑕疵”都贴上去的标准 AI 脸。
一、明明加了细节,为什么还是很假?

“真实皮肤纹理”这类词当然有用。它们能避免人物像蜡像,也能让近景不至于太干净。但当所有人用同一批词修图,新的模板很快又出现了。标准脸型配上标准鼻梁,脸上再挂着统一的微笑,外面铺一层均匀的雀斑和颗粒。
麻烦在于,那些瑕疵看上去像后期统一盖上的效果。
真人的皮肤不会平均地变化。鼻翼、额头、脸颊和眼下吃到的光不同,皮肤状态也会跟着作息、年龄、妆面和灯光走。给护肤产品拍面部近景,处理这些层次很有必要。清洁喷雾广告里硬塞满脸雀斑和法令纹,画面反倒会显得在拼命证明“她是真人”。
观众不会逐条检查提示词。他们会看人物、产品和场景是否合理。

二、场景和人物要互相匹配
“一位朴素的阿姨打扫卫生,比一个精致的美女更有说服力”
一位妆发完整、姿态像杂志封面的年轻模特,站在普通家庭卫生间里举着清洁喷雾。图可以拍得很漂亮,卫生间也可以足够写实,人物却还是像被摆进去的,因为她看起来不是在清洁,只是在卫生间完成一次拍摄。
AI 广告在这里就容易出现人物与场景脱节。

不少流程从角色设定开始,先定年龄、长相、身材和发型,再把同一个人送进卫生间、办公室、健身房或客厅。身份确实好维持,场景却已经向人物提出了要求。
这件产品平常由谁使用,空间属于谁,镜头要让观众相信什么,人物要显得熟练还是只是负责好看。前面几步没想清楚,后面的角色再精致,也像一张被搬运的设定图。

我更建议先做场景化选角。先把产品和使用情境定下来,再从情境里找人。角色身份依然可以提炼、扩展和复用,只是她得先在任务里成立。
三、不同产品,需要不同的可信度
人物真实感没有一把通用尺子。同一个人在不同商业任务里,观众盯着看的地方会变。
护肤内容通常离脸很近。观众会看肤色是否自然、不同区域有没有层次、上妆和光线是否合理。身高和全身比例并非完全不重要,但不会决定这张图是否成立。
服装内容反过来。衣服挂在身体上,肩线、腰线、四肢比例、重心、站姿和行走状态,往往比鼻翼上的毛孔更直接地影响产品表现。一个脸部做得很真的人物,如果体态和衣服的受力关系不对,整张图依然站不住。
清洁用品、家居和日用品更看重生活关系。人物不必长得像时尚封面,但她要让人相信自己知道怎么使用这个产品,动作和环境也符合清洁任务。专业软件、医疗或工业产品多了一层要求,人物的工作动作、着装和环境要能支撑专业身份。

动手前,先问这张画面里观众会拿什么判断她是否可信。这个问题会直接决定你该把时间花在皮肤、体态,还是动作上。
四、先定产品和场景,再做角色卡
一套更稳的顺序并不复杂。
先把产品任务说清。它卖什么,画面最后放在哪里,观众要在几秒内看懂什么。接着定场景,画面是在记录一次真实使用,还是在展示产品质感。空间要干净到什么程度,光从哪里来,产品离人多远,都在这一步决定。
人物可以晚一点进场。先找一个放进画面里就成立的人,再决定她的年龄、衣着、妆发和状态。第一张场景图跑通后,再从里面抽取身份特征,补正面、侧面、全身、不同表情和服装版本。
这样做,人物的一致性也不只剩下“长得像同一个人”。同一个人物换到另一个画面,衣着、动作和角色身份仍然要和场景一致。

五、视频需要一整组人物状态

单张图表现不出什么内容,到了视频里,人物得抬头、低头、看产品、回应镜头、说话、转身、走动。每多一个状态,角色资产就得面临一次考验。
有些人物正面很好看,一转头鼻子变了,开口后脸型又变了。还有些人五官没崩,却从头到尾挂着同一种礼貌微笑。前一种情况是身份没稳住,后一种是状态没有变化。

角色库别只收正脸、侧脸和全身照。把任务里会用到的状态也留下来,例如看产品时的视线、操作时手和产品的关系、等待时的放松表情、说话时嘴部和下巴的变化,还有站立与坐下时的重心。视频制作时,创作者需要的正是这些状态。
六、数字人的“声音”非常重要
人物一开口,观众会同时接收脸部动作和声音,两者不是各看各的。 关于视听语音感知的研究表明,人会把声音与嘴部、面部动作放在一起处理,音画不一致会增加理解上的不确定性。PNAS 的相关研究也指出,脸部动作与声道形态存在可测的联动关系。

所以,声音的作用不只是“像不像这个人”。一段语音至少要和画面对齐四件事:说话人的音色与身份,句子的停顿和重音,情绪与正在发生的事,以及嘴部动作和发声时机。前两项做好,声音会更自然;后两项失配,视频的真实感会明显下降。语音合成研究在评估自然度时,也会把说话风格、可懂度、说话人一致性、韵律变化和自发行为分开看。相关评测说明,音色相似只是其中一项。
MiniMax 提供语音克隆和声音设计能力。它的官方文档要求克隆音源至少 10 秒,并允许额外提供一段不超过 8 秒、带转写的参考音频来增强相似度与稳定性。MiniMax Voice Clone 文档给出的重点很实在:为数字人准备的参考录音,应当能体现最终视频需要的语速、停顿和说话状态,而不只是一段干净的音色样本。
七、制作方式也会改变人物的可信度
Grok Imagine、Seedance 2.5 这类视频生成工具,适合从文字、图片或其他参考资料出发建立人物的画面与运动。Grok Imagine 已提供图像和视频生成能力;字节 Seed 官方对 Seedance 2.0 公开的能力包括文字、图片、音频和视频四类输入的联合生成。xAI 文档和 Seedance 官方发布说明能确认这两条路线。
这类工具负责生成画面、动作和镜头。它们能把人物放进一个可用的场景,却不会自动替你判断角色身份、说话方式和行为是否合理。模型版本越新,画面的错误可能越少,人物和任务之间的关系还是要由创作者先定下来。
如果目标是还原一个确定的真人,可以使用真人录像生成 Digital Twin。
HeyGen 的 Instant Avatar / Digital Twin 支持使用自定义 Avatar,并可配合自定义声音生成视频。HeyGen 官方文档把它和单张照片驱动的 Avatar 分开列出。它保留的是已有真人素材里的脸、动作和声音参考,适合需要持续出现同一人物的内容。前提很简单,只用自己的素材,或取得当事人的明确授权。
视频模型、语音模型和真人录制的 Twin 解决的不是同一个问题。前者补画面与动作,中间这一层补声音身份与说话状态,最后一条路线保留更多已有参考。成片是否可信,仍然要回到同一个判断:画面里这个人说这句话,合不合理。
八、先定内容,再出人物

写提示词前,先写一页人物简报,把六件事记下来。
- 产品任务。画面要为产品证明什么。
- 使用场景。人物在哪里,以什么动作碰到产品。
- 观众关系。谁会相信这个人物,理由是什么。
- 关键变量。这次优先看皮肤、体态、生活感、专业动作还是表情状态。
- 角色身份。年龄段、气质、衣着和妆发,只留和任务有关的部分。
- 状态清单。后续图生视频必须覆盖哪些视角、动作和表情。
写这页简报,是为了先把人物、产品和场景想清楚。提示词负责描述细节,无法替你做前面的判断。
可直接使用的数字人真实感增强提示词
下面这段是顶层控制提示词。它先规定画面必须建立什么关系,再由具体项目填入产品、人物和场景。它不限定清洁、美妆、服装或专业服务等品类,也不把“真实感”缩成皮肤细节。
用途:
生成一张写实画面,让人物、任务、产品或物体与环境共同构成一个可信的现实情境。画面要说清楚三件事:这个人为什么在这里、为什么在做这个动作、这个产品或物体为什么会出现在这个场景里。
画幅:
[按最终投放位置填写画幅,如 4:5、1:1、16:9 或 9:16]。
主体:
[年龄段] 的 [身份或职业],位于 [明确的现实地点],为了 [即时目的],正在用 [产品或物体] 做 [一个可观察的动作]。先定义角色、任务和场景,再描述外貌。衣着、妆发、姿态、视线、表情、手部位置、工具和身体重心,都要符合这个人的身份与动作。除非简报明确要求摆拍肖像,人物应当专注于任务本身。
风格:
符合 [投放位置] 的写实 [商业 / 编辑 / 纪实] 摄影。人物比例、材质、衣物受力、表面状态和光线方向都要合理。人的变化要跟着年龄、活动、妆发、光线和镜头距离走。优先保证本次任务的关键可信度变量,例如面部皮肤、体态、实际使用方式、专业动作或情绪状态。装饰性细节与情境冲突时,删掉装饰性细节。
构图:
[景别]、[机位] 与 [主体位置] 要让观众一眼看清动作、产品或物体,以及它们之间的物理关系。环境只展示建立情境所需要的部分。只有最终版式需要文字时才留白。产品是画面核心时,再把它放到视觉优先级最高的位置。
避免元素:
任何与角色、动作、场景或目标受众矛盾的细节。没有简报依据的通用美人模特造型;为了显得真实而硬加的皮肤瑕疵;执行任务时的摆拍行为;手、产品、工具、衣物或表面之间不符合物理关系的接触;没有功能的道具;与任务无关的背景活动;日常使用场景里过于样板间化的环境;畸形的人体;无法控制的文字或商标。
做完一张人物图,可以先别急着放大看细节。缩小图片看整体,判断图片的含义。这个人为什么会在这里?为什么会这样拿着产品?
如果都合理,那么年龄、状态、动作、光线和空间通常也会合理。如果图片内容不合理,再加毛孔、雀斑和颗粒这种细节,也没有什么意义。
内容的合理性最为重要。
🥳****感谢看到这里,我是阿哲, 前建筑师 → AIGC设计师&架构师
欢迎关注我 @Formulasearch,我会持续分享可实操的AI提示词,工具教程,实践经验。
数据结果
- 渠道:x
- 展现:
- 点赞:
- 转发:
- 评论:
- 互动:
- 详情展开:
- 主页访问:
- 收藏:
- 私信 / 新增关注:
为什么表现好 / 不好
- 待补数据。
值得沉淀的资产
- 主题母题:
- 案例:
- 表达:
- 长文方向:
- 下次复盘重点: