AI人物太假?如何提高数字人的真实感?经验分享Why Do AI People Look Fake? Making Digital Humans More Believable

左右并列的男性肖像对比,左侧是冷蓝背景下过度光滑工整的棚拍面孔,右侧是暖色生活场景中更自然的微笑与皮肤细节
本页目录On this page

现在的 AI 人物图,单看一张图已经挺像回事。五官工整,皮肤细节和光影也合理。但是生成视频之后,一眼AI,明明看起来背景和脸部都没有明显问题,却还是有点假,问题出在哪里呢?

接下来结合我最近的工作探索的经验,分享一下我自己的一些看法,希望会有帮助

画面看起来不对时,很多人会先从皮肤细节下手补脸。毛孔、雀斑、黑眼圈、细小绒毛、皮肤颗粒、不对称五官,提示词越加越长。最后得到的却是一张把“真人瑕疵”都贴上去的标准 AI 脸。

一、明明加了细节,为什么还是很假?

一、明明加了细节,为什么还是很假?配图

“真实皮肤纹理”这类词当然有用。它们能避免人物像蜡像,也能让近景不至于太干净。但当所有人用同一批词修图,新的模板很快又出现了。标准脸型配上标准鼻梁,脸上再挂着统一的微笑,外面铺一层均匀的雀斑和颗粒。

麻烦在于,那些瑕疵看上去像后期统一盖上的效果。

真人的皮肤不会平均地变化。鼻翼、额头、脸颊和眼下吃到的光不同,皮肤状态也会跟着作息、年龄、妆面和灯光走。给护肤产品拍面部近景,处理这些层次很有必要。清洁喷雾广告里硬塞满脸雀斑和法令纹,画面反倒会显得在拼命证明“她是真人”。

观众不会逐条检查提示词。他们会看人物、产品和场景是否合理。

一、明明加了细节,为什么还是很假?配图

二、场景和人物要互相匹配

“一位朴素的阿姨打扫卫生,比一个精致的美女更有说服力”

一位妆发完整、姿态像杂志封面的年轻模特,站在普通家庭卫生间里举着清洁喷雾。图可以拍得很漂亮,卫生间也可以足够写实,人物却还是像被摆进去的,因为她看起来不是在清洁,只是在卫生间完成一次拍摄。

AI 广告在这里就容易出现人物与场景脱节。

二、场景和人物要互相匹配配图

不少流程从角色设定开始,先定年龄、长相、身材和发型,再把同一个人送进卫生间、办公室、健身房或客厅。身份确实好维持,场景却已经向人物提出了要求。

这件产品平常由谁使用,空间属于谁,镜头要让观众相信什么,人物要显得熟练还是只是负责好看。前面几步没想清楚,后面的角色再精致,也像一张被搬运的设定图。

二、场景和人物要互相匹配配图

我更建议先做场景化选角。先把产品和使用情境定下来,再从情境里找人。角色身份依然可以提炼、扩展和复用,只是她得先在任务里成立。

三、不同产品,需要不同的可信度

人物真实感没有一把通用尺子。同一个人在不同商业任务里,观众盯着看的地方会变。

护肤内容通常离脸很近。观众会看肤色是否自然、不同区域有没有层次、上妆和光线是否合理。身高和全身比例并非完全不重要,但不会决定这张图是否成立。

服装内容反过来。衣服挂在身体上,肩线、腰线、四肢比例、重心、站姿和行走状态,往往比鼻翼上的毛孔更直接地影响产品表现。一个脸部做得很真的人物,如果体态和衣服的受力关系不对,整张图依然站不住。

清洁用品、家居和日用品更看重生活关系。人物不必长得像时尚封面,但她要让人相信自己知道怎么使用这个产品,动作和环境也符合清洁任务。专业软件、医疗或工业产品多了一层要求,人物的工作动作、着装和环境要能支撑专业身份。

三、不同产品,需要不同的可信度配图

动手前,先问这张画面里观众会拿什么判断她是否可信。这个问题会直接决定你该把时间花在皮肤、体态,还是动作上。

四、先定产品和场景,再做角色卡

一套更稳的顺序并不复杂。

先把产品任务说清。它卖什么,画面最后放在哪里,观众要在几秒内看懂什么。接着定场景,画面是在记录一次真实使用,还是在展示产品质感。空间要干净到什么程度,光从哪里来,产品离人多远,都在这一步决定。

人物可以晚一点进场。先找一个放进画面里就成立的人,再决定她的年龄、衣着、妆发和状态。第一张场景图跑通后,再从里面抽取身份特征,补正面、侧面、全身、不同表情和服装版本。

这样做,人物的一致性也不只剩下“长得像同一个人”。同一个人物换到另一个画面,衣着、动作和角色身份仍然要和场景一致。

四、先定产品和场景,再做角色卡配图

五、视频需要一整组人物状态

五、视频需要一整组人物状态配图

单张图表现不出什么内容,到了视频里,人物得抬头、低头、看产品、回应镜头、说话、转身、走动。每多一个状态,角色资产就得面临一次考验。

有些人物正面很好看,一转头鼻子变了,开口后脸型又变了。还有些人五官没崩,却从头到尾挂着同一种礼貌微笑。前一种情况是身份没稳住,后一种是状态没有变化。

五、视频需要一整组人物状态配图

角色库别只收正脸、侧脸和全身照。把任务里会用到的状态也留下来,例如看产品时的视线、操作时手和产品的关系、等待时的放松表情、说话时嘴部和下巴的变化,还有站立与坐下时的重心。视频制作时,创作者需要的正是这些状态。

六、数字人的“声音”非常重要

人物一开口,观众会同时接收脸部动作和声音,两者不是各看各的。 关于视听语音感知的研究表明,人会把声音与嘴部、面部动作放在一起处理,音画不一致会增加理解上的不确定性。PNAS 的相关研究也指出,脸部动作与声道形态存在可测的联动关系。

六、数字人的“声音”非常重要配图

所以,声音的作用不只是“像不像这个人”。一段语音至少要和画面对齐四件事:说话人的音色与身份,句子的停顿和重音,情绪与正在发生的事,以及嘴部动作和发声时机。前两项做好,声音会更自然;后两项失配,视频的真实感会明显下降。语音合成研究在评估自然度时,也会把说话风格、可懂度、说话人一致性、韵律变化和自发行为分开看。相关评测说明,音色相似只是其中一项。

MiniMax 提供语音克隆和声音设计能力。它的官方文档要求克隆音源至少 10 秒,并允许额外提供一段不超过 8 秒、带转写的参考音频来增强相似度与稳定性。MiniMax Voice Clone 文档给出的重点很实在:为数字人准备的参考录音,应当能体现最终视频需要的语速、停顿和说话状态,而不只是一段干净的音色样本。

七、制作方式也会改变人物的可信度

Grok Imagine、Seedance 2.5 这类视频生成工具,适合从文字、图片或其他参考资料出发建立人物的画面与运动。Grok Imagine 已提供图像和视频生成能力;字节 Seed 官方对 Seedance 2.0 公开的能力包括文字、图片、音频和视频四类输入的联合生成。xAI 文档Seedance 官方发布说明能确认这两条路线。

这类工具负责生成画面、动作和镜头。它们能把人物放进一个可用的场景,却不会自动替你判断角色身份、说话方式和行为是否合理。模型版本越新,画面的错误可能越少,人物和任务之间的关系还是要由创作者先定下来。

如果目标是还原一个确定的真人,可以使用真人录像生成 Digital Twin。

HeyGen 的 Instant Avatar / Digital Twin 支持使用自定义 Avatar,并可配合自定义声音生成视频。HeyGen 官方文档把它和单张照片驱动的 Avatar 分开列出。它保留的是已有真人素材里的脸、动作和声音参考,适合需要持续出现同一人物的内容。前提很简单,只用自己的素材,或取得当事人的明确授权。

视频模型、语音模型和真人录制的 Twin 解决的不是同一个问题。前者补画面与动作,中间这一层补声音身份与说话状态,最后一条路线保留更多已有参考。成片是否可信,仍然要回到同一个判断:画面里这个人说这句话,合不合理。

八、先定内容,再出人物

八、先定内容,再出人物配图

写提示词前,先写一页人物简报,把六件事记下来。

  • 产品任务。画面要为产品证明什么。
  • 使用场景。人物在哪里,以什么动作碰到产品。
  • 观众关系。谁会相信这个人物,理由是什么。
  • 关键变量。这次优先看皮肤、体态、生活感、专业动作还是表情状态。
  • 角色身份。年龄段、气质、衣着和妆发,只留和任务有关的部分。
  • 状态清单。后续图生视频必须覆盖哪些视角、动作和表情。

写这页简报,是为了先把人物、产品和场景想清楚。提示词负责描述细节,无法替你做前面的判断。

可直接使用的数字人真实感增强提示词

下面这段是顶层控制提示词。它先规定画面必须建立什么关系,再由具体项目填入产品、人物和场景。它不限定清洁、美妆、服装或专业服务等品类,也不把“真实感”缩成皮肤细节。

用途:
生成一张写实画面,让人物、任务、产品或物体与环境共同构成一个可信的现实情境。画面要说清楚三件事:这个人为什么在这里、为什么在做这个动作、这个产品或物体为什么会出现在这个场景里。

画幅:
[按最终投放位置填写画幅,如 4:5、1:1、16:9 或 9:16]。

主体:
[年龄段] 的 [身份或职业],位于 [明确的现实地点],为了 [即时目的],正在用 [产品或物体] 做 [一个可观察的动作]。先定义角色、任务和场景,再描述外貌。衣着、妆发、姿态、视线、表情、手部位置、工具和身体重心,都要符合这个人的身份与动作。除非简报明确要求摆拍肖像,人物应当专注于任务本身。

风格:
符合 [投放位置] 的写实 [商业 / 编辑 / 纪实] 摄影。人物比例、材质、衣物受力、表面状态和光线方向都要合理。人的变化要跟着年龄、活动、妆发、光线和镜头距离走。优先保证本次任务的关键可信度变量,例如面部皮肤、体态、实际使用方式、专业动作或情绪状态。装饰性细节与情境冲突时,删掉装饰性细节。

构图:
[景别]、[机位] 与 [主体位置] 要让观众一眼看清动作、产品或物体,以及它们之间的物理关系。环境只展示建立情境所需要的部分。只有最终版式需要文字时才留白。产品是画面核心时,再把它放到视觉优先级最高的位置。

避免元素:
任何与角色、动作、场景或目标受众矛盾的细节。没有简报依据的通用美人模特造型;为了显得真实而硬加的皮肤瑕疵;执行任务时的摆拍行为;手、产品、工具、衣物或表面之间不符合物理关系的接触;没有功能的道具;与任务无关的背景活动;日常使用场景里过于样板间化的环境;畸形的人体;无法控制的文字或商标。

做完一张人物图,可以先别急着放大看细节。缩小图片看整体,判断图片的含义。这个人为什么会在这里?为什么会这样拿着产品?

如果都合理,那么年龄、状态、动作、光线和空间通常也会合理。如果图片内容不合理,再加毛孔、雀斑和颗粒这种细节,也没有什么意义。

内容的合理性最为重要。

🥳****感谢看到这里,我是阿哲, 前建筑师 → AIGC设计师&架构师

欢迎关注我 @Formulasearch,我会持续分享可实操的AI提示词,工具教程,实践经验。

数据结果

  • 渠道:x
  • 展现:
  • 点赞:
  • 转发:
  • 评论:
  • 互动:
  • 详情展开:
  • 主页访问:
  • 收藏:
  • 私信 / 新增关注:

为什么表现好 / 不好

  • 待补数据。

值得沉淀的资产

  • 主题母题:
  • 案例:
  • 表达:
  • 长文方向:
  • 下次复盘重点:

继续阅读Keep reading

AI 实践分享AI Practice

从零开始用 ComfyUI 跑 MiniMax H3(2):官方skill分析与简易示例MiniMax H3 in ComfyUI, Part 2: Official Skills and Simple Examples

在跑通 H3 之后,继续拆解官方提示词规范和八类内容 Skill,用简易案例说明适用场景、输入模式与减少无效生成的方法。After the first successful run, examine the official prompt rules and eight content skills through simple examples, input modes, and ways to reduce wasted generations.

AI 实践分享AI Practice

从零开始用 ComfyUI 跑 MiniMax H3:本地安装、云端和视频工作流Run MiniMax H3 in ComfyUI from Scratch: Local, Cloud, and Video Workflows

面向新手说明如何检查硬件、选择本地或云端环境,并在 ComfyUI 中从官方 MiniMax H3 模板开始生成第一条带声音的视频。A beginner guide to checking hardware, choosing local or cloud execution, and generating a first video with audio from the official MiniMax H3 templates in ComfyUI.