一起来看一下成品:
准备工具
image 2.0 https://chatgpt.com/c/
nanobanan pro https://labs.google/fx/tools/flow/
seedance2.0 https://jimeng.jianying.com/ai-tool/home/
倘若不知道模型怎么使用,可以参考这个教程(https://www.super-i.cn/info-2796.html),与本教程一起使用
https://www.flowpix.club/bj/30288.html?token=687e266af42b09ea39ca147ad769aaab
第一步,先准备参考素材
这里你可以使用自己的照片,也可以使用其他图片作为主角参考。

我这次是做一个女版蜘蛛侠的真人短片,所以除了主角图片之外,又从网络上找了一些女版蜘蛛侠的造型图片作为参考。

第二步,生成人物图
我先使用 NanoBanana Pro 生成人物的全身图素材。这个全身图非常重要,因为它相当于后面所有画面的角色母版。
提示词如下(使用nanobanan pro生成):
将图1人物的服装与发型改成图2、图3 的服装与发型,并且保持白底图展示,生成全身图,保持超模的身材比例,9头身


得到这张全身图

有了基础全身图之后,我又在这个人物的基础上,给她加了一套日常服装作为掩饰。
提示词如下(使用image2.0生成):
在这个角色的基础上(不要改变紧身内搭的情况下),穿上深灰色带黑色蜘蛛侠纹理短袖上衣,外搭灰色短裤,腰部系着一件灰色卫衣。脖子上有一个黑色头戴式耳机


生成的图片
这个设计的目的,是让她看起来不像一开始就穿着完整战衣,而是更像一个隐藏身份的年轻人。这样人物会更有故事感。
接着继续生成人物四视图。
四视图主要用来锁定人物的一致性,包括正面、背面和半侧面。后面不管是生图还是做视频,都可以把它作为人物参考。
这里的四视图我还会再使用第一张人物图作为参考,因为生成全身图后,人脸占比太小了,去生成四视图后人脸会不像。
提示词如下(nanobanan pro生成):
生成图中人物的真人形象设定四视图,灰色摄影棚背景,整体为专业真人角色定妆参考板,规整排版,干净简洁,不是海报,不是杂志大片,不要剧情动作,不要复杂场景。
本次生成需要同时参考两张图片:
第一张参考图为“原始造型参考图”。它负责控制人物的整体造型,包括发型、妆容、头部配饰、服装设计、布料层次、鞋子、身体比例、身材气质、穿搭风格、配饰样式、整体角色风格与画面质感。
第二张参考图为“脸模参考图”。它只用于替换和参考人物的脸部模型,包括脸型轮廓、三庭五眼比例、五官形状、眉眼结构、鼻梁结构、嘴唇形态、颧骨与下颌骨结构、面部骨相、面部气质。脸模参考图只影响人物的脸,不影响任何其他内容。
严格要求:只参考脸模参考图中的脸部结构与五官特征,不参考脸模参考图中的发型、服装、妆容、头饰、姿态、身体、背景、光线、色调、拍摄风格和画面氛围。人物的发型、妆造、头部配饰、服装、身体比例、鞋子、配饰、整体风格必须全部保持与原始造型参考图一致。最终效果是:原始造型参考图中的人物造型,换成脸模参考图的脸。
整体版式严格分为上下两部分:上半部分占画面高度三分之一,下半部分占画面高度三分之二。
上方区域展示两张精细真人面部特写,左侧为正面面部特写,右侧为侧面面部特写。两张特写都以头部与肩颈为主,构图紧凑,清晰展示人物五官、骨骼结构、妆容、发型、头饰与神态。
上方两张脸部特写中,人物的脸型、五官比例、眼睛、眉毛、鼻子、嘴唇、颧骨、下颌线、面部骨骼结构必须严格参考脸模参考图。人物的发型、妆容、头部配饰、服装领口、肩颈造型、整体角色气质必须严格参考原始造型参考图。不要把脸模参考图里的发型、妆容、服装或背景带入画面。
皮肤质感真实自然,保留毛孔、细纹、绒毛、眉睫、碎发与皮肤受光后的细微起伏,不磨皮,不过度锐化,不做人像美容,呈现高解析真人摄影棚定妆照质感。脸部需要真实融合到原始造型参考图的人物设定中,不能像换脸贴图,不能出现脸部与发型、妆容、肤色、光线不匹配的问题。
下方区域展示两张身体与服装参考图,左右排列。
左侧图片必须是放大后的正面服装展示图,人物采用标准 A-pose 站姿。
这一张图的重点不是完整全身入镜,而是“人物尺度明显放大”,让角色在画面中占据更大比例。
左侧图片必须使用更近距离的正面取景,人物从肩颈下方开始入画,到鞋子结束,头部因画面放大而被完整裁切到画面之外。
请注意,这张图不是普通远距离全身照,而是近距离放大的正面服装图:人物身体在画面中的占比要明显更大,上半身与下半身都要被放大展示,整体视觉效果像时装定妆板中的服装主体展示图。
人物双肩、双臂、双手、躯干、腰部、腿部、鞋子必须完整保留,画面边缘只允许裁掉头部,不能裁掉手、脚或身体主体。
左侧这张图必须比右侧背面图看起来更“近”、更“满”、更“放大”,让服装细节和身体比例更突出。
禁止把左侧图做成普通小比例全身图,禁止人物在左侧图中显得太小,禁止头部仍然留在画面内,禁止只裁掉半个头或留出下巴、嘴巴、鼻子、头发边缘。
右侧图片为背面全身图,标准 A-pose,完整展示从头部到鞋子的背面全身。人物背对镜头,完整保留背面头部、发型背部、服装背面结构、鞋子与整体轮廓,用于展示角色背面造型。右侧这张图为常规完整背面全身展示,人物比例正常,不需要像左图那样放大裁切。
下方两张图必须为同一个人物、同一套服装、同一组配饰、同一身体比例。整体保持超模感修长比例,但不要夸张变形。服装设计、布料层次、鞋子、穿搭风格、服装结构与配饰样式必须严格遵循原始造型参考图。所有服装与配饰都要呈现真实物理材质质感,布料有自然褶皱、垂坠和厚薄变化,金属有真实反光,皮革、丝绸、纱质等材质表现真实自然。
若原始造型参考图服装为开叉长裙,则左侧正面放大图中人物可自然一条腿向前迈出半步,以展示开叉结构和露腿效果,但整体仍需保持定妆照式稳定姿态,不要做走秀动作。
光线只使用干净统一的摄影棚三点式打光:正左侧主光,正右侧辅助光,后右侧轮廓光。不要杂乱光效,不要彩色灯光,不要强氛围特效。背景为纯净灰色无缝影棚背景。
严格要求: 上方两张脸部特写占画面上三分之一。 下方两张身体图占画面下三分之二。 人物脸部必须参考脸模参考图。 人物发型、妆容、头部配饰、服装、身体、鞋子、配饰、整体造型必须参考原始造型参考图。 脸模参考图只用于脸部,不允许影响其他任何部分。 左下图必须是“放大后的正面服装展示图”,人物在画面中的占比明显更大,头部因近距离取景被完整裁切出画面。 右下图必须是完整背面全身图。 禁止左下图做成普通比例全身小图。 禁止左下图出现任何头部信息。 禁止左右服装不一致。 禁止人物比例漂移。 禁止把脸模参考图中的发型、服装、妆容、背景、光线带入最终画面。 禁止脸部与原始造型参考图的发型、妆造、光线不融合。 禁止 AI 油腻感、塑料皮肤感、过度美颜感、廉价 CG 感。



我还额外做了一张戴耳机状态的四视图,作为蛛丝飞驰的人物资产:
提示词如下(nanobanan pro生成):
女主带上脖子上的耳机


第三步,生成人物场景图
人物准备好之后,就要做一个能承接故事的场景。我这次选择的是纽约公寓卧室,让角色坐在窗边,外面能看到城市建筑。这个场景既能交代她的日常身份,也方便后面接上从窗台倒出去、进入城市飞荡的动作。
这里我使用 GPT Image 2.0 生成一张电影感卧室图,提示词可以这样写:
生成一张电影感真人剧照,16:9横向画幅。画面中是一位年轻女性坐在公寓卧室的大窗台上,人物位于画面中央,身体正对镜头,头部侧转看向左侧窗外,神情安静、若有所思。她有浅金色短发波波头,发尾带明显的粉色挑染,发丝自然微乱。上身穿深灰色纹理短袖上衣,内搭白色带蛛网纹理的长袖紧身衣,双手戴白色蛛网纹理手套,下身穿黑色紧身裤,腰间系一件浅灰色外套,整体造型有青春感、都市感和轻微超英漫改气质,但必须保持真人写实。
场景是一间真实的城市公寓卧室,人物坐在打开的大窗前,窗外能看到纽约城市楼群与远处低矮建筑,天空明亮但带一点阴天质感。室内左侧有书架,摆放漫画书、饮料罐、小物件和海报;右侧是床铺、墙上海报以及随意堆放的衣物,房间略显凌乱但充满真实生活气息。窗户两侧是红砖墙结构,窗框形成自然取景框,把人物包裹在画面中心。
整体风格为青春独立电影质感,带有轻微漫改气息。使用自然窗光照明,窗外光线柔和地照进室内,人物面部和身体受光自然。色彩要比普通电影调色更鲜艳、更有层次,整体提升饱和度,但仍然真实耐看。重点强化粉色头发、红砖墙、漫画海报、蓝灰色床品、窗外暖褐色城市建筑的色彩表现。室内综合色调偏青蓝灰,搭配砖墙和城市景观的暖橙棕色,形成明显但舒服的冷暖对比。画面要有鲜明但不过分夸张的色彩,青春、清爽、通透,像高质量电影截图。镜头为平视机位,中景偏大全景,35mm电影镜头,轻微景深,保留真实皮肤纹理、衣物质感和室内生活细节,high saturation, cinematic still, vibrant colors, natural window light, realistic urban bedroom, coming-of-age superhero mood, subtle film grain, highly detailed, no text, no watermark, no logo。

不过这里有一个小问题。
这张图本身是带人物的,但后面我们要使用自己前面生成好的角色,所以需要先把场景里原本的人物去掉。
我这里继续使用 NanoBanana Pro,把人物从画面中清理掉
提示词如下:
去掉窗台的人物

这样就得到了一张干净的场景底图。

然后再把前面生成好的人物放回这个场景中,让她坐在公寓卧室的大窗台上。


第四步,使用 Seedance2.0 生成视频。
这里我一共生成了两段视频。
第一段是室内镜头,也就是人物从窗台缓缓向后倒出窗外。
这一段的关键不是让动作特别快。人物一开始坐在窗台上,随后身体慢慢后仰,重心离开窗台,最后向窗外倒出。镜头可以保持相对稳定,重点表现人物的身体失重感和窗外空间的危险感。
这一段提示词可以这样写:
以图1为首帧,图2是人物四视图。固定镜头,人物叹了口气,转过头与身体看向镜头,坐到了窗台中间,打了个响指,随后把脖子上的头戴式耳机戴在头上,随后张开双手,身体往后仰缓缓倒出窗台。不要生成bgm,只需要音效

我这里使用flowpix来演示,因为即梦官网会卡审核,建议使用聚合平台
第二段是室外动作镜头,也就是人物在街区中使用蛛网穿梭。
提示词如下:
使用图片1为女主角,严格参考图1人物的服装。并且是带上耳机的状态
只需要生成音效,不要生成bgm
15秒连续无人机跟拍镜头。直接延续上一镜,画面从黑场开始。
0—1秒:黑场。随后切入——特写——白色手套的手。手指张开,手腕一抖,蛛丝射出。镜头立刻快速向后拉开。
1—4秒:广角——纽约住宅街区。棕石公寓、消防梯、街角杂货店。她低空荡行——距离街道约3米。身体状态:双臂前伸抓住蛛丝,双腿并拢向后拖曳,核心收紧,背部挺直。在摆荡弧线最低点时,她的双脚轻轻擦过一辆停着的汽车车顶——这是一次短暂而明确的物理接触,脚尖轻弹借力,顺势改变方向。镜头倾斜侧摆40度。
4—7秒:她在摆荡顶点松开蛛丝——身体打开,双臂张开,双腿伸展。然后她不是立刻再次发射蛛丝——而是沿着一栋棕石建筑的侧墙奔跑。双脚以真实跑步节奏踩击砖墙——身体以45度角贴向墙面,双臂摆动,在垂直墙面上快速跑出4到5步——随后双脚同时狠狠蹬离墙面,膝盖完全伸展发力,在空中朝宽阔十字路口对面的一栋建筑射出新的蛛丝。新的摆荡将她猛烈横向拉走——镜头随之滚转60度。
7—10秒:她低空冲进一条狭窄街道,街上停满黄色出租车。她离地约2米,身体呈流线型——双臂朝前,双腿向后拖曳,如箭一般。蛛丝释放。她双脚落地——立刻进入全速冲刺,身体前倾,双臂驱动,在出租车之间连续跑出3到4步,借助前冲惯性,双脚真实踩击潮湿路面。一辆出租车鸣笛。她笑了。随后她单脚踩上出租车侧面,借助车顶完成一次爆发式蹬离,朝高楼上方射出蛛丝,整个人高速向上冲起。
“Woohoo!”
10—15秒:广角镜头——屋顶高度,但不要太高。她停留在摆荡顶点——背对镜头,双臂微微张开,身体自然轻微后弓,整个人在空中静止一瞬,像屏住呼吸般短暂停顿。天空是黄金时刻——地平线铺满温暖的橙色与粉色光线。巨大的戏剧性云层从下方被金光照亮。她作为一个小小的人物,正好位于画面中央,背后是巨大而发光的天空。远处可见城市屋顶、水塔、防火梯,以及下方柔和的建筑剪影。 只需要生成音效,不要生成bgm

最后一步就是剪辑。
把第一段室内倒出窗外的视频放在前面,第二段城市蛛网穿梭的视频接在后面,直接拼接起来即可

【免责声明】 本课程内容仅为AIGC技术教学与案例分析之目的,所引用的品牌名称、商标、Logo、广告素材等均属各自权利人所有。本平台与所提及的任何品牌方不存在任何形式的合作、联名、代言或授权关系。课程内容仅供学习参考,不构成任何商业建议。如权利人认为内容涉及侵权,请联系我们(联系方式 WX:Xiaofengguwen010),我们将在核实后第一时间处理。
角色设计执行卡
把这节课压缩成一张可执行卡片:看重点、照步骤、避坑,再复制模板直接开做。
这节课不是让你照着参考图抄脸,而是围绕「小白也能做!AI生成真人版蜘蛛侠视频教程」把原创角色脸拆成结构、比例、五官主次和妆造记忆点。
按原文节奏走最稳:先吃透「准备工具」,再把「第一步,先准备参考素材」定住,接着处理「第二步,生成人物图」;最后用「第三步,生成人物场景图」收口。
- 先把「准备工具」里说的脸型或气质定住。
- 围绕「第一步,先准备参考素材」只取局部结构,别整张照搬。
- 做完「第二步,生成人物图」后,先确认角色还是原创。
- 先把「第三步,生成人物场景图」里说的脸型或气质定住。
- 围绕「第四步,使用 Seedance2.0 生成视频。」收一收五官,不要让每个部位都抢戏。
不要直接套真人脸或影视角色脸;不要把所有五官都做成强特征,否则容易撞脸、割裂、不稳定。
检查角色是否有清晰记忆点;年龄感和气质是否一致;换妆造后脸是否稳定;是否不像任何明确真人或影视角色。
请围绕「小白也能做!AI生成真人版蜘蛛侠视频教程」帮我做一个可直接执行的方案。 我的目标是:【填写你的具体目标】 我的素材/产品/角色信息是:【填写已有素材和限制】 请输出:角色定位、脸型方向、三庭五眼比例、五官主次、妆造记忆点、完整生图提示词。要求原创、有辨识度、避免撞脸和网红脸。