← Journal
  • 免费
CraftAUG 05, 20266 min

AI 已经能拍出「电影胶片感」了

一支没人看得出是 AI 的旧录像,是怎么做出来的

收录于 AI 视频创作 →

AI 已经能拍出「电影胶片感」了

女主在巷口扎头发,起身往里走,蹲下喂猫,去前院晾衣服,最后坐在前廊看街。四十秒,没有剧情没有音乐,画面带着旧 DV 的噪点、失焦和偶尔过曝。朋友看完说,这拍得挺有感觉。

整部片是电脑前完成的。放在几年前,这句话多少有点夸张。一个人能剪片、能做特效,但要凭空造出演员、街道、天气和镜头运动,还得在时间线上接起来,通常要一群人。现在,坐在键盘前的人已经能直接做电影镜头了。

键盘前的人,开始做电影镜头了

网上的 Seedance 2.5 生成案例里,一场沙漠怪物大战十五秒拆成六个镜头,一次生成。护肤品广告十五秒分八段,三位人物轮番与产品互动,落在产品特写。CGI 商品广告十五秒塞进十次切镜。

Higgsfield 官方演示:怪物片一镜生成六段
Higgsfield 官方演示:怪物片一镜生成六段

这些是平台自己发布的演示,不能当独立测评,也不能证明谁按一下都能得到同样结果。但和早期让一张图动起来比,模型处理的东西明显多了。导演、摄影、美术、演员、视效、剪辑原来各管一段,现在全挤进同一份生成任务。

商业上也有人跑得快。做 AI 真人秀的账号,老师学生捉迷藏、海上生存挑战,平均五天更新一期,还接到商单。真实躲猫猫的公开复盘里,约二十个摄影、多个剪辑、两三周制作,团队完整一期大约三个月。

钱,变成一次次生成

效率上去了,账单也堆得快。当时公开测试里,一条十五秒 4K 视频接近一百块,比 720p 贵六倍。一个镜头反复生成,十次就是一千块。一万元能买一台相机,也能按一百次生成按钮。以前这道题没悬念,现在一条广告镜头原本就要万元预算,答案开始犹豫了。

演员、场地、机器的钱省下了,十次二十次重跑的钱又来了。想少烧几次,得先把自己要什么讲清楚。

我这支短片制作方法有相似的地方:人物要固定,场景要固定,道具要接续,镜头要按时间发生,声音也要提前决定。

先做一张不会变的脸

我先用 GPT Image 2 High 做角色母版。第一版太普通,推翻重做,最后定下灰色短背心、浅蓝牛仔裤、黑色帆布鞋、黑绳项链,还有被风吹乱的侧马尾。

最后定下来的角色母版
最后定下来的角色母版

做分镜时,这张图是唯一的人物参考。四个镜头:扎头发、喂猫、晾衣、前廊。女主一直往画面右边走,白杯、木衣夹、浅色衣服和猫在不同段落里接着出现。每段结尾停在哪个动作,下一段就从哪里继续。

提示词,像一份拍摄文件

提示词也不再是一句画面描述,更像一份缩小的拍摄文件。先写场景,再写用哪些参考素材、哪些必须锁住,然后按秒排动作和机位,单独写声音,最后补上不能出现什么。

有些商业示例会把原始视频标成 @video_1,再把桌面、蓝色笔、关掉的显示器、屏幕里的灯光反射和手持轨迹逐项锁住,模型只准往里面加生物和它产生的光影,不能顺手改色、变速、重构图。声音也单独限定,只要现场音效,不要音乐。

优秀的案例确实能用来参考,包括处理自己的片子也是这么干的:能自由发挥的留给模型,不能变的一项项写出来。

到视频阶段👇

4K,还是 1080p?

AI 说的 4K 和相机拍的 4K 不是一回事。相机提高分辨率,是把现场记录得更细;生成模型提高画质,会重新补出眼睛反光、发丝、材质纹理。这些细节看起来更真,却未必存在于原来的画面里。

目前 seedance2.0 支持 4k,但是 2.5 还不支持。

人脸,被平台拦住了

我原本准备把角色母版和分镜首帧一起交给 Seedance 2.0,让四段视频继续用这张脸。只要是生成带人脸的视频,Seedance 都要先做身份验证,人脸素材不能直接上传。这张脸是模型刚生成的,现实里没这个人,但系统还是按具体人脸处理,注册不上,图生视频就卡住了。定妆图和四张分镜都做完了,最需要它们的时候,反而不能再用。

这道限制当时让我很烦,后来想想又不能简单怪它。任何人都能生成电影镜头以后,脸和声音也会变成可调用的素材。互联网上已经出现大量没得到本人许可的配音和换脸视频。人脸授权不再是发布以后才处理的版权问题,它直接进入了制作流程。

最后我放弃参考图,四段全部改成纯文生视频。代价很清楚,脸会漂,服装也可能变。

没有图,就靠文字认人

没有图片可认,我只好让文字尽量认得出她。四段提示词都重复同一份人物描述,还起了个内部代号 KDV-01:年龄、脸型、眼睛、鼻子、肤色、身材、发型、背心、牛仔裤、鞋、项链,一项不少。

KDV-01,约 25 岁韩国女性,椭圆脸,杏眼,浅暖肤色。黑色长波浪发,凌乱侧扫低马尾。灰色褪色无袖短背心,宽松高腰浅蓝牛仔裤,黑色帆布鞋,黑绳项链。

人物写完还不够。我把十秒拆开,告诉模型每一小段发生什么。

开头 2.8 秒,她坐在水泥路沿整理侧马尾,摄影者刚开机,对焦在脸和手之间来回找。

接下来的 2.7 秒,她放下手,停一下,再起身。摄影者慢半拍重新构图,曝光短暂变亮。

剩下的时间,她往画面右边走进窄巷。镜头跟得慢一点,结尾保留继续向右走的姿态。

时间不是让模型卡着秒表演戏,我拿它检查一条提示词里是不是塞了太多动作,顺便给每段留一个能接下去的结尾。

声音单独写。鸟叫、风、远处摩托车、很淡的邻里说话声、衣服和树叶的摩擦、鞋踩水泥。不要音乐,不要旁白,不要后期音效。

然后它给了我四段各十点一秒的视频。

分镜和成片,差了一个天气

下面两张图来自同一个喂猫镜头。第一张是我做的分镜:阳光穿过树叶,女主的脸很清楚,猫完整地走进画面。

喂猫镜头的分镜首帧
喂猫镜头的分镜首帧

成片没有照着来。天气变成阴天,画面偏青灰,猫只进来半个身子,还带着运动模糊。女主的脸变了,黑绳项链成了一条深色 choker,牛仔裤上凭空多出一条棕色皮带。

成片里的同一段,猫没有完整进入画面
成片里的同一段,猫没有完整进入画面

我把两张图来回看了几次,留下了成片。分镜图很漂亮,光线、人物、猫都在正确的位置,也因此像一张安排好的剧照。成片里的阴天、慢半拍的手、没走进画面的猫,倒更接近我开始想的东西。朋友拍生活,不会等猫站好再按录制。

四段之间仍然有不少没对上:脸不完全一样,服装有细小变化,天气也跳。好在人物始终往右走,道具和动作接得住。放在这种模糊、晃动、没有明确叙事的录像里,没有显得特别突兀。

四段成片的抽帧,从扎头发一直到沿街走远
四段成片的抽帧,从扎头发一直到沿街走远

四段素材是分开生成的,最后让 AI 帮忙合成。没有加音乐、LUT、降噪或额外颗粒,末尾只留了四帧黑场。

四十秒,是拼出来的

同一批素材里,还有两条更短的片段,只有八秒。它们是我单独生成的,没有进最终成片,但我反而觉得它们更接近我想要的那种真实感。画幅更宽,手持感更明显,像真的有人在路边随手拍了一段。放上来一起看。

现在刚发布的 Seedance 2.5 已经能连续生成三十秒,一次接收最多五十份图片、声音和视频,某些演示还能在一条生成里安排六个镜头。不过可惜的是展示输出只有 720p 和 24fps。手机上看问题不大,放到大屏幕或宽景里,细节还是少很多,特别是卡帧。

平台渗水,还是买有保障的官方模型

现在有很多平台如 lovart,还有很多中转平台,但是你会发现同一个按钮背后还有很大的问题。页面写着某个模型,不代表最终一定由那个模型、那个分辨率生成。有些平台会换模型或降规格,用户只看到一个能播放的结果。这也是我坚持在提示词里写清模型、分辨率和禁止静默降级的原因,并且在有保障的官方订阅里生成,并且我还会重新读文件参数,不然你被坑多少次你都不知道,这里面水分特别大。

结语

坐在键盘前生成电影,已经不再是一句玩笑。个人可以碰以前只有大团队敢碰的怪物片、广告和真人秀,也可以像我这样,造一段电影感片子。

只是按下生成以后,创作者仍然要做很多选择:钱烧在哪个版本,哪些细节能算真实,哪张脸可以使用,模型有没有被换掉,失败的镜头要修还是留下。