让 AI 剪纸画动起来:一台 5090 + Claude 自动做卡点定格动画

不用从零找项目——你已经握着 90% 的流水线;真正的难点不是「能不能动」,而是「怎么不被做成 3D」

leonardchow.work · 读物

2026-06-19

本文事实查证日期:2026 年 6 月 19 日。 AI 视频这块半年一大变,文中提到的模型版本号、显存需求都标了来源与不确定程度;凡是没法独立核实的版本/会议信息,都明确写了「以官方仓库为准」。硬件结论(5090、显存预算)基于本机实测配置。

先把几个词讲清楚,后面反复用

这篇会聊不少技术名词,先用大白话过一遍,后面就不绕了:


一、先看清你的硬件和「家底」

很多人一上来就去 GitHub 海里捞项目。但对你来说,第一步不是找新项目,是盘清自己已经有什么——盘完会发现,整条流水线你已经握着九成。

硬件现实(本机实测): 显卡是 RTX 5090,32GB 显存。但要注意一个坑:Windows 桌面图形本身通常占掉 12–14GB,真正能给 AI 用的只剩 ~16–18GB。结论是:别硬上未压缩的大模型,优先用 FP8 / GGUF 量化版,而且一次只跑一个模型,跑完再跑下一个。

软件家底(已装好的两套技能):

你已有的 管什么环节 现状
/pixelle(ComfyUI + MCP 桥) 生成:文/图生图、图生视频 已把 Wan 2.2 图生视频、Wan 2.1 FusionX、Flux、Qwen-Image、配音、配乐都封装成 Claude 能直接按的「按钮」(MCP 工具)。⚠ 但 MCP 桥目前没装、模型权重还没下。
/reel(ffmpeg + 5090 NVENC) 卡点 + 拼接:按时间线拼片、运镜、转场、烧字幕、配音 整套开箱即用。「卡点切镜」用 librosa 自动找节拍来排每段时长——已选型,标注「待接入」,就差把它接进自动排时间线的环节。

一句话:「生成」和「卡点剪辑」两大块,你都已经有了。 缺的不是项目,是(1)补一个对剪纸更友好的生成模型,(2)把这几块串起来自动跑。


二、核心矛盾:通用视频模型会「毁掉」剪纸的扁平感

这是整件事最该先想明白的一点,想通了选型就不纠结了。

像 Wan、LTX 这类主流视频模型,都是拿海量真实拍摄视频和 3D 渲染画面训练出来的。它们看到一张扁平剪纸的「本能反应」是:把它「修正」成立体——给纸面加体积光、加摄像机透视、让纸边卷起来、让背景产生纵深位移。

这恰恰是剪纸动画最大的敌人。 剪纸片(像上海美影厂的传统剪纸片)的灵魂就是绝对的平面感:边缘干脆、色块平涂、没有立体光影。一旦被模型「3D 化」,就不是剪纸了,变成了廉价的塑料质感。

赢法只有两条,后面所有推荐都围绕这两条:

  1. 用 2D 专训模型——它们专门学过平面卡通,知道怎么在不脑补立体的前提下让画面动(代表:ToonCrafter)。
  2. 用强约束把模型的自由发挥锁死——比如同时给首帧和尾帧(FLF2V),AI 只能在你画好的两端之间连线,没空间乱发挥;再配一句强力的「负面提示词」(negative prompt,告诉 AI「不要」出现什么),把 3D, cinematic lighting, depth, photorealism 全列进去。

三、五条技术路线横评(2026 年 6 月)

你在 goal 里自己列的几个方向——「骨架生成视频」「生成几个动作补中间」「ComfyUI + ControlNet」——其实分别对应下面五条路线。一张表说清:

路线 代表工具 怎么用 剪纸友好度 显存 / 可脚本化
① 通用图生视频 Wan 2.2 I2V、LTX-Video 喂一张剪纸图 + 文字描述,直接出动画 ⚠ 低:最容易被 3D 化 FP8 可压到 ~12–16GB;ComfyUI API 可全自动
② 首尾帧补间 Wan 2.2 FLF2V 给同一角色的两个姿势当首尾帧,AI 连中间 ✅ 中高:锁了两端,跑不太偏 同上;ComfyUI 原生节点 WanFirstLastFrameToVideo
③ 2D 卡通补间 ToonCrafter、ToonComposer 给两张卡通关键帧,专训模型补中间 ✅✅ 最高:专学平面、几乎不脑补立体 ToonCrafter 原生分辨率偏低(约 512×320),靠 ComfyUI 放大;5090 跑得动
④ 轨迹 / 分层控制 Framer、LayerAnimate 画运动轨迹线 / 把角色和背景分层 ✅✅ 高:能强制「刚性平移」、人景分离,最像纸偶 有社区 ComfyUI 节点;部署前以各自仓库为准
⑤ 骨架驱动 VACE、SparseCtrl + AnimateDiff 用一段「骨架动作」去驱动角色 ⚠ 看怎么用(见下) 偏重,配置最复杂

关于第⑤条「骨架生成视频」要单独说清,因为这正是你问的:

「ComfyUI + ControlNet」这条老路还成立吗? ComfyUI 仍然是最该用的「总指挥台」(它有 API、能被脚本驱动)。但 2024 年那套「AnimateDiff + OpenPose ControlNet」做角色动画,在剪纸这个场景已经被②③④更新的方案比下去了。ControlNet 留给第⑤条(骨架条件)还有用。


四、推荐路线:「几个关键动作 + 卡点硬切」——这正是定格的本质

这是给你的主推方案。它最省力、最像剪纸片,而且和你自己的直觉(「生成几个最终动作,再补齐中间」)完全一致

关键洞察:「定格动画」其实是你的朋友,不是难点。 定格本来就是「咔、咔、咔」一格一格跳的,根本不需要丝滑。所以最聪明的做法,反而是:做几个关键姿势,把它们硬切在音乐鼓点上,中间过渡能补就补、不补也照样成立。

整条流水线拆成五步(从你给素材,到出成片):

步骤 做什么 用什么
0. 找节拍 分析你的音乐,算出每个鼓点在第几秒,得到一张「节拍时间表」 librosa(Claude 写几行脚本就行;/reel 已选型)
1. 出关键姿势 拿你现有的剪纸,做出同一个角色的几个不同姿势(抬手、转身、跳…) 指令式改图:Flux.1 Kontext dev 或 Qwen-Image-Edit。由 Claude 写改图指令(「同一个剪纸小人,现在抬起左手」)
2.(可选)补中间帧 在相邻两个关键姿势之间补过渡 ToonCrafter(最扁平)或 Wan 2.2 FLF2V(分辨率高)
3. 卡点排时间线 让每个姿势的切换正好踩在第 0 步的鼓点上 /reel 的 plan,按节拍排每段时长
4. 拼接 + 配乐 把片段按时间线拼成片、叠上音乐,可选运镜/转场/胶片调色 /reel 的 5090 NVENC 引擎

两个档位,按你想要多丝滑来选:

建议先做 A 档跑通,看效果再决定要不要升级到 B 档——这是「人力介入最少」的最优解。


五、谁来按按钮:LLM 怎么「操盘」整条线

你的核心诉求是「人力最少,Claude / Codex 能直接操作」。好消息:这条流水线的每一步都是「可被程序调用」的,所以确实能交给 LLM 跑。

它能成立,靠的是两种「可编程入口」:

  1. 生成端 = MCP 工具 / ComfyUI API。 ComfyUI 的精髓是:任何搭好的工作流都能导出成一份 JSON,然后通过它的 /prompt 接口,用程序把参数(换输入图、改提示词、改帧数)塞进去触发。/pixelle 更进一步,把这些工作流包成了 Claude 能直接按的 MCP 工具(比如「图生视频」就是一次工具调用)。
  2. 剪辑端 = 脚本。 找节拍(librosa)、排时间线、用 ffmpeg 拼片配乐,全是 Claude 能直接写、直接跑的 Python / 命令。

所以分工是这样:


六、落到你这台机器,还差哪几步(可执行清单)

研究归研究,这是把它真正跑起来需要补的「最后一公里」:

  1. 打通生成端的程序入口。 两条路二选一:(a) 装好 /pixelle 的 MCP 桥(设 $PIXELLE_HOME、起 daemon);或 (b) 更轻量——跳过 pixelle,让 Claude 直接驱动 ComfyUI 的 /prompt API。第一次做、想稳,选 (a);想轻、想完全自己控,选 (b)。
  2. 下模型 + 补工作流。 Wan 2.2 可以直接用预设脚本下(fetch_model.py --preset wan22)。但对剪纸更友好的 ToonCrafter / Flux Kontext / Framer,目前不在 pixelle 的预设清单里,需要新增对应的 ComfyUI 节点和权重、并存一份工作流 JSON。
  3. 把 librosa 卡点接进 /reel 也就是把那个「待接入」的卡点组件,接到自动生成 plan(时间线)的环节——让每段时长按鼓点来排。
  4. 守住显存红线。 全程用 FP8 / GGUF 量化版,一次只跑一个模型;遇到 CUDA OOM 就重启 ComfyUI 释放碎片显存。

小结 / 下一步