不用从零找项目——你已经握着 90% 的流水线;真正的难点不是「能不能动」,而是「怎么不被做成 3D」
2026-06-19
本文事实查证日期:2026 年 6 月 19 日。 AI 视频这块半年一大变,文中提到的模型版本号、显存需求都标了来源与不确定程度;凡是没法独立核实的版本/会议信息,都明确写了「以官方仓库为准」。硬件结论(5090、显存预算)基于本机实测配置。
这篇会聊不少技术名词,先用大白话过一遍,后面就不绕了:
很多人一上来就去 GitHub 海里捞项目。但对你来说,第一步不是找新项目,是盘清自己已经有什么——盘完会发现,整条流水线你已经握着九成。
硬件现实(本机实测): 显卡是 RTX 5090,32GB 显存。但要注意一个坑:Windows 桌面图形本身通常占掉 12–14GB,真正能给 AI 用的只剩 ~16–18GB。结论是:别硬上未压缩的大模型,优先用 FP8 / GGUF 量化版,而且一次只跑一个模型,跑完再跑下一个。
软件家底(已装好的两套技能):
| 你已有的 | 管什么环节 | 现状 |
|---|---|---|
/pixelle(ComfyUI + MCP 桥) |
生成:文/图生图、图生视频 | 已把 Wan 2.2 图生视频、Wan 2.1 FusionX、Flux、Qwen-Image、配音、配乐都封装成 Claude 能直接按的「按钮」(MCP 工具)。⚠ 但 MCP 桥目前没装、模型权重还没下。 |
/reel(ffmpeg + 5090 NVENC) |
卡点 + 拼接:按时间线拼片、运镜、转场、烧字幕、配音 | 整套开箱即用。「卡点切镜」用 librosa 自动找节拍来排每段时长——已选型,标注「待接入」,就差把它接进自动排时间线的环节。 |
一句话:「生成」和「卡点剪辑」两大块,你都已经有了。 缺的不是项目,是(1)补一个对剪纸更友好的生成模型,(2)把这几块串起来自动跑。
这是整件事最该先想明白的一点,想通了选型就不纠结了。
像 Wan、LTX 这类主流视频模型,都是拿海量真实拍摄视频和 3D 渲染画面训练出来的。它们看到一张扁平剪纸的「本能反应」是:把它「修正」成立体——给纸面加体积光、加摄像机透视、让纸边卷起来、让背景产生纵深位移。
这恰恰是剪纸动画最大的敌人。 剪纸片(像上海美影厂的传统剪纸片)的灵魂就是绝对的平面感:边缘干脆、色块平涂、没有立体光影。一旦被模型「3D 化」,就不是剪纸了,变成了廉价的塑料质感。
赢法只有两条,后面所有推荐都围绕这两条:
3D, cinematic lighting, depth, photorealism 全列进去。你在 goal 里自己列的几个方向——「骨架生成视频」「生成几个动作补中间」「ComfyUI + ControlNet」——其实分别对应下面五条路线。一张表说清:
| 路线 | 代表工具 | 怎么用 | 剪纸友好度 | 显存 / 可脚本化 |
|---|---|---|---|---|
| ① 通用图生视频 | Wan 2.2 I2V、LTX-Video | 喂一张剪纸图 + 文字描述,直接出动画 | ⚠ 低:最容易被 3D 化 | FP8 可压到 ~12–16GB;ComfyUI API 可全自动 |
| ② 首尾帧补间 | Wan 2.2 FLF2V | 给同一角色的两个姿势当首尾帧,AI 连中间 | ✅ 中高:锁了两端,跑不太偏 | 同上;ComfyUI 原生节点 WanFirstLastFrameToVideo |
| ③ 2D 卡通补间 | ToonCrafter、ToonComposer | 给两张卡通关键帧,专训模型补中间 | ✅✅ 最高:专学平面、几乎不脑补立体 | ToonCrafter 原生分辨率偏低(约 512×320),靠 ComfyUI 放大;5090 跑得动 |
| ④ 轨迹 / 分层控制 | Framer、LayerAnimate | 画运动轨迹线 / 把角色和背景分层 | ✅✅ 高:能强制「刚性平移」、人景分离,最像纸偶 | 有社区 ComfyUI 节点;部署前以各自仓库为准 |
| ⑤ 骨架驱动 | VACE、SparseCtrl + AnimateDiff | 用一段「骨架动作」去驱动角色 | ⚠ 看怎么用(见下) | 偏重,配置最复杂 |
关于第⑤条「骨架生成视频」要单独说清,因为这正是你问的:
「ComfyUI + ControlNet」这条老路还成立吗? ComfyUI 仍然是最该用的「总指挥台」(它有 API、能被脚本驱动)。但 2024 年那套「AnimateDiff + OpenPose ControlNet」做角色动画,在剪纸这个场景已经被②③④更新的方案比下去了。ControlNet 留给第⑤条(骨架条件)还有用。
这是给你的主推方案。它最省力、最像剪纸片,而且和你自己的直觉(「生成几个最终动作,再补齐中间」)完全一致。
关键洞察:「定格动画」其实是你的朋友,不是难点。 定格本来就是「咔、咔、咔」一格一格跳的,根本不需要丝滑。所以最聪明的做法,反而是:做几个关键姿势,把它们硬切在音乐鼓点上,中间过渡能补就补、不补也照样成立。
整条流水线拆成五步(从你给素材,到出成片):
| 步骤 | 做什么 | 用什么 |
|---|---|---|
| 0. 找节拍 | 分析你的音乐,算出每个鼓点在第几秒,得到一张「节拍时间表」 | librosa(Claude 写几行脚本就行;/reel
已选型) |
| 1. 出关键姿势 | 拿你现有的剪纸,做出同一个角色的几个不同姿势(抬手、转身、跳…) | 指令式改图:Flux.1 Kontext dev 或 Qwen-Image-Edit。由 Claude 写改图指令(「同一个剪纸小人,现在抬起左手」) |
| 2.(可选)补中间帧 | 在相邻两个关键姿势之间补过渡 | ToonCrafter(最扁平)或 Wan 2.2 FLF2V(分辨率高) |
| 3. 卡点排时间线 | 让每个姿势的切换正好踩在第 0 步的鼓点上 | /reel 的 plan,按节拍排每段时长 |
| 4. 拼接 + 配乐 | 把片段按时间线拼成片、叠上音乐,可选运镜/转场/胶片调色 | /reel 的 5090 NVENC 引擎 |
两个档位,按你想要多丝滑来选:
建议先做 A 档跑通,看效果再决定要不要升级到 B 档——这是「人力介入最少」的最优解。
你的核心诉求是「人力最少,Claude / Codex 能直接操作」。好消息:这条流水线的每一步都是「可被程序调用」的,所以确实能交给 LLM 跑。
它能成立,靠的是两种「可编程入口」:
/prompt
接口,用程序把参数(换输入图、改提示词、改帧数)塞进去触发。/pixelle
更进一步,把这些工作流包成了 Claude 能直接按的 MCP
工具(比如「图生视频」就是一次工具调用)。所以分工是这样:
研究归研究,这是把它真正跑起来需要补的「最后一公里」:
/pixelle 的 MCP 桥(设 $PIXELLE_HOME、起
daemon);或 (b) 更轻量——跳过 pixelle,让 Claude 直接驱动 ComfyUI 的
/prompt API。第一次做、想稳,选 (a);想轻、想完全自己控,选
(b)。fetch_model.py --preset wan22)。但对剪纸更友好的
ToonCrafter / Flux Kontext / Framer,目前不在
pixelle 的预设清单里,需要新增对应的 ComfyUI
节点和权重、并存一份工作流 JSON。/reel。
也就是把那个「待接入」的卡点组件,接到自动生成
plan(时间线)的环节——让每段时长按鼓点来排。/pixelle(生成)+
/reel(卡点剪辑),九成的活儿已经在手。