一张 5090 在家能跑多强的 AI 出图和视频?顺便讲清「Wan 为什么这么难伺候」

2026 年中实测:本地图像已接近专业水准,本地视频的天花板是 720p、5 秒;以及我亲手踩完的 Wan 训练「格式地狱」

leonardchow.work · 读物

2026-06-20

一句话:2026 年,一张 RTX 5090(32GB 显存)在家就能跑接近专业水准的 AI 出图;但 AI 视频的本地天花板还很现实——大约 720p、5 秒、一条渲染 2–9 分钟。而最强的视频(4K、带音、长镜头)仍然只在云端。这篇把能跑什么、什么级别、以及「Wan 这个模型为什么这么难调」讲清楚。

查证日期 2026-06-20,数据来自实测跑分 + 官方仓库,关键数字都标了。文中不含任何私密信息。

先讲几个词


一、本地出图:5090 已经接近专业水准

先说好消息。2026 年的 5090 是第一张能在家本地跑「320 亿参数级」大图像模型的消费显卡(靠量化)。能做到:4MP 高清、专业级文字排版、接近商业水平的修图。

各模型在 5090 上的实测(都查证过):

模型 显存怎么塞 速度(1024图) 最擅长
Flux.2-dev(32B,2025-11) fp16 装不下,要 fp8/GGUF(30–35G) 12–25 秒 写实 + 文字排版,质量第一
Qwen-Image-Edit-2511(20B) fp8/Q8 约 22G 几十秒 改图、中日韩文字,最接近 Nano Banana
Flux.1-dev(12B) 原生 fp16 就塞得下 7–15 秒 写实、画面内文字
SDXL / Illustrious(8B) 8G 起,不用量化 1–3 秒 二次元/扁平 2D 画风,LoRA 生态最大
Sana(英伟达) 4K 只要 8G 极快 超高分辨率、轻量

结论:写实/排版找 Flux 系,二次元/画风化角色找 SDXL(Illustrious)——后者虽然「小」,但 LoRA、ControlNet 生态最成熟,1–3 秒一张,做风格化角色反而最顺手。(我自己训角色 LoRA 最后就落到 Illustrious 上,正是这个原因。)

云端的 gpt-image-2、Nano Banana Pro 仍略强(尤其人像皮肤光影),但差距已经很小。


二、本地视频:天花板是 720p、5 秒

这是更要泼冷水、但也更有用的一节。一张 5090 在 2026 年的本地视频天花板,现实地说:约 720p、约 5 秒、16–24fps、一条渲染 2–9 分钟。 硬撑到 10–20 秒也行,但画面连贯性会垮、容易 OOM。

两个主力(都查证过实测):

模型 在 5090 上 特点
LTX-2(~19–22B,2026-01) 832×480/3.4 秒 约 22 秒出片(热启动) 最快;唯一能同时出声音;弱点:乱推镜、手画崩
Wan 2.2 14B(MoE) 同样片子 约 125 秒 慢但手最好、镜头最稳、LoRA 生态强;fp16 装不下,必须 GGUF
Wan 2.2 5B / 1.3B 轻松塞下 入门;动作精细度低于 14B
Wan 2.2 Animate Q8 GGUF 本地人物一致性最强,角色替换/动画几乎不漂移
HunyuanVideo fp8/GGUF 480p/5秒约 284 秒;1080p 很吃紧

★ 一条重要避坑 ───────────────────────────────── 很多「云 GPU 租赁」厂商的博客说「5090 根本跑不动 Wan 2.2 14B / HunyuanVideo」——这是误导性营销。那只对「未量化的 fp16」成立。实际上 ComfyUI 用户每天在 5090 上用 GGUF Q4/Q8 量化版跑这两个。信实测跑分,别信租赁页的「最低要求」。 ──────────────────────────────────────────

本地 vs 云端的真实差距:分辨率(720p vs 4K)、时长(5秒 vs 15–60秒)、声音(本地基本没有,LTX-2 例外)、物理/连贯性(本地明显弱)。最强的 Seedance 2.0 / Veo 3.1 / Kling 3.0 / Sora 2 全是云端闭源,native 4K/60fps、带同步音。一条 10 秒 1080p 云端约 ¥3.5–18(0.5–2.5 美元)。 > 但本地赢在:免费(买完卡之后)、隐私、能训自己的角色 LoRA、Wan Animate 的角色一致性。短的 5 秒 720p 片子,本地完全能用于生产。


三、Wan 为什么这么「难伺候」?(我亲手踩完的坑)

我花了很久才让 Wan 的 LoRA 训练在本地跑起来,中间踩的坑几乎和社区记录的一模一样。把原因讲清,能帮你判断「值不值得碰」。

根因:Wan 2.2 是「双专家」结构,把一切都翻倍了。

它不是一个模型,是两个各 ~14B 的专家:一个管「画面噪点多时」的大轮廓(高噪专家),一个管「快画好时」的细节纹理(低噪专家),中途按噪点比例切换。结果: - 生成时显存不翻倍(每步只用一个);但训练时一切翻倍——要分两次训、下两份权重、缓存两遍。

然后是文件格式的「地狱」(我逐个踩了):

  1. 最流行的 fp8_scaled 版,训练器根本不认。ComfyUI 用的那个压缩版带了特殊的「缩放」标记,只能拿来跑、不能拿来训。报错就是一堆 scale_weight key 对不上。
  2. fp16 版(每个专家 ~28GB)训练时会爆显存。32G 装得下模型,但训练要算梯度,峰值一超就 OOM 崩。
  3. 精度互相打架:fp16 底模强制要 fp16 模式,但「省显存的动态压缩」又只认 bf16 底模——于是你卡在 DiT weights are in fp16, mixed precision must be fp16 这种死结里。正解是去下 bf16 版,但官方又是「分片格式」,还得先合并。
  4. 救命稻草是「把模型块倒进内存」(block-swap),但慢 5 倍——每步都要把权重从内存搬到显卡,我亲测从 1 秒/步变成 7 秒/步,1000 步要 8 小时。
  5. 还有时间步分界:i2v 必须设 0.9 这个边界,否则训出来的 LoRA「没效果」。
  6. 外加一堆依赖/配置(easydict、accelerate 配置、attention 后端选哪个),装环境就先卡半天。

一句话:「随便训个 Wan LoRA」会变成「好几天的格式转换 + 爆显存调试 + 双管线记账」。这也是为什么我最后改用 SDXL(Illustrious)训角色 LoRA——单文件、非 gated、一次就跑通,1500 步 56 分钟,显存稳稳的。对比之下,Wan 的难全在「工程地狱」,不在「算力不够」。


四、给在家玩的人的实用结论