2026 年中实测:本地图像已接近专业水准,本地视频的天花板是 720p、5 秒;以及我亲手踩完的 Wan 训练「格式地狱」
2026-06-20
一句话:2026 年,一张 RTX 5090(32GB 显存)在家就能跑接近专业水准的 AI 出图;但 AI 视频的本地天花板还很现实——大约 720p、5 秒、一条渲染 2–9 分钟。而最强的视频(4K、带音、长镜头)仍然只在云端。这篇把能跑什么、什么级别、以及「Wan 这个模型为什么这么难调」讲清楚。
查证日期 2026-06-20,数据来自实测跑分 + 官方仓库,关键数字都标了。文中不含任何私密信息。
先说好消息。2026 年的 5090 是第一张能在家本地跑「320 亿参数级」大图像模型的消费显卡(靠量化)。能做到:4MP 高清、专业级文字排版、接近商业水平的修图。
各模型在 5090 上的实测(都查证过):
| 模型 | 显存怎么塞 | 速度(1024图) | 最擅长 |
|---|---|---|---|
| Flux.2-dev(32B,2025-11) | fp16 装不下,要 fp8/GGUF(30–35G) | 12–25 秒 | 写实 + 文字排版,质量第一 |
| Qwen-Image-Edit-2511(20B) | fp8/Q8 约 22G | 几十秒 | 改图、中日韩文字,最接近 Nano Banana |
| Flux.1-dev(12B) | 原生 fp16 就塞得下 | 7–15 秒 | 写实、画面内文字 |
| SDXL / Illustrious(8B) | 8G 起,不用量化 | 1–3 秒 | 二次元/扁平 2D 画风,LoRA 生态最大 |
| Sana(英伟达) | 4K 只要 8G | 极快 | 超高分辨率、轻量 |
结论:写实/排版找 Flux 系,二次元/画风化角色找 SDXL(Illustrious)——后者虽然「小」,但 LoRA、ControlNet 生态最成熟,1–3 秒一张,做风格化角色反而最顺手。(我自己训角色 LoRA 最后就落到 Illustrious 上,正是这个原因。)
云端的 gpt-image-2、Nano Banana Pro 仍略强(尤其人像皮肤光影),但差距已经很小。
这是更要泼冷水、但也更有用的一节。一张 5090 在 2026 年的本地视频天花板,现实地说:约 720p、约 5 秒、16–24fps、一条渲染 2–9 分钟。 硬撑到 10–20 秒也行,但画面连贯性会垮、容易 OOM。
两个主力(都查证过实测):
| 模型 | 在 5090 上 | 特点 |
|---|---|---|
| LTX-2(~19–22B,2026-01) | 832×480/3.4 秒 约 22 秒出片(热启动) | 最快;唯一能同时出声音;弱点:乱推镜、手画崩 |
| Wan 2.2 14B(MoE) | 同样片子 约 125 秒 | 慢但手最好、镜头最稳、LoRA 生态强;fp16 装不下,必须 GGUF |
| Wan 2.2 5B / 1.3B | 轻松塞下 | 入门;动作精细度低于 14B |
| Wan 2.2 Animate | Q8 GGUF | 本地人物一致性最强,角色替换/动画几乎不漂移 |
| HunyuanVideo | fp8/GGUF | 480p/5秒约 284 秒;1080p 很吃紧 |
★ 一条重要避坑 ─────────────────────────────────
很多「云 GPU 租赁」厂商的博客说「5090 根本跑不动 Wan 2.2 14B /
HunyuanVideo」——这是误导性营销。那只对「未量化的
fp16」成立。实际上 ComfyUI 用户每天在 5090 上用
GGUF Q4/Q8
量化版跑这两个。信实测跑分,别信租赁页的「最低要求」。
──────────────────────────────────────────
本地 vs 云端的真实差距:分辨率(720p vs 4K)、时长(5秒 vs 15–60秒)、声音(本地基本没有,LTX-2 例外)、物理/连贯性(本地明显弱)。最强的 Seedance 2.0 / Veo 3.1 / Kling 3.0 / Sora 2 全是云端闭源,native 4K/60fps、带同步音。一条 10 秒 1080p 云端约 ¥3.5–18(0.5–2.5 美元)。 > 但本地赢在:免费(买完卡之后)、隐私、能训自己的角色 LoRA、Wan Animate 的角色一致性。短的 5 秒 720p 片子,本地完全能用于生产。
我花了很久才让 Wan 的 LoRA 训练在本地跑起来,中间踩的坑几乎和社区记录的一模一样。把原因讲清,能帮你判断「值不值得碰」。
根因:Wan 2.2 是「双专家」结构,把一切都翻倍了。
它不是一个模型,是两个各 ~14B 的专家:一个管「画面噪点多时」的大轮廓(高噪专家),一个管「快画好时」的细节纹理(低噪专家),中途按噪点比例切换。结果: - 生成时显存不翻倍(每步只用一个);但训练时一切翻倍——要分两次训、下两份权重、缓存两遍。
然后是文件格式的「地狱」(我逐个踩了):
scale_weight key 对不上。DiT weights are in fp16, mixed precision must be fp16
这种死结里。正解是去下 bf16
版,但官方又是「分片格式」,还得先合并。一句话:「随便训个 Wan LoRA」会变成「好几天的格式转换 + 爆显存调试 + 双管线记账」。这也是为什么我最后改用 SDXL(Illustrious)训角色 LoRA——单文件、非 gated、一次就跑通,1500 步 56 分钟,显存稳稳的。对比之下,Wan 的难全在「工程地狱」,不在「算力不够」。