Wan-Animate-2是什么
Wan-Animate-2是万相团队开源的新一代角色动画模型,作为 Wan-Animate 的重大架构升级,放弃了对显式姿态骨架和辅助姿态提取网络的依赖,改为端到端的双分支 Diffusion Transformer(DiT),直接从参考视频中捕捉运动先验。模型支持文本驱动的视角控制,提供可达 24 fps 的实时流式变体。
Wan-Animate-2的主要功能
-
驱动视频转角色动画:输入参考图
reference.png与驱动模板视频template.mp4,让参考角色复刻驱动视频中的动作与镜头节奏。 -
端到端运动迁移:重新设计的 DiT 直接消费驱动视频,不再经过中间运动提取器,目标是同时提升运动保真与身份一致性。
-
身份/外观保持:通过 reference image token 与 reference video token 参与注意力计算,把参考外观注入生成过程,减少“动作像但脸崩”的情况。
-
文本规范化控制:推理前先用 LLM 生成固定范式 caption,只写“人物外观描述 + 背景描述”,不描述动作、不推测情绪,再作为 Wan-Animate-2 的 prompt。
-
文本驱动视角控制:支持用文本把输出相机视角与驱动视频解耦,方便做“同一套动作、不同机位/视角”的生成。
-
Base 高质量模式:默认推理脚本走常规配置,官方示例 Diffusers 侧为
num_inference_steps=40,更偏质量优先。 -
Distillation 低步数模式:蒸馏权重示例为 10 steps、
guidance_scale=1.0、Euler solver/no CFG,面向更快出片与低延迟验证。 -
实时化前瞻功能:论文提出 Wan-Animate-2-Lite,用 teacher forcing、error buffer、Self-Forcing 蒸馏与 chunk-wise 反传,把延迟压向实时阈值,面向流式角色动画。
-
本地与在线体验:提供本地 Gradio 脚本,Base 用
wan_animate_2_gradio.py,蒸馏用wan_animate_2_gradio_distillation.py;README 也指向 ModelScope Studio 在线 demo。 -
工程生态入口:权重走 HuggingFace/ModelScope,模型 ID 示例为
Wan-AI/Wan2.2-Animate-2-14B;Diffusers 已可源码安装接入,ComfyUI/DiffSynth-Studio 仍在 Todo。 -
可配置并行生成:默认按 8×A800、720P 调参,也测过 2×A800、480P;不同硬件需要改 YAML 并行配置。
如何使用Wan-Animate-2
-
准备硬件:优先按官方默认 8×A800、720P 规划;官方另测过 2×A800、480P,消费级单卡不要默认能跑。
-
克隆仓库:
git clone --recursive https://github.com/Wan-Video/Wan-Animate-2.git。 -
建环境:Python 3.11;安装 torch 2.7.0 / torchvision 0.22.0 / torchaudio 2.7.0,CUDA 12.6 源;再装
requirements.txt、flash-attn,最后pip install -e .。 -
下载权重:HuggingFace 用
huggingface-cli download Wan-AI/Wan2.2-Animate-2-14B --local-dir ./ckpts/;ModelScope 用modelscope download --model Wan-AI/Wan2.2-Animate-2-14B --local_dir ./ckpts/。 -
先生成 caption:用 Qwen3.7-Plus 之类 LLM,按官方中文范式只写“人物外观描述 + 背景描述”,不要写动作、情绪或评价。
-
跑 Base:进入
infer,执行wan_animate_2_demo.py,传--prompt、--refer-img-file、--refer-video-file、--config ./wan_animate_2.yaml。 -
跑蒸馏版:改用
wan_animate_2_distillation.yaml,并加--sample_guide_scale 1.0 --step 10;Diffusers 侧对应guidance_scale=1.0、flow_solver="euler"。 -
改并行配置:GPU 数量/显存与官方不一致时,先改 YAML parallel configs,再排查 OOM 或速度异常。
-
快速体验:不想部署可先试 ModelScope Studio;本地则运行
wan_animate_2_gradio.py或wan_animate_2_gradio_distillation.py。
微信关注回复“开源”,加入AI开源项目交流群
Wan-Animate-2的核心优势
-
动作保真与身份一致性是主卖点:去掉中间运动提取器,理论上少一层误差累积。
-
更贴近生产链路:官方把 caption 前置成固定范式,要求描述人物外观与背景、不描述动作,便于稳定复现。
-
低延迟路线明确:Distillation 已可跑 10 步推理;Lite 论文口径更是直指实时/流式数字人。
-
可商用友好度较高:Apache-2.0 对二次开发更友好,但实际商用仍要处理素材版权、肖像权与平台规则。
Wan-Animate-2的项目地址
- 项目官网:https://humanaigc.github.io/wan-animate-2
- Github仓库:https://github.com/Wan-Video/Wan-Animate-2
- ModelScope:https://modelscope.cn/models/Wan-AI/Wan2.2-Animate-2-14B
- arXiv技术论文:https://arxiv.org/pdf/2608.06009
- 在线体验Demo:https://www.modelscope.cn/studios/Wan-AI/Wan2.2-Animate
Wan-Animate-2的同类竞品对比
| 对比维度 | Wan-Animate-2 | MagicAnimate | MusePose |
|---|---|---|---|
| 核心任务 | 参考图 + 驱动视频生成角色动画,强调端到端动作迁移与身份保持。 | 单张图 + motion video 生成动画,主打时序一致性与参考图保真。 | 参考图 + pose 序列生成虚拟人视频,偏舞蹈/全身动作。 |
| 技术路线 | 重新设计 DiT 直接消费驱动视频,去掉中间运动提取器;加文本驱动视角控制。 | 早期扩散方案,默认依赖 DensePose 驱动;需配 SD1.5、MSE VAE 与项目 checkpoints。 | diffusion-based + pose-guided;基于/优化 Moore-AnimateAnyone 路线,并提供 pose align。 |
| 动作信号 | 直接用 driving video,少一层姿态/关键点中间表示。 | 依赖 motion video/DensePose 类条件。 | 显式 dwpose 序列,先把舞蹈视频对齐到参考图再推理。 |
| 身份/细节 | 目标是高保真运动 + 强身份保持;真实效果仍建议同素材自测脸、手、闪烁。 | 官网自承脸和手可能失真,默认配置可能出现动漫到写实的风格漂移。 | 官方 Limitations 写明:脸部区域、复杂服装细节保持不稳定,复杂背景有噪声/闪烁。 |
| 速度/实时 | Distillation 示例 10 steps、无 CFG、Euler;论文另提 Lite 冲实时流式。 | 属早期高质量扩散路线,未以实时为主卖点。 | 未主打实时;优势在 pose align 提升可用性,不是低延迟架构。 |
| 分辨率/硬件 | 默认 8×A800、720P;官方测过 2×A800、480P;硬件不同要改 YAML 并行。 | 官网安装要求 python>=3.8、CUDA>=11.3、ffmpeg;未给新一代显存承诺。 | 官方给出 512×512×48 约 16GB VRAM、768×768×48 约 28GB VRAM;训练机示例为 8×80GB。 |
| 生态/易用 | HuggingFace/ModelScope 权重、Gradio、Diffusers 源码接入;ComfyUI 仍在 Todo。 | 有 HuggingFace/Replicate/Colab 等早期体验入口,但架构偏老。 | 已支持 Comfyui-MusePose,2025-03-04 发布 train codes。 |
Wan-Animate-2的应用场景
-
虚拟主播 / 数字人直播:Lite 路线明确指向实时阈值与流式角色动画,适合做“真人驱动虚拟形象”的低延迟直播间。
-
短视频 / 短剧角色替身:把演员的表演视频作为 driving video,套到角色立绘或参考图上,适合奇幻角色、IP 形象、低成本替身镜头;核心是端到端动作迁移与身份保持。
-
舞蹈、MV、手势舞二创:用一段舞蹈模板驱动不同角色形象,做多角色翻跳、同框换装或风格化 MV;视角控制还能做“同动作不同机位”的剪辑素材。
-
电商与品牌内容:让品牌 mascot、虚拟模特按统一模板展示动作,用于上新短片、活动页视频、社媒素材;商用前要处理肖像、服装版权与平台合规。
-
教育 / 知识博主课件:把讲师形象或卡通讲师驱动成固定动作模板,批量生成开场、转场、知识点提示镜头,降低重复拍摄成本。
-
游戏 NPC / 过场预演:策划先用真人表演快速驱动角色原型,验证动作节奏、镜头和情绪,再决定是否进入正式动捕与渲染管线。



京公网安备 京ICP备17006096号-3