Wan(通义万相)是阿里巴巴的视频生成模型家族,它以两种容易被混淆的形态存在。一种是发布在 GitHub 与 Hugging Face 上、采用 Apache 2.0 许可的开放模型权重,任何人都可以下载并在自己的硬件上运行。另一种是位于 wan.video 的托管创作台,你付订阅费、在浏览器里生成,不需要拥有显卡。这个品类里的多数工具只居其一,而 Wan 两者兼有;至于你该关心哪一种,完全取决于你手里有没有一块显存够用的显卡。
归属问题值得先讲清楚,因为以知名开源模型命名的域名经常被第三方抢注。这一个不是。wan.video 的页脚写着「Wan © 2026 Powered by Alibaba Cloud」,并列出 wan_ai@service.alibaba.com 作为联系地址。更具决定性的证据在基础设施层面:站点的前端资源全部由阿里自有的内容分发网络在通义实验室命名空间下提供——样式表与应用打包文件都从 g.alicdn.com/tongyi-lab-fe/wan/ 加载;其站点分析标识被设为 tongyiwanxiang,正是 Wan 的中文品牌名;其埋点脚本是阿里内部的 npm 包。任何第三方都无法把代码部署进另一家公司自有 CDN 的命名空间。这就是一方站点。
在开源一侧,官方 GitHub 组织是 Wan-Video,官方 Hugging Face 账号是 Wan-AI。Wan2.2 仓库把自己描述为开放且先进的大规模视频生成模型,拥有 17,280 个 star 与 2,191 个 fork;更早的 Wan2.1 仓库拥有 16,888 个 star 与 3,450 个 fork。两者许可均为 Apache-2.0,该组织下的衍生仓库亦然,其中包括面向角色动画的 Wan-Animate-2,面向舞蹈动作的 Wan-Dancer,以及被描述为让 AI 智能体调用 Wan 生成能力的技能包 Wan-skills。
托管产品的迭代速度快于多数第三方收录的更新速度。站点当前主推的是 Wan3.0——首要行动按钮写着「Try Wan3.0 Now」,特性区标题为「Introducing Wan3.0」——而部署最广的开放权重仍是 2.1 与 2.2 两代。如果你读到过把 Wan 简单描述为文生图与文生视频平台的说法,那份描述早于当前版本。
开放权重与托管创作台并非同一产品的不同包装。它们在许可、能力,以及你能拿产出物做什么这三件事上都不同。
权重给你的是 Apache 2.0 条款,允许商业使用、修改与再分发,前提是保留版权声明与许可文本。Hugging Face 模型卡更进一步,用一句话直接放弃了产出物权利:官方声明不主张对用户生成内容的任何权利,用户可自由使用,只需确保用途符合该许可的规定(英文原文为 We claim no rights over the your generated contents,其中的 the your 是发布时即存在的笔误)。这在产出物归属上是一个异常干净的立场,原文中的笔误此处按发布原样保留。
托管创作台适用它自己的订阅条款,而这些条款在本次调研中未能取得——下文会完整说明这一局限。不要想当然地认为 Apache 2.0 的产出物立场会自动延伸到 create.wan.video 上生成的内容。
官网为 Wan3.0 列出五项视频侧能力,每一项都给出了具体主张而非空泛描述。Omni-Creation 接受最多 20 个参考素材,并能解析文档与网页作为输入。Native 30s Duration 原生生成 30 秒时长,而非把较短片段拼接起来,公司把它诠释为支撑更完整的叙事。Pixel-Perfect Consistency 的定位落在「为生产工作流提升交付确定性」上——值得注意的是这是生产口径而非创作口径。Immersive Experience 这一项涵盖的是真实感、质感与声音设计三个方面。Precision Video Editing 则对应可控的编辑。
另有五项能力面向图像。Portrait Customization 可细到骨骼结构与眼部细节。Advanced Text Rendering 支持 12 种语言的长文本,并能生成图表、公式与信息图——文字渲染长期是图像模型的短板,这是一个针对性很强的主张。Precise Color Control 掌控色彩分布。Multi-Image Editing 可把最多 9 张图像融合为单一产出。Sequential Storytelling 可生成最多 12 张风格与主体一致的连续图像。Interactive Editing 允许框选区域,在像素级对齐创作意图。
create.wan.video 的创作控制台带有八个导航模块,依次是探索(Explore)、生成(Generate)、画布(Canvas)、技能(Skills)、实验场(Playground)、时间线(TimeLine)、素材(Assets)与收藏(Favorites)。其中 Canvas 与 TimeLine 的存在尤其说明这是一个编排与时序环境,而不是一次「生成并下载」的单次交互。控制台顶部另有独立的 CLI 与 API 入口。
Wan2.2 提供五个变体,而参数量在这里很重要,因为它决定了你需要什么硬件。T2V-A14B 是文生视频模型,采用混合专家架构,总参数 270 亿、每步推理激活约 140 亿。I2V-A14B 是同架构的图生视频模型。TI2V-5B 是 50 亿参数的稠密模型,在单一检查点中统一了文生与图生视频两种任务。S2V-14B 处理语音驱动视频。Animate-14B 处理角色动画与替换。这些模型以 480P 与 720P、24fps 生成。
混合专家设计是架构上的看点:不是由一个模型承担整个去噪过程,而是设有两个专用专家,一个负责高噪声的早期阶段,一个负责低噪声的精修阶段。ComfyUI 的官方文档为该模型维护着原生工作流,它把由此带来的优势归纳为三点——电影级美学控制,可在光照、色彩与构图上进行多维掌控;大幅度复杂运动,流畅度与可控性均有提升;以及在复杂多主体场景中的精准语义遵循。该文档还指出 5B 版本使用高压缩比 VAE 以优化显存占用。
仓库对运行这些模型所需的条件毫不含糊。对 A14B 系列模型,文档写明其运行命令需要一块至少具备 80GB 显存的 GPU。对 TI2V-5B,官方说明它可以在 4090 这类消费级显卡上运行,所需显存至少为 24GB,文档中点名的示例机型正是 RTX 4090。
这是一道很宽的鸿沟,而它已经明显地塑造了真实世界的采用格局。Hugging Face 自有接口显示,30 天下载量居首的是 1.3B 版的文生视频模型,达到 204,432 次;紧随其后的是 5B 版的文图生视频统一模型,为 198,975 次。旗舰级的 A14B 模型反而落后:图生视频 134,807 次,文生视频 132,815 次。换句话说,最小和次小的模型,下载量大约是最大那两个的一点五到三倍。这项技术真正的约束条件不是模型质量,而是用户机器里的那块显卡。
官网把 API 当作独立的第三条产品线对待,在顶部导航中与 Features、Open Source 平起平坐,页脚也另设分组,其中一个入口通向平台概览,另一个通向接口接入说明。定价页记录了一条重要的商业细节:创作台订阅仅覆盖 create.wan.video 上的模型创作,API 与其他产品需要另行购买。API 的具体定价与调用规格在本次调研中未能取得。
自托管视频生成。 开放权重最清晰的用途。如果你有一块 24GB 的卡,TI2V-5B 就在射程之内;如果你有数据中心级硬件,A14B 系列也可以。Apache 2.0 许可意味着产出物与部署都归你,前提是遵守其载明的内容限制。
在模型之上做二次开发。 由于权重可下载、许可允许修改与再分发,这些模型可以被微调、量化、包装成产品,或集成进专有系统。仅 Wan2.1 一个仓库就有 3,450 个 fork,说明这件事正在大规模发生。
ComfyUI 与节点式工作流。 ComfyUI 为 Wan2.2 维护着官方原生工作流,这让习惯用节点图而非命令行的大量创作者也能用上这些模型。
没有硬件时的评估。 托管创作台的免费档正是为此而存在。你可以在决定是否投资显卡或订阅之前先判断输出质量。
中等产量的生产级视频工作。 付费档解锁 1080p 输出、10 到 30 秒区间的视频,以及无水印下载——这三样正是把演示与可交付成果区分开来的东西。
多语种图文混排。 覆盖 12 种语言的长文本渲染,包括图表与信息图,瞄准的是多数图像模型处理得都不好的一类需求。
智能体驱动的生成。 Wan-skills 仓库把生成能力封装为智能体技能包,创作台又暴露了 CLI,两者结合适合程序化与自动化的流水线。
即便硬件跑得动更大的模型,也先从 5B 版开始。 下载数据表明社区收敛到它自有其道理:它在单一检查点里统一了文生与图生视频,且能在一块消费级显卡上运行。先在这里把工作流跑通,再考虑向上扩展。
有意识地在中文与英文之间选择提示词语言。 这些模型在构建时就支持中英双语提示。如果你的题材在某一种语言中的表征更充分,那值得实测而不是想当然。
用图生视频来换取可控性。 从一张你已经掌控的图像出发,相比文生视频消除了一整个维度的不确定性——这也正是 I2V-A14B 在该账号所有模型中点赞数最高的原因。
不要指望用免费档产出可发布的内容。 无水印下载从付费档才开始提供。为评估质量而生成的产出,并不是你能拿去交付的产出。
对第一个计费周期要格外审慎。 定价页写明订阅自动续费、可随时取消,但首月或首年一经激活便不予退款。除非你已经很有把握,第一次尝试请选月付。
不要假设创作台继承了开源许可。 Apache 2.0 条款与「不主张产出物权利」的声明来自模型仓库。托管服务有自己的条款,而本文未能取得。
若要再分发,请保留许可文本。 Apache 2.0 允许商业使用、修改与再分发,但以保留原始版权声明与许可文本为条件。把模型打包进产品时,这一点很容易被忽略。
大规模部署前先读内容限制。 模型卡禁止违反适用法律、对个人或群体造成伤害、传播意图伤害他人的个人信息、散布错误信息或针对弱势群体的内容,并声明用户对遵守这些限制负全部责任。
拥有 GPU 资源的开发者与团队 在这里能拿到最具差异性的价值。宽松许可下的开放权重,外加对产出物权利的明确弃权声明,这个组合在视频模型中并不多见。
研究者与做微调的人 会被变体的铺开程度很好地服务——五个任务专用模型,加上独立的动画与舞蹈仓库,提供了充足的起点。
ComfyUI 用户 拥有一条获得官方支持的路径,而这在被移植进该生态的模型中并非常态。
没有硬件的创作者 可以使用托管创作台,但应当在价格与产出上与专门的托管竞品做对比评估,而不要想当然地认为开源出身会自动转化为更好的托管产品。
智能体与自动化的构建者 有 CLI、API 线路与 Wan-skills 仓库可用。
不建议选用的情况: 期待在消费级硬件上自托管旗舰模型的人,因为 80GB 是数据中心级要求;需要在投入前先审阅托管服务条款的人,因为那些文档不可达;所在地区拿不到移动应用、又必须要原生应用而非移动网页的人;以及希望用单一供应商关系覆盖创作台、API 及其他一切的人,因为这些是分开购买的。
自托管。 任何满足显存门槛的机器均可,模型经由代码托管平台 GitHub 与模型托管平台 Hugging Face 获取。这是使用 Wan 能力最完整、约束最少的方式。
网页创作台。 create.wan.video,带有上文所述的八模块控制台。对本地硬件没有要求。
移动端。 官网提供 App Store 与 Google Play 链接,但附带了一条公司自己写明的告诫:「App not available in your region? Try our mobile web version.」这个区域限制是真实存在的——以三组关键词检索美国区 App Store,未返回任何由阿里发行的 Wan 应用。返回的是不相干的产品,以及两个借用该名称的第三方应用,各自只有一到两条评分,样本量远不足以说明任何问题,也不应被误认作官方产品。
API。 作为独立产品线提供,需要单独购买。
ComfyUI。 有官方文档支持的原生工作流。
这里被定价的其实是两样东西,不应混为一谈。
开放权重是免费的。 Apache 2.0 许可、可下载、可商用。你的成本是硬件与电费。
托管创作台设三档会员。 价格按每月列示,年付标注 50% off:
| 档位 | 年付(折合每月) | 月付 | 每月积分 | 并发视频 | 并发图像 |
|---|---|---|---|---|---|
| Free | $0 | $0 | — | 1 | 1 |
| Pro | $5 | $10 | 300 | 3 | 3 |
| Premium | $20 | $40 | 1,200 | 8 | 5 |
公司提供了换算口径,让积分变得可推算:Pro 的 300 积分约合最多 1,200 张图或 60 个视频,Premium 的 1,200 积分约合最多 4,800 张图或 240 个视频。定价页另设 Credits 与 Gift Cards 两个页签,在会员体系之外单独售卖。
免费档不包含什么,与付费档包含什么同样重要。免费档只有 6 种图像风格而非全部,不能下载无水印图像或视频,不能生成 1080p 视频,也不能生成 10 到 30 秒的较长视频。付费档补上以上全部,另加图像放大。所有档位都可通过每日签到赚取积分。
两条付款条款值得注意。 订阅自动续费、可随时取消,但首月或首年一经激活便不予退款。另外,该订阅仅覆盖 create.wan.video 上的模型创作——API、DealDance 及其他产品需要另行购买。
纯托管型视频生成器 是与创作台的天然对照。如果你完全不打算在本地跑权重,就应当纯粹按产出质量、价格与权利条款去评估 Wan 的创作台;它的开源出身在这个比较里并不带来任何优势。
其他开放权重视频模型 才是你真要自托管时的相关对照。该问的问题是许可条款、各质量档位的显存要求,以及生态支持度。Wan 在第一项上表现很好——Apache 2.0 加上明确的产出物权利弃权,处在宽松的一端——而它的 ComfyUI 支持是官方维护的。
跑较小的 Wan 变体 本身就是跑旗舰版的替代方案。鉴于 TI2V-5B 的下载量接近 1.3B 版、且明显高于 A14B 那一对,社区实际给出的判断是:5B 这一档在质量与硬件之间的取舍才是合理的默认值。
阿里的其他视频模型 不应与 Wan 混淆。该公司有不止一条视频生成产品线,出自不同团队;关于「阿里某视频模型」的报道并不自动等同于关于 Wan 的报道。二手信源在这一点上经常出错。
托管服务的条款未能取得。 这是本文最重要的一处信息缺口,此处如实说明而非含糊带过。页脚上指向使用政策、服务条款、隐私政策与训练数据说明的四个链接,全部是不带 href 属性的 JavaScript 事件处理器。直接请求对应路径只返回 258 字符的单页应用壳。用无头浏览器渲染 create.wan.video/terms 会被重定向到错误页。因此本文对托管服务的条款、隐私处理与训练数据披露不作任何断言。任何有商业依赖的人,都应在投入之前直接向公司索取这些文档。
产出物权利在权重侧清晰,在创作台侧不明。 模型卡对生成内容权利的弃权声明是具体且可核验的,它适用于开放模型。create.wan.video 是否采用同样立场,本次调研无法确认。
旗舰模型需要数据中心级硬件。 80GB 显存把 A14B 挡在个人用户射程之外。24GB 的 5B 模型才是现实的消费级天花板,而下载量分布显示社区已相应地作出了调整。
免费档无法产出可发布的内容。 没有无水印下载、没有 1080p、没有更长时长,图像风格只有 6 种。
第一个计费周期不予退款。 自动续费、可随时取消,但首月或首年激活后不退款。
购买不能在不同触点之间通用。 创作台订阅不覆盖 API 或其他产品。请据此做预算。
移动端可得性受区域限制。 公司在自己站点上就是这么说的,而美国区 App Store 中没有官方应用这一事实也佐证了这一点。
内容限制适用,且责任在你。 模型卡禁止若干类内容,并声明用户对遵守规定负全部责任。
站点元数据落后于产品。 当前版本是 Wan3.0,而流通中的许多描述性材料——包括本条目所继承的元数据——描述的是一个更早、更窄的产品。请以站点本身为准来判断当前能力,不要依赖第三方描述。
分类归属需要更正。 本条目此前把视频编辑列为主分类。而产品自身的表述是生成优先:四项首屏能力中三项是生成,五个开源模型变体全部是生成或驱动类模型,公司自己的标题也称其为视频生成模型。编辑能力真实存在,但属次要。
当心二手报道中的张冠李戴。 本次调研中,一份检索摘要把一则知名视频模型排名归到了 Wan 名下,而底层文章讲的是另一支团队的另一款阿里模型。凡是关于「阿里视频模型」的性能与排名说法,都应回到原文核对其真实主体。
既是也不是,取决于你指的是哪个产品。模型权重是真正免费的,采用 Apache 2.0 许可——下载、运行、商用皆可,前提是保留许可文本并遵守载明的内容限制,你唯一的成本是硬件。wan.video 的托管创作台设有免费档,但受限颇多:1 个并发视频与 1 个并发图像、6 种图像风格、不能下载无水印素材、没有 1080p、没有更长视频。付费档从年付折合每月 5 美元起。
是阿里巴巴,出自其通义实验室;wan.video 是官方站点。页脚写着「Wan © 2026 Powered by Alibaba Cloud」,联系方式为 wan_ai@service.alibaba.com。更有力的证据在基础设施层面:站点的样式表与应用打包文件由阿里自有 CDN 在 tongyi-lab-fe 命名空间下提供,其站点分析产品标识为 tongyiwanxiang,并加载了阿里内部的 npm 包用于埋点。第三方无法部署进另一家公司的 CDN 命名空间。官方 GitHub 组织是 Wan-Video,官方 Hugging Face 账号是 Wan-AI。
对开放模型而言,这个立场异常清晰。Apache 2.0 允许商业使用,模型卡并声明团队不主张对你生成内容的任何权利,只要用途符合许可规定即可自由使用。对托管创作台而言,本次无法确定——其服务条款在调研中不可取得。如果你的商业计划依赖创作台的产出而非自托管的产出,请先取得书面确认。
完全取决于变体。TI2V-5B 需要至少 24GB 显存,文档点名 RTX 4090 是可行的消费级显卡。A14B 系列——T2V-A14B、I2V-A14B——需要至少 80GB,也就是数据中心级硬件。这道鸿沟是关于自托管 Wan 最重要的一个现实事实,下载统计也印证了它:1.3B 与 5B 的下载量远高于 14B 那一档。
Wan2.2 提供五个。T2V-A14B 从文本生成视频,采用混合专家设计,总参数 270 亿、每步约激活 140 亿。I2V-A14B 从图像生成视频,架构相同。TI2V-5B 是更小的稠密模型,在一个检查点里完成上述两项任务,也正是能在消费级硬件上运行的那一个。S2V-14B 从语音生成视频。Animate-14B 处理角色动画与替换。全部以 480P 与 720P、24fps 生成。
Wan3.0 是托管站点上的当前主推版本——主按钮写着「Try Wan3.0 Now」,特性区标题为「Introducing Wan3.0」。它带来原生 30 秒生成、最多 20 个参考素材并支持文档与网页解析、面向生产交付的像素级一致性,以及一组图像能力,包括 12 语言文字渲染与 9 图融合。而部署最广的开放权重仍是 2.1 与 2.2 两代,所以托管创作台与可下载模型并不处在同一版本上。
积分是托管档位上的计量单位。Pro 每月提供 300 分,Premium 提供 1,200 分。公司给出了换算口径而不是让你自己猜:300 积分约合最多 1,200 张图或 60 个视频,1,200 积分约合最多 4,800 张图或 240 个视频。积分也可以在会员档位之外单独购买,且所有档位都能通过每日签到额外获取。
站点上有 App Store 与 Google Play 链接,但附有一条公司自己写明的告诫:该应用并非所有地区都可获取,受影响的用户会被引导至移动网页版。以多组关键词检索美国区 App Store,没有返回任何由阿里发行的 Wan 应用——只有不相干的产品,以及两个借用该名称的第三方应用,各自只有一到两条评分,样本量远不足以说明任何问题。
可以,而且有官方支持。ComfyUI 的文档收录了 Wan2.2 的原生工作流示例,把它描述为该模型在 ComfyUI 中的官方使用指南,并确认了包含商业使用在内的 Apache 2.0 许可。对多数希望跑这些模型又不想自建基础设施的人来说,这是现实的入口。
不包含,定价页对此写得很明确。订阅仅用于 create.wan.video 上的模型创作;API、DealDance 及其他产品需要另行购买。如果你的计划涉及程序化生成,请为此单独做预算——另需说明,本次调研未能取得 API 的定价与调用规格。