Wan(通義萬相)是阿里巴巴的影片生成模型家族,它以兩種容易被混淆的形態存在。一種是發布在 GitHub 與 Hugging Face 上、採用 Apache 2.0 許可的開放模型權重,任何人都可以下載並在自己的硬體上執行。另一種是位於 wan.video 的託管創作台,你付訂閱費、在瀏覽器裡生成,不需要擁有顯示卡。這個品類裡的多數工具只居其一,而 Wan 兩者兼有;至於你該關心哪一種,完全取決於你手裡有沒有一塊顯示記憶體夠用的顯示卡。
歸屬問題值得先講清楚,因為以知名開源模型命名的域名經常被第三方搶注。這一個不是。wan.video 的頁尾寫著「Wan © 2026 Powered by Alibaba Cloud」,並列出 wan_ai@service.alibaba.com 作為聯絡地址。更具決定性的證據在基礎設施層面:站點的前端資源全部由阿里自有的內容分發網路在通義實驗室名稱空間下提供——樣式表與應用打包檔案都從 g.alicdn.com/tongyi-lab-fe/wan/ 載入;其站點分析標識被設為 tongyiwanxiang,正是 Wan 的中文品牌名;其埋點指令碼是阿里內部的 npm 包。任何第三方都無法把程式碼部署進另一家公司自有 CDN 的名稱空間。這就是一方站點。
在開源一側,官方 GitHub 組織是 Wan-Video,官方 Hugging Face 賬號是 Wan-AI。Wan2.2 倉庫把自己描述為開放且先進的大規模影片生成模型,擁有 17,280 個 star 與 2,191 個 fork;更早的 Wan2.1 倉庫擁有 16,888 個 star 與 3,450 個 fork。兩者許可均為 Apache-2.0,該組織下的衍生倉庫亦然,其中包括面向角色動畫的 Wan-Animate-2,面向舞蹈動作的 Wan-Dancer,以及被描述為讓 AI 智慧體呼叫 Wan 生成能力的技能包 Wan-skills。
託管產品的迭代速度快於多數第三方收錄的更新速度。站點當前主推的是 Wan3.0——首要行動按鈕寫著「Try Wan3.0 Now」,特性區標題為「Introducing Wan3.0」——而部署最廣的開放權重仍是 2.1 與 2.2 兩代。如果你讀到過把 Wan 簡單描述為文生圖與文生影片平臺的說法,那份描述早於當前版本。
開放權重與託管創作台並非同一產品的不同包裝。它們在許可、能力,以及你能拿產出物做什麼這三件事上都不同。
權重給你的是 Apache 2.0 條款,允許商業使用、修改與再分發,前提是保留版權宣告與許可文字。Hugging Face 模型卡更進一步,用一句話直接放棄了產出物權利:官方宣告不主張對使用者生成內容的任何權利,使用者可自由使用,只需確保用途符合該許可的規定(英文原文為 We claim no rights over the your generated contents,其中的 the your 是發布時即存在的筆誤)。這在產出物歸屬上是一個異常乾淨的立場,原文中的筆誤此處按發布原樣保留。
託管創作台適用它自己的訂閱條款,而這些條款在本次調研中未能取得——下文會完整說明這一侷限。不要想當然地認為 Apache 2.0 的產出物立場會自動延伸到 create.wan.video 上生成的內容。
官網為 Wan3.0 列出五項影片側能力,每一項都給出了具體主張而非空泛描述。Omni-Creation 接受最多 20 個參考素材,並能解析文件與網頁作為輸入。Native 30s Duration 原生生成 30 秒時長,而非把較短片段拼接起來,公司把它詮釋為支撐更完整的敘事。Pixel-Perfect Consistency 的定位落在「為生產工作流提升交付確定性」上——值得注意的是這是生產口徑而非創作口徑。Immersive Experience 這一項涵蓋的是真實感、質感與聲音設計三個方面。Precision Video Editing 則對應可控的編輯。
另有五項能力面向影象。Portrait Customization 可細到骨骼結構與眼部細節。Advanced Text Rendering 支援 12 種語言的長文字,並能生成圖表、公式與資訊圖——文字渲染長期是影象模型的短板,這是一個針對性很強的主張。Precise Color Control 掌控色彩分佈。Multi-Image Editing 可把最多 9 張影象融合為單一產出。Sequential Storytelling 可生成最多 12 張風格與主體一致的連續影象。Interactive Editing 允許框選區域,在畫素級對齊創作意圖。
create.wan.video 的創作控制檯帶有八個導航模組,依次是探索(Explore)、生成(Generate)、畫布(Canvas)、技能(Skills)、實驗場(Playground)、時間線(TimeLine)、素材(Assets)與收藏(Favorites)。其中 Canvas 與 TimeLine 的存在尤其說明這是一個編排與時序環境,而不是一次「生成並下載」的單次互動。控制檯頂部另有獨立的 CLI 與 API 入口。
Wan2.2 提供五個變體,而引數量在這裡很重要,因為它決定了你需要什麼硬體。T2V-A14B 是文生影片模型,採用混合專家架構,總引數 270 億、每步推理啟用約 140 億。I2V-A14B 是同架構的圖生影片模型。TI2V-5B 是 50 億引數的稠密模型,在單一檢查點中統一了文生與圖生影片兩種任務。S2V-14B 處理語音驅動影片。Animate-14B 處理角色動畫與替換。這些模型以 480P 與 720P、24fps 生成。
混合專家設計是架構上的看點:不是由一個模型承擔整個去噪過程,而是設有兩個專用專家,一個負責高噪聲的早期階段,一個負責低噪聲的精修階段。ComfyUI 的官方文件為該模型維護著原生工作流,它把由此帶來的優勢歸納為三點——電影級美學控制,可在光照、色彩與構圖上進行多維掌控;大幅度複雜運動,流暢度與可控性均有提升;以及在複雜多主體場景中的精準語義遵循。該文件還指出 5B 版本使用高壓縮比 VAE 以最佳化顯示記憶體佔用。
倉庫對執行這些模型所需的條件毫不含糊。對 A14B 系列模型,文件寫明其執行命令需要一塊至少具備 80GB 顯示記憶體的 GPU。對 TI2V-5B,官方說明它可以在 4090 這類消費級顯示卡上執行,所需顯示記憶體至少為 24GB,文件中點名的示例機型正是 RTX 4090。
這是一道很寬的鴻溝,而它已經明顯地塑造了真實世界的採用格局。Hugging Face 自有介面顯示,30 天下載量居首的是 1.3B 版的文生影片模型,達到 204,432 次;緊隨其後的是 5B 版的文圖生影片統一模型,為 198,975 次。旗艦級的 A14B 模型反而落後:圖生影片 134,807 次,文生影片 132,815 次。換句話說,最小和次小的模型,下載量大約是最大那兩個的一點五到三倍。這項技術真正的約束條件不是模型質量,而是使用者機器裡的那塊顯示卡。
官網把 API 當作獨立的第三條產品線對待,在頂部導航中與 Features、Open Source 平起平坐,頁尾也另設分組,其中一個入口通向平臺概覽,另一個通向介面接入說明。定價頁記錄了一條重要的商業細節:創作台訂閱僅覆蓋 create.wan.video 上的模型創作,API 與其他產品需要另行購買。API 的具體定價與呼叫規格在本次調研中未能取得。
自託管影片生成。 開放權重最清晰的用途。如果你有一塊 24GB 的卡,TI2V-5B 就在射程之內;如果你有資料中心級硬體,A14B 系列也可以。Apache 2.0 許可意味著產出物與部署都歸你,前提是遵守其載明的內容限制。
在模型之上做二次開發。 由於權重可下載、許可允許修改與再分發,這些模型可以被微調、量化、包裝成產品,或整合進專有系統。僅 Wan2.1 一個倉庫就有 3,450 個 fork,說明這件事正在大規模發生。
ComfyUI 與節點式工作流。 ComfyUI 為 Wan2.2 維護著官方原生工作流,這讓習慣用節點圖而非命令列的大量創作者也能用上這些模型。
沒有硬體時的評估。 託管創作台的免費檔正是為此而存在。你可以在決定是否投資顯示卡或訂閱之前先判斷輸出質量。
中等產量的生產級影片工作。 付費檔解鎖 1080p 輸出、10 到 30 秒區間的影片,以及無水印下載——這三樣正是把演示與可交付成果區分開來的東西。
多語種圖文混排。 覆蓋 12 種語言的長文字渲染,包括圖表與資訊圖,瞄準的是多數影象模型處理得都不好的一類需求。
智慧體驅動的生成。 Wan-skills 倉庫把生成能力封裝為智慧體技能包,創作台又暴露了 CLI,兩者結合適合程式化與自動化的流水線。
即便硬體跑得動更大的模型,也先從 5B 版開始。 下載資料表明社群收斂到它自有其道理:它在單一檢查點裡統一了文生與圖生影片,且能在一塊消費級顯示卡上執行。先在這裡把工作流跑通,再考慮向上擴充套件。
有意識地在中文與英文之間選擇提示詞語言。 這些模型在構建時就支援中英雙語提示。如果你的題材在某一種語言中的表徵更充分,那值得實測而不是想當然。
用圖生影片來換取可控性。 從一張你已經掌控的影象出發,相比文生影片消除了一整個維度的不確定性——這也正是 I2V-A14B 在該賬號所有模型中點贊數最高的原因。
不要指望用免費檔產出可發布的內容。 無水印下載從付費檔才開始提供。為評估質量而生成的產出,並不是你能拿去交付的產出。
對第一個計費週期要格外審慎。 定價頁寫明訂閱自動續費、可隨時取消,但首月或首年一經啟用便不予退款。除非你已經很有把握,第一次嘗試請選月付。
不要假設創作台繼承了開源許可。 Apache 2.0 條款與「不主張產出物權利」的宣告來自模型倉庫。託管服務有自己的條款,而本文未能取得。
若要再分發,請保留許可文字。 Apache 2.0 允許商業使用、修改與再分發,但以保留原始版權宣告與許可文字為條件。把模型打包進產品時,這一點很容易被忽略。
大規模部署前先讀內容限制。 模型卡禁止違反適用法律、對個人或群體造成傷害、傳播意圖傷害他人的個人資訊、散佈錯誤資訊或針對弱勢群體的內容,並宣告使用者對遵守這些限制負全部責任。
擁有 GPU 資源的開發者與團隊 在這裡能拿到最具差異性的價值。寬鬆許可下的開放權重,外加對產出物權利的明確棄權宣告,這個組合在影片模型中並不多見。
研究者與做微調的人 會被變體的鋪開程度很好地服務——五個任務專用模型,加上獨立的動畫與舞蹈倉庫,提供了充足的起點。
ComfyUI 使用者 擁有一條獲得官方支援的路徑,而這在被移植進該生態的模型中並非常態。
沒有硬體的創作者 可以使用託管創作台,但應當在價格與產出上與專門的託管競品做對比評估,而不要想當然地認為開源出身會自動轉化為更好的託管產品。
智慧體與自動化的構建者 有 CLI、API 線路與 Wan-skills 倉庫可用。
不建議選用的情況: 期待在消費級硬體上自託管旗艦模型的人,因為 80GB 是資料中心級要求;需要在投入前先審閱託管服務條款的人,因為那些文件不可達;所在地區拿不到移動應用、又必須要原生應用而非移動網頁的人;以及希望用單一供應商關係覆蓋創作台、API 及其他一切的人,因為這些是分開購買的。
自託管。 任何滿足顯示記憶體門檻的機器均可,模型經由程式碼託管平臺 GitHub 與模型託管平臺 Hugging Face 獲取。這是使用 Wan 能力最完整、約束最少的方式。
網頁創作台。 create.wan.video,帶有上文所述的八模組控制檯。對本地硬體沒有要求。
移動端。 官網提供 App Store 與 Google Play 連結,但附帶了一條公司自己寫明的告誡:「App not available in your region? Try our mobile web version.」這個區域限制是真實存在的——以三組關鍵詞檢索美國區 App Store,未返回任何由阿里發行的 Wan 應用。返回的是不相干的產品,以及兩個借用該名稱的第三方應用,各自只有一到兩條評分,樣本量遠不足以說明任何問題,也不應被誤認作官方產品。
API。 作為獨立產品線提供,需要單獨購買。
ComfyUI。 有官方文件支援的原生工作流。
這裡被定價的其實是兩樣東西,不應混為一談。
開放權重是免費的。 Apache 2.0 許可、可下載、可商用。你的成本是硬體與電費。
託管創作台設三檔會員。 價格按每月列示,年付標註 50% off:
| 檔位 | 年付(摺合每月) | 月付 | 每月積分 | 併發影片 | 併發影象 |
|---|---|---|---|---|---|
| Free | $0 | $0 | — | 1 | 1 |
| Pro | $5 | $10 | 300 | 3 | 3 |
| Premium | $20 | $40 | 1,200 | 8 | 5 |
公司提供了換算口徑,讓積分變得可推算:Pro 的 300 積分約合最多 1,200 張圖或 60 個影片,Premium 的 1,200 積分約合最多 4,800 張圖或 240 個影片。定價頁另設 Credits 與 Gift Cards 兩個頁籤,在會員體系之外單獨售賣。
免費檔不包含什麼,與付費檔包含什麼同樣重要。免費檔只有 6 種影象風格而非全部,不能下載無水印影象或影片,不能生成 1080p 影片,也不能生成 10 到 30 秒的較長影片。付費檔補上以上全部,另加影象放大。所有檔位都可透過每日簽到賺取積分。
兩條付款條款值得注意。 訂閱自動續費、可隨時取消,但首月或首年一經啟用便不予退款。另外,該訂閱僅覆蓋 create.wan.video 上的模型創作——API、DealDance 及其他產品需要另行購買。
純託管型影片生成器 是與創作台的天然對照。如果你完全不打算在本地跑權重,就應當純粹按產出質量、價格與權利條款去評估 Wan 的創作台;它的開源出身在這個比較裡並不帶來任何優勢。
其他開放權重影片模型 才是你真要自託管時的相關對照。該問的問題是許可條款、各質量檔位的顯示記憶體要求,以及生態支援度。Wan 在第一項上表現很好——Apache 2.0 加上明確的產出物權利棄權,處在寬鬆的一端——而它的 ComfyUI 支援是官方維護的。
跑較小的 Wan 變體 本身就是跑旗艦版的替代方案。鑑於 TI2V-5B 的下載量接近 1.3B 版、且明顯高於 A14B 那一對,社群實際給出的判斷是:5B 這一檔在質量與硬體之間的取捨才是合理的預設值。
阿里的其他影片模型 不應與 Wan 混淆。該公司有不止一條影片生成產品線,出自不同團隊;關於「阿里某影片模型」的報道並不自動等同於關於 Wan 的報道。二手信源在這一點上經常出錯。
託管服務的條款未能取得。 這是本文最重要的一處資訊缺口,此處如實說明而非含糊帶過。頁尾上指向使用政策、服務條款、隱私政策與訓練資料說明的四個連結,全部是不帶 href 屬性的 JavaScript 事件處理器。直接請求對應路徑只返回 258 字元的單頁應用殼。用無頭瀏覽器渲染 create.wan.video/terms 會被重定向到錯誤頁。因此本文對託管服務的條款、隱私處理與訓練資料披露不作任何斷言。任何有商業依賴的人,都應在投入之前直接向公司索取這些文件。
產出物權利在權重側清晰,在創作台側不明。 模型卡對生成內容權利的棄權宣告是具體且可核驗的,它適用於開放模型。create.wan.video 是否採用同樣立場,本次調研無法確認。
旗艦模型需要資料中心級硬體。 80GB 顯示記憶體把 A14B 擋在個人使用者射程之外。24GB 的 5B 模型才是現實的消費級天花板,而下載量分佈顯示社群已相應地作出了調整。
免費檔無法產出可發布的內容。 沒有無水印下載、沒有 1080p、沒有更長時長,影象風格只有 6 種。
第一個計費週期不予退款。 自動續費、可隨時取消,但首月或首年啟用後不退款。
購買不能在不同觸點之間通用。 創作台訂閱不覆蓋 API 或其他產品。請據此做預算。
移動端可得性受區域限制。 公司在自己站點上就是這麼說的,而美國區 App Store 中沒有官方應用這一事實也佐證了這一點。
內容限制適用,且責任在你。 模型卡禁止若干類內容,並宣告使用者對遵守規定負全部責任。
站點後設資料落後於產品。 當前版本是 Wan3.0,而流通中的許多描述性材料——包括本條目所繼承的後設資料——描述的是一個更早、更窄的產品。請以站點本身為準來判斷當前能力,不要依賴第三方描述。
分類歸屬需要更正。 本條目此前把影片編輯列為主分類。而產品自身的表述是生成優先:四項首屏能力中三項是生成,五個開源模型變體全部是生成或驅動類模型,公司自己的標題也稱其為影片生成模型。編輯能力真實存在,但屬次要。
當心二手報道中的張冠李戴。 本次調研中,一份檢索摘要把一則知名影片模型排名歸到了 Wan 名下,而底層文章講的是另一支團隊的另一款阿里模型。凡是關於「阿里影片模型」的效能與排名說法,都應回到原文核對其真實主體。
既是也不是,取決於你指的是哪個產品。模型權重是真正免費的,採用 Apache 2.0 許可——下載、執行、商用皆可,前提是保留許可文字並遵守載明的內容限制,你唯一的成本是硬體。wan.video 的託管創作台設有免費檔,但受限頗多:1 個併發影片與 1 個併發影象、6 種影象風格、不能下載無水印素材、沒有 1080p、沒有更長影片。付費檔從年付摺合每月 5 美元起。
是阿里巴巴,出自其通義實驗室;wan.video 是官方站點。頁尾寫著「Wan © 2026 Powered by Alibaba Cloud」,聯絡方式為 wan_ai@service.alibaba.com。更有力的證據在基礎設施層面:站點的樣式表與應用打包檔案由阿里自有 CDN 在 tongyi-lab-fe 名稱空間下提供,其站點分析產品標識為 tongyiwanxiang,並載入了阿里內部的 npm 包用於埋點。第三方無法部署進另一家公司的 CDN 名稱空間。官方 GitHub 組織是 Wan-Video,官方 Hugging Face 賬號是 Wan-AI。
對開放模型而言,這個立場異常清晰。Apache 2.0 允許商業使用,模型卡並宣告團隊不主張對你生成內容的任何權利,只要用途符合許可規定即可自由使用。對託管創作台而言,本次無法確定——其服務條款在調研中不可取得。如果你的商業計劃依賴創作台的產出而非自託管的產出,請先取得書面確認。
完全取決於變體。TI2V-5B 需要至少 24GB 顯示記憶體,文件點名 RTX 4090 是可行的消費級顯示卡。A14B 系列——T2V-A14B、I2V-A14B——需要至少 80GB,也就是資料中心級硬體。這道鴻溝是關於自託管 Wan 最重要的一個現實事實,下載統計也印證了它:1.3B 與 5B 的下載量遠高於 14B 那一檔。
Wan2.2 提供五個。T2V-A14B 從文字生成影片,採用混合專家設計,總引數 270 億、每步約啟用 140 億。I2V-A14B 從影象生成影片,架構相同。TI2V-5B 是更小的稠密模型,在一個檢查點裡完成上述兩項任務,也正是能在消費級硬體上執行的那一個。S2V-14B 從語音生成影片。Animate-14B 處理角色動畫與替換。全部以 480P 與 720P、24fps 生成。
Wan3.0 是託管站點上的當前主推版本——主按鈕寫著「Try Wan3.0 Now」,特性區標題為「Introducing Wan3.0」。它帶來原生 30 秒生成、最多 20 個參考素材並支援文件與網頁解析、面向生產交付的畫素級一致性,以及一組影象能力,包括 12 語言文字渲染與 9 圖融合。而部署最廣的開放權重仍是 2.1 與 2.2 兩代,所以託管創作台與可下載模型並不處在同一版本上。
積分是託管檔位上的計量單位。Pro 每月提供 300 分,Premium 提供 1,200 分。公司給出了換算口徑而不是讓你自己猜:300 積分約合最多 1,200 張圖或 60 個影片,1,200 積分約合最多 4,800 張圖或 240 個影片。積分也可以在會員檔位之外單獨購買,且所有檔位都能透過每日簽到額外獲取。
站點上有 App Store 與 Google Play 連結,但附有一條公司自己寫明的告誡:該應用並非所有地區都可獲取,受影響的使用者會被引導至移動網頁版。以多組關鍵詞檢索美國區 App Store,沒有返回任何由阿里發行的 Wan 應用——只有不相干的產品,以及兩個借用該名稱的第三方應用,各自只有一到兩條評分,樣本量遠不足以說明任何問題。
可以,而且有官方支援。ComfyUI 的文件收錄了 Wan2.2 的原生工作流示例,把它描述為該模型在 ComfyUI 中的官方使用指南,並確認了包含商業使用在內的 Apache 2.0 許可。對多數希望跑這些模型又不想自建基礎設施的人來說,這是現實的入口。
不包含,定價頁對此寫得很明確。訂閱僅用於 create.wan.video 上的模型創作;API、DealDance 及其他產品需要另行購買。如果你的計劃涉及程式化生成,請為此單獨做預算——另需說明,本次調研未能取得 API 的定價與呼叫規格。