Wan 2.6 R2V:完整規格、定價、API 接入與應用場景(2026)
什麼是 Wan 2.6 R2V?
Wan 2.6 R2V 是阿里雲推出的多模態參考到影片生成模型,隸屬於 Wan 2.6 系列,2025年12月已於官方文件中記錄。此模型支援文字、圖片與影片輸入,輸出同步的影音內容,生成時長為2至10秒,並於2026年7月起以秒計費。
「R2V」即 Reference-to-Video(參考到影片)。與僅依賴文字描述的文字到影片模型不同,Wan 2.6 R2V 能接受參考媒體,指引生成場景中主體的外觀、身分、動作、聲音特徵或角色。
阿里雲官方文件支援該模型用於單角色與多角色影片生成、多鏡頭敘事以及影音同步。輸出解析度為720p或1080p,採用H.264編碼的MP4格式,幀率為每秒30幀。
此模型適合創作者與開發團隊,特別是在評估角色一致性的廣告片段、短敘事序列、虛擬主持人、產品概念、社群影音資產等需要比僅靠文字提示更強參考控制的工作流程場景。
Wan 2.6 R2V 的主要規格與定價?
下表區分了阿里雲官方模型規格與 Gate.AI 平台資訊。所有資料截至2026年7月,除非另有說明。
| 規格 | 經查證的數值 |
|---|---|
| 提供方 | 阿里雲 / 通義萬象(截至2026年7月) |
| 模型系列 | Wan 2.6(截至2026年7月) |
| 模型類型 | 多模態參考到影片生成模型(截至2026年7月) |
| 模型狀態 | Wan 2.6 系列模型已於2025年12月記錄;官方文件未明確單獨上線日期(截至2026年7月) |
| 上下文視窗 | 不適用語言模型Token上下文;提示與媒體限制透過API參數定義(截至2026年7月) |
| 文字輸入計費 | 未記錄單獨的Token輸入費用(截至2026年7月) |
| 參考輸入計費 | 阿里雲計費可將參考影片時長納入計費秒數(截至2026年7月) |
| 快取輸入計費 | 不適用或未指定(截至2026年7月) |
| Gate.AI720p 計費 | 每秒 \$0.10,詳見Gate.AI模型卡(截至2026年7月) |
| Gate.AI1080p 計費 | 每秒 \$0.15,詳見Gate.AI模型卡(截至2026年7月) |
| 阿里雲全球720p計費 | 每計費秒 \$0.086012(截至2026年7月) |
| 阿里雲全球1080p計費 | 每計費秒 \$0.143353(截至2026年7月) |
| 計費單位 | 影片計費秒(截至2026年7月) |
| 輸入模態 | 文字、圖片、影片(截至2026年7月) |
| 輸出模態 | 同步影音(截至2026年7月) |
| 輸出解析度 | 720p 和 1080p(截至2026年7月) |
| 輸出時長 | 部署文件允許2至10秒的整數時長(截至2026年7月) |
| 幀率 | 30幀/秒(截至2026年7月) |
| 檔案格式 | MP4,H.264編碼(截至2026年7月) |
| 阿里雲模型ID | wan2.6-r2v(截至2026年7月) |
| Gate.AI模型ID | alibaba/wan2.6-r2v,詳見Gate.AI模型卡(截至2026年7月) |
| 提供方API接入 | 阿里雲 Model Studio 非同步影片生成API(截至2026年7月) |
| Gate.AI接入 | 列於Gate.AIModels目錄,詳見https://gate.ai/models(截至2026年7月) |
| 區域可用性 | 全球部署,德國與美國有文件記錄;帳戶與工作空間配置可能影響存取(截至2026年7月) |
| 知識截止 | 不適用於此影片生成模型(截至2026年7月) |
| 微調支援 | 官方文件未明確說明(截至2026年7月) |
| 串流生成 | 未記錄;官方流程採用非同步任務(截至2026年7月) |
| 批次API支援 | 未從官方管道確認(截至2026年7月) |
| 工具或函式呼叫 | 不適用(截至2026年7月) |
| 結構化輸出 | API任務中繼資料為結構化,語言模型JSON生成不適用(截至2026年7月) |
| 使用限制 | 受平台條款、內容規範、隱私要求及相關法律約束(截至2026年7月) |
阿里雲目前全球定價略低於 Gate.AI 模型卡的四捨五入價格。兩者屬於不同平台,無法直接互換。阿里雲官方全球價格為720p每秒 \$0.086012,1080p每秒 \$0.143353。
阿里雲參考到影片計費方式為按輸入與輸出時長計費。官方文件顯示參考影片時長可計入,計費輸入部分上限為5秒。若請求使用5秒參考影片並生成10秒輸出,則總計費為15秒。
Wan 2.6 R2V 在生產環境中的應用價值?
參考引導的主體一致性
Wan 2.6 R2V 可透過圖片與影片建立人物、動物、產品或虛擬角色的外觀。參考媒體比文字描述更具視覺指向性,有助於在新生成鏡頭中維持主體的辨識度。
適用於活動角色、系列社群內容、視覺概念開發、授權數位主持人等場景。此模型不保證每一幀完全一致,所有輸出仍需人工審核。
單角色與多角色生成
阿里雲文件支援單角色與多角色場景。可為不同實體分配多個參考資產並於提示中呼叫,實現短對話、互動、反應鏡頭或群組組合。
當專案需要多個可辨識主體時,此功能特別適用。角色、動作、空間關係愈複雜,準確性可能下降。
多鏡頭敘事生成
模型可於短片中生成多個構圖或敘事節點。提示可描述開場鏡頭、特寫、主體動作、轉場或鏡頭運動,而非僅生成單一靜態畫面。
多鏡頭支援適用於分鏡、預演、廣告、預告片、社群影音草稿。單次生成時長有限,通常需後製剪輯形成完整序列。
影音同步輸出
Wan 2.6 R2V 輸出影音同步內容,而非無聲影片。官方功能包括影音同步,支援對話場景、聲音表演、環境音效與短敘事片段。
同步品質受提示明確度、來源媒體品質、角色數量、語言及場景複雜度影響。製作團隊應於發布前檢查口型、時序、發音及聲音連貫性。
鏡頭與動作引導
提示可引導動作、場景結構、構圖及鏡頭運動,參考媒體則決定主體。這種組合有助於將創意簡報轉化為可測試的視覺序列。
模型屬於生成式製作工具,非確定性動畫系統。動作軌跡、產品幾何、手部位置、Logo 呈現、鏡頭路徑等可能與提示略有差異。
Wan 2.6 R2V 支援哪些模態?
| 模態 | 是否支援 | 說明 |
|---|---|---|
| 文字輸入 | 支援 | 描述場景、動作、角色、對話、風格、構圖及鏡頭行為 |
| 圖片輸入 | 支援 | 可定義參考主體的視覺身分或外觀 |
| 影片輸入 | 支援 | 提供外觀、行為、動作及影音參考資訊 |
| 獨立音訊輸入 | Wan 2.6 R2V 未記錄 | 音訊輸入已於新版 Wan 2.7 R2V 工作流程記錄,非 Wan 2.6 R2V 標準輸入 |
| 影片輸出 | 支援 | 720p 或 1080p,30幀/秒,MP4/H.264 |
| 音訊輸出 | 支援 | 同步影音輸出 |
| 無聲影片輸出 | 標準 Wan 2.6 R2V 不支援 | 無聲輸出僅於 wan2.6-r2v-flash 版本記錄,非標準模型 |
| 文字輸出 | 不支援 | 回應包含任務中繼資料,生成媒體為影音 |
阿里雲目前模型概覽顯示 Wan 2.6 R2V 輸入支援文字、圖片、影片,並與 wan2.6-r2v-flash 區分,後者可生成影音或無聲輸出。
參考到影片API支援多參考資產。具體檔案大小、時長、解析度及資產數量要求需依部署API文件查核,因模型版本與區域可能有差異。
Wan 2.6 R2V 的侷限性
生成片段較短: Wan 2.6 R2V 於現有部署下生成2至10秒片段,適用於單鏡頭、短場景、廣告、社群影音片段,並非完整長片製作。
長專案需多次生成、連貫規劃、剪輯、音效混音、調色及人工品管。
參考一致性非絕對: 參考媒體提升控制力,但無法保證每一幀人臉、服飾、物品、聲音、比例完全一致。細節可能發生漂移,尤於快速動作、遮擋、鏡頭切換或多角色互動時。
這是生成式影片的普遍侷限,非 Wan 2.6 R2V 獨有。
複雜提示降低指令遵循度: 多角色、對話、動作、產品置入、鏡頭運動、視覺特效等複雜提示可能產生衝突約束,模型可能省略、合併或重新解釋細節。
建議將複雜概念拆分為短、聚焦鏡頭以利製作。
計費不僅包含輸出時長: 阿里雲計費可包括參考影片時長及生成輸出。團隊應依計費時長計算費用,而非僅看最終片段長度。
平台計費、區域價格、重試、工作流程儲存及處理費用需另行查核。
延遲與並發波動: 影片生成運算密集,採用非同步任務流程。完成時間受解析度、時長、請求複雜度、服務負載、帳戶限額影響。
阿里雲對帳戶層級進行速率限制,涉及關聯用戶、工作空間、API金鑰。超限請求可能暫時被拒絕。
權利與安全審查必不可少: 參考媒體可能包含人臉、聲音、表演、隱私資訊、商標或著作權內容。上傳或再現前須取得相關權利與同意。
生成影片亦可能包含不準確、誤導、不當或視覺缺陷內容。不得用於冒充他人、偽造證據、法律、醫療、金融或安全關鍵決策,須經專業人工審核。
Wan 2.6 R2V 最適合哪些場景?
當專案需求與短時長、參考控制、影音輸出相符時,此模型適用於下列場景:
| 應用場景 | Wan 2.6 R2V 適用理由 | 重要限制 |
|---|---|---|
| 活動角色再現 | 參考資產有助於於新場景中維持主體辨識度 | 身分、服飾、配件仍可能發生漂移 |
| 短廣告概念 | 多鏡頭與鏡頭引導可將簡報轉化為視覺原型 | 產品形狀、文字、Logo需特別審查 |
| 社群影音片段 | 2至10秒片段適合片頭、轉場、反應、短敘事節點 | 完整內容通常需剪輯與加字幕 |
| 授權虛擬主持人 | 參考媒體可引導主持人外觀及影音行為 | 需管理同意、揭露及聲音權利 |
| 對話原型 | 多角色支援可測試參考主體間短互動 | 口型同步與輪替可能存在差異 |
| 分鏡腳本 | 快速生成有助於評估構圖、氛圍、動作、鏡頭順序 | 生成畫面非確定性分鏡腳本 |
| 角色主導娛樂 | 參考身分與多鏡頭輸出可支援短虛構場景 | 多次生成間連貫性需人工控制 |
| 創意預演 | 團隊可先測試鏡頭創意再投入製作 | 物理、時序、幾何未必符合製作標準 |
若專案不需參考身分、僅靠文字提示,可參考相關的 Wan 2.6 文字到影片模型,獲得更直接的工作流程。
Wan 2.6 R2V 與 Sora 2、海螺 2.3 的比較?
Wan 2.6 R2V、Sora 2 與海螺 2.3 在AI影片領域有重疊應用,但存取方式、參考控制、時長限制、影音特性、計費結構需按產品層面比較。
| 比較維度 | Wan 2.6 R2V | Sora 2 | 海螺 2.3 | 場景適配 |
|---|---|---|---|---|
| 主要工作流程 | 參考到影片生成 | 廣泛生成式影片創作 | 廣泛生成式影片創作 | Wan 2.6 R2V 適合以參考主體為核心的工作流程 |
| 參考輸入 | 文字、圖片、影片 | 需查閱目前產品控制方式 | 需查閱目前產品控制方式 | 驗證所需參考類型是否支援 |
| 角色處理 | 單角色與多角色生成 | 依賴目前產品特性 | 依賴目前產品特性 | Wan 適用於涉及多個參考實體的短場景 |
| 音訊輸出 | 同步影音輸出 | 需查閱目前產品與API層級 | 需查閱目前產品與API層級 | 對於對話、聲音、音樂或聲音主導片段尤為重要 |
| 輸出時長 | 2至10秒 | 依產品設定而異 | 依產品設定而異 | Wan 以短片段與鏡頭為結構基礎 |
| 解析度 | 720p 和 1080p | 需查閱目前產品選項 | 需查閱目前產品選項 | Wan 明確記錄解析度等級 |
| 計費結構 | 按計費秒;參考時長影響阿里雲費用 | 依產品與存取層級而定 | 依產品與存取層級而定 | 比較整體計費流程而非單一價格 |
| API工作流程 | 非同步提供方API;Gate.AI模型目錄 | 存取方式依目前產品而定 | 存取方式依目前產品而定 | 整合需求可能決定適用性 |
團隊於評估 Sora 2 或 海螺 2.3 時,應比較參考媒體支援、片段時長、音訊表現、區域存取、內容審查、並發能力及實際成本等最新文件。
沒有哪款模型適用於所有場景。若核心需求是圍繞一個或多個參考主體生成短影音片段,Wan 2.6 R2V 尤為適合。
如何透過 Gate.AI 存取 Wan 2.6 R2V?
Wan 2.6 R2V 可於 Gate.AI Models 目錄下存取,模型ID為:
alibaba/wan2.6-r2v
截至2026年7月,Gate.AI模型卡記錄如下:
- 720p輸出:每秒 \$0.10
- 1080p輸出:每秒 \$0.15
- 最大生成時長:最多10秒
- 輸出:同步影音
Gate.AI 提供非同步影片生成API:
https://api.gate.ai/api/v1/videos
請求需於 Authorization: Bearer 標頭中帶入 Gate.AI API Key。提交成功後會回傳任務ID與狀態URL,應用可輪詢狀態端點直到任務完成或失敗。完成回應包含臨時下載URL與最終計費資訊。
參考到影片生成時,請求可於 input_references 中包含一個公開HTTPS影片URL,媒體類型為 video,角色為 reference_video。
Python 範例
以下範例提交 Wan 2.6 R2V 任務、輪詢狀態並將生成影片儲存至本地。
import osimport timefrom pathlib import Pathfrom typing import Anyimport requestsAPI_BASE_URL = "https://api.gate.ai"MODEL_ID = "alibaba/wan2.6-r2v"API_KEY = os.environ["GATEAI_API_KEY"]REFERENCE_VIDEO_URL = "https://your-cdn.example.com/reference-video.mp4"OUTPUT_PATH = Path("wan-2-6-r2v-output.mp4")HEADERS = {"Authorization": f"Bearer {API_KEY}","Content-Type": "application/json",}def parse_data(response: requests.Response) -> dict[str, Any]:"""Raise for HTTP errors and return the Gate.AI data object."""response.raise_for_status()payload = response.json()if not isinstance(payload, dict):raise RuntimeError("Gate.AI returned an unexpected response.")data = payload.get("data")if not isinstance(data, dict):raise RuntimeError(f"Gate.AI response did not contain a data object: {payload}")return datadef submit_video() -> dict[str, Any]:payload = {"model": MODEL_ID,"prompt": ("Use the referenced subject in a cinematic city scene. ""Preserve the subject's appearance and natural movement. ""The camera slowly tracks from left to right."),"duration": 10,"resolution": "1080p","aspect_ratio": "16:9","generate_audio": True,"seed": -1,"input_references": [{"type": "video","url": REFERENCE_VIDEO_URL,"role": "reference_video",}],"metadata": {"source": "wan-2-6-r2v-example",},}response = requests.post(f"{API_BASE_URL}/api/v1/videos",headers=HEADERS,json=payload,timeout=60,)return parse_data(response)def wait_for_completion(status_url: str) -> dict[str, Any]:while True:response = requests.get(status_url,headers={"Authorization": f"Bearer {API_KEY}"},timeout=30,)data = parse_data(response)status = data.get("status")print(f"Status: {status}; "f"estimated cost: {data.get('estimated_cost', 'not available')}")if status == "completed":return dataif status == "failed":raise RuntimeError(f"Video generation failed: {data}")if status not in {"pending", "in_progress"}:raise RuntimeError(f"Unexpected task status: {status}")time.sleep(5)def download_video(download_url: str) -> None:response = requests.get(download_url,headers={"Authorization": f"Bearer {API_KEY}"},timeout=120,allow_redirects=True,)response.raise_for_status()OUTPUT_PATH.write_bytes(response.content)def main() -> None:submitted = submit_video()job_id = submitted.get("job_id")status_url = submitted.get("status_url")if not job_id or not status_url:raise RuntimeError(f"Submission response is missing job details: {submitted}")print(f"Submitted job: {job_id}")completed = wait_for_completion(status_url)download_url = completed.get("download_url")if not download_url:raise RuntimeError(f"Completed task did not include a download URL: {completed}")download_video(download_url)print(f"Video saved to: {OUTPUT_PATH.resolve()}")print(f"Final billed cost: {completed.get('billed_cost', 'not available')}")if __name__ == "__main__":main()
curl 範例
curl --request POST "https://api.gate.ai/api/v1/videos" \--header "Authorization: Bearer $GATEAI_API_KEY" \--header "Content-Type: application/json" \--header "Idempotency-Key: wan-r2v-$(date +%s)" \--data '{"model": "alibaba/wan2.6-r2v","prompt": "Use the referenced subject in a cinematic city scene. Preserve the subject appearance and natural movement while the camera slowly tracks from left to right.","duration": 10,"resolution": "1080p","aspect_ratio": "16:9","generate_audio": true,"seed": -1,"input_references": [{"type": "video","url": "https://your-cdn.example.com/reference-video.mp4","role": "reference_video"}],"metadata": {"source": "wan-2-6-r2v-example"}}'
生成流程為非同步。提交請求不會立即回傳影片檔案,應用需輪詢狀態URL或設定Webhook回呼。
生成影片URL可能會過期,生產應用應於任務完成後盡快將檔案儲存至可控、持久的儲存空間。
部署前請確認 alibaba/wan2.6-r2v 仍支援 /api/v1/videos 端點,並查核模型卡是否支援所選時長、解析度、比例、音訊選項及參考媒體角色。
常見問題
Wan 2.6 R2V 支援哪些解析度與時長?
Wan 2.6 R2V 支援720p與1080p影音,幀率為每秒30幀。阿里雲官方部署允許2至10秒的整數片段時長。
Wan 2.6 R2V 費用是多少?
Gate.AI模型卡記錄720p每秒 \$0.10,1080p每秒 \$0.15。阿里雲全球分別為每計費秒 \$0.086012 與 \$0.143353,資料截至2026年7月。
開發者能否透過API存取 Wan 2.6 R2V?
可以。Gate.AI將此模型列為 alibaba/wan2.6-r2v。阿里雲 Model Studio 另有非同步API,模型ID為 wan2.6-r2v。開發者應依所選平台查閱最新文件。
Wan 2.6 R2V 適合哪些應用?
Wan 2.6 R2V 適用於短時角色一致廣告、授權虛擬主持片段、對話原型、多角色場景、社群影音片段、分鏡腳本及創意預演。所有輸出需審查視覺缺陷、事實準確性、同意權利及品牌合規。


