Gate.AI博客Wan 2.5 T2V 预览:完整规格、定价、API 接入与应用场景(2026)

    Wan 2.5 T2V 预览:完整规格、定价、API 接入与应用场景(2026)

    模型

    Wan 2.5 T2V Preview 是什么?

    Wan 2.5 T2V Preview 是阿里巴巴推出的文本生成视频(Text-to-Video)模型,于 2025年11月11日 作为 Wan2.5 Preview 商业化发布,支持短视频生成并同步音频,输出分辨率可选 480P/720P/1080P,并自 2026年7月起按分辨率和生成时长计费。

    阿里云将 wan2.5-t2v-preview 列为 Wan 视频生成系列模型之一。官方文档将其描述为“带音频的视频”文本生成视频模型,具备音视频同步、文本和音频输入、5 秒和 10 秒输出时长、30 帧/秒视频、MP4 格式(H.264 编码)等特性。

    该模型专为短时长、基于提示词的视频生成设计,不适合长视频制作。用户通常将其用于创意概念片段、社交媒体草案、营销分镜、教育可视化等场景,即通过文本提示生成带有匹配音频的短视频资产。团队在对比AI 视频生成模型参数时,应重点关注时长、输出质量、音频支持、计费单位、提示词控制能力及 API 可用性等要素,选择合适的生产模型。

    Wan 2.5 T2V Preview 的核心参数与定价

    字段 经确认的参数值
    提供方 阿里巴巴 / 阿里云模型工作室,截至 2026年7月
    模型系列 Wan / Wan2.5 Preview 视频生成系列,截至 2026年7月
    模型类型 支持音频输出的文本生成视频模型,截至 2026年7月
    发布日期 商业化 Wan2.5 Preview 发布活动:2025年11月11日;截至 2026年7月,官方未单独确认首个预览开放日期
    上下文窗口 作为视频生成模型不适用;输入限制为提示词长度,截至 2026年7月
    提示词长度 Wan2.6 与 Wan2.5 系列文本生成视频提示词最长 1,500 字符,截至 2026年7月
    输入计价 非按 token 计价;阿里云说明 Wanx 文本生成视频仅按输出计费,截至 2026年7月
    缓存输入计价 不适用 / 截至 2026年7月官方未确认
    输出计价 国际部署:480P \$0.05/秒,720P \$0.10/秒,1080P \$0.15/秒,截至 2026年7月
    中国大陆定价 480P \$0.043006/秒,720P \$0.086012/秒,1080P \$0.143353/秒,截至 2026年7月
    计费单位 按生成视频输出的每秒计价,基于输出分辨率,截至 2026年7月
    支持的输入类型 文本提示词及可选音频 URL,截至 2026年7月
    支持的输出类型 MP4 视频(带音频),H.264 编码,30 帧/秒,截至 2026年7月
    分辨率选项 480P、720P、1080P,截至 2026年7月
    时长选项 5 秒或 10 秒,截至 2026年7月
    提供方 API 访问 阿里云模型工作室异步 API,截至 2026年7月
    阿里模型 ID wan2.5-t2v-preview,截至 2026年7月
    Gate.AI模型 ID alibaba/wan2.5-t2v-preview,见本页面Gate.AI列表,截至 2026年7月
    Gate.AI列表定价 480P \$0.05/秒,720P \$0.10/秒,1080P \$0.15/秒,见本页面Gate.AI列表,截至 2026年7月
    可用性 阿里云文档覆盖国际与中国大陆部署场景,截至 2026年7月
    速率限制 截至 2026年7月官方未确认
    微调支持 wan2.5-t2v-preview 目前官方未确认支持模型微调,截至 2026年7月
    流式输出支持 截至 2026年7月官方未确认
    批量 API 支持 截至 2026年7月官方未确认
    工具 / Function Calling 按官方文档,该视频生成模型不适用,截至 2026年7月
    结构化输出 / JSON 模式 生成视频输出不适用;截至 2026年7月未被确认为模型特性
    授权 / 使用限制 截至 2026年7月,模型专属限制未在公开文档中完整总结;生产环境部署前,用户需查阅阿里云及Gate.AI政策条款

    阿里云说明 size(分辨率)与时长参数直接影响费用,计费方式为分辨率单价×时长(秒)。Gate.AI 定价页也说明,图像、音频、视频等多模态能力可按生成次数、时长、分辨率或任务规格计费,这与 Gate.AI 列表中的每秒计价模式一致。

    Wan 2.5 T2V Preview 在生产中的应用价值

    Wan 2.5 T2V Preview 能够根据文本提示生成短视频,适用于需要在投入拍摄、动画、剪辑或更长创意流程前,先获得动态视觉草案的团队。由于阿里云文档明确支持 5 秒和 10 秒时长,该模型更适合用作短片生成器,而非完整场景或长视频系统。

    该模型支持带音频的视频输出。阿里云模型表中列明“带音频视频”及“音视频同步”,适用于社交短片、情绪视频、带声概念与短营销草案等需要声音与画面同步的场景。

    Wan 2.5 T2V Preview 还支持通过 input.audio_url 输入自定义音频(Wan2.5 系列)。阿里云文档支持公开 HTTP/HTTPS 音频 URL,WAV/MP3 格式,3–30 秒时长,单文件不超过 15 MB。若音频长于视频,仅截取匹配时长;若音频短于视频,剩余部分为静音。

    分辨率灵活性也是生产优势。模型支持 480P、720P、1080P 三档,团队可用 480P 低成本生成草案,720P/1080P 则用于高质量预览。阿里 API 参考还列出常见横版、竖版、方形等分辨率比例。

    该模型适合提示词驱动的创意流程,但不应取代人工审核。生成视频仍需剪辑、品牌审核、政策合规、质量把控、版权核查及后期润色后方可对外发布。

    Wan 2.5 T2V Preview 支持哪些模态?

    模态 是否支持 说明
    文本输入 支持 主要输入,Wan2.5 系列提示词最长 1,500 字符
    音频输入 支持 支持可选 audio_url,Wan2.5 系列接受公开 HTTP/HTTPS、WAV/MP3 格式、3–30 秒、最大 15 MB
    图像输入 本 T2V 模型不支持 图像输入适用于 Wan 图像生成视频变体,wan2.5-t2v-preview 不支持
    视频输入 本 T2V 模型不支持 其他 Wan 任务支持视频输入,文本生成视频模型不支持
    视频输出 支持 MP4 视频,H.264 编码,30 帧/秒,5 秒或 10 秒
    音频输出 支持 官方文档为“带音频视频”,音视频同步

    Wan 2.5 T2V Preview 的局限性

    Wan 2.5 T2V Preview 仅支持短片。阿里云 API 参考规定 wan2.5-t2v-preview 时长仅为 5 秒和 10 秒,需长场景、多分钟广告或完整叙事片段的流程需后期剪辑拼接或选用其他视频模型。

    模型提示词长度有限。Wan2.6 与 Wan2.5 系列文本生成视频提示词最长 1,500 字符,超长文本会自动截断,复杂视觉指令需精炼表达。

    迭代时成本易快速上升。阿里云按输出分辨率和时长计价,1080P 多次生成费用远高于 480P 草稿。团队使用多模态生成 API时,应关注分辨率选择、重试次数、废弃生成和审核周期,而非仅关注最终成品成本。

    Gate.AI 访问细节需谨慎处理。本页面 Gate.AI 列表标注模型 ID 及定价,Gate.AI 公共文档确认支持 OpenAI 兼容接入,但本次查阅未见该模型专属视频生成 endpoint 路径、请求及返回 schema 的公开细节。

    此外,除非阿里巴巴特别声明,以下为通用 AI 局限:生成视频可能存在伪影、运动失真、视觉细节不准确、不安全内容、误导性画面或文本渲染不佳等问题。涉及广告、政治、法律、医疗、金融、身份敏感、版权或品牌合规使用时,必须进行人工审核。

    Wan 2.5 T2V Preview 适合哪些场景?

    应用场景 适用原因 重要限制
    创意短片概念 将文本提示转为 5 秒或 10 秒带音频视频 不适合长视频生成
    社交媒体草案视频 支持 480P/720P/1080P,便于成本与质量控制 终稿格式与平台合规仍需复核
    音频驱动视觉概念 支持音频同步输出及自定义音频 URL 仍可能需专业音频混音
    广告分镜探索 帮助团队在拍摄前测试场景、运动、氛围与声音 品牌、肖像、版权及政策审核仍为必要环节
    教育与培训可视化 可通过简洁提示生成短时长说明片段 事实准确性与视觉清晰度需人工核验
    产品与活动创意头脑风暴 快速探索氛围、运动、场景构图 生成结果未经质检不可直接用于生产

    Wan 2.5 T2V Preview 最适合目标为带音频的短 AI 视频片段。若需长叙事、多镜头连续、图像条件生成或视频参考流程,团队应考虑其他AI 内容生成模型,并核查其时长、模态与计费要求。

    Wan 2.5 T2V Preview 与 Seedance 2.0、Veo 3.1 对比

    对比维度 Wan 2.5 T2V Preview Seedance 2.0 Veo 3.1 适用场景说明
    提供方 阿里巴巴 字节跳动 Seed 团队 谷歌 根据生态、API 接入、合规、输出需求与定价选择
    模型类型 带音频的文本生成视频 音视频生成与编辑模型 原生音频视频生成模型 Wan 2.5 适合短文本生成视频,Seedance/Veo 适合更广泛视频场景
    输入 文本及可选音频 URL 官方资料称支持文本、图像、音频、视频 谷歌文档支持原生音频及图像驱动视频生成 根据模态需求筛选
    输出时长 5 秒或 10 秒 字节描述支持最长 15 秒多镜头高质量音视频 具体时长依赖谷歌 API 配置,需实施时核查 Wan 2.5 定位为短片生成模型
    分辨率 480P、720P、1080P 部署前需查阅官方文档当前分辨率选项 部署前需查阅谷歌文档当前分辨率选项 分辨率影响成本与审核质量
    定价透明度 阿里巴巴文档分辨率每秒计价;Gate.AI列表同步本页面 480P/720P/1080P 每秒定价 官方资料未详述 需查阅谷歌当前计费文档 Wan 2.5 在阿里官方文档中有明确公开每秒定价
    主要限制 时长短、提示词长度有限 官方资料说明模型仍有局限 谷歌 API 限制与模型可用性需实施前核查 无绝对优劣,模型选择取决于具体任务约束

    Wan 2.5 T2V Preview 适合需要音视频同步、定价透明、分辨率灵活的短文本生成视频场景。Seedance 2.0 与 Veo 3.1 更适合多模态参考、长片段或其他生态需求,但生产选型应以官方最新文档为准,而非仅凭参数对比。

    如何通过 Gate.AI 访问 Wan 2.5 T2V Preview?

    根据本页面 Gate.AI 列表,Wan 2.5 T2V Preview 可通过模型 ID alibaba/wan2.5-t2v-preview 调用。该模型支持从文本提示生成 5–10 秒带原生音频同步轨道的视频,输出分辨率为 480P/720P/1080P,定价分别为 480P \$0.05/秒、720P \$0.10/秒、1080P \$0.15/秒(截至 2026年7月)。

    Gate.AI 公共文档说明其 OpenAI 兼容基础地址为 https://api.gate.ai/openai/v1,模型 ID 通常采用 provider/model 格式。Gate.AI 定价页也说明,视频及多模态能力可按生成次数、时长、分辨率或任务规格计费。

    以下示例采用 Gate.AI OpenAI 兼容接入、列表中模型 ID 及支持的分辨率和时长选项。生产环境前,开发者应在 Gate.AI 控制台或模型文档确认最终参数名称及返回结构。

    Python 示例

    1. from openai import OpenAI
    2. import os
    3. client = OpenAI(
    4. api_key=os.environ["GATE_AI_API_KEY"],
    5. base_url="https://api.gate.ai/openai/v1"
    6. )
    7. response = client.chat.completions.create(
    8. model="alibaba/wan2.5-t2v-preview",
    9. messages=[
    10. {
    11. "role": "user",
    12. "content": (
    13. "Generate a 10-second 720P cinematic video of a golden retriever "
    14. "running across a sunny beach at sunset, with gentle <a href=\"/price/waves-waves\" target=\"_blank\" class=\"blog_inner_link\">waves</a> and "
    15. "a native synchronized audio track."
    16. )
    17. }
    18. ],
    19. extra_body={
    20. "resolution": "720p",
    21. "duration": 10
    22. }
    23. )
    24. print(response)

    本 Python 示例配置 Gate.AI 客户端,使用 OpenAI 兼容基础地址及模型 ID alibaba/wan2.5-t2v-previewresolutionduration 字段对应 Gate.AI 列表支持的输出选项。生产部署前,请确认 Gate.AI 是否采用该字段命名或有专属视频生成参数格式。

    curl 示例

    1. curl https://api.gate.ai/openai/v1/chat/completions \
    2. -H "Authorization: Bearer $GATE_AI_API_KEY" \
    3. -H "Content-Type: application/json" \
    4. -d '{
    5. "model": "alibaba/wan2.5-t2v-preview",
    6. "messages": [
    7. {
    8. "role": "user",
    9. "content": "Generate a 10-second 720P cinematic video of a golden retriever running across a sunny beach at sunset, with gentle waves and a native synchronized audio track."
    10. }
    11. ],
    12. "resolution": "720p",
    13. "duration": 10
    14. }'

    该 curl 示例遵循 Gate.AI OpenAI 兼容 API 格式,API 密钥采用环境变量。请求中包含模型 ID、文本提示、720P 分辨率及 10 秒时长。开发者应在 Gate.AI 平台核查最终返回结构及模型专属参数。

    常见问题解答

    Wan 2.5 T2V Preview 最长支持多长视频?
    阿里云文档截至 2026年7月,wan2.5-t2v-preview 支持 5 秒和 10 秒两种时长。

    Wan 2.5 T2V Preview 的费用是多少?
    阿里巴巴国际定价为 480P \$0.05/秒,720P \$0.10/秒,1080P \$0.15/秒(截至 2026年7月)。

    Wan 2.5 T2V Preview 是否支持 API 访问?
    支持。阿里云模型工作室文档说明支持异步 API,Gate.AI 列表模型 ID 为 alibaba/wan2.5-t2v-preview

    Wan 2.5 T2V Preview 适合哪些用途?
    适合带音频的短文本生成视频,如概念视觉、社交草案、广告分镜、培训片段及动态实验。生产使用前仍需人工审核。

    本内容不构成任何要约、招揽、或建议。您在做出任何投资决定之前应始终寻求独立的专业建议。请注意,Gate 可能会限制或禁止来自受限制地区的所有或部分服务。请阅读 用户协议了解更多信息。

    相关文章