浏览文档
全部文档

媒体生成

选择适合该工作的模型

根据所需的功能、创意限制、访问权限、速度和估计成本来选择模型,而不仅仅是名称。

最后审核日期:2026年9月25日

通过消除无法执行工作的路线来选择模型,然后将剩余选项与受控测试进行比较。型号名称、发布日期和受欢迎程度对于工作所需的能力来说是次要的。

1. 定义不可协商的事项

在打开选择器之前写下一行要求。包括:

  • 输出类型:图像、视频或音频;
  • 操作:生成、编辑、动画、变换、扩展、口型同步或组合;
  • 所需的来源媒体和参考文献数量;
  • 宽高比、分辨率和持续时间;
  • 视频是否必须包含或响应音频;
  • 产品、人、声音、标签或现有作品的保真度要求;
  • 此尝试的最大可接受估计。

这些限制创建了一个候选名单。如果模型无法接受所需的源视频或对话音频,则其视觉质量与该工作流程无关。

2. 读取模型选择器

工作区按所选媒体类型对模型进行分组。按型号或提供商搜索,然后阅读每个选项旁边的状态。

信号这意味着什么这不意味着什么
已选择该模型将用于具有可见设置的该节点该模型最适合每项任务
热门当前目录中精选的发现信号质量保证或成本最低
新根据目录日期,该版本是最近发布的每个工作流程的成熟行为
高级或不可用当前访问状态下路由可见但不可用该路线将默默地回退到另一个模型
信用评估当前路线和设置的预期使用情况每次多步运行的固定最终费用

选择模型后,composer 会协调其控件。如果分辨率、持续时间、比率、语音或参考控件消失,则该路由不会声明当前模式的这些选择。

! 打开图像模型目录并为准备好的制作简介选择路线。

3.了解工作流程模式

模式当需要思考
生成提示应创建新图像或声音描述预期的结果和目的地
编辑现有媒体必须保持基础说明什么必须改变,什么必须保留
文字转视频不需要起始帧描述主题、动作、摄像机、节奏和结束状态
图像转视频静态图像作为开场构图的锚点保护身份并仅描述预期的动作
视频参考多个兼容的源定义主题、风格、动作或音频为每个参考提供明确的角色和优先级
第一帧和最后一帧两个受控状态之间的过渡很重要使两个框架兼容并描述它们之间的路径
延长视频现有动议应继续进行保持方向、摄像机逻辑、灯光和节奏
演讲或对话文本应该成为表演的音轨指定语音、语言、发音、语速和发言者轮流
声音场景、音乐或效果结果是环境或非语言音频描述听觉事件、结构、强度和结尾

模式名称描述的是能力,而不是质量。两条路由可以支持相同的模式,但会产生不同的结果或暴露不同的限制。

4. 选择图像艺术方向

对于新图像,比较宽高比、可用分辨率、提示限制以及路线是否支持后期编辑。对于受控艺术,检查编辑路径接受的参考数量。

将测试与工作相匹配:

  • 产品保真度: 比较标签形状、材料、颜色、反射和小结构细节。
  • 布局工作: 比较对负空间、裁剪、层次结构和相机位置的遵守情况。
  • 排版敏感的工作: 检查每个生成的字符;当确切的文本很重要时,计划在一代之外添加最终的活动副本。
  • 风格探索: 保持主题和构图稳定,同时仅改变视觉处理。
  • 迭代: 当第一个输出应成为受控修订的源时,更喜欢具有兼容编辑模式的路由。

不要仅因为某条路线具有最大分辨率而选择该路线。具有实用分辨率的强大合成比结构错误的大文件更有用。

5.选择视频制作

视频选择从源工作流程开始。决定镜头是以文本为主导、以图像为主导、以参考为主导、以第一张和最后一张图像为框架、扩展还是编辑。

然后比较:

  • 活动模式允许的持续时间;
  • 宽高比和分辨率选择;
  • 接受的参考文献的数量和类型;
  • 端架支撑;
  • 原生或驾驶音频支持;
  • 身份、产品细节、摄像头和动作的连续性要求。

当您已经有了最终对话时,生成原生音频的路线可能仍然是错误的选择。对于由完成的音轨驱动的可见扬声器,请使用专用的 口型同步工作流程。对于多个批准的剪辑,请使用 组装 而不是要求一代人创造一个完整的序列。

! 打开实时视频模型目录并比较以图像为主导的视频的兼容路线。

6. 选择音频制作

从所需的模式开始。语音模型公开语音选择,并且可能在语言、交付控制、时间戳或输出格式方面有所不同。更广泛的声音模型可以支持对话、声音场景、音乐或效果,并且可以接受图像或音频参考。

对于声音比较,使用相同的短脚本并检查发音、节奏、情感契合度、一致性和噪音。对于音乐或效果,比较结构、可用的结尾、不需要的声音以及结果与预期编辑的契合程度。

7. 将模型与生产阶段相匹配

在发现概念时使用最低承诺支持的路线。只有在简介、参考文献和目的地格式稳定后,才能转到最终保真度所需的路线和设置。

  1. 探索: 测试核心思想和提示结构。
  2. 比较: 通过一个小的候选名单运行相同的受控概要。
  3. 细化: 当支持编辑时,使用最强的输出作为源。
  4. 完成: 选择所需的分辨率、持续时间或语音,并根据交付大小进行审查。

这并不是说“快速”模型总是适合草稿,或者昂贵的模型总是更好。采摘者和受控测试的结果就是证据。

8. 进行公平比较

保持提示、参考文献、宽高比、分辨率目标和审核标准固定。仅更改型号。记录每个结果的模型和设置。

对工作实际需要的内容进行评分:及时遵守、品牌契合度、主题保真度、构图、文本、解剖结构、动作连续性、音频质量、速度、可编辑性和估计。赢得电影景观测试的模型可能会输掉包装保真度测试。

9. 确认访问权限和费用

可用性取决于当前帐户、环境和服务配置。在围绕路由构建工作流之前,请确认该路由已启用。更改分辨率、持续时间、模式或参考后再次查看估计值。

如果没有单个模型支持每个约束,请将工作拆分为连接的节点。首先生成或编辑源图像,在兼容的视频路径中为其设置动画,单独创建音频,然后在适当的时候使用唇形同步或组合。

从产品目录生成

当前型号目录

这些表是从 Fuzzbucket 的当前产品目录生成的,因此模型名称和声明的功能与工作区保持一致。访问权限可能因帐户而异。打开模型选择器以确认可用性并查看您的确切设置的估计值。

图像模型15 当前目录中的型号查看

比较生成和编辑支持、参考能力以及每个图像路径声明的输出控件。

型号模式输入输出控制
GPT Image 2热门生成、编辑提示·最多 16 个参考6 种纵横比
Grok Imagine Pro热门生成、编辑提示·最多 3 个参考1K、2K
Nano Banana 2热门生成、编辑提示·最多 14 条参考文献0.5K、1K、2K、4K
FLUX 2 Pro生成、编辑提示·最多 10 条参考文献5 种纵横比
GPT Image 2.5 Sunburst生成、编辑提示·最多 16 个参考1K、2K、4K
Grok Imagine Image生成、编辑提示·最多 3 个参考1K、2K
Ideogram V4生成、编辑提示·最多 1 个参考5 种纵横比
Krea 2 Large生成提示1K
Krea 2 Medium生成提示1K
Nano Banana Pro生成、编辑提示·最多 14 条参考文献1K、2K、4K
Qwen Image 2生成、编辑提示·最多 3 个参考5 种纵横比
Recraft V4.1生成提示5 种纵横比
Reve 2.1生成、编辑提示·最多 1 个参考18 种纵横比
Seedream 4.5生成、编辑提示·最多 14 条参考文献2K、4K
Wan 2.7 Image生成、编辑提示·最多 4 条参考文献5 种纵横比
视频模型18 当前目录中的型号查看

比较源工作流程、参考容量、持续时间、分辨率以及路线是否可以生成或使用音频。

型号模式输入输出控制
Grok Imagine Video热门文本到视频、图像到视频、视频参考、编辑、扩展视频提示 · 最多 7 条参考文献480p、720p · 1–15 秒
Seedance 2.5热门文本转视频、图像转视频、视频参考提示·最多 30 条参考文献480p、720p · 4–30 秒 · 具有音频功能
Veo 3.1 Fast热门文本到视频、图像到视频、视频参考、扩展视频、第一帧和最后一帧提示·最多 3 个参考720p、1080p · 4–8s · 具有音频功能
FLUX 3文本到视频、图像到视频、第一帧和最后一帧、扩展视频提示720p、1080p · 5–20 秒 · 具有音频功能
Gemini Omni Flash文本到视频、图像到视频、视频参考、编辑提示·最多 10 条参考文献2 种纵横比 · 3–10 秒
Kling Video O3 Standard文本转视频、图像转视频、视频参考提示·最多 4 条参考文献3 种宽高比 · 3–15 秒 · 具有音频功能
Kling Video V3 Pro文字转视频、图像转视频提示3 种宽高比 · 3–15 秒 · 具有音频功能
LTX 2.3文本到视频、图像到视频、第一帧和最后一帧、扩展视频提示、图像、视频、结束帧1080p、1440p、2160p · 2–20 秒 · 具有音频功能
MiniMax H3文本转视频、图像转视频、视频参考提示、图像、视频+3480P、768P、2K、4K · 5–15 秒 · 具有音频功能
MiniMax H3 Max文本转视频、图像转视频、视频参考提示、图像、视频+3480P、768P · 5–15 秒 · 具有音频功能
MiniMax H3 Max Turbo文字转视频、图像转视频提示、图像、结束帧480P、768P · 5–15 秒 · 具有音频功能
PixVerse V6文本到视频、图像到视频、第一帧和最后一帧、扩展视频提示、图像、视频、结束帧360p、540p、720p、1080p · 1–15 秒 · 具有音频功能
Seedance 2.0文本转视频、图像转视频、视频参考提示·最多 9 个参考480p、720p、1080p、4k · 4–15 秒 · 具有音频功能
Seedance 2.0 Fast文本转视频、图像转视频、视频参考提示·最多 9 个参考480p、720p · 4–15 秒 · 具有音频功能
Sora 2文本转视频、图像转视频、编辑提示4-20秒
Veo 3.1文本到视频、图像到视频、视频参考、扩展视频、第一帧和最后一帧提示·最多 3 个参考720p、1080p、4k · 4–8s · 具有音频功能
Vidu Q3文本到视频、图像到视频、第一帧和最后一帧、视频参考提示、图像、最多 4 个参考、结束帧360p、540p、720p、1080p · 1–16s · 具有音频功能
Wan 2.7文本到视频、图像到视频、第一帧和最后一帧、扩展视频、视频参考、编辑提示、图像、视频+3720p、1080p · 2–15 秒 · 具有音频功能
音频型号4 当前目录中的型号查看

比较语音和声音生成模式、可接受的源类型、格式、持续时间和语音选项。

型号模式输入输出控制
ElevenLabs Turbo v2.5演讲提示MP3·8种声音
ElevenLabs v3演讲提示MP3·8种声音
Seed Audio 1.0语音、对话、声音场景、音乐、音效提示、图像、音频、最多 3 个参考长达 120 秒 · WAV、MP3、PCM、OGG_OPUS
Seed Speech TTS 2.0演讲提示MP3、OPUS · 10 种声音