本答案内容
我应该选择哪一代型号?
选择适合该工作的模型
根据所需的功能、创意限制、访问权限、速度和估计成本来选择模型,而不仅仅是名称。
通过消除无法执行工作的路线来选择模型,然后将剩余选项与受控测试进行比较。型号名称、发布日期和受欢迎程度对于工作所需的能力来说是次要的。
从工作开始,而不是排行榜。 最佳路线是成本最低的可用选项,可以满足此阶段工作所需的输入、控制和质量标准。
1. 定义不可协商的事项
在打开选择器之前写下一行要求。包括:
- 输出类型:图像、视频或音频;
- 操作:生成、编辑、动画、变换、扩展、口型同步或组合;
- 所需的来源媒体和参考文献数量;
- 宽高比、分辨率和持续时间;
- 视频是否必须包含或响应音频;
- 产品、人、声音、标签或现有作品的保真度要求;
- 此尝试的最大可接受估计。
这些限制创建了一个候选名单。如果模型无法接受所需的源视频或对话音频,则其视觉质量与该工作流程无关。
2. 读取模型选择器
工作区按所选媒体类型对模型进行分组。按型号或提供商搜索,然后阅读每个选项旁边的状态。
| 信号 | 这意味着什么 | 这不意味着什么 |
|---|---|---|
| 已选择 | 该模型将用于具有可见设置的该节点 | 该模型最适合每项任务 |
| 热门 | 当前目录中精选的发现信号 | 质量保证或成本最低 |
| 新 | 根据目录日期,该版本是最近发布的 | 每个工作流程的成熟行为 |
| 高级或不可用 | 当前访问状态下路由可见但不可用 | 该路线将默默地回退到另一个模型 |
| 信用评估 | 当前路线和设置的预期使用情况 | 每次多步运行的固定最终费用 |
选择模型后,composer 会协调其控件。如果分辨率、持续时间、比率、语音或参考控件消失,则该路由不会声明当前模式的这些选择。
3.了解工作流程模式
| 模式 | 当 | 需要思考 |
|---|---|---|
| 生成 | 提示应创建新图像或声音 | 描述预期的结果和目的地 |
| 编辑 | 现有媒体必须保持基础 | 说明什么必须改变,什么必须保留 |
| 文字转视频 | 不需要起始帧 | 描述主题、动作、摄像机、节奏和结束状态 |
| 图像转视频 | 静态图像作为开场构图的锚点 | 保护身份并仅描述预期的动作 |
| 视频参考 | 多个兼容的源定义主题、风格、动作或音频 | 为每个参考提供明确的角色和优先级 |
| 第一帧和最后一帧 | 两个受控状态之间的过渡很重要 | 使两个框架兼容并描述它们之间的路径 |
| 延长视频 | 现有动议应继续进行 | 保持方向、摄像机逻辑、灯光和节奏 |
| 演讲或对话 | 文本应该成为表演的音轨 | 指定语音、语言、发音、语速和发言者轮流 |
| 声音场景、音乐或效果 | 结果是环境或非语言音频 | 描述听觉事件、结构、强度和结尾 |
模式名称描述的是能力,而不是质量。两条路由可以支持相同的模式,但会产生不同的结果或暴露不同的限制。
4. 选择图像艺术方向
对于新图像,比较宽高比、可用分辨率、提示限制以及路线是否支持后期编辑。对于受控艺术,检查编辑路径接受的参考数量。
将测试与工作相匹配:
- 产品保真度: 比较标签形状、材料、颜色、反射和小结构细节。
- 布局工作: 比较对负空间、裁剪、层次结构和相机位置的遵守情况。
- 排版敏感的工作: 检查每个生成的字符;当确切的文本很重要时,计划在一代之外添加最终的活动副本。
- 风格探索: 保持主题和构图稳定,同时仅改变视觉处理。
- 迭代: 当第一个输出应成为受控修订的源时,更喜欢具有兼容编辑模式的路由。
不要仅因为某条路线具有最大分辨率而选择该路线。具有实用分辨率的强大合成比结构错误的大文件更有用。
5.选择视频制作
视频选择从源工作流程开始。决定镜头是以文本为主导、以图像为主导、以参考为主导、以第一张和最后一张图像为框架、扩展还是编辑。
然后比较:
- 活动模式允许的持续时间;
- 宽高比和分辨率选择;
- 接受的参考文献的数量和类型;
- 端架支撑;
- 原生或驾驶音频支持;
- 身份、产品细节、摄像头和动作的连续性要求。
当您已经有了最终对话时,生成原生音频的路线可能仍然是错误的选择。对于由完成的音轨驱动的可见扬声器,请使用专用的 口型同步工作流程。对于多个批准的剪辑,请使用 组装 而不是要求一代人创造一个完整的序列。
! 打开实时视频模型目录并比较以图像为主导的视频的兼容路线。
6. 选择音频制作
从所需的模式开始。语音模型公开语音选择,并且可能在语言、交付控制、时间戳或输出格式方面有所不同。更广泛的声音模型可以支持对话、声音场景、音乐或效果,并且可以接受图像或音频参考。
对于声音比较,使用相同的短脚本并检查发音、节奏、情感契合度、一致性和噪音。对于音乐或效果,比较结构、可用的结尾、不需要的声音以及结果与预期编辑的契合程度。
7. 将模型与生产阶段相匹配
在发现概念时使用最低承诺支持的路线。只有在简介、参考文献和目的地格式稳定后,才能转到最终保真度所需的路线和设置。
- 探索: 测试核心思想和提示结构。
- 比较: 通过一个小的候选名单运行相同的受控概要。
- 细化: 当支持编辑时,使用最强的输出作为源。
- 完成: 选择所需的分辨率、持续时间或语音,并根据交付大小进行审查。
这并不是说“快速”模型总是适合草稿,或者昂贵的模型总是更好。采摘者和受控测试的结果就是证据。
8. 进行公平比较
保持提示、参考文献、宽高比、分辨率目标和审核标准固定。仅更改型号。记录每个结果的模型和设置。
对工作实际需要的内容进行评分:及时遵守、品牌契合度、主题保真度、构图、文本、解剖结构、动作连续性、音频质量、速度、可编辑性和估计。赢得电影景观测试的模型可能会输掉包装保真度测试。
9. 确认访问权限和费用
可用性取决于当前帐户、环境和服务配置。在围绕路由构建工作流之前,请确认该路由已启用。更改分辨率、持续时间、模式或参考后再次查看估计值。
如果没有单个模型支持每个约束,请将工作拆分为连接的节点。首先生成或编辑源图像,在兼容的视频路径中为其设置动画,单独创建音频,然后在适当的时候使用唇形同步或组合。
这个答案有帮助吗?