模型
模型组、任务类型和公开 ready 规则。
模型
公开目录只展示已经可以承接真实流量的模型组。不同模型组可以共用同一套 worker 平台,但要保留独立的队列、伸缩、计费和任务 schema 配置。
分类
| 分类 | 当前状态 |
|---|---|
| 图像 | Omni Image AIO 已展示并可用。 |
| 视频 | Omni Video AIO 已展示并可用。 |
| Multi | Omni Multi AIO 已展示,可执行混合媒体任务。 |
| 音频 | MM Audio AIO 已展示,可执行音效生成。 |
| VLLM | 独立 VLLM 模型组预留,模型选型和文本协议准备好前隐藏。 |
Omni Image AIO
图像任务覆盖单图编辑、网站侧 local inpaint 封装,以及为未来模型预留的多图输入接口。公开 API 只开放已支持的 task type;仅网站使用的 wrapper 可以不对 API 用户开放。
文生图五个比例固定映射为 1344x768、1152x864、1008x1008、864x1152、768x1344。API 也可以提交显式 reference_width/reference_height 并保持 aspect_ratio 为空;每边必须在 256-2048 之间、能被 16 整除,面积不超过 1024x1024。图像编辑参考面积上限为 896x896;输入原图最长边超过 1536 时由 Worker 按比例缩小。
Omni Video AIO
视频任务覆盖文生视频、图生视频、首尾帧视频和视频转视频。视频延长按 video-to-video 的兼容命名处理。
所有视频任务必须同时提交相等的 reference_width/reference_height,只允许 384、512、800。基于媒体的 auto 尺寸优先读取输入比例,读取失败时回退为 1:1。
Omni Multi AIO
Omni Multi AIO 在同时维护多个模型组的共享运行时上执行混合媒体任务。当前公开 Catalog 提供:
image_upscale:图像超分。audio_transcribe:独立音频转录。voice_clone_tts:使用文本和参考音频合成语音。vlm_chat:带图像输入的文本问答。talk2prompt:先做语音转写,再交给 VLM 生成提示词/回答。voice_translate:完成转录、翻译并生成目标语言语音。
六种已就绪 task type 全部使用同一公开 Catalog 和 create 合同,线上 Catalog 仍是唯一权威。
文本和 JSON 输出直接写入任务结果字段。图像输出继续使用标准 R2 签名输出合同。运行时按 warm worker slot 串行执行任务,需要代理时只使用标准代理环境变量。
Multi 语言选择器使用同一份语言 manifest。下拉选项可以是基础值,也可以是 { value, label, label_i18n_key } 对象;label 是稳定的“缩写/本地语言名”展示,例如 yue/中文-粤语,label_i18n_key 指向网站 UI 和 API 文档共用的本地化语言名称。
image_upscale 使用统一尺寸合同提交 reference_width、reference_height,并保持 aspect_ratio 为空。reference_width 和 reference_height 必须相等,只允许 2048 或 3072。历史字段 target_max_side 会被拒绝。Worker 会保持输入图宽高比并在 runtime summary 中回写最终宽高。
MM Audio AIO
MM Audio AIO 已在 API Models、Playground 和 Visual 网站组开放,提供三个 task type:text_to_audio、image_to_audio 和 video_to_audio。三者都必须填写 Prompt;文本任务禁止媒体输入,图像任务必须且只能提交一张源图,视频任务必须且只能提交一个源视频。每个媒体输入最大 100 MB,图像真实解码后最多 64 MP,源视频最长 20 秒。原始媒体最长边允许超过 1024;Worker 会按真实解码结果等比规范化图像和视频输入,使最长边为 1024 后再推理。
MM Audio AIO 只使用 Fast 积分。文本任务返回一个固定 10 秒的 audio/wav 文件;图像任务返回一个以源图为画面、固定 10 秒、25 FPS 的 H.264/AAC video/mp4 文件;视频任务返回一个保留源视频画面、跟随实际解码时长且最长 20 秒的 H.264/AAC video/mp4 文件。任务输入和输出始终以线上 Catalog 为准。
Ready 要求
模型组公开前需要满足:
- worker 完成 warmup 后再接任务。
- 下载、推理、上传、总耗时都有分段日志。
- 队列和伸缩限制已配置。
- 价格和扣费规则已确定。
- 当前 release candidate 至少通过一次 smoke 任务。
