Omni API
Omni API Docs

模型

模型组、任务类型和公开 ready 规则。

模型

公开目录只展示已经可以承接真实流量的模型组。不同模型组可以共用同一套 worker 平台,但要保留独立的队列、伸缩、计费和任务 schema 配置。

分类

分类 当前状态
图像 Omni Image AIO 已展示并可用。
视频 Omni Video AIO 已展示并可用。
Multi Omni Multi AIO 已展示,可执行混合媒体任务。
音频 MM Audio AIO 已展示,可执行音效生成。
VLLM 独立 VLLM 模型组预留,模型选型和文本协议准备好前隐藏。

Omni Image AIO

图像任务覆盖单图编辑、网站侧 local inpaint 封装,以及为未来模型预留的多图输入接口。公开 API 只开放已支持的 task type;仅网站使用的 wrapper 可以不对 API 用户开放。

文生图五个比例固定映射为 1344x7681152x8641008x1008864x1152768x1344。API 也可以提交显式 reference_width/reference_height 并保持 aspect_ratio 为空;每边必须在 256-2048 之间、能被 16 整除,面积不超过 1024x1024。图像编辑参考面积上限为 896x896;输入原图最长边超过 1536 时由 Worker 按比例缩小。

Omni Video AIO

视频任务覆盖文生视频、图生视频、首尾帧视频和视频转视频。视频延长按 video-to-video 的兼容命名处理。

所有视频任务必须同时提交相等的 reference_width/reference_height,只允许 384512800。基于媒体的 auto 尺寸优先读取输入比例,读取失败时回退为 1:1

Omni Multi AIO

Omni Multi AIO 在同时维护多个模型组的共享运行时上执行混合媒体任务。当前公开 Catalog 提供:

  • image_upscale:图像超分。
  • audio_transcribe:独立音频转录。
  • voice_clone_tts:使用文本和参考音频合成语音。
  • vlm_chat:带图像输入的文本问答。
  • talk2prompt:先做语音转写,再交给 VLM 生成提示词/回答。
  • voice_translate:完成转录、翻译并生成目标语言语音。

六种已就绪 task type 全部使用同一公开 Catalog 和 create 合同,线上 Catalog 仍是唯一权威。

文本和 JSON 输出直接写入任务结果字段。图像输出继续使用标准 R2 签名输出合同。运行时按 warm worker slot 串行执行任务,需要代理时只使用标准代理环境变量。

Multi 语言选择器使用同一份语言 manifest。下拉选项可以是基础值,也可以是 { value, label, label_i18n_key } 对象;label 是稳定的“缩写/本地语言名”展示,例如 yue/中文-粤语label_i18n_key 指向网站 UI 和 API 文档共用的本地化语言名称。

image_upscale 使用统一尺寸合同提交 reference_widthreference_height,并保持 aspect_ratio 为空。reference_widthreference_height 必须相等,只允许 20483072。历史字段 target_max_side 会被拒绝。Worker 会保持输入图宽高比并在 runtime summary 中回写最终宽高。

MM Audio AIO

MM Audio AIO 已在 API Models、Playground 和 Visual 网站组开放,提供三个 task type:text_to_audioimage_to_audiovideo_to_audio。三者都必须填写 Prompt;文本任务禁止媒体输入,图像任务必须且只能提交一张源图,视频任务必须且只能提交一个源视频。每个媒体输入最大 100 MB,图像真实解码后最多 64 MP,源视频最长 20 秒。原始媒体最长边允许超过 1024;Worker 会按真实解码结果等比规范化图像和视频输入,使最长边为 1024 后再推理。

MM Audio AIO 只使用 Fast 积分。文本任务返回一个固定 10 秒的 audio/wav 文件;图像任务返回一个以源图为画面、固定 10 秒、25 FPS 的 H.264/AAC video/mp4 文件;视频任务返回一个保留源视频画面、跟随实际解码时长且最长 20 秒的 H.264/AAC video/mp4 文件。任务输入和输出始终以线上 Catalog 为准。

Ready 要求

模型组公开前需要满足:

  • worker 完成 warmup 后再接任务。
  • 下载、推理、上传、总耗时都有分段日志。
  • 队列和伸缩限制已配置。
  • 价格和扣费规则已确定。
  • 当前 release candidate 至少通过一次 smoke 任务。