
Gemini Omni
在 UniRoute 借助 Gemini Omni API 构建视频生成与编辑产品。通过自然语言控制、参考引导和高性价比的 API 接入,将文本、图像、视频和语音输入转化为连贯的视频结果。
定价
| 档位 | UniRoute 价格 | 市场参考价 |
|---|---|---|
| video · 4s 1080p no video input | $0.315 | — |
| video · 4s 720p no video input | $0.315 | $0.50 |
| video · 6s 1080p no video input | $0.42 | — |
| video · 6s 720p no video input | $0.42 | $0.75 |
| video · 8s 1080p no video input | $0.525 | — |
每次请求
模型介绍
在 Google I/O 2026 大会上,Gemini Omni 代表了多模态 AI 创作的全新跨越。它专为基于不同类型的输入进行创作而设计,并以视频为起点,将 Gemini 的推理能力与生成式媒体系统结合在一起。这使得模型能够更深入地理解场景、动作、环境、物理行为和现实世界背景,从而使视频生成与编辑超越简单的文生视频输出。Gemini Omni Flash 是 Omni 家族的首发模型,专为实用的视频创作与编辑工作流而打造;在这些工作流中,用户可以转换素材、通过参考资料引导生成结果,并通过自然语言优化场景。
深入了解
Google Gemini Omni:支持任意输入的多模态视频创作模型
在 Google I/O 2026 大会上,Gemini Omni 代表了多模态 AI 创作的全新跨越。它专为基于不同类型的输入进行创作而设计,并以视频为起点,将 Gemini 的推理能力与生成式媒体系统结合在一起。这使得模型能够更深入地理解场景、动作、环境、物理行为和现实世界背景,从而使视频生成与编辑超越简单的文生视频输出。Gemini Omni Flash 是 Omni 家族的首发模型,专为实用的视频创作与编辑工作流而打造;在这些工作流中,用户可以转换素材、通过参考资料引导生成结果,并通过自然语言优化场景。
Gemini Omni Flash 文本输入
文本输入功能允许用户使用自然语言描述他们想要创建或编辑的视频。提示词可以定义场景、主体、动作、运镜、风格、光影或特定的转换效果,使 Gemini Omni Flash 非常适用于文生视频及对话式视频微调。
Gemini Omni Flash 图像输入
图像输入可通过主体、人物、物品、场景、线稿或视觉风格来引导视频生成。Gemini Omni Flash 能够借助参考图像保留关键视觉细节、应用所选外观,或将静态创意转化为动态视频序列。
一次请求即可调用
兼容 OpenAI SDK —— 只需修改 base URL。
curl https://api.uniroute.dev/v1/video/generations \
-H "Authorization: Bearer $UNIROUTE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-omni",
"prompt": "Drone shot over a neon city at night",
"duration": 8
}'相关模型
受欢迎在UniRoute上使用Google Veo 3.1 API,从文本或图像生成高质量视频。控制每一帧,延伸场景,生成同步音频——立即体验Veo 3.1,感受电影级AI视频创作。
新上架在 UniRoute 上调用 MiniMax H3 API,将提示词与多模态参考转化为高品质 2K 视频,具备原生立体声、连贯的动作表现及精准的创意控制。

在 UniRoute 接入 Seedance 2.0 Mini API,实现更快、更低成本的 AI 视频生成。通过文本、图像及多模态输入创建高质量视频,质量媲美 Seedance 2.0 Fast。
