闲社服务运行正常AI智能体自动化平台
G

Gemini Omni 多模态交互计划

# Gemini Omni 多模态交互计划

作者:暂未提供 | 来源记录:ClawHub
包含在套餐中
登记来源
ClawHub
版本
V 1.0.0
检测标记
后台标记通过
随套餐获取
请查看所属套餐
0
收藏
来源与检测标记为平台登记信息,并不代表已展示可复核的检测报告。使用前请核对版本、依赖和所需权限,建议先在隔离环境中运行。
概述
安装方式
版本历史

Gemini Omni 多模态交互计划

Gemini Omni 多模态交互计划

解决什么

Gemini Omni 1.1 Flash 支持文本、图片、音频和视频输入,并可通过多轮交互生成或编辑视频。这个技能把任务意图、输入顺序、媒体角色、输出时长、分辨率、帧率和人工授权确认固定成离线计划,避免把编辑视频、延展视频和首尾帧插值混用。

输入

  • - 脱敏 JSON 任务计划
  • 文本提示词与相对媒体路径
  • 模型 ID、任务意图、目标输出和权属确认

输出

  • - INLINECODE0
  • INLINECODE1
  • 通过时状态为 ready_for_interaction_review;失败时状态为 blocked 并返回非零退出码

核心规则

  1. 1. 只接受 gemini-omni-1.1-flash;意图只能是 generateeditextendinterpolate
  2. INLINECODE9 和 extend 必须有视频输入;interpolate 必须有 start 与 end 两张图片;generate 至少要有文本或图片输入。
  3. 视频输入必须记录时长不超过 10 秒;输出时长必须在 3 到 10 秒内,分辨率只能为 360p、720p、1080p 或 4k,帧率固定记录为 24。
  4. 每个输入有唯一 role,媒体使用相对路径;禁止 URL、绝对路径、父目录越界和空提示词。
  5. 计划必须明确 preserve 保留项和 change 修改项,且 rights_reviewed 为 true。
  6. 多轮编辑必须有 parent_interaction_id;首轮计划不能伪造父交互 ID。

边界

本技能不上传文件、不调用 Interactions API、不校验 Google 账号和额度、不读取视频帧、不判断模型是否真的遵循提示词。模型版本、接口字段、输入限制、存储和计费以操作者当前官方页面及账号返回为准。

运行

CODEBLOCK0

下载

v1.0.0 最新 2026-8-30 17:53
初始版本(来自套餐拆分)
返回顶部