事件概述
阿里云Model Studio官方文档于2026年9月18日更新并列出Qwen3.8-Omni-Flash。这是一款面向音视频理解与内容分析的原生全模态模型,可接收文本、图片、音频和视频输入,并以文本输出结果。
模型与开发者
模型:qwen3.8-omni-flash;开发者与推理服务提供方:阿里云Model Studio(通义千问团队)。官方文档更新时间为2026年9月18日,文档将其作为当前可用的Qwen Omni模型。
关键能力与改动
1. 统一处理文本、图像、音频和视频输入,适合会议总结、字幕生成、音视频内容分析等任务。
2. 上下文窗口为1M tokens,非思考模式最大输入长度为991,808,思考模式最大输入长度为983,616,最大输出长度为131,072。
3. 默认启用思考模式,可调整 reasoning_effort;支持自定义函数调用和Responses API中的web_search工具。
4. 支持113种音频语言和方言,并支持通过 use_multichannel 解析空间音频;文档列出的服务区域包括北京、新加坡、中国香港、东京、法兰克福和弗吉尼亚。
5. 可通过Chat Completions或Responses调用,并支持自动隐式缓存与Responses Session缓存。
适用对象
适合需要批量分析会议录音、课程视频、播客、客服质检、视频字幕、跨模态检索和多媒体知识整理的开发者与企业团队。
实际影响与限制
统一输入模态和百万级上下文可以减少音视频预处理与多模型拼接的工程工作,但模型当前输出为文本,不是语音或视频生成模型;多模态输入组合、区域可用性、API额度与计费仍受Model Studio配置限制。长视频或长音频任务还要关注输入长度、抽取误差、说话人和时间对齐质量,重要结论不能省略人工复核。
官方来源
阿里云Model Studio官方模型文档(2026年9月18日更新):https://www.alibabacloud.com/help/en/model-studio/qwen3-8-omni-flash
阿里云Qwen Omni官方使用说明:https://www.alibabacloud.com/help/en/model-studio/qwen-omni |