Qwen3.8-Omni-Flash 发布:1M 上下文全模态,音视频智能体开始交付(2026年9月)

⚡ TL;DR
千问 Qwen3.8-Omni-Flash 支持文本图像音频视频四类输入与 1M 上下文,官方称 29 项评测平均分提升超 25%、音频输入成本降超 98%。本文对照 Gemini 3.8 Flash 给出音频与视频两侧的强弱分野,并给出三类团队的迁移建议。

一句话结论:2026 年 9 月 18 日,阿里千问发布原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频、视频四类输入与 1M 上下文,官方称 29 项评测平均分比上一代 Qwen3.5-Omni-Plus 提升超 25%,每小时音频输入成本降幅超过 98%。它的定位不是「更能听懂」,而是让音视频成为智能体可交付任务的媒介。

Qwen 官方博客:Qwen3.8-Omni-Flash 发布

Qwen3.8-Omni-Flash 关键参数

  • 四模态原生输入:文本、图像、音频、视频,不是语音识别 + 图像识别的拼装
  • 上下文:1M token(最大输入约 99.2 万,思考模式约 98.4 万),最大输出 13.1 万
  • 音频支持 113 种语言与方言,可做立体声与 4 声道空间音频分析
  • 接口兼容 OpenAI 协议,支持函数调用、联网搜索、上下文缓存、三档推理强度
  • 上线:阿里云百炼北京、新加坡、中国香港、东京、法兰克福、弗吉尼亚

最狠的不是分数,是价格

官方给了两个比榜单实在的数字:每小时音频输入价格降幅超 98%,每小时音视频联合输入价格降幅超 93%。计价口径是「处理 2 分钟素材成本的 30 倍」,视频按 720p、每秒 1 帧估算。阿里云国际区文本为每百万输入 token 0.15 美元、缓存输入 0.016 美元、输出 0.47 美元,中国大陆计价另有区分,以官网为准。会议转写、播客切片、长视频素材检索这类长期常驻的任务,成本结构被改写。

音视频智能体:先挑片段,再逐帧细看

长视频的老问题是每一帧都要读一遍。这代改成问题驱动检索:先粗筛关键片段,再对候选段做多轮证据比对。官方测试里 OmniVideoBench 从 63.4 升到 67.8,单次查询 token 消耗从 145,736 降到 79,117(降 45.7%)。但同一 Agent 模式下,Gemini 3.8 Flash 在这项是 70.1,仍压一头。

同维度横评:音视频智能体该选谁

信息图:Qwen3.8-Omni-Flash、Gemini 3.8 Flash、Seed 2.0 Lite 三家在音频、音视频与成本上的同维度对比
Qwen3.8-Omni-Flash 发布:1M 上下文全模态,音视频智能体开始交付(2026年9月) - 数据对比信息图
Qwen3.8-Omni-Flash 发布:1M 上下文全模态,音视频智能体开始交付(2026年9月) · 核心数据一览
项目Qwen3.8-Omni-FlashGemini 3.8 Flash
多说话人会议识别(DER/cpWER,越低越好)3.35 / 17.1872.6 / 53.1
音视频工具调用 WildClawBench-MM71.058.9
视频理解 OmniVideoBench63.465.2
音视频智能体 OmniGAIA74.078.6

结论很清楚:音频与音视频工具调用千问这代反超,视频理解与视频智能体 Gemini 仍领先。官方口径说音视频「接近」、音频「整体超过」——按自家表格看,这措辞把视频侧差距说轻了。

已绑在 Gemini 上做会议转写与视频检索的团队,值得拿这组价格重谈一轮;已在用 千问 的则是顺手升级。

顺手开源了两套工具

模型本身没开源,开源的是配套:Qwen-MM-Plugins 提供多模态工具集成,适配 Claude CodeCodex、Qwen Code 与 Gemini CLI;Qwen-Live Harness 是实时音视频流的运行框架,官方称是首个支持「声音定位」的全模态实时版本,走 WebSocket 与 WebRTC。

官方还让模型自己参与研发:12 小时内完成 4 轮迭代、造出 3,413 条训练数据,把 Qwen2.5-Omni-3B 的四川方言字符错误率从 25.79% 降到 15.30%。

Qwen 官方博客:29 项评测与成本口径

谁该现在试,谁可以再等

  • 做会议纪要、客服质检、长视频检索的团队:98% 降幅足够覆盖迁移成本,现在就试
  • 做视频理解、依赖 Gemini 视频强项的团队:先拿这组价格去谈判,别急着换栈
  • 需要私有化或权重自持的团队:模型未开源,先看 Qwen3.8-Max 这类可自持路线

数据声明:本文跑分、降幅与定价取自千问官方博客(2026-09-18)与阿里云百炼文档,属厂商自测口径,以官网为准。

❓ 常见问题

Qwen3.8-Omni-Flash 开源了吗?

模型本身没有开源,走的是阿里云百炼 API。这次开源的是配套工具:Qwen-MM-Plugins 多模态插件套件与 Qwen-Live Harness 实时运行框架。需要权重自持或私有化部署的团队,得看 Qwen3.8-Max 这类可自持路线。

1M 上下文真的能用满吗?

官方给出的上限是最大输入约 99.2 万 token、思考模式约 98.4 万 token,最大输出 13.1 万 token,并支持上下文缓存来摊薄重复输入成本。实际可用长度还受你的素材码率与抽帧策略影响,视频按 720p、每秒 1 帧计价的估算方式就说明了这一点。

音频输入成本降 98% 是怎么算出来的?

官方口径是把每小时音频的 API 价格折算成「处理 2 分钟素材成本的 30 倍」,音视频联合输入按 720p、每秒 1 帧计算,对比对象是上一代 Qwen3.5-Omni-Plus。这是厂商自测的估算方法,不是第三方测出来的账单,落地前建议用真实素材跑一批对账。

它和 Gemini 3.8 Flash 到底谁更强?

按官方自己公布的表格:多说话人会议识别、音视频工具调用、音频理解三项千问领先,视频理解 OmniVideoBench 与音视频智能体 OmniGAIA 两项 Gemini 领先。所以更准确的说法是音频侧反超、视频侧仍有差距,而不是全面胜出。

关于作者:本文由 AI工具宝箱编辑组 撰写,团队持续追踪并实测主流 AI 工具,月均订阅支出 $200+,所有评测基于真实长期使用。

数据声明:本文所有数据均标注来源,可溯源核查。发现错误欢迎通过 联系页面 反馈,48 小时内核查修正。