# Qwen3.8-Omni-Flash 发布：1M 上下文全模态，音视频智能体开始交付（2026年9月）

**一句话结论**：2026 年 9 月 18 日，阿里千问发布原生全模态模型 Qwen3.8-Omni-Flash，支持文本、图像、音频、视频四类输入与 1M 上下文，官方称 29 项评测平均分比上一代 Qwen3.5-Omni-Plus 提升超 25%，每小时音频输入成本降幅超过 98%。它的定位不是「更能听懂」，而是让音视频成为智能体可交付任务的媒介。

![Qwen 官方博客：Qwen3.8-Omni-Flash 发布](https://www.aitoollab.cn/images/articles/qwen3-8-omni-flash-audio-video-agent-2026/1-qwen-omni-flash-blog.png)

## Qwen3.8-Omni-Flash 关键参数

- 四模态原生输入：文本、图像、音频、视频，不是语音识别 + 图像识别的拼装
- 上下文：1M token（最大输入约 99.2 万，思考模式约 98.4 万），最大输出 13.1 万
- 音频支持 113 种语言与方言，可做立体声与 4 声道空间音频分析
- 接口兼容 OpenAI 协议，支持函数调用、联网搜索、上下文缓存、三档推理强度
- 上线：阿里云百炼北京、新加坡、中国香港、东京、法兰克福、弗吉尼亚

## 最狠的不是分数，是价格

官方给了两个比榜单实在的数字：每小时音频输入价格降幅超 98%，每小时音视频联合输入价格降幅超 93%。计价口径是「处理 2 分钟素材成本的 30 倍」，视频按 720p、每秒 1 帧估算。阿里云国际区文本为每百万输入 token 0.15 美元、缓存输入 0.016 美元、输出 0.47 美元，中国大陆计价另有区分，以官网为准。会议转写、播客切片、长视频素材检索这类长期常驻的任务，成本结构被改写。

## 音视频智能体：先挑片段，再逐帧细看

长视频的老问题是每一帧都要读一遍。这代改成问题驱动检索：先粗筛关键片段，再对候选段做多轮证据比对。官方测试里 OmniVideoBench 从 63.4 升到 67.8，单次查询 token 消耗从 145,736 降到 79,117（降 45.7%）。但同一 Agent 模式下，Gemini 3.8 Flash 在这项是 70.1，仍压一头。

## 同维度横评：音视频智能体该选谁

> 信息图：Qwen3.8-Omni-Flash、Gemini 3.8 Flash、Seed 2.0 Lite 三家在音频、音视频与成本上的同维度对比

| 项目 | Qwen3.8-Omni-Flash | Gemini 3.8 Flash |
| --- | --- | --- |
| 多说话人会议识别（DER/cpWER，越低越好） | 3.35 / 17.18 | 72.6 / 53.1 |
| 音视频工具调用 WildClawBench-MM | 71.0 | 58.9 |
| 视频理解 OmniVideoBench | 63.4 | 65.2 |
| 音视频智能体 OmniGAIA | 74.0 | 78.6 |

结论很清楚：音频与音视频工具调用千问这代反超，视频理解与视频智能体 Gemini 仍领先。官方口径说音视频「接近」、音频「整体超过」——按自家表格看，这措辞把视频侧差距说轻了。

已绑在 [Gemini](/tools/gemini/) 上做会议转写与视频检索的团队，值得拿这组价格重谈一轮；已在用 [千问](/tools/qwen-chat/) 的则是顺手升级。

## 顺手开源了两套工具

模型本身没开源，开源的是配套：Qwen-MM-Plugins 提供多模态工具集成，适配 [Claude Code](/tools/claude-code/)、[Codex](/tools/codex-cli/)、Qwen Code 与 Gemini CLI；Qwen-Live Harness 是实时音视频流的运行框架，官方称是首个支持「声音定位」的全模态实时版本，走 WebSocket 与 WebRTC。

官方还让模型自己参与研发：12 小时内完成 4 轮迭代、造出 3,413 条训练数据，把 Qwen2.5-Omni-3B 的四川方言字符错误率从 25.79% 降到 15.30%。

![Qwen 官方博客：29 项评测与成本口径](https://www.aitoollab.cn/images/articles/qwen3-8-omni-flash-audio-video-agent-2026/2-qwen-omni-flash-pricing-benchmark.png)

## 谁该现在试，谁可以再等

- 做会议纪要、客服质检、长视频检索的团队：98% 降幅足够覆盖迁移成本，现在就试
- 做视频理解、依赖 Gemini 视频强项的团队：先拿这组价格去谈判，别急着换栈
- 需要私有化或权重自持的团队：模型未开源，先看 [Qwen3.8-Max](/tools/qwen3-8-max/) 这类可自持路线

数据声明：本文跑分、降幅与定价取自千问官方博客（2026-09-18）与阿里云百炼文档，属厂商自测口径，以官网为准。
