AB
AiBoss
project

Qwen3.8-Omni-Flash - 阿里千问推出的原生全模态模型

Qwen3.8-Omni-Flash是阿里千问推出的原生全模态模型,支持文本、图像、音频、视频输入及1M长上下文,主打'从理解到交付'的Agent能力,可自主完成视频剪辑、MV...

Qwen3.8-Omni-Flash是什么

Qwen3.8-Omni-Flash是阿里千问推出的原生全模态模型,支持文本、图像、音频、视频输入及1M长上下文,主打”从理解到交付”的Agent能力,可自主完成视频剪辑、MV创作、短剧翻译、电影解说、会议纪要执行等端到端工作流。相比上代平均提升超25%,API音频输入价格降幅超98%,并开源Qwen-MM-Plugins与Qwen-Live Harness两大配套框架。

Qwen3.8-Omni-Flash的主要功能

  • 可控音视频 Caption:用户可自由指定描述对象、时间范围、信息粒度与输出格式,实现”用户想知道什么”而非”模型看到了什么”。
  • Agentic 长音视频理解:从问题出发自主决定看哪里、听什么,通过由粗到细的多轮取证定位关键信息,准确率提升的同时 token 消耗降低约 45.7%。
  • 长会议理解与执行:原生支持一小时音视频输入,端到端完成说话人切分、转录、身份对齐、纪要生成与待办执行。
  • 音视频深度研究:结合视频内容与用户需求,自动检索多模态资料,生成以视频为中心的图文并茂研究报告。
  • Music2MV:细粒度理解歌曲结构、节奏与情绪,输出带时间戳歌词,贯穿音乐理解到成片质检的完整 MV 创作流程。
  • 短剧翻译:一句话完成角色台词识别、口语化翻译、音色克隆配音、音轨重混与质检,实现译制自动化交付。
  • 长电影解说:输入影片与一句话需求,自动完成全片理解、情节提炼、解说文案、配音配乐、剪辑渲染与质检。
  • Video2Note:将数小时视频压缩为图文对应、带时间戳的 PDF 笔记,并自动审阅迭代修正。
  • Omni Skill Creator:从操作演示或专家教学中提炼 SOP,转化为经校验的可复用 Agent Skill。
  • 实时口语陪练:联合建模发音与语义,理解口音偏差并实时生成标准发音示范。

Qwen3.8-Omni-Flash的技术原理

  • 原生全模态统一架构:模型在单一架构内联合建模文本、图像、音频与视频,通过模态对齐的编码与统一的表示空间实现跨模态理解,保持与同尺寸纯文本模型相当的文本能力;1M token 长上下文使其能原生容纳数小时音视频输入,避免分段处理导致的信息割裂。
  • Agentic 按需感知与取证:模型先粗粒度扫描定位候选片段,再细粒度调取相关音画内容进行核对,形成由粗到细的多轮取证链,将计算与 token 预算集中于真正相关的片段。
  • 音视频与 Agent 环境协同:长音视频 Agent 化的瓶颈在于 harness 缺乏原生音视频支持,因此官方以模型 + 工具链协同演进:Qwen-MM-Plugins 提供按需感知、工具调用与工作流执行能力,接入 Claude Code、OpenClaw 等主流 Agent 框架,将素材理解、任务规划、工具执行与结果交付串成完整链路。
  • 多说话人音画协同识别:模型联合建模画面与音频流,利用视觉信息(人物在画面中的出现与开口状态)辅助消解音频中的指代与实体歧义,端到端完成说话人切分、语音转录与身份对齐,这使多人交替发言、声音重叠的会议场景识别指标大幅优化。
  • 实时流式交互架构:Qwen3.8-Omni-Flash-Realtime 通过 WebSocket/WebRTC 接收音视频流,在输入的同时完成感知与响应,首 token 延迟约 600-980ms、音频生成 RTF 约 0.153;口语纠正依赖发音与语义的联合建模,模型在新一轮语音到来时持续更新判断,区分影响理解的错误与自然口音。

微信关注回复“开源”,加入AI开源项目交流群

如何使用Qwen3.8-Omni-Flash

  • 网页直接用:打开千问 AI 平台https://www.qianwenai.com/models/qwen3.8-omni-flash,搜索 qwen3.8-omni-flash,上传视频/音频/图片就能对话。
  • API 调用:申请阿里云 DashScope 的 API Key,用兼容 OpenAI 的接口调用,传图片、音频、视频链接加文字问题即可。
  • 装插件让它干活:在 Claude Code、Qwen Code 等工具里装 Qwen-MM-Plugins,然后像聊天一样说”@视频.mp4 帮我做成解说视频”,AI自动完成全流程。

Qwen3.8-Omni-Flash的核心优势

  • 全模态统一:文本、图像、音频、视频一个模型全搞定,支持 1M 超长上下文,一小时长视频可原生输入。
  • 从理解到交付:不只是”看懂”音视频,还能自主规划、调用工具、产出成片和文档,完成端到端任务。
  • Agent 能力突出:音视频 Agent 基准大幅领先,WildClawBench-MM 较上代提升 36.5 分,长程任务达 UniClawBench 69.6 高分。
  • 音频能力反超 Gemini:60 项语言语音识别、39 种中文方言、多说话人识别指标全面优于 Gemini 3.8 Flash。
  • 效率更高更省:Agentic 取证让长视频理解 token 消耗降低约 45.7%,准确不降反升。
  • 价格大幅降低:API 每小时音频输入降价超 98%,音视频输入降价超 93%,规模化使用成本压力大减。
  • 开源配套完善:Qwen-MM-Plugins 和 Qwen-Live Harness 全部开源,兼容 Claude Code、OpenClaw 等主流 Agent 框架。

Qwen3.8-Omni-Flash的项目地址

  • GitHub仓库
    • Qwen-MM-Plugins: https://github.com/QwenLM/Qwen-MM-Plugins
    • Qwen-Live Harness: https://github.com/QwenLM/Qwen-Live-Harness

Qwen3.8-Omni-Flash的同类竞品对比

对比维度 Qwen3.8-Omni-Flash Gemini 3.8 Flash
上下文窗口 1M token 1M token
音视频理解(OmniVideoBench) 63.4 65.2
长视频推理(LVOmniBench) 63.3 70.7
多说话人识别(AliMeeting DER) 3.4 72.6
多语言ASR(FLEURS WER) 9.3 7.9
中文方言支持 39种方言 明显更少
音视频Agent(WildClawBench-MM) 71.0 58.9
成本 音频输入降价98%+,价格优势大 明显更贵

Qwen3.8-Omni-Flash的应用场景

  • 视频内容生产:输入一句需求,自动完成电影解说、MV 制作、短剧翻译配音的端到端交付。
  • 会议效率工具:上传一小时会议录像,自动生成纪要、待办事项,甚至直接发邮件、建任务。
  • 学习知识沉淀:把几小时教程视频自动压缩成带截图和时间戳的 PDF 笔记。
  • 视频深度研究:针对视频内容自动检索全网图文资料,生成图文并茂的深度研究报告。
  • 实时交互服务:实时口语陪练、智能客服、听声辨位导航等低延迟音视频交互场景。