AB
AiBoss站
project

Qwen 3.8-Max - 阿里云 Qwen 团队推出的旗舰大模型

Qwen 3.8-Max 是阿里云 Qwen 团队推出的旗舰大模型,总参数量达 2.4 万亿,基于 Qwen 3.5 架构扩展而成。作为 Qwen 家族迄今最强大的模型,是首个即将开源权...

Qwen 3.8-Max是什么

Qwen 3.8-Max 是阿里云 Qwen 团队推出的旗舰大模型,总参数量达 2.4 万亿,基于 Qwen 3.5 架构扩展而成。作为 Qwen 家族迄今最强大的模型,是首个即将开源权重的 Max 级别模型。模型在编程、办公、科研及长程任务上实现全面升级,支持通过千问AI平台 API 调用,兼容 OpenAI 与 Anthropic 协议,可无缝集成至 Claude Code、Codex、Qoder 等主流智能体框架。

Qwen 3.8-Max的主要功能

  • 长程自动编程:支持十天级自主编程,构建自进化 harness 并完成需求收集、issue 派发、代码生成与自我修复。
  • 论文复现与超越:独立复现论文实验后,通过四轮自我进化循环测试 18 种改进想法,在 AIME24 上超越原方法 2.7 分。
  • 竞赛实战:24 小时内独立搭建并迭代方案,准确率从 0.60 升至 0.853,击败 87% 的人类参赛队伍。
  • 办公提效:覆盖数百种高价值职业场景,如律师一小时标出 1,284 条条款、设计师一次成型 8 页可交互原型。
  • 量化策略研发:从单句描述出发调度约 330 个子智能体,完成约 6,000 次回测,交付端到端 ETF 轮动策略。
  • 芯片自主设计:历经约 500 轮交互,将密码加速器网表门数从 8,298 优化至 678,面积缩减 81% 并实现时序闭合。

Qwen 3.8-Max的技术原理

  • 架构扩展:基于 Qwen 3.5 架构基础扩展而成,总参数量达 2.4 万亿,激活参数 95B,在保持架构继承性的同时实现规模跃升。
  • 真实世界强化学习系统:通过联合扩展 RL 环境数量与训练算力提升通用工作能力,核心解决三个耦合挑战:在任务、工作空间、Harness三个维度上解耦合,使环境数以组合方式自然增长;构建统一奖励系统,将基于执行的校验、文本及渲染后视觉输出的 rubric 评估、agentic 检查统一内化,消除任务专用验证器的不一致性;构建在线数据均衡器,对每个 batch 在任务、难度、工作区与 harness 上重构均衡分布,降低梯度方差,支撑训练算力稳定持续扩展。
  • 自进化反馈闭环:模型通过执行-反馈-迭代的自适应机制推进优化,在数百至数千轮交互中保持高度连贯的系统性策略,依赖仿真、综合、布局等反馈闭环,实现算法级数据通路重构而非浅层语法微调。
  • 动态工作流编排:用编程方式驱动任务规划,将编排逻辑固化为可复现程序,支持从单链路连贯研发到大规模并行探索的灵活切换,使复杂任务的串行推进转化为一次对话内可规模化交付的自动化闭环。

如何使用Qwen 3.8-Max

  • 千问AI平台调用:注册账号获取 API Key,通过兼容 OpenAI或 Anthropic 协议的接口直接调用模型。
  • 调节推理深度:通过 reasoning_effort 参数设置 xhigh(默认,深度分析)、medium(平衡)或 low(高效推理),按需控制成本与性能。
  • 集成智能体框架:配置 API Key 与 Base URL 后,可接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流编程助手与 Agent 框架。
  • 开源权重部署:下周起从 Hugging Face 或 ModelScope 下载模型权重,进行本地部署与二次开发。

Qwen 3.8-Max 的核心优势

  • 超长程自主执行:可连续专注数天至数十天,通过执行-反馈-迭代闭环自我进化,全程无需人工介入。
  • 真实世界 RL 训练:联合扩展环境数量与训练算力,在 QwenWork、Claude Code、Codex、OpenClaw、Hermes 等 harness 上表现均衡且持续提升。
  • 端到端交付能力:通过动态工作流将编排逻辑固化为可复现程序,把原本需数周串行推进的复杂任务压缩为一次对话内可规模化交付的自动化闭环。

Qwen 3.8-Max 的项目地址

  • 项目官网:https://qwen.ai/blog?id=qwen3.8

Qwen 3.8-Max 的同类竞品对比

维度 Qwen 3.8-Max GPT 5.6 Sol
论文复现 PaperBench 93.0 分,独立复现后自我进化超越原文 PaperBench 90.5 分
软件工程 SWE-bench Pro 67.7 分,FrontierSWE 73.5 分 SWE-bench Pro 64.6 分,FrontierSWE 无官方数据
终端编码 Terminal Bench 2.1 86.6 分 Terminal Bench 2.1 88.8 分
通用办公 CoWorkBench 74.8 分,JobBench 53.4 分 CoWorkBench 71.5 分,JobBench 45.4 分
多模态推理 MMMU-Pro 82.3 分,BabyVision 82.0 分 MMMU-Pro 83.0 分,BabyVision 65.5 分
视觉智能体 OSWorld-Verified 86.1 分,AndroidWorld 85.3 分 OSWorld-Verified 83.2 分,AndroidWorld 77.6 分
视频理解 VideoMME 90.4 分,MLVU 90.8 分 VideoMME 89.5 分,MLVU 87.6 分
长程任务 365 天电商模拟 4.16 倍回报,芯片设计 500 轮优化 无公开同类长程自主任务数据

Qwen 3.8-Max 的应用场景

  • 法律合规审查:单次通读数百份文档,一小时内标出上千条相关条款,替代法务团队约一周工作量。
  • UI/UX 原型设计:为数字银行 App 一次生成 8 页高保真可交互原型,无需人工返修。
  • 餐饮菜单开发:基于上百份食材资料一次性产出 26 道菜的完整菜单,控制食材成本率在 33.8%。
  • 结构工程建模:仅凭一份图纸在浏览器中还原 30 层写字楼抗震结构模型,支持实时悬停查看关键指标。
  • 康复医学可视化:将 2D 纸质评估单转化为可自由旋转、逐层浮现的 3D 交互演示,帮助患者理解康复路径。