阿里推出原生 Computer Use Agent「Qwen-CUA」
阿里 Qwen 团队联合 XLang Lab 推出原生 Computer Use Agent「Qwen-CUA」,基于 397B-A17B 混合专家架构,通过屏幕截图感知界面状态,无需依赖 DOM 树或无障碍元数据,直接输出键盘鼠标事件操控浏览器、桌面及专业软件。模型在 OSWorld-Verified 基准取得 86.2 分,万亿参数 Max 版本达 87.6 分。
阿里 Qwen 团队联合 XLang Lab 推出原生 Computer Use Agent「Qwen-CUA」,基于 397B-A17B 混合专家架构,通过屏幕截图感知界面状态,无需依赖 DOM 树或无障碍元数据,直接输出键盘鼠标事件操控浏览器、桌面及专业软件。模型在 OSWorld-Verified 基准取得 86.2 分,万亿参数 Max 版本达 87.6 分。
帕西尼再获10亿元战略轮融资,累计融资35亿元,创全球触觉感知领域最高纪录。本轮由全球消费电子与半导体万亿级巨头、中银国际投资、鲲鹏基金等联合领投,老股东持续加码。帕西尼以全栈自研具身感知技术为核心,定位Physical AI时代物理交互数据基础设施,年芯片消耗量逼近100万颗,商业化与全球化布局加速推进。
面壁智能联合 OpenBMB 开源 ForgeStencil,全球首个 AI 驱动的 Stencil 全自动优化系统。ForgeStencil由 Kernel Agent 与 App Agent 双智能体协同,实现从算子研究到应用部署的全流程零人工介入。ForgeStencil 一周能完成 100 余个真实工业与科学软件的端到端优化,覆盖油气勘探、电磁仿真、医学影像等 8 大工业领域。
商汤科技开源轻量级原生统一多模态模型SenseNova U1.5-Lite-Preview,基于NEO-Unify架构,用仅8B-MoT参数贯通视觉理解、推理、生成与编辑。模型原生支持4K图像生成,在局部纹理、真实质感、中英文文字排版及复杂视觉指令遵循上显著提升,配套Prompt Enhance Skill降低长篇创作指令的编写门槛。
商汤科技与教育部教育技术与资源发展中心(中央电化教育馆)签署战略合作框架协议,双方将推动AI技术在教育公共服务领域应用,促进教育技术与教学资源深度融合,赋能国家级教育服务平台智能化建设。商汤依托日日新SenseNova大模型体系与SenseCore算力基础设施,已为高校教学科研、K12教案生成等场景提供支撑。
腾讯混元联合清华AIR、东南大学推出 E-Bench 智能体评测基准,以王者荣耀、QQ音乐、腾讯会议为原型,构建含323个改状态任务、7.6万+数据行的全合成虚拟环境。通过信息鸿沟与工具鸿沟设计,防止模型凭记忆抄近道。E-Bench 评测了11个前沿模型平均成功率仅54.56%,最强模型Avg@3为73.79%,Pass³低于60%。
Genspark 创始人景鲲在 AGI Playground 2026 大会上推出 GenOffice,定位为全球首个全功能开源 AI Office 套件。GenOffice客户端面向 Windows 与 Mac,支持文档、表格、幻灯片及 PDF 编辑,免费、无广告且开源。
扩散语言模型厂商西湖心辰近日完成B+轮融资,金额达数亿元,由广发信德领投,西湖创新投、武汉江豚基金等多家机构跟投,58产业基金等产业资本及老股东蚂蚁集团、汤姆猫参与支持。本轮资金将主要用于新一代扩散语言模型研发、原生多模态实时互动产品迭代及海外市场拓展。
MiniMax正式开源新一代通用视频模型 MiniMax H3,支持文本、图像、视频、音频多模态输入,可生成最高2K分辨率、15秒时长、32kHz立体声音频的视频。模型由H3-Context-IR、H3-Base和H3-Regenerate-2K三模块组成,H3-Base已开源并支持SGLang、vLLM等框架本地部署。 稀宇科技
阿里云正式推出Qwen3.8-Max,参数规模达2.4万亿、激活参数95B,支持100万上下文Tokens,在编程、办公、科研及长程任务上全面升级,下周将开源模型权重。模型在Arena文本、代码、视觉三大榜单均位列前三,API定价国内输入12元/百万Tokens。
阿里云内测面向B端的AI办公平台万有无界,平台由多名数字员工组成协作小组,围绕完整项目协同推进任务。万有无界聚焦复杂项目的多智能体协同交付,进一步完善阿里AI办公产品矩阵。实测发现,自由职业者和个体创业者同样能找到适配场景,平台轻量化适配性突出。
李飞飞旗下World Labs收购SceniX,标志着物理AI训练从采集真实数据转向生成虚拟世界。SceniX通过将真实场景重建为可交互的物理孪生资产,围绕几何、材质、布局等属性生成可控变化,将有限真实数据扩展成无限泛化的世界。
DeepSeek通过 API 文档发布日志,宣布DeepSeek-V4-Flash正式版API上线公测。Agent能力大幅增强,多项基准测试得分远超V4-Pro-Preview版本。正式版原生支持Responses API格式,针对Codex进行优化适配。模型结构与Preview版保持一致,仅重新进行后训练。
LibTV与MiniMax联合首发新一代多模态视频模型MiniMax H3,支持5—15秒视频生成、24 FPS输出与原生双声道声音,可统一理解图文音视频,实现从素材参考到成片编辑的一体化创作,面向短剧、广告、影视等商业场景。
腾讯 WorkBuddy (V5.3.5版)联合腾讯文档推出人机双写功能,让用户与 AI 可在同一份文档中实时协同编辑。工具支持框选即改,AI 仅在指定范围内处理内容,兼容 Word、Excel、PPT、Markdown 等主流格式及本地 Office 与腾讯文档,同时支持多人与 AI 共同创作、实时同步。
MiniMax推出通用全模态生成模型MiniMax H3,支持文本、图像、视频与声音的统一理解与生成,可输出15秒2K分辨率原生双声道音视频。模型打破任务与模态边界,在指令遵循、动作迁移及多模态编辑方面表现出色,适用广告、电商、游戏等商业场景。 稀宇科技
智谱GLM Coding Plan重新开放订阅。之前因需求爆发曾限名额,本次回归伴随基础设施扩容,新版采用透明积分制,输入输出及MCP能力均按规则折算,支持周末全天低峰抵扣。老用户权益保留,v1用户到期前可按V2价格续订,同时开放HighSpeed高速版申请。
字节跳动Seed团队推出新一代视频创作模型 Seedance 2.5,单次生成时长从15秒提升至30秒并支持多轮延长,可产出数分钟连贯内容。模型全面升级多模态参考能力,单次最多支持30张图片、10段视频及10段音频作为参考素材,同时新增时间戳精准编辑、绿幕替换、视角调整等专业功能,满足影视与广告创作需求。
阿里通义团队开源Qwen-UI-Agent,以统一框架覆盖手机、电脑、浏览器和DeepSearch任务。项目最初公开于7月30日,并非8月20日当天新发布。
腾讯混元团队开源投机解码框架 AngelSpec,覆盖 drafter 训练、架构设计到线上部署全链路,同步开源 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码。DFly 在 4 至 64 并发取得 SOTA,较自回归基线平均加速 1.98–2.40 倍,代码数学峰值 2.86 倍;D-cut 高并发额外提升吞吐 15.7%,MTP 结合 TTT 将对话接受率从 52.8% 提至 66.4%。
字节跳动启动AI业务组织调整,飞书产品团队并入豆包,由豆包负责人赵祺统筹,飞书负责人谢欣向其汇报。飞书GTM团队与火山引擎整合为创造力服务平台,由谭待负责,统一推进MaaS和SaaS市场。数据显示豆包月活3.82亿,字节大模型ARR已达40亿美元。
Google DeepMind 在 Flow Music 推出新一代 AI 音乐生成模型 Lyria 3.5,实现音乐性、歌词质量、人声表现力与创作控制四项核心升级。模型可生成更自然复杂的旋律,歌词遵循度显著提升,人声情感丰富且发音清晰,支持便捷调节节奏与时长。
月之暗面Kimi完成新一轮融资,筹集35亿美元,估值达350亿美元,并正寻求投前估值约500亿美元的新融资。Kimi在Hugging Face开源K3模型权重,总参数2.8万亿、激活参数1040亿,为全球首个3万亿参数级开源模型。K3基于MoE架构,多家平台已宣布适配,与Claude Sonnet 5标准价持平。
商汤科技推出Seko 3.0,新版本从创作工具跃迁为创作者成长平台,首创AI视频梦工厂,以Agent智能工作流串联无限画布资产沉淀与Skill生态,将头部创作者经验封装为可调用的专业能力,实现体系化影视级生产。