Bilibili 开源工业级零样本语音克隆模型 IndexTTS-2.5,参数量仅 0.8B,支持中、英、日、西、阿五种语言跨语种迁移。模型重构了推理架构,速度提升 2.28 倍,实时率低至 0.20,同时支持 0.5x 至 2.0x 无级语速调节,提供拼音、CMU 音素和日语假名三种粒度的发音干预。
Bilibili 开源工业级零样本语音克隆模型 IndexTTS-2.5,参数量仅 0.8B,支持中、英、日、西、阿五种语言跨语种迁移。模型重构了推理架构,速度提升 2.28 倍,实时率低至 0.20,同时支持 0.5x 至 2.0x 无级语速调节,提供拼音、CMU 音素和日语假名三种粒度的发音干预。
Manus宣布脱离Meta恢复独立运营。Manus去年12月被Meta用超20亿美元收购,因跨境监管审查,双方重新调整架构。Manus要求部分用户在8月23日前备份数据,8月25日恢复服务,受影响的用户过渡期间不被收取任何费用并提供回归奖励。
腾讯推出Windows端桌面美化工具「小鹅桌面」,以免费无广告为核心卖点切入市场,提供百万级4K超清动态与静态壁纸资源。产品在桌面左上角内置轻量化AI对话窗口,可完成待办备忘与文件搜索。工具面向学生及普通个人用户,与办公向产品WorkBuddy形成错位布局,通过壁纸美化卡位Windows高频桌面场景。
智谱AI旗下 ZCode 全面升级,上线 Goal、Subagents、Remote Control、闲时任务 四大功能。Goal模式支持设定可验收目标后自主拆解、执行并迭代交付复杂任务;Subagents实现多智能体并行协作;Remote Control支持手机/微信远程管控;闲时任务可在低峰时段免积分执行。同时,GLM Coding Plan 额度已统一重置,全员额度全部回满。
Meta 开源300亿参数模型Muse Glimmer。模型专为本地常驻运行设计,通过4-bit量化和DFlash投机解码技术,可在24GB显存设备,如Mac、消费级GPU上流畅运行,支持断网操作、多模态感知、工具调用及代码编写。
OpenAI扩展网络安全防御服务Daybreak,新增Blue与Red两个等级。Blue提供事件响应、恶意软件分析等常规服务;Red包含专为安全测试和漏洞研究训练的新模型GPT-5.6-Cyber。GPT-5.6-Cyber模型目前仅向埃森哲、IBM、CrowdStrike等可信合作伙伴开放。
腾讯混元3D研究团队推出 WorldClaw,基于 Agent 的 3D 开放世界生成框架。框架能将一句开放式文本提示转化为可探索、可编辑的完整 3D 世界,在保持全局地形连贯性的同时,按需为局部区域生成丰富细节。WorldClaw 将地形与每个对象作为独立可编辑实例输出,支持自由视角漫游、对象级编辑及游戏引擎直接接入。
Cloudflare 推出 Kitesurf,专为 AI 智能体打造的云端浏览器,基于 Workers 平台运行,支持浏览网页与填写表单,较 Chromium 更省计算资源显著降低运行成本,同时针对 AI 特性优化上下文窗口与性能表现,防范提示词注入攻击,目前 Kitesurf 处于测试阶段,正式版将在未来推出。
NVIDIA推出Alpamayo 2 Super智能汽车开放模型,基于Cosmos 3 Super Reasoner构建并采用OpenMDW 1.1商业许可,支持商用与微调。模型在LingoQA等辅助驾驶基准测试中排名第一,可输出轨迹规划、因果推理、元动作、自动标注及视觉问答五类结果,决策过程透明可验证。
阿里巴巴推出国内首个一站式AI语音平台CosyVoice Studio,基于自研Qwen-Audio模型,集成语音记录CosyFlow、语音智能体CosyAgent和音频创作CosyCreative三大模块。CosyFlow支持语音转写叠加语义理解并生成结构化文本,CosyAgent可通过自然语言快速创建实时语音交互智能体,CosyCreative支持上传文档生成播客与多角色有声书。
蚂蚁百灵正式推出Ling-3.0-tiny原生混合推理模型,总参数7.9B、每token仅激活1.3B,面向数学推理与端侧部署深度优化。模型原生支持工具调用,可直接驱动浏览器UI与移动设备自动化操作,支持完全本地离线推理。
火山引擎正式上线Seedance 2.5 API,相比2.0在指令遵循、长叙事、真人感及声画质感上大幅提升,原生支持30秒视频直出与最高50个全模态素材参考,兼容十余种语言。模型已在LibTV、奇想AI、TapNow等平台同步上线。
阿里全新一代视频生成模型Wan3.0正式开启公测,同步上线堆友Agent及视频生成模块。模型支持单段30秒视频生成,具备智能时长推荐与视频延长功能;支持文本、图片、视频多模态参考,实现万物皆可生视频;人像刻画千人千面,在角色、道具、声音等维度保持高一致性,视频编辑能力也大幅提升。
OpenAI宣布免费用户与ChatGPT的文字聊天不再受限,默认模型升级为GPT-5.6 Luna,性能优于GPT-5.5 Instant。免费及Go订阅用户还可使用新增思考按钮处理复杂问题,但文件上传、图片生成、语音对话等高算力功能仍受限。付费用户将获得更可靠、简洁的GPT-5.6 Sol及5档思考强度滑块。
阿里全新一代视频生成模型Wan3.0开启公测。模型单次可生成30秒视频,支持连续运镜与一镜到底叙事;在文本、图片、音频、视频四种基础模态之外,首次支持doc、xls、ppt、pdf、md等文档输入,可将办公素材直接转化为教学课件、产品演示等视频。人像追求千人千面,角色、道具、场景、风格一致性显著增强。
腾讯推出AI原生数据分析产品Omega,内测版名为「马尔摩斯(marmos)」,用户通过自然语言可生成完整数据仪表盘,支持持续交互修改、筛选联动与数据动态刷新。产品采用QueryRegistry数据契约与DTBridge运行时架构,叠加多层权限校验与AST只读检查,解决传统AI看板数据凝固与安全问题。
阿里云上线One Key MCP服务,开发者可通过统一的阿里云百炼API Key一键调用所有生态伙伴MCP服务,兼容Qoder、Codex、Claude Code、Cursor等主流Coding Agent,大幅简化多MCP服务的接入、鉴权与计费管理流程。用户可登录阿里云百炼平台,在MCP广场直接使用现有API Key开通并调用相关服务。
Meta 推出首个编程 AI 智能体工具 Muse Code 测试版,由首席 AI 官汪滔领衔开发。模型基于 Muse Spark 1.2 模型,可处理大型代码库中的完整软件工程任务,直接挑战 Anthropic Claude Code 与 OpenAI Codex。
兔展智能推出图层级一站式AI设计工具RabbitVis,基于自研UniWorld-Design视觉大模型,将AI生成与图层级编辑深度融合。产品突破传统AI生图只能生成、难以修改的瓶颈,支持透明素材生成、图像分层拆解与持续编辑,让海报、电商图、杂志内页等设计资产可反复调整与复用。
京东开源自研实时流式视频编辑模型 JoyAI-Video-Edit,支持视频边播边改,在 720P 分辨率下实现每秒 30 帧推理,可处理任意时长视频。模型在 OpenVE-Bench 评测中全面领先 SANA Streaming、LiveEdit 等同类流式模型,编辑质量达到离线模型水平。
Mistral AI 开源多模态内容审核模型 Shieldstral,支持 12 种语言且单张 16GB GPU 可运行。模型在多模态审核领域达到 SOTA,性能媲美 7 倍规模竞品;创新性地将审核策略用自然语言问题形式输入,通过”是/否”问答机制输出校准安全分数,支持提示词分类、回答审核与毒性检测等任务。
字节跳动 Seed 推出原生音视频全双工大模型 SeedRealtime,基于统一架构原生融合音频、视频与文本,实现”边看、边听、边说”的实时多模态交互。模型具备音视频联合理解、主动交互与流畅对话节奏三大核心能力,端到端评测显示对话节奏问题较级联模型减少一半。
阿里巴巴千问图像生成模型Qwen-Image-3.0上线千问AI平台,面向所有用户免费开放。旗舰版Qwen-Image-3.0-Pro与标准版Qwen-Image-3.0-Standard同步开放API。在国际评测平台Arena.ai最新文生图榜单中,模型位列国内第一、全球第五。
腾讯混元推出新一代语音识别模型Hy ASR 3.0 preview,模型基于Hy3大语言模型打造,深度融合语音识别与深度语义理解能力,在中文普通话、英语及粤语等场景的识别准确率均达到业界顶尖水平,具备复杂语境下的智能纠错能力。