AB
AiBoss站
project

Microsoft-Decision-1 - 微软推出的新一代 AI 决策模型

Microsoft-Decision-1是微软推出的新一代快速决策AI模型,专为结构化决策任务设计,可从预设选项中选出最优解并为各备选答案赋予概率评分,供下游应用判断执...

Microsoft-Decision-1是什么

Microsoft-Decision-1是微软推出的新一代快速决策AI模型,专为结构化决策任务设计,可从预设选项中选出最优解并为各备选答案赋予概率评分,供下游应用判断执行、重试或转人工。Microsoft-Decision-1在36项基准测试准确率均列第一,速度达GPT-6 Sol的35倍,输入每百万tokens仅收0.042美元且输出免费。模型基于Qwen3.5-9B构建,已上线Microsoft Foundry。

Microsoft-Decision-1的主要功能

  • 最优解选取:从预设选项中选出最优答案,并输出各备选答案的概率评分。
  • 路由分发:将请求或任务智能分发至合适的下游模块或服务。
  • 内容分类:对文本等内容进行快速归类,如Xbox团队用它分类上万条游戏反馈。
  • 任务优先级排序:为多个待处理任务判定处理顺序。
  • 结果验证:评估AI生成结果的质量,决定是否通过或重试。
  • 工作流控制:作为Agent工作流的编排组件,判断继续执行、重新尝试、升级处理还是转交人工。

Microsoft-Decision-1的技术原理

  • 底座架构:Microsoft-Decision-1基于开源的Qwen3.5-9B模型构建,参数规模适中,兼顾推理速度与部署成本,微软计划未来将其迁移至自研MAI:系列及OpenAI模型等其他底座之上。
  • 专项后训练:模型经过以”单次决策评分”为核心的专项后训练,针对预设选项的概率化评分,从而将大语言模型改造成结构化的决策引擎。
  • 决策机制:模型对每个决策请求一次性完成评分与选择,相比多轮推理的大语言模型大幅降低延迟;官方称连续20个决策各增加100毫秒的累计延迟问题在此架构下被显著压缩。
  • 鲁棒性设计:针对决策稳定性做专门优化,在同一请求的8种扰动形式下平均决策翻转率仅1.3%,在选项描述改写或顺序颠倒等场景下翻转率为零,确保输入变化不影响决策一致性。
  • 安全对齐:模型经受了涵盖11项基准、5250条请求的安全测试,覆盖有害内容识别、越狱攻击及提示词注入等场景,在拒绝有害请求的同时保持较高的正常任务效用。

如何使用Microsoft-Decision-1

  • 接入平台:通过微软旗下的 AI 开发平台 Microsoft Foundry 向开发者开放使用。
  • 定义决策场景:将任务转化为”预设选项 + 选择最优解”的结构化决策问题,如路由分发、内容分类、优先级排序等。
  • 提交请求:将待决策内容用结构化格式提交给模型。
  • 获取概率评分:模型返回最优选项及各备选答案的概率评分,而非开放式文本。
  • 驱动下游动作:根据评分结果判断继续执行、重新尝试、升级处理或转交人工审核。
  • 嵌入工作流:可无缝嵌入现有应用程序、AI Agent 及工作流系统,作为编排基础组件。

Microsoft-Decision-1的核心优势

  • 速度极快:P50 延迟是 GPT-6 Sol 的 35 倍、Quyet-1.0-Large 的 4.5 倍,是实测最快的决策模型。
  • 准确率领先:在近 15 万道题目的 36 项基准测试中准确率均排名第一。
  • 成本极低:输入每百万 tokens 仅 0.042 美元且输出免费,内部实测分类任务成本较 GPT-6 Sol 降低约 200 倍。
  • 决策可评分:为各备选答案输出概率评分,方便下游判断执行、重试或转人工,比”黑盒式”生成更可控。
  • 鲁棒性强:8 种扰动下决策翻转率平均仅 1.3%,选项改写/颠倒场景翻转率为零。
  • 安全可靠:通过 11 项基准、5250 条请求的安全测试,能拒绝有害请求且保持正常使用效用。

Microsoft-Decision-1的项目地址

  • 项目官网:https://commandline.microsoft.com/microsoft-decision-1-model-foundry/

Microsoft-Decision-1的同类竞品对比

对比维度 Microsoft-Decision-1 Jev(TypeSafe AI)
模型品类 快速决策模型(结构化决策任务) 首个 System One 决策模型
技术底座 基于 Qwen3.5-9B 后训练(计划迁移至 MAI/OpenAI 底座) 自研架构 + 并行采样器,RLCD(校准决策强化学习)训练
决策速度 P50 延迟为 GPT-6 Sol 的 35 倍 端到端 70–500ms,同任务比 LLM 快 40–200 倍
准确率 36 项基准测试(近15万题)全部第一(微软自测) JevBench 官方排名第 3(71.49 分),已被广泛实测
输出形式 最优选项 + 各备选答案概率评分 带校准概率的类型化答案(Choice/Score/Noul 三种判断)
鲁棒性 8 种扰动翻转率 1.3%,选项改写/颠倒场景为零 校准性为核心卖点(置信度与准确率对齐)
定价 输入 $0.042/百万 tokens,输出免费 输入 $0.042/百万 tokens,输出免费
生态接入 Microsoft Foundry(OpenRouter 计划中) 官方 API + SDK,社区生态丰富(路由、分类等开源项目)

Microsoft-Decision-1的应用场景

  • 智能路由分发:将用户请求或任务流量智能分发至最合适的下游服务、模型或 Agent。
  • 内容分类与审核:对海量用户反馈、评论进行快速分类和有害内容识别。
  • 任务优先级排序:在客服工单、缺陷处理等场景中判定任务处理顺序,实现工作流自动化编排。
  • AI 结果验证:作为 AI 响应评估器,判断生成结果是否合格,决定放行、重试还是升级处理。
  • 异常决策与升级:在事故响应、质量控制等场景中,基于概率评分决定是否转交人工审核,构建人机协同的安全兜底机制。