project
Microsoft-Decision-1 - 微软推出的新一代 AI 决策模型
Microsoft-Decision-1是微软推出的新一代快速决策AI模型,专为结构化决策任务设计,可从预设选项中选出最优解并为各备选答案赋予概率评分,供下游应用判断执...
Microsoft-Decision-1是什么
Microsoft-Decision-1是微软推出的新一代快速决策AI模型,专为结构化决策任务设计,可从预设选项中选出最优解并为各备选答案赋予概率评分,供下游应用判断执行、重试或转人工。Microsoft-Decision-1在36项基准测试准确率均列第一,速度达GPT-6 Sol的35倍,输入每百万tokens仅收0.042美元且输出免费。模型基于Qwen3.5-9B构建,已上线Microsoft Foundry。
Microsoft-Decision-1的主要功能
-
最优解选取:从预设选项中选出最优答案,并输出各备选答案的概率评分。
-
路由分发:将请求或任务智能分发至合适的下游模块或服务。
-
内容分类:对文本等内容进行快速归类,如Xbox团队用它分类上万条游戏反馈。
-
任务优先级排序:为多个待处理任务判定处理顺序。
-
结果验证:评估AI生成结果的质量,决定是否通过或重试。
-
工作流控制:作为Agent工作流的编排组件,判断继续执行、重新尝试、升级处理还是转交人工。
Microsoft-Decision-1的技术原理
- 底座架构:Microsoft-Decision-1基于开源的Qwen3.5-9B模型构建,参数规模适中,兼顾推理速度与部署成本,微软计划未来将其迁移至自研MAI:系列及OpenAI模型等其他底座之上。
- 专项后训练:模型经过以”单次决策评分”为核心的专项后训练,针对预设选项的概率化评分,从而将大语言模型改造成结构化的决策引擎。
- 决策机制:模型对每个决策请求一次性完成评分与选择,相比多轮推理的大语言模型大幅降低延迟;官方称连续20个决策各增加100毫秒的累计延迟问题在此架构下被显著压缩。
- 鲁棒性设计:针对决策稳定性做专门优化,在同一请求的8种扰动形式下平均决策翻转率仅1.3%,在选项描述改写或顺序颠倒等场景下翻转率为零,确保输入变化不影响决策一致性。
- 安全对齐:模型经受了涵盖11项基准、5250条请求的安全测试,覆盖有害内容识别、越狱攻击及提示词注入等场景,在拒绝有害请求的同时保持较高的正常任务效用。
如何使用Microsoft-Decision-1
-
接入平台:通过微软旗下的 AI 开发平台 Microsoft Foundry 向开发者开放使用。
-
定义决策场景:将任务转化为”预设选项 + 选择最优解”的结构化决策问题,如路由分发、内容分类、优先级排序等。
-
提交请求:将待决策内容用结构化格式提交给模型。
-
获取概率评分:模型返回最优选项及各备选答案的概率评分,而非开放式文本。
-
驱动下游动作:根据评分结果判断继续执行、重新尝试、升级处理或转交人工审核。
-
嵌入工作流:可无缝嵌入现有应用程序、AI Agent 及工作流系统,作为编排基础组件。
Microsoft-Decision-1的核心优势
-
速度极快:P50 延迟是 GPT-6 Sol 的 35 倍、Quyet-1.0-Large 的 4.5 倍,是实测最快的决策模型。
-
准确率领先:在近 15 万道题目的 36 项基准测试中准确率均排名第一。
-
成本极低:输入每百万 tokens 仅 0.042 美元且输出免费,内部实测分类任务成本较 GPT-6 Sol 降低约 200 倍。
-
决策可评分:为各备选答案输出概率评分,方便下游判断执行、重试或转人工,比”黑盒式”生成更可控。
-
鲁棒性强:8 种扰动下决策翻转率平均仅 1.3%,选项改写/颠倒场景翻转率为零。
-
安全可靠:通过 11 项基准、5250 条请求的安全测试,能拒绝有害请求且保持正常使用效用。
Microsoft-Decision-1的项目地址
- 项目官网:https://commandline.microsoft.com/microsoft-decision-1-model-foundry/
Microsoft-Decision-1的同类竞品对比
| 对比维度 | Microsoft-Decision-1 | Jev(TypeSafe AI) |
|---|---|---|
| 模型品类 | 快速决策模型(结构化决策任务) | 首个 System One 决策模型 |
| 技术底座 | 基于 Qwen3.5-9B 后训练(计划迁移至 MAI/OpenAI 底座) | 自研架构 + 并行采样器,RLCD(校准决策强化学习)训练 |
| 决策速度 | P50 延迟为 GPT-6 Sol 的 35 倍 | 端到端 70–500ms,同任务比 LLM 快 40–200 倍 |
| 准确率 | 36 项基准测试(近15万题)全部第一(微软自测) | JevBench 官方排名第 3(71.49 分),已被广泛实测 |
| 输出形式 | 最优选项 + 各备选答案概率评分 | 带校准概率的类型化答案(Choice/Score/Noul 三种判断) |
| 鲁棒性 | 8 种扰动翻转率 1.3%,选项改写/颠倒场景为零 | 校准性为核心卖点(置信度与准确率对齐) |
| 定价 | 输入 $0.042/百万 tokens,输出免费 | 输入 $0.042/百万 tokens,输出免费 |
| 生态接入 | Microsoft Foundry(OpenRouter 计划中) | 官方 API + SDK,社区生态丰富(路由、分类等开源项目) |
Microsoft-Decision-1的应用场景
-
智能路由分发:将用户请求或任务流量智能分发至最合适的下游服务、模型或 Agent。
-
内容分类与审核:对海量用户反馈、评论进行快速分类和有害内容识别。
-
任务优先级排序:在客服工单、缺陷处理等场景中判定任务处理顺序,实现工作流自动化编排。
-
AI 结果验证:作为 AI 响应评估器,判断生成结果是否合格,决定放行、重试还是升级处理。
-
异常决策与升级:在事故响应、质量控制等场景中,基于概率评分决定是否转交人工审核,构建人机协同的安全兜底机制。