AB
AiBoss
project

Startlux-Decision - StartLux Labs 开源的决策模型家族

StartLux-Decision 是 StartLux Labs 推出的策模型家族,包含 0.8B 至 27B 五个稠密模型和 35B-A3B 混合专家模型。StartLux-Decision 接收文本、JSON 或图片...

Startlux-Decision是什么

StartLux-Decision 是 StartLux Labs 推出的决策模型家族,包含 0.8B 至 27B 五个稠密模型和 35B-A3B 混合专家模型。StartLux-Decision 接收文本、JSON 或图片形式的状态,针对选择、是非、评分等类型问题,单次前向推理即返回每个选项的概率,可作为置信度使用。模型原生支持 256K token 长上下文,毫秒级延迟,兼容 Jev 的 TypeSafe 客户端格式。

Startlux-Decision的主要功能

  • 类型化决策:支持选择题、是非题、评分题三种问题类型,每个问题返回各选项的概率分布。
  • 多模态输入:状态可以是文本、JSON 或图片(2026-10-03 更新),证据与图片可作为请求一部分。
  • 超长上下文:所有尺寸模型原生支持 262,144 token(256K)提示长度,长状态分块读取一次。
  • 置信度输出:概率直接用作置信度,适合需要风险量化的自动化流程。
  • 高吞吐低延迟:短问题单次前向仅几毫秒,支持批量推理(batched path)和 CUDA Graphs 加速。
  • 全平台部署:提供 GGUF 量化(BF16/Q8_0/Q4_K_M)用于 llama.cpp,Apple Silicon 上可用 MLX 后端。
  • 游戏与智能体应用:已验证于网页购物、国际象棋、超级马里奥、星际争霸 II、Doom 等实时决策场景。
  • Jev 生态兼容:请求响应采用 TypeSafe /v1/systemone 格式,为 Jev 编写的客户端可无缝接入。

Startlux-Decision的技术原理

  • 单次前向读答案:模型将选项渲染为字母标记,答案从 forward pass 后的选项字母位置直接读出概率,一个请求的所有问题在单次前向中并行完成。
  • 线性注意力架构:采用 flash-linear-attention 与 causal-conv1d 快速内核,短请求延迟极低,且服务器在无这些内核的 GPU 上拒绝启动保证性能。
  • MoE 分组矩阵乘:35B-A3B 混合专家模型每个 token 仅激活约 3B 参数,专家用 grouped matmul 运行并被 CUDA Graphs 覆盖,延迟约为 27B 稠密模型的一半。
  • 长输入分块与分支:256K 长状态按块读取一次,请求中每个问题从其表示分支计算,避免重复编码。
  • 概率保真量化:GGUF 的 BF16 与 Q8_0 在 99–100% 的 JevBench 项目上给出与原权重完全相同的决策,说明决策能力对量化高度鲁棒。

微信关注回复“开源”,加入AI开源项目交流群

如何使用Startlux-Decision

  • 下载权重:通过 hf download startlux-models/StartLux-Decision-4B --local-dir StartLux-Decision-4B 从 Hugging Face 下载。
  • 安装依赖:进入模型目录执行 pip install -r requirements.txt。
  • 验证内核:运行 python -m startlux_decision.check StartLux-Decision-4B,必须输出 “fast kernels: active”。
  • 启动服务:执行 python -m startlux_decision.server --model StartLux-Decision-4B --port 8090 启动本地推理服务。
  • 发送请求:向 localhost:8090/v1/systemone 发送 JSON,包含 state和 questions(choice / noul / score 类型)。
  • 获取结果:响应返回每个问题各选项的概率分布,可直接作为决策置信度使用。
  • GGUF 方式(可选):下载对应 GGUF 仓库后,先启动 llama-server,再运行 python -m startlux_decision.gguf_server 在 llama.cpp 前提供决策服务。

Startlux-Decision的核心优势

  • 概率化决策:每个问题直接返回各选项概率,置信度天然可用,无需额外校准。
  • 极快延迟:单次前向即出答案,4B 模型仅 26ms、35B-A3B 仅 52.5ms。
  • 全面领先基准:Decision Index 0.2.1 达 63.88,超越 Jev 1.13等所有公开对手。
  • 超长上下文:全系列原生支持 256K token 输入,长文档只读一次。
  • 多模态证据:所有尺寸均可读取图片作为决策依据。
  • 同级全面胜出:从 0.8B 到 35B 每个档位都优于相近规模的竞品模型。
  • Jev 生态兼容:采用 TypeSafe /v1/systemone 格式,为 Jev 编写的客户端零改动接入。

Startlux-Decision的项目地址

  • GitHub仓库:https://github.com/StartLuxLabs/Startlux-Decision
  • HuggingFace模型库:https://huggingface.co/collections/startlux-models/startlux-decision-6abba92b301b573fa154d493

Startlux-Decision的同类竞品对比

对比维度 StartLux-Decision Jev
产品定位 类型化决策模型(0.8B–35B 家族) 通用决策系统
Decision Index 0.2.1 63.88 57.91
JevBench public(231 题) 208 题 199 题
延迟(3 问题单次请求) 102.3 ms(H200,本机) 64.0 ms(API 网关);端到端 109.7 ms
上下文长度 262,144 token(256K) 未公开/较短
图像输入 支持(全尺寸) 未提及
38 项基准对比 31 项胜出 7 项胜出
输出形式 每选项概率分布(置信度) 选项答案
对战胜率 256 局国际象棋 58.4%(+59 Elo) 41.6%
权重开放 HF + ModelScope,CC BY-NC 4.0 封闭 API
部署方式 自托管 + GGUF + MLX 仅云端 API

Startlux-Decision的应用场景

  • 智能客服分单:输入工单文本或图片,单次请求判断处理团队、加急与否及严重程度,选项概率即置信度。
  • 电脑操作自动化:驱动真实浏览器逐步选择控件并判断任务是否完成,已演示自动完成网页下单购物。
  • 游戏 AI 决策:单次前向输出走子、建造、射击等动作概率,已验证于国际象棋、星际争霸 II、Doom 等游戏。
  • 金融风控与合规:覆盖合同条款核查、金融实体识别与钓鱼邮件甄别,置信度可直接用于风控流程。
  • 企业检索与分类:毫秒级延迟完成意图识别、查询分类和 RAG 事实核查,适合高并发业务场景。