project
Startlux-Decision - StartLux Labs 开源的决策模型家族
StartLux-Decision 是 StartLux Labs 推出的策模型家族,包含 0.8B 至 27B 五个稠密模型和 35B-A3B 混合专家模型。StartLux-Decision 接收文本、JSON 或图片...
Startlux-Decision是什么
StartLux-Decision 是 StartLux Labs 推出的决策模型家族,包含 0.8B 至 27B 五个稠密模型和 35B-A3B 混合专家模型。StartLux-Decision 接收文本、JSON 或图片形式的状态,针对选择、是非、评分等类型问题,单次前向推理即返回每个选项的概率,可作为置信度使用。模型原生支持 256K token 长上下文,毫秒级延迟,兼容 Jev 的 TypeSafe 客户端格式。
Startlux-Decision的主要功能
-
类型化决策:支持选择题、是非题、评分题三种问题类型,每个问题返回各选项的概率分布。
-
多模态输入:状态可以是文本、JSON 或图片(2026-10-03 更新),证据与图片可作为请求一部分。
-
超长上下文:所有尺寸模型原生支持 262,144 token(256K)提示长度,长状态分块读取一次。
-
置信度输出:概率直接用作置信度,适合需要风险量化的自动化流程。
-
高吞吐低延迟:短问题单次前向仅几毫秒,支持批量推理(batched path)和 CUDA Graphs 加速。
-
全平台部署:提供 GGUF 量化(BF16/Q8_0/Q4_K_M)用于 llama.cpp,Apple Silicon 上可用 MLX 后端。
-
游戏与智能体应用:已验证于网页购物、国际象棋、超级马里奥、星际争霸 II、Doom 等实时决策场景。
-
Jev 生态兼容:请求响应采用 TypeSafe
/v1/systemone格式,为 Jev 编写的客户端可无缝接入。
Startlux-Decision的技术原理
- 单次前向读答案:模型将选项渲染为字母标记,答案从 forward pass 后的选项字母位置直接读出概率,一个请求的所有问题在单次前向中并行完成。
- 线性注意力架构:采用 flash-linear-attention 与 causal-conv1d 快速内核,短请求延迟极低,且服务器在无这些内核的 GPU 上拒绝启动保证性能。
- MoE 分组矩阵乘:35B-A3B 混合专家模型每个 token 仅激活约 3B 参数,专家用 grouped matmul 运行并被 CUDA Graphs 覆盖,延迟约为 27B 稠密模型的一半。
- 长输入分块与分支:256K 长状态按块读取一次,请求中每个问题从其表示分支计算,避免重复编码。
- 概率保真量化:GGUF 的 BF16 与 Q8_0 在 99–100% 的 JevBench 项目上给出与原权重完全相同的决策,说明决策能力对量化高度鲁棒。
微信关注回复“开源”,加入AI开源项目交流群
如何使用Startlux-Decision
-
下载权重:通过
hf download startlux-models/StartLux-Decision-4B --local-dir StartLux-Decision-4B从 Hugging Face 下载。 -
安装依赖:进入模型目录执行
pip install -r requirements.txt。 -
验证内核:运行
python -m startlux_decision.check StartLux-Decision-4B,必须输出 “fast kernels: active”。 -
启动服务:执行
python -m startlux_decision.server --model StartLux-Decision-4B --port 8090启动本地推理服务。 -
发送请求:向
localhost:8090/v1/systemone发送 JSON,包含state和questions(choice / noul / score 类型)。 -
获取结果:响应返回每个问题各选项的概率分布,可直接作为决策置信度使用。
-
GGUF 方式(可选):下载对应 GGUF 仓库后,先启动
llama-server,再运行python -m startlux_decision.gguf_server在 llama.cpp 前提供决策服务。
Startlux-Decision的核心优势
-
概率化决策:每个问题直接返回各选项概率,置信度天然可用,无需额外校准。
-
极快延迟:单次前向即出答案,4B 模型仅 26ms、35B-A3B 仅 52.5ms。
-
全面领先基准:Decision Index 0.2.1 达 63.88,超越 Jev 1.13等所有公开对手。
-
超长上下文:全系列原生支持 256K token 输入,长文档只读一次。
-
多模态证据:所有尺寸均可读取图片作为决策依据。
-
同级全面胜出:从 0.8B 到 35B 每个档位都优于相近规模的竞品模型。
-
Jev 生态兼容:采用 TypeSafe
/v1/systemone格式,为 Jev 编写的客户端零改动接入。
Startlux-Decision的项目地址
- GitHub仓库:https://github.com/StartLuxLabs/Startlux-Decision
- HuggingFace模型库:https://huggingface.co/collections/startlux-models/startlux-decision-6abba92b301b573fa154d493
Startlux-Decision的同类竞品对比
| 对比维度 | StartLux-Decision | Jev |
|---|---|---|
| 产品定位 | 类型化决策模型(0.8B–35B 家族) | 通用决策系统 |
| Decision Index 0.2.1 | 63.88 | 57.91 |
| JevBench public(231 题) | 208 题 | 199 题 |
| 延迟(3 问题单次请求) | 102.3 ms(H200,本机) | 64.0 ms(API 网关);端到端 109.7 ms |
| 上下文长度 | 262,144 token(256K) | 未公开/较短 |
| 图像输入 | 支持(全尺寸) | 未提及 |
| 38 项基准对比 | 31 项胜出 | 7 项胜出 |
| 输出形式 | 每选项概率分布(置信度) | 选项答案 |
| 对战胜率 | 256 局国际象棋 58.4%(+59 Elo) | 41.6% |
| 权重开放 | HF + ModelScope,CC BY-NC 4.0 | 封闭 API |
| 部署方式 | 自托管 + GGUF + MLX | 仅云端 API |
Startlux-Decision的应用场景
-
智能客服分单:输入工单文本或图片,单次请求判断处理团队、加急与否及严重程度,选项概率即置信度。
-
电脑操作自动化:驱动真实浏览器逐步选择控件并判断任务是否完成,已演示自动完成网页下单购物。
-
游戏 AI 决策:单次前向输出走子、建造、射击等动作概率,已验证于国际象棋、星际争霸 II、Doom 等游戏。
-
金融风控与合规:覆盖合同条款核查、金融实体识别与钓鱼邮件甄别,置信度可直接用于风控流程。
-
企业检索与分类:毫秒级延迟完成意图识别、查询分类和 RAG 事实核查,适合高并发业务场景。