project
Laya - 开源的非自回归 AI 决策模型,Jev 开源平替
Laya 是开源的非自回归AI决策模型。模型不做文本生成,基于 ModernBERT/mmBERT 双向编码器,对一段文本加类型化问题只做一次前向传播,约 33ms 输出结构化结...
Laya是什么
Laya 是开源的非自回归AI决策模型,模型不做文本生成,基于 ModernBERT/mmBERT 双向编码器,对一段文本加类型化问题只做一次前向传播,约 33ms 输出结构化结果与校准概率。模型内置语言路由支持 100+ 语言。相比闭源模型Jev,Laya在准确率(76.6% vs 72.7%)、多语言支持(100+语言)和成本(本地部署免费)上更具优势。
Laya的主要功能
-
单次前向决策:输入一段状态加一组类型化问题,一次前向传播直接返回结构化结果,不做文本生成,约 33ms。
-
三种决策原语:choice 从候选项中选一个并给出各项概率;score 在有序量表上打分并给出分布;noul 回答是非问题并返回 0–1 的成立概率。
-
语言自动路由:Router 在 <0.5ms 内检测输入脚本与语言,自动分发到英文或多语言 checkpoint,避免选错模型导致”自信地答错”。
-
置信度门控:概率经 RLCD 训练具备统计意义,可按阈值把高置信决策自动放行、低置信转人工。
-
内置工作流预设:提供模型路由、提示注入防护、内容安全审核、工单分诊等预置问题模板,开箱即用。
-
本地微调:附带 Kaggle notebook,支持用自有数据完成造数据、RLCD 训练、温度拟合、评测的完整微调流程。
Laya的技术原理
- 双向非自回归架构:基于 ModernBERT-large(421M)或 mmBERT-base(322M)双向编码器,输入 token 同时可见前后文;推理时不逐字生成文本,而是为每个候选选项分配独立 [MASK] 位,一次前向输出所有选项的 logits,经 Softmax 归一化为概率分布——这是 33ms 级延迟的来源。
- RLCD 强化学习训练:以对数评分、球面评分、等级概率评分等严格真评分规则作为奖励,模型只有在输出真实后验概率时才能获得高分,不确定时置信度自然降低,避免传统大模型”盲目自信”的问题。
- 语言路由机制:Router 在 forward 之前用纯 Python 检测 Unicode 字符集与语言,据此选择 checkpoint;因为英文 checkpoint 在非拉丁文字上会以 0.95 置信度给出 0 准确率的答案,置信度本身无法预警,所以路由决策必须在推理前完成。
- 概率校准:出厂 checkpoint 存在过度自信,需按(问题类型、选项数)在自有数据上拟合温度;拟合后平均 ECE 可从 0.466 降至 0.081,此时概率才可直接用于自动放行决策。
微信关注回复“开源”,加入AI开源项目交流群
如何使用Laya
- 安装:
pip install laya,PyPI 包,两天内从 0.1.0 更到 0.3.4,注意接口仍在变动。 - 加载模型:
Router(preload=True)预加载三个 checkpoint,避免冷启动时每次切语言重建模型。 - 准备状态:把要分析的文本组装成 dict,如
{"from": ..., "subject": ..., "body": ...},支持任意语言或 JSON 结构。 - 定义问题:用 JSON 写一组类型化问题,指定 type(choice / score / noul)、instructions 和 criteria(选项或量表)。
- 执行预测:调用
router.predict(state, questions),一次前向传播返回所有答案,英文走 laya、 Hindi 等自动走 multilingual。 - 读取结果:从
res["answers"]取 choice 标签、score 分值或 noul 概率,res["routing"]会解释为什么选了这个 checkpoint。 - 置信度门控:对
confidence设阈值(如 0.85),高置信自动处理、低置信转人工——但前提是先在自己的数据上做过温度拟合。
Laya的核心优势
-
极速推理:单次前向传播约 33ms(T4),批量低至 7.2ms/题,比闭源的 TypeSafe Jev 快约 7.8 倍。
-
零幻觉风险:不生成文本、只输出结构化决策,没有解析负担,也不存在编造内容的问题。
-
概率可校准:经 RLCD 严格真评分规则训练,置信度有统计意义,可直接驱动自动放行/人工复核流程。
-
校准精度领先:温度拟合后 ECE 仅 0.081,优于 Jev 的 0.246,typed-decisions 准确率 0.766 也超过 Jev 的 0.727。
-
多语言路由:内置 Router 亚毫秒级识别 100+ 语言并自动选 checkpoint,避免英文模型在非拉丁文字上”自信地答错”。
-
完全开源零成本:Apache-2.0 协议、权重开放、可自托管,对比 Jev 的 $0.042/百万 token API 费用,长期使用成本为零。
-
输出类型化:choice / score / noul 三种原语覆盖分类、打分、是非判断绝大多数结构化决策场景。
Laya的项目地址
- GitHub仓库:https://github.com/NandhaKishorM/laya
- HuggingFace模型库:https://huggingface.co/convaiinnovations/laya
Laya的同类竞品对比
| 维度 | Laya(开源) | TypeSafe Jev |
|---|---|---|
| 协议/权重 | Apache-2.0,权重完全开放 | 闭源,仅 API 调用 |
| 延迟(单题) | 32.8 ms(T4 实测) | 236–276 ms p50(第三方实测) |
| typed-decisions 准确率 | 0.766(微调版) | 0.727 |
| ECE 校准误差 | 0.081(温度拟合后) | 0.246 |
| Banking77 高基数分类 | 0.425(77 选项,弱) | 0.870(72 选项,强) |
| 语言覆盖 | 100+ 语言,Router 自动分发 | 无公开多语言基准 |
| 成本 | 自托管 $0 | $0.042 / 1M tokens |
| 数据隐私 | 可完全本地跑,数据不出境 | 需上传至第三方 API |
| 软分布匹配(soft acc) | 0.471 | 0.580(更贴合教师分布) |
| 开箱即用性 | 基础模型零样本接近随机,需微调 | 商用 API,默认即可用 |
Laya的应用场景
- 客服工单自动分诊:判断部门归属(billing/technical/sales)、紧急程度、用户挫败感和流失风险,高置信自动派单、低置信转人工。
- 内容安全与审核:检测毒性、骚扰、威胁内容,noul 原语输出违规概率,适合社区和 UGC 平台实时审核。
- 提示注入防护(Guardrails):在 Agent 系统入口检测越狱、注入、密钥泄露等攻击,33ms 级延迟可嵌入每次请求链路。
- 智能模型路由:在混合大模型架构中判断请求该走小模型还是前沿模型,用极低成本完成调度决策,节省推理费用。