AB
AiBoss站
project

Laya - 开源的非自回归 AI 决策模型,Jev 开源平替

Laya 是开源的非自回归AI决策模型。模型不做文本生成,基于 ModernBERT/mmBERT 双向编码器,对一段文本加类型化问题只做一次前向传播,约 33ms 输出结构化结...

Laya是什么

Laya 是开源的非自回归AI决策模型,模型不做文本生成,基于 ModernBERT/mmBERT 双向编码器,对一段文本加类型化问题只做一次前向传播,约 33ms 输出结构化结果与校准概率。模型内置语言路由支持 100+ 语言。相比闭源模型Jev,Laya在准确率(76.6% vs 72.7%)、多语言支持(100+语言)和成本(本地部署免费)上更具优势。

Laya的主要功能

  • 单次前向决策:输入一段状态加一组类型化问题,一次前向传播直接返回结构化结果,不做文本生成,约 33ms。
  • 三种决策原语:choice 从候选项中选一个并给出各项概率;score 在有序量表上打分并给出分布;noul 回答是非问题并返回 0–1 的成立概率。
  • 语言自动路由:Router 在 <0.5ms 内检测输入脚本与语言,自动分发到英文或多语言 checkpoint,避免选错模型导致”自信地答错”。
  • 置信度门控:概率经 RLCD 训练具备统计意义,可按阈值把高置信决策自动放行、低置信转人工。
  • 内置工作流预设:提供模型路由、提示注入防护、内容安全审核、工单分诊等预置问题模板,开箱即用。
  • 本地微调:附带 Kaggle notebook,支持用自有数据完成造数据、RLCD 训练、温度拟合、评测的完整微调流程。

Laya的技术原理

  • 双向非自回归架构:基于 ModernBERT-large(421M)或 mmBERT-base(322M)双向编码器,输入 token 同时可见前后文;推理时不逐字生成文本,而是为每个候选选项分配独立 [MASK] 位,一次前向输出所有选项的 logits,经 Softmax 归一化为概率分布——这是 33ms 级延迟的来源。
  • RLCD 强化学习训练:以对数评分、球面评分、等级概率评分等严格真评分规则作为奖励,模型只有在输出真实后验概率时才能获得高分,不确定时置信度自然降低,避免传统大模型”盲目自信”的问题。
  • 语言路由机制:Router 在 forward 之前用纯 Python 检测 Unicode 字符集与语言,据此选择 checkpoint;因为英文 checkpoint 在非拉丁文字上会以 0.95 置信度给出 0 准确率的答案,置信度本身无法预警,所以路由决策必须在推理前完成。
  • 概率校准:出厂 checkpoint 存在过度自信,需按(问题类型、选项数)在自有数据上拟合温度;拟合后平均 ECE 可从 0.466 降至 0.081,此时概率才可直接用于自动放行决策。

微信关注回复“开源”,加入AI开源项目交流群

如何使用Laya

  • 安装pip install laya,PyPI 包,两天内从 0.1.0 更到 0.3.4,注意接口仍在变动。
  • 加载模型Router(preload=True) 预加载三个 checkpoint,避免冷启动时每次切语言重建模型。
  • 准备状态:把要分析的文本组装成 dict,如 {"from": ..., "subject": ..., "body": ...},支持任意语言或 JSON 结构。
  • 定义问题:用 JSON 写一组类型化问题,指定 type(choice / score / noul)、instructions 和 criteria(选项或量表)。
  • 执行预测:调用 router.predict(state, questions),一次前向传播返回所有答案,英文走 laya、 Hindi 等自动走 multilingual。
  • 读取结果:从 res["answers"] 取 choice 标签、score 分值或 noul 概率,res["routing"] 会解释为什么选了这个 checkpoint。
  • 置信度门控:对 confidence 设阈值(如 0.85),高置信自动处理、低置信转人工——但前提是先在自己的数据上做过温度拟合。

Laya的核心优势

  • 极速推理:单次前向传播约 33ms(T4),批量低至 7.2ms/题,比闭源的 TypeSafe Jev 快约 7.8 倍。
  • 零幻觉风险:不生成文本、只输出结构化决策,没有解析负担,也不存在编造内容的问题。
  • 概率可校准:经 RLCD 严格真评分规则训练,置信度有统计意义,可直接驱动自动放行/人工复核流程。
  • 校准精度领先:温度拟合后 ECE 仅 0.081,优于 Jev 的 0.246,typed-decisions 准确率 0.766 也超过 Jev 的 0.727。
  • 多语言路由:内置 Router 亚毫秒级识别 100+ 语言并自动选 checkpoint,避免英文模型在非拉丁文字上”自信地答错”。
  • 完全开源零成本:Apache-2.0 协议、权重开放、可自托管,对比 Jev 的 $0.042/百万 token API 费用,长期使用成本为零。
  • 输出类型化:choice / score / noul 三种原语覆盖分类、打分、是非判断绝大多数结构化决策场景。

Laya的项目地址

  • GitHub仓库:https://github.com/NandhaKishorM/laya
  • HuggingFace模型库:https://huggingface.co/convaiinnovations/laya

Laya的同类竞品对比

维度 Laya(开源) TypeSafe Jev
协议/权重 Apache-2.0,权重完全开放 闭源,仅 API 调用
延迟(单题) 32.8 ms(T4 实测) 236–276 ms p50(第三方实测)
typed-decisions 准确率 0.766(微调版) 0.727
ECE 校准误差 0.081(温度拟合后) 0.246
Banking77 高基数分类 0.425(77 选项,弱) 0.870(72 选项,强)
语言覆盖 100+ 语言,Router 自动分发 无公开多语言基准
成本 自托管 $0 $0.042 / 1M tokens
数据隐私 可完全本地跑,数据不出境 需上传至第三方 API
软分布匹配(soft acc) 0.471 0.580(更贴合教师分布)
开箱即用性 基础模型零样本接近随机,需微调 商用 API,默认即可用

Laya的应用场景

  • 客服工单自动分诊:判断部门归属(billing/technical/sales)、紧急程度、用户挫败感和流失风险,高置信自动派单、低置信转人工。
  • 内容安全与审核:检测毒性、骚扰、威胁内容,noul 原语输出违规概率,适合社区和 UGC 平台实时审核。
  • 提示注入防护(Guardrails):在 Agent 系统入口检测越狱、注入、密钥泄露等攻击,33ms 级延迟可嵌入每次请求链路。
  • 智能模型路由:在混合大模型架构中判断请求该走小模型还是前沿模型,用极低成本完成调度决策,节省推理费用。