AB
AiBoss
project

LLM2Jev - 把本地大模型改造成 Jev 风格结构化决策模型

LLM2Jev 是一个独立开源项目,目标是让本地文本与视觉语言模型以 Jev 风格的结构化方式做决策:只做 prefill、从 logits 直接算概率并组装结果,不逐 token 解码。它支持 SGLang、Transformers 与 Apple Silicon 上的 MLX 后端,可通过 Python API 或 HTTP 服务调用,并支持文本与图像混合输入。

LLM2Jev 是一个把本地语言模型改造成 Jev 风格结构化决策模型的开源项目。按项目自述,它的核心思路是「只做 prefill」:在 prefill 阶段直接从 logits 计算概率并组装结果,不需要逐 token 解码,从而在文本和图像输入上拿到决策结果。它面向的是需要在本地跑模型、又希望以结构化方式(例如选项、打分、候选比较)获得输出的开发者,尤其是手上有 NVIDIA GPU 或 Apple Silicon 机器、愿意自己部署推理后端的人。

维护者与状态

项目由 Yinsongxu 维护,仓库创建于 2026-09-19,最后一次提交在 2026-09-26。截至 2026-10-04,仓库获得 390 个星标。事实表显示该项目尚无正式 release,也就是说目前没有可引用的版本号发布记录,使用时应以仓库当前代码为准。

项目自述中强调,LLM2Jev 是一个独立开源项目,与 Jev 或 TypeSafe 没有隶属关系,也未获得其背书。

主要能力

以下能力来自项目 README 的自述,属于维护者视角的描述:

  • 多后端支持:项目自述可在 SGLang、Transformers,以及 Apple Silicon 上的 MLX 上运行本地文本与视觉语言模型,调用方式包括 Python API 和 HTTP 服务。
  • 仅 prefill 的推理路径:据项目说明,它在 prefill 阶段从 logits 计算概率并直接组装结果,不进行逐 token 解码。
  • 多模态输入:README 称可以在 state 或 instructions 中组合文本与图像,支持 SGLang、Transformers 与 MLX-VLM。
  • 冷请求下的前缀复用:项目自述通过分阶段提交候选来复用 SGLang 的 Radix Cache,即使首个请求没有任何相关缓存前缀也能受益。同一问题下的候选共享 state,同一问题的候选还共享其 instructions。SGLang 后端会先对一个真实的 criteria 候选打分以建立前缀缓存,再提交可复用该缓存的候选;每个候选只打一次分,从而减少长输入、多候选场景下的重复计算。MLX 后端则在给候选后缀打分前显式 prefill 共享前缀。两种后端保持同一套二值打分接口。
  • HTTP 服务:据项目说明,提供了兼容的 POST /v1/systemone 端点,以及兼容 System One 的 HTTP 服务。
  • 示例与演示:README 提到 Web 演示、Snake 演示与 MuJoCo pick-and-place 演示,用于组合混合问题并观察模型驱动的决策。

使用入口

仓库地址:LLM2Jev。

据项目 README 的 Quick Start,在 Linux 且配有受支持的 NVIDIA GPU 的环境下,可以通过 SGLang 跑本地模型:

git clone https://github.com/Yinsongxu/LLM2Jev.git
cd LLM2Jev
uv sync --extra sglang
source .venv/bin/activate
python examples/sglang_inference.py --model-path /path/to/model

项目自述称,该示例会提交 Choice、Score 与 Noul 三类问题,并以 JSON 打印响应;/path/to/model 需替换为本地 Hugging Face 兼容的因果语言模型目录。图像服务相关用法见其多模态输入文档。安装方面,README 指向 Installation 页面,其中列出环境要求、SGLang、Transformers 与 MLX 依赖,以及 uv 或 pip 的安装方式;完整示例见 Usage 指南,涵盖离线 Python API、Apple Silicon 上的 MLX 后端、在线 HTTP 服务、staged 与 all 的选择,以及多模态输入。测试可用 python -m unittest discover -s tests -v 运行。

许可与限制

许可证为 Apache-2.0。

关于边界与前置条件,项目自述提到:SGLang 路径需要 Linux 与受支持的 NVIDIA GPU;MLX 后端面向 Apple Silicon;模型需为本地 Hugging Face 兼容的因果语言模型目录。性能收益并非固定值,README 明确说明收益取决于输入长度、候选数量与缓存状态。

项目自述中给出的 JevBench 公开集测试覆盖 231 条公开条目,LLM2Jev 配 Qwen3.5-4B 测得 76.2% 准确率,记录的延迟为 P50 48 ms / P95 346 ms,而 Jev 1.13.0 的数值为 P50 652 ms / P95 722 ms。这些数字来自维护者自己的报告,本站未做独立复现,引用时请以项目仓库中的报告与复现命令为准。此外,README 的 Roadmap 中仍有多项未完成,包括覆盖更多模型规模、数据集与工作负载的基准测试,以及更多多模态任务与演示。