project
APUS-OpenJev-v1 - APUS AI Lab 开源的端侧决策大模型
APUS-OpenJev-v1 是 APUS AI Lab 开源的端侧“System 1”决策大模型系列,与 TypeSafe AI 的闭源 Jev 同类,提供 4B、9B 和 35B-A3B 权重,可在浏览器自动化、...
APUS-OpenJev-v1是什么
APUS-OpenJev-v1 是 APUS AI Lab 开源的端侧System 1决策大模型系列,与 TypeSafe AI 的闭源 Jev 同类,提供 4B、9B 和 35B-A3B 权重,可在浏览器自动化、表单填写、流程路由等任务中快速选择下一步操作。模型首创 effort="low/high" 动态计算深度:low 仅运行 16 层并结合候选感知投影,速度快、成本低;high 使用完整深度,准确率更高。
APUS-OpenJev-v1的主要功能
-
候选动作决策:根据任务、页面上下文和候选操作描述,输出下一步业务动作。
-
浏览器自动化:识别按钮、输入框、导航元素等 DOM 信息,辅助 Agent 完成网页操作。
-
业务规则路由:适用于客服工单分流、流程审批、表单提交等业务决策场景。
-
动态计算控制:通过
effort="low/high"在高吞吐和高质量之间切换。 -
表单文本生成:除选择题式决策外,还能生成搜索关键词、输入文本等开放式内容。
-
本地毫秒级部署:支持单卡 GPU 和 vLLM 服务化部署,降低云端 API 延迟与调用成本。
-
多模型规格选择:提供 4B、9B 和 35B-A3B 等版本,分别面向轻量端侧、生产通用和高性能需求。
APUS-OpenJev-v1的技术原理
- 语言原生决策接口:模型把任务目标、上下文和候选操作描述都作为自然语言输入,为候选动作绑定 A、B、C 等紧凑 Token。推理时,模型只需计算这些合法候选 Token 的概率,再由宿主程序映射回具体业务动作。
effort="low/high"动态计算深度:同一套模型权重内置两个决策出口:effort="low"只运行前 16 层 Transformer,并配合候选感知输出投影,用更低算力完成高频常规动作;effort="high"执行完整 32 层推理,适合支付、权限确认等高风险操作。让 Agent 系统根据动作重要性和把握程度动态分配计算资源。- 跨深度联合后训练与自蒸馏:为让浅层出口在减少一半计算量后仍具备可靠判断力,模型对浅层和深层路径同时进行真实标签监督,同时使用深层输出的概率分布作为“软标签”,通过 KL 散度蒸馏给浅层路径。为避免浅层容量不足拖累深层模型,训练还对深层输出施加梯度阻断,使其既能自我优化,能作为浅层路径的教师。
- 候选感知输出投影:传统大模型每生成一个 Token 都要遍历约 24.8 万词表,结构化决策通常只有几个候选动作。直接抽取候选 Token 对应的输出权重行,将矩阵计算从全词表缩小到 K 个候选。在保持候选概率逻辑等价的同时,显著降低输出头的计算量和显存访问开销。
微信关注回复“开源”,加入AI开源项目交流群
如何使用APUS-OpenJev-v1
- 准备环境:安装支持 CUDA 的 PyTorch、Transformers 和
huggingface_hub,并确保本地或服务器拥有足够的 GPU 显存。 - 下载模型:执行
hf download apus-ailab/APUS-OpenJev-v1 --include "9B-3000/*" --local-dir ./APUS-OpenJev-v1下载所需模型目录。 - 进入模型目录:切换到下载好的模型子目录,即可直接使用其中自带的
openjet_runtime推理组件。 - 加载模型:使用
OpenJet.from_pretrained(".", device="cuda:0")将模型加载到指定显卡上。 - 构造决策请求:按照
instructions、state和candidates三个字段输入任务目标、当前上下文及候选操作。 - 执行快速决策:调用
model.decide(request_data, effort="low"),以较低计算成本获得高频常规动作。 - 执行深度决策:调用
model.decide(request_data, effort="high"),获得适合支付、提交等关键动作的完整推理结果。 - 生成工作流文本:对需要填写搜索词或表单内容的场景,调用
model.generate_text()生成具体文本。 - 部署生产服务:运行
python deployment/serve_vllm.py --port 8000,通过 vLLM 启动 OpenAI 兼容接口。
APUS-OpenJev-v1的核心优势
- 决策准确率高:在官方 80 题冻结基准中,9B 版本达到 85%,高于 Jev 商业 API 的 82.5%。
- 响应速度极快:在指定本地 vLLM 部署路径下,9B 的 P50 延迟低至 25.58ms,4B 仅为 18ms。
- 计算资源可动态调节:首创
effort="low/high"模式,可根据动作风险在速度和准确率之间自由切换。 - 高频操作成本更低:
effort="low"只运行 16 层,并采用候选感知输出投影,适合滚动、点击下一步等高频决策。 - 关键动作更可靠:
effort="high"执行完整网络深度,适合支付确认、权限审批等高风险场景。 - 避免输出格式错误:采用语言原生决策接口,将输出约束在预定义候选集合内,消除 JSON 格式幻觉。
- 业务迁移能力强:同一模型可通过自然语言描述适配浏览器操作、客服分流、规则审核等不同任务。
APUS-OpenJev-v1的项目地址
- HuggingFace模型库:https://huggingface.co/apus-ailab/APUS-OpenJev-v1
APUS-OpenJev-v1的同类竞品对比
| 对比维度 | APUS-OpenJev-v1 | Jev |
|---|---|---|
| 产品性质 | APUS AI Lab 开源的“System 1”决策大模型 | TypeSafe AI 推出的商业闭源决策 API |
| 开放程度 | 模型权重、运行时、部署脚本及技术报告开放 | 仅以云端 API 提供服务,核心模型不开源 |
| 模型规格 | 提供 4B、9B 及 35B-A3B 等版本 | 官方未公开完整模型规模和版本细节 |
| 决策准确率 | 9B 在官方 80 题冻结基准中达到 85.00% | 官方 API 同基准结果为 82.50% |
| 响应延迟 | 指定本地部署路径下,9B P50 为 25.58ms | 公网 API 实测 P50 为 280.80ms |
| 计算模式 | 原生支持 effort="low/high" 动态计算深度 |
未公开类似的可调节计算深度机制 |
| 部署方式 | 支持本地、私有算力及 vLLM 服务化部署 | 主要依赖云端 API 调用 |
| 输出方式 | 可输出候选动作,也能生成表单和搜索文本 | 主要面向结构化动作决策,公开信息未明确文本生成能力 |
| 隐私与数据控制 | 数据可完全留在本地或企业私有环境 | 请求需发送至云端,数据控制依赖服务商方案 |
| 成本模式 | 自部署后主要承担硬件和推理成本 | 按商业 API 调用计费,并产生持续订阅或流量成本 |
APUS-OpenJev-v1的应用场景
- 浏览器自动化:根据网页 DOM、按钮和输入框信息,快速决定点击、滚动或跳转等下一步操作。
- 企业流程路由:在审批、工单处理或表单流转中,根据业务规则自动选择提交、退回、转交等处理路径。
- 客服工单分配:结合用户问题、历史信息和候选处理部门,实时判断最合适的客服团队或处理动作。
- 金融与合规审核:对高风险操作使用
effort="high"深度判断,识别异常交易、权限风险或违规数据流向。 - 端侧智能助手:将轻量模型部署在本地设备或私有服务器上,为高频 Agent 任务提供低延迟、保护隐私的决策能力。