AB
AiBoss站
project

APUS-OpenJev-v1 - APUS AI Lab 开源的端侧决策大模型

APUS-OpenJev-v1 是 APUS AI Lab 开源的端侧“System 1”决策大模型系列,与 TypeSafe AI 的闭源 Jev 同类,提供 4B、9B 和 35B-A3B 权重,可在浏览器自动化、...

APUS-OpenJev-v1是什么

APUS-OpenJev-v1 是 APUS AI Lab 开源的端侧System 1决策大模型系列,与 TypeSafe AI 的闭源 Jev 同类,提供 4B、9B 和 35B-A3B 权重,可在浏览器自动化、表单填写、流程路由等任务中快速选择下一步操作。模型首创 effort="low/high" 动态计算深度:low 仅运行 16 层并结合候选感知投影,速度快、成本低;high 使用完整深度,准确率更高。

APUS-OpenJev-v1的主要功能

  • 候选动作决策:根据任务、页面上下文和候选操作描述,输出下一步业务动作。
  • 浏览器自动化:识别按钮、输入框、导航元素等 DOM 信息,辅助 Agent 完成网页操作。
  • 业务规则路由:适用于客服工单分流、流程审批、表单提交等业务决策场景。
  • 动态计算控制:通过 effort="low/high" 在高吞吐和高质量之间切换。
  • 表单文本生成:除选择题式决策外,还能生成搜索关键词、输入文本等开放式内容。
  • 本地毫秒级部署:支持单卡 GPU 和 vLLM 服务化部署,降低云端 API 延迟与调用成本。
  • 多模型规格选择:提供 4B、9B 和 35B-A3B 等版本,分别面向轻量端侧、生产通用和高性能需求。

APUS-OpenJev-v1的技术原理

  • 语言原生决策接口:模型把任务目标、上下文和候选操作描述都作为自然语言输入,为候选动作绑定 A、B、C 等紧凑 Token。推理时,模型只需计算这些合法候选 Token 的概率,再由宿主程序映射回具体业务动作。
  • effort="low/high" 动态计算深度:同一套模型权重内置两个决策出口:effort="low" 只运行前 16 层 Transformer,并配合候选感知输出投影,用更低算力完成高频常规动作;effort="high" 执行完整 32 层推理,适合支付、权限确认等高风险操作。让 Agent 系统根据动作重要性和把握程度动态分配计算资源。
  • 跨深度联合后训练与自蒸馏:为让浅层出口在减少一半计算量后仍具备可靠判断力,模型对浅层和深层路径同时进行真实标签监督,同时使用深层输出的概率分布作为“软标签”,通过 KL 散度蒸馏给浅层路径。为避免浅层容量不足拖累深层模型,训练还对深层输出施加梯度阻断,使其既能自我优化,能作为浅层路径的教师。
  • 候选感知输出投影:传统大模型每生成一个 Token 都要遍历约 24.8 万词表,结构化决策通常只有几个候选动作。直接抽取候选 Token 对应的输出权重行,将矩阵计算从全词表缩小到 K 个候选。在保持候选概率逻辑等价的同时,显著降低输出头的计算量和显存访问开销。

微信关注回复“开源”,加入AI开源项目交流群

如何使用APUS-OpenJev-v1

  • 准备环境:安装支持 CUDA 的 PyTorch、Transformers 和 huggingface_hub,并确保本地或服务器拥有足够的 GPU 显存。
  • 下载模型:执行 hf download apus-ailab/APUS-OpenJev-v1 --include "9B-3000/*" --local-dir ./APUS-OpenJev-v1 下载所需模型目录。
  • 进入模型目录:切换到下载好的模型子目录,即可直接使用其中自带的 openjet_runtime 推理组件。
  • 加载模型:使用 OpenJet.from_pretrained(".", device="cuda:0") 将模型加载到指定显卡上。
  • 构造决策请求:按照 instructions、state 和 candidates 三个字段输入任务目标、当前上下文及候选操作。
  • 执行快速决策:调用 model.decide(request_data, effort="low"),以较低计算成本获得高频常规动作。
  • 执行深度决策:调用 model.decide(request_data, effort="high"),获得适合支付、提交等关键动作的完整推理结果。
  • 生成工作流文本:对需要填写搜索词或表单内容的场景,调用 model.generate_text() 生成具体文本。
  • 部署生产服务:运行 python deployment/serve_vllm.py --port 8000,通过 vLLM 启动 OpenAI 兼容接口。

APUS-OpenJev-v1的核心优势

  • 决策准确率高:在官方 80 题冻结基准中,9B 版本达到 85%,高于 Jev 商业 API 的 82.5%。
  • 响应速度极快:在指定本地 vLLM 部署路径下,9B 的 P50 延迟低至 25.58ms,4B 仅为 18ms。
  • 计算资源可动态调节:首创 effort="low/high" 模式,可根据动作风险在速度和准确率之间自由切换。
  • 高频操作成本更低:effort="low" 只运行 16 层,并采用候选感知输出投影,适合滚动、点击下一步等高频决策。
  • 关键动作更可靠:effort="high" 执行完整网络深度,适合支付确认、权限审批等高风险场景。
  • 避免输出格式错误:采用语言原生决策接口,将输出约束在预定义候选集合内,消除 JSON 格式幻觉。
  • 业务迁移能力强:同一模型可通过自然语言描述适配浏览器操作、客服分流、规则审核等不同任务。

APUS-OpenJev-v1的项目地址

  • HuggingFace模型库:https://huggingface.co/apus-ailab/APUS-OpenJev-v1

APUS-OpenJev-v1的同类竞品对比

对比维度 APUS-OpenJev-v1 Jev
产品性质 APUS AI Lab 开源的“System 1”决策大模型 TypeSafe AI 推出的商业闭源决策 API
开放程度 模型权重、运行时、部署脚本及技术报告开放 仅以云端 API 提供服务,核心模型不开源
模型规格 提供 4B、9B 及 35B-A3B 等版本 官方未公开完整模型规模和版本细节
决策准确率 9B 在官方 80 题冻结基准中达到 85.00% 官方 API 同基准结果为 82.50%
响应延迟 指定本地部署路径下,9B P50 为 25.58ms 公网 API 实测 P50 为 280.80ms
计算模式 原生支持 effort="low/high" 动态计算深度 未公开类似的可调节计算深度机制
部署方式 支持本地、私有算力及 vLLM 服务化部署 主要依赖云端 API 调用
输出方式 可输出候选动作,也能生成表单和搜索文本 主要面向结构化动作决策,公开信息未明确文本生成能力
隐私与数据控制 数据可完全留在本地或企业私有环境 请求需发送至云端,数据控制依赖服务商方案
成本模式 自部署后主要承担硬件和推理成本 按商业 API 调用计费,并产生持续订阅或流量成本

APUS-OpenJev-v1的应用场景

  • 浏览器自动化:根据网页 DOM、按钮和输入框信息,快速决定点击、滚动或跳转等下一步操作。
  • 企业流程路由:在审批、工单处理或表单流转中,根据业务规则自动选择提交、退回、转交等处理路径。
  • 客服工单分配:结合用户问题、历史信息和候选处理部门,实时判断最合适的客服团队或处理动作。
  • 金融与合规审核:对高风险操作使用 effort="high" 深度判断,识别异常交易、权限风险或违规数据流向。
  • 端侧智能助手:将轻量模型部署在本地设备或私有服务器上,为高频 Agent 任务提供低延迟、保护隐私的决策能力。