AB
AiBoss站
快讯

Liquid AI 发布 d1 系列开源决策模型,面向边缘设备多模态推理

Liquid AI 在 Hugging Face 发布 d1-3B 与 d1-omni-600M 两款开源权重决策模型,主打边缘设备上的单次前向推理,支持文本、图像,后者还支持音频。官方称 d1-3B 在 Decision Index 0.2.1 上得分 48.57。

核心事实

Liquid AI 在 Hugging Face 博客发布 d1 决策模型家族的两款开源权重模型:d1-3B 与实验性的 d1-omni-600M。据官方介绍,d1-3B 在 Decision Index 0.2.1 上得分 48.57,官方称其领先所有 4B 与 9B 模型,并高于 Decider 35B-A3B 的 47.11。两款模型均支持文本与图像输入,d1-omni-600M 额外支持文本与音频组合输入。

与生成式模型不同,决策模型不逐 token 生成,而是在单次前向传播中给出答案。d1-3B 基于 LFM2.5-VL-3B 训练,d1-omni-600M 基于 LFM2.5-Encoder-350M 训练并加入视觉与音频编码器。

背景与影响

官方在七个公开数据集上做了评测,覆盖阅读理解、毒性检测、意图分类、医疗问答与跨语言理解。d1-3B 平均分 82.9,d1-omni-600M 为 78.4,官方称后者以约四分之一参数量超过 Decider 2B 的 77.1。

速度方面,官方与 NVIDIA 合作在 RTX 4090、Jetson AGX Thor、Jetson AGX Orin 64 GB 与 Jetson Orin Nano 上测试 d1-3B:单次问答在 Jetson AGX Thor 上为 16 ms,AGX Orin 为 26 ms,Orin Nano 为 50 ms;GPU 上单次问答低于 10 ms。d1-omni-600M 因属早期研究版本,未公布速度数据。

限制与来源

官方表示未公布视觉与音频基准成绩,原因是 Decision Index v0.3 仅含私有视觉子集,音频决策基准仍是开放问题。d1-omni-600M 被明确标注为早期研究版本,仍在继续开发。上述分数与延迟均为官方自述,未获第三方独立验证。模型权重与使用方式、依赖版本及可用地区请以 Hugging Face 模型卡与官网当前信息为准。

来源:Hugging Face 博客《Multimodal open d1 decision models for the edge》。