AB
AiBoss站
快讯

Liquid AI 发布 LFM2.5-VL-DSpark 视觉语言模型草稿模型

Liquid AI 在 Hugging Face 博客发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 引入推测解码路径。官方称该草稿模型增加约 280M 参数,并给出在设备端与 H100 上的解码加速数据。

核心事实

据 Hugging Face 博客文章,Liquid AI 发布了面向视觉语言模型(VLM)LFM2.5-VL-3B 的实验性 DSpark 草稿模型 LFM2.5-VL-DSpark。官方称,该草稿模型为模型增加一条推测解码(speculative decoding)路径,以较小的内存开销换取更快的解码速度,且不改变输出质量。

据该文章,草稿模型约有 280M 参数,相当于在 3B 目标模型基础上增加约 8.9%。文章称其采用 4 层注意力草稿结构、块大小 9,并给出解码加速最高 3.13 倍(设备端)与 2.66 倍(H100)的数据,端到端增益最高分别为 2.62 倍与 2.27 倍。文章还称该草稿模型在 llama.cpp、MLX-VLM 和 SGLang 上提供首日支持。

背景与影响

推测解码的思路是让一个较小的草稿模型先提出若干候选 token,再由目标模型逐一验证,因此文章强调该过程是精确的:贪心解码输出与单独运行目标模型一致。对视觉语言模型而言,图像先经过视觉编码器,语言主干再处理数百个视觉 token,预填充阶段在端侧设备上占用的时间比例更高。

文章据此指出,推测解码只加速解码阶段,不加速视觉编码与预填充;当这些阶段已占据大部分耗时,即便解码大幅提速,端到端收益也有限,这被文章称为阿姆达尔定律的体现。因此该方案的实际效果会随任务类型与硬件配置而变化。

限制与来源

上述参数规模、加速倍数与支持框架信息均来自 Liquid AI 的博客文章,属于官方自述,尚未见独立第三方复现验证。文章未披露定价、地区可用性或商业授权条款;模型权重以 Safetensors 与 GGUF 格式发布,具体许可与使用条件请以官网及模型页面当前信息为准。运行 SGLang、llama.cpp 与 MLX-VLM 均需使用包含相应支持的构建版本,相关命令与参数请以官方文档为准。

来源:Hugging Face 博客文章《Accelerating vision-language models with LFM2.5-VL-DSpark》(Liquid AI)。