AB
AiBoss
News

Perplexity开源Lily本地推理服务器

Perplexity开源Lily,一个面向Apple Silicon的轻量Metal推理服务器。当前实现只支持Qwen3.6-35B-A3B的MLX 4位权重,并提供精简版OpenAI Chat Completions兼容接口。

Perplexity开源Lily本地推理服务器,目标是在较新的Apple Silicon设备上运行特定Qwen模型。

当前版本仅支持Qwen3.6-35B-A3B的MLX affine 4位权重,提供精简版OpenAI Chat Completions接口,并固定使用贪心解码。项目要求M5或更新的Apple GPU、macOS 26以及Rust 1.92。

Lily并非通用模型运行框架:它明确不支持GGUF、AWQ、GPTQ、int8、fp8、工具调用、流式响应或多模态输入。其严格边界更适合作为特定模型和硬件组合的实验性工程实现。

参考:Perplexity官方代码仓库