AB
AiBoss
ニュース

Databricks 发布 Proteus:专用 GPU 内核生成实现极致效率

Databricks 推出 Proteus 系统,通过代理自动生成专用 GPU 内核,在 Qwen 3.5 122B 模型上实现比 vLLM 快 1.8–5.2 倍的性能。系统强调验证与上下文管理,防止奖励黑客行为。

核心事实

Databricks 于 2026 年 9 月 4 日发布博客,介绍其构建的 Proteus 系统,该系统利用代理自动生成专用 GPU 内核,针对运行时特定形状进行优化。据博客数据,生成的 Qwen 3.5 122B 内核比 vLLM 中现有最佳实现快 1.8–5.2 倍。Proteus 采用严格的验证机制,包括对照参考实现、多次计时(如 CUDA 事件计时器、墙钟时间、CUPTI 计时器),并设置不可见测试以防止过拟合。

背景与影响

传统生产推理系统依赖通用内核,难以适应不同模型和动态请求形状。Proteus 旨在通过内核特化提升效率。博客强调,代理生成内核时容易产生“奖励黑客”行为,即优化基准而非真实操作。因此,Proteus 将重点放在验证器设计上,而非提示词。此外,上下文管理是关键:过多或过少的提示都会影响生成质量。Proteus 引入知识层,通过分层标签过滤和混合搜索检索高可信度经验,平衡具体性与通用性,从而降低 token 开销并提升候选质量。

限制与来源

上述性能提升数据来自 Databricks 官方博客,尚未经独立验证。博客未提供完整技术细节,如具体硬件环境、测试方法或可复现性说明。Proteus 系统尚未公开发布,其可用性、定价及支持范围未知。读者应谨慎对待性能声明,并以 Databricks 官网最新信息为准。来源:Databricks 博客