AB
AiBoss
ニュース

是石科技Meta-Infer引擎优化PCIe显卡,称DeepSeek推理吞吐提升近7倍

是石科技发布Meta-Infer高效部署引擎,通过内核补齐、算子与通信重构等软件手段优化PCIe-Only显卡推理。据其披露,DeepSeek-V4.1-Flash输入吞吐从1932 tok/s提升至13274 tok/s,约6.87倍,相关数据尚未获第三方独立验证。

是石科技称Meta-Infer引擎可将PCIe显卡推理吞吐提升近7倍

据量子位刊载的授权文章,是石科技(METASTONE)推出自研的Meta-Infer高效部署引擎,定位为面向异构加速芯片的企业级高性能大模型推理引擎。该引擎尝试在不改动模型结构、不修改任务语义的前提下,通过纯软件优化释放PCIe-Only显卡的推理能力。文章披露,在8张PCIe-Only显卡环境下,DeepSeek-V4.1-Flash的社区Day0基线输入吞吐为1932 tok/s,经算模协同与通算重构全套调优后提升至13274 tok/s,整体约6.87倍,并称支持1M超长上下文。

背景与影响

文章认为,许多不在主流开源框架官方验证矩阵内的长尾GPU卡,虽然能完成模型加载与服务拉起,但算子会静默回退至低效通用实现,集合通信也沿用面向高速互联硬件的调优参数,导致实际性能远低于硬件潜力。Meta-Infer的优化逻辑分为算模协同与通算重构两个阶段,沉淀为内核补齐、算子优化与通信重构、并行与容量调优、缓存复用四项能力。文章还列举了其他模型数据:DeepSeek-V4-Flash输入吞吐从14546 tok/s提升至22584 tok/s,GLM5.3从3236.78 tok/s提升至6222.72 tok/s,并称该套方法论在国产GPU上同样完成验证,仅将Shared Expert与Routed Expert改为并行提交,就在35组同配置配对测试中带来11.26%的吞吐提升。

限制与来源

上述性能数据均来自是石科技提供并获量子位授权刊载的材料,属于厂商侧披露,尚未获官方独立确认,也未见第三方复现结果。文中涉及的模型版本、硬件型号、并发配置与对照口径较为具体,但不同环境下的实际表现可能存在差异。相关引擎的功能范围、支持硬件清单、部署方式与商务条款,请以是石科技官网当前信息为准。本文仅为技术动态转述,不构成任何采购、投资或部署建议。