快讯2025年12月14日

美团发布面向复杂问题的大模型智能体评测基准——VitaBench

美团 LongCat 团队发布 VitaBench，是面向复杂问题的大模型智能体评测基准。以外卖点餐、餐厅就餐、旅游出行三大生活场景为载体，构建了包含 66 个工具的交互式评测环境。VitaBench 从深度推理、工具使用与用户交互三大维度量化任务复杂性，通过真实用户模拟器和原子化评估准则实现细粒度评估。

全部分类