AB
AiBoss
News

Meituan releases VitaBench, a benchmark for evaluating large-scale intelligent agents for complex problems.

Meituan's LongCat team released VitaBench, a benchmark for evaluating large-scale intelligent agents facing complex problems. Using three major life scenarios—food delivery, restaurant dining, and travel—as platforms, it constructs an interactive evaluation environment containing 66 tools. VitaBench quantifies task complexity from three dimensions: deep reasoning, tool usage, and user interaction, achieving fine-grained evaluation through a real user simulator and atomic evaluation criteria.