VitaBench-美团推出的大模型Agent评测基准

VitaBench-美团推出的大模型Agent评测基准

文章来源:智汇AI    发布时间:2025-10-27

VitaBench 是美团 LongCat 团队发布的面向复杂问题的大模型智能体评测基准。以外卖点餐、餐厅就餐、旅游出行等高频生活场景为载体,构建了包含66个工

暂无访问

VitaBench是什么

VitaBench 是美团 LongCat 团队发布的面向复杂问题的大模型智能体评测基准。以外卖点餐、餐厅就餐、旅游出行等高频生活场景为载体,构建了包含66个工具的交互式评测环境,设计了跨场景综合任务,从深度推理、工具使用与用户交互三大维度衡量智能体表现。首次量化拆解智能体任务,构建大规模真实环境数据库,引入真实用户模拟器,通过原子化评估准则(Rubric)实现细粒度行为覆盖。

VitaBench

VitaBench的主要功能

构建复杂任务评测环境:以外卖点餐、餐厅就餐、旅游出行等高频生活场景为载体,构建包含66个工具的交互式评测环境,设计跨场景综合任务,模拟真实场景下的复杂需求。

相关推荐