VibeLifeBench:你的生活智能体能否在动态世界中保持主动与持续行动?
个人智能体需要在持续变化的现实环境中工作数周,而不是只响应一次性的用户请求。我们提出 VibeLifeBench,包含十个日常生活领域、22 项模拟服务和 200 个长周期任务。七个前沿模型的整体表现仍然较低,表明当前智能体距离主动发现变化、长期保持目标并持续采取行动仍有明显差距。
研究智能体如何学习、行动、协作与持续改进。
个人智能体需要在持续变化的现实环境中工作数周,而不是只响应一次性的用户请求。我们提出 VibeLifeBench,包含十个日常生活领域、22 项模拟服务和 200 个长周期任务。七个前沿模型的整体表现仍然较低,表明当前智能体距离主动发现变化、长期保持目标并持续采取行动仍有明显差距。
智能体能否将模型失败的证据转化为更好的训练数据,并持续改进模型?我们提出 RSIBench-Data,在固定后训练技术栈中单独评估智能体的数据研究能力。六项基准测试显示,智能体已经能够提出有效假设并改进初始方案,但仍难以保留最佳结果、将反馈稳定转化为持续提升,这揭示了递归自我改进中的关键瓶颈。
当智能体的可复用技能库从数十项扩展到数百甚至上千项时,会发生什么?我们在 15 个前沿模型、1,141 项真实技能和超过 300 万次路由与执行决策中,发现了支配技能选择和任务执行的两条耦合扩展规律。结果表明,智能体能力不仅取决于模型本身,也取决于技能如何组织、区分和呈现。
编程智能体正在直接操作终端、代码仓库和用户文件,因此最小权限控制已成为安全落地的必要条件。我们提出 AuthBench,通过 120 个真实终端任务、人工审核的权限边界和可执行安全验证,评估模型能否正确推断任务权限。结果显示,当前模型经常同时出现敏感权限授予过多和必要权限缺失的问题,单纯增加推理时间或收紧权限并不能解决这一矛盾。
协作型智能体需要完成跨越多个工作日的业务流程,同时应对邮件、日历、文档和多模态信息的持续变化。我们提出 ClawMark,包含 13 类专业场景中的 100 个任务,并通过有状态沙箱服务和确定性规则进行评估。前沿智能体通常能够取得部分进展,却很少完整完成端到端流程;环境发生变化后,表现还会明显下降。