返回博客
VibeLifeBench:让 Agent 学会在会变化的世界里长期工作
AgentBenchmarkLong-horizonLiving World

VibeLifeBench:让 Agent 学会在会变化的世界里长期工作

一位 32 岁的产品经理,计划带 62 岁的母亲和 65 岁的父亲赴日旅行 20 天。看似普通的家庭出游,背景材料里却埋着一连串足以让行程失控的细节,等待 AI 助理逐一识别和处理。

  1. 母亲的护照将于 2026 年 11 月 8 日到期,而返程日期是 5 月 16 日。届时护照有效期只剩 5 个月零 22 天——距离“六个月有效期”的要求,恰好差 8 天。这个问题必须在订票前被发现;一旦错过,整套机票和行程都要被迫推倒重来。
  2. 父亲患有胰岛素依赖型糖尿病。20 天所需的胰岛素及备用剂量必须随身带上飞机,因此需要提前准备双语医生证明,并按要求申报。行程设计也需要迁就他的身体状况:每天步行不能超过 4 公里,用餐时间不能拖延。
  3. 总预算为 6 万元人民币,而且是不可突破的硬上限。这套任务强调 AI 助理需要主动做好预算管理,对每笔支出进行准确计算、持续核对,并及时发现预算偏差。
  4. 旅途中,风险还在不断变化:航司悄悄将执飞机型从 B787-9 换成 B737-800,原先选好的座位随之失效,却没有发出任何通知。
  5. 一封伪装成“签证加急费”的钓鱼邮件混入收件箱;
  6. 台风预警从低置信度一路升级至高置信度,预计登陆点正是关西;
  7. 返程航班又延误了 4 小时 10 分钟。

我们完整复盘了七个当前最强模型的任务轨迹。结果是:没有一个模型在正确的时间节点发现母亲的护照问题;也没有一个在机型变更后重新完成选座。

VibeLifeBench 的 motivation

  1. 生活领域:Agent 还没有真正进入日常

近年来,Agent 评测几乎只关心两件事:写代码和办公。SWE、跨文件重构、前端生成,以及 PPT、Excel 等办公任务,一个榜单接着一个榜单。行业在关注什么,从 benchmark 的目录里就能看得很清楚。

VibeLifeBench 的论文把 12 个代表性 Agent benchmark 放在同一张表里比较,coding、office、web 和通用工具调用占满了大部分位置,**衣食住行这一格却几乎空着。**但生活恰恰是 Agent 离普通用户最近的地方,也是用户最不能接受“偶尔出错”的地方。

图片为VibeLifeBench与现有基准测试的对比表。展示了不同基准测试的领域、是否主动、是否生活世界、是否长时程等特性。其中VibeLifeBench(ours)涵盖生活(十个领域),在主动、生活世界、长时程方面均被标记为“有”。该表与上下文紧密相关,上下文提到生活任务与coding任务相比多了模糊、个性化、超长程、难验证等麻烦,VibeLifeBench正是为应对这些挑战而设计的基准测试。

生活任务与 coding 任务并不是换一套工具那么简单。它们至少多了四层麻烦:

  • **模糊:**用户开口时自己都没想清楚,需求得在过程里一点点长出来;
  • **个性化:**同一句“帮我订个酒店”,换个人、换个家庭结构,正确答案就完全不同;
  • **超长程:**一件事跟几周、几个月,甚至跨年;
  • **难验证:**没有一套测试用例能告诉你“这趟旅行安排得对不对”。
  1. 动态任务:世界不会停在原地

过去的 Agent benchmark 大多采用“单轮任务”范式:用户通过一条 instruction 交代目标、约束和背景,Agent 随后在相对静态的环境中完成任务。

但真实世界会持续变化。航班可能延误,房源可能下架,新邮件会不断到达,日历安排、天气和价格也会发生变化。Agent 不能只执行最初的计划,还需要持续感知外部变化,理解新信息,并主动调整后续行动。

因此,动态任务评估的重点不是 Agent 能否完成一条固定指令,而是它能否在环境变化后及时更新判断,采取正确行动,并让最终结果与现实状态保持一致。

  1. 超长程任务:事情需要被持续推进

真实任务往往不是一次交互就能完成的。准备一次家庭旅行、处理租房纠纷、跟进考试安排或管理装修进度,都可能持续数周甚至数月。

在这个过程中,用户不可能在第一句话里交代所有细节,任务也会被拆成多个阶段,涉及多轮沟通、连续决策和大量工具调用。Agent 需要保持长期上下文,记住已经完成的工作,识别下一步行动,并在关键节点持续推进任务。

VibeLifeBench 将任务定义为一个带时间轴的 living world。每个任务都有明确的阶段和时间线,中位持续时间约为 29 天,覆盖 10 个生活领域、200 个任务、22 个 mock service 和 288 个工具接口,并通过 12,261 个细粒度检查项进行评分。

评测不依赖 Agent 的自我汇报,而是读取它最终留在后端、日历、邮件、笔记和文件等位置的客观状态,判断任务是否真正完成。

动态任务关注的是世界如何变化,超长程任务关注的是Agent 能否把事情持续做下去。二者共同构成了真实世界 Agent 评测区别于单轮 benchmark 的关键。

图片展示了VibeLifeBench中一个超过30天的多日家庭日本之旅任务示例。从4月17日出发前的准备,到28日台风登陆后的应对,再到5月16日旅行结束,任务中包含多个世界变化(如航班取消、签证过期等)和用户消息,体现了任务的长期性和世界变化的复杂性。图片还呈现了任务分类(10个真实生活场景)和环境服务(288个真实生活API),与上下文介绍的评测关注点相呼应。

Leaderboard

先看 leaderboard:最强的 Opus 5 平均分只有 0.325,最好的一次也只有 0.412。五个模型全部挤在 0.21–0.33 的窄带里,几乎没有形成梯队。换句话说,会聊天、会调工具,并不等于能把生活中的一件事从头照看到尾。

更棘手的是稳定性。所有模型的 min@3 都不超过 0.22;同一道任务重复运行,分数仍会明显波动,最高差值达到 0.151。偶尔做对一次,却无法稳定复现。对于一个可能要托付家人行程的助理,这比单纯低分更值得警惕。

图片展示了VibeLifeBench Leaderboard中不同模型的性能数据。模型包括Opus - 5、gpt - 5.5、gemini - 3.5 - flash等,各模型的AVG@3、MAX@3、MIN@3、I、INPUT(M)、OUTPUT、TOOL CALLS、TURNS等指标均有呈现。其中Opus - 5的AVG@3为0.325,MAX@3为0.412,MIN@3为0.238,I为0.098,INPUT(M)为25.6,OUTPUT为325,198,TOOL CALLS为316,TURNS为210。该图与上下文紧密相关,直观呈现了各模型在VibeLifeBench任务中的表现情况。

再看领域跨度。即使是最强的 Opus 5,十个领域的得分也从 0.22 摆到 0.51;而且不同模型的难易顺序高度一致:购物、旅行、装修和诉讼相对容易,租房、团建、备考和健身最难。模型的短板并非随机噪声,而是呈现出稳定的场景结构。

图片展示了不同模型在各领域任务中的平均min@3得分情况。横轴为模型名称,包括OPUS - 5、GPT - 5.5、GEMINI等;纵轴为领域,涵盖career、exam preparation等。每个单元格内显示对应模型在该领域的得分,得分以不同颜色区分,绿色代表较高得分。图片与上下文紧密相关,直观呈现了各模型在不同领域任务中的表现,帮助理解模型在领域跨度方面的表现情况。

长程助理能力不是工具调用能力

长期助理能力不是“多会几个工具”就能补齐的,它至少需要三种能力同时在线。

第一是 proactivity。好的 Agent 不能永远等用户发下一句话;它要判断什么时候该主动检查、什么时候该提醒、什么时候该行动,以及什么时候最好别添乱。VibeLifeBench 通过 silent mutation 让这种能力变得可测:部分环境变化不会触发通知,只有 Agent 主动回看,才会发现现实已经悄悄改了剧本。

第二是 persistence。Agent 必须把早期约束、阶段性决定和后续变化串成一条线,不能每轮醒来都像第一次接触这个项目。结果显示,当前模型在 persistence 和 bookkeeping 上仍然很弱:问题不只是“有没有写笔记”,而是这些记录能否形成可审计、可跨阶段追踪的状态。

第三是 long-horizon coherence。任务越往后,Agent 越容易忘记最初的红线:预算、授权边界、隐私要求、健康条件和截止日期。论文中所有模型在时间线后段的通过率都明显下降,说明长程一致性是一项独立能力,不会因为 context window 变长就自动出现。

从 ClawMark 到 VibeLifeBench

对真实世界任务的关注,延续了我们此前的研究路线。早期 benchmark 主要评估单轮任务:一条 instruction、一个 Agent、一次执行。而随着 Agent 的能力逐渐增强,Agent 工作的时间周期被拉长,需要在一周左右持续与用户交互,两次交互之间,邮箱、表格和日历都可能发生变化,我们此前推出的 ClawMark,则将评测扩展到 multi-turn、multi-day、multi-service、multimodal 的办公室场景,用确定性 checker 检查 Agent 能否在动态环境中持续完成任务。 eval不再只关心单次执行是否成功,还需要考察 Agent 能否在持续变化的环境中保持上下文、处理新信息,并最终把工作完成。

ClawMark:面向多轮、多日、多服务和多模态办公任务的 Agent benchmark

VibeLifeBench 又把这条时间轴往前推了一段:从办公室走向生活,从几天延伸到 20、30 天甚至更久,从显式工作流进入隐含约束更多、风险更贴近个人的场景。问题始终是同一个:Agent evaluation 不能只看一次执行,而要看它能否跨时间、跨状态、跨交互地维持可靠性。

为长程动态任务准备的基础设施

如果说 ClawMark 和 VibeLifeBench 展示了“会变化的世界有多难”,那么 Terrarium 就是让超长程世界真正运转的底层基础设施。

Terrarium:用任务程序、动态环境、多轮交互与阶段检查运行 living-world evaluation

当任务从静态沙盒中的单次执行,变成持续变化的世界,评测基础设施也必须拥有时间维度。Terrarium 是一个 multi-turn data engine:研究者可以用纯 Python 编写 task program,组合邮件、数据库、文件等服务,驱动 Agent 多轮行动,并在任意阶段运行程序化检查。

它主要解决三类基础问题。第一,环境会变化:两轮行动之间可以到达新邮件、出现新文件或更新数据库。第二,流程不是直线:任务能够根据 Agent 已完成的动作分支、循环。第三,主动性可以被测试:heartbeat 和 webhook 让 Agent 在周期信号或事件通知下,自主决定检查、行动还是忽略。

因此,Terrarium 不只是一个承载 benchmark 运行的环境。它将“长程、动态、主动”这类任务形态工程化:通过可组合服务、可变环境、多轮驱动、阶段检查和可复现的运行配置,让复杂任务能够被稳定生成、重复运行并可靠评估。换句话说,当 task 开始拥有时间,支撑它运行的 environment 和 infrastructure 也必须能够处理时间带来的变化。