博客
分享我们构建真实世界智能体过程中的思考、实践与观察。
2026
- VibeLifeBench:让 Agent 学会在会变化的世界里长期工作
- FrontierRefactor:多尺度、性能导向的代码库重构能力评测
- AI 的下一条 Scaling Law,是组织能力
- 递归自我改进的真正护城河在哪里?
- RSIBench-Data: AI Agent会像研究员一样开展数据研究吗?
- 面向组织的群体自进化 Agent:Evolvent's self-evolving AI system
- 人类对人类的沟通模式正在成为整个系统的瓶颈
- 技能越多,效果越差?Agent 技能库背后的隐藏本质
- BenchRouter: 基于容器化基准路由的零适配 LLM 评测
- AuthBench:Agent 知道自己应该被允许访问什么吗?
- Terrarium:面向 LLM Agent 的多轮数据引擎
- ClawMark:面向多日、多模态协作 Agent 的动态世界基准