Auto Research Data
01覆盖信息源发现、证据综合、引用校验与长篇分析的端到端研究任务和轨迹,适用于开放网络与专业知识工作流。
前沿数据产品
智能并不只来自阅读。模型还需要练习、反馈、评测,以及在接近真实世界的环境中积累经验。
我们构建支撑这一学习过程的数据系统:轨迹数据、RL 环境、Verifier、专家判断,以及覆盖 Coding、研究和 Computer Use 的多模态任务。
随着模型能力边界不断扩展,我们的产品也随之演进——从聚焦单项能力的 Benchmark,到持续运行的开放式工作流。
覆盖信息源发现、证据综合、引用校验与长篇分析的端到端研究任务和轨迹,适用于开放网络与专业知识工作流。
面向 Coding、Computer Use、研究和专业工作流的高保真、有状态环境,并配套任务、轨迹与奖励信号,用于长时程训练。
将复杂结果转化为可靠学习信号的评测系统,把可执行检查与精细标准结合起来,衡量质量、正确性与完成过程。
高信号示范与多步轨迹,呈现专家如何编写代码、调用工具、从错误中恢复,并从头到尾完成复杂工作流。
由经过训练的人类评审在 Arena 中大规模进行成对比较,识别静态分数难以体现的正确性、实用性、推理质量与偏好差异。
由科学、金融、法律、工程等高技能领域的专家创建并评审任务,解决仅靠表面语言流畅度无法判断的问题。
让模型理解并操作截图、文档、界面、图像、音频与视频的数据,并通过真实工具调用任务完成能力落地。
无需定制开发即可使用的生产级数据集、Benchmark 与环境,覆盖 Coding、研究、Agent 工作流和模型核心能力。
从 Chatbot 到 Persistent Agent,AI 系统所需的数据基础设施正在发生根本性变化。
Instruction Tuning 配对数据与 RLHF 偏好数据。由人工标注师策划的静态 (prompt, response) 样本。
沙箱环境中的 Agent 轨迹数据。在单个有界会话内的 RL rollout、工具调用 trace 和奖励信号。
连续多天的交互数据流,涵盖不断变化的环境、持续累积的上下文,以及自我改进的 Agent 行为。