OTS 现货数据

前沿数据,开箱即用

由参与前沿实验室工作的同一批专家打造的训练数据、评测集与 RL 环境。在公开基准上已有发布的能力提升结果。现已提供。

按能力浏览

四大类别,对应后训练团队实际规划训练的方式。以下为代表性选例,完整清单可联系索取。

RSI / Auto Research

Research Agent、轨迹与环境

我们自己的 Research Agent 数据:包含可执行研究环境、长链轨迹、带 verifier 的任务与 reward 信号,用于自主实验能力训练。

PostTrainBench

PostTrainBench Ext.

面向 LLM 后训练研究的可运行 Agent 数据。每条数据包含 PostTrainBench / AutoResearch 任务、可执行环境、Claude Opus 4.8 研究轨迹、明文 reasoning_content 与原始 signature blocks。

结果

4/4 任务相对基线或初始提交均有正向提升;159 条非空明文 thinking、168 个 signature blocks;214 个源文件 SHA256 校验通过。

申请数据集
FrontierCS

FrontierCS Ext.

Frontier-CS algorithmic track 的 Harbor Adapter 数据,覆盖 172 个开放式算法 / 竞赛编程任务。每个任务含问题说明、C++17 解题入口、任务模板、verifier / partial scoring 机制与 parity metadata。

申请数据集
Coding Agents

Coding agents

覆盖仓库级软件工程、代码执行环境与带 verifier 的编程任务,用于训练和评测 Coding Agent。

TerminalBenchFrontier-BenchFrontierSWE

TerminalBench 困难终端任务数据

困难终端任务评测数据。内部登记中该数据集的详细简介尚未填写,具体规模与构成请联系我们获取最新说明。

申请数据集
SWEBench-MultilingualDeepSWESWEBench-ProProgramBench

Repository-Level Software Engineering

设置在完整代码库中的软件工程任务,覆盖功能开发、缺陷修复与生产级重构。开箱即用兼容 SWE-hench。

申请数据集
Enterprise Agents

Enterprise agents

面向真实知识工作流程的长链轨迹、可执行环境、人工 Rubric 与 reward 信号,支持企业 Agent 的训练与评测。

ClawMarkClaw-EvalClawBenchToolathlon

OpenClaw / Hermes RL Workspace & Rubric 数据

面向真实 Agent 执行场景的全会话轨迹与人工 Rubric 数据,用于强化学习、奖励建模、critic 训练与高标准 Agent 评测。执行模型:Claude Opus 4.6。

结果

27B / 2k step 后训练对比:total-300 口径 38.3%,general-161 50.9%,multi-turn-38 44.7%。

申请数据集
Expert Reasoning

Expert reasoning and core capabilities

专家编写的推理任务、长文本语料与困难评测环境,用于强化模型的核心能力。

AIME 2025FrontierMath

数学 PhD 级题目集

面向高难度数学推理训练的专家级题目集,3,000 道覆盖组合、数论、几何与代数四个一级领域的题目,每题配备完整解答、细粒度评分标准(rubrics)及多模型评测结果。

申请数据集

Train first. Pay if it works.

加入 Trusted Program 的实验室可以先用完整数据集训练、评测训练后的模型,只有当指标确实被推动时才付费。

告诉我们你在训什么

把你要攻的能力方向发给我们,我们会返回匹配的数据集、样例包与报价。定制数据同样基于这套生产管线。