PostTrainBench Ext.
面向 LLM 后训练研究的可运行 Agent 数据。每条数据包含 PostTrainBench / AutoResearch 任务、可执行环境、Claude Opus 4.8 研究轨迹、明文 reasoning_content 与原始 signature blocks。
4/4 任务相对基线或初始提交均有正向提升;159 条非空明文 thinking、168 个 signature blocks;214 个源文件 SHA256 校验通过。
四大类别,对应后训练团队实际规划训练的方式。以下为代表性选例,完整清单可联系索取。
我们自己的 Research Agent 数据:包含可执行研究环境、长链轨迹、带 verifier 的任务与 reward 信号,用于自主实验能力训练。
面向 LLM 后训练研究的可运行 Agent 数据。每条数据包含 PostTrainBench / AutoResearch 任务、可执行环境、Claude Opus 4.8 研究轨迹、明文 reasoning_content 与原始 signature blocks。
4/4 任务相对基线或初始提交均有正向提升;159 条非空明文 thinking、168 个 signature blocks;214 个源文件 SHA256 校验通过。
Frontier-CS algorithmic track 的 Harbor Adapter 数据,覆盖 172 个开放式算法 / 竞赛编程任务。每个任务含问题说明、C++17 解题入口、任务模板、verifier / partial scoring 机制与 parity metadata。
申请数据集覆盖仓库级软件工程、代码执行环境与带 verifier 的编程任务,用于训练和评测 Coding Agent。
面向真实知识工作流程的长链轨迹、可执行环境、人工 Rubric 与 reward 信号,支持企业 Agent 的训练与评测。
专家编写的推理任务、长文本语料与困难评测环境,用于强化模型的核心能力。
面向高难度数学推理训练的专家级题目集,3,000 道覆盖组合、数论、几何与代数四个一级领域的题目,每题配备完整解答、细粒度评分标准(rubrics)及多模型评测结果。
申请数据集加入 Trusted Program 的实验室可以先用完整数据集训练、评测训练后的模型,只有当指标确实被推动时才付费。