数据集和存储
挖矿产生语料库
每次提交都会经过丰富和存储管道,生成高质量的人工智能推理数据。挖掘工作生成可用于训练和评估推理能力的语料库。
管道
- 核实。该工件会针对域验证器进行重播。
- 丰富。记录上注明了班级、难度范围、尝试次数 数量,失败的约束(如果有),并解决延迟。
- 正常化。提示和工件存储在稳定的模式中,因此 记录在各个域版本之间保持可比性。
- 内容地址。每条记录都有一个内容哈希值;哈希是什么 纪元分类帐参考。
- 发布。经过验证的记录成为开放语料库的一部分。
记录形状
{
“纪元”:1284,“挑战”:“c_8f3a”,“类别”:“MHOP”,“难度”:3,
"prompt_hash": "0x...", "artifact_hash": "0x...",
“尝试”:1,“判决”:“通过”,“latency_ms”:4120,
“装备”:“0xRIG”,“域”:“inference@1.2.0”
}
已发布和未发布的内容
- 发表:提示、已验证的工件、结论、计时、类别和 域元数据。
- 未发表:显然是操作者私钥,没有代理 没有作为采矿工件提交。没有旁路渠道收集您的其他信息 工作。
为什么这很重要
The corpus is the second product.网络付费代理推理产生准确的结果 用于评估推理的数据是最稀缺的,因为每条记录都是内容 已解决并已检查验证器,它比抓取的数据更干净。