791个机器人数据集汇流
跨具身训练进入质量治理期
本周扫描 86 个 HF 组织 · 50 个 GitHub 组织 · 71 个博客 · 125 个 X 账户
LeRobot 于 2026-07-16 发布 791 个跨具身社区数据集,覆盖 46 类机器人与 2,597 万帧 [P0]、Microsoft 的 Resource2Skill 首周下载 2,098 次,Agent 训练单元从对话扩展到可执行技能 [P0]、Meta 的 GAMUT 用两层元量规评测 1,813 个开放式问题,最佳模型得分仅 58.7% [P1]。本周最强数据需求信号:机器人操作轨迹。
Key Findings
本周 5 条高商业价值发现
lerobot/community_dataset_v3 于 2026-07-16 发布,本次扫描时 downloads 5,114、likes 3,规模为 10M<n<100M。官方数据卡披露其由 235 名社区贡献者共同形成,包含 791 个子数据集、50,622 个 episode、25,971,082 帧和 251.5 小时数据,覆盖 46 类机器人;原始 851 个数据集经清理后保留 791 个,剔除了缺失视频、数据类型不一致和转换失败的数据。Hugging Face 又于 2026-07-21 发布 Grabette,让参与者用手持夹爪、相机与浏览器流程采集 6-DoF 操作轨迹并转换为 LeRobot 格式。
microsoft/RESOURCE2SKILL 于 2026-07-17 发布,本次扫描时 downloads 2,098、likes 9,覆盖 Web、PowerPoint、Excel、Blender 与音频工作流,将人类创建的教程、代码、文档和参考产物提炼为可发现、可组合、可执行的技能;项目页报告在同一 GPT-5.4 backbone 上,七个领域平均任务得分由 51.9 提升至 66.9,其中 UE5 提升 38.2 分。同期 nvidia/Open-SWE-Traces 于 2026-07-16 更新,包含 207,489 条 SWE-agent/OpenHands 软件工程轨迹,本次扫描 downloads 8,274;Apple 于 2026-07-21 发布无需真实 API 环境的轨迹合成方法,并以 LLM judge 过滤结果。
facebook/GAMUT 于 2026-07-20 发布,配套论文于 2026-07-21 公开。该基准包含 1,813 个基于真实可穿戴图像的问题,覆盖 10 个领域;其方法先由结构化 meta-rubric 描述完整答案需要满足的事实、替代项和有序过程,再机械编译为低方差的二元检查项。问题与量规由多轮“人类 + LLM”流程构建,每条量规均有网页证据并经专家核验;在 14 个闭源与开源模型中,最佳结果只有 58.7%。AllenAI 又于 2026-07-22 发布 deepresearch-bench,提供中英文各 50 个任务,并将可读性、洞察力、完整性和指令遵循拆为带权判据。
surgeai/chartography 于 2026-07-16 完成本期更新,本次扫描时 downloads 121。它仅设 test split,包含 100 张真实图表和 100 个问题,覆盖金融、医疗、制造、供应链、化学、地学和电气工程等 12 个专业领域;每道题由相关从业者编写并经多名专家复核,同时提供完整计算路径和按图表精度设定的可接受答案区间。官方报告首批评测没有前沿模型超过 45%,并通过 canary 明确阻止训练污染。Amazon 于 2026-07-20 发布 ConfBench,以 75 份经核验的 FCC 发票生成最多 18 类退化版本,共 1,346 个样本,用于 OCR 鲁棒性与置信度校准。
nvidia/av-skills 于 2026-07-22 更新,官方数据卡披露共 2,862,653 条音视频对话,覆盖 29 类任务,训练视频最长 15 分钟;其中 AV-Think 含 23,618 条时间锚定推理样本,平均推理链长度 635.7 个英文词。数据同时覆盖语音、环境声、音乐、长程视频和时间定位。2026-07-20 发布的 ConsiSpace 论文进一步指出,模型在视角变化和长时段视频中容易聚合出不一致的空间证据,说明长视频能力已从片段识别进入跨时间、跨视角的一致性推理阶段。
Demand Signals
从模型发布反推训练数据需求
想深聊本期内容?
由 AI Dataset Radar 自动生成 · 每周更新
AI Dataset Radar →