Radar Brief 2026 年第 24 周 · 2026-07-16 — 2026-07-23

791个机器人数据集汇流
跨具身训练进入质量治理期

本周扫描 86 个 HF 组织 · 50 个 GitHub 组织 · 71 个博客 · 125 个 X 账户

0
高价值数据集
0
相关论文
0
博客文章
0
活跃仓库
一句话速览

LeRobot 于 2026-07-16 发布 791 个跨具身社区数据集,覆盖 46 类机器人与 2,597 万帧 [P0]、Microsoft 的 Resource2Skill 首周下载 2,098 次,Agent 训练单元从对话扩展到可执行技能 [P0]、Meta 的 GAMUT 用两层元量规评测 1,813 个开放式问题,最佳模型得分仅 58.7% [P1]。本周最强数据需求信号:机器人操作轨迹。

Key Findings

本周 5 条高商业价值发现

P0 LeRobot 于 2026-07-16 发布 791 个跨具身社区数据集,覆盖 46 类机器人与 2,597 万帧 [P0]

lerobot/community_dataset_v3 于 2026-07-16 发布,本次扫描时 downloads 5,114、likes 3,规模为 10M<n<100M。官方数据卡披露其由 235 名社区贡献者共同形成,包含 791 个子数据集、50,622 个 episode、25,971,082 帧和 251.5 小时数据,覆盖 46 类机器人;原始 851 个数据集经清理后保留 791 个,剔除了缺失视频、数据类型不一致和转换失败的数据。Hugging Face 又于 2026-07-21 发布 Grabette,让参与者用手持夹爪、相机与浏览器流程采集 6-DoF 操作轨迹并转换为 LeRobot 格式。

商业意义 → 机器人数据采集正在从单一实验室、单一机型走向社区化和跨具身汇流,真正的瓶颈随之从“有没有数据”转向“不同设备、视角、帧率和任务语义能否被可信地合并”。这正需要人对任务描述、轨迹完整性、操作成败、异常恢复和安全边界作出判断。集识光年可优先建设跨具身数据质检、机器人 episode 级成功判定、失败类型分层与争议轨迹复核能力,把社区贡献转化为可训练的数据资产。
P0 Microsoft 的 Resource2Skill 首周下载 2,098 次,Agent 训练单元从对话扩展到可执行技能 [P0]

microsoft/RESOURCE2SKILL 于 2026-07-17 发布,本次扫描时 downloads 2,098、likes 9,覆盖 Web、PowerPoint、Excel、Blender 与音频工作流,将人类创建的教程、代码、文档和参考产物提炼为可发现、可组合、可执行的技能;项目页报告在同一 GPT-5.4 backbone 上,七个领域平均任务得分由 51.9 提升至 66.9,其中 UE5 提升 38.2 分。同期 nvidia/Open-SWE-Traces 于 2026-07-16 更新,包含 207,489 条 SWE-agent/OpenHands 软件工程轨迹,本次扫描 downloads 8,274;Apple 于 2026-07-21 发布无需真实 API 环境的轨迹合成方法,并以 LLM judge 过滤结果。

商业意义 → Agent 数据的基本单位正在由“指令—回复”迁移为“需求—技能—工具调用—环境反馈—可验证结果”的执行链。合成轨迹会快速增多,但能否代表真实需求、步骤是否必要、工具调用是否可靠、结果是否达到专业标准,仍取决于高质量判断。集识光年应把 Agent 轨迹审查进一步产品化为技能抽取、任务有效性验证、过程偏好比较、失败归因和真实软件验收五类判断任务。
P1 Meta 的 GAMUT 用两层元量规评测 1,813 个开放式问题,最佳模型得分仅 58.7% [P1]

facebook/GAMUT 于 2026-07-20 发布,配套论文于 2026-07-21 公开。该基准包含 1,813 个基于真实可穿戴图像的问题,覆盖 10 个领域;其方法先由结构化 meta-rubric 描述完整答案需要满足的事实、替代项和有序过程,再机械编译为低方差的二元检查项。问题与量规由多轮“人类 + LLM”流程构建,每条量规均有网页证据并经专家核验;在 14 个闭源与开源模型中,最佳结果只有 58.7%。AllenAI 又于 2026-07-22 发布 deepresearch-bench,提供中英文各 50 个任务,并将可读性、洞察力、完整性和指令遵循拆为带权判据。

商业意义 → 开放式生成评测正在从“答案对不对”升级为“是否完整、证据是否充分、过程是否满足领域结构”。量规设计本身开始成为稀缺的数据资产,而不是附属说明。集识光年可提供证据驱动的量规编写、判据级打分、专家仲裁和评审者一致性校准,让人的判断被保存为可复用、可审计的评测基础设施。
P1 Surge AI 的 Chartography 由专业人士构建 100 道真实图表题,前沿模型最高不足 45% [P1]

surgeai/chartography 于 2026-07-16 完成本期更新,本次扫描时 downloads 121。它仅设 test split,包含 100 张真实图表和 100 个问题,覆盖金融、医疗、制造、供应链、化学、地学和电气工程等 12 个专业领域;每道题由相关从业者编写并经多名专家复核,同时提供完整计算路径和按图表精度设定的可接受答案区间。官方报告首批评测没有前沿模型超过 45%,并通过 canary 明确阻止训练污染。Amazon 于 2026-07-20 发布 ConfBench,以 75 份经核验的 FCC 发票生成最多 18 类退化版本,共 1,346 个样本,用于 OCR 鲁棒性与置信度校准。

商业意义 → 专业视觉推理的难点不是识别标签,而是读懂稀疏坐标、重叠流向、投影几何和未写在题面上的行业约定。一个看似合理但读错曲线的答案,在医疗、工程或金融场景中可能直接失效。集识光年可组织专业从业者构建“真实材料 + 计算路径 + 容差区间 + 防污染机制”的黄金评测集,把领域经验转化为可计量的判断标准。
P2 NVIDIA 将 AV-Skills 扩展到 286 万条音视频对话,长视频训练转向时间定位与跨模态一致性 [P2]

nvidia/av-skills 于 2026-07-22 更新,官方数据卡披露共 2,862,653 条音视频对话,覆盖 29 类任务,训练视频最长 15 分钟;其中 AV-Think 含 23,618 条时间锚定推理样本,平均推理链长度 635.7 个英文词。数据同时覆盖语音、环境声、音乐、长程视频和时间定位。2026-07-20 发布的 ConsiSpace 论文进一步指出,模型在视角变化和长时段视频中容易聚合出不一致的空间证据,说明长视频能力已从片段识别进入跨时间、跨视角的一致性推理阶段。

商业意义 → 286 万条规模可以由机器快速扩增,但音画是否对齐、事件边界是否准确、推理是否引用了正确时段、跨视角空间关系是否一致,仍需可追溯的判断标准。集识光年可布局长视频事件切片、时间证据定位、音画一致性复核、空间关系裁定和推理链证据对齐,形成区别于低门槛内容生产的高价值多模态判断能力。

Demand Signals

从模型发布反推训练数据需求

数据类型 强度 趋势 关联信号
机器人操作轨迹
极强 → 持续
LeRobot 汇总 791 个数据集 · 50,622 个 episode · 46 类机器人;Grabette 降低 6-DoF 演示采集门槛
Agent 真实轨迹与长程评测
极强 → 持续
Open-SWE-Traces 公开 207,489 条轨迹且下载 8,274;Resource2Skill 下载 2,098
开放式生成元量规
极强 ↑ 新增
GAMUT 以 1,813 个问题验证两层元量规,最佳模型仅 58.7%;AllenAI 同步发布中英文判据集
科研分析评测数据
→ 持续
Chartography 覆盖 12 个专业领域且前沿模型低于 45%;SciForma 强调科学图示的结构保真
第一视角视频记忆/3D 推理
→ 持续
Open-AoE 释放约 2,000 小时第一视角操作视频;Grabette 与 ConsiSpace 同期强化轨迹和空间一致性
长视频音视频时间定位
↑ 新增
AV-Skills 扩展到 2,862,653 条对话,含 23,618 条时间锚定推理样本
Agent 可执行技能库
↑ 新增
Resource2Skill 覆盖七类真实软件任务,项目报告平均任务得分提升 15.0 分
合成环境与世界模型数据
↑ 新增
Apple 以 API 规格生成有状态轨迹;ABot-World-0 与 G-MAD 分别扩展交互世界和 RGB-T 仿真数据
文档鲁棒性与置信校准
↑ 新增
ConfBench 以 75 份核验发票生成 1,346 个退化样本,覆盖最多 18 类真实噪声
专家黄金集与防污染评测
↑ 新增
Chartography 采用专业人士编写 · 多轮复核 · 答案容差和 canary 防污染
语音多语言问答评测 ↓ 退出 上期出现,本期未出现
检索引用与科研 Agent 证据数据 ↓ 退出 上期出现,本期未出现
偏好学习与噪声校正数据 ↓ 退出 上期出现,本期未出现
数据归因与模型记忆分析 ↓ 退出 上期出现,本期未出现
隐私与合成敏感文本 ↓ 退出 上期出现,本期未出现
气候/仿真时序环境 ↓ 退出 上期出现,本期未出现

想深聊本期内容?

Kai
Kai Founder & CEO
苏文
苏文 AI 文档与发布工程师
陆明哲
陆明哲 AI 产品经理

AI Dataset Radar 自动生成 · 每周更新

AI Dataset Radar →