Radar Brief 2026 年第 31 周 · 2026-09-26 — 2026-10-03

FetchMan-data 在 10 月
AI 数据行业周度洞察

本周扫描 86 个 HF 组织 · 50 个 GitHub 组织 · 71 个博客 · 125 个 X 账户

0
高价值数据集
0
相关论文
0
博客文章
0
活跃仓库
一句话速览

FetchMan-data 在 10 月 1 日释出 5,200 万帧具身交互数据 [P0]、Surge AI 于 9 月 30 日推出面向专业判断的 GDP.xlsx 基准 [P0]、10 月 1 日论文将合成数据的“来源与审查链”提升为训练数据基础设施问题 [P1]。本周最强数据需求信号:具身智能连续轨迹。

Key Findings

本周 5 条高商业价值发现

P0 FetchMan-data 在 10 月 1 日释出 5,200 万帧具身交互数据 [P0]

Allen AI 于 2026-10-01 发布 allenai/fetchman-data,包含 352,696 个机器人训练 episode、52,008,151 帧数据和 90 个语言任务,覆盖 Unitree G1 人形机器人在 MolmoSpaces 中执行物体抓取时的动作、第一视角视频与本体感知信息;截至扫描日下载量为 434、点赞数为 4。

商业意义 → 具身智能训练正在从静态图像和单步动作转向“语言指令—连续动作—视觉反馈—身体状态”的长轨迹数据。可规模化生成的模拟数据解决数量问题,但真实世界中的抓取成功、遮挡处理、物体易损性和动作安全仍需要人类判断来定义有效行为与失败边界。集识光年应优先布局机器人轨迹复核、异常动作筛选、任务成功度判断和仿真到现实迁移评估,让贡献判断的人直接参与具身模型能力建设并获得收入。
P0 Surge AI 于 9 月 30 日推出面向专业判断的 GDP.xlsx 基准 [P0]

Surge AI 于 2026-09-30 发布 surgeai/GDP.xlsx,截至扫描日下载量为 71;该基准包含 70 个任务,覆盖 13 个专业领域,以 Harbor 环境封装,用于评估 AI Agent 是否能够理解电子表格并给出符合领域专业人士判断的答案。

商业意义 → 训练数据的价值正在从“能否生成正确文本”转向“能否在真实工作材料中做出专业决策”。表格理解、跨单元格推理、异常识别和业务结论判断都难以仅靠自动规则验证,专业人士的判断过程、置信度和可接受误差将成为高价值数据资产。集识光年可以把金融、运营、供应链、法务和医疗等领域的复杂表格任务拆解为可付费的判断贡献,形成专业 Agent 训练与评测数据产品。
P1 10 月 1 日论文将合成数据的“来源与审查链”提升为训练数据基础设施问题 [P1]

论文 Generation Provenance Before Behavior Attribution: Auditing Synthetic Speech Research Objects 于 2026-10-01 发布,提出为合成语音研究对象绑定源规范、生成内容、波形、目标、事实要求、质量信号和审查谱系;同日论文 LineupRL: Verifiable Reinforcement Learning for Time Series Captioning via Caption-to-Series Identification 探索使用可验证奖励提升时间序列描述质量。

商业意义 → 合成数据正在从一次性生成内容转向可追溯、可审查、可验证的训练对象。客户不仅需要结果,还需要知道数据由什么模型生成、经过谁的判断、哪些质量信号被确认以及哪些样本应被淘汰。集识光年可建设“生成记录—人类复核—多轮争议处理—版本追踪”的判断贡献链,重点服务语音、时间序列和多模态训练数据,降低合成数据进入生产训练后的不可解释风险。
P1 InternLM 于 9 月 29 日同时发布 AdvancedMathBench 与 AutoVerifier,强化证明生成和证明核验 [P1]

InternLM 于 2026-09-29 发布 internlm/AdvancedMathBench,下载量为 72、点赞数为 1,覆盖本科和资格考试层级的自然语言数学证明生成与验证;配套模型 internlm/AdvancedMathBench-AutoVerifier 同日发布,下载量为 50、点赞数为 1;同日 Intern-Decision-4B、Intern-Decision-2B 和 Intern-Decision-0.8B 分别拥有 1,607、575 和 1,159 次下载,定位于多模态决策和结构化预测。

商业意义 → 模型训练正在从“生成答案”转向“生成决策并证明为什么这样决策”。自动验证器能够检查形式正确性,但无法完全替代人类对证明是否有意义、推理是否符合教学或业务规范、结论是否可被接受的判断。集识光年可关注数学证明质量、决策理由完整性、多模态证据一致性和拒答边界等任务,建立“机器验证 + 人类审查”的高难度推理数据服务。
P2 Meta 于 9 月 28 日发布 ADEPTS,评估跨设备 Computer Use Agent 的可信度 [P2]

Meta 于 2026-09-28 发布 facebook/adepts,截至扫描日下载量为 133、点赞数为 1;ADEPTS-BENCH 采用双流可信度评测,覆盖移动端和桌面端 Computer Use Agent 在视觉界面中处理歧义、执行操作和保证安全的能力。

商业意义 → Computer Use Agent 的核心风险不再只是回答错误,而是点击错误按钮、误解界面状态、绕过安全提示或在歧义场景下继续执行。此类任务需要人类判断“是否应该继续、是否需要澄清、哪一步属于高风险动作”,因此将带动 GUI 操作轨迹、风险等级、停止条件和纠错反馈数据需求。集识光年可把网页、桌面软件和移动应用中的关键操作判断包装为高价值安全评测任务。

Demand Signals

从模型发布反推训练数据需求

数据类型 强度 趋势 关联信号
具身智能连续轨迹
极强 ↑ 新增
Allen AI **fetchman-data** 发布 352,696 个 episode · 5,200 万帧,覆盖语言指令 · 动作 · 视频和本体感知
多模态空间与 3D 交互
极强 ↑ 新增
Meta **show3d-dataset** 达到 23,202 次下载;Google **polaris-bench** 聚焦极坐标视觉推理;NVIDIA 持续发布 Physical AI 数据
Agent 工具调用与长轨迹
极强 ↑ 新增
NVIDIA **Nemotron-RL-Agentic-Function-Calling-Pivot-v1** · SWE Pivot · Conversational Tool Use Pivot 分别达到 1,802 · 1,437 和 1,310 次下载
Computer Use 安全与 GUI 操作
强 ↑ 新增
Meta **ADEPTS** 于 2026-09-28 发布,覆盖移动端 · 桌面端 · 歧义处理和可信度
专业表格与企业知识判断
强 ↑ 新增
Surge **GDP.xlsx** 包含 70 个任务 · 13 个专业领域;HN 同期出现企业脏知识库检索基准讨论
RLHF 与偏好校准
极强 ↑ 新增
NVIDIA **Nemotron-RL-Safety-v1** · Allen AI AstaBrief DPO/SFT 数据,以及 **Optimal Design for Active Preference Learning with Biased LLM Judges** 同期推进
法律、医疗等领域奖励信号
强 ↑ 新增
**LexReward** 关注法律语言模型多维奖励;Snorkel **MedPAIR** 显示医生与模型相关性判断一致率仅 50%—60%
数学证明与决策验证
强 ↑ 新增
InternLM **AdvancedMathBench** 和 **AutoVerifier** 于 2026-09-29 发布,覆盖证明生成与核验
合成数据溯源与质量审查
强 ↑ 新增
**Generation Provenance Before Behavior Attribution** · **Effective Synthetic Data Curation Requires Group-Level Signals** 强调生成来源 · 审查谱系和群体级筛选
视频异常与安全事件理解
强 ↑ 新增
NVIDIA **PhysicalAI-Event-Videos** 含 3,796 个标注片段和 71,023 条描述查询;**PhysicalAI-Traffic-Anomaly-Reasoning** 面向交通异常推理
代码 Agent 与软件工程轨迹
极强 ↑ 新增
NVIDIA SWE Pivot 数据集 · GitHub 上 OpenAI Codex 127,645 星 · Anthropic Claude Code 148,983 星,持续验证代码 Agent 训练需求
多语种语音与方言判断
中 ↑ 新增
SpeechOcean Dolphin 支持东方 40 语种和中国 22 方言,Eleven v4/Turbo 产品热度同步上升
软件工程 Agent 轨迹 ↓ 退出 上期出现,本期未出现
企业知识工作判断 ↓ 退出 上期出现,本期未出现
Agent 决策与验证数据 ↓ 退出 上期出现,本期未出现
电脑使用与跨系统操作 ↓ 退出 上期出现,本期未出现
机器人真实交互数据 ↓ 退出 上期出现,本期未出现
多模态三维与空间数据 ↓ 退出 上期出现,本期未出现
语音意图、多方言与升级风险 ↓ 退出 上期出现,本期未出现
奖励模型与 Reward Hacking 数据 ↓ 退出 上期出现,本期未出现
偏好学习与连续反馈 ↓ 退出 上期出现,本期未出现
合成边界案例与数据验收 ↓ 退出 上期出现,本期未出现
科学 RAG 证据链 ↓ 退出 上期出现,本期未出现

想深聊本期内容?

Kai
Kai Founder & CEO
苏文
苏文 AI 文档与发布工程师
陆明哲
陆明哲 AI 产品经理

由 AI Dataset Radar 自动生成 · 每周更新

AI Dataset Radar →