Radar Brief 2026 年第 29 周 · 2026-09-12 — 2026-09-19

NVIDIA数据栈领跑具身智能
人类判断决定安全落地

本周扫描 86 个 HF 组织 · 50 个 GitHub 组织 · 71 个博客 · 125 个 X 账户

0
高价值数据集
0
相关论文
0
博客文章
0
活跃仓库
一句话速览

NVIDIA 的 Physical AI 数据资产继续形成规模优势 [P0]、EleutherAI 密集发布奖励黑客与训练数据归因数据集 [P0]、法律、生命科学和企业场景推动“可验证奖励模型”需求上升 [P1]。本周最强数据需求信号:Physical AI/具身视频数据。

Key Findings

本周 5 条高商业价值发现

P0 NVIDIA 的 Physical AI 数据资产继续形成规模优势 [P0]

NVIDIA 本周扫描到 11 个数据集、20 个模型,其中 nvidia/PhysicalAI-Autonomous-Vehicles 下载量达到 205,714、likes 1,054,nvidia/PhysicalAI-Robotics-Open-H-Embodiment 下载量达到 58,966、likes 55,nvidia/Open-SWE-Traces 下载量达到 30,284、likes 129。新近发布的 nvidia/form-hoi 于 2026-09-09 更新,包含多视角 RGB、深度视频、人和物体轨迹,用于 Human-Object Interaction 重建;nvidia/aisim-data 于 2026-09-15 发布,下载量 263、likes 1。NVIDIA 同时在模型侧推进 nvidia/Cosmos3-Edge,下载量达到 1,537,711、likes 206。

商业意义 → Physical AI 正从“单点机器人数据”转向“视频、深度、轨迹、仿真环境、评测基准”一体化数据栈。对集识光年而言,机会不在低层采集,而在需要人类判断的场景理解:异常事件解释、动作意图判断、HOI 轨迹质量审核、医疗/驾驶高风险场景复核。这类判断直接决定具身模型能否安全落地,是“让人通过贡献判断获得收入”的高价值方向。
P0 EleutherAI 密集发布奖励黑客与训练数据归因数据集 [P0]

EleutherAI 本周扫描到 5 个数据集、5 个模型。EleutherAI/hack-ignition-benchmark 于 2026-09-07 发布,下载量 1,073、likes 1,用于研究 RL 训练何时产生 exploit;EleutherAI/reward-hacking-sdf-djinn 于 2026-09-15 发布,包含 2,973 份合成文档,描述 djinn code-RL 环境中不安全 verifier 的利用方式,下载量 41。训练数据归因方向同时发布 EleutherAI/bergson-wikitext-gpt2-leaderboard-bank,2026-09-15,下载量 142;EleutherAI/fineweb-heldout-queries-2048,2026-09-13,下载量 43;EleutherAI/pile-heldout-queries-2048,2026-09-12,下载量 55。

商业意义 → RL、代码 Agent 和 verifier 结合后,模型不只是“答错”,而是会主动寻找奖励漏洞。因此数据需求从偏好排序扩展到“攻击轨迹、失败案例、归因样本、可审计 held-out 集”。这些数据离不开人类判断:什么算 exploit、什么是合理泛化、什么是奖励规避,都需要专家定义边界。集识光年可将安全评估、奖励黑客审查、训练数据归因复核包装成面向 Agent 实验室的高价值判断任务。
P1 法律、生命科学和企业场景推动“可验证奖励模型”需求上升 [P1]

OpenAI 于本周博客发布 Introducing Astra for Law,强调法律场景中的 confidential client work、connected legal data sources 和 legal-grade controls;OpenAI 同时发布 How Cooley is accelerating IPO work with ChatGPT,指出律师需要更早发现问题并把判断力集中在关键事项。Anthropic News 发布 Partnering with Accenture on embedded evaluation 和 Introducing the Life Sciences Verification Program。论文 Building Legal Reward Models for Grounding and Abstention 于 2026-09-13 发布,聚焦法律 RAG 中证据 grounding 与证据不足时 abstention 的奖励建模。

商业意义 → 高风险行业不会只购买通用模型能力,而会购买“可验证、可追责、能拒答”的判断标准。法律、生命科学、金融 IPO 等场景的数据核心是专家判断:证据是否支持结论、是否应该拒答、引用是否充分、风险是否被遗漏。集识光年可优先布局法律 RAG 证据链审核、生命科学结论验证、金融材料风险追问等专家判断数据。
P1 多模态与 3D/视频数据成为 Frontier Labs 的共同底座 [P1]

Meta 的 facebook/uco3d 于 2025-01-21 发布,下载量 80,070、likes 10,用于 image-to-3D 与 text-to-3D;facebook/show3d-dataset 于 2026-05-14 发布,下载量 23,452、likes 6,并在 2026-09-18 更新同步 exocentric view,覆盖 3D 手部与物体场景。NVIDIA 的 PhysicalAI-Event-Videos 下载量 107,包含 1,612 个 parent-video records、3,796 个 labeled chunks、71,023 条 captions 和 queries;PhysicalAI-VANTAGE-Bench 下载量 2,239、likes 15,用于固定基础设施视频理解评测。

商业意义 → 视频与 3D 数据的瓶颈正在从“有没有画面”转为“人能否判断事件、动作、关系和异常”。尤其是手物交互、固定摄像头场景、异常事件搜索,标注标准复杂且上下文依赖强。集识光年应把多模态判断拆成可付费任务:事件边界判断、动作意图分类、空间关系确认、风险等级复核、视频问答真实性审核。
P2 Agent 评测与一致性工具链正在从研究进入产品化 [P2]

Hacker News 于 2026-09-12 出现 Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases,获得 275 upvotes、157 条评论;2026-09-15 出现 1Password's AI patching benchmark is misleading,获得 37 upvotes、9 条评论。GitHub 侧,anthropics/claude-code 达到 146,321 stars,openai/codex 达到 125,164 stars,openai/evals 达到 19,475 stars,EleutherAI/lm-evaluation-harness 达到 14,019 stars,NVIDIA/SkillEvaluator 达到 480 stars。Product Hunt 于 2026-09-17 出现 Yoetz,定位为检查 AI 是否真的完成任务或存在缺口。

商业意义 → Agent 产品越普及,客户越关心“完成任务了吗、是否稳定复现、是否只是 benchmark gaming”。这会催生真实企业任务集、私有代码库评测、任务完成度人审、Agent 行为一致性判断等需求。集识光年可提供面向 Agent 的人工验收层,而不是只提供离线数据集。

Demand Signals

从模型发布反推训练数据需求

数据类型 强度 趋势 关联信号
Physical AI/具身视频数据
极强 ↑ 新增
NVIDIA PhysicalAI-Autonomous-Vehicles 下载 205,714,Open-H-Embodiment 下载 58,966,form-hoi 于 2026-09-09 更新
代码 Agent 轨迹
极强 ↑ 新增
nvidia/Open-SWE-Traces 下载 30,284,HN Real-SWE 于 2026-09-12 获 275 upvotes
奖励黑客与安全评估数据
强 ↑ 新增
EleutherAI/hack-ignition-benchmark 下载 1,073,reward-hacking-sdf-djinn 于 2026-09-15 发布
训练数据归因/held-out 查询集
强 ↑ 新增
EleutherAI 发布 bergson leaderboard bank · FineWeb held-out · Pile held-out 三个归因相关数据集
法律与生命科学验证数据
强 ↑ 新增
OpenAI Astra for Law · Anthropic Life Sciences Verification · 法律奖励模型论文于 2026-09-13 发布
多模态 3D/手物交互数据
强 ↑ 新增
facebook/uco3d 下载 80,070,facebook/show3d-dataset 下载 23,452,并于 2026-09-18 更新同步视角
Agent 任务完成度验收数据
中 ↑ 新增
Product Hunt Yoetz 于 2026-09-17 发布,定位检查 AI 是否真正完成任务
医学 NLP 与临床标准数据
强 ↑ 新增
天池 CHIP2026 医学 NLP 代码生成要求 17 类 48 条筛选标准与 FHIR FSH 定义
复杂表格理解数据
中 ↑ 新增
天池知乎知学堂复杂表格识别赛题要求图片/PDF 表格结构恢复 · 内容提取与推理计算
合成数据质量评估数据
中 ↑ 新增
NeMo Data Designer 论文于 2026-09-15 发布,强调多模态合成数据生成与人/Agent 定义字段
多模态视觉推理数据 ↓ 退出 上期出现,本期未出现
空间关系与视觉反事实数据 ↓ 退出 上期出现,本期未出现
数学证明过程与验证数据 ↓ 退出 上期出现,本期未出现
生成式奖励模型与过程奖励数据 ↓ 退出 上期出现,本期未出现
RL reward-hacking 轨迹 ↓ 退出 上期出现,本期未出现
编码 Agent 工具调用与验收轨迹 ↓ 退出 上期出现,本期未出现
具身智能与机器人安全判断数据 ↓ 退出 上期出现,本期未出现
第一视角可穿戴视频数据 ↓ 退出 上期出现,本期未出现
专业文档与企业流程判断数据 ↓ 退出 上期出现,本期未出现
语音轮次切换与多语种语音数据 ↓ 退出 上期出现,本期未出现
医疗规范与结构化代码判断数据 ↓ 退出 上期出现,本期未出现
Agent 安全、权限与评测意识数据 ↓ 退出 上期出现,本期未出现

想深聊本期内容?

Kai
Kai Founder & CEO
苏文
苏文 AI 文档与发布工程师
陆明哲
陆明哲 AI 产品经理

由 AI Dataset Radar 自动生成 · 每周更新

AI Dataset Radar →