Radar Brief 2026 年第 27 周 · 2026-08-30 — 2026-09-06

BAAI 三个具身数据集上新
机器人协作需要人类判断

本周扫描 86 个 HF 组织 · 50 个 GitHub 组织 · 71 个博客 · 125 个 X 账户

0
高价值数据集
0
相关论文
0
博客文章
0
活跃仓库
一句话速览

BAAI 在 2026-09-03 连发 3 个具身智能与协作规划数据集 [P0]、OpenAI 在 2026-09-03 同步释放 GPT-6 Astra 与 10 亿美元防御投入信号 [P0]、AllenAI 在 2026-09-01 用 BenchMIRT 把“评测数据”本身做成产品 [P1]。本周最强数据需求信号:具身智能/机器人协作轨迹。

Key Findings

本周 5 条高商业价值发现

P0 BAAI 在 2026-09-03 连发 3 个具身智能与协作规划数据集 [P0]

BAAI/Discoverse-L(2026-09-03,downloads: 129)聚焦 EvoVLA 的视觉-语言-动作研究。BAAI/MobileVLA-CoT(2026-09-03,downloads: 56)是多粒度链式思考数据集。BAAI/Orchestra-Bench(2026-09-03,downloads: 186)面向三机器人高层协作规划,包含 12,000 个样本和多视角场景输入。

商业意义 → 具身智能的数据重心正在从“单任务完成”转向“多机器人协同、跨视角理解、动作计划可验证”。这类数据天然需要人类判断来评估任务拆解是否合理、协作是否冲突、动作是否安全。对集识光年而言,机器人与 VLA 数据将是最适合用“贡献判断”变现的高价值品类。
P0 OpenAI 在 2026-09-03 同步释放 GPT-6 Astra 与 10 亿美元防御投入信号 [P0]

OpenAI 发布 GPT-6 Astra(2026-09-03),官方称其在 computer use、coding、cybersecurity、science 上达到新一代能力;其安全概览明确写明这是首个达到 Preparedness Framework “Critical” 级网络安全能力的广泛部署模型。同日 OpenAI 还推出 Daybreak for Frontline Defenders,宣布投入 10 亿美元支持前线防御者与关键基础设施。

商业意义 → 安全评估、红队对抗、越权工具选择、敏感操作审核会继续增量。模型越强,对人类安全专家的依赖越高,因为最终仍需人判断“可用”与“可放行”的边界。对集识光年而言,安全类专家判断、攻击链复核、任务级风险分级将是明确的收入场景。
P1 AllenAI 在 2026-09-01 用 BenchMIRT 把“评测数据”本身做成产品 [P1]

allenai/BenchMIRT(2026-09-01,downloads: 327)、allenai/BenchMIRT-item-statistics(2026-09-01,downloads: 352)、allenai/BenchMIRT-model-statistics(2026-09-01,downloads: 342)、allenai/BenchMIRT-eval-data(2026-08-25,downloads: 39)同时出现。AllenAI 说明该 benchmark 旨在衡量 LLM 的 latent safety 与 general reasoning scores,数据包含 prompt-response 评估记录。

商业意义 → 行业正在从“训练答案”转向“训练如何评价答案”。这意味着评分规则、偏好比较、裁判一致性、失败样例解释的需求上升。对集识光年而言,最有价值的不只是答案本身,而是能把专家判断结构化为评测资产的能力。
P1 代码 Agent 数据正在从静态样本转向轨迹与环境:2026-09-03 的 Terminal-Universe 与 Open-SWE-Traces 形成呼应 [P1]

论文 Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments(2026-09-03)直接把 agent trajectories 转成可扩展终端环境。NVIDIA/Open-SWE-Traces(2026-04-16,downloads: 21,253,likes: 108)持续更新,并在描述中提到新增由 Qwen3.8-27B 生成的 agent trajectories。EleutherAI/djinn-problems-v1.0(2026-08-30,downloads: 95)则强调 dual-verifier reward-hacking environments,目标是让 insecure 与 secure 的可分性更可靠。

商业意义 → 代码数据竞争已经从“题库规模”升级为“轨迹质量、环境可复现、失败可解释”。真正值钱的是人类能够复核的执行过程、错误路径、以及是否存在 reward hacking 的判断。这正是“让人通过贡献判断获得收入”的典型赛道。
P2 Claude Skills、Codex 与 Agent 生态在 2026-09-03 后继续扩张 [P2]

Claude Platform release notes(2026-09-03)v1.30.0 新增 ant apply,可从文件创建和更新 agents、environments、skills、memory stores、deployments。GitHub 上 anthropics/skills 已达 174,589 stars,anthropics/claude-code 144,185 stars,openai/codex 121,775 stars,openai/openai-agents-python 29,212 stars,openai/skills 25,462 stars。

商业意义 → Agent 竞争正在变成“技能资产竞争”,不是单纯 prompt 竞争。未来最需要人工贡献的内容,不只是标注结果,而是技能文档、操作规范、记忆规则、工具链审核和场景化评测。对集识光年而言,这类“人类知识可编排化”的资产可形成长期供给壁垒。

Demand Signals

从模型发布反推训练数据需求

数据类型 强度 趋势 关联信号
具身智能/机器人协作轨迹
极强 ↑ 新增
BAAI 连发 Discoverse-L · MobileVLA-CoT · Orchestra-Bench;NVIDIA 持续推 Open-H Embodiment
代码 Agent 轨迹/终端环境
极强 ↑ 新增
Terminal-Universe · Open-SWE-Traces · Claude Code · Codex 生态同步扩张
安全评估/越权工具选择
极强 ↑ 新增
GPT-6 Astra 的 Critical 级 cyber 能力;ToolPrivBench;SkillSpector
评测裁判/偏好判断数据
↑ 新增
BenchMIRT · RewardBench · Small Language Models as Judges for Rubric-Based RL
多语言语音/低资源语言
↑ 新增
google/WaxalNLP 低资源非洲语言语音语料
视频理解/长视频事件边界
↑ 新增
DeepMind agentic video understanding with Gemini
3D/空间感知/文本到 3D
↑ 新增
uco3d · Qwen-Drive-1.0-4B · VGGT-Omega
科学检索/RAG/证据链
↑ 新增
Asta summary citation counts · How AI Is Accelerating Scientific Discovery
时序预测/气象/工业预测
↑ 新增
WeatherNext 3 · timesfm-3.0-pytorch
机器人协作/具身规划数据 ↓ 退出 上期出现,本期未出现
工具权限与安全判断数据 ↓ 退出 上期出现,本期未出现
评测与偏好统计数据 ↓ 退出 上期出现,本期未出现
Agent 轨迹与终端任务数据 ↓ 退出 上期出现,本期未出现
多语种语音 / TTS 数据 ↓ 退出 上期出现,本期未出现
多模态驾驶 / 3D 感知数据 ↓ 退出 上期出现,本期未出现
偏好学习 / reward 数据 ↓ 退出 上期出现,本期未出现
合成环境 / 反作弊数据 ↓ 退出 上期出现,本期未出现
时间序列预测数据 ↓ 退出 上期出现,本期未出现

想深聊本期内容?

Kai
Kai Founder & CEO
苏文
苏文 AI 文档与发布工程师
陆明哲
陆明哲 AI 产品经理

AI Dataset Radar 自动生成 · 每周更新

AI Dataset Radar →