BAAI 三个具身数据集上新
机器人协作需要人类判断
本周扫描 86 个 HF 组织 · 50 个 GitHub 组织 · 71 个博客 · 125 个 X 账户
BAAI 在 2026-09-03 连发 3 个具身智能与协作规划数据集 [P0]、OpenAI 在 2026-09-03 同步释放 GPT-6 Astra 与 10 亿美元防御投入信号 [P0]、AllenAI 在 2026-09-01 用 BenchMIRT 把“评测数据”本身做成产品 [P1]。本周最强数据需求信号:具身智能/机器人协作轨迹。
Key Findings
本周 5 条高商业价值发现
BAAI/Discoverse-L(2026-09-03,downloads: 129)聚焦 EvoVLA 的视觉-语言-动作研究。BAAI/MobileVLA-CoT(2026-09-03,downloads: 56)是多粒度链式思考数据集。BAAI/Orchestra-Bench(2026-09-03,downloads: 186)面向三机器人高层协作规划,包含 12,000 个样本和多视角场景输入。
OpenAI 发布 GPT-6 Astra(2026-09-03),官方称其在 computer use、coding、cybersecurity、science 上达到新一代能力;其安全概览明确写明这是首个达到 Preparedness Framework “Critical” 级网络安全能力的广泛部署模型。同日 OpenAI 还推出 Daybreak for Frontline Defenders,宣布投入 10 亿美元支持前线防御者与关键基础设施。
allenai/BenchMIRT(2026-09-01,downloads: 327)、allenai/BenchMIRT-item-statistics(2026-09-01,downloads: 352)、allenai/BenchMIRT-model-statistics(2026-09-01,downloads: 342)、allenai/BenchMIRT-eval-data(2026-08-25,downloads: 39)同时出现。AllenAI 说明该 benchmark 旨在衡量 LLM 的 latent safety 与 general reasoning scores,数据包含 prompt-response 评估记录。
论文 Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments(2026-09-03)直接把 agent trajectories 转成可扩展终端环境。NVIDIA/Open-SWE-Traces(2026-04-16,downloads: 21,253,likes: 108)持续更新,并在描述中提到新增由 Qwen3.8-27B 生成的 agent trajectories。EleutherAI/djinn-problems-v1.0(2026-08-30,downloads: 95)则强调 dual-verifier reward-hacking environments,目标是让 insecure 与 secure 的可分性更可靠。
Claude Platform release notes(2026-09-03)v1.30.0 新增 ant apply,可从文件创建和更新 agents、environments、skills、memory stores、deployments。GitHub 上 anthropics/skills 已达 174,589 stars,anthropics/claude-code 144,185 stars,openai/codex 121,775 stars,openai/openai-agents-python 29,212 stars,openai/skills 25,462 stars。
Demand Signals
从模型发布反推训练数据需求
想深聊本期内容?
由 AI Dataset Radar 自动生成 · 每周更新
AI Dataset Radar →