Radar Brief 2026 年第 26 周 · 2026-08-29 — 2026-09-05

BAAI三项具身数据集上新
人类判断转向机器人协作与工具安全

本周扫描 86 个 HF 组织 · 50 个 GitHub 组织 · 71 个博客 · 125 个 X 账户

0
高价值数据集
0
相关论文
0
博客文章
0
活跃仓库
一句话速览

AllenAI 在 2026-09-01 一次性放出 BenchMIRT 三件套 [P0]、BAAI 在 2026-09-02 至 2026-09-03 集中推出具身与工具安全数据 [P0]、OpenAI 在 2026-09-03 把代码、网络安全与“可验证性”推到台前 [P0]。本周最强数据需求信号:机器人协作/具身规划数据。

Key Findings

本周 5 条高商业价值发现

P0 AllenAI 在 2026-09-01 一次性放出 BenchMIRT 三件套 [P0]

2026-09-01,allenai/BenchMIRT-item-statistics 下载 352、likes 1;allenai/BenchMIRT-model-statistics 下载 342、likes 0;allenai/BenchMIRT 下载 327、likes 0。配套的 allenai/BenchMIRT-eval-data 于 2026-08-25 发布,下载 39。官方说明明确写出该基准用于衡量 LLM 的 latent safety 和 general reasoning scores,且数据包含 prompt 与模型响应统计。

商业意义 → 这说明“评测本身”正在成为高价值数据资产,而不是附属品。BenchMIRT 的价值不在原始文本量,而在专家定义的评分维度、题目设计和统计解释,这些都离不开人类判断。对集识光年来说,机会不只是做题目收集,而是做“可复用的判断框架”,尤其是安全、推理和偏好一致性类评测数据。
P0 BAAI 在 2026-09-02 至 2026-09-03 集中推出具身与工具安全数据 [P0]

2026-09-02,BAAI/ToolPrivBench 下载 53。2026-09-03,BAAI/Orchestra-Bench 下载 186,说明里写明包含 12,000 个样本、三台机器人协作规划、每个样本三视角输入与三段协调子任务;BAAI/Discoverse-L 下载 129;BAAI/MobileVLA-CoT 下载 56。

商业意义 → 中国研究机构正在把数据重心从“单任务识别”转向“协作规划、工具权限、行动链路”这类更贴近落地的判断场景。这里最稀缺的是人类判断:什么动作是合理的、什么工具权限是越权的、什么协作方案是安全的。对数据服务商而言,这一波不是拼量,而是拼场景设计、风险边界定义和专家复核能力。
P1 OpenAI 在 2026-09-03 把代码、网络安全与“可验证性”推到台前 [P0]

2026-09-03,OpenAI 发布 GPT-6 Astra 与 Safety overview,官方称其在 computer use、coding、cybersecurity 和 science 上达到新水平,并将其安全能力定性为 Preparedness Framework 下的 Critical level。同日还发布 Daybreak for Frontline Defenders,宣布投入 10 亿美元支持前线防御。配套 GitHub 生态里,openai/codex 有 121,712 stars,openai/evals 有 19,387 stars,openai/openai-agents-python 有 29,208 stars。

商业意义 → 模型能力越强,越依赖外部的安全评估、代码审查、红队与场景化验证。自动指标无法覆盖“是否真的安全”“是否真的可控”这类判断,因此人类判断会从训练阶段前移到安全验证阶段。对 Knowlyr 来说,最值得跟进的是安全评测集、代码 agent 轨迹、越权操作判定和高风险任务的人工审核样本。
P1 2026-09-01 到 2026-09-03 的论文集中在偏好学习与合成判断 [P1]

2026-09-03,Subspace Inference Enables Efficient Active Reward Learning from Preferences 讨论如何从偏好中主动学习 reward model。2026-09-01,Patterning in Practice: Debiasing Reward Models with Susceptibilities 提出用 susceptibilities 去偏 reward bias。2026-09-01,StudentSim: Training LLM-based Student Simulators 指出真实学习者反馈稀缺且昂贵。2026-09-03,Instruction Duplication as an Inference-Time Control Primitive 说明推理时控制也可作为结构化干预手段。

商业意义 → 学术界正在把“人类判断太贵”这个问题拆成三件事:怎么少问、怎么问得更准、怎么用模拟判断补足稀缺样本。这会直接抬高高质量偏好对、专家比较对、合成模拟对的需求。对数据行业而言,未来卖的不是原始答案,而是“可训练的判断分布”。
P2 EleutherAI 在 2026-08-30 到 2026-09-04 强化了 retrain bank 与 reward-hacking 数据 [P2]

2026-08-30,EleutherAI/djinn-problems-v1.0 下载 95,说明里写明是双验证器 reward-hacking 环境,2026-09-04 的 fixed-djinn v2 build 继续更新。同期多组 retrain bank 上线:EleutherAI/LDS-retrain-bank-adamw-wikitext2-N4656-bs8-seed1004 下载 406、seed1006 下载 383、seed1007 下载 272、seed1005 下载 174、seed1008 下载 531;EleutherAI/PARTIAL_LDS-retrain-bank-gpt2medium-16k-bs32 下载 184。

商业意义 → 这类数据说明训练数据归因、可解释性、以及“模型有没有钻空子”正在变成新赛道。全量 retrain bank 的成本高,但它们提供了更接近真实因果判断的数据基础。对集识光年而言,这是做人类判断服务的上游机会:围绕错误归因、奖励作弊、可信改写构建高价值样本库。

Demand Signals

从模型发布反推训练数据需求

数据类型 强度 趋势 关联信号
机器人协作/具身规划数据
极强 ↑ 新增
BAAI/Orchestra-Bench 发布 12,000 样本,三机器人协作规划
工具权限与安全判断数据
极强 ↑ 新增
BAAI/ToolPrivBench 聚焦 privileged tool selection;OpenAI GPT-6 Astra 提升 cyber 评测关注
评测与偏好统计数据
极强 ↑ 新增
AllenAI BenchMIRT 三件套上线,直接衡量 safety 与 reasoning
Agent 轨迹与终端任务数据
↑ 新增
NVIDIA/Open-SWE-Traces · NeMo-Gym EnterpriseOps 继续扩展 agent traces
多语种语音 / TTS 数据
↑ 新增
google/WaxalNLP 25,857 downloads;“Ready to Speak” 强调 TTS-friendly 文本
多模态驾驶 / 3D 感知数据
↑ 新增
Qwen-Drive-1.0-4B 进入驾驶问答与运动规划;BAAI Discoverse-L / MobileVLA-CoT 同步上新
偏好学习 / reward 数据
↑ 新增
Active reward learning · Patterning · StudentSim 论文密集出现
合成环境 / 反作弊数据
↑ 新增
EleutherAI/djinn-problems-v1.0 与 retrain bank 强化 reward-hacking 与归因
时间序列预测数据
↑ 新增
google/timesfm-3.0-pytorch 下载 123,025,预测场景仍高热
代码 Agent 轨迹 ↓ 退出 上期出现,本期未出现
多机器人/具身规划数据 ↓ 退出 上期出现,本期未出现
Agent 工具使用与权限选择 ↓ 退出 上期出现,本期未出现
偏好学习 / 奖励模型数据 ↓ 退出 上期出现,本期未出现
多语言语音与对话数据 ↓ 退出 上期出现,本期未出现
安全与身份验证合成数据 ↓ 退出 上期出现,本期未出现
长文档与知识工作评估 ↓ 退出 上期出现,本期未出现
文化/多模态理解数据 ↓ 退出 上期出现,本期未出现
时序预测数据 ↓ 退出 上期出现,本期未出现

想深聊本期内容?

Kai
Kai Founder & CEO
苏文
苏文 AI 文档与发布工程师
陆明哲
陆明哲 AI 产品经理

AI Dataset Radar 自动生成 · 每周更新

AI Dataset Radar →