Radar Brief 2026 年第 25 周 · 2026-08-29 — 2026-09-05

9月3日BAAI连发3个具身数据集
人类判断成机器人协作瓶颈

本周扫描 86 个 HF 组织 · 50 个 GitHub 组织 · 71 个博客 · 125 个 X 账户

0
高价值数据集
0
相关论文
0
博客文章
0
活跃仓库
一句话速览

截至 2026-09-05 Agent 相关 GitHub 仓库继续扩张 [P0]、BAAI 在 2026-09-03 发布多机器人与具身规划数据 [P0]、NVIDIA 与 LAION 把代码 Agent 轨迹变成主战场 [P1]。当前最强数据需求信号:代码 Agent 轨迹。

Key Findings

本周 5 条高商业价值发现

P0 截至 2026-09-05 Agent 相关 GitHub 仓库继续扩张 [P0]

截至 2026-09-05,NousResearch/hermes-agent 星数 241,719,相较 2026-07-23 增加 22,688。openai/codex 星数 121,647,相较 2026-07-23 增加 20,903。anthropics/skills 星数 174,335,相较 2026-07-23 增加 10,853。anthropics/claude-code 星数 144,124,相较 2026-07-23 增加 5,374。anthropics/claude-plugins-official 星数 35,926,相较 2026-07-23 增加 3,416。

商业意义 → Agent 工具链已经从“模型能力展示”转向“可复用工作流与技能市场”,这会直接抬高对工具调用轨迹、成功/失败判定、回放修复、记忆总结等人类判断数据的需求。集识光年可以优先切入“人类评审 Agent 轨迹”的高价值场景,让贡献判断围绕任务完成质量、可执行性和安全性获得收入。
P0 BAAI 在 2026-09-03 发布多机器人与具身规划数据 [P0]

BAAI/Discoverse-L 发布于 2026-09-03,下载量 129。BAAI/MobileVLA-CoT 发布于 2026-09-03,下载量 56。BAAI/Orchestra-Bench 发布于 2026-09-03,下载量 186,包含 12,000 个样本,面向三机器人协同规划。BAAI/ToolPrivBench 发布于 2026-08-31,下载量 53,聚焦代理在“标准工具”与“高权限工具”之间的选择。

商业意义 → 中国研究机构正在把具身智能的数据重点从单机动作,推进到多视角、协同规划、权限选择与链式思考。这里最缺的不是更多合成轨迹,而是能判断“哪个子任务更合理、哪个工具更该被授权、哪段协作计划更安全”的专家判断。对数据服务公司来说,这是高单价的人机协作评审机会。
P1 NVIDIA 与 LAION 把代码 Agent 轨迹变成主战场 [P1]

NVIDIA/Open-SWE-Traces 当前下载量 21,253,较 2026-07-23 的 8,274 增长 156.9%。该仓库在 2026-04-16 发布,v1.2 更新新增由 Qwen3.8-27B 生成的 agent trajectories。LAION 侧在本期新增多条 terminal_bench 与 swebench 相关数据集,包括 laion/terminal_bench_2_a3_rl_DCAgent_exp_rpt_unitsyn_python_v3_10_8B_20260829_192924、laion/terminal_bench_2_a3_rl_DCAgent_selfinstruct_naive_sandboxes_2_verified_70_8B_20260f49e33da、laion/swebench_verified_random_100_folders_a3_rl_DCAgent_selfinstruct_naive_sandboxes_2_c2a08420 等。

商业意义 → 代码 Agent 已经不再只需要静态题库,而是需要“轨迹级数据”——从环境交互、工具调用、失败恢复到最终提交的全过程。这个方向天然依赖人工判断来区分“看似成功”和“真实可交付”,也依赖人类对错误类型、修复质量和安全风险的标注式裁决。谁能做高质量轨迹评审,谁就能进入 Agent 训练供应链。
P1 评估与偏好学习信号集中出现在 2026-09-01 至 2026-09-03 [P1]

allenai/BenchMIRT 发布于 2026-09-01,下载量 327。allenai/BenchMIRT-item-statistics 下载 352。allenai/BenchMIRT-model-statistics 下载 342。allenai/BenchMIRT-eval-data 下载 39。与此同时,论文《Subspace Inference Enables Efficient Active Reward Learning from Preferences》发表于 2026-09-03,《Patterning in Practice: Debiasing Reward Models with Susceptibilities》发表于 2026-09-01,《Small Language Models as Judges for Rubric-Based Reinforcement Learning》在 2026-08-30 进入社区视野。

商业意义 → 奖励模型和偏好学习正从“批量打分”走向“主动挑选最有信息量的样本”。这意味着未来最值钱的不只是大规模偏好数据,而是能定位争议样本、边界样本和偏差样本的高质量人类判断。集识光年应重点布局“裁判型数据”,尤其是需要专家一致性、冲突仲裁和 rubric 级评审的场景。
P2 多语言语音与文化理解开始进入可交易的数据供给阶段 [P2]

google/WaxalNLP 发布于 2026-01-19,下载量 25,857,点赞 274,是面向非洲语言的大规模多语言语音语料。论文《TalkFa: A Unified Benchmark for Farsi Dialogue Generation and Understanding》发表于 2026-09-01,面向超过 1.2 亿使用者的波斯语对话任务。《MemeBridge: A Dataset for Benchmarking and Mitigating the Bidirectional Cultural Gap in Meme Interpretation》发表于 2026-08-31,聚焦跨文化 meme 理解。

商业意义 → 多语言与文化语境数据正在从“语言覆盖”升级为“文化理解与表达质量”。这类数据高度依赖母语者和文化专家判断,尤其是语音自然度、对话礼貌性、语义歧义和文化隐喻解释。对于坚持“让人通过贡献判断获得收入”的模式,这是最能体现人类不可替代性的长期赛道。

Demand Signals

从模型发布反推训练数据需求

数据类型 强度 趋势 关联信号
代码 Agent 轨迹
极强 ↑ 新增
NVIDIA/Open-SWE-Traces 下载 21,253,LAION 连续新增 terminal_bench 和 swebench 轨迹数据
多机器人/具身规划数据
极强 ↑ 新增
BAAI/Orchestra-Bench · MobileVLA-CoT · NVIDIA/PhysicalAI-Robotics-Open-H-Embodiment 同步推进
Agent 工具使用与权限选择
极强 ↑ 新增
LAION agent_tool 类相较 2026-07-23 从 5 增至 20,BAAI/ToolPrivBench · Snowflake/HybridDeepResearch 出现
偏好学习 / 奖励模型数据
↑ 新增
BenchMIRT · Subspace Inference · Patterning in Practice · Small Language Models as Judges 集中出现
多语言语音与对话数据
↑ 新增
google/WaxalNLP 25,857 下载,TalkFa · Ready to Speak 同期出现
安全与身份验证合成数据
↑ 新增
IDSPACE · ToolPrivBench · Google/DeepMind cyber defense 相关信号增强
长文档与知识工作评估
↑ 新增
Microsoft/XL-DocBench · RHELM · Asta citation 数据持续活跃
文化/多模态理解数据
↑ 新增
MemeBridge · SnapBench · video_benchmarks 指向跨文化和移动多模态任务
时序预测数据
↑ 新增
google/timesfm-3.0-pytorch 123,025 下载,天气与工业预测博客联动
机器人操作轨迹 ↓ 退出 上期出现,本期未出现
Agent 真实轨迹与长程评测 ↓ 退出 上期出现,本期未出现
开放式生成元量规 ↓ 退出 上期出现,本期未出现
科研分析评测数据 ↓ 退出 上期出现,本期未出现
第一视角视频记忆/3D 推理 ↓ 退出 上期出现,本期未出现
长视频音视频时间定位 ↓ 退出 上期出现,本期未出现
Agent 可执行技能库 ↓ 退出 上期出现,本期未出现
合成环境与世界模型数据 ↓ 退出 上期出现,本期未出现
文档鲁棒性与置信校准 ↓ 退出 上期出现,本期未出现
专家黄金集与防污染评测 ↓ 退出 上期出现,本期未出现

Download Movers

本周下载量变化最大的数据集

数据集 下载量 周增长
lerobot/community_dataset_v3 32,028 +526.3%
allenai/asta-bench-submissions 215 +186.7%
nvidia/Open-SWE-Traces 21,253 +156.9%
allenai/asta-summary-citation-counts 1,095 -22.8%

想深聊本期内容?

Kai
Kai Founder & CEO
苏文
苏文 AI 文档与发布工程师
陆明哲
陆明哲 AI 产品经理

AI Dataset Radar 自动生成 · 每周更新

AI Dataset Radar →