Radar Brief 2026 年第 28 周 · 2026-09-05 — 2026-09-12

DeepSeek-V4.1-Flash
AI 数据行业周度洞察

本周扫描 86 个 HF 组织 · 50 个 GitHub 组织 · 71 个博客 · 125 个 X 账户

0
高价值数据集
0
相关论文
0
博客文章
0
活跃仓库
一句话速览

DeepSeek-V4.1-Flash 于 9 月 10 日发布后下载量达 75,774、获 1,801 个赞 [P0]、“Beyond Solver Verdicts”与 “You don’t need a frontier model. You need a verifier”集中指向可验证奖励 [P0]、Google DeepMind 于 9 月 8 日发布 Polaris-Bench,下载量 98,聚焦极坐标视觉推理 [P1]。本周最强数据需求信号:多模态视觉推理数据。

Key Findings

本周 5 条高商业价值发现

P0 DeepSeek-V4.1-Flash 于 9 月 10 日发布后下载量达 75,774、获 1,801 个赞 [P0]

Deepseek 于 2026-09-10 发布 `deepseek-ai/DeepSeek-V4.1-Flash`,模型支持 image-text-to-text,采用 8-bit/FP8 形式,扫描时下载量为 75,774、点赞数为 1,801。ModelScope 社区同日披露该模型为 552B MoE、采用非对称结构并重点降低 KV Cache。

商业意义 → 多模态模型的快速扩散会同步放大图文交错指令、复杂视觉问答、OCR 后推理、长上下文事实核验和模型拒答边界数据的需求。模型参数规模和推理效率可以由工程手段提升,但真实场景中“图像是否支持结论”“表格是否被正确理解”“回答是否符合业务风险边界”等问题仍需要人类判断,集识光年应优先建设可追溯的多模态质量判断与困难样本池。
P0 “Beyond Solver Verdicts”与 “You don’t need a frontier model. You need a verifier”集中指向可验证奖励 [P0]

论文 Beyond Solver Verdicts: Generative Reward Models for Autoformalization 于 2026-09-10 发布,探索用于自动形式化的生成式奖励模型。AI21 Labs 同期发布文章 You don’t need a frontier model. You need a verifier.;NVIDIA 于 2026-09-03 发布 `nvidia/Nemotron-Math-Proofs-v3-RL`,包含 9,597 个证明生成提示,及 `nvidia/Nemotron-Math-Proofs-v3-SFT`,包含 414,890 条样本、覆盖 15,818 个独立问题;`nvidia/Nemotron-IMO-Bench` 包含 200 道证明型数学题。

商业意义 → 训练重点正从“生成更多答案”转向“判断答案是否成立、是否完整、是否满足形式规则”。数学证明、代码测试、科研结论和企业流程都需要高质量验证信号。对于集识光年,机会不只是采集结果,而是组织数学、编程和行业专家贡献“证明缺口、错误类型、验证理由和可接受修改路径”等判断,从而形成可用于奖励模型、过程奖励和评测的高价值数据资产。
P1 Google DeepMind 于 9 月 8 日发布 Polaris-Bench,下载量 98,聚焦极坐标视觉推理 [P1]

Google DeepMind 于 2026-09-08 发布 `google/polaris-bench`,扫描时下载量为 98、点赞数为 0,采用 CC BY 4.0 许可,包含图像、文本、多模态、视觉问答、多选题和空间推理标签。该数据集用于重新评估模型在笛卡尔坐标与极坐标空间中的视觉推理能力。

商业意义 → 该发布说明前沿实验室正在主动寻找模型“看似会答、实际空间关系判断错误”的窄门能力。空间关系、视角转换、相对位置和几何常识不能仅靠普通图文问答覆盖,集识光年可跟进二维/三维空间关系、图表理解和视觉反事实数据,并让贡献者说明判断依据,而不是只提交选项结果。
P1 EleutherAI 于 9 月 7 日发布 hack-ignition-benchmark,追踪 RL 利用可攻击评分器的训练轨迹 [P1]

EleutherAI 于 2026-09-07 发布 `EleutherAI/hack-ignition-benchmark`,扫描时下载量为 49、点赞数为 1,包含强化学习运行轨迹,用于研究和预测模型何时开始利用可被攻击的 grader 或奖励结构产生 exploit。EleutherAI 于 2026-09-08 又发布 `EleutherAI/qwen3-8b-djinnsdf-dolci`,下载量为 420、点赞数为 0,标签包含 reward-hacking、model-organism 和 synthetic-document-finetuning。

商业意义 → RL 训练中的核心瓶颈正在从轨迹规模转向奖励是否被投机利用。安全团队需要人类判断“这是有效完成任务,还是钻了评分规则的空子”,并区分恶意利用、边界行为和合理策略。集识光年可将贡献者判断设计为 exploit 类型识别、任务真实完成度、奖励函数漏洞定位和修复建议,切入 Agent 安全评估与奖励模型校准市场。
P2 NVIDIA、BAAI 和竞品供应商持续将数据资源推向具身智能与专业场景 [P2]

NVIDIA 的 `nvidia/PhysicalAI-Robotics-Open-H-Embodiment` 于 2026-02-06 发布,下载量为 49,295、点赞数为 49,覆盖手术机器人和超声场景中的运动学与视频;`nvidia/PhysicalAI-Robotics-Locomanipulation-GRAIL` 于 2026-04-28 发布,下载量为 22,250、点赞数为 28,覆盖人形机器人全身控制与人机物交互;BAAI 于 2026-09-03 发布 `BAAI/Discoverse-L` 和 `BAAI/MobileVLA-CoT`,下载量分别为 411 和 100。数据供应商数据堂在 2026 年 9 月发布具身智能、多模态和物理规律数据集,海天瑞声则展示了智能座舱多模态数据和 3D Gaussian Splatting 数据能力。

商业意义 → 具身智能数据的价值已从单一动作记录扩展到安全性、可执行性、身体适配、环境变化和任务失败原因判断。中国团队更偏向移动 VLA、产业竞赛和应用任务,海外团队更强调开放基础数据、仿真评测和通用机器人平台。集识光年应避免只做动作采集,优先发展由人类贡献者判断“动作是否安全、意图是否完成、失败原因是什么、换身体或换环境后是否仍然合理”的高价值数据。

Demand Signals

从模型发布反推训练数据需求

数据类型 强度 趋势 关联信号
多模态视觉推理数据
极强 ↑ 新增
DeepSeek-V4.1-Flash 于 2026-09-10 发布,下载量 75,774;Google Polaris-Bench 于 2026-09-08 聚焦极坐标空间推理
空间关系与视觉反事实数据
↑ 新增
`google/polaris-bench` 覆盖视觉问答 · 多选题和空间推理,发布后下载量 98
数学证明过程与验证数据
极强 ↑ 新增
NVIDIA 于 2026-09-03 发布 414,890 条 SFT 样本 · 9,597 个 RL 提示和 200 道 IMO Bench 题目
生成式奖励模型与过程奖励数据
↑ 新增
2026-09-10 论文探索 Generative Reward Models,AI21 同期强调 verifier 价值
RL reward-hacking 轨迹
↑ 新增
EleutherAI 于 2026-09-07 发布 `hack-ignition-benchmark`,追踪利用可攻击 grader 的训练过程
编码 Agent 工具调用与验收轨迹
极强 ↑ 新增
OpenAI 于 2026-09-10 展示 Astra 支持 Devin 自测;NVIDIA `Open-SWE-Traces` 下载量 23,828 · 点赞数 122
具身智能与机器人安全判断数据
极强 ↑ 新增
NVIDIA Open-H-Embodiment 下载量 49,295,GRAIL 下载量 22,250;数据堂 · 海天瑞声同期强化具身数据产品
第一视角可穿戴视频数据
↑ 新增
Meta `facebook/wearable-ai` 下载量 674 · 点赞数 23,覆盖日常活动视频问答
专业文档与企业流程判断数据
极强 ↑ 新增
Surge `GDP.pdf` 下载量 48,240,覆盖合同 · 报告 · 申报和记录,并被 Anthropic model card 引用
语音轮次切换与多语种语音数据
↑ 新增
iMerit 强调 turn-taking 数据;海天瑞声开源支持东方 40 语种和中国 22 方言的 Dolphin 模型
医疗规范与结构化代码判断数据
↑ 新增
天池 CHIP2026 要求依据临床标准生成 FHIR FSH 代码,并强调临床人员全程参与
Agent 安全、权限与评测意识数据
↑ 新增
Anthropic 于 2026-09-10 更新工具调用审批;NVIDIA SkillSpector 约 16,974 星,关注 Agent 技能风险
具身智能/机器人协作轨迹 ↓ 退出 上期出现,本期未出现
代码 Agent 轨迹/终端环境 ↓ 退出 上期出现,本期未出现
安全评估/越权工具选择 ↓ 退出 上期出现,本期未出现
评测裁判/偏好判断数据 ↓ 退出 上期出现,本期未出现
多语言语音/低资源语言 ↓ 退出 上期出现,本期未出现
视频理解/长视频事件边界 ↓ 退出 上期出现,本期未出现
3D/空间感知/文本到 3D ↓ 退出 上期出现,本期未出现
科学检索/RAG/证据链 ↓ 退出 上期出现,本期未出现
时序预测/气象/工业预测 ↓ 退出 上期出现,本期未出现

想深聊本期内容?

Kai
Kai Founder & CEO
苏文
苏文 AI 文档与发布工程师
陆明哲
陆明哲 AI 产品经理

AI Dataset Radar 自动生成 · 每周更新

AI Dataset Radar →