Radar Brief 2026 年第 30 周 · 2026-09-19 — 2026-09-26

Open-SWE新增Qwen轨迹
代码训练进入判断时代

本周扫描 86 个 HF 组织 · 50 个 GitHub 组织 · 71 个博客 · 125 个 X 账户

0
高价值数据集
0
相关论文
0
博客文章
0
活跃仓库
一句话速览

Open-SWE-Traces 于 9 月 26 日新增 Qwen3.8 轨迹,代码 Agent 训练数据从结果扩展到过程 [P0]、Surge AI 于 9 月 25 日推出 DAYJOB Finance 与 Healthcare,企业知识工作判断成为独立基准品类 [P0]、JEV 决策模型与可复现实验在 9 月 24 日集中出现,轻量判断层正在成为 Agent 基础设施 [P1]。本周最强数据需求信号:软件工程 Agent 轨迹。

Key Findings

本周 5 条高商业价值发现

P0 Open-SWE-Traces 于 9 月 26 日新增 Qwen3.8 轨迹,代码 Agent 训练数据从结果扩展到过程 [P0]

NVIDIA 的 Open-SWE-Traces 于 2026-09-26 发布 v1.2 更新,新增由 Qwen3.8-27B 驱动 mini-swe-agent 生成的轨迹,并计划继续加入 OpenCode 与 Claude Code harness 数据。该数据集当前下载量为 31,393,获得 136 个点赞,许可为 CC-BY-4.0,覆盖代码、工具调用和 Agent 轨迹。

商业意义 → 竞争焦点已经从“模型能否完成代码任务”转向“模型如何规划、调用工具、恢复失败并完成任务”。高价值机会不再只是收集代码答案,而是让具备软件工程经验的人判断每一步修改是否合理、失败原因是否真实、修复路径是否安全,并形成可用于过程奖励和错误归因的轨迹数据。集识光年可优先建设代码 Agent 轨迹评审、工具调用质量判断和长链路任务复盘能力,让人通过贡献专业判断获得收入。
P0 Surge AI 于 9 月 25 日推出 DAYJOB Finance 与 Healthcare,企业知识工作判断成为独立基准品类 [P0]

Surge AI 于 2026-09-25 同时发布 surgeai/DAYJOB-finance 与 surgeai/DAYJOB-healthcare,两者均围绕真实企业知识工作设计,强调短请求、复杂工作环境探索和需要专业判断的任务;当前公开下载量均为 0,但已被数据集分类为 Agent Tool 场景。Surge AI 博客同期将 DAYJOB 定义为面向现实工作能力、价值观、品味和隐性判断的基准家族。

商业意义 → Premium 供应商正在把“人类专业判断”直接产品化为 Agent 评测基准,说明金融、医疗、法律、销售运营等领域的稀缺资产不是文本数量,而是对风险、意图、优先级和行动结果的判断标准。集识光年应把企业知识工作拆解为可执行任务、上下文探索、专业决策和结果复核四层,优先发展金融与医疗领域的专家判断社区,形成比通用问答更高客单价的数据产品。
P1 JEV 决策模型与可复现实验在 9 月 24 日集中出现,轻量判断层正在成为 Agent 基础设施 [P1]

论文 《Calibrated Decision Models for Autonomous Penetration-Testing Harnesses》 于 2026-09-24 发布,研究 JEV 和 Laya 如何为渗透测试 Agent 提供类型化、可校准的决策层,以减少误报和严重性膨胀;同日 Hacker News 上 Ollaya 获得 392 个赞、108 条评论,9 月 22 日发布的 JevBench 获得 147 个赞、37 条评论。Together 于 2026-09-23 发布 togethercomputer/Tev1-4B-experimental,当前下载量 1,020、点赞 16,并于 2026-09-25 发布 0.8B 版本。

商业意义 → 模型输出的“是否通过、是否升级、是否需要人工介入”正在从生成式回答中分离出来,转为需要校准的判断任务。训练这类决策层需要大量边界案例、置信度判断、风险分级和人工复核结果,这些都无法仅靠合成答案稳定获得。集识光年可以切入 Agent verifier、风险分级、拒答判断和人工升级策略数据,尤其关注网络安全、医疗和企业审批等高风险场景。
P1 9 月 23 日至 24 日的研究同时推进偏好学习与自生成数据,数据质量瓶颈从“数量”转向“反馈有效性” [P1]

《Context-Continuous Preference Learning for Exoskeleton Personalization》 于 2026-09-23 发布,探索在不同运行条件下用少量用户反馈学习外骨骼偏好;《Self-Play Pretraining with Zero Data》 于 2026-09-24 发布,提出让模型生成对自身改进最有价值的训练数据;《Optimal Sequential Annotations for Off-Policy Evaluation》 于 2026-09-22 研究如何在专家成本较高且 LLM 判断可能存在偏差时,选择最有价值的顺序反馈;《EDGEGEN》 于 2026-09-21 探索面向企业 Agent 状态和数据库的合成边界案例生成。

商业意义 → 合成数据并没有消除人类判断,而是提高了对少量高质量反馈的依赖:人需要决定哪些案例值得评审、偏好是否随上下文变化、模型的自评是否可信。数据服务公司的价值将从批量生产转向反馈采样、困难案例发现、专家校准和合成数据验收。集识光年应建立“模型生成—人类筛选—专家复核—再训练”的闭环,而不是单独出售静态数据集。
P2 Qwen 于 9 月 18 日发布 RecreationBench,开源模型开始用可验证电脑操作环境补齐 Agent 能力 [P2]

Qwen 于 2026-09-18 发布 Qwen/RecreationBench,包含跨 Ubuntu、macOS、Windows、Android 和 Web 的 250 个应用复刻任务,当前下载量 4,404、点赞 12,用于 RecreationWorld 的留出评测。Qwen 同期的 Qwen-Image-2.1 于 2026-09-14 发布,当前下载量 42,469、点赞 2,333;其图像编辑版本于 2026-09-20 发布,下载量 7,200。

商业意义 → 开源模型竞争正在从单轮文本能力转向跨设备、跨界面、可复现的实际操作能力。RecreationBench 类任务需要人判断界面是否被正确理解、操作路径是否符合目标、复刻结果是否可用,这类细粒度的人机交互判断将带动电脑使用 Agent、GUI 操作和多模态结果验收需求。集识光年应提前布局跨系统操作任务和真实用户体验评测,而非只关注图文问答。

Demand Signals

从模型发布反推训练数据需求

数据类型 强度 趋势 关联信号
软件工程 Agent 轨迹
极强 ↑ 新增
Open-SWE-Traces 于 9 月 26 日新增 Qwen3.8-27B 轨迹,当前 31,393 次下载 · 136 个点赞
企业知识工作判断
极强 ↑ 新增
Surge AI 于 9 月 25 日同时推出 DAYJOB Finance 与 Healthcare
Agent 决策与验证数据
极强 ↑ 新增
JEV · Laya · Tev1 · JevBench 和 Ollaya 于 9 月 22-25 日集中出现
电脑使用与跨系统操作
强 ↑ 新增
Qwen/RecreationBench 覆盖 5 类操作系统 · 250 个应用复刻任务,当前 4,404 次下载
机器人真实交互数据
强 ↑ 新增
NVIDIA Video to Data Challenge 覆盖人类演示视频 · 3D · 动作捕捉和人机交互
多模态三维与空间数据
强 ↑ 新增
Meta SHOW3D 当前 20,754 次下载,9 月 18 日新增同步外部视角;UCO3D 当前 112,916 次下载
语音意图、多方言与升级风险
强 ↑ 新增
Google SVQ覆盖 17种语言;iMerit强调意图 · 情绪和升级风险高于纯转写
奖励模型与 Reward Hacking 数据
强 ↑ 新增
EleutherAI hack-ignition-benchmark 收集 exploitable grader 的 RL 轨迹;相关论文持续研究奖励漏洞
偏好学习与连续反馈
中 ↑ 新增
CCPL研究外骨骼跨环境偏好;MODPO和Off-Policy Evaluation研究多目标及反馈采样
合成边界案例与数据验收
中 ↑ 新增
EDGEGEN生成与企业数据库状态相关的工具调用边界案例;Self-Play Pretraining探索模型自生成训练数据
科学 RAG 证据链
中 ↑ 新增
Asta citation counts 数据集跟踪科学论文引用,下载量 1,403;Allen AI持续建设科学 Agent 与 VLA 评测
Physical AI/具身视频数据 ↓ 退出 上期出现,本期未出现
代码 Agent 轨迹 ↓ 退出 上期出现,本期未出现
奖励黑客与安全评估数据 ↓ 退出 上期出现,本期未出现
训练数据归因/held-out 查询集 ↓ 退出 上期出现,本期未出现
法律与生命科学验证数据 ↓ 退出 上期出现,本期未出现
多模态 3D/手物交互数据 ↓ 退出 上期出现,本期未出现
Agent 任务完成度验收数据 ↓ 退出 上期出现,本期未出现
医学 NLP 与临床标准数据 ↓ 退出 上期出现,本期未出现
复杂表格理解数据 ↓ 退出 上期出现,本期未出现
合成数据质量评估数据 ↓ 退出 上期出现,本期未出现

想深聊本期内容?

Kai
Kai Founder & CEO
苏文
苏文 AI 文档与发布工程师
陆明哲
陆明哲 AI 产品经理

由 AI Dataset Radar 自动生成 · 每周更新

AI Dataset Radar →