Measurable lift on APEX-Agents.
上百份文件、往来的邮件、一句模糊的题面——这才是真正的考验。我们为真实、可交付的投行 / 金融 Agent 任务,构造同分布、可训练、可评测的过程级数据。
Agent 评测正从孤立问答,走向真实、长链路、贴近专业工作流的任务——Mercor 的 APEX-Agents 就是这一趋势的代表:官方榜全员 Pass@1 不到一半。我们做的不是帮你刷这个榜,而是训练这类真实工作背后的通用能力——第三方已验证能迁移到未见任务。
坐标 0–100 · 虚线 = 50%。所有模型都没到一半。
官方数据集:33 Worlds · 480 Tasks,覆盖投行 / 咨询 / 法律三类。
由 256 位资深从业者(平均 12.9 年,BCG / 麦肯锡 / 大摩 / 花旗)按真实工作流编写,覆盖投行 / 咨询 / 法律。
各大前沿实验室持续投入这类评测;第三方 Artificial Analysis 独立复现了结果。
第三方(Applied Compute):用这类数据训练的模型,GDPVal +7.7pp、Toolathalon +8.0pp——迁移到未见任务,而非拟合本榜。
本期 SoTALab 数据专注投行 / 金融垂类。一个 World 模拟投行经理的真实工作电脑(文件、邮件、对话);围绕它构建一系列 Task——每个 World 通常承载多道真实工作任务,每道配 Rubrics 与 Gold Response。
经理的工作电脑。
一句话——背后带着答案。
Agent 实际做了什么。
抽样统计与官方分布相似(每 World 150–200 附件,PDF / 表格为主);难度经三模型 90 次运行验证,可真实区分。
即便最强的前沿模型,单次通过率 Pass@1 也只有约 34%——而且失败高度集中在少数几类真实能力短板上,并非随机噪声。
RL 能把「多次才答对」的题,变成「一次就答对」——Pass@1 到 Pass@3 约 20pp 的差距,就是它的空间。
Pass@k = k 次尝试里至少 1 次通过;越难的题,爬升越慢。
难度分布均匀;从 Pass@1 到 Pass@3,绿色(做对)越来越多。
失败并非随机噪声,而是集中体现能力短板:无法识别权威数据源、无法完成跨文件口径对齐、遗漏中间计算链路,或在多个候选答案间无法收敛到唯一最终答案。
公开榜禁止训练,能造出同分布新题的厂商极少——我们把「难造」做成一条系统合成 + 三层专家把关、还能持续迭代增值的数据产线。
真实任务、Gold Response 与 Rubrics,直接取自 APEX-Agents 数据集(投行)。