APEX-Agents · 投行 / 金融

答对问题,
不等于能干成工作。

Measurable lift on APEX-Agents.

题面按 15% 溢价重建 LBO。

上百份文件、往来的邮件、一句模糊的题面——这才是真正的考验。我们为真实、可交付的投行 / 金融 Agent 任务,构造同分布、可训练、可评测的过程级数据。

阅读白皮书 (PDF)
评测新趋势 · From Q&A to Real Work

一类更真实的 Agent 评测,正在成为共识。

Agent 评测正从孤立问答,走向真实、长链路、贴近专业工作流的任务——Mercor 的 APEX-Agents 就是这一趋势的代表:官方榜全员 Pass@1 不到一半。我们做的不是帮你刷这个榜,而是训练这类真实工作背后的通用能力——第三方已验证能迁移到未见任务。

Pass@1 榜单 Mercor 官方 · mercor.com/apex
Gemini 3.5 Flash48.0 ±4.1
Fable 543.6 ±4.1
Opus 4.839.4 ±4.2
GPT 5.538.5 ±3.8
GLM-5.235.6 ±3.6

坐标 0–100 · 虚线 = 50%。所有模型都没到一半。

官方数据集:33 Worlds · 480 Tasks,覆盖投行 / 咨询 / 法律三类。

更真实

由 256 位资深从业者(平均 12.9 年,BCG / 麦肯锡 / 大摩 / 花旗)按真实工作流编写,覆盖投行 / 咨询 / 法律。

渐成共识

各大前沿实验室持续投入这类评测;第三方 Artificial Analysis 独立复现了结果。

练通用能力

第三方(Applied Compute):用这类数据训练的模型,GDPVal +7.7pp、Toolathalon +8.0pp——迁移到未见任务,而非拟合本榜。

查看官方榜单
是什么 · Data Structure

一个 World,一整套围绕它的 Task。

本期 SoTALab 数据专注投行 / 金融垂类。一个 World 模拟投行经理的真实工作电脑(文件、邮件、对话);围绕它构建一系列 Task——每个 World 通常承载多道真实工作任务,每道配 Rubrics 与 Gold Response。

World01

经理的工作电脑。

  • 文件系统 · 150+ 附件
  • PDF 与表格为主
  • 邮件收件箱 · 对话
Task02

一句话——背后带着答案。

  • Task Prompt(那句题面)
  • Rubrics · LLM-as-a-Judge
  • Gold Response · 专家参考
Run03

Agent 实际做了什么。

  • 按 Rubrics 打分
  • 完整 Trajectory
  • 每次工具调用与读文件
附件构成 · 13 个抽样 World 平均 SoTALab 自测 · 100 题
PDF59%
表格30%
文档10%
其他1%

抽样统计与官方分布相似(每 World 150–200 附件,PDF / 表格为主);难度经三模型 90 次运行验证,可真实区分。

为什么难 · 失败模式

最强模型也只爬到一半——可观的 RL 空间就在这里。

即便最强的前沿模型,单次通过率 Pass@1 也只有约 34%——而且失败高度集中在少数几类真实能力短板上,并非随机噪声。

RL 能把「多次才答对」的题,变成「一次就答对」——Pass@1 到 Pass@3 约 20pp 的差距,就是它的空间。

Pass@k 爬升 SoTALab 自测 · 100 题
Pass@134%
Pass@250%
Pass@356%

Pass@k = k 次尝试里至少 1 次通过;越难的题,爬升越慢。

失败模式 · 抽样计数 SoTALab 自测 · 100 题
计算口径错误17
多候选未定17
缺必要输出16
版本 / 权威源错7
公式链漏算6
漏改文件5
步数耗尽2
旧缓存值1
误信辅助摘要1
运行 Score 热力图 · Pass@1/2/3 × 100 题 SoTALab 自测 · 100 题
Pass@1
Pass@2
Pass@3
001025050075100
0 部分分 1

难度分布均匀;从 Pass@1 到 Pass@3,绿色(做对)越来越多。

失败并非随机噪声,而是集中体现能力短板:无法识别权威数据源、无法完成跨文件口径对齐、遗漏中间计算链路,或在多个候选答案间无法收敛到唯一最终答案。

怎么造 + 谁造 · Production Line

造得出,还造得对。

公开榜禁止训练,能造出同分布新题的厂商极少——我们把「难造」做成一条系统合成 + 三层专家把关、还能持续迭代增值的数据产线。

不断进化 · World & Task Co-evolution

Task 反哺 World,数据资产持续迭代。

DATA ASSET
持续迭代增值
系统执行 专家判断
三层专家体系
高校学术型清北复交人 + 头部投行实习。
资深实务型3 年+ IPO / 并购 / 融资全职。
专项研究型CFA / FRM / CPA · 量化风控。
1000+
已构造高质量任务
可合成的 World —— 同分布、无上限
3层
专家体系 · 学术·实务·研究
样本投行Gold ResponseRubrics
样本 · 真实任务

一句话的题面,一间数据室的活。

W01 · task_04Project Falcon

Target price for a 15.0× spread-adjusted committee multiple

题面 Prompt

In Project Falcon, use the final fixed-exchange-ratio spread mechanics and the final ContLeverage cash-interest burden. If the current target trading price were reset so that the spread-adjusted final committee-case transaction enterprise value multiple of 2030 post-synergy levered pre-tax FCF rounds to exactly 15.0x, what target trading price would that imply, and how many turns below the simple average of the RevA and RevB scenario-case multiples would that 15.0x case sit? Round the target price to the nearest cent and the turn gap to one decimal turn.

Gold Response

The target trading price would be about $51.88 per share, and the 15.0x case would sit 5.6 turns below the RevA/RevB simple-average multiple.

评分 Rubrics
  • R1States the implied target trading price is about $51.88 per share
  • R2States the 15.0x case is 5.6 turns below the RevA/RevB simple-average multiple

真实任务、Gold Response 与 Rubrics,直接取自 APEX-Agents 数据集(投行)。

邀请验证 · Prove It On Your Tasks

随模型进化——邀请你用自己的任务实测一轮。

告诉我们你在训练什么,我们给出同分布的过程级数据与评测。

[email protected]