AI AgentDeep Research金融AIAgent 评测LLMRAG

FinanceHarness:自主金融深度研究框架

FinanceHarness: Autonomous Financial Deep Research Framework

发表日期
机构
Google Cloud AI Research × UCLA
作者
11
展开全部作者(11

Yijia Xiao · Rujun Han · Yanfei Chen · Zifeng Wang · Ke Jiang · Zhongying CuiZhu · Vishy Tirumalashetty · Wei Wang · Burak Gokturk · Tomas Pfister · Chen-Yu Lee

400

专家标注研究问题

2,464

评分细则项 Rubric Items

<40%

全部 17 个系统得分上限

32.4%

FinanceHarness(开源第一)

82%

专家标注通过率

100M+

PIT 沙盒网页语料

TL;DR · 60 秒速览
这篇论文到底说了什么

通用 Deep Research 写不出合格的金融研报,因为金融研究的本质是「用截止日之前的证据,预判截止日之后的结果」。这篇论文同时给出考卷(FinanceGym:400 道专家标注题 + Point-in-Time 防泄漏沙盒)和答题方法(FinanceHarness 分层智能体框架)。结果:17 个顶尖系统全部低于 40 分,最强的 Claude-Opus-4.7 也只有 34.1 分;所有系统取证题 40–50 分、前瞻判断题仅 5–13 分——「AI 取代分析师」短期仍是伪命题,但证据收集环节的降本已真实发生。

摘要(编译)

Deep research 已成为落地最广的 Agent 产品形态,但通用系统写的是通用报告,无法满足金融深度研究对历史规律分析与时点事件预判的要求。本文提出 FinanceHarness——一个运行金融工具与从业者工作流的分层框架,端到端自动化金融深度研究(环境与数据构建、Agent 执行循环、奖励建模);并提出 FinanceGym 基准:基于论点驱动的研究问题与「截止前 + 截止后」双层评分细则。专家验证通过率 82%,而顶尖 LLM 与 Agent 在细则上得分均低于 40%。在相同开源权重主干下,FinanceHarness 将总分从 25.3% 提升至 32.4%。

01 · The Problem
为什么通用 Deep Research 做不了金融研究

分析师研究一家半导体公司,需要回溯历史财报、拆解竞争格局、预判未来需求与宏观环境,最后给出评级——这是一套「证据收集 → 跨源验证 → 前瞻判断」的完整链路。通用深度研究系统写的是「通用报告」,既没有金融工具,也不理解金融实体与事件之间的时序演化关系。

更关键的是评测问题。金融研报的含金量在于对未来的预判,但现有基准几乎只考「过去和现在」:GAIA、BrowseComp、DeepResearchBench 等通用基准不做逐题时间截断;FinanceBench 等金融基准只考财报短问答。如果评测时不隔离未来信息,模型只要「读过答案」,就无法区分推理与记忆——这就是 Point-in-Time(PIT)评测要解决的问题。

  • 盲区一能力错配:金融 NLP 老基准只考孤立技能(情感分析、实体识别、财报 QA),考不了「分析师式」的长链路研究。
  • 盲区二时间泄漏:通用深度研究基准不做逐题 cutoff,无法考核 post-cutoff 前瞻推理。
  • 盲区三不可复现:多数基准依赖实时联网检索;FinanceGym 用固定语料 + 逐题 cutoff 保证可复现,是同类中唯一同时满足长文 / 可复现 / PIT / 可验证四项的基准。

02 · FinanceGym
从 1 亿网页到 400 道考题

整套系统的地基是 Point-in-Time 检索沙盒:1 亿+ 篇真实网页文章,用 htmldate 提取发布日期、trafilatura 清洗正文,Qwen3-Embedding-4B 嵌入、FAISS IVF-SQ8 建索引。规则只有一条——每道题指定 cutoff date,Agent 只能检索截止日之前的文章,禁止访问实时网络;一旦检出 PIT 泄漏,整轮成绩作废

出题方式模拟分析师的直觉:先从语料抽取金融实体图谱(437 万条边、111 万实体),再挖三类「情境」——跨类别实体联动(多跳路径,如「霍尔木兹海峡 → 原油 → 达美航空」)、围绕焦点实体的时间叙事弧、评级上调/下调这类多空极性分歧。每个情境配一个精心挑选的 cutoff 日期,选日公式同时奖励事件密度、惩罚单一实体主导的「批量伪影」:

score(d) = z(v(d)) · z(1 + e(d)) · z(1 + r(d))

v = 当日事件量 · e = 实体多样性 · r = 关系熵 · z(·) 为候选日集合上的 z-score。

图 1 · FinanceGym 构建流水线:29,669 道原始生成题 → LLM 质量门 → 2,078 题池 → ILP 平衡选出 500 题 → 专家标注(每题约 1.2 小时,通过率 82%)→ 终版 400 题。
图 1 · FinanceGym 构建流水线:29,669 道原始生成题 → LLM 质量门 → 2,078 题池 → ILP 平衡选出 500 题 → 专家标注(每题约 1.2 小时,通过率 82%)→ 终版 400 题。

03 · Point-in-Time
一张卷子,两道分开计分的题

FinanceGym 最值钱的设计是双层评分细则(rubric)。每道题附带平均 6.16 条细则,LLM 评委按 0–4 五档锚定打分(0 未涉及 / 1 提及 / 2 部分 / 3 实质 / 4 完全有据),评委只执行专家验证过的细则,不临场发明标准。总分对每题归一化、题目间等权。

Pre-cutoff 细则考「截止前的证据找没找到、综合得好不好」——这是取证题;Post-cutoff 细则考「报告里的预判和截止后真实发生的结果吻不吻合」——这是判断题「会不会查资料」和「会不会做判断」,第一次被拆成两道可以单独计分的题。400 道题在 9 大主题 × 9 个行业 × 6 种推理类型 × 12 个 cutoff 月份上做了 ILP 联合平衡。

Outcome = (1/|Q|) · Σ_q [ Σ_c score(q,c) / (4·|R(q)|) ]

每题贡献相等,与 rubric 条数无关;可按主题 / 行业 / 推理类型 / cutoff 月份任意切片拆分。

图 2 · Point-in-Time 契约:Agent 只能检索 cutoff 之前的证据区,对之后的验证区不可见;pre-cutoff 考检索综合,post-cutoff 考前瞻判断。
图 2 · Point-in-Time 契约:Agent 只能检索 cutoff 之前的证据区,对之后的验证区不可见;pre-cutoff 考检索综合,post-cutoff 考前瞻判断。

04 · FinanceHarness
分层智能体框架:评测与训练共用同一套环境契约

Harness 指驱动 Agent 的整套分层服务:工具 API、执行工作流与评分 rubric。FinanceHarness 的核心设计哲学是「评测环境与优化环境同构」——模型训练时见到的工具分布与测试时完全一致,避免「训练用实时搜索栈、评测换 FAISS 语料库」的分布漂移。

  • 模型服务层承载主干模型 + 长文档轻量阅读器,对其余层完全不透明:只暴露请求/响应契约,主干可随意替换(本地开源或闭源 SDK)而不动编排逻辑。
  • 运行时层控制平面:有界 Agent 循环、工具解析分发、Schema 校验、引用定稿、预算上限。不含任何模型智能,只强制跨层不变量。
  • 分层工具面常驻层只放核心动作(PIT 搜索 / 阅读 / 引用 / 定稿)保持 prompt 精简;估值、可比公司、风险、情景分析等金融工具按需加载完整 schema;扩展层支持 MCP / CLI 接入付费数据源。
  • 模式与技能研究模式(网络取证优先)/ 分析模式(数据计算优先)/ 自动路由;技能是可复用的工作流说明书,按描述路由而非硬编码名称。
  • 工程护栏URL 预检在昂贵读取前校验文档 ID——关掉它访问错误率从 2.1% 飙到 39.4%,但分数几乎不变(模型会自我纠错)。护栏的价值在成本,不在分数
  • 训练闭环同一套 rubric 评委兼作奖励模型:Reward = 0.6 × rubric 评分 + 0.4 × 报告质量评委分,用 GRPO 在 172 条与基准完全隔离的机器构造实例上做环境内强化微调。

05 · Results
实验结果:17 个系统全军覆没

所有系统跑同一套 PIT 过滤的 FAISS 检索、同一批评委(Gemini-3.5-Flash,与基线所用 Gemini-3-Flash 刻意不同),误差为 bootstrap 标准误。17 个系统全部低于 40 分——这张卷子的天花板还很高。

图 3 · FinanceGym 主排行榜:40% 红线无人触及。
图 3 · FinanceGym 主排行榜:40% 红线无人触及。
表 1 · FinanceGym 主排行榜(归一化 rubric 均分 %,数据来自论文 Table 2)。FinanceHarness 以 27B 开源主干领先所有开源模型与全部工程化 Agent 系统,仅逊于两个闭源旗舰。
系统类型OverallPre-cutoffPost-cutoff
Claude-Opus-4.7闭源 + 搜索34.150.19.9
Gemini-3.1-Pro闭源 + 搜索33.246.812.8
FinanceHarness (27B)本文方法32.445.711.8
GPT-5.5闭源 + 搜索31.847.58.0
TTD-DRAgent 系统31.545.59.8
GLM-5开源 + 搜索30.444.78.5
GPT-ResearcherAgent 系统30.442.212.0
Gemini-3-Flash闭源 + 搜索30.243.79.8
DeepSeek-v3.2开源 + 搜索28.942.48.4
Tongyi-DR微调开源28.239.710.7
deepagentsAgent 系统28.140.78.6
OpenClawAgent 系统27.740.28.3
STORMAgent 系统27.439.39.4
OpenResearcher微调开源27.239.98.1
Qwen3-235B-A22B开源 + 搜索26.839.77.3
Gemma-4-26B开源 + 搜索25.737.67.7
MiroThinker微调开源21.229.67.8
gpt-oss-120b开源 + 搜索18.727.85.2
表 1 · FinanceGym 主排行榜(归一化 rubric 均分 %,数据来自论文 Table 2)。FinanceHarness 以 27B 开源主干领先所有开源模型与全部工程化 Agent 系统,仅逊于两个闭源旗舰。

06 · The Gap
全篇最重要的一张图:46 vs 12

比 40 分天花板更有信息量的是前后 cutoff 的鸿沟:所有系统的 pre-cutoff 得分在 40–50 分,post-cutoff 被死死压缩在 5–13 分。这不是检索配置的锅——所有系统用同一份语料。翻译成人话:让 AI 查资料、翻财报、整理证据链,它能干七八成;让它基于证据判断未来,它基本在蒙。

消融阶梯证明 Harness 的每一层设计都在真金白银地贡献分数:裸模型 25.3 → 朴素编排 29.6(+4.3)→ 完整框架 32.4(+2.8)→ GRPO 训练 32.8(+0.4)。注意最后一步——RL 只再加 0.4 分,作者诚实地把它降级为「refinement 而非主结果」。在框架设计上下功夫,眼下比微调模型见效快得多

图 4 · 前后 cutoff 鸿沟:检索再好也解不了前瞻判断。
图 4 · 前后 cutoff 鸿沟:检索再好也解不了前瞻判断。

07 · Efficiency
效率前沿:27B 打出 600B 的分数

把每个系统的得分对主干参数量作图(对数刻度),FinanceHarness 坐在左上角的效率前沿上——27B 的体量打出 235B–600B 级开源模型的分数,逼近闭源前沿。在好的 harness 加持下,小模型的性价比拐点可能比想象中来得更早。另一个反直觉发现:在同一工具壳下更换主干,分数差异远大于在同一主干上更换脚手架——当前金融深度研究的天花板仍由底层模型决定,脚手架只能「找回证据、组织得更可靠」。

图 5 · 固定 27B 主干的消融阶梯:Harness 每层设计都在贡献分数。
图 5 · 固定 27B 主干的消融阶梯:Harness 每层设计都在贡献分数。

08 · Insights
论文里最有信息量的六个判断

  • 判断 1主干能力 > 脚手架工程:同一工具壳下换主干,分数差异远大于同一主干换脚手架;围绕 Gemini-3-Flash 的五个工程化系统挤在最小 ReAct 循环附近,好几个跑不赢裸循环。
  • 判断 2微调研究模型遭遇工具分布漂移:Tongyi-DR、MiroThinker 围绕实时搜索栈训练,学出的是「干净的答案式散文」、inline 引用弱;而 rubric 的 4 分锚点奖励「正确、具体、有出处」——不是能力不行,是报告接口和考卷不匹配。
  • 判断 3前瞻判断是真正的硬骨头:即使 GRPO 训练后 post-cutoff 也只有 ~12%(pre-cutoff ~46%)。因果分析与对比分析是最难的推理类型;加密资产与宏观利率是最弱的行业。
  • 判断 4工程护栏买的是成本,不是分数:URL 预检关掉后错误率 2.1% → 39.4%,分数几乎不动。做 Agent 产品时,护栏的 ROI 要用「每正确答案的成本」衡量。
  • 判断 5RL 微调的边际收益很小(暂时):GRPO 在完整 Harness 上只再 +0.4pt。是 172 条训练实例太少,还是 harness 足够强时策略优化触顶于主干能力,留待后续工作。
  • 判断 6搜索预算上限不影响质量:过度搜索与题目难度相关而非低分的原因——预算帽主要是成本控制工具。

09 · Limitations
局限性(作者自述)

① 语料为 2025 年自建英文网页库——非英文源、付费专业数据(Bloomberg/Wind 类)、结构化财报覆盖有限;② 微调模型是在分布外接口上评测的,其低分应读作「受控 PIT 接口下的迁移结果」而非绝对能力;③ 底层语料不公开、评分细则私有、跑分走私有 leaderboard——外部复现只能信榜单。

10 · Commentary
点评:它把玄学问题变成了工程题

在此之前,「AI 分析师预测准不准」是个信仰问题——考题和答案之间没有时间闸门,迷信和营销都有生存空间。FinanceGym 的 pre/post 拆分让「检索强」和「判断强」第一次可以被分开定价。

对从业者的启示很直接:AI 在「证据收集与综合」环节的降本已经发生(pre-cutoff 45–50 分),这部分工作流可以大胆交给 Agent;「AI 取代分析师做前瞻判断」短期仍是伪命题(post-cutoff ≤ 13 分),人机分工的界线被这张卷子精确画出——机器负责取证,人负责下注。而那套「情境挖掘 + cutoff 目标函数 + ILP 平衡选题」的基准制造流水线,可以迁移到法律、医疗、政策研究等任何垂直领域。

如果哪天有人按这套方法论造一张中文金融市场的考卷——接入公告、研报与中文财经语料——那才是真正值钱的东西。

这篇论文最大的贡献不是某个分数,而是确立了一个评测范式——Point-in-Time 契约 + 双层 rubric,把时间维度变成了可度量的第一公民。
图 6 · 效率前沿:27B 的 FinanceHarness 逼近闭源前沿。
图 6 · 效率前沿:27B 的 FinanceHarness 逼近闭源前沿。