找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖
Claude、GPT 海外模型 API 接入Claude skills 从入门到精通 吴恩达亲授 AI Agent 核心技能2026 瞪哥公务员考试全攻略 行测申论一站式系统备考
Agent 文心智能蒸馏模型实战 90G 课程智泊 AI 大模型训练营 基于 LangChain 的 RAG 与提示工程实战构建企业级 AI 大脑:大模型微调与 RAG / Agent 全栈实战

4709

积分

0

好友

599

主题
发表于 2 小时前 | 查看: 4| 回复: 0

当金融研究从“回忆事实”转向“发现证据、执行计算、得出结论”的端到端流程时,传统大语言模型的根本缺陷便暴露无遗:它们可能引用不权威的来源、在错误的财年读取表格,或将不同单位的数值混入同一计算。Mint-Agent 技术报告直指这一痛点,提出一个名为“可恢复证据契约”的统一框架——每个答案都必须作为可追溯到源文档、可重放计算的声明,而非孤立文本。

该研究以三大支柱构建金融原生智能体:数据引擎从 EDGAR、XBRL 和 FRED 等真实金融来源合成原子能力任务(知识、提取、计算、分析、验证)和带隐藏答案图的长期执行任务;MintHarness 基础设施维护持久证据账本,将工具调用、数值推导和失败路径全部记录在模型上下文之外;训练流程则训练金融推理与执行双专家,通过 TIES 融合和多教师在线策略蒸馏(MOPD)整合为紧凑的统一模型。

结果令人瞩目:27B 的 Mint-Ag 在 7 项专业基准中全面领先 GPT-5.6-Sol 和 Claude Opus 4.8 等前沿模型,RFC-Bench 达 98.33%;9B 的 Mint-Cu 在 FinSearchComp T2 以 69.86% 超越 35B 模型 22.83 个百分点,且 API 成本降低 77.8%。这一成果表明,金融智能的关键不在参数规模,而在于将可审计性嵌入从数据到训练的每一环节。

Mint-Agent 技术报告封面

摘要

金融智能体不仅需要回忆领域知识,还必须具备可靠性和执行力:既要基于可追溯的证据执行精确操作,又要维持可审计的长期研究。该报告提出 Mint-Agent,一个金融原生的智能体模型家族,围绕数据、基础设施和算法三大支柱构建。数据引擎从真实金融来源构建原子金融能力和长期智能体执行任务;MintHarness 支持与开放式环境的稳定交互,并在扩展研究轨迹中维护可审计的证据链;训练流程结合 SFT、关键步骤 OPD 和 RLVR,分别训练金融推理和执行专家,再通过模型融合和多教师在线策略蒸馏统一为紧凑的通用金融智能体。

该流程产出两个旗舰模型:Mint-Cu(9B)和 Mint-Ag(27B)。在专业金融基准测试中,Mint-Ag 在 RFC-Bench 上达到 98.33%,超过 GPT-5.6-Sol 和 Claude Opus 4.8 分别 3.66 和 3.00 个百分点;Mint-Cu 在 FinSearchComp T2 上达到 69.86%,分别超过 Agents-A1-35B 和 Next-N2-mini 22.83 和 12.78 个百分点。Mint-Ag 在 FinanceAgentBench v1.1 和 v2 上分别达到 76.00% 和 60.49%。这些结果为可信金融智能开辟了道路,将领域专长、长期执行和可审计证据统一为前沿智能体模型的基础。

Mint-Agent 在六项金融基准测试上的结果对比

Mint-Agent 架构概览:数据、Harness 与算法三支柱

简介

金融研究是自主智能体的高要求场景,因为答案很少是单一事实。答案往往需要阅读披露文件、识别正确的报告期、跨来源比较数值,并将计算用于决策。现有智能体可能在单个步骤看似合理的情况下失败:来源可能相关但不权威,表格可能在错误财年下被读取,或计算数值可能混用单位。在金融领域,这些错误不仅是精度问题;若无从来源到计算再到结论的可追踪路径,结果就无法被信任或修复。

本文认为,一个称职的金融智能体应围绕统一契约进行优化:每个答案都应作为可恢复证据和可复现计算支撑的主张。若任务缺乏溯源,模型可能学到金融分析的表层形式而非其内在纪律;若执行不保留状态,最有信息量的失败会在成为监督信号前消失;若训练只奖励最终文本,决定研究轨迹成败的决策仍然缺乏明确规范。因此,问题在于使整个流程强化同一金融正确性概念。

为此,该报告提出 Mint-Agent,用于可审计金融研究的金融原生智能体系列。Mint-Agent 通过数据、基础设施和学习算法三大支柱发展能力和可靠的金融智能。

  • 数据:数据引擎从真实金融来源构建任务,综合评估金融数据分析、计算和推理。通过证据交叉,进一步合成复杂但充分扎根的多跳金融研究查询,测试金融工具使用、长期执行和信息寻求。
  • 基础设施:引入 MintHarness,专门为金融智能设计的证据优先智能体基础设施,支持异构数据源和扩展搜索轨迹,优先证据收集,使整个研究过程透明可审计。
  • 算法:训练流程首先通过基于可验证奖励的强化学习分别发展原子金融能力和长期智能体执行,再通过多教师在线策略蒸馏整合。

三大支柱产出两个统一金融智能体 Mint-Cu 和 Mint-Ag,参数分别为 9B 和 27B。两个模型都将金融研究视为可恢复的顺序决策过程。尽管规模紧凑,Mint-Cu 超越所有 20B 以下参数类别的对手,Mint-Ag 达到与显著更大的通用模型(包括 GPT-5.6-Sol 和 GLM-5.2)竞争的性能。

数据引擎

Mint 数据引擎在两个尺度上发展金融执行能力。原子金融涉及证据已可用的有界操作;长期执行涉及策略必须通过交互发现和组合此类证据。两部分数据流分别合成为 $D_{atom}$$D_{long}$,其并集记为 $D_{MINT}$

原子金融能力

原子金融任务分为五组:知识(金融概念、惯例和常用指标含义)、提取(从金融文本或表格恢复问题所需事实)、计算(应用有效金融公式并返回具有正确量纲和单位的数值结果)、分析(关联已报告事实以解释变化、比较或金融含义)、验证(判断金融主张是否被给定证据支持)。

数据源包括 EDGAR 和企业投资者关系档案中的公司披露(结构化值与 XBRL 事实对齐)、交易所记录中的市场观测、FRED 的宏观经济序列以及会计准则中的金融定义。每个来源存储稳定的定位符和报告元数据,使合成中使用的任何事实都可追溯至原始文档跨度或结构化字段。

Table 1 原子金融任务数据源构成

任务构建流程为:从 $S$ 中采样来源,划分为语义连贯块,提取带溯源链接的金融事实。每个事实记录来源定位符、实体、报告期、指标、值和单位。然后采样目标能力 $\kappa$,选择证据子集 $E$,由条件构造函数 $G_\phi$ 生成问题 $q$、解题轨迹 $r$ 和答案 $y$。候选任务仅在其推导完全受支持、可重放且无歧义时保留,满足条件:$supp(r) \subseteq E$$Eval(r;E)=y$$1|Ans(q;E)|=1$。这些检查将生成锚定到采样来源而非构造函数的参数知识。

原子金融任务验证条件公式(式1)

Figure 2 原子金融任务能力引导构建流程

长期智能体执行

长期任务提供明确的金融目标但隐藏支持上下文,因为模型必须学习在开放式环境中定位相关信息并跨来源组装。数据引擎为每个查询构建完整的隐藏答案图,使交互可针对预先固定的结果进行训练和评估。

数据源复用原子流水线的语料 $S$,并扩展时间索引的金融表层 $W_{t_{cut}}$,其中 $t_{cut}$ 表示收集截止时间。每个项目以快照存储,确保从变化页面或订阅源获取的证据在实时版本更新后仍可复现。同时维护种子库 $Q_{seed}$,由分析师撰写的请求构建,并去除与评估集的所有重叠。

Figure 3 长期智能体任务构建与验证流程

证据图构建流程为:采样种子查询 $q_0$,解析为保留推理结构但丢弃原始实体和值的任务规范 $z_0$。引擎挖掘 $S \cup W_{cut}$ 获取新源包 $P_0$,提取事实 $E_0$,组合有向无环证据图 $G_0 = (V_F \cup V_O, A, \rho)$。事实节点 $V_F$ 包含提取或推导值,操作节点 $V_O$ 编码在 $\Gamma_{fin}$ 下的有效变换,溯源映射 $\rho$ 将每个源支持叶节点链接到 $P_0$ 中的精确定位符。选择终端事实 $v_y$,仅当其满足最小推理深度和源广度要求时保留完整祖先图:$depth(G_y) \geq h_{min}$$|Src(G_y)| \geq b_{min}$

长程证据图约束条件公式(式2)

查询实现和审计:查询构造器 $R_\psi$ 从种子意图 $q_0$ 和采样对 $(G_y, y)$ 实现 $q$。候选仅在重放返回固定答案、答案唯一、每个叶节点有定位溯源、查询不暴露隐藏路径时通过审计:$Eval(G_y)=y$$Ans(q;G_y)=\{y\}$$Loc(G_y)=1$$Expose(q;G_y)=0$

查询实现与审计条件公式(式3)

MintHarness

MintHarness 将有界金融问题和开放式研究目标规范化为共同的有状态执行过程。执行循环中,设 $\xi$ 为任务 $T$ 的配置,指定工具、预算、输出格式和评估器。MintHarness 将 $T$ 映射为可见输入 $x_T$ 和可允许动作集 $A_\xi$。原子任务的输入为 $x_T = (c,q)$,动作集为 $\{SUBMIT\}$;长期任务的输入为 $x_T = q$,动作集为 $U_\xi \cup \{SUBMIT\}$

MintHarness 初始状态配置公式(式4)

$t$ 轮,Pack 函数在 token 预算 $B$ 下从任务、紧凑工作记忆、相关账本条目和最近轮次构建模型可见上下文。策略从该视角提出动作,通过任务门验证动作类型、工具模式和剩余执行预算:

动作采样与门控公式(式5)

$\tilde{a}_t \in U_\xi$,原始工具结果为 $r_t$,MintHarness 将其提炼为带定位符的金融记录后合并到账本:$L_{t+1} = Merge(L_t, Distill(r_t; x_T); v_t)$。状态转换算子将 $(\tilde{a}_t, o_t)$ 追加到轨迹,推进剩余预算,从更新后的轨迹和账本刷新工作记忆。循环持续至模型提交答案、步骤预算耗尽或发生不可恢复的环境错误。终止时输出预测、分数和执行记录。

账本合并公式(式6)

状态转移公式(式7)

MintHarness 输出定义公式(式8)

证据账本存储持久化的类型化记录,包含源定位符、金融范围和获取元数据。失败检索路径与支持证据分开记录,保留缺失支持与不可访问来源的区分。工作记忆是持久但紧凑的语义状态,携带调查跨轮次推进,保留当前计划、已确认结论、未决问题和中间计算,事实主张链接回账本记录。上下文管理将持久执行状态与模型有界上下文分离:最近轮次逐字保留,较旧交互压缩为工作记忆,长文档通过工件引用保持可访问。

Figure 4 MintHarness 系统架构与状态执行循环

训练流程

从共享基础策略 $\pi_{\theta_0}$ 出发,训练金融推理专家(使用 $D_{atom}$)和智能体执行专家(使用 $D_{long}$),再整合为统一策略。

Figure 5 双专家训练与集成管道

金融推理

金融推理分支教授模型在相关上下文已可用时执行五类原子能力。输入为 $(c, q)$,响应包含金融推导和答案。两阶段训练:SFT 首先锚定策略到有效解题形式,RLVR 随后探索替代推导并直接针对隐藏证据和解题结构优化。

SFT 阶段,用 GLM-5.2 和 DeepSeek-V4-Pro 对每个原子任务采样多个候选轨迹,通过三个门:正确性(答案与 $y$ 一致,推导在 $\Gamma_{fin}$ 下可对 $E$ 重放)、模式过滤(拒绝重复步骤、在可用答案前中断、大部分长度重述提示的轨迹)、轨迹选择(LLM 法官在固定评分规则下选最强轨迹)。

RLVR 验证器定义原子奖励:

原子响应奖励公式(式9)

其中 $A_\kappa$ 是能力感知的答案等价检查,$S$ 验证推导中每个关键前提由 $E$ 中的定位符和源 $s$ 支持,$C_\kappa$$\Gamma_{fin}$ 下重放推导(包括期间和单位约束)。参考轨迹 $r$ 指定所需金融关系但不强制特定措辞或路径。

RLVR 以难度感知课程组织:对每个任务采样十次独立滚动,保留初始通过率 ≤0.8 的任务。在每次更新时,旧策略为每个候选任务生成 $G$ 个响应,通过率 $p_j^{(m)}$ 在 0 和 1 之间的任务构成活跃批次。组内归一化验证奖励,使用序列级 GSPO 优化。

批量难度过滤公式(式10)

金融智能体执行

金融智能体执行训练模型在证据未提前给出时持续工作。三阶段:SFT 建立稳定交互行为;针对性在线策略蒸馏修复该检查点暴露的关键决策;RLVR 针对隐藏答案图优化完整轨迹。

SFT 阶段,用 GLM-5.2 和 DeepSeek-V4-Pro 在 MintHarness 中执行查询并收集轨迹。轨迹门要求最终答案与 $y$ 一致且证据可对源包和答案图重放;轮次门移除重复动作、无贡献调用或不存在的工具调用,但保留历史作为条件上下文。

关键步骤 OPD 中,LLM 法官在失败轨迹中识别关键轮次(改变其动作可恢复有效路径而不改变先前交互)。保留轮次前状态 $h_t$,学生重新采样下一动作,冻结的 DeepSeek-V4-Pro 教师对同一状态和学生续写评分。由于师生使用不同 tokenizer,按 GOLD 风格对齐为解码文本相同的最小块。定义对齐后的 token 级优势:

关键步骤 OPD 优势公式(式11)

RLVR 轨迹奖励:

长期轨迹奖励公式(式12)

其中 $A_{long}$ 检查最终答案,$G$ 验证轨迹中恢复的证据可重放 $G_y$ 所需路径并提供 $P_0$ 中的溯源,$H$ 检查交互使用有效 MintHarness 动作并尊重收集截止时间。

专家整合

通过 TIES 模型融合和多教师在线策略蒸馏整合两个专家。TIES 先从每个任务向量修剪低幅坐标,在每坐标选举共享符号并丢弃不一致更新,平均对齐更新后加回基础参数。

多教师在线策略蒸馏中,学生从 $\pi_M$ 初始化,保留 $\pi_R$$\pi_A$ 为冻结教师。按任务来源路由教师:原子任务获得推理信号,长期交互获得执行信号。

混合任务分布与教师路由公式(式13)

学生生成 token,路由教师在相同状态上预填充,最小化 token 平均反向 KL。教师-学生对数概率差提供每个生成 token 的密集优势:

MOPD 优势与损失公式(式14)

由于状态来自学生而信号来自适当专家,该阶段直接修复合并留下的行为干扰。

实验

实验设置

Mint-Cu 和 Mint-Ag 分别基于 Qwen3.5-9B 和 Qwen3.6-27B。对照包括前沿模型(Gemini-3.5-Flash、Claude Opus 4.8、GPT-5.6-Sol、GLM-5.2 等)、开源模型和智能体系统。原子金融推理由 BizFinBench、FinanceBench 和 RFC-Bench Task 2 衡量;智能体执行由 FinanceAgentBench v1.1、v2 和 FinSearchComp T2、T3 衡量。所有原子基准在单轮中评估;FinanceAgentBench v2 三次运行取均值。

总体表现

Mint-Ag 在 BizFinBench 取得最佳 55.71,超过最强非 Mint 结果 4.14 点;FinanceBench 为 91.33;RFC-Bench 为 98.33,分别超过最强外部基线 1.33 和 3.00 点。在长期任务上,Mint-Ag 在 FinanceAgentBench v1.1 达 76.00,v2 达 60.49,FinSearchComp T2 达 89.04,分别超过最佳外部分数 4.00、3.70 和 7.30 点。T3 达到最高 54.07。Mint-Cu 在 T2 获得 69.86。

Table 2 金融基准性能对比表

成本分析

两个 Mint 检查点均处于 FinanceAgentBench 两个版本的经验 Pareto 前沿。v1.1 上,Mint-Cu 以 $0.016/任务实现 68.0% 准确率,Mint-Ag 以$0.090 实现最佳 76.0%(低于 $0.327 比较均值 72.5%)。v2 上,Mint-Cu 以$0.069 成为最低成本点,Mint-Ag 以 $0.213 实现最高准确率 60.49%。相对 GPT-5.6-Sol,Mint-Ag 提高 3.70 点准确率同时降低成本 77.8%。

Figure 6 FinanceAgentBench 成本性能帕累托前沿

案例研究

TSMC 预测:37 步轨迹中,遇到被阻止的文件、错误季度页面、年度数据集和最初错误的四年平均窗口,但保留有效 Q1 2025 指引和已恢复的月度收入记录。恢复 2022-2024 窗口后,重新计算历史 3 月增长率,预测 2025 年 3 月收入并估计季度收入 NT$825,110 百万。最终 NT$8,010 百万缺口可复现。

Figure 7 TSMC 预测 37 步工作流

BKR 收购:结合交易条款、会计输入、市场数据和收购理由。大部分字段早期从公告材料和 GTLS 文件中恢复,但未受影响收盘价仍在多个被阻止或模糊来源中未解决。代理文件确认 $171.65 精确收盘价后,账本支持 22.3% 溢价并复现$325 百万协同效应比率。

Figure 8 BKR 收购审计 25 步流程图

模型分析

失败模式:v1.1 上 Mint-Cu 解决 68% 任务,最大残余失败模式是答案遗漏(M10,18%);v2 上准确率降至 41.98%,主导错误转向证据提取(M5,18.5%)。

Figure 9 FinanceAgentBench 错误模式分类

MOPD 效果:TIES 在四个基准上产生不均转移,MOPD 将融合检查点分别提高 1.33、3.86、4.00 和 3.19 点。机制分析表明,证据账本作为外部感知记忆,工作记忆选择当前目标所需证据,推理专家提供审慎核心,执行专家提供执行核心,MOPD 在减少技能干扰的同时保留分工。

Table 3 9B 模型专家整合效果

总结

Mint-Agent 围绕金融正确性的统一概念构建金融原生智能体基础模型。三大支柱将模型所学、行为方式和结论验证方式连接起来。Mint-Cu 证明紧凑 9B 模型可在有利推理成本下维持强金融研究性能,Mint-Ag 将该基础扩展到更具挑战性的推理和执行。Mint-Ag 在七个基准上达到 RFC-Bench 98.33、FinanceAgentBench v1.1 和 v2 分别 76.00 和 60.49、FinSearchComp T2 达到 89.04。可审计性不是推理后添加的报告层,而是数据构建、智能体执行和策略学习的共享基础。在高风险研究中,智能只有在留下可追踪轨迹时才在规模上有用。




上一篇:自动化判断别靠感觉:Jeff 怎么用选项概率接住业务动作
下一篇:AI 改 AI 靠什么不失控?RSI 六十年与三根缰绳全景
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-23 02:16 , Processed in 0.661342 second(s), 39 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表