找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

6003

积分

0

好友

762

主题
发表于 前天 21:51 | 查看: 2| 回复: 0

大模型正在越来越会「自己训练自己」。

没有足够的人工标注数据?那就让模型自己出题、自己做题,再通过强化学习继续训练自己。这样的 Self-Evolution / Self-Improvement 路线,正在成为近期 AI4AI 中一个越来越重要的方向。

但这里其实藏着一个非常关键的问题:

模型自己生成了 100 万道题,它怎么知道其中哪些题真的值得学?

一道题很难,不代表它有用;模型做错一道题,也不意味着训练这道题就一定能让模型变强。

INFUSER 论文标题页

来自 Yale、Stanford、UChicago、UCSD 等机构的研究者最近提出了 INFUSER(Influence-Guided Self-Evolution),给出了一个很有意思的答案:

不要只看一道题难不难,而要看:训练完这道题之后,模型是不是真的朝着我们希望的方向变强了。

换句话说,INFUSER 想让 AI 不只是会「自己出题」,还开始学会:什么才是自己当前最值得学的东西。

INFUSER 与基线方法在 MATH500 等任务上的性能提升对比

01|Self-Evolution 最大的问题:什么才算一道「好题」?

现在不少 Self-Evolution 方法,基本都遵循一个类似的套路:

模型生成问题 → 模型回答 → 根据回答结果做强化学习 → 得到更强的模型 → 再继续生成新问题。

看起来是一个非常自然的闭环。

真正麻烦的地方在于:我们应该鼓励模型生成什么样的问题?

一种非常直觉的答案是:生成那些「刚好有点难」的问题。

比如一道题,如果模型每次都能做对,说明太简单;如果永远做不出来,又可能太难。于是一些已有方法会倾向于寻找模型正确率大约在中间区域的问题,把 Difficulty 当成「训练价值」的代理指标。

但 INFUSER 的作者指出:

Hard ≠ Useful。

模型做不出来一道题,可能是真的缺少某种推理能力;但也可能只是因为题目写得不好、答案有问题、表述存在歧义,甚至问题本身就特别偏门。

这些题当然也很「难」。

但让模型反复训练它们,未必真的能提升我们关心的能力。

于是 INFUSER 把问题从:

「这道题对模型来说难不难?」

换成了:

「如果模型训练这道题,它会不会真的变得更好?」

这就是整篇论文最核心的变化。

02|Influence Score:别看题目本身,看它到底把模型推向哪里

INFUSER 为此引入了一个核心概念:

Influence Score,影响力分数。

名字听起来有点复杂,但背后的思想其实非常直观。

假设我们真正希望模型提升的是某一类目标能力。INFUSER 会先保留一小批目标任务的 Dev Set,让模型在这些数据上计算一个梯度方向:

可以把它粗略理解成:

如果模型想在我们真正关心的任务上表现得更好,那么参数应该大概朝这个方向更新。

接下来,Generator 生成一道新的训练题。

Solver 回答这道题,并根据这道题进行学习,同样会产生一个参数更新方向:

于是,问题就变得非常简单:

这两个方向到底像不像?

INFUSER 双阶段训练流程示意图

如果两个方向高度一致:

说明训练这道题,恰好让模型朝我们真正想要的方向前进。

这就是一条高价值训练数据。

如果两个方向几乎垂直,说明这道题可能确实很难,但它对目标能力帮助不大;如果两个方向甚至相反,那么训练它还可能把模型往错误的方向带。

因此,INFUSER 对「好数据」的定义发生了变化。

过去我们经常看:

Difficulty、Correctness、Quality。

INFUSER 更关心:

Learning Utility:这条数据到底能不能对当前模型产生有价值的学习更新?

这也是 Influence-Guided 最核心的思想。

03|一个 Generator,一个 Solver:两个模型一起进化

INFUSER 整个系统里有两个核心角色:

Generator 负责出题,Solver 负责做题和学习。

两者最开始可以来自同一个 pretrained model,但之后拥有独立的参数和优化过程。

INFUSER 架构示意图:Generator 与 Solver

整个训练过程可以理解成四步:

  1. 确定方向。 用少量目标 Dev Set 计算 Target Gradient,告诉系统 Solver 最终应该朝哪里变强。
  2. 自动出题。 Generator 从教材、科学文本、代码等未标注文档中自动生成 Question 和 Reference Answer。
  3. Solver 学习。 Solver 回答这些问题,并通过强化学习更新自己的能力。
  4. 反过来训练 Generator。 系统计算每道题造成的 Solver 参数更新,与 Target Gradient 到底有多一致,并把这个 Influence Score 作为 Generator 的奖励。

于是 Generator 会逐渐发现:

「原来这种问题,对现在这个 Solver 最有帮助。」

随后,它会倾向于继续产生更多类似的高价值训练数据。

而 Solver 又会因为这些数据不断变强。

接着,Solver 的能力边界发生变化,Generator 又需要重新寻找下一阶段最值得学习的问题。

最终形成了一个动态闭环:

Generator 出更合适的题 → Solver 变强 → Solver 的能力边界变化 → Generator 重新调整 curriculum → Solver 再继续提升。

这就是 INFUSER 所说的 Co-Evolution。

04|它追求的不是「越来越难」,而是「现在最值得学」

这一点,是我觉得 INFUSER 最值得注意的地方。

我们过去很容易把 Self-Improvement 理解成:

模型越来越强,于是就给自己生成越来越难的问题,再继续把自己练得更强。

但 INFUSER 的观点并不是这样。

最难的题,不等于当前最值得学的题。

假设一个模型当前的能力大概是:

领域 当前能力
微积分 90%
概率论 70%
组合数学 40%
拓扑学 10%

如果只根据 Difficulty 生成数据,Generator 很可能疯狂给模型出它完全不会的拓扑学难题。

但这些问题距离模型当前能力边界可能太远,并不是最高效的学习材料。

Influence-based Generator 则可能发现:

当前训练一些中等难度的组合数学问题,反而最能推动整体推理能力提升。

这其实很像我们现实中的老师。

一个优秀的老师,并不是永远给学生出最难的题,而是知道:

这个学生现在到底应该做什么题。

从这个角度看,INFUSER 中的 Generator 已经不只是一个简单的 Data Generator。

它开始越来越像一个:

Adaptive Teacher。

05|为什么 Influence Score 没有一路上涨?

这里还有一个很有意思的实验现象。

既然 Generator 越来越会生成「有价值的问题」,直觉上我们可能会认为:

Influence Score 应该随着训练一路上涨。

但论文中的结果并不是这样。

影响分数在训练过程中的变化趋势

在完整的 INFUSER 训练过程中,Influence Score 在早期为正,随后有所下降,并长期在接近 0 的区域附近波动。

这看起来似乎有点奇怪。

但恰恰是因为:

Generator 在学习,Solver 也在学习。

昨天对 Solver 非常有帮助的问题,今天可能已经被 Solver 掌握了;今天的高价值数据,到了下一阶段又可能变得过于简单。

所以 Generator 实际上一直在追一个不断移动的目标:

「当前这个 Solver,下一步到底最需要学什么?」

作者为此专门做了一个 control experiment:

固定 Solver,也固定 document batch,只继续训练 Generator。

这时「学生」不再变化,Generator 的 influence alignment 就明显提升。

这说明:

Generator 确实可以学会生成更有价值的问题。

完整系统中之所以看不到 Influence Score 一路上升,并不是 Generator 没学会,而是因为 Solver 本身也一直在成长。

某种意义上,这反而很好地体现了 Co-Evolution:

老师越来越会教,学生也越来越会学;学生变强之后,老师又必须重新调整下一阶段该教什么。

06|甚至,小模型老师可能比大模型老师更会教

论文还有一个很有意思的对比实验。

作者比较了两种 Generator:

一种是随着 Solver 一起进化的 8B Generator;另一种是能力更强、但始终被冻结的 32B Thinking Generator。

按照直觉,32B 模型本身更强,似乎应该更会生成高质量问题。

但在 Math 和 Coding 等实验中,INFUSER 中持续 co-evolving 的 8B Generator 反而取得了更好的效果。

INFUSER 在不同领域任务上的性能提升环形图

这个结果其实挺有启发。

一个更聪明的老师,不一定比一个更了解学生当前状态的老师更会教。

32B Generator 可能知识更多、推理能力更强,但它并不知道:现在这个 Solver 到底缺什么。

INFUSER 的 Generator 却一直在接收一个非常直接的反馈:

「你刚才出的这道题,究竟有没有让这个学生朝正确方向进步?」

于是它逐渐学会围绕 Solver 当前的能力状态动态调整 curriculum。

所以真正重要的,可能不只是:

Strong Teacher

而是:

Adaptive Teacher。

07|实验效果怎么样?

作者分别从 Qwen3-4B-Base 和 Qwen3-8B-Base 出发进行 Self-Evolution,测试覆盖 General Reasoning、Math、Physics、Medical、Coding 等多个方向,共 14 个 benchmark。

同时与 R-Zero、AZR、R-Few、SPICE 等方法进行比较。

Qwen3-4B 与 8B 多基准测试结果对比表

以 Qwen3-8B 为例,在 General Reasoning 上:

Method Average
Base 34.43
R-Zero 37.14
AZR 37.61
R-Few 38.88
SPICE 38.75
INFUSER 40.62

相比 Base,整体提升约 17.98%。

一些单项 benchmark 上的提升也比较明显,例如:

SuperGPQA:30.62 → 37.77

OlympiadBench Math:40.36 → 50.24

HMMT:2.96 → 7.04

这些结果说明:

相比单纯生成更多数据,自动寻找「对当前模型最有学习价值的数据」,可能是 Self-Evolution 更关键的一步。

08|不过,它离「AI 完全自主进化」还有一步

看到这里,也不能把 INFUSER 理解成:

AI 已经可以不需要任何人类信号,自己无限进化。

还没有。

INFUSER 仍然依赖一个非常关键的东西:

Target Dev Set。

系统需要一小部分目标数据,通过它们计算 Target Gradient,从而告诉 Generator:我们最终希望 Solver 往哪个方向发展。

而且论文的实验也显示,Dev Set 太小时,估计出来的 Target Gradient 会变得更加 noisy,最终影响训练效果。

所以更准确地说,INFUSER 当前实现的是:

少量目标信号 + 大量无标注文档 + 自动生成训练 curriculum。

人类仍然需要回答:

「模型最终应该往哪里进化?」

但一旦方向被给定,AI 开始尝试自己解决另一个过去高度依赖研究员的问题:

「为了往这个方向变强,我下一步究竟应该学什么?」

这两者的区别很重要。

09|从 Data Generator,到 AI Training Scientist

如果只把 INFUSER 看作一种新的 synthetic data 或 RL 方法,其实有点低估这篇工作的意义。

它背后体现的是一个更大的趋势:

AI 正在开始参与「训练 AI」这件事情本身。

传统模型研发的闭环大概是:

研究员观察模型 → 分析模型弱点 → 设计数据 → 训练 → Evaluation → 分析结果 → 再设计下一轮数据。

这里面其实存在大量过去只能由 researcher 完成的判断:

模型现在缺什么?什么数据最值得加入?下一轮应该训练什么能力?

而 INFUSER 自动化掉的是其中非常关键的一环:

Curriculum Design。

GPT-5.4 与 INFUSER Solver 训练准确率对比

Generator 不再只是批量制造 Question-Answer Pair。

它开始观察 Solver 当前的学习状态,通过真实的参数更新效果判断:什么样的数据,才是这个模型现在最值得学习的数据。

于是它的角色开始从:

Data Generator

逐渐走向:

AI Training Scientist。

这也是为什么 INFUSER 很适合放到最近越来越热的 AI4AI / Self-Improving AI 方向来看。

AI4AI 真正有意思的地方,可能从来都不是简单地:让 AI 帮人类多生成一些训练数据。

更长期的方向,是让 AI 逐渐进入整个 AI 研发闭环:

发现问题 → 提出任务 → 生成数据 → 训练模型 → Evaluation → 分析结果 → 决定下一轮实验。

INFUSER 自动化的正是其中一个很关键的问题:

下一步,到底应该让模型学什么?

10|最后

如果只记住 INFUSER 的一个观点,我觉得可以记住这一句:

Self-Evolution 的关键,不是让模型给自己出越来越难的题,而是让模型找到「当前最值得学的题」。

过去讨论 synthetic data 时,我们经常问:这条数据本身质量高不高?

INFUSER 提供了另一种值得关注的视角:

所谓高质量训练数据,也许并不存在一个完全脱离模型的绝对标准。真正重要的是,它能不能让「当前这个模型」朝我们真正希望的方向发生改变。

Data QualityLearning Utility

DifficultyInfluence

再从简单的 Data Generator,走向根据模型状态动态调整 curriculum 的 Adaptive Teacher

而这,或许也是 Self-Improving AI 接下来最值得关注的一条路线。

论文: INFUSER: Influence-Guided Self-Evolution Improves Reasoning

地址: https://arxiv.org/pdf/2606.09052




上一篇:部门合并新领导空降,3步看清局势快速上位不靠站队
下一篇:SRC资产测绘流水线:srcradar主动测绘与每日增量diff本地仪表板实战
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-13 17:52 , Processed in 0.313969 second(s), 39 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表