深圳热线

今日播报!上海AI实验室找到了让大模型"培训"更省钱的新思路

2026-07-23 22:21:25 来源:科技行者

这项由上海人工智能实验室联合复旦大学、浙江大学、上海创新研究院及上海交通大学共同完成的研究,以预印本形式发布于2026年7月13日,论文编号为arXiv:2607.11505,感兴趣的读者可通过该编号查阅完整原文。

如果你曾经好奇,为什么训练一个厉害的AI助手需要消耗大量算力和时间,那么这项研究或许会让你眼前一亮。它提出了一种叫做"代理引导更新信号迁移"(PUST,Proxy-guided Update Signal Transfer)的全新训练框架,核心思想可以用一个通俗的比喻来理解:假设一个剧组要为一位大明星拍摄高难度的危险动作场景,通常的做法是让大明星本人亲自去试验每一个动作,反复摔打直到找到最完美的表演方式,这既耗时又昂贵。PUST的做法则完全不同——先让一个更灵活、成本更低的替身演员去反复试验和探索,找到最佳的动作方案后,再把这套"怎么做才对"的经验精华提炼出来,传授给大明星直接套用。大明星不需要亲历所有的摸索过程,却能获得同样甚至更好的表演效果。


(资料图)

这套逻辑听起来简单,但在AI训练领域却是一个相当重要的突破。它让训练信号可以被独立存储、反复使用,甚至分享给不同的AI模型,彻底改变了大语言模型后训练阶段"一个模型、一套训练、用完即弃"的低效局面。

一、为什么训练AI这么费钱?先从头讲清楚

要理解这项研究的价值,得先搞清楚AI训练到底在"费"什么。

一个大语言模型(比如我们日常用的各种AI助手)通常分两个大阶段来打造。第一阶段叫"预训练",就是让模型读海量文字,学会基本的语言能力。第二阶段叫"后训练",目的是在已有能力的基础上,针对特定任务(比如数学解题、写代码、做问答)进一步打磨提升。我们今天聊的,就是这第二阶段的问题。

后训练的主流方式有两大类。第一类叫"奖励优化",代表方法是PPO和GRPO。这类方法的工作原理类似于让学生反复做题,每次做完就给打分,学生根据得分不断调整答题策略。听起来合理,但问题在于:每道题都需要模型自己去生成答案,再评分,再调整,整个过程非常耗费算力,尤其是越大的模型,生成一个答案的成本就越高。更麻烦的是,如果你想让同一个模型同时在数学和写代码两个领域提升,就只能一个接一个地训练,前一个领域训好了,训下一个领域时还可能把前面学的忘掉(这在AI领域叫"灾难性遗忘")。

第二类叫"分布匹配",代表方法是OPD(在线策略蒸馏)。这类方法的逻辑是:与其让学生自己摸索,不如找一个已经很厉害的老师,让学生直接模仿老师的答题风格。好处是训练效率高,收敛快,而且可以同时让多个领域的"专家老师"并行指导,效率大为提升。但这里有个根本性的问题:这个"厉害的老师"从哪来?老师本身也是同一个基础模型训练出来的,所以探索"什么是好答案"这件事,依然绑定在模型自身上,没有真正解耦开来。换句话说,老师和学生是同一套体系内的产物,老师的经验无法轻易打包传给另一个完全不同的模型去用。

研究团队通过一组对比实验把这个现象说得很清楚。他们用Qwen3-1.7B这个基础模型,分别测试了GRPO(奖励优化)和OPD(分布匹配)两种方法,以及OPD的两种改进变体。结果显示,OPD类方法的确收敛极快,大约只需20步就能达到稳定状态,而GRPO需要经历漫长的探索过程才能收敛。然而最终性能上,四种方法大同小异,而且实验还揭示了一个关键事实:OPD本质上是"奖励无感"的——它只是机械地让学生模仿老师的分布,并不真正理解哪些内容对应"正确答案"、哪些对应"错误答案"。即便加上了奖励相关的修正机制,也只能在轨迹层面粗略区分对错,无法做到精细的、逐字逐句的奖励感知。

这个发现指向了一个核心洞察:真正驱动模型变好的"方向性信号",根本上来自奖励优化过程中的主动探索。而现有方法无论是哪种,都把这个探索过程和模型本身紧紧捆绑在一起,导致信号既无法独立存储,也无法跨模型复用。

二、"替身演员"方案:PUST的三步走逻辑

研究团队提出的解决思路,正是本文开头那个"替身演员"比喻的具体实现。整个PUST框架分为三个依次推进的阶段,就像一套精心设计的流水线。

第一步叫"代理探索"。所谓"代理",就是那个充当替身的轻量级小模型(比如参数量只有1.7B或4B的小版本)。在这一步,不需要动用昂贵的大模型,只需要让这个小替身模型用标准的奖励优化方法(比如GRPO)在目标任务上训练,让它自己去摸索什么样的回答方式能拿到高分。训练完成后,我们得到两个状态的小模型:一个是训练前的原始版本,一个是训练后的优化版本。这两个版本之间的差异,就藏着我们真正想要的东西。

第二步叫"更新信号提取"。这一步做的事情,类似于对比一个学生"学习前后"的答题风格,提炼出"到底哪些改变让他变好了"。具体来说,对于每一个词(在AI语言模型里,文字是被切成一个个"词元"来处理的),研究团队计算了这个词在小模型优化后和优化前的概率之比的对数值。如果这个值是正的,说明奖励训练让模型更倾向于选这个词;如果是负的,说明奖励训练让模型更不愿意选这个词。这个信号捕捉的不是"这个词有多好"这种绝对判断,而是"这个词的地位因为训练而发生了怎样的相对变化"——这正是它能够跨越模型能力差异进行迁移的关键所在。

第三步叫"信号迁移"。有了这个提炼好的方向性信号,接下来就可以把它应用到真正想要提升的大模型(也就是"主模型")上了。但这里有一个微妙的问题需要处理:这个信号是从小模型身上提炼出来的,如果直接原封不动地往大模型上套,就好比把一个适合替身身材的服装硬往大明星身上穿,可能根本穿不合适。更重要的是,随着大模型不断吸收这个信号、不断调整自己,如果不加节制地一直往同一个方向推,就会推过头,反而适得其反。

为了解决这个问题,PUST引入了一个叫"锚点校准"的机制。这个机制追踪大模型当前状态和它最初始状态之间的偏移量,把这个偏移量作为一种"刹车力"加入到更新过程中。偏移已经很大了,刹车就踩得重一些;偏移还小,刹车就轻一些。这个刹车的强度由一个叫做"校准系数λ"的参数控制,λ越大,更新越保守,λ越小,更新越激进。

从数学角度来看,整个训练目标等价于让大模型的策略分布去逼近一个动态构建的目标分布——这个目标分布不是某个固定的"老师模型",而是把小模型探索到的改进方向"嫁接"到大模型自身的起点策略上构建出来的。换句话说,大模型是沿着一个"为自己量身定制"的方向在改进,而不是在机械地模仿别人。

三、实验验证:小替身真的能帮大明星变更强吗?

研究团队用阿里巴巴开源的Qwen3系列模型(1.7B、4B、8B三个规格)做了一系列详细实验,覆盖数学推理和代码生成两个领域,用来回答几个核心问题。

首先是最关键的性能验证。在数学领域,研究团队让4B和1.7B两个小模型分别在DeepMath-103K数据集上用GRPO训练500步,提炼出更新信号后,迁移到8B大模型上。评测采用了AIME 2024、AIME 2025(美国数学邀请赛题目)以及HMMT 2025(哈佛-麻省理工数学竞赛题目)等高难度数学基准,使用Mean@16指标(即让模型对每道题各自独立生成16个答案,取平均正确率)。

结果颇为惊人。基础的8B模型在这些测试上平均得分只有17.3分,而接受了4B小模型信号迁移后,得分飙升到47.5分,提升了30.2分,和直接用4B模型自己做奖励训练的效果(提升30.5分)几乎持平,甚至在某些具体测试上(比如AIME 2024,提升38.1分)还略胜一筹。即便用更小的1.7B模型来当替身,8B大模型也能获得平均19.9分的提升,成效相当可观。

在代码生成领域同样如此。用4B模型提炼出的代码相关信号迁移到8B模型后,在LiveCodeBench这个测试上,8B模型的提升幅度(+8.3分)甚至远超4B模型自身训练的提升(+1.0分),展示出一种"大模型更善于利用信号"的现象。

这些结果有力地证明了一件事:更新信号所携带的是一种可迁移的"改进方向",而不是某个模型的专属能力。较弱的小模型探索出的方向,在较强的大模型上往往能产生更显著的效果,因为大模型有更强的基础能力去执行这个方向。

四、一次探索,多次使用:信号的可复用性

PUST框架的另一个重要优势在于,更新信号一旦提炼完毕,就可以像一个独立的文件一样存储起来,反复用于不同的目标模型,而无需重新做代价高昂的探索。

研究团队专门设计实验验证了这一点。他们让4B模型做了500步GRPO训练(这是一次性的探索成本),提炼出更新信号。随后,分别把这个信号迁移到1.7B、4B、8B三个不同规模的模型上,每次迁移只需要50步训练,效率是最初探索阶段的十分之一。实验结果显示,三个目标模型都获得了一致的性能提升:1.7B模型平均提升16.7分,4B模型平均提升30.5分,8B模型平均提升30.2分。

这意味着,在未来的工程实践中,可以形成一种"探索一次、分发多次"的高效范式。一个机构只需要在某个任务上训练一次代理模型、提炼一次信号,就可以把这个信号分发给多个不同规模的下游模型使用,彻底改变了当前每个模型都要独立训练的低效局面。

还有一个更有趣的发现:更新信号甚至可以"接力传递"。研究团队测试了一条三段式的传递链:先把4B模型的信号传给1.7B,再把1.7B模型的信号传给8B。这条路径下,8B模型最终平均提升了26.6分,虽然不如直接从4B传到8B的效果(+30.1分),但依然远好于什么都不做(+0分),且说明信号在传递过程中有一定的"衰减",但不会完全失真。这种传递性为未来构建更复杂的信号流转体系提供了理论基础。

五、校准系数:这个"刹车踏板"该踩多用力?

既然校准系数λ对迁移效果至关重要,研究团队专门对它做了系统性的灵敏度分析,结果非常直观。

当把4B模型的信号迁移到8B时,λ设为0会导致完全的性能崩溃(得分归零),因为完全没有刹车的情况下,模型会无节制地沿着固定方向一直走,最终走进死胡同。λ=0.5的情况类似,虽然不是完全崩溃,但峰值出现很早随后就开始下滑,属于"冲得太猛、收不住"的典型失败。λ在0.75到1.5之间的表现普遍稳定,最优点出现在λ=1.1附近。

当换成更小的1.7B模型做信号来源时,由于代理和主模型之间的能力差距更大、信号"噪音"更多,最优的λ需要更大(约1.57),也就是需要踩更重的刹车来抵消那些不那么可靠的信号。这个规律非常有实践意义:代理与主模型的能力差距越大,校准就需要越保守。

同时研究团队也指出,目前用一个固定的λ对所有词元统一校准,其实并不精细——不同位置、不同上下文中的词元,所需要的校准强度理应不同。如何根据局部分布关系(比如两个模型在某个词上的概率重叠程度、局部熵值等)自适应地调整校准系数,是一个值得未来深入探索的方向。

六、小替身和大明星之间,到底还差多少?

研究团队还做了一个额外的对比实验,专门回答一个可能让读者好奇的问题:用小模型来探索信号,和直接让大模型自己探索,效果上到底有多大差距?

实验结果显示,直接让8B模型用GRPO训练400步,其性能提升轨迹整体略高于通过4B或1.7B代理迁移的路径,但差距并不悬殊,尤其是4B代理的结果非常接近。更有意思的是,把1.7B模型的训练步数从500步延长到800步后,迁移效果明显提升,逐渐接近4B代理的水平。这说明探索的时间更长,小模型也能挖掘出更高质量的信号。

另一个支持这一结论的证据来自"采样数量"的实验。研究团队让三个规模的模型(1.7B、4B、8B)分别在同一套题目上生成不同数量的答案(16个、23个、58个),然后观察随着样本增多,正确率的增幅(用pass@k - pass@1衡量)。结果发现,随着采样数量增加,三个模型的增幅都在稳步上升,而且差距在缩小——这意味着更多的探索本身就是在弥补模型能力的不足,小模型通过更充分的探索,完全可以逼近大模型的探索质量。

这些发现共同指向一个结论:训练数据的质量和探索策略,才是后训练性能的真正瓶颈,而不单纯是模型的规模。PUST将探索从主模型身上解耦出来,恰恰为这种"更充分、更灵活的探索"提供了可能性。

七、这套框架背后的更大图景

研究团队在文章最后提出了一个颇具启发性的概念框架,将整个PUST流程抽象为两个顺序递进的过程:信息压缩和信号应用。

在信息压缩阶段,代理模型扮演的是一个"经验提炼器"的角色——它通过在数据和任务环境中反复试错,把有价值的监督信息从原始数据中压缩提炼成一种可迁移的分布改进信号。这个信号的质量上限,取决于数据分布本身、代理模型的探索策略以及信号聚合方式。通过让多个代理模型并行探索、或者引入集成投票机制,可以进一步提升这个上限,真正实现"压缩一次,多次复用"的高效范式。

在信号应用阶段,挑战在于如何跨越代理和主模型之间的分布鸿沟。当前使用固定校准系数的方式是一个可靠的基线,但更理想的做法是根据每一个具体词元的局部分布状况(比如两个模型对某个词的概率分布重叠程度、局部熵值高低等)动态调整迁移强度,实现真正意义上的自适应校准。

从更宏观的角度看,PUST把AI后训练从一个"整体在线优化"的单体流程,改造成了一个"探索—提炼—迁移"的模块化流水线。每个环节都可以独立优化、独立存储、独立复用,这为构建更大规模、更高效的后训练生态系统打开了新的可能。

说到底,这项研究做的事情,是把一个看似简单的工程直觉——"让便宜的替身先探路"——变成了一套数学上严格、实验上有效、工程上可行的系统方法。它的核心洞察在于:让模型变好所需要的"方向性知识",其实可以独立于模型本身存在,可以被提炼、存储和传递。这一点如果能进一步发展,未来的AI训练或许真的可以像使用软件库一样,从一个"更新信号仓库"里按需取用已经验证过的改进方向,而不是每次都从零开始重新探索。

当然,目前这套框架还有明显的局限。校准系数需要人工调整、缺乏自适应能力;信号在多次转手后会有衰减;小模型探索的信号质量终究有上界。研究团队自己也坦承,更智能的自适应校准机制和更强大的代理探索策略,是这个方向最值得深挖的两个后续问题。

对于普通用户来说,这项研究的直接影响可能暂时感受不到,但它指向的未来图景是清晰的:用更低的成本、更快的速度,把AI助手打磨得更擅长某个特定任务——无论是帮你解数学题、写代码,还是其他需要专业能力的领域。如果你对其中的技术细节感兴趣,可以通过arXiv:2607.11505查阅完整论文。

Q&A

Q1:PUST框架是如何让小模型的训练经验迁移到大模型上的?

A:PUST提取的不是小模型的"最终能力",而是小模型在训练前后每个词的概率变化方向,也就是"哪些词被奖励鼓励、哪些被抑制"这一相对改进信号。这个信号经过校准系数调节后,被叠加到大模型自身的策略空间上,引导大模型沿着这个方向改进,而不是机械模仿小模型。

Q2:PUST的校准系数λ应该怎么设置,有没有通用规律?

A:目前的实验表明,λ的最优值与代理模型和主模型之间的能力差距有关。差距越大,λ应该越大(更保守)。比如用4B代理迁移到8B时最优λ约为1.08,而用1.7B代理迁移到8B时最优λ约为1.57。但目前还没有自动计算最优λ的方法,需要人工调试,这也是研究团队指出的未来改进方向。

Q3:PUST框架中代理模型训练完后,更新信号是如何存储和复用的?

A:更新信号存储在代理模型的"模型对"中,即训练前的原始代理模型和训练后的优化代理模型这两个检查点。每次迁移时,从这两个模型实时计算出逐词的对数概率差值,作为引导信号使用。同样的模型对可以反复用于不同的主模型,每次迁移只需约50步训练,成本极低。

关键词: 信号 系数 数学 大模型 ai实验室

热门推荐