Nvidia 研究人员通过让大语言模型在预训练期间“思考”来提高大语言模型的推理能力

10.12 通过学习在不需要外部验证者的情况下对纯文本进行推理,使用RLP训练的模型在学习下游复杂的推理任务方面显示出显着改进,暗示未来人工智能将更强大适应性更强,无法完成现实世界的任务

英伟达的研究人员开发了一种新技术,可以颠覆大型语言模型 (LLM) 如何学习推理的剧本。


该方法称为强化学习预训练 (RLP),将 RL 集成到初始训练阶段,而不是将其保存到最后。

 

研究人员在他们的论文中指出,这种方法鼓励模型“在预测接下来会发生什么之前独立思考,从而在预训练的早期教授独立的思考行为”。

 

通过学习在不需要外部验证者的情况下对纯文本进行推理,使用 RLP 训练的模型在学习下游复杂的推理任务方面显示出显着改进,暗示未来人工智能将更强大、适应性更强,无法完成现实世界的任务。

 

典型的 LLM 训练周期

通常,大型语言模型首先使用“下一个标记预测”目标对大量文本进行预训练,在该目标中,它们会被赋予一串文本,并要求它们不断猜测下一个单词(或标记)将是什么。在这个阶段,他们学习语法、事实和基本联想。

 

在后期的训练后阶段,模型通常会学习复杂的推理能力,例如思维链 (CoT),其中模型逐步布局其推理。此阶段通常涉及监督微调 (SFT) 或来自人类反馈的强化学习 (RLHF),这需要专门的、精心策划的数据集。

 

该论文的作者认为,这种顺序过程与人类的理解不符,人类的理解“不是一个线性的逐个标记过程,而是输入与先验知识的并行集成”。现有的预训练方法缺乏这种机制,阻碍了模型从一开始就发展深度推理的能力。

 

强化学习预训练的工作原理

RLP 通过将 CoT 生成视为模型在预测下一个标记之前采取的作来重新构建这一过程。在每一步中,模型首先生成一个内部“思想”或推理链。然后,它使用原始上下文和新思想来预测文本中的下一个单词。

 

该模型根据其想法与未产生想法的基线相比,其想法提高了预测准确性的程度(纯粹的下一个标记预测)来获得奖励。该奖励信号是根据概率的变化自动计算的,无需外部验证者或人工标记的数据。

 

只有当生成的想法帮助模型更好地预测下一个标记时,奖励才是正的。通过根据想法的预测优势奖励想法,RLP 有效地教模型如何在用于标准预训练的相同海量非结构化数据集上进行有用的思考。


2025-10-12_142934_170

 

这种连续的反馈循环使模型能够学习何时简单的预测猜测就足够了,何时需要进行更深入的推理。正如研究人员所说,“RLP 旨在通过仅奖励那些对下一个代币预测有显着帮助的想法来塑造基本模型中的思维。

 

然而,这种基本方法并没有使后来的微调阶段过时。英伟达应用深度学习研究副总裁、该论文的合著者布莱恩·卡坦扎罗 (Bryan Catanzaro) 表示,RLP 旨在补充而不是取代这些关键步骤。“RLP 并不意味着取代后期训练后阶段,例如监督微调或从人类反馈中强化学习,”Catanzaro 告诉 VentureBeat。“这些阶段对于完善模型行为仍然至关重要......它实际上旨在通过让模型抢占先机来增强后期阶段的有效性。

 

RLP 在行动

在 Qwen3-1.7B 和 Nemotron-Nano-12B 的实验中,Nvidia 的团队在一套数学和科学推理基准测试中测试了 RLP。结果表明,用 RLP 增强的模型始终优于传统训练的模型,在推理繁重的任务中获得特别强劲的收益。

 

对于企业来说,这种改进的推理可以转化为财务分析或法律文件摘要等多步骤工作流程中更可靠的输出。

 

“RLP 鼓励模型在预训练期间在预测之前进行思考,帮助模型内化更连贯的推理风格,”Catanzaro 说。“这有助于减少细微的逻辑错误,尤其是在较长的工作流程中。”

 

Catanzaro 强调 RLP 训练的模型仍然需要通常的护栏,例如验证层、人工监督和一致性检查,但 Catanzaro 表示,“RLP 为你提供了更强大的基线。

 

重要的是,RLP 的好处在随后的微调阶段复合而不是消失(灾难性遗忘是 LLM 训练中的常见问题,后期的训练阶段会导致模型忘记其先前学到的技能和知识)。在相同的训练后方案后,RLP 训练模型的总分比基线高 7-8%。研究人员得出结论,RLP“建立了强大的推理基础,这些基础不会被下游对齐所冲走,而是与后训练复合。


2025-10-12_142947_057

 

该技术的效率是一个关键发现。在Qwen3-1.7B模型上,RLP比标准连续预训练提高了17%的性能,并且还通过前缀匹配奖励(RPT)击败了称为强化预训练的类似技术。即使基线模型使用多 35 倍的数据来匹配计算成本,这一优势仍然存在,证实了收益来自方法本身,而不仅仅是更多的处理。

 

此外,RLP 展示了令人印象深刻的可扩展性和多功能性,成功地从通用 Web 数据(而不仅仅是精选数据集)中提取推理信号。当应用于混合 Mamba-Transformer 模型 Nemotron-Nano-12B 时,RLP 比经过大量训练的基线实现了 35% 的相对改进,同时仅使用一小部分数据。

 

虽然这些结果指向了构建强大模型的更有效途径,但 Catanzaro 将创新视为学习过程本身的根本转变,而不是解决高培训成本的直接解决方案。

 

“这项研究令人兴奋,因为它改变了模型在预训练期间吸收信息的方式,从而实现了更智能的学习过程,”他解释道。“它不会取代大规模预训练,而是提供另一种构建最佳模型的创造性方法。”

 

AI 训练的新基础

最终,RLP 指向一个未来,预训练不再是下一个代币预测的单一过程。相反,下一代模型可以建立在混合目标之上,创建从第一天起就学会更稳健思考的人工智能。卡坦扎罗提供了一个强有力的类比来构建这种转变:

 

“下一个代币预测教会了一个模型世界是什么样子;像 RLP 这样的强化式目标可以教会它如何思考它所看到的东西,“他说。“这两个目标的结合可以帮助模型在训练的早期发展更深入、更有条理的思维......像 RLP 这样的工具可以建立在这个基础之上,使学习更加活跃、好奇,甚至更加高效。

 

关于预训练阶段强化学习的动态还有很多东西需要了解,但似乎很清楚的是,“在训练早期引入探索开辟了一个新的扩展轴——不仅在大小上,而且在模型学习推理的方式上,”卡坦扎罗说。