可验证奖励强化学习

科技人工智能

大语言模型不应被简单理解为"下一个Token预测器"

大语言模型的真实能力超越了单纯的序列预测。虽然在预训练阶段,大语言模型通过学习训练数据中的实际Token序列来运作,但在后训练阶段,引入强化学习与可验证奖励(RLVR)使模型的功能发生了根本性变化。此时模型不再仅预测训练数据中已有的序列,而是开始探索生成新序列并从奖励信号中学习。