AB
AiBoss
Wiki

什么是测试时计算扩展(Test-Time Compute Scaling)?

测试时计算扩展指在模型参数固定不变的前提下,通过在推理阶段投入更多计算量来提升大语言模型输出质量的做法。它把「多花算力」从预训练阶段挪到推理阶段,让同一个模型在难题上表现更好,并引出推理算力与预训练算力如何权衡的问题。

测试时计算扩展(Test-Time Compute Scaling),又称推理时计算扩展,指在模型参数保持不变的前提下,通过在推理阶段投入更多计算量来提升大语言模型(Large Language Model,LLM)输出质量的一类方法。它要解决的问题是:当模型规模已经固定、无法继续增大时,能否靠「多想一会儿」而不是「长得更大」来把难题做对。arXiv 论文《Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters》把这一问题表述为:如果允许一个 LLM 使用一份固定但非平凡的推理时算力,它在一个有挑战性的提示上能提升多少性能。

为什么重要

在测试时计算扩展被系统研究之前,提升 LLM 能力的主流路径是扩大预训练规模:增加参数量、增加训练数据、增加训练算力。这条路径的代价集中在训练阶段,一旦模型训练完成,其能力上限就基本固定。用户拿到模型后,无论问题多难,模型都只做一次前向计算,输出长度与思考深度不随问题难度变化。

这种做法带来两个痛点。第一,算力分配是「一刀切」的:简单问题与困难问题消耗同样的推理算力,简单问题上浪费,困难问题上又不够。第二,训练算力与推理算力之间的取舍缺乏依据。论文指出,尽管测试时计算扩展很重要,但此前很少有研究尝试理解各种测试时推理方法的扩展行为,而且当时的工作对其中不少策略给出的主要是负面结果。

测试时计算扩展的意义在于把算力从训练阶段部分转移到推理阶段,并且可以按提示逐条分配。论文认为,让 LLM 通过使用更多测试时计算来改进输出,是构建能够在开放式自然语言上运行的、可自我改进的通用智能体的关键一步。它同时影响 LLM 预训练的未来走向,以及应当如何在推理时算力与预训练算力之间做权衡。

工作机制

论文分析了两种扩展测试时计算的主要机制。

其一,针对稠密的、基于过程的验证器奖励模型(process-based verifier reward model)进行搜索。 模型针对同一个提示生成多个候选解答,再由一个验证器对解答过程逐步打分,搜索过程依据这些分数挑选或组合出最终答案。这类方法把额外的算力花在「生成更多候选」与「评估候选」上。

其二,在测试时根据提示自适应地更新模型对回答的分布。 也就是让模型在推理阶段依据当前提示调整自身的输出分布,而不是固定使用训练结束时的分布。

论文的关键发现是:在这两种机制下,不同测试时计算扩展方法的有效性,都严重依赖于提示的难度。这一观察引出了「计算最优」(compute-optimal)的扩展策略——按提示自适应地分配测试时算力,把算力更多地投向真正需要它的难题。论文称,使用这种计算最优策略,相比 best-of-N 基线,可以把测试时计算扩展的效率提升 4 倍以上。此外,在 FLOPs 匹配的评估中,论文发现在较小的基础模型能够取得一定非平凡成功率的题目上,测试时计算可以让它超过一个 14 倍大的模型。

需要强调的是,上述 4 倍效率提升与 14 倍模型规模对比,都是该论文在其实验设定下报告的结果,属于该论文的主张,而非已被普遍验证的行业结论。

典型例子

论文《Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters》由 Charlie Snell、Jaehoon Lee、Kelvin Xu、Aviral Kumar 撰写,2024 年 8 月 6 日提交至 arXiv,编号 arXiv:2408.03314,主题分类为机器学习与计算语言学。该论文本身即是测试时计算扩展这一方向的代表性研究,它给出的两个具体例子是:以稠密过程奖励模型为目标的搜索,以及测试时对回答分布的自适应更新;并给出了「计算最优」分配策略与 best-of-N 基线的对比。

另一篇相关论文是 DeepSeek-AI 的《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》,2025 年 1 月 22 日提交至 arXiv,编号 arXiv:2501.12948。该论文提出,LLM 的推理能力可以通过纯强化学习(Reinforcement Learning,RL)来激励,无需人工标注的推理轨迹。论文称,所提出的 RL 框架促成了自我反思、验证与动态策略调整等高级推理模式的自发涌现,训练出的模型在数学等可验证任务上取得较好表现。这篇工作与测试时计算扩展的关联在于:模型在推理阶段表现出的更长思考、自我检查与策略切换,正是测试时计算被消耗的具体形态;而 RL 训练则决定了模型在获得额外推理算力时能把它用得多好。

边界与常见误解

第一,测试时计算扩展不是「算力越多越好」的线性关系。论文明确指出,不同扩展方法的有效性取决于提示难度,这正是需要「计算最优」分配的原因;把算力平均地撒在所有提示上,效率会明显低于按难度自适应分配。

第二,它不能无条件替代模型规模。论文的结论有明确前提:在 FLOPs 匹配的评估中,测试时计算能够超过 14 倍大的模型,是在「较小的基础模型已经能达到一定非平凡成功率」的题目上。如果基础模型在某一类问题上几乎完全失败,仅靠增加测试时计算未必能弥补。

第三,它容易被误解为单纯的「让模型输出更长」。输出更长只是表象,论文讨论的两种机制分别是针对验证器奖励模型的搜索,以及测试时对输出分布的自适应更新,二者都涉及额外的生成、评估或分布调整,而不是简单地延长文本。

第四,已知代价在于推理成本。测试时计算扩展把开销从一次性训练转移到每次请求的推理上,对高并发、低延迟的场景并不友好;同时它还需要额外的组件,例如论文中提到的稠密过程奖励模型,这类验证器本身的训练与运行也构成成本。

第五,关于 DeepSeek-R1 的部分,其自我反思、验证与动态策略调整等推理模式的涌现,以及其在数学等可验证任务上的表现,均出自该论文自身的描述,属于该研究团队的主张。

参考资料