什么是上下文学习(In-Context Learning)?
上下文学习(In-Context Learning,ICL)指自回归语言模型仅凭提示中给出的少量示例,通过下一词元预测完成任务,而无需更新模型参数。它把「任务说明」从训练阶段搬到了推理阶段的上下文里,因而被视为大语言模型时代的一种新范式。但一篇 ICLR 2026 论文通过大规模消融分析提出,ICL 的经验学习与泛化能力有限,更多是从提示的规律性中做推断。
上下文学习(In-Context Learning,ICL)指一类自回归语言模型在不进行额外训练、不更新任何参数的前提下,仅依靠提示(prompt)中给出的少量示例(exemplars,也称「shots」),通过下一词元预测(next-token prediction)来完成指定任务的做法。它要解决的问题是:如何让一个已经训练好的模型适配新任务,而不必为每个任务重新收集标注数据、重新微调。
按 arXiv:2301.00234 这篇综述的表述,随着大语言模型(Large Language Model,LLM)能力提升,ICL 已成为自然语言处理(Natural Language Processing,NLP)的一种新范式:模型基于被少量示例增强过的上下文直接作出预测。该综述同时给出了 ICL 的形式化定义,并梳理了它与相关研究之间的关系。
为什么重要
在 ICL 被广泛讨论之前,让模型适配一个新任务的主流路径是训练侧的改造:收集该任务的标注数据,对模型做微调(fine-tuning),或至少调整部分参数。这条路径的代价是显而易见的——每个新任务都要一份数据、一次训练、一轮部署,任务越多,维护成本越高;对于只有几十条样本的冷启动场景,微调也未必划算。
ICL 把这件事挪到了推理侧:任务信息不再写进权重,而是写进上下文。用户把几个「输入—输出」示例连同待处理的输入一起放进提示,模型据此直接给出答案。这使得同一个模型可以在不重新训练的情况下被用于多种任务,也让「用提示评估和推断模型能力」成为一种显著的研究趋势——arXiv:2301.00234 即指出,探索 ICL 以评估和推断 LLM 的能力已成为重要方向。
但正因为 ICL 表面上「看几个例子就会了」,它很容易被赋予超出实际的期待。arXiv:2509.10414 正是针对这一点展开:该论文指出,演绎(deduction)并不总是意味着学习(learning),因为 ICL 并不会显式地编码给定的观察结果,模型依靠的是自身的先验知识和(如果有的话)给出的示例。
工作机制
从流程上看,一次典型的 ICL 调用包含以下环节:
- 构造上下文。把若干示例按某种格式拼进提示,每个示例通常由任务输入与期望输出组成;随后接上真正需要模型回答的输入。示例的数量、顺序、格式与措辞,构成所谓的提示风格(prompting style)。
- 前向推理。模型对上下文做一次前向计算,以自回归方式逐词元生成输出。整个过程不涉及梯度更新,模型参数保持不变。
- 输出解析。从生成结果中取出对应任务的答案。
围绕这条主线,arXiv:2301.00234 把相关技术组织为若干类,包括训练策略、提示设计策略以及相关分析;该综述还讨论了 ICL 的多种应用场景,例如数据工程与知识更新,并列出 ICL 面临的挑战与可能的后续研究方向。
关于 ICL 究竟在做什么,arXiv:2509.10414 给出了一个更谨慎的刻画。该论文认为,从数学上看 ICL 符合学习的定义,但要完整刻画它仍需实证工作。作者为此开展了大规模分析,对记忆化(memorisation)、预训练、分布偏移(distributional shifts)以及提示风格与措辞等因素进行了消融或控制。其结论是:经验上 ICL 的学习能力及其向未见任务泛化的能力是有限的。具体而言,在示例数量趋于增多的极限下,准确率对示例分布、模型、提示风格以及输入的语言学特征都不敏感;模型实际上是从提示中的规律性里推断模式,这带来了分布敏感性,在思维链(chain-of-thought)一类提示风格中尤其明显。该论文据此认为,自回归的临时性编码(ad-hoc encoding)不是一种稳健的学习机制,其通用泛化能力有限。
需要强调的是,上述判断来自 arXiv:2509.10414 这一篇论文的分析与结论,属于该论文的主张,而非整个领域的一致定论。
典型例子
素材中出现的具体用法与系统包括:
- 少样本提示。arXiv:2509.10414 讨论的设定是:模型仅凭提示中的少量示例(few shots)去解决任务,并检验这种能力能否延伸到未见任务。
- 思维链提示。该论文在分析提示风格时特别提到思维链,指出这类风格下的分布敏感性尤为突出。
- 数据工程与知识更新。arXiv:2301.00234 将这两者列为 ICL 的应用场景。
- 能力评估。同一综述指出,用 ICL 来评估与推断 LLM 的能力已成为显著趋势。
这些例子说明 ICL 的落点并不局限于「做分类题」,还包括对模型本身能力的探测,以及围绕数据与知识的下游用途。
边界与常见误解
最常见的误解,是把 ICL 等同于「模型在上下文里学会了新任务」。arXiv:2509.10414 明确反对这种直接推论:ICL 并不显式编码给定观察,模型依赖先验知识与示例;在示例增多的极限下,准确率对示例分布、模型、提示风格和输入的语言学特征不敏感,说明它更像是从提示的规律性中做推断。该论文还观察到,在形式上相似的任务之间准确率存在差异,并由此得出自回归的临时性编码不是稳健学习机制的结论。
由此可以推出若干边界:
- 对分布敏感。由于依赖提示中的规律性,提示的分布特征会影响结果,思维链等风格下尤为明显。
- 泛化有限。该论文认为 ICL 向未见任务泛化的能力有限,不宜假定其具备通用的、一劳永逸的泛化性。
- 不是参数更新。ICL 全程不改变模型权重,因此它带来的「适配」是上下文范围内的,与微调在机制上不同。
- 结论有归属。上述关于局限性的判断出自 arXiv:2509.10414,属于该论文的实证结论;arXiv:2301.00234 则侧重综述进展、技术分类、应用场景与挑战,并呼吁进一步研究 ICL 的工作机理。
此外,ICL 的效果与提示设计强相关,而提示设计本身在 arXiv:2301.00234 中被单列为一类技术方向,这也意味着 ICL 的可用性并非与提示写法无关。