Anthropic 工程师解释:模型更聪明了,Claude 的写作为何反而变差
Anthropic 一名从事 Claude 微调的工程师据报解释了为何模型在数学、代码与推理上进步的同时,写作质量却停滞甚至下滑:部分原因在于训练目标偏向数学与代码,以及模型被「适配」为面向其他 AI 模型写作。
核心事实
据 the-decoder.com 报道,Anthropic 从事 Claude 微调工作的工程师 Jackson Kernion 近日解释了为何 Claude 在数学、代码和推理能力快速提升的同时,写作质量却停滞甚至变差。据报他的说法是:新模型被优化用于数学与代码,同时被训练成面向其他 AI 模型输出技术性解释,这被认为是 Claude 措辞显得怪异(即所谓「Claudeish」)的主要原因。Kernion 称模型已被「适配到 LLM 心理学」,学会为 AI 模型而非人类写作。
背景与影响
Kernion 把这一现象类比为只与同类交流的人所形成的表达风格:在群体内部有效,外部读者却难以跟上。他表示,LLM 的工作记忆远大于人类,能捕捉更细粒度的细节,因此在训练中逐渐形成一种对 AI 模型友好、但被人类读者视为「信息过度密集堆砌」的写作风格。按他的说法,问题根源在于强化学习的奖励结构:一部分奖励针对 AI 模型的理解,另一部分针对人类的理解;数学与代码训练越多,就越需要主动通过奖励「人类能跟上的简单解释」来抵消这种偏移。他还提到,Anthropic 在 Opus 5.5 上找到了更好的平衡,并称自 Opus 4.6 以来他未曾对某个模型的写作如此满意;但他同时表示,这并不意味着 Opus 5.5 超越了更早的模型,并称这是一个难题,团队会继续改进。
限制与来源
上述内容来自 the-decoder.com 对 Kernion 在 X 上发言的转述,属于个人观点与经验性描述,尚未获 Anthropic 官方确认,也不代表官方产品说明。素材中未提供任何实测数据、性能指标、定价、地区可用性或发布时间信息,本文亦不作此类推断。模型的具体功能、可用范围与支持语言请以 Anthropic 官网当前信息为准。