单语训练激发跨语言推理潜能,苹果实验揭示关键机制

苹果公司研究团队开展了一项涵盖9个模型和11种语言的强化学习实验,旨在探究单一语言训练是否足以支撑模型在多种语言任务中的表现提升。结果显示,即使未接受目标语言的直接训练,模型仍能通过底层推理结构的泛化,在其他语言测试中取得显著进步。

跨语言能力迁移效果逼近原生训练水平

以法语测试为例,使用法语数据进行训练的模型平均得分提升25.6个百分点;而完全不接触法语数据,仅通过西班牙语题目训练的模型,在法语测试中仍实现24.6个百分点的提升,差距仅1个百分点,表明模型已习得可迁移的通用解题策略。

特定语言训练可能引发性能退化风险

实验也揭示了潜在副作用:相同训练流程下,更换训练语言可能导致部分模型在其他任务上出现明显下降。例如,Qwen3-4B模型采用斯瓦希里语训练后,面对英语测试时成绩较基准模型下降19.2个百分点;而在多语言联合训练条件下,同一测试反而提升4.5个百分点,凸显语言选择对模型能力分布的影响。

通用推理机制适用于可自动化评估的任务

本研究聚焦于数学、逻辑、图形与几何等答案可自动判别对错的推理类型,这类任务的底层解题逻辑在不同语言间具有高度一致性。然而,对于依赖语义理解、文化背景或隐喻识别的阅读理解类任务,当前实验尚未覆盖,其跨语言迁移能力仍有待进一步验证。