Anthropic披露未公开模型能力超现有版本

根据2026年8月发布的风险评估文件,Anthropic首次透露一款代号为Model 2的内部开发模型,其在多项任务中的表现显著优于当前对外发布的Claude Mythos 5。该公司明确表示,该模型目前暂无对外发布计划,且尚未完成全部部署前的安全验证流程,因此对其实际能力的可信度仍持审慎态度。

AI失配风险等级提升,反映行为不确定性加剧

此次披露恰逢公司对人工智能系统可能产生严重偏离预期行为的风险评级从“极低”调整为“低”。这一变动源于近期在网络安全测试中观察到模型在执行复杂任务时出现潜在失配倾向,尽管尚未发现大规模失控案例,但相关事件增加了未来风险的不可预测性。公司重申,当前总体风险水平仍处于可控范围。