Anthropic公布研发自动化分级体系及安全监控进展

Anthropic于9月18日通过X平台发布最新透明度公告,宣布建立涵盖研发全流程的自动化评级机制。该体系以AL0至AL5为标准,评估各项研究任务中AI参与程度。数据显示,截至2026年8月,其核心模型Claude已负责公司约26%的研发工作,超过九成任务达到人机协同或更高层级,但全领域自主运行仍无实现。

实时监管覆盖超三万智能代理,决策拦截率极低

公司透露,其内部研发平台共有约3万名智能体持续参与实验,均接受在线与离线双重监控。8月份累计产生超10亿次自主决策,其中仅有0.002%被系统识别并干预,反映当前整体运行稳定性较高。

安全算力投入占比显著提升,将引入外部审计机制

在资源分配方面,约6%的总研发算力用于安全相关任务;若仅统计由AI驱动的研发环节,则该比例上升至12%。Anthropic强调此数据为保守估算,并计划未来邀请可访问内部系统的独立第三方机构开展评估,以增强治理公信力。