Anthropic推动安全评估机制革新:引入全权嵌入式评审

9月12日,Anthropic首席执行官Dario Amodei在其发表的《我们必须控制前沿发展速度》一文中提出一项创新性监管构想,主张将外部独立评估人员直接纳入AI研发团队,赋予其与正式员工同等的技术访问权限及成果发布自主权。

构建持续监督体系,替代传统周期性审计

该模式的核心在于实现对模型开发全过程的动态追踪,而非依赖定期快照式的检查。评估人员将获得专属工位、门禁权限和设备支持,长期驻场于研发环境,确保能够实时监测技术演进路径。

METR被列为潜在合作机构,强化外部独立性

文章明确指出,专注于人工智能安全的非营利组织METR有望成为首批被整合进该体系的外部力量。Amodei强调,此举旨在建立一种可验证的安全承诺机制,在自我报告可信度不断下降的背景下,仅靠内部声明已难以满足公众与监管层对透明性的要求。