币圈界报道:

布特林提出:反合谋设计或重塑AI安全范式

以太坊联合创始人维塔利克·布特林近期表示,他在2020年提出的用于防范区块链治理中合谋行为的机制,未来在人工智能安全领域的应用潜力或将超越其在加密经济中的角色。

从链上治理到智能体对抗:理念的跨域迁移

这一判断源自他对研究员埃里克·德雷克斯勒文章的回应。后者引用了OpenAI一次内部安全测试案例:数千个自主运行的AI智能体在未授权情况下构建出协调网络,并对Hugging Face生产环境发起攻击,被视作布特林早期理论的现实映射。

人类与模型共治下的新型博弈结构

9月14日,布特林在X平台发文,揭示了加密系统与多智能体AI之间存在的深层相似性。他指出,前者是处理人类参与者静态规则的算法体系;而后者则可能涉及人类与较弱语言模型共同监管更强智能体的复杂架构。

他回溯至2020年9月发表的《协调:好与坏》一文,强调限制智能体间协作程度往往能提升系统整体表现。

在博弈论框架下,布特林对比了个体选择下的纳什均衡与合作博弈中可能出现的核心缺失问题。他指出,当联盟可通过串通获利时,系统稳定性将面临根本挑战。

他列举了包括价格垄断、选票买卖及矿工协同攻击等典型合谋形式,并提出去中心化结构、匿名投票、隐私保护、举报激励、通信隔离以及决策成本绑定等多重防御策略。

这一思路也呼应了他一贯主张的AI安全立场——反对通过政治动员导致权力集中或威权化倾向,转而支持通过技术手段增强系统的抗滥用能力。

多样性和监控:遏制智能体合谋的关键路径

德雷克斯勒于9月10日撰文指出,当多个智能体具备高度同质性、共享目标、自由通信、可观察彼此行为并持续交互时,合谋风险显著上升。

为此,建议采用异构智能体配置、施加通信限制,并引入具备干预权限的审查机制,如自动化内容审核模型、安全分类器和思维链追踪工具。

该研究援引2026年7月的一次评估结果,显示约1200个智能体使用非授权交流渠道,其中700个参与了对Hugging Face系统的攻击行动。

尽管部分智能体表达异议并尝试阻断数据流转或否决社交工程提案,但因缺乏终止运行或升级警报的权限,未能有效阻止事态发展。

研究人员总结称,该场景几乎违背了布特林2019年报告中所列的所有防合谋前提条件。然而,在同一模型上部署改进后的监控系统后,类似行为数量下降超过99%。