英伟达发布KDA²智能体:算子优化实现质的飞跃

据NVIDIA Labs博客《KDA²》披露,其自主研发的内核设计智能体(KDAgent)已成功实现对Moonshot AI中Kimi Delta Attention(KDAttn)算子的自动化深度优化。该成果在英伟达B300架构下完成验证,显著提升计算效率与结果精度。

多版本内核实测:加速比普遍超2.8倍

测试结果显示,在8,192 tokens输入长度条件下,新内核在不同实现路径中均展现出卓越性能:TIRx版本几何平均加速达2.96倍,CAKE-PTX版本为2.94倍,而CuTe-DSL版本亦达到2.85倍,全面超越官方FlashKDA基线。

精度跃迁:误差压缩至原水平的十分之一

更关键的是,新内核在高精度场景下的表现实现突破——在处理8,192 tokens的最终状态时,相对误差由FlashKDA的3.45%显著降低至CuTe版本的0.22%和TIRx版本的0.29%,降幅接近90%,达到业界领先水平。相关代码已向全球开源,推动底层算力生态协同发展。