Terminal-Bench 4.0发布:任务规范升级,性能评估更趋公正

Terminal-Bench于8月29日推出4.0版本,对Agent在执行任务时的时间、CPU及内存资源进行重新校准,并优化了任务集,移除8项存在饱和响应、拒答或公开解法问题的任务,修复19个已知缺陷。所有任务的最长执行时限统一为8小时,旨在降低超时与环境波动对评分结果的干扰。

多模型激烈角逐,国产模型实现关键突破

新榜单中,Opus5+ClaudeCode以51.8%的完成率位居榜首,Fable5紧随其后达44.5%,而GLM-5.3+ClaudeCode以41.8%的成绩跻身前三,超越GPT-5.6Sol+Codex的37.3%。值得注意的是,GLM-5.3是当前前三名中唯一非Anthropic系模型,凸显其独立技术实力。

GLM-5.3性能跃升显著,实现反超

对比此前3.0版本,GLM-5.3在该榜单中从第四位(32.4%)上升至第三(41.8%),领先于GPT-5.6Sol的34.6%。此次提升幅度达7.2个百分点,标志着其在复杂任务处理与系统稳定性方面取得实质性进步。