Terminal-Bench 4.0发布:任务规范升级,性能评估更趋公正
Terminal-Bench于8月29日推出4.0版本,对Agent在执行任务时的时间、CPU及内存资源进行重新校准,并优化了任务集,移除8项存在饱和响应、拒答或公开解法问题的任务,修复19个已知缺陷。所有任务的最长执行时限统一为8小时,旨在降低超时与环境波动对评分结果的干扰。
多模型激烈角逐,国产模型实现关键突破
新榜单中,Opus5+ClaudeCode以51.8%的完成率位居榜首,Fable5紧随其后达44.5%,而GLM-5.3+ClaudeCode以41.8%的成绩跻身前三,超越GPT-5.6Sol+Codex的37.3%。值得注意的是,GLM-5.3是当前前三名中唯一非Anthropic系模型,凸显其独立技术实力。
GLM-5.3性能跃升显著,实现反超
对比此前3.0版本,GLM-5.3在该榜单中从第四位(32.4%)上升至第三(41.8%),领先于GPT-5.6Sol的34.6%。此次提升幅度达7.2个百分点,标志着其在复杂任务处理与系统稳定性方面取得实质性进步。
声明:本站所有文章内容,均为采集网络资源,不代表本站观点及立场,不构成任何投资建议!如若内容侵犯了原著者的合法权益,可联系本站删除。
币安 Binance
币安交易所是全球加密货币交易所,注册奖励 500 U
